Zuletzt aktualisiert: 20 Aug, 2026

OCR File Formats for Historical and Handwritten Documents

OCR-Dateiformate für historische und handschriftliche Dokumente

Die Bewahrung des Kulturerbes durch Digitalisierung erlebt eine Renaissance. Während frühe Systeme zur optischen Zeichenerkennung (OCR) dafür konzipiert waren, makellose, maschinell gedruckte Dokumente des zwanzigsten Jahrhunderts zu verarbeiten, stehen moderne Kulturinstitutionen vor einer deutlich unordentlicheren, komplexeren Herausforderung: mittelalterliche Manuskripte, handschriftliche Korrespondenz aus dem neunzehnten Jahrhundert, zerbrechliche illuminierte Folianten und jahrhundertealte Register.

Das Transkribieren historischer Dokumente geht nicht mehr nur darum, reinen ASCII-Text zu extrahieren. Es erfordert das Erfassen von Kontext—der physischen Geometrie der Seite, Grundlinienkurven, Durchscheinen-Korrekturen, Randnotizen, Abkürzungen und paleografischer Unsicherheit. Dieses spezialisierte Feld, häufig unter Handschriftenerkennung (HTR) kategorisiert, hängt stark vom Dateiformat ab, das zum Speichern und Austauschen sowohl von Bildkoordinaten als auch von Textebenen verwendet wird.

Die Auswahl des falschen Schemas kann wichtige Grundliniendaten entfernen, die Ausrichtung mit IIIF (International Image Interoperability Framework)-Manifests brechen oder die langfristige digitale Erhaltung verhindern. Hier ist ein umfassender Leitfaden zu den führenden OCR- und HTR-Dateiformaten für historische Dokumente, ihren strukturellen Stärken und wie Sie die richtige Wahl für Ihre Archivierungspipeline bestimmen.

Das historische Dilemma: Warum Klartext und Standard-PDFs scheitern

Maschinell gedrucktes OCR erzeugt häufig einfache .txt-Dateien oder „Sandwich“-PDFs mit versteckten Textebenen unter dem Scan. Für historische Manuskripte und kursive Handschrift versagen diese Ausgaben aus drei Hauptgründen:

  1. Nicht-lineare Texte und komplexe Layouts: Historische Schreiber hielten sich nicht an saubere rechteckige Raster. Der Text fließt in die Ränder, umschließt beleuchtete Initialen, verwebt sich zwischen eingefügten interlinearen Korrekturen oder verläuft vertikal entlang des Buchrückens.
  2. Gebogene und schräg verlaufende Grundlinien: Kursive Schrift folgt selten einer starren horizontalen Achse. HTR‑Engines wie Transkribus, Kraken und eScriptorium nutzen Polylinien‑Grundlinien statt Begrenzungsrahmen, um ligaturreiche Schriften zu interpretieren.
  3. Paläografische Komplexität und Metadaten: Archivforschung erfordert das Verfolgen von Abkürzungen, historischen Rechtschreibvarianten, beschädigten Lesungen und Zeilen‑Confidence‑Scores. Standard‑Dokumentenformate verwerfen diese Granularität.

Um die Treue zum Originalartefakt zu bewahren, verlässt sich die Archivgemeinschaft auf strukturierte XML‑Schemata, die die Layout‑Topologie neben dem transkribierten Text erhalten.

1. PAGE XML: Der Goldstandard für die Handschriftenerkennung (HTR)

Entwickelt vom PRImA (Pattern Recognition & Image Analysis) Research Lab, ist PAGE XML (Page Analysis and Groundtruth Elements) allgemein als das modernste Format für Handschriftenerkennung und fortgeschrittene Layout‑Analyse anerkannt.

Kernarchitektur

PAGE XML behandelt das physische Dokument als hierarchische Struktur:

  • PcGts (Wurzel)
    • Page (Bildabmessungen und Gesamtleseordnung)
      • TextRegion (Absätze, Überschriften, Randnotizen, Stichwörter)
        • TextLine
          • Coords (Polygonkoordinaten um die Zeile)
          • Baseline (Eine Reihe von Punkten, die der wahren Grundlinie des Schrifts folgen)
          • TextEquiv (Der erkannte Text, mit optionalen Vertrauensmetriken)

Warum es für historische Manuskripte hervorragend ist

  • Polygon- und Polylinienpräzision: Anstatt Zeichen in rechteckige Begrenzungsrahmen zu zwingen, verwendet PAGE XML mehrpunktige Polygongrenzen und kontinuierliche Grundlinien. Dies verhindert, dass überlappende kursive Ober- und Unterlängen die Segmentierung beeinträchtigen.
  • Granulare Strukturelemente: Regionen können präzise klassifiziert werden (z. B. marginalia, drop-capital, signature-mark, header, editorial-note).
  • Umfangreiches Software-Ökosystem: Es dient als primäres internes und Export‑Schema für führende HTR‑Plattformen wie Transkribus, eScriptorium und Kraken.

2. ALTO XML: Das Kraftpaket für Bibliotheken und Archive

ALTO (Analyzed Layout and Text Object) ist ein offener XML‑Standard, der von der Library of Congress gepflegt wird und von nationalen Bibliotheken weit verbreitet ist, darunter die Bibliothèque nationale de France (BnF) und die British Library.

Kernarchitektur

ALTO strukturiert das Layout hierarchisch von Page zu PrintSpace, weiter zu TextBlock, TextLine und String (einzelne Wörter oder Token). Es wird häufig in einen METS (Metadata Encoding and Transmission Standard) Wrapper verpackt, um strukturelle Metadaten mit hochauflösenden Master‑Bildern zu verknüpfen.

Wesentliche Stärken und Anwendungsfälle

  • Massen-Digitalisierungs-Workflows: ALTO wurde mit Blick auf die industrielle Massen‑digitalisierung von Zeitungen und Büchern entwickelt. Es codiert Schriftattribute, Wort‑Koordinaten, Zeichen‑Vertrauenswerte und Leerzeichen sauber.
  • Modern HTR Support (ALTO 4): Frühere Versionen von ALTO setzten stark auf rechteckige Koordinaten (HPOS, VPOS, WIDTH, HEIGHT). Ab ALTO Version 4 führte das Schema jedoch <Shape>-Polygone und Polylinien‑Grundlinien ein und schloss damit die funktionale Lücke zu PAGE XML für handschriftliche Materialien.
  • Langzeitarchivierung: Da es ein offizieller Standard ist, der von internationalen Bibliothekskonsortien unterstützt wird, garantiert ALTO langfristige Stabilität und archivgerechte Rückwärtskompatibilität.

3. hOCR: Der Web-First, leichtgewichtige Standard

Erstellt von Thomas Breuel, verfolgt hOCR einen pragmatischen Ansatz: Anstatt ein völlig neues XML‑Schema zu erstellen, bettet es Layout‑ und Transkriptions‑Metadaten direkt in semantisches HTML/XHTML ein, wobei Microformate und Klassenattribute verwendet werden.

Typisches Syntaxbeispiel

<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
  <div class="ocr_carea" id="block_1_1">
    <p class="ocr_par" id="par_1_1">
      <span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
        <span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Incipit</span>
      </span>
    </p>
  </div>
</div>

Vor- und Nachteile für historische Materialien

  • Vorteile: Browser können es nativ rendern. Es lässt sich leicht mit einfachem CSS und JavaScript transformieren und ist das standardmäßige strukturierte Exportformat für Engines wie Tesseract.
  • Nachteile: Die native Unterstützung für komplexe, freiformige mehrpunktige Grundlinienkurven ist begrenzt. Während es für frühe Druckwerke (Incunabula oder saubere Flugblätter) praktisch ist, hat hOCR Schwierigkeiten mit unregelmäßigen Manuskript‑Layouts und mehrschichtigen Marginalien.

4. TEI-XML: Der akademische und digitale Geisteswissenschaften‑Benchmark

Das Text Encoding Initiative (TEI)-Format ist nicht strikt ein Ausgabeformat einer OCR-Engine; vielmehr ist es der führende Standard für kritische digitale Editionen und wissenschaftliche Darstellung literarischer und historischer Texte.

Verknüpfung von OCR/HTR mit TEI

Moderne Pipelines enden selten bei der reinen Zeichenerkennung. Wissenschaftler*innen nutzen Werkzeuge wie den Transkribus TEI Exporter oder automatisierte XSLT-Pipelines, um PAGE XML- oder ALTO-Dateien in TEI-konformes XML zu übersetzen:

  • Abkürzungen werden erweitert (<choice><abbr>...</abbr><expan>...</expan></choice>).
  • Löschungen, Hinzufügungen und Schreibhanden werden formal klassifiziert (<add>, <del>, <handShift>).
  • Layout-Daten werden neben der literarischen Analyse über die Elemente <facsimile> und <surface> erhalten.

Wenn Ihr historisches Projekt darauf abzielt, eine interaktive kritische Edition oder ein semantisch durchsuchbares wissenschaftliches Archiv zu erstellen, ist die Umwandlung Ihrer OCR/HTR-Daten in TEI-XML häufig der erforderliche abschließende Schritt.

Vergleichsmatrix: OCR/HTR-Formate auf einen Blick

Merkmal / KriteriumPAGE XMLALTO XML (v4+)hOCRTEI-XML
Primäre DomäneKursive HTR & ManuskripteMassenbibliotheksdigitalisierungWeb-OCR & leichte SucheWissenschaftliche kritische Ausgaben
Grundlegende UnterstützungNative, Mehrpunkt-PolylinienUnterstützt (seit v4.0)Einfach (Steigung/Verschiebung)Durch faksimile Zuordnung
Unregelmäßige PolygoneVollVollBegrenztÜber Koordinatenelemente
Werkzeug-ÖkosystemTranskribus, eScriptoriumMETS, Goobi, KitodoTesseract, Web-ViewerOxygen, TEI Publisher
StandardisierungsorganisationPRImA Group / OpenLibrary of CongressCommunity-SpezifikationTEI-Konsortium

Praktische Empfehlungen: Auswahl Ihrer Archivierungspipeline

Um eine effiziente, zukunftssichere Digitalisierungspipeline zu etablieren:

  1. Für reine handschriftliche Manuskripte & Archive: Standardisieren Sie Ihre Transkription und Layout-Extraktion auf PAGE XML. Seine Basiskalkulation und Polygonkonturierung bewältigen nicht standardisierte Schreibweisen mit minimalem Datenverlust.
  2. Für groß angelegte Bibliotheken & gemischte Sammlungen: Wählen Sie ALTO XML (v4.2 oder höher) in Kombination mit METS. Dies garantiert eine nahtlose Integration in standardisierte digitale Repository-Architekturen und Systeme für das digitale Asset-Management (DAMS).
  3. Für Webpräsentation & Volltextsuchindizes: Verwenden Sie hOCR oder leiten Sie leichte GeoJSON/Web-Annotation-Strukturen aus PAGE XML ab, um interaktive IIIF-Viewer (wie Mirador oder Universal Viewer) mit Live-Textüberlagerungen im Browser zu betreiben.
  4. Für wissenschaftliche Editionen & paläografische Forschung: Erzeugen Sie Ihr Ground Truth in PAGE XML, führen Sie die Erkennung durch und leiten Sie die Ausgabe durch einen automatisierten Konverter, um TEI-XML für redaktionelle Auszeichnung zu erzeugen.

Indem Sie die strukturellen Möglichkeiten dieser Formate an die paläografischen Anforderungen Ihres Ausgangsmaterials anpassen, stellen Sie sicher, dass jeder Strich, jede Abkürzung und jede historische Nuance für kommende Jahrhunderte lesbar bleibt.

Häufig gestellte Fragen (FAQ)

Q1. Was ist der grundlegende Unterschied zwischen Standard-OCR und HTR? OCR erkennt konsistente maschinengedruckte Typografie, während HTR (Handwritten Text Recognition) tiefe neuronale Netze nutzt, um kontinuierliche, variable Handschrift und gekrümmte Grundlinien zu dekodieren.

Q2. Kann Tesseract OCR PAGE XML oder ALTO-Ausgabe für historische Dokumente erzeugen? Ja, Tesseract kann native ALTO XML und hOCR-Ausgabe erzeugen, und Drittanbieter-Wrapper können diese Ergebnisse in PAGE XML konvertieren.

Q3. Warum sind Grundlinien wichtiger als Begrenzungsrahmen bei der Transkription handgeschriebener Texte? Grundlinien verfolgen die natürliche, wellenförmige Linie der menschlichen Handschrift und ermöglichen es der Software, überlappende Auf- und Unterlängen zu trennen, die in starren Begrenzungsrahmen kollidieren.

Q4. Wie interagiert der IIIF-Standard mit diesen OCR-Dateiformaten? IIIF stellt hochauflösende Bilder über offene Web-APIs bereit, während Formate wie ALTO oder PAGE XML Koordinatendaten liefern, die in IIIF Content Search-Anmerkungen umgewandelt werden können.

Q5. Welches Dateiformat lässt sich am einfachsten direkt in ein durchsuchbares PDF konvertieren? Sowohl hOCR als auch ALTO XML können mit den Originalseitenbildern kombiniert werden, um durchsuchbare PDF-Dateien mit zwei Ebenen mithilfe von Werkzeugen wie OCRmyPDF zu erstellen.

Siehe auch