<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>OCR-Formate on File Format Blog</title>
    <link>https://blog.fileformat.com/de/tag/ocr-formate/</link>
    <description>Recent content in OCR-Formate on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>de</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/de/tag/ocr-formate/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Wie man das richtige Dateiformat für die Handschriftenerkennung (HTR) auswählt</title>
      <link>https://blog.fileformat.com/de/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/de/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Entdecken Sie die besten OCR- und HTR-Dateiformate für historische Manuskripte und handschriftliche Archive, im Vergleich von ALTO, PAGE XML, hOCR und TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Zuletzt aktualisiert</strong>: 20 Aug, 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="ocr-dateiformate-für-historische-und-handschriftliche-dokumente">OCR-Dateiformate für historische und handschriftliche Dokumente</h2>
<p>Die Bewahrung des Kulturerbes durch Digitalisierung erlebt eine Renaissance. Während frühe Systeme zur optischen Zeichenerkennung (OCR) dafür konzipiert waren, makellose, maschinell gedruckte Dokumente des zwanzigsten Jahrhunderts zu verarbeiten, stehen moderne Kulturinstitutionen vor einer deutlich unordentlicheren, komplexeren Herausforderung: mittelalterliche Manuskripte, handschriftliche Korrespondenz aus dem neunzehnten Jahrhundert, zerbrechliche illuminierte Folianten und jahrhundertealte Register.</p>
<p>Das Transkribieren historischer Dokumente geht nicht mehr nur darum, reinen ASCII-Text zu extrahieren. Es erfordert das Erfassen von <strong>Kontext</strong>—der physischen Geometrie der Seite, Grundlinienkurven, Durchscheinen-Korrekturen, Randnotizen, Abkürzungen und paleografischer Unsicherheit. Dieses spezialisierte Feld, häufig unter Handschriftenerkennung (HTR) kategorisiert, hängt stark vom Dateiformat ab, das zum Speichern und Austauschen sowohl von Bildkoordinaten als auch von Textebenen verwendet wird.</p>
<p>Die Auswahl des falschen Schemas kann wichtige Grundliniendaten entfernen, die Ausrichtung mit IIIF (International Image Interoperability Framework)-Manifests brechen oder die langfristige digitale Erhaltung verhindern. Hier ist ein umfassender Leitfaden zu den führenden OCR- und HTR-Dateiformaten für historische Dokumente, ihren strukturellen Stärken und wie Sie die richtige Wahl für Ihre Archivierungspipeline bestimmen.</p>
<h2 id="das-historische-dilemma-warum-klartext15-und-standard-pdfs1-scheitern">Das historische Dilemma: Warum <a href="https//docs.fileformat.com/word-processing/txt/">Klartext</a> und Standard-<a href="https://docs.fileformat.com/pdf/">PDFs</a> scheitern</h2>
<p>Maschinell gedrucktes OCR erzeugt häufig einfache <code>.txt</code>-Dateien oder „Sandwich“-PDFs mit versteckten Textebenen unter dem Scan. Für historische Manuskripte und kursive Handschrift versagen diese Ausgaben aus drei Hauptgründen:</p>
<ol>
<li><strong>Nicht-lineare Texte und komplexe Layouts:</strong> Historische Schreiber hielten sich nicht an saubere rechteckige Raster. Der Text fließt in die Ränder, umschließt beleuchtete Initialen, verwebt sich zwischen eingefügten interlinearen Korrekturen oder verläuft vertikal entlang des Buchrückens.</li>
<li><strong>Gebogene und schräg verlaufende Grundlinien:</strong> Kursive Schrift folgt selten einer starren horizontalen Achse. HTR‑Engines wie Transkribus, Kraken und eScriptorium nutzen Polylinien‑Grundlinien statt Begrenzungsrahmen, um ligaturreiche Schriften zu interpretieren.</li>
<li><strong>Paläografische Komplexität und Metadaten:</strong> Archivforschung erfordert das Verfolgen von Abkürzungen, historischen Rechtschreibvarianten, beschädigten Lesungen und Zeilen‑Confidence‑Scores. Standard‑Dokumentenformate verwerfen diese Granularität.</li>
</ol>
<p>Um die Treue zum Originalartefakt zu bewahren, verlässt sich die Archivgemeinschaft auf strukturierte XML‑Schemata, die die Layout‑Topologie neben dem transkribierten Text erhalten.</p>
<h2 id="1-page-xml-der-goldstandard-für-die-handschriftenerkennung-htr">1. PAGE XML: Der Goldstandard für die Handschriftenerkennung (HTR)</h2>
<p>Entwickelt vom PRImA (Pattern Recognition &amp; Image Analysis) Research Lab, ist <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) allgemein als das modernste Format für Handschriftenerkennung und fortgeschrittene Layout‑Analyse anerkannt.</p>
<h3 id="kernarchitektur">Kernarchitektur</h3>
<p>PAGE XML behandelt das physische Dokument als hierarchische Struktur:</p>
<ul>
<li><code>PcGts</code> (Wurzel)
<ul>
<li><code>Page</code> (Bildabmessungen und Gesamtleseordnung)
<ul>
<li><code>TextRegion</code> (Absätze, Überschriften, Randnotizen, Stichwörter)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Polygonkoordinaten um die Zeile)</li>
<li><code>Baseline</code> (Eine Reihe von Punkten, die der wahren Grundlinie des Schrifts folgen)</li>
<li><code>TextEquiv</code> (Der erkannte Text, mit optionalen Vertrauensmetriken)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="warum-es-für-historische-manuskripte-hervorragend-ist">Warum es für historische Manuskripte hervorragend ist</h3>
<ul>
<li><strong>Polygon- und Polylinienpräzision:</strong> Anstatt Zeichen in rechteckige Begrenzungsrahmen zu zwingen, verwendet PAGE XML mehrpunktige Polygongrenzen und kontinuierliche Grundlinien. Dies verhindert, dass überlappende kursive Ober- und Unterlängen die Segmentierung beeinträchtigen.</li>
<li><strong>Granulare Strukturelemente:</strong> Regionen können präzise klassifiziert werden (z. B. <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Umfangreiches Software-Ökosystem:</strong> Es dient als primäres internes und Export‑Schema für führende HTR‑Plattformen wie <strong>Transkribus</strong>, <strong>eScriptorium</strong> und <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-das-kraftpaket-für-bibliotheken-und-archive">2. ALTO XML: Das Kraftpaket für Bibliotheken und Archive</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> ist ein offener XML‑Standard, der von der Library of Congress gepflegt wird und von nationalen Bibliotheken weit verbreitet ist, darunter die Bibliothèque nationale de France (BnF) und die British Library.</p>
<h3 id="kernarchitektur-1">Kernarchitektur</h3>
<p>ALTO strukturiert das Layout hierarchisch von <code>Page</code> zu <code>PrintSpace</code>, weiter zu <code>TextBlock</code>, <code>TextLine</code> und <code>String</code> (einzelne Wörter oder Token). Es wird häufig in einen <strong>METS</strong> (Metadata Encoding and Transmission Standard) Wrapper verpackt, um strukturelle Metadaten mit hochauflösenden Master‑Bildern zu verknüpfen.</p>
<h3 id="wesentliche-stärken-und-anwendungsfälle">Wesentliche Stärken und Anwendungsfälle</h3>
<ul>
<li><strong>Massen-Digitalisierungs-Workflows:</strong> ALTO wurde mit Blick auf die industrielle Massen‑digitalisierung von Zeitungen und Büchern entwickelt. Es codiert Schriftattribute, Wort‑Koordinaten, Zeichen‑Vertrauenswerte und Leerzeichen sauber.</li>
<li><strong>Modern HTR Support (ALTO 4):</strong> Frühere Versionen von ALTO setzten stark auf rechteckige Koordinaten (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Ab <strong>ALTO Version 4</strong> führte das Schema jedoch <code>&lt;Shape&gt;</code>-Polygone und Polylinien‑Grundlinien ein und schloss damit die funktionale Lücke zu PAGE XML für handschriftliche Materialien.</li>
<li><strong>Langzeitarchivierung:</strong> Da es ein offizieller Standard ist, der von internationalen Bibliothekskonsortien unterstützt wird, garantiert ALTO langfristige Stabilität und archivgerechte Rückwärtskompatibilität.</li>
</ul>
<h2 id="3-hocr-der-web-first-leichtgewichtige-standard">3. hOCR: Der Web-First, leichtgewichtige Standard</h2>
<p>Erstellt von Thomas Breuel, verfolgt <strong>hOCR</strong> einen pragmatischen Ansatz: Anstatt ein völlig neues XML‑Schema zu erstellen, bettet es Layout‑ und Transkriptions‑Metadaten direkt in semantisches HTML/XHTML ein, wobei Microformate und Klassenattribute verwendet werden.</p>
<h3 id="typisches-syntaxbeispiel">Typisches Syntaxbeispiel</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="vor--und-nachteile-für-historische-materialien">Vor- und Nachteile für historische Materialien</h3>
<ul>
<li><strong>Vorteile:</strong> Browser können es nativ rendern. Es lässt sich leicht mit einfachem CSS und JavaScript transformieren und ist das standardmäßige strukturierte Exportformat für Engines wie <strong>Tesseract</strong>.</li>
<li><strong>Nachteile:</strong> Die native Unterstützung für komplexe, freiformige mehrpunktige Grundlinienkurven ist begrenzt. Während es für frühe Druckwerke (Incunabula oder saubere Flugblätter) praktisch ist, hat hOCR Schwierigkeiten mit unregelmäßigen Manuskript‑Layouts und mehrschichtigen Marginalien.</li>
</ul>
<h2 id="4-tei-xml-der-akademische-und-digitale-geisteswissenschaftenbenchmark">4. TEI-XML: Der akademische und digitale Geisteswissenschaften‑Benchmark</h2>
<p>Das <strong>Text Encoding Initiative (TEI)</strong>-Format ist nicht strikt ein Ausgabeformat einer OCR-Engine; vielmehr ist es der führende Standard für kritische digitale Editionen und wissenschaftliche Darstellung literarischer und historischer Texte.</p>
<h3 id="verknüpfung-von-ocrhtr-mit-tei">Verknüpfung von OCR/HTR mit TEI</h3>
<p>Moderne Pipelines enden selten bei der reinen Zeichenerkennung. Wissenschaftler*innen nutzen Werkzeuge wie den <strong>Transkribus TEI Exporter</strong> oder automatisierte XSLT-Pipelines, um PAGE XML- oder ALTO-Dateien in TEI-konformes XML zu übersetzen:</p>
<ul>
<li>Abkürzungen werden erweitert (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Löschungen, Hinzufügungen und Schreibhanden werden formal klassifiziert (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Layout-Daten werden neben der literarischen Analyse über die Elemente <code>&lt;facsimile&gt;</code> und <code>&lt;surface&gt;</code> erhalten.</li>
</ul>
<p>Wenn Ihr historisches Projekt darauf abzielt, eine interaktive kritische Edition oder ein semantisch durchsuchbares wissenschaftliches Archiv zu erstellen, ist die Umwandlung Ihrer OCR/HTR-Daten in TEI-XML häufig der erforderliche abschließende Schritt.</p>
<h2 id="vergleichsmatrix-ocrhtr-formate-auf-einen-blick">Vergleichsmatrix: OCR/HTR-Formate auf einen Blick</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Merkmal / Kriterium</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Primäre Domäne</strong></td>
<td style="text-align:left">Kursive HTR &amp; Manuskripte</td>
<td style="text-align:left">Massenbibliotheksdigitalisierung</td>
<td style="text-align:left">Web-OCR &amp; leichte Suche</td>
<td style="text-align:left">Wissenschaftliche kritische Ausgaben</td>
</tr>
<tr>
<td style="text-align:left"><strong>Grundlegende Unterstützung</strong></td>
<td style="text-align:left">Native, Mehrpunkt-Polylinien</td>
<td style="text-align:left">Unterstützt (seit v4.0)</td>
<td style="text-align:left">Einfach (Steigung/Verschiebung)</td>
<td style="text-align:left">Durch faksimile Zuordnung</td>
</tr>
<tr>
<td style="text-align:left"><strong>Unregelmäßige Polygone</strong></td>
<td style="text-align:left">Voll</td>
<td style="text-align:left">Voll</td>
<td style="text-align:left">Begrenzt</td>
<td style="text-align:left">Über Koordinatenelemente</td>
</tr>
<tr>
<td style="text-align:left"><strong>Werkzeug-Ökosystem</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, Web-Viewer</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Standardisierungsorganisation</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Library of Congress</td>
<td style="text-align:left">Community-Spezifikation</td>
<td style="text-align:left">TEI-Konsortium</td>
</tr>
</tbody>
</table>
<h2 id="praktische-empfehlungen-auswahl-ihrer-archivierungspipeline">Praktische Empfehlungen: Auswahl Ihrer Archivierungspipeline</h2>
<p>Um eine effiziente, zukunftssichere Digitalisierungspipeline zu etablieren:</p>
<ol>
<li><strong>Für reine handschriftliche Manuskripte &amp; Archive:</strong>
Standardisieren Sie Ihre Transkription und Layout-Extraktion auf <strong>PAGE XML</strong>. Seine Basiskalkulation und Polygonkonturierung bewältigen nicht standardisierte Schreibweisen mit minimalem Datenverlust.</li>
<li><strong>Für groß angelegte Bibliotheken &amp; gemischte Sammlungen:</strong>
Wählen Sie <strong>ALTO XML (v4.2 oder höher)</strong> in Kombination mit <strong>METS</strong>. Dies garantiert eine nahtlose Integration in standardisierte digitale Repository-Architekturen und Systeme für das digitale Asset-Management (DAMS).</li>
<li><strong>Für Webpräsentation &amp; Volltextsuchindizes:</strong>
Verwenden Sie <strong>hOCR</strong> oder leiten Sie leichte GeoJSON/Web-Annotation-Strukturen aus PAGE XML ab, um interaktive IIIF-Viewer (wie Mirador oder Universal Viewer) mit Live-Textüberlagerungen im Browser zu betreiben.</li>
<li><strong>Für wissenschaftliche Editionen &amp; paläografische Forschung:</strong>
Erzeugen Sie Ihr Ground Truth in PAGE XML, führen Sie die Erkennung durch und leiten Sie die Ausgabe durch einen automatisierten Konverter, um <strong>TEI-XML</strong> für redaktionelle Auszeichnung zu erzeugen.</li>
</ol>
<p>Indem Sie die strukturellen Möglichkeiten dieser Formate an die paläografischen Anforderungen Ihres Ausgangsmaterials anpassen, stellen Sie sicher, dass jeder Strich, jede Abkürzung und jede historische Nuance für kommende Jahrhunderte lesbar bleibt.</p>
<h2 id="häufig-gestellte-fragen-faq">Häufig gestellte Fragen (FAQ)</h2>
<p><strong>Q1. Was ist der grundlegende Unterschied zwischen Standard-OCR und HTR?</strong> OCR erkennt konsistente maschinengedruckte Typografie, während HTR (Handwritten Text Recognition) tiefe neuronale Netze nutzt, um kontinuierliche, variable Handschrift und gekrümmte Grundlinien zu dekodieren.</p>
<p><strong>Q2. Kann Tesseract OCR PAGE XML oder ALTO-Ausgabe für historische Dokumente erzeugen?</strong> Ja, Tesseract kann native ALTO XML und hOCR-Ausgabe erzeugen, und Drittanbieter-Wrapper können diese Ergebnisse in PAGE XML konvertieren.</p>
<p><strong>Q3. Warum sind Grundlinien wichtiger als Begrenzungsrahmen bei der Transkription handgeschriebener Texte?</strong> Grundlinien verfolgen die natürliche, wellenförmige Linie der menschlichen Handschrift und ermöglichen es der Software, überlappende Auf- und Unterlängen zu trennen, die in starren Begrenzungsrahmen kollidieren.</p>
<p><strong>Q4. Wie interagiert der IIIF-Standard mit diesen OCR-Dateiformaten?</strong> IIIF stellt hochauflösende Bilder über offene Web-APIs bereit, während Formate wie ALTO oder PAGE XML Koordinatendaten liefern, die in IIIF Content Search-Anmerkungen umgewandelt werden können.</p>
<p><strong>Q5. Welches Dateiformat lässt sich am einfachsten direkt in ein durchsuchbares PDF konvertieren?</strong> Sowohl hOCR als auch ALTO XML können mit den Originalseitenbildern kombiniert werden, um durchsuchbare PDF-Dateien mit zwei Ebenen mithilfe von Werkzeugen wie OCRmyPDF zu erstellen.</p>
<h2 id="siehe-auch">Siehe auch</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Das Hybrid-Monster? Originaldaten in Ihr OCR einbetten</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Verstehen von OCR-Dateiformaten - HOCR vs ALTO vs PDF/A erklärt</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Was ist der Unterschied zwischen PDF und FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Wofür wird FDF verwendet? Zweck des Forms Data Format verstehen</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: Welches sollten Sie wann verwenden?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
