<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>OCR vs HTR on File Format Blog</title>
    <link>https://blog.fileformat.com/nl/tag/ocr-vs-htr/</link>
    <description>Recent content in OCR vs HTR on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>nl</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/nl/tag/ocr-vs-htr/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Hoe kies je het juiste bestandsformaat voor Handgeschreven Tekstherkenning (HTR)</title>
      <link>https://blog.fileformat.com/nl/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/nl/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Ontdek de beste OCR- en HTR-bestandsformaten voor historische manuscripten en handgeschreven archieven, met een vergelijking van ALTO, PAGE XML, hOCR en TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Laatst bijgewerkt</strong>: 20 aug. 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="ocr-bestandsformaten-voor-historische-en-handgeschreven-documenten">OCR-bestandsformaten voor historische en handgeschreven documenten</h2>
<p>Het behouden van cultureel erfgoed door digitalisering heeft een renaissance doorgemaakt. Terwijl vroege optische tekenherkenningssystemen (OCR) waren ontworpen om onberispelijke, machinaal afgedrukte documenten uit de twintigste eeuw te verwerken, staan moderne instellingen voor cultureel erfgoed voor een veel rommeliger, rijker uitdaging: middeleeuwse manuscripten, negentiende-eeuwse cursieve correspondentie, broze verlichte folio&rsquo;s en eeuwenoude registers.</p>
<p>Het transcriberen van historische documenten gaat niet langer alleen over het extraheren van platte ASCII-tekst. Het vereist het vastleggen van <strong>context</strong>—de fysieke geometrie van de pagina, basislijncurves, correcties voor doorschijnende inkt, marginalia, afkortingen en paleografische onzekerheid. Dit gespecialiseerde vakgebied, vaak gecategoriseerd onder Handwritten Text Recognition (HTR), is sterk afhankelijk van het bestandsformaat dat wordt gebruikt om zowel afbeeldingscoördinaten als tekstlagen op te slaan en uit te wisselen.</p>
<p>Het kiezen van het verkeerde schema kan cruciale basislijngegevens wegnemen, de uitlijning met IIIF (International Image Interoperability Framework)-manifesten breken, of langdurige digitale bewaring verhinderen. Hier is een definitieve gids voor de toonaangevende OCR- en HTR-bestandsformaten voor historische documenten, hun structurele sterktes, en hoe u de juiste keuze voor uw archiveringspipeline bepaalt.</p>
<h2 id="het-historische-dilemma-waarom-platte-tekst15-en-standaard-pdfs1-falen">Het historische dilemma: waarom <a href="https//docs.fileformat.com/word-processing/txt/">Platte tekst</a> en standaard <a href="https://docs.fileformat.com/pdf/">PDF&rsquo;s</a> falen</h2>
<p>Machine-geprinte OCR levert vaak eenvoudige <code>.txt</code> bestanden of &ldquo;sandwich&rdquo; PDF&rsquo;s met verborgen tekstlagen onder de scan. Voor historische manuscripten en cursieve handschriften falen deze uitvoer om drie fundamentele redenen:</p>
<ol>
<li><strong>Niet-lineaire tekst en complexe lay-outs:</strong> Historische schrijvers hielden zich niet aan nette rechthoekige rasters. Tekst stroomt in de marges, wikkelt zich rond verlichte initialen, weeft zich tussen ingevoegde interlineaire correcties, of loopt verticaal langs de rug.</li>
<li><strong>Gebogen en schuine basislijnen:</strong> Cursief schrijven volgt zelden een starre horizontale as. HTR-motoren zoals Transkribus, Kraken en eScriptorium vertrouwen op polyline-basislijnen in plaats van begrenzingskaders om ligatuur-rijke scripts te interpreteren.</li>
<li><strong>Paleografische complexiteit en metadata:</strong> Archiefonderzoek vereist het bijhouden van afkortingen, historische spellingvariaties, beschadigde lezingen en vertrouwensscores per regel. Standaard documentformaten laten deze granulariteit weg.</li>
</ol>
<p>Om de getrouwheid aan het oorspronkelijke artefact te behouden, vertrouwt de archiefgemeenschap op gestructureerde XML-schema&rsquo;s die zijn ontworpen om de lay-outtopologie naast de getranscribeerde tekst te behouden.</p>
<h2 id="1-page-xml-de-gouden-standaard-voor-handgeschreven-teksterkenning-htr">1. PAGE XML: de gouden standaard voor handgeschreven teksterkenning (HTR)</h2>
<p>Ontwikkeld door het PRImA (Pattern Recognition &amp; Image Analysis) Research Lab, <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) wordt algemeen beschouwd als het geavanceerde formaat voor handgeschreven tekstanalyse en geavanceerde lay-outanalyse.</p>
<h3 id="kernarchitectuur">Kernarchitectuur</h3>
<p>PAGE XML behandelt het fysieke document als een hiërarchische structuur:</p>
<ul>
<li><code>PcGts</code> (Root)
<ul>
<li><code>Page</code> (Afbeeldingsdimensies en algemene leesvolgorde)
<ul>
<li><code>TextRegion</code> (Paragrafen, koppen, marginale aantekeningen, catchwords)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Polygooncoördinaten rond de lijn)</li>
<li><code>Baseline</code> (Een reeks punten die de ware basislijn van het schrift volgen)</li>
<li><code>TextEquiv</code> (De herkende tekst, met optionele betrouwbaarheidsmetingen)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="waarom-het-uitblinkt-voor-historische-manuscripten">Waarom het uitblinkt voor historische manuscripten</h3>
<ul>
<li><strong>Polygon en Polyline Precisie:</strong> In plaats van tekens in rechthoekige begrenzingskaders te dwingen, gebruikt PAGE XML meerpuntspolygongrenzen en continue basislijnen. Dit voorkomt dat overlappende cursieve opstijgers en dalers de segmentatie verstoren.</li>
<li><strong>Granulaire Structurele Types:</strong> Regio&rsquo;s kunnen nauwkeurig worden geclassificeerd (bijv., <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Breed software-ecosysteem:</strong> Het dient als het primaire interne en exportschema voor vlaggenschip HTR-platformen zoals <strong>Transkribus</strong>, <strong>eScriptorium</strong>, en <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-de-bibliotheek--en-archiefkrachtpatser">2. ALTO XML: de bibliotheek- en archiefkrachtpatser</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> is een open XML-standaard onderhouden door de Library of Congress en breed geadopteerd door nationale bibliotheken, waaronder de Bibliothèque nationale de France (BnF) en de British Library.</p>
<h3 id="kernarchitectuur-1">Kernarchitectuur</h3>
<p>ALTO structureert de lay-out hiërarchisch van <code>Page</code> tot <code>PrintSpace</code>, vervolgens <code>TextBlock</code>, <code>TextLine</code> en <code>String</code> (individuele woorden of tokens). Het wordt vaak verpakt binnen een <strong>METS</strong> (Metadata Encoding and Transmission Standard) wrapper om structurele metadata te koppelen aan hoge-resolutie masterafbeeldingen.</p>
<h3 id="belangrijkste-sterktes-en-toepassingsgevallen">Belangrijkste sterktes en toepassingsgevallen</h3>
<ul>
<li><strong>Massadigitaliseringsworkflows:</strong> ALTO is ontworpen met grootschalige industriële krant- en boekdigitalisering in gedachten. Het codeert duidelijk lettertype‑eigenschappen, woord‑niveau coördinaten, teken‑betrouwbaarheid en witruimtes.</li>
<li><strong>Modern HTR-ondersteuning (ALTO 4):</strong> Vroegere versies van ALTO leunden sterk op rechthoekige coördinaten (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Echter, vanaf <strong>ALTO versie 4</strong> introduceerde het schema <code>&lt;Shape&gt;</code>-polygonen en polyline-baselines, waardoor de functionele kloof met PAGE XML voor handgeschreven materialen werd gedicht.</li>
<li><strong>Langdurige bewaring:</strong> Omdat het een officiële standaard is die wordt ondersteund door internationale bibliotheekconsortia, garandeert ALTO langdurige stabiliteit en archiefwaardige achterwaartse compatibiliteit.</li>
</ul>
<h2 id="3-hocr-de-web-first-lichtgewicht-standaard">3. hOCR: De Web-First, Lichtgewicht Standaard</h2>
<p>Aangemaakt door Thomas Breuel, <strong>hOCR</strong> hanteert een pragmatische benadering: in plaats van een geheel nieuw XML-schema te creëren, embedt het lay-out- en transcriptiemetadata direct in semantische HTML/XHTML met behulp van microformats en klasse‑attributen.</p>
<h3 id="typisch-syntaxisvoorbeeld">Typisch syntaxisvoorbeeld</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="voor--en-nadelen-voor-historische-materialen">Voor- en nadelen voor historische materialen</h3>
<ul>
<li><strong>Voordelen:</strong> Browsers kunnen het native weergeven. Het kan eenvoudig worden getransformeerd met vanilla CSS en JavaScript, en het is het standaard gestructureerde exportformaat voor engines zoals <strong>Tesseract</strong>.</li>
<li><strong>Nadelen:</strong> Native ondersteuning voor complexe, vrije meerpunt-baselinecurven is beperkt. Hoewel praktisch voor vroege gedrukte werken (incunabelen of schone brede bladen), heeft hOCR moeite met onregelmatige manuscriptlay-outs en meerlagige marginalia.</li>
</ul>
<h2 id="4-tei-xml-de-academische-en-digitale-humaniora-benchmark">4. TEI-XML: De academische en digitale humaniora benchmark</h2>
<p>Het <strong>Text Encoding Initiative (TEI)</strong>-formaat is niet strikt een uitvoerformaat van een OCR-engine; het is eerder de toonaangevende standaard voor kritische digitale edities en wetenschappelijke weergave van literaire en historische teksten.</p>
<h3 id="ocrhtr-koppelen-aan-tei">OCR/HTR koppelen aan TEI</h3>
<p>Moderne pipelines stoppen zelden bij ruwe tekenherkenning. Wetenschappers gebruiken tools zoals de <strong>Transkribus TEI Exporter</strong> of geautomatiseerde XSLT-pipelines om PAGE XML of ALTO-bestanden te vertalen naar TEI-conforme XML:</p>
<ul>
<li>Afkortingen worden uitgebreid (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Verwijderingen, toevoegingen en schrijvershanden worden formeel geclassificeerd (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Lay-outgegevens worden behouden naast literaire analyse via de <code>&lt;facsimile&gt;</code>- en <code>&lt;surface&gt;</code>-elementen.</li>
</ul>
<p>Als uw historische project tot doel heeft een interactieve kritische editie of semantisch doorzoekbaar wetenschappelijk archief te creëren, is het omzetten van uw OCR/HTR-gegevens naar TEI-XML vaak de vereiste eindstap.</p>
<h2 id="vergelijkende-matrix-ocrhtr-formaten-in-één-oogopslag">Vergelijkende matrix: OCR/HTR-formaten in één oogopslag</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Kenmerk / Criterium</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Primaire Domein</strong></td>
<td style="text-align:left">Cursieve HTR &amp; manuscripten</td>
<td style="text-align:left">Massale bibliotheekdigitalisering</td>
<td style="text-align:left">Web-OCR &amp; lichte zoekopdrachten</td>
<td style="text-align:left">Wetenschappelijke kritische edities</td>
</tr>
<tr>
<td style="text-align:left"><strong>Basisondersteuning</strong></td>
<td style="text-align:left">Native, meerpuntspolylijnen</td>
<td style="text-align:left">Ondersteund (sinds v4.0)</td>
<td style="text-align:left">Basis (helling/offset)</td>
<td style="text-align:left">Via facsimile mapping</td>
</tr>
<tr>
<td style="text-align:left"><strong>Onregelmatige polygonen</strong></td>
<td style="text-align:left">Volledig</td>
<td style="text-align:left">Volledig</td>
<td style="text-align:left">Beperkt</td>
<td style="text-align:left">Via coördinaatelementen</td>
</tr>
<tr>
<td style="text-align:left"><strong>Tooling Ecosysteem</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, Webviewers</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Standaardiseringsorgaan</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Library of Congress</td>
<td style="text-align:left">Community Specificatie</td>
<td style="text-align:left">TEI Consortium</td>
</tr>
</tbody>
</table>
<h2 id="praktische-aanbevelingen-het-kiezen-van-uw-archief-pipeline">Praktische aanbevelingen: Het kiezen van uw archief-pipeline</h2>
<p>Om een efficiënte, toekomstbestendige digitaliseringspipeline op te zetten:</p>
<ol>
<li><strong>Voor pure handgeschreven manuscripten &amp; archieven:</strong>
Standaardiseer uw transcriptie en layoutextractie op <strong>PAGE XML</strong>. De baseline-berekening en polygoncontouren verwerken niet-standaard handschriften met minimaal gegevensverlies.</li>
<li><strong>Voor grootschalige bibliotheken &amp; gemengde collecties:</strong>
Kies <strong>ALTO XML (v4.2 of hoger)</strong> in combinatie met <strong>METS</strong>. Dit garandeert naadloze integratie in standaard digitale repository-architecturen en digitale asset management-systemen (DAMS).</li>
<li><strong>Voor webpresentatie &amp; volledige-tekst zoekindexen:</strong>
Gebruik <strong>hOCR</strong> of haal lichte GeoJSON/Web Annotation-structuren uit PAGE XML om interactieve IIIF-viewers (zoals Mirador of Universal Viewer) aan te sturen met live tekstoverlays in de browser.</li>
<li><strong>Voor wetenschappelijke edities &amp; paleografisch onderzoek:</strong>
Genereer uw ground truth in PAGE XML, voer herkenning uit en leid de output via een geautomatiseerde converter om <strong>TEI-XML</strong> voor redactionele opmaak te genereren.</li>
</ol>
<p>Door de structurele mogelijkheden van deze formaten af te stemmen op de paleografische eisen van uw bronmateriaal, zorgt u ervoor dat elke streep, afkorting en historische nuance eeuwenlang ontcijferbaar blijft.</p>
<h2 id="veelgestelde-vragen-faq">Veelgestelde vragen (FAQ)</h2>
<p><strong>Q1. Wat is het fundamentele verschil tussen standaard OCR en HTR?</strong> OCR herkent consistente machinaal gedrukte typografie, terwijl HTR (Handwritten Text Recognition) diepe neurale netwerken gebruikt om continue, variabele handgeschreven tekst en gebogen basislijnen te decoderen.</p>
<p><strong>Q2. Kan Tesseract OCR PAGE XML of ALTO-output produceren voor historische documenten?</strong> Ja, Tesseract kan native ALTO XML en hOCR-output genereren, en derde‑partij wrappers kunnen deze resultaten omzetten naar PAGE XML.</p>
<p><strong>Q3. Waarom zijn basislijnen belangrijker dan begrenzingskaders bij handgeschreven transcriptie?</strong> Basislijnen volgen de natuurlijke, golvende lijn van menselijk handschrift, waardoor software overlappende stijgende en dalende delen kan scheiden die binnen starre begrenzingskaders botsen.</p>
<p><strong>Q4. Hoe werkt de IIIF-standaard samen met deze OCR-bestandsformaten?</strong> IIIF levert hoge-resolutie afbeeldingen via open web‑API&rsquo;s, terwijl formaten zoals ALTO of PAGE XML coördinaten leveren die kunnen worden omgezet in IIIF Content Search‑annotaties.</p>
<p><strong>Q5. Welk bestandsformaat is het gemakkelijkst direct om te zetten naar een doorzoekbare PDF?</strong> Zowel hOCR als ALTO XML kunnen worden gekoppeld aan originele paginabeelden om doorzoekbare PDF‑bestanden met twee lagen te maken met behulp van tools zoals OCRmyPDF.</p>
<h2 id="zie-ook">Zie ook</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Het Hybride Monster? Originele Gegevens Inbedden In Je OCR</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Begrijpen van OCR-bestandsformaten - HOCR vs ALTO vs PDF/A uitgelegd</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Wat is het verschil tussen PDF en FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Waar wordt FDF voor gebruikt? Het doel van het Forms Data Format begrijpen</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: welke moet je gebruiken en wanneer?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
