Laatst bijgewerkt: 20 aug. 2026

OCR File Formats for Historical and Handwritten Documents

OCR-bestandsformaten voor historische en handgeschreven documenten

Het behouden van cultureel erfgoed door digitalisering heeft een renaissance doorgemaakt. Terwijl vroege optische tekenherkenningssystemen (OCR) waren ontworpen om onberispelijke, machinaal afgedrukte documenten uit de twintigste eeuw te verwerken, staan moderne instellingen voor cultureel erfgoed voor een veel rommeliger, rijker uitdaging: middeleeuwse manuscripten, negentiende-eeuwse cursieve correspondentie, broze verlichte folio’s en eeuwenoude registers.

Het transcriberen van historische documenten gaat niet langer alleen over het extraheren van platte ASCII-tekst. Het vereist het vastleggen van context—de fysieke geometrie van de pagina, basislijncurves, correcties voor doorschijnende inkt, marginalia, afkortingen en paleografische onzekerheid. Dit gespecialiseerde vakgebied, vaak gecategoriseerd onder Handwritten Text Recognition (HTR), is sterk afhankelijk van het bestandsformaat dat wordt gebruikt om zowel afbeeldingscoördinaten als tekstlagen op te slaan en uit te wisselen.

Het kiezen van het verkeerde schema kan cruciale basislijngegevens wegnemen, de uitlijning met IIIF (International Image Interoperability Framework)-manifesten breken, of langdurige digitale bewaring verhinderen. Hier is een definitieve gids voor de toonaangevende OCR- en HTR-bestandsformaten voor historische documenten, hun structurele sterktes, en hoe u de juiste keuze voor uw archiveringspipeline bepaalt.

Het historische dilemma: waarom Platte tekst en standaard PDF’s falen

Machine-geprinte OCR levert vaak eenvoudige .txt bestanden of “sandwich” PDF’s met verborgen tekstlagen onder de scan. Voor historische manuscripten en cursieve handschriften falen deze uitvoer om drie fundamentele redenen:

  1. Niet-lineaire tekst en complexe lay-outs: Historische schrijvers hielden zich niet aan nette rechthoekige rasters. Tekst stroomt in de marges, wikkelt zich rond verlichte initialen, weeft zich tussen ingevoegde interlineaire correcties, of loopt verticaal langs de rug.
  2. Gebogen en schuine basislijnen: Cursief schrijven volgt zelden een starre horizontale as. HTR-motoren zoals Transkribus, Kraken en eScriptorium vertrouwen op polyline-basislijnen in plaats van begrenzingskaders om ligatuur-rijke scripts te interpreteren.
  3. Paleografische complexiteit en metadata: Archiefonderzoek vereist het bijhouden van afkortingen, historische spellingvariaties, beschadigde lezingen en vertrouwensscores per regel. Standaard documentformaten laten deze granulariteit weg.

Om de getrouwheid aan het oorspronkelijke artefact te behouden, vertrouwt de archiefgemeenschap op gestructureerde XML-schema’s die zijn ontworpen om de lay-outtopologie naast de getranscribeerde tekst te behouden.

1. PAGE XML: de gouden standaard voor handgeschreven teksterkenning (HTR)

Ontwikkeld door het PRImA (Pattern Recognition & Image Analysis) Research Lab, PAGE XML (Page Analysis and Groundtruth Elements) wordt algemeen beschouwd als het geavanceerde formaat voor handgeschreven tekstanalyse en geavanceerde lay-outanalyse.

Kernarchitectuur

PAGE XML behandelt het fysieke document als een hiërarchische structuur:

  • PcGts (Root)
    • Page (Afbeeldingsdimensies en algemene leesvolgorde)
      • TextRegion (Paragrafen, koppen, marginale aantekeningen, catchwords)
        • TextLine
          • Coords (Polygooncoördinaten rond de lijn)
          • Baseline (Een reeks punten die de ware basislijn van het schrift volgen)
          • TextEquiv (De herkende tekst, met optionele betrouwbaarheidsmetingen)

Waarom het uitblinkt voor historische manuscripten

  • Polygon en Polyline Precisie: In plaats van tekens in rechthoekige begrenzingskaders te dwingen, gebruikt PAGE XML meerpuntspolygongrenzen en continue basislijnen. Dit voorkomt dat overlappende cursieve opstijgers en dalers de segmentatie verstoren.
  • Granulaire Structurele Types: Regio’s kunnen nauwkeurig worden geclassificeerd (bijv., marginalia, drop-capital, signature-mark, header, editorial-note).
  • Breed software-ecosysteem: Het dient als het primaire interne en exportschema voor vlaggenschip HTR-platformen zoals Transkribus, eScriptorium, en Kraken.

2. ALTO XML: de bibliotheek- en archiefkrachtpatser

ALTO (Analyzed Layout and Text Object) is een open XML-standaard onderhouden door de Library of Congress en breed geadopteerd door nationale bibliotheken, waaronder de Bibliothèque nationale de France (BnF) en de British Library.

Kernarchitectuur

ALTO structureert de lay-out hiërarchisch van Page tot PrintSpace, vervolgens TextBlock, TextLine en String (individuele woorden of tokens). Het wordt vaak verpakt binnen een METS (Metadata Encoding and Transmission Standard) wrapper om structurele metadata te koppelen aan hoge-resolutie masterafbeeldingen.

Belangrijkste sterktes en toepassingsgevallen

  • Massadigitaliseringsworkflows: ALTO is ontworpen met grootschalige industriële krant- en boekdigitalisering in gedachten. Het codeert duidelijk lettertype‑eigenschappen, woord‑niveau coördinaten, teken‑betrouwbaarheid en witruimtes.
  • Modern HTR-ondersteuning (ALTO 4): Vroegere versies van ALTO leunden sterk op rechthoekige coördinaten (HPOS, VPOS, WIDTH, HEIGHT). Echter, vanaf ALTO versie 4 introduceerde het schema <Shape>-polygonen en polyline-baselines, waardoor de functionele kloof met PAGE XML voor handgeschreven materialen werd gedicht.
  • Langdurige bewaring: Omdat het een officiële standaard is die wordt ondersteund door internationale bibliotheekconsortia, garandeert ALTO langdurige stabiliteit en archiefwaardige achterwaartse compatibiliteit.

3. hOCR: De Web-First, Lichtgewicht Standaard

Aangemaakt door Thomas Breuel, hOCR hanteert een pragmatische benadering: in plaats van een geheel nieuw XML-schema te creëren, embedt het lay-out- en transcriptiemetadata direct in semantische HTML/XHTML met behulp van microformats en klasse‑attributen.

Typisch syntaxisvoorbeeld

<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
  <div class="ocr_carea" id="block_1_1">
    <p class="ocr_par" id="par_1_1">
      <span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
        <span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Incipit</span>
      </span>
    </p>
  </div>
</div>

Voor- en nadelen voor historische materialen

  • Voordelen: Browsers kunnen het native weergeven. Het kan eenvoudig worden getransformeerd met vanilla CSS en JavaScript, en het is het standaard gestructureerde exportformaat voor engines zoals Tesseract.
  • Nadelen: Native ondersteuning voor complexe, vrije meerpunt-baselinecurven is beperkt. Hoewel praktisch voor vroege gedrukte werken (incunabelen of schone brede bladen), heeft hOCR moeite met onregelmatige manuscriptlay-outs en meerlagige marginalia.

4. TEI-XML: De academische en digitale humaniora benchmark

Het Text Encoding Initiative (TEI)-formaat is niet strikt een uitvoerformaat van een OCR-engine; het is eerder de toonaangevende standaard voor kritische digitale edities en wetenschappelijke weergave van literaire en historische teksten.

OCR/HTR koppelen aan TEI

Moderne pipelines stoppen zelden bij ruwe tekenherkenning. Wetenschappers gebruiken tools zoals de Transkribus TEI Exporter of geautomatiseerde XSLT-pipelines om PAGE XML of ALTO-bestanden te vertalen naar TEI-conforme XML:

  • Afkortingen worden uitgebreid (<choice><abbr>...</abbr><expan>...</expan></choice>).
  • Verwijderingen, toevoegingen en schrijvershanden worden formeel geclassificeerd (<add>, <del>, <handShift>).
  • Lay-outgegevens worden behouden naast literaire analyse via de <facsimile>- en <surface>-elementen.

Als uw historische project tot doel heeft een interactieve kritische editie of semantisch doorzoekbaar wetenschappelijk archief te creëren, is het omzetten van uw OCR/HTR-gegevens naar TEI-XML vaak de vereiste eindstap.

Vergelijkende matrix: OCR/HTR-formaten in één oogopslag

Kenmerk / CriteriumPAGE XMLALTO XML (v4+)hOCRTEI-XML
Primaire DomeinCursieve HTR & manuscriptenMassale bibliotheekdigitaliseringWeb-OCR & lichte zoekopdrachtenWetenschappelijke kritische edities
BasisondersteuningNative, meerpuntspolylijnenOndersteund (sinds v4.0)Basis (helling/offset)Via facsimile mapping
Onregelmatige polygonenVolledigVolledigBeperktVia coördinaatelementen
Tooling EcosysteemTranskribus, eScriptoriumMETS, Goobi, KitodoTesseract, WebviewersOxygen, TEI Publisher
StandaardiseringsorgaanPRImA Group / OpenLibrary of CongressCommunity SpecificatieTEI Consortium

Praktische aanbevelingen: Het kiezen van uw archief-pipeline

Om een efficiënte, toekomstbestendige digitaliseringspipeline op te zetten:

  1. Voor pure handgeschreven manuscripten & archieven: Standaardiseer uw transcriptie en layoutextractie op PAGE XML. De baseline-berekening en polygoncontouren verwerken niet-standaard handschriften met minimaal gegevensverlies.
  2. Voor grootschalige bibliotheken & gemengde collecties: Kies ALTO XML (v4.2 of hoger) in combinatie met METS. Dit garandeert naadloze integratie in standaard digitale repository-architecturen en digitale asset management-systemen (DAMS).
  3. Voor webpresentatie & volledige-tekst zoekindexen: Gebruik hOCR of haal lichte GeoJSON/Web Annotation-structuren uit PAGE XML om interactieve IIIF-viewers (zoals Mirador of Universal Viewer) aan te sturen met live tekstoverlays in de browser.
  4. Voor wetenschappelijke edities & paleografisch onderzoek: Genereer uw ground truth in PAGE XML, voer herkenning uit en leid de output via een geautomatiseerde converter om TEI-XML voor redactionele opmaak te genereren.

Door de structurele mogelijkheden van deze formaten af te stemmen op de paleografische eisen van uw bronmateriaal, zorgt u ervoor dat elke streep, afkorting en historische nuance eeuwenlang ontcijferbaar blijft.

Veelgestelde vragen (FAQ)

Q1. Wat is het fundamentele verschil tussen standaard OCR en HTR? OCR herkent consistente machinaal gedrukte typografie, terwijl HTR (Handwritten Text Recognition) diepe neurale netwerken gebruikt om continue, variabele handgeschreven tekst en gebogen basislijnen te decoderen.

Q2. Kan Tesseract OCR PAGE XML of ALTO-output produceren voor historische documenten? Ja, Tesseract kan native ALTO XML en hOCR-output genereren, en derde‑partij wrappers kunnen deze resultaten omzetten naar PAGE XML.

Q3. Waarom zijn basislijnen belangrijker dan begrenzingskaders bij handgeschreven transcriptie? Basislijnen volgen de natuurlijke, golvende lijn van menselijk handschrift, waardoor software overlappende stijgende en dalende delen kan scheiden die binnen starre begrenzingskaders botsen.

Q4. Hoe werkt de IIIF-standaard samen met deze OCR-bestandsformaten? IIIF levert hoge-resolutie afbeeldingen via open web‑API’s, terwijl formaten zoals ALTO of PAGE XML coördinaten leveren die kunnen worden omgezet in IIIF Content Search‑annotaties.

Q5. Welk bestandsformaat is het gemakkelijkst direct om te zetten naar een doorzoekbare PDF? Zowel hOCR als ALTO XML kunnen worden gekoppeld aan originele paginabeelden om doorzoekbare PDF‑bestanden met twee lagen te maken met behulp van tools zoals OCRmyPDF.

Zie ook