Poslední aktualizace: 20 Aug, 2026

Formáty souborů OCR pro historické a ručně psané dokumenty
Zachování kulturního dědictví prostřednictvím digitalizace vstoupilo do renesance. Zatímco první systémy optického rozpoznávání znaků (OCR) byly navrženy pro zpracování čistých, strojově tištěných dokumentů ze dvacátého století, moderní instituce kulturního dědictví čelí mnohem chaotičtějšímu a bohatšímu výzvě: středověkým rukopisům, devatenáctému století psané kurzívní korespondenci, křehkým iluminovaným listům a stoletým rejstříkům.
Přepisování historických dokumentů již není jen o získávání prostého ASCII textu. Vyžaduje zachycení kontextu — fyzické geometrie stránky, křivek základní čáry, korekcí proprosvítání, marginalií, zkratek a paleografické nejistoty. Toto specializované odvětví, často zařazované pod rozpoznávání ručně psaného textu (Handwritten Text Recognition (HTR)), silně závisí na formátu souboru používaném k ukládání a výměně jak obrazových souřadnic, tak textových vrstev.
Výběr nesprávného schématu může odebrat důležitá data základní čáry, narušit sladění s manifesty IIIF (International Image Interoperability Framework) nebo zabránit dlouhodobé digitální archivaci. Zde je definitivní průvodce předními formáty souborů OCR a HTR pro historické dokumenty, jejich strukturálními přednostmi a tím, jak určit správnou volbu pro váš archivní pipeline.
Historické dilema: Proč prostý text a standardní PDF soubory selhávají
Strojově tištěný OCR často vytváří jednoduché soubory .txt nebo “sandwich” PDF s skrytými textovými vrstvami pod skenem. Pro historické rukopisy a kurzívní ruční písmo tyto výstupy selhávají ze tří hlavních důvodů:
- Nelineární text a složité rozvržení: Historické písaře se nedrželi úhledných pravoúhlých mřížek. Text se rozlévá do okrajů, obtéká iluminované iniciály, proplétá se mezi vloženými interlineárními opravami nebo běží vertikálně podél hřbetu.
- Zakřivené a šikmé základní linie: Kurzívní psaní zřídka následuje pevnou horizontální osu. HTR enginy jako Transkribus, Kraken a eScriptorium se spoléhají na polyline základní linie místo ohraničujících rámečků při interpretaci skriptů bohatých na ligatury.
- Paleografická složitost a metadata: Archivní výzkum vyžaduje sledování zkratek, historických pravopisných variant, poškozených čtení a skóre důvěry na úrovni řádku. Standardní formáty dokumentů tuto granularitu zahoďují.
Aby zachovala věrnost originálnímu artefaktu, archivní komunita spoléhá na strukturované XML schémata navržená k zachování topologie rozvržení spolu s přepsaným textem.
1. PAGE XML: Zlatý standard pro rozpoznávání ručně psaného textu (HTR)
Vyvinutý výzkumnou laboratoří PRImA (Pattern Recognition & Image Analysis), PAGE XML (Page Analysis and Groundtruth Elements) je široce považován za špičkový formát pro rozpoznávání ručně psaného textu a pokročilou analýzu rozvržení.
Základní architektura
PAGE XML zachází s fyzickým dokumentem jako s hierarchickou strukturou:
PcGts(Kořen)Page(Rozměry obrázku a celkový pořad čtení)TextRegion(Odstavce, nadpisy, okrajové poznámky, slova na konci řádku)TextLineCoords(Souřadnice polygonu kolem řádku)Baseline(Série bodů následujících skutečnou základní čáru písma)TextEquiv(Rozpoznaný text, s volitelnými metrikami důvěryhodnosti)
Proč vyniká u historických rukopisů
- Přesnost polygonů a polylinií: Místo nucení znaků do obdélníkových ohraničujících rámečků PAGE XML používá vícebodové polygonové hranice a kontinuální základní čáry. To zabraňuje překrývání kurzivních výčlenků a podstupů, které by rušily segmentaci.
- Detailní typy struktur: Oblasti lze přesně klasifikovat (např.
marginalia,drop-capital,signature-mark,header,editorial-note). - Široký softwarový ekosystém: Slouží jako primární interní a exportní schéma pro vlajkové platformy HTR, jako jsou Transkribus, eScriptorium a Kraken.
2. ALTO XML: Knihovní a archivní mocnost
ALTO (Analyzed Layout and Text Object) je otevřený XML standard spravovaný Kongresovou knihovnou a široce přijatý národními knihovnami, včetně Bibliothèque nationale de France (BnF) a British Library.
Základní architektura
ALTO strukturuje rozvržení hierarchicky od Page po PrintSpace, dále k TextBlock, TextLine a String (jednotlivá slova nebo tokeny). Často je zabalený do obalu METS (Metadata Encoding and Transmission Standard), aby spojil strukturální metadata s vysoce rozlišenými master obrazy.
Klíčové silné stránky a případy použití
- Pracovní postupy hromadné digitalizace: ALTO bylo navrženo s ohledem na průmyslovou digitalizaci novin a knih. Čistě kóduje atributy fontů, souřadnice na úrovni slov, důvěryhodnost znaků a mezery.
- Moderní podpora HTR (ALTO 4): Starší verze ALTO se silně spoléhaly na obdélníkové souřadnice (
HPOS,VPOS,WIDTH,HEIGHT). Nicméně od verze ALTO 4 schéma zavedlo polygonové<Shape>a polylineové základní čáry, čímž uzavřelo funkční mezeru s PAGE XML pro ručně psané materiály. - Dlouhodobá archivace: Protože se jedná o oficiální standard podporovaný mezinárodními knihovními konsorcii, ALTO zaručuje dlouhodobou stabilitu a archivní úroveň zpětné kompatibility.
3. hOCR: Web‑první, lehký standard
Vytvořeno Thomasem Breuelem, hOCR přistupuje pragmaticky: místo vytváření zcela nového XML schématu vkládá metadata rozvržení a transkripce přímo do sémantického HTML/XHTML pomocí mikroformátů a atributů třídy.
Typický příklad syntaxe
<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
<div class="ocr_carea" id="block_1_1">
<p class="ocr_par" id="par_1_1">
<span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
<span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Incipit</span>
</span>
</p>
</div>
</div>
Výhody a nevýhody historických materiálů
- Výhody: Prohlížeče jej dokážou nativně vykreslit. Lze jej snadno transformovat pomocí čistého CSS a JavaScriptu a je výchozím strukturovaným exportním formátem pro enginy jako Tesseract.
- Nevýhody: Nativní podpora pro složité, volně tvarované křivky základních čar s více body je omezená. Zatímco je praktické pro rané tištěné práce (inkunabuly nebo čisté brožury), hOCR má potíže s nepravidelným rozvržením rukopisů a vícevrstvými marginaliemi.
4. TEI-XML: Akademický a digitální humanitní referenční bod
Formát Text Encoding Initiative (TEI) není striktně výstupním formátem OCR enginu; spíše je předním standardem pro kritické digitální edice a vědeckou reprezentaci literárních a historických textů.
Propojení OCR/HTR s TEI
Moderní pipeliney se zřídka zastavují u pouhého rozpoznání znaků. Vědci používají nástroje jako Transkribus TEI Exporter nebo automatizované XSLT pipeline k převodu PAGE XML nebo ALTO souborů do TEI‑kompatibilního XML:
- Zkratky jsou rozšířeny (
<choice><abbr>...</abbr><expan>...</expan></choice>). - Smazání, doplnění a rukopisné ruce jsou formálně klasifikovány (
<add>,<del>,<handShift>). - Data o rozložení jsou zachována vedle literární analýzy pomocí elementů
<facsimile>a<surface>.
Pokud váš historický projekt cílí na vytvoření interaktivní kritické edice nebo sémanticky prohledávatelného vědeckého archivu, převod vašich OCR/HTR dat do TEI‑XML je často nezbytným konečným krokem.
Komparativní matice: Formáty OCR/HTR na první pohled
| Vlastnost / Kritérium | PAGE XML | ALTO XML (v4+) | hOCR | TEI-XML |
|---|---|---|---|---|
| Primární doména | Kurzívní HTR & rukopisy | Masová digitalizace knihoven | Web OCR & lehké vyhledávání | Vědecké kritické edice |
| Základní podpora | Nativní, vícebodové polyliny | Podporováno (od verze 4.0) | Základní (sklon/posun) | Pomocí facsimile mapování |
| Nepravidelné polygony | Plný | Plný | Omezený | Pomocí souřadnicových prvků |
| Ekosystém nástrojů | Transkribus, eScriptorium | METS, Goobi, Kitodo | Tesseract, webové prohlížeče | Oxygen, TEI Publisher |
| Standardizační orgán | PRImA Group / Open | Kongresová knihovna | Komunitní specifikace | Konsorcium TEI |
Praktická doporučení: Výběr vašeho archivního pracovního postupu
Pro vytvoření efektivního, budoucnosti odolného digitalizačního řetězce:
- Pro čisté rukopisné rukopisy a archivy: Standardizujte svůj přepis a extrakci rozvržení na PAGE XML. Jeho výpočet základní linie a polygonové obrysování zvládá neobvyklé rukopisné styly s minimální ztrátou dat.
- Pro rozsáhlé knihovny a smíšené sbírky: Zvolte ALTO XML (v4.2 nebo vyšší) v kombinaci s METS. To zaručuje bezproblémovou integraci do standardních architektur digitálních repozitářů a systémů pro správu digitálních aktiv (DAMS).
- Pro webovou prezentaci a indexy full-textového vyhledávání: Použijte hOCR nebo odvoďte lehké struktury GeoJSON/Web Annotation z PAGE XML k ovládání interaktivních IIIF prohlížečů (např. Mirador nebo Universal Viewer) s živými textovými překryvy v prohlížeči.
- Pro vědecké edice a paleografický výzkum: Vytvořte svůj ground truth v PAGE XML, proveďte rozpoznání a přeneste výstup přes automatizovaný konvertor k vytvoření TEI-XML pro editační značkování.
Při sladění strukturálních možností těchto formátů s paleografickými požadavky vašeho zdrojového materiálu zajistíte, že každý tah, zkratka a historický odstín zůstane čitelný po staletí.
Často kladené otázky (FAQ)
Q1. Jaký je základní rozdíl mezi standardním OCR a HTR? OCR rozpoznává konzistentní strojově tištěnou typografii, zatímco HTR (rozpoznávání ručně psaného textu) využívá hluboké neuronové sítě k dekódování kontinuálního, proměnlivého lidského rukopisu a zakřivených základních čar.
Q2. Dokáže Tesseract OCR vytvářet PAGE XML nebo ALTO výstup pro historické dokumenty? Ano, Tesseract může generovat nativní ALTO XML a hOCR výstup a třetí strany mohou tyto výsledky převést do PAGE XML.
Q3. Proč jsou základní čáry důležitější než ohraničující rámečky při transkripci ručně psaného textu? Základní čáry sledují přirozenou, vlnitou linii lidského psaní, což umožňuje softwaru oddělit překrývající se výšky a spody písmen, které se střetávají uvnitř pevných ohraničujících rámečků.
Q4. Jak standard IIIF interaguje s těmito formáty OCR souborů? IIIF poskytuje vysoce rozlišené obrázky prostřednictvím otevřených webových API, zatímco formáty jako ALTO nebo PAGE XML poskytují souřadnicová data, která lze převést na anotace IIIF Content Search.
Q5. Který formát souboru je nejjednodušší přímo převést na prohledávatelný PDF? Jak hOCR, tak ALTO XML lze spojit s originálními obrázky stránek a vytvořit prohledávatelné PDF soubory s dvojitou vrstvou pomocí nástrojů jako OCRmyPDF.