Legutóbb frissítve: 2026. aug. 20.

OCR fájlformátumok történelmi és kézírásos dokumentumokhoz
A kulturális örökség digitalizálással történő megőrzése reneszánszba lépett. Míg a korai optikai karakterfelismerő (OCR) rendszerek tiszta, géppel nyomtatott, a huszadik századi papírok feldolgozására lettek tervezve, a modern kulturális örökségi intézmények sokkal zavarosabb, gazdagabb kihívással néznek szembe: középkori kéziratok, a tizenkilencedik századi kézírásos levelezés, törékeny, illusztrált füzetek és évszázados nyilvántartások.
A történelmi dokumentumok átírása már nem csak egyszerű ASCII szöveg kinyeréséről szól. kontextus rögzítését igényli – a lap fizikai geometriáját, az alapvonal görbéit, a átszivárgások korrekcióját, a marginaliákat, a rövidítéseket és a paleográfiai bizonytalanságot. Ez a specializált terület, amelyet gyakran a kézírásfelismerés (HTR) kategóriájába sorolják, erősen függ a képadatok és a szövegrétegek tárolására és cseréjére használt fájlformátumtól.
A rossz séma kiválasztása eltávolíthatja a létfontosságú alapvonal adatokat, megszakíthatja az IIIF (International Image Interoperability Framework) manifesztumokkal való összehangolást, vagy megakadályozhatja a hosszú távú digitális megőrzést. Íme egy végleges útmutató a történelmi dokumentumok vezető OCR és HTR fájlformátumairól, azok szerkezeti erősségeiről, valamint arról, hogyan határozhatja meg a megfelelő választást az archiválási folyamatához.
A történelmi dilemma: Miért nem működnek az Egyszerű szöveg és a szabványos PDF-ek
A géppel nyomtatott OCR gyakran egyszerű .txt fájlokat vagy "szendvics" PDF-eket állít elő, amelyek a szkennelés alatt rejtett szövegrétegeket tartalmaznak. Történelmi kéziratok és folyókézírás esetén ezek a kimenetek három fő okból hibásak:
- Nemlineáris szöveg és összetett elrendezések: A történelmi írók nem tartották be a rendezett téglalap alakú rácsokat. A szöveg a margókba folyik, körbefut a díszített kezdőbetűk körül, átszövi a beillesztett interlineáris javításokat, vagy függőlegesen fut a gerinc mentén.
- Ívelt és ferde alapvonalak: A kézírás ritkán követ egy merev vízszintes tengelyt. Az olyan HTR motorok, mint a Transkribus, a Kraken és az eScriptorium, polilinés alapvonalakat használnak a kerethelyek helyett, hogy értelmezzék a ligatúrákkal teli írásokat.
- Paleográfiai komplexitás és metaadatok: Az archivális kutatás megköveteli a rövidítések, a történelmi helyesírási változatok, a sérült olvasatok és a soronkénti megbízhatósági pontszámok nyomon követését. A szabványos dokumentumformátumok elhagyják ezt a részletességet.
Az eredeti lelet hűségének megőrzése érdekében az archiválási közösség strukturált XML sémákat használ, amelyek a layout topológiát a leírt szöveggel együtt őrzik.
1. PAGE XML: Az aranyszabvány a kézírásos szövegfelismeréshez (HTR)
A PRImA (Pattern Recognition & Image Analysis) Kutató Laboratórium által fejlesztett PAGE XML (Page Analysis and Groundtruth Elements) széles körben a kézírásos szövegfelismerés és a fejlett elrendezéselemzés csúcsformátumának tekintett.
Alapvető architektúra
A PAGE XML a fizikai dokumentumot hierarchikus struktúraként kezeli:
PcGts(Gyökér)Page(Kép méretei és az általános olvasási sorrend)TextRegion(Bekezdések, címsorok, margó jegyzetek, kulcsszavak)TextLineCoords(Poligon koordináták a vonal körül)Baseline(Pontok sorozata, amely a szöveg valódi alapvonalát követi)TextEquiv(A felismert szöveg, opcionális bizonyossági mutatókkal)
Miért kiemelkedő a történelmi kéziratoknál
- Poligon és Polivonal Pontosság: A karakterek téglalap alakú keretekbe kényszerítése helyett a PAGE XML többpontos poligon határokat és folyamatos alapvonalakat használ. Ez megakadályozza, hogy a átfedő kézírási felső- és alsó szárnyak beavatkozzanak a szegmentálásba.
- Részletes Strukturális Típusok: A régiók pontosan osztályozhatók (pl.
marginalia,drop-capital,signature-mark,header,editorial-note). - Széles szoftverkörnyezet: Elsődleges belső és export séma a zászlóshajó HTR platformokhoz, mint a Transkribus, eScriptorium és a Kraken.
2. ALTO XML: A könyvtárak és archívumok erőműve
ALTO (Analyzed Layout and Text Object) egy nyílt XML szabvány, amelyet a Kongresszusi Könyvtár tart karban, és amelyet széles körben alkalmaznak a nemzeti könyvtárak, köztük a Bibliothèque nationale de France (BnF) és a British Library.
Alapvető architektúra
Az ALTO hierarchikusan strukturálja az elrendezést a Page-től a PrintSpace-ig, lejjebb a TextBlock, TextLine és String (egyes szavak vagy tokenek) elemekig. Gyakran egy METS (Metadata Encoding and Transmission Standard) burkolóba csomagolják, hogy a strukturális metaadatokat magas felbontású mesterképekkel társítsa.
Fő erősségek és felhasználási esetek
- Tömeges digitalizálási munkafolyamatok: Az ALTO-t ipari méretű újság- és könyvdigitalizálásra tervezték. Tiszta módon kódolja a betűtípus attribútumokat, a szavak szintű koordinátákat, a karakterek megbízhatóságát és a szóközöket.
- Modern HTR támogatás (ALTO 4): Az ALTO korábbi verziói erősen támaszkodtak a téglalap koordinátákra (
HPOS,VPOS,WIDTH,HEIGHT). Azonban a ALTO 4-es verzióval a séma bevezette a<Shape>sokszögeket és a vonallánc alapvonalakat, ezzel lezárva a funkcionális szakadékot a PAGE XML-lel a kézírásos anyagok esetében. - Hosszú távú megőrzés: Mivel egy nemzetközi könyvtári konzorciumok által támogatott hivatalos szabvány, az ALTO garantálja a hosszú távú stabilitást és az archív szintű visszafelé kompatibilitást.
3. hOCR: A web‑első, könnyűsúlyú szabvány
Thomas Breuel által létrehozott hOCR pragmatikus megközelítést alkalmaz: ahelyett, hogy teljesen új XML sémát hozna létre, a layout és a transzkripció metaadatait közvetlenül a szemantikus HTML/XHTML-be ágyazza be mikroformátumok és osztályattribútumok használatával.
Tipikus szintaxis példa
<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
<div class="ocr_carea" id="block_1_1">
<p class="ocr_par" id="par_1_1">
<span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
<span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Kezdet</span>
</span>
</p>
</div>
</div>
Előnyök és hátrányok a történelmi anyagok esetében
- Előnyök: A böngészők natívan megjeleníthetik. Könnyen átalakítható vanilla CSS és JavaScript segítségével, és ez az alapértelmezett strukturált exportformátum olyan motorok számára, mint a Tesseract.
- Hátrányok: A komplex, szabad formájú többpontos alapvonal görbék natív támogatása korlátozott. Bár a korai nyomtatott művek (incunabula vagy tiszta plakátok) esetén praktikus, a hOCR nehezen birkózik meg a változatos kézirati elrendezésekkel és a több rétegű marginaliákkal.
4. TEI-XML: Az akadémiai és digitális bölcsészet benchmarkja
A Text Encoding Initiative (TEI) formátum nem kifejezetten OCR motor kimeneti formátum; inkább a kritikus digitális kiadások és a irodalmi és történelmi szövegek tudományos ábrázolásának vezető szabványa.
OCR/HTR csatlakoztatása a TEI-hez
A modern feldolgozási láncok ritkán állnak meg a nyers karakterfelismerésnél. A tudósok olyan eszközöket használnak, mint a Transkribus TEI Exporter, vagy automatizált XSLT csővezetékek a PAGE XML vagy ALTO fájlok TEI-megfelelő XML-re történő átalakításához:
- A rövidítéseket kibontják (
<choice><abbr>...</abbr><expan>...</expan></choice>). - A törléseket, hozzáadásokat és a kézírási kézjeleket formálisan osztályozzák (
<add>,<del>,<handShift>). - Az elrendezési adatokat a
<facsimile>és<surface>elemek segítségével a irodalmi elemzéssel együtt őrzik meg.
Ha a történelmi projektje interaktív kritikai kiadást vagy szemantikai kereshető tudományos archívumot kíván létrehozni, az OCR/HTR adatok TEI-XML-re konvertálása gyakran a szükséges végső lépés.
Összehasonlító mátrix: OCR/HTR formátumok áttekintése
| Jellemző / Kritérium | PAGE XML | ALTO XML (v4+) | hOCR | TEI-XML |
|---|---|---|---|---|
| Elsődleges tartomány | Kézírás HTR és kéziratok | Tömeges könyvtári digitalizáció | Webes OCR és könnyű keresés | Tudományos kritikai kiadások |
| Alapvető támogatás | Natív, többpontos vonalláncok | Támogatott (v4.0 óta) | Alap (Meredekség/Eltolás) | Fakszimile leképezésen keresztül |
| Rendellenes sokszögek | Teljes | Teljes | Korlátozott | Koordinátaelemeken keresztül |
| Eszközök ökoszisztémája | Transkribus, eScriptorium | METS, Goobi, Kitodo | Tesseract, Web megjelenítők | Oxygen, TEI Publisher |
| Szabványosító testület | PRImA Group / Open | Kongresszusi Könyvtár | Közösségi specifikáció | TEI Konzorcium |
Gyakorlati ajánlások: Az archiválási folyamat kiválasztása
Egy hatékony, jövőbiztos digitalizációs folyamat kiépítéséhez:
- Tiszta kézírásos kéziratok és archívumok esetén: Standardizálja a transzkripciót és az elrendezés kinyerését a PAGE XML segítségével. Ennek alapvonal-számítása és poligon-kontúrozása a nem szabványos kézírásokat minimális adatveszteséggel kezeli.
- Nagy léptékű könyvtárak és vegyes gyűjtemények esetén: Válassza a ALTO XML (v4.2 vagy újabb)-t METS-szel párosítva. Ez garantálja a zökkenőmentes integrációt a szabványos digitális tároló architektúrákba és digitális eszközkezelő rendszerekbe (DAMS).
- Webes megjelenítés és teljes szöveges keresési indexek esetén: Használja a hOCR-t, vagy származtasson könnyű GeoJSON/Web Annotation struktúrákat a PAGE XML-ből, hogy interaktív IIIF nézőket (például Mirador vagy Universal Viewer) működtessen élő, böngészőben megjelenő szövegátfedésekkel.
- Tudományos kiadásokhoz és paleográfiai kutatáshoz: Generálja a ground truth adatot PAGE XML-ben, végezzen felismerést, és a kimenetet egy automatizált konverteren keresztül alakítsa TEI-XML-re a szerkesztői jelöléshez.
Azáltal, hogy ezeknek a formátumoknak a szerkezeti képességeit a forrásanyag paleográfiai igényeihez igazítja, biztosítja, hogy minden vonás, rövidítés és történelmi árnyalat évszázadokig értelmezhető maradjon.
Gyakran Ismételt Kérdések (GYIK)
Q1. Mi a alapvető különbség a standard OCR és a HTR között? Az OCR a konzisztens géppel nyomtatott tipográfiát ismeri fel, míg a HTR (Handwritten Text Recognition) mély neurális hálózatokat használ a folyamatos, változó kézírás és ívelt alapvonalak dekódolására.
Q2. Tud-e a Tesseract OCR PAGE XML vagy ALTO kimenetet előállítani történelmi dokumentumokhoz? Igen, a Tesseract képes natív ALTO XML és hOCR kimenetet generálni, és harmadik féltől származó csomagolók átalakíthatják ezeket az eredményeket PAGE XML-re.
Q3. Miért fontosabbak az alapvonalak, mint a körülhatároló dobozok a kézírásos szöveg átírásában? Az alapvonalak nyomon követik az emberi kézírás természetes, hullámzó vonalát, lehetővé téve a szoftver számára, hogy szétválassza a átfedő felső- és alsó karaktereket, amelyek egy szilárd körülhatároló dobozban ütköznek.
Q4. Hogyan lép kölcsönhatásba az IIIF szabvány ezekkel az OCR fájlformátumokkal? Az IIIF nagy felbontású képeket szolgáltat nyílt web API-ken keresztül, míg az ALTO vagy a PAGE XML formátumok koordináta adatokat biztosítanak, amelyeket IIIF Content Search annotációkká lehet konvertálni.
Q5. Melyik fájlformátum a legegyszerűbb közvetlenül kereshető PDF‑vé konvertálni? Mind a hOCR, mind az ALTO XML párosítható az eredeti oldalképekkel, hogy kereshető kétszintű PDF‑fájlokat hozzanak létre olyan eszközökkel, mint az OCRmyPDF.