Legutóbb frissítve: 2026. aug. 20.

OCR File Formats for Historical and Handwritten Documents

OCR fájlformátumok történelmi és kézírásos dokumentumokhoz

A kulturális örökség digitalizálással történő megőrzése reneszánszba lépett. Míg a korai optikai karakterfelismerő (OCR) rendszerek tiszta, géppel nyomtatott, a huszadik századi papírok feldolgozására lettek tervezve, a modern kulturális örökségi intézmények sokkal zavarosabb, gazdagabb kihívással néznek szembe: középkori kéziratok, a tizenkilencedik századi kézírásos levelezés, törékeny, illusztrált füzetek és évszázados nyilvántartások.

A történelmi dokumentumok átírása már nem csak egyszerű ASCII szöveg kinyeréséről szól. kontextus rögzítését igényli – a lap fizikai geometriáját, az alapvonal görbéit, a átszivárgások korrekcióját, a marginaliákat, a rövidítéseket és a paleográfiai bizonytalanságot. Ez a specializált terület, amelyet gyakran a kézírásfelismerés (HTR) kategóriájába sorolják, erősen függ a képadatok és a szövegrétegek tárolására és cseréjére használt fájlformátumtól.

A rossz séma kiválasztása eltávolíthatja a létfontosságú alapvonal adatokat, megszakíthatja az IIIF (International Image Interoperability Framework) manifesztumokkal való összehangolást, vagy megakadályozhatja a hosszú távú digitális megőrzést. Íme egy végleges útmutató a történelmi dokumentumok vezető OCR és HTR fájlformátumairól, azok szerkezeti erősségeiről, valamint arról, hogyan határozhatja meg a megfelelő választást az archiválási folyamatához.

A történelmi dilemma: Miért nem működnek az Egyszerű szöveg és a szabványos PDF-ek

A géppel nyomtatott OCR gyakran egyszerű .txt fájlokat vagy "szendvics" PDF-eket állít elő, amelyek a szkennelés alatt rejtett szövegrétegeket tartalmaznak. Történelmi kéziratok és folyókézírás esetén ezek a kimenetek három fő okból hibásak:

  1. Nemlineáris szöveg és összetett elrendezések: A történelmi írók nem tartották be a rendezett téglalap alakú rácsokat. A szöveg a margókba folyik, körbefut a díszített kezdőbetűk körül, átszövi a beillesztett interlineáris javításokat, vagy függőlegesen fut a gerinc mentén.
  2. Ívelt és ferde alapvonalak: A kézírás ritkán követ egy merev vízszintes tengelyt. Az olyan HTR motorok, mint a Transkribus, a Kraken és az eScriptorium, polilinés alapvonalakat használnak a kerethelyek helyett, hogy értelmezzék a ligatúrákkal teli írásokat.
  3. Paleográfiai komplexitás és metaadatok: Az archivális kutatás megköveteli a rövidítések, a történelmi helyesírási változatok, a sérült olvasatok és a soronkénti megbízhatósági pontszámok nyomon követését. A szabványos dokumentumformátumok elhagyják ezt a részletességet.

Az eredeti lelet hűségének megőrzése érdekében az archiválási közösség strukturált XML sémákat használ, amelyek a layout topológiát a leírt szöveggel együtt őrzik.

1. PAGE XML: Az aranyszabvány a kézírásos szövegfelismeréshez (HTR)

A PRImA (Pattern Recognition & Image Analysis) Kutató Laboratórium által fejlesztett PAGE XML (Page Analysis and Groundtruth Elements) széles körben a kézírásos szövegfelismerés és a fejlett elrendezéselemzés csúcsformátumának tekintett.

Alapvető architektúra

A PAGE XML a fizikai dokumentumot hierarchikus struktúraként kezeli:

  • PcGts (Gyökér)
    • Page (Kép méretei és az általános olvasási sorrend)
      • TextRegion (Bekezdések, címsorok, margó jegyzetek, kulcsszavak)
        • TextLine
          • Coords (Poligon koordináták a vonal körül)
          • Baseline (Pontok sorozata, amely a szöveg valódi alapvonalát követi)
          • TextEquiv (A felismert szöveg, opcionális bizonyossági mutatókkal)

Miért kiemelkedő a történelmi kéziratoknál

  • Poligon és Polivonal Pontosság: A karakterek téglalap alakú keretekbe kényszerítése helyett a PAGE XML többpontos poligon határokat és folyamatos alapvonalakat használ. Ez megakadályozza, hogy a átfedő kézírási felső- és alsó szárnyak beavatkozzanak a szegmentálásba.
  • Részletes Strukturális Típusok: A régiók pontosan osztályozhatók (pl. marginalia, drop-capital, signature-mark, header, editorial-note).
  • Széles szoftverkörnyezet: Elsődleges belső és export séma a zászlóshajó HTR platformokhoz, mint a Transkribus, eScriptorium és a Kraken.

2. ALTO XML: A könyvtárak és archívumok erőműve

ALTO (Analyzed Layout and Text Object) egy nyílt XML szabvány, amelyet a Kongresszusi Könyvtár tart karban, és amelyet széles körben alkalmaznak a nemzeti könyvtárak, köztük a Bibliothèque nationale de France (BnF) és a British Library.

Alapvető architektúra

Az ALTO hierarchikusan strukturálja az elrendezést a Page-től a PrintSpace-ig, lejjebb a TextBlock, TextLine és String (egyes szavak vagy tokenek) elemekig. Gyakran egy METS (Metadata Encoding and Transmission Standard) burkolóba csomagolják, hogy a strukturális metaadatokat magas felbontású mesterképekkel társítsa.

Fő erősségek és felhasználási esetek

  • Tömeges digitalizálási munkafolyamatok: Az ALTO-t ipari méretű újság- és könyvdigitalizálásra tervezték. Tiszta módon kódolja a betűtípus attribútumokat, a szavak szintű koordinátákat, a karakterek megbízhatóságát és a szóközöket.
  • Modern HTR támogatás (ALTO 4): Az ALTO korábbi verziói erősen támaszkodtak a téglalap koordinátákra (HPOS, VPOS, WIDTH, HEIGHT). Azonban a ALTO 4-es verzióval a séma bevezette a <Shape> sokszögeket és a vonallánc alapvonalakat, ezzel lezárva a funkcionális szakadékot a PAGE XML-lel a kézírásos anyagok esetében.
  • Hosszú távú megőrzés: Mivel egy nemzetközi könyvtári konzorciumok által támogatott hivatalos szabvány, az ALTO garantálja a hosszú távú stabilitást és az archív szintű visszafelé kompatibilitást.

3. hOCR: A web‑első, könnyűsúlyú szabvány

Thomas Breuel által létrehozott hOCR pragmatikus megközelítést alkalmaz: ahelyett, hogy teljesen új XML sémát hozna létre, a layout és a transzkripció metaadatait közvetlenül a szemantikus HTML/XHTML-be ágyazza be mikroformátumok és osztályattribútumok használatával.

Tipikus szintaxis példa

<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
  <div class="ocr_carea" id="block_1_1">
    <p class="ocr_par" id="par_1_1">
      <span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
        <span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Kezdet</span>
      </span>
    </p>
  </div>
</div>

Előnyök és hátrányok a történelmi anyagok esetében

  • Előnyök: A böngészők natívan megjeleníthetik. Könnyen átalakítható vanilla CSS és JavaScript segítségével, és ez az alapértelmezett strukturált exportformátum olyan motorok számára, mint a Tesseract.
  • Hátrányok: A komplex, szabad formájú többpontos alapvonal görbék natív támogatása korlátozott. Bár a korai nyomtatott művek (incunabula vagy tiszta plakátok) esetén praktikus, a hOCR nehezen birkózik meg a változatos kézirati elrendezésekkel és a több rétegű marginaliákkal.

4. TEI-XML: Az akadémiai és digitális bölcsészet benchmarkja

A Text Encoding Initiative (TEI) formátum nem kifejezetten OCR motor kimeneti formátum; inkább a kritikus digitális kiadások és a irodalmi és történelmi szövegek tudományos ábrázolásának vezető szabványa.

OCR/HTR csatlakoztatása a TEI-hez

A modern feldolgozási láncok ritkán állnak meg a nyers karakterfelismerésnél. A tudósok olyan eszközöket használnak, mint a Transkribus TEI Exporter, vagy automatizált XSLT csővezetékek a PAGE XML vagy ALTO fájlok TEI-megfelelő XML-re történő átalakításához:

  • A rövidítéseket kibontják (<choice><abbr>...</abbr><expan>...</expan></choice>).
  • A törléseket, hozzáadásokat és a kézírási kézjeleket formálisan osztályozzák (<add>, <del>, <handShift>).
  • Az elrendezési adatokat a <facsimile> és <surface> elemek segítségével a irodalmi elemzéssel együtt őrzik meg.

Ha a történelmi projektje interaktív kritikai kiadást vagy szemantikai kereshető tudományos archívumot kíván létrehozni, az OCR/HTR adatok TEI-XML-re konvertálása gyakran a szükséges végső lépés.

Összehasonlító mátrix: OCR/HTR formátumok áttekintése

Jellemző / KritériumPAGE XMLALTO XML (v4+)hOCRTEI-XML
Elsődleges tartományKézírás HTR és kéziratokTömeges könyvtári digitalizációWebes OCR és könnyű keresésTudományos kritikai kiadások
Alapvető támogatásNatív, többpontos vonalláncokTámogatott (v4.0 óta)Alap (Meredekség/Eltolás)Fakszimile leképezésen keresztül
Rendellenes sokszögekTeljesTeljesKorlátozottKoordinátaelemeken keresztül
Eszközök ökoszisztémájaTranskribus, eScriptoriumMETS, Goobi, KitodoTesseract, Web megjelenítőkOxygen, TEI Publisher
Szabványosító testületPRImA Group / OpenKongresszusi KönyvtárKözösségi specifikációTEI Konzorcium

Gyakorlati ajánlások: Az archiválási folyamat kiválasztása

Egy hatékony, jövőbiztos digitalizációs folyamat kiépítéséhez:

  1. Tiszta kézírásos kéziratok és archívumok esetén: Standardizálja a transzkripciót és az elrendezés kinyerését a PAGE XML segítségével. Ennek alapvonal-számítása és poligon-kontúrozása a nem szabványos kézírásokat minimális adatveszteséggel kezeli.
  2. Nagy léptékű könyvtárak és vegyes gyűjtemények esetén: Válassza a ALTO XML (v4.2 vagy újabb)-t METS-szel párosítva. Ez garantálja a zökkenőmentes integrációt a szabványos digitális tároló architektúrákba és digitális eszközkezelő rendszerekbe (DAMS).
  3. Webes megjelenítés és teljes szöveges keresési indexek esetén: Használja a hOCR-t, vagy származtasson könnyű GeoJSON/Web Annotation struktúrákat a PAGE XML-ből, hogy interaktív IIIF nézőket (például Mirador vagy Universal Viewer) működtessen élő, böngészőben megjelenő szövegátfedésekkel.
  4. Tudományos kiadásokhoz és paleográfiai kutatáshoz: Generálja a ground truth adatot PAGE XML-ben, végezzen felismerést, és a kimenetet egy automatizált konverteren keresztül alakítsa TEI-XML-re a szerkesztői jelöléshez.

Azáltal, hogy ezeknek a formátumoknak a szerkezeti képességeit a forrásanyag paleográfiai igényeihez igazítja, biztosítja, hogy minden vonás, rövidítés és történelmi árnyalat évszázadokig értelmezhető maradjon.

Gyakran Ismételt Kérdések (GYIK)

Q1. Mi a alapvető különbség a standard OCR és a HTR között? Az OCR a konzisztens géppel nyomtatott tipográfiát ismeri fel, míg a HTR (Handwritten Text Recognition) mély neurális hálózatokat használ a folyamatos, változó kézírás és ívelt alapvonalak dekódolására.

Q2. Tud-e a Tesseract OCR PAGE XML vagy ALTO kimenetet előállítani történelmi dokumentumokhoz? Igen, a Tesseract képes natív ALTO XML és hOCR kimenetet generálni, és harmadik féltől származó csomagolók átalakíthatják ezeket az eredményeket PAGE XML-re.

Q3. Miért fontosabbak az alapvonalak, mint a körülhatároló dobozok a kézírásos szöveg átírásában? Az alapvonalak nyomon követik az emberi kézírás természetes, hullámzó vonalát, lehetővé téve a szoftver számára, hogy szétválassza a átfedő felső- és alsó karaktereket, amelyek egy szilárd körülhatároló dobozban ütköznek.

Q4. Hogyan lép kölcsönhatásba az IIIF szabvány ezekkel az OCR fájlformátumokkal? Az IIIF nagy felbontású képeket szolgáltat nyílt web API-ken keresztül, míg az ALTO vagy a PAGE XML formátumok koordináta adatokat biztosítanak, amelyeket IIIF Content Search annotációkká lehet konvertálni.

Q5. Melyik fájlformátum a legegyszerűbb közvetlenül kereshető PDF‑vé konvertálni? Mind a hOCR, mind az ALTO XML párosítható az eredeti oldalképekkel, hogy kereshető kétszintű PDF‑fájlokat hozzanak létre olyan eszközökkel, mint az OCRmyPDF.

Lásd még