Paskutinį kartą atnaujinta: 2026 m. rugpjūčio 20 d.

OCR failų formatai istoriniams ir rankraštiems dokumentams
Kultūrinio paveldo išsaugojimas per skaitmeninimą įžengė į renesansą. Nors ankstyvosios optinės simbolių atpažinimo (OCR) sistemos buvo sukurtos analizuoti nepriekaištingus, mašininiu spausdinimu sukurtus XX amžiaus dokumentus, šiuolaikinės kultūrinio paveldo institucijos susiduria su daug chaotiškesniu, turtingesniu iššūkiu: viduramžių rankraščiais, XIX amžiaus kursyvu rašyta korespondencija, trapūs apšviesti folijai ir šimtmečio senumo registrai.
Transkribuoti istorinius dokumentus daugiau nebėra tik apie paprasto ASCII teksto išgavimą. Tai reikalauja fiksuoti kontekstą—puslapio fizinę geometriją, bazinių kreivių linijas, peršvietimo korekcijas, marginalijas, santrumpas ir paleografinį neapibrėžtumą. Ši specializuota sritis, dažnai klasifikuojama kaip ranka rašyto teksto atpažinimas (HTR), stipriai priklauso nuo failo formato, naudojamo saugoti ir keistis tiek vaizdo koordinatėmis, tiek tekstiniais sluoksniais.
Neteisingo schemos pasirinkimas gali pašalinti svarbius bazinius duomenis, sutrikdyti suderinamumą su IIIF (International Image Interoperability Framework) manifestais arba trukdyti ilgalaikei skaitmeninei archyvavimui. Štai galutinis vadovas apie pirmaujančius OCR ir HTR failų formatus istoriniams dokumentams, jų struktūrinius privalumus ir kaip nustatyti tinkamiausią pasirinkimą jūsų archyvavimo procesui.
Istorinė dilema: kodėl Paprastas tekstas ir standartiniai PDF failai nesėkmingi
Mašininis spausdinimas OCR dažnai generuoja paprastus .txt failus arba “sandwich” PDF failus su paslėptais teksto sluoksniais po skenu. Istorinėms rankraščių ir kursyvinės rašymo formoms šie išvesties formatai nesugeba dėl trijų pagrindinių priežasčių:
- Nelinijinis tekstas ir sudėtingi išdėstymai: Istoriniai rašytojai nežiūrėjo į tvarkingas stačiakampes tinkleles. Tekstas tekėja į paraštes, supa apšviestas iniciales, persipina su įterptais tarpliniais pataisymais arba teksta vertikaliai palei nugarą.
- Kreivios ir pasvirusios bazinės linijos: Rankraštis retai laikosi griežtos horizontalaus ašies. HTR varikliai, tokie kaip Transkribus, Kraken ir eScriptorium, remiasi polilinijomis bazinėmis linijomis, o ne ribinėmis dėžutėmis, kad interpretuotų ligatūromis turtingus raštus.
- Paleografinė sudėtingumas ir metaduomenys: Archyvų tyrimai reikalauja sekti santrumpas, istorines rašybos variacijas, pažeistas skaitymo vietas ir eilučių lygio pasitikėjimo balus. Įprasti dokumentų formatai išmeta šį detalumą.
Siekiant išlaikyti tikslumą originaliam artefaktui, archyvų bendruomenė remiasi struktūruotomis XML schemomis, sukurtomis išsaugoti išdėstymo topologiją kartu su transkribuotu tekstu.
1. PAGE XML: Aukščiausias standartas rankrašto teksto atpažinimui (HTR)
Sukurtas PRImA (Pattern Recognition & Image Analysis) tyrimų laboratorijos, PAGE XML (Page Analysis and Groundtruth Elements) plačiai laikomas pažangiausiu formatu rankrašto teksto atpažinimui ir išplėstinei išdėstymo analizei.
Pagrindinė architektūra
PAGE XML traktuoja fizinį dokumentą kaip hierarchinę struktūrą:
PcGts(Šakninis)Page(Vaizdo matmenys ir bendras skaitymo tvarka)TextRegion(Pastraipos, antraštės, paraštės pastabos, raktiniai žodžiai)TextLineCoords(Poligono koordinatės aplink liniją)Baseline(Taškų serija, sekanti tikrąją šrifto bazinę liniją)TextEquiv(Atpažintas tekstas, su pasirenkamais pasitikėjimo rodikliais)
Kodėl jis išsiskiria istoriniams rankraštiams
- Poligono ir polilinijos tikslumas: Vietoj to, kad priverstų simbolius į stačiakampines ribojančias dėžutes, PAGE XML naudoja daugelio taškų poligono ribas ir nuolatines bazines linijas. Tai neleidžia persidengiančioms kursyvinėms viršutinėms ir apatinėms dalims trukdyti segmentavimui.
- Išsamūs struktūriniai tipai: Regionus galima tiksliai klasifikuoti (pvz.,
marginalia,drop-capital,signature-mark,header,editorial-note). - Plati programinės įrangos ekosistema: Ji veikia kaip pagrindinė vidinė ir eksporto schema vėliausioms HTR platformoms, tokioms kaip Transkribus, eScriptorium ir Kraken.
2. ALTO XML: Bibliotekų ir archyvų galingas įrankis
ALTO (Analyzed Layout and Text Object) yra atviras XML standartas, kurį prižiūri Kongreso biblioteka ir plačiai priima nacionalinės bibliotekos, įskaitant Bibliothèque nationale de France (BnF) ir Britų biblioteką.
Pagrindinė architektūra
ALTO struktūruoja išdėstymą hierarchiškai nuo Page iki PrintSpace, žemyn iki TextBlock, TextLine ir String (atskirų žodžių ar tokenų). Ji dažnai supakuojama į METS (Metadata Encoding and Transmission Standard) apvalkalą, kad susietų struktūrinę metaduomenų su aukštos raiškos pagrindiniais vaizdais.
Pagrindiniai privalumai ir naudojimo atvejai
- Masinės skaitmenizacijos darbo srautai: ALTO buvo sukurta atsižvelgiant į pramoninio masto laikraščių ir knygų skaitmenizaciją. Ji tvarkingai koduoja šriftų atributus, žodžių lygio koordinates, simbolių pasitikėjimo rodiklius ir tarpus.
- Moderni HTR palaikymas (ALTO 4): Ankstesnės ALTO versijos stipriai remtasi stačiakampėmis koordinatėmis (
HPOS,VPOS,WIDTH,HEIGHT). Tačiau nuo ALTO 4 versijos schema pristatė<Shape>daugiakampius ir polilinijines bazines linijas, uždarydama funkcinį tarpą su PAGE XML ranka rašytų medžiagų atžvilgiu. - Ilgalaikė išsaugojimas: Kadangi tai yra oficialus standartas, remiamas tarptautinių bibliotekų konsorciumų, ALTO garantuoja ilgalaikį stabilumą ir archyvo lygio atgalinę suderinamumą.
3. hOCR: Žiniatinklio pirmumo, lengvas standartas
Sukurtas Thomas Breuel, hOCR priima praktišką požiūrį: vietoj visiškai naujos XML schemos kūrimo, jis įterpia išdėstymo ir transkripcijos metaduomenis tiesiai į semantinį HTML/XHTML, naudodamas mikroformatus ir klasės atributus.
Tipinis sintaksės pavyzdys
<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
<div class="ocr_carea" id="block_1_1">
<p class="ocr_par" id="par_1_1">
<span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
<span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Incipit</span>
</span>
</p>
</div>
</div>
Privalumai ir trūkumai istoriniams medžiagoms
- Privalumai: Naršyklės gali jį atvaizduoti natūraliai. Jis lengvai transformuojamas naudojant grynąjį CSS ir JavaScript, ir yra numatytasis struktūruotas eksporto formatas tokioms sistemoms kaip Tesseract.
- Trūkumai: Natūrali parama sudėtingoms, laisvai formuojamoms daugelio taškų bazinėms kreivėms yra ribota. Nors tai praktiška ankstyviems spausdintiems darbams (inkunabulai arba švarios broadsidės), hOCR susiduria su sunkumais netvarkingų rankraštinių išdėstymų ir daugiapakopės marginalijos atžvilgiu.
4. TEI-XML: Akademinis ir skaitmeninės humanistikos standartas
Text Encoding Initiative (TEI) formatas nėra griežtai OCR variklio išvesties formatas; priešingai, tai yra pirmaujantis standartas kritinėms skaitmeninėms leidiniams ir moksliniam literatūrinių bei istorinių tekstų atvaizdavimui.
OCR/HTR susiejimas su TEI
Šiuolaikiniai procesai retai sustoja ties žaliuoju ženklų atpažinimu. Mokslininkai naudoja įrankius, tokius kaip Transkribus TEI Exporter arba automatizuotus XSLT procesus, kad konvertuotų PAGE XML arba ALTO failus į TEI atitinkantį XML:
- Santrumpos išplečiamos (
<choice><abbr>...</abbr><expan>...</expan></choice>). - Ištryniai, papildymai ir rašytojų rankų tipai yra formaliai klasifikuojami (
<add>,<del>,<handShift>). - Išdėstymo duomenys išsaugomi kartu su literatūrine analize naudojant
<facsimile>ir<surface>elementus.
Jei jūsų istorinis projektas siekia sukurti interaktyvią kritinę leidinę arba semantiškai ieškomą mokslinį archyvą, OCR/HTR duomenų konvertavimas į TEI-XML dažnai yra būtinas galutinis žingsnis.
Palyginamoji matrica: OCR/HTR formatai iš karto
| Savybė / Kriterijus | PAGE XML | ALTO XML (v4+) | hOCR | TEI-XML |
|---|---|---|---|---|
| Pagrindinė sritis | Kursyvinis HTR & rankraštiai | Masinė bibliotekų skaitmenizacija | Interneto OCR & lengva paieška | Mokslinės kritinės leidiniai |
| Pagrindinė parama | Vietiniai, daugelio taškų polilinijos | Palaikoma (nuo v4.0) | Paprasta (nuolydis/poslinkis) | Per faksimilių žemėlapį |
| Nereguliarios daugiakampiai | Pilna | Pilna | Ribota | Per koordinatų elementus |
| Įrankių ekosistema | Transkribus, eScriptorium | METS, Goobi, Kitodo | Tesseract, Žiniatinklio peržiūros programos | Oxygen, TEI Publisher |
| Standartizacijos organas | PRImA Group / Open | Jungtų Valstijų Kongreso biblioteka | Bendruomenės specifikacija | TEI konsorciumas |
Praktinės rekomendacijos: pasirinkti savo archyvų procesą
Sukurti efektyvų, ateičiai atsparų skaitmeninimo procesą:
- Gryni rankraštiniai rankraščiai ir archyvai: Standartizuokite savo transkripciją ir išdėstymo išgavimą naudojant PAGE XML. Jo bazės linijos skaičiavimas ir daugiakampių kontūrų apdorojimas tvarko nestandartines rašymo rankas su minimalia duomenų praradimo rizika.
- Didelio masto bibliotekoms ir mišrioms kolekcijoms: Pasirinkite ALTO XML (v4.2 arba aukštesnę) kartu su METS. Tai garantuoja sklandų integravimą į standartines skaitmeninių saugyklų architektūras ir skaitmeninių turto valdymo sistemas (DAMS).
- Skaitmeninei prezentacijai ir pilno teksto paieškos indeksams: Naudokite hOCR arba išgaukite lengvus GeoJSON/Web anotacijų struktūras iš PAGE XML, kad valdyti interaktyvias IIIF peržiūros programas (pvz., Mirador arba Universal Viewer) su tiesioginiais naršyklės tekstiniais sluoksniais.
- Moksliniams leidiniams ir paleografiniams tyrimams: Sukurkite savo pagrindinę tiesą PAGE XML formatu, atlikite atpažinimą ir perkelkite išvestį per automatizuotą konverterį, kad sukurtumėte TEI-XML redagavimo žymėjimui.
Suderindami šių formatų struktūrines galimybes su jūsų šaltinio medžiagos paleografiniais reikalavimais, užtikrinate, kad kiekvienas brūkšnys, santrumpa ir istorinė niuansas išliktų iššifruojami šimtmečius ateityje.
Dažnai užduodami klausimai (DUK)
K1. Koks yra pagrindinis skirtumas tarp standartinio OCR ir HTR? OCR atpažįsta nuoseklią mašininiu spausdinimu tipografiją, o HTR (rankraščio teksto atpažinimas) naudoja gilias neuronines tinklus, kad iššifruotų nuolatinį, kintamą žmogaus rankraštį ir kreivus bazinius linijas.
K2. Ar Tesseract OCR gali generuoti PAGE XML arba ALTO išvestį istoriniams dokumentams? Taip, Tesseract gali generuoti natūrinį ALTO XML ir hOCR išvestį, o trečiųjų šalių apvalkalo programos gali konvertuoti šiuos rezultatus į PAGE XML.
K3. Kodėl bazinės linijos yra svarbesnės nei ribų dėžutės rankraščio teksto transkripcijoje? Bazinės linijos seka natūralią, banginę žmogaus rašymo liniją, leidžiančią programinei įrangai atskirti persidengiančius viršutinius ir apatinus ženklus, kurie susiduria kietose ribų dėžutėse.
Q4. Kaip IIIF standartas sąveikauja su šiais OCR failų formatais? IIIF teikia aukštos raiškos vaizdus per atviras žiniatinklio API, o tokie formatai kaip ALTO arba PAGE XML suteikia koordinatų duomenis, kuriuos galima konvertuoti į IIIF turinio paieškos anotacijas.
Q5. Kuris failo formatas yra lengviausias tiesiogiai konvertuoti į ieškomą PDF? Tiek hOCR, tiek ALTO XML gali būti susieti su originaliomis puslapio nuotraukomis, kad būtų sukurtas ieškomas dviejų sluoksnių PDF failas naudojant įrankius, pvz., OCRmyPDF.