Pēdējoreiz atjaunināts: 20 Aug, 2026

OCR failu formāti vēsturiskajiem un rakstītajiem dokumentiem
Digitālizācijas laikā kultūras mantojuma saglabāšana ir ieguvusi renesansi. Kamēr agrīnie optiskās rakstzīmju atpazīšanas (OCR) sistēmas tika izstrādātas, lai apstrādātu nevainojamu, mašīnapdrukātu divdesmitā gadsimta dokumentāciju, mūsdienu kultūras mantojuma iestādes saskaras ar daudz sarežģītāku, bagātāku izaicinājumu: viduslaiku rokrakstiem, XIX gadsimta kursīva sarakstēm, trausliem apgaismotajiem folijiem un gadsimtu vecām reģistrām.
Vēsturisko dokumentu transkribēšana vairs nav tikai par vienkārša ASCII teksta izguvi. Tas prasa kontekstu—fizisko ģeometriju, bāzes līnijas līknes, caurspīdīguma korekcijas, piezīmes, saīsinājumus un paleogrāfisko nenoteiktību. Šī specializētā joma, bieži klasificēta kā Rokas rakstības teksta atpazīšana (HTR), lielā mērā atkarīga no faila formāta, ko izmanto attēlu koordinātu un teksta slāņu glabāšanai un apmaiņai.
Neatbilstoša shēmas izvēle var noņemt svarīgus bāzes datus, pārtraukt saskaņošanu ar IIIF (International Image Interoperability Framework) manifestiem vai neļaut ilgtermiņa digitālo saglabāšanu. Šeit ir galīgs ceļvedis par vadošajiem OCR un HTR failu formātiem vēsturiskajiem dokumentiem, to struktūras stiprajām pusēm un to, kā noteikt pareizo izvēli jūsu arhīva caurulē.
Vēsturiskā dilema: Kāpēc Vienkāršais teksts un Standarta PDF neizdodas
Mašīnas drukāts OCR bieži izvada vienkāršus .txt failus vai “sandwich” PDF failus ar slēptiem teksta slāņiem zem skenējuma. Vēsturiskajiem manuskriptam un kursīvai rokrakstam šie iznākumi neizdodas trīs galveno iemeslu dēļ:
- Nelineārs teksts un sarežģīti izkārtojumi: Vēsturiskie rakstnieki neievēroja kārtīgus taisnstūra režģus. Teksts plūst uz malām, aptin apgaismotos iniciāļus, izšūjas starp ievietotajām starplīnijas korekcijām vai skrien vertikāli gar grāmatas mugurkaulu.
- Izliektas un slīpas bāzes līnijas: Rokraksts reti seko stingrai horizontālai asij. HTR dzinēji, piemēram, Transkribus, Kraken un eScriptorium, paļaujas uz daudzstūru bāzes līnijām, nevis uz robežkasti, lai interpretētu ligatūru bagātus rakstus.
- Paleogrāfiskā sarežģītība un metadati: Arhīvu pētījumiem ir jāseko saīsinājumiem, vēsturiskajām pareizrakstības variācijām, bojātām lasījumiem un rindas līmeņa pārliecības punktiem. Standarta dokumentu formāti izmet šo smalkumu.
Lai saglabātu ticamību oriģinālajam artefaktam, arhīvu kopiena paļaujas uz strukturētām XML shēmām, kas izstrādātas, lai saglabātu izkārtojuma topoloģiju kopā ar transkribēto tekstu.
1. PAGE XML: Zelta standarts rakstītā teksta atpazīšanai (HTR)
Izstrādāts PRImA (Pattern Recognition & Image Analysis) pētniecības laboratorijā, PAGE XML (Page Analysis and Groundtruth Elements) tiek plaši uzskatīts par modernāko formātu rokraksta teksta atpazīšanai un uzlabotai izkārtojuma analīzei.
Pamatarchitektūra
PAGE XML uztver fizisko dokumentu kā hierarhisku struktūru:
PcGts(Sakne)Page(Attēla dimensijas un kopējā lasīšanas secība)TextRegion(Rindkopas, virsraksti, malas piezīmes, atslēgvārdi)TextLineCoords(Poligona koordinātas ap līniju)Baseline(Punktu sērija, kas seko patiesajai rakstības bāzes līnijai)TextEquiv(Atpazītais teksts, ar izvēles pārliecības metriku)
Kāpēc tas izceļas vēsturiskajos manuskriptos
- Poligona un Polilīnijas Precizitāte: Tā vietā, lai piespiestu rakstzīmes taisnstūrveida robežlodziņos, PAGE XML izmanto daudzpunktu poligona robežas un nepārtrauktas bāzes līnijas. Tas novērš pārklājošos kursīva augšējus un apakšējos elementus, kas traucē segmentēšanu.
- Granulāri Strukturālie Veidi: Reģioni var tikt precīzi klasificēti (piem.,
marginalia,drop-capital,signature-mark,header,editorial-note). - Plašs programmatūras ekosistēma: Tā kalpo kā galvenais iekšējais un eksporta shēma vadošajām HTR platformām, piemēram, Transkribus, eScriptorium un Kraken.
2. ALTO XML: Bibliotēku un arhīvu spēks
ALTO (Analyzed Layout and Text Object) ir atvērtā XML standarts, ko uztur Kongresa bibliotēka, un plaši pieņem nacionālās bibliotēkas, tostarp Bibliothèque nationale de France (BnF) un Britu bibliotēka.
Pamatarchitektūra
ALTO strukturē izkārtojumu hierarhiskā veidā no Page līdz PrintSpace, tad TextBlock, TextLine un String (atsevišķi vārdi vai tokeni). To bieži pakot iekš METS (Metadata Encoding and Transmission Standard) ietvara, lai saistītu strukturālos metadatus ar augstas izšķirtspējas galvenajiem attēliem.
Galvenās stiprās puses un lietošanas gadījumi
- Masveida digitalizācijas darba plūsmas: ALTO tika izstrādāts, domājot par rūpnieciskā mēroga avīžu un grāmatu digitalizāciju. Tas skaidri kodē fonta atribūtus, vārda līmeņa koordinātas, rakstzīmju pārliecību un atstarpes.
- Mūsdienīgs HTR atbalsts (ALTO 4): Agrākas ALTO versijas lielā mērā balstījās uz taisnstūra koordinātām (
HPOS,VPOS,WIDTH,HEIGHT). Tomēr, sākot ar ALTO versiju 4, shēma ieviesa<Shape>poligonus un polilīniju bāzes līnijas, aizverot funkcionālo plaisu ar PAGE XML rakstītām materiāliem. - Ilgtermiņa saglabāšana: Tā kā tas ir oficiāls standarts, ko atbalsta starptautiskas bibliotēku konsorciji, ALTO garantē ilgtermiņa stabilitāti un arhīva līmeņa atpakaļējo saderību.
3. hOCR: Tīmekļa-pirmais, viegls standarts
Izveidots Thomas Breuel, hOCR pieņem pragmatisku pieeju: nevis izveidojot pilnīgi jaunu XML shēmu, tas iekļauj izkārtojuma un transkripcijas metadatus tieši semantiskajā HTML/XHTML, izmantojot mikroformātus un klases atribūtus.
Tipisks sintakses piemērs
<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
<div class="ocr_carea" id="block_1_1">
<p class="ocr_par" id="par_1_1">
<span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
<span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Incipit</span>
</span>
</p>
</div>
</div>
Priekšrocības un trūkumi vēsturiskajiem materiāliem
- Priekšrocības: Pārlūkprogrammas var to attēlot iebūvēti. To ir viegli pārveidot, izmantojot vienkāršu CSS un JavaScript, un tas ir noklusējuma strukturētais eksporta formāts dzinējiem, piemēram, Tesseract.
- Trūkumi: Iebūvētais atbalsts sarežģītām, brīvi veidotām daudzpunktu bāzes līkņu krivām ir ierobežots. Lai gan tas ir praktisks agrīnām drukas darbiem (inkunabulas vai tīriem plakātiem), hOCR saskaras ar grūtībām neviendabīgos rokrakstu izkārtojumos un daudzslāņainajās marginalijās.
4. TEI-XML: Akadēmiskā un digitālo humanitāru standarts
Text Encoding Initiative (TEI) formāts nav stingri OCR dzinēja izvades formāts; tas gan ir vadošais standarts kritiskajām digitālajām izdevumiem un akadēmiskai literāro un vēsturisko tekstu pārstāvībai.
OCR/HTR savienošana ar TEI
Mūsdienu caurules reti apstājas pie neapstrādātas rakstzīmju atpazīšanas. Zinātnieki izmanto rīkus, piemēram, Transkribus TEI Exporter vai automatizētas XSLT caurules, lai pārvērstu PAGE XML vai ALTO failus TEI atbilstošā XML:
- Saīsinājumi tiek paplašināti (
<choice><abbr>...</abbr><expan>...</expan></choice>). - Dzēšanas, pievienošanas un rakstnieku rokas tiek formāli klasificētas (
<add>,<del>,<handShift>). - Izkārtojuma dati tiek saglabāti kopā ar literāro analīzi, izmantojot
<facsimile>un<surface>elementus.
Ja jūsu vēsturiskais projekts mērķē izveidot interaktīvu kritisko izdevumu vai semantiski meklējamu akadēmisku arhīvu, OCR/HTR datu pārveidošana uz TEI-XML bieži ir nepieciešamais galīgais solis.
Salīdzinošā matrica: OCR/HTR formāti uz skatiena
| Īpašība / Kritērijs | PAGE XML | ALTO XML (v4+) | hOCR | TEI-XML |
|---|---|---|---|---|
| Primārais domēns | Rokas rakstība HTR & rokopisi | Masveida bibliotēku digitalizācija | Tīmekļa OCR & viegla meklēšana | Zinātniskās kritiskās izdevumi |
| Pamata atbalsts | Dzimtās, daudzpunktu līnijas | Atbalstīts (kopš v4.0) | Pamata (slīpums/novirze) | Izmantojot faksimīles kartēšanu |
| Neregulāri daudzstūri | Pilns | Pilns | Ierobežots | Izmantojot koordinātu elementus |
| Rīku ekosistēma | Transkribus, eScriptorium | METS, Goobi, Kitodo | Tesseract, tīmekļa skatītāji | Oxygen, TEI publicētājs |
| Standartizācijas institūcija | PRImA grupa / Open | Kongresa bibliotēka | Kopienas specifikācija | TEI konsorcijs |
Praktiski ieteikumi: Izvēloties jūsu arhīva cauruļvadu
Lai izveidotu efektīvu, nākotnei drošu digitalizācijas cauruļvadu:
- Tikai tīri rokraksta manuskripti un arhīvi: Standardizējiet savu transkripciju un izkārtojuma izvilkumu, izmantojot PAGE XML. Tā bāzes līnijas aprēķins un daudzstūra kontūru veidošana apstrādā nestandarta rakstības rokas ar minimālu datu zudumu.
- Lielapjoma bibliotēkām un jauktām kolekcijām: Izvēlieties ALTO XML (v4.2 vai jaunāku) kopā ar METS. Tas nodrošina nevainojamu integrāciju ar standarta digitālo krātuves arhitektūrām un digitālo aktīvu pārvaldības sistēmām (DAMS).
- Tīmekļa prezentācijai un pilna teksta meklēšanas indeksiem: Izmantojiet hOCR vai izveidojiet vieglas GeoJSON/Tīmekļa anotācijas struktūras no PAGE XML, lai vadītu interaktīvus IIIF skatītājus (piemēram, Mirador vai Universal Viewer) ar tiešsaistes pārlūkprogrammas teksta pārklājumiem.
- Zinātniskajām izdevumiem un paleogrāfijas pētījumiem: Izveidojiet savu patieso datus PAGE XML formātā, veiciet atpazīšanu un caurvadiet rezultātu caur automatizētu pārveidotāju, lai ģenerētu TEI-XML redakcijas marķēšanai.
Saskaņojot šo formātu struktūrvērtības ar jūsu avota materiāla paleogrāfiskajām prasībām, jūs nodrošināt, ka katra svītra, katrs saīsinājums un katra vēsturiskā niansa paliek atpazīstama nākamajām gadsimtiem.
Biežāk uzdotie jautājumi (BUJ)
J1. Kāda ir būtiskā atšķirība starp standarta OCR un HTR? OCR atpazīst konsekventu mašīnas drukātu tipogrāfiju, savukārt HTR (Rokas raksta atpazīšana) izmanto dziļus neironu tīklus, lai atkodētu nepārtrauktu, mainīgu cilvēka rakstību un izliekotas bāzes līnijas.
J2. Vai Tesseract OCR var ģenerēt PAGE XML vai ALTO izvadi vēsturiskajiem dokumentiem? Jā, Tesseract var izveidot iebūvēto ALTO XML un hOCR izvadi, un trešo pušu pārklājumi var pārvērst šos rezultātus PAGE XML formātā.
J3. Kāpēc bāzes līnijas ir svarīgākas nekā robežkastiņas rokraksta teksta transkripcijā? Bāzes līnijas sekot dabiski, viļņojošai cilvēka rakstības līnijai, ļaujot programmatūrai atdalīt pārklājošos augšējos un apakšējos stieņus, kas saduras stingrās robežkastiņās.
Q4. Kā IIIF standarts mijiedarbojas ar šiem OCR failu formātiem? IIIF nodrošina augstas izšķirtspējas attēlus caur atvērtām tīmekļa API, kamēr tādi formāti kā ALTO vai PAGE XML sniedz koordinātu datus, kurus var pārveidot par IIIF Content Search anotācijām.
Q5. Kurš faila formāts ir visvieglāk tieši pārveidot meklējamu PDF? Gan hOCR, gan ALTO XML var tikt savienoti ar oriģinālajiem lapas attēliem, lai izveidotu meklējamus divslāņu PDF failus, izmantojot tādus rīkus kā OCRmyPDF.