<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Rankrašto teksto atpažinimas on File Format Blog</title>
    <link>https://blog.fileformat.com/lt/tag/rankra%C5%A1to-teksto-atpa%C5%BEinimas/</link>
    <description>Recent content in Rankrašto teksto atpažinimas on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>lt</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/lt/tag/rankra%C5%A1to-teksto-atpa%C5%BEinimas/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Kaip pasirinkti tinkamą failo formatą rankrašto teksto atpažinimui (HTR)</title>
      <link>https://blog.fileformat.com/lt/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/lt/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Atraskite geriausius OCR ir HTR failų formatus istoriniams rankraštiems dokumentams ir rankraštiems archyvams, lyginant ALTO, PAGE XML, hOCR ir TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Paskutinį kartą atnaujinta</strong>: 2026 m. rugpjūčio 20 d.</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="ocr-failų-formatai-istoriniams-ir-rankraštiems-dokumentams">OCR failų formatai istoriniams ir rankraštiems dokumentams</h2>
<p>Kultūrinio paveldo išsaugojimas per skaitmeninimą įžengė į renesansą. Nors ankstyvosios optinės simbolių atpažinimo (OCR) sistemos buvo sukurtos analizuoti nepriekaištingus, mašininiu spausdinimu sukurtus XX amžiaus dokumentus, šiuolaikinės kultūrinio paveldo institucijos susiduria su daug chaotiškesniu, turtingesniu iššūkiu: viduramžių rankraščiais, XIX amžiaus kursyvu rašyta korespondencija, trapūs apšviesti folijai ir šimtmečio senumo registrai.</p>
<p>Transkribuoti istorinius dokumentus daugiau nebėra tik apie paprasto ASCII teksto išgavimą. Tai reikalauja fiksuoti <strong>kontekstą</strong>—puslapio fizinę geometriją, bazinių kreivių linijas, peršvietimo korekcijas, marginalijas, santrumpas ir paleografinį neapibrėžtumą. Ši specializuota sritis, dažnai klasifikuojama kaip ranka rašyto teksto atpažinimas (HTR), stipriai priklauso nuo failo formato, naudojamo saugoti ir keistis tiek vaizdo koordinatėmis, tiek tekstiniais sluoksniais.</p>
<p>Neteisingo schemos pasirinkimas gali pašalinti svarbius bazinius duomenis, sutrikdyti suderinamumą su IIIF (International Image Interoperability Framework) manifestais arba trukdyti ilgalaikei skaitmeninei archyvavimui. Štai galutinis vadovas apie pirmaujančius OCR ir HTR failų formatus istoriniams dokumentams, jų struktūrinius privalumus ir kaip nustatyti tinkamiausią pasirinkimą jūsų archyvavimo procesui.</p>
<h2 id="istorinė-dilema-kodėl-paprastas-tekstas15-ir-standartiniai-pdf-failai1-nesėkmingi">Istorinė dilema: kodėl <a href="https//docs.fileformat.com/word-processing/txt/">Paprastas tekstas</a> ir standartiniai <a href="https://docs.fileformat.com/pdf/">PDF failai</a> nesėkmingi</h2>
<p>Mašininis spausdinimas OCR dažnai generuoja paprastus <code>.txt</code> failus arba &ldquo;sandwich&rdquo; PDF failus su paslėptais teksto sluoksniais po skenu. Istorinėms rankraščių ir kursyvinės rašymo formoms šie išvesties formatai nesugeba dėl trijų pagrindinių priežasčių:</p>
<ol>
<li><strong>Nelinijinis tekstas ir sudėtingi išdėstymai:</strong> Istoriniai rašytojai nežiūrėjo į tvarkingas stačiakampes tinkleles. Tekstas tekėja į paraštes, supa apšviestas iniciales, persipina su įterptais tarpliniais pataisymais arba teksta vertikaliai palei nugarą.</li>
<li><strong>Kreivios ir pasvirusios bazinės linijos:</strong> Rankraštis retai laikosi griežtos horizontalaus ašies. HTR varikliai, tokie kaip Transkribus, Kraken ir eScriptorium, remiasi polilinijomis bazinėmis linijomis, o ne ribinėmis dėžutėmis, kad interpretuotų ligatūromis turtingus raštus.</li>
<li><strong>Paleografinė sudėtingumas ir metaduomenys:</strong> Archyvų tyrimai reikalauja sekti santrumpas, istorines rašybos variacijas, pažeistas skaitymo vietas ir eilučių lygio pasitikėjimo balus. Įprasti dokumentų formatai išmeta šį detalumą.</li>
</ol>
<p>Siekiant išlaikyti tikslumą originaliam artefaktui, archyvų bendruomenė remiasi struktūruotomis XML schemomis, sukurtomis išsaugoti išdėstymo topologiją kartu su transkribuotu tekstu.</p>
<h2 id="1-page-xml-aukščiausias-standartas-rankrašto-teksto-atpažinimui-htr">1. PAGE XML: Aukščiausias standartas rankrašto teksto atpažinimui (HTR)</h2>
<p>Sukurtas PRImA (Pattern Recognition &amp; Image Analysis) tyrimų laboratorijos, <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) plačiai laikomas pažangiausiu formatu rankrašto teksto atpažinimui ir išplėstinei išdėstymo analizei.</p>
<h3 id="pagrindinė-architektūra">Pagrindinė architektūra</h3>
<p>PAGE XML traktuoja fizinį dokumentą kaip hierarchinę struktūrą:</p>
<ul>
<li><code>PcGts</code> (Šakninis)
<ul>
<li><code>Page</code> (Vaizdo matmenys ir bendras skaitymo tvarka)
<ul>
<li><code>TextRegion</code> (Pastraipos, antraštės, paraštės pastabos, raktiniai žodžiai)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Poligono koordinatės aplink liniją)</li>
<li><code>Baseline</code> (Taškų serija, sekanti tikrąją šrifto bazinę liniją)</li>
<li><code>TextEquiv</code> (Atpažintas tekstas, su pasirenkamais pasitikėjimo rodikliais)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="kodėl-jis-išsiskiria-istoriniams-rankraštiams">Kodėl jis išsiskiria istoriniams rankraštiams</h3>
<ul>
<li><strong>Poligono ir polilinijos tikslumas:</strong> Vietoj to, kad priverstų simbolius į stačiakampines ribojančias dėžutes, PAGE XML naudoja daugelio taškų poligono ribas ir nuolatines bazines linijas. Tai neleidžia persidengiančioms kursyvinėms viršutinėms ir apatinėms dalims trukdyti segmentavimui.</li>
<li><strong>Išsamūs struktūriniai tipai:</strong> Regionus galima tiksliai klasifikuoti (pvz., <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Plati programinės įrangos ekosistema:</strong> Ji veikia kaip pagrindinė vidinė ir eksporto schema vėliausioms HTR platformoms, tokioms kaip <strong>Transkribus</strong>, <strong>eScriptorium</strong> ir <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-bibliotekų-ir-archyvų-galingas-įrankis">2. ALTO XML: Bibliotekų ir archyvų galingas įrankis</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> yra atviras XML standartas, kurį prižiūri Kongreso biblioteka ir plačiai priima nacionalinės bibliotekos, įskaitant Bibliothèque nationale de France (BnF) ir Britų biblioteką.</p>
<h3 id="pagrindinė-architektūra-1">Pagrindinė architektūra</h3>
<p>ALTO struktūruoja išdėstymą hierarchiškai nuo <code>Page</code> iki <code>PrintSpace</code>, žemyn iki <code>TextBlock</code>, <code>TextLine</code> ir <code>String</code> (atskirų žodžių ar tokenų). Ji dažnai supakuojama į <strong>METS</strong> (Metadata Encoding and Transmission Standard) apvalkalą, kad susietų struktūrinę metaduomenų su aukštos raiškos pagrindiniais vaizdais.</p>
<h3 id="pagrindiniai-privalumai-ir-naudojimo-atvejai">Pagrindiniai privalumai ir naudojimo atvejai</h3>
<ul>
<li><strong>Masinės skaitmenizacijos darbo srautai:</strong> ALTO buvo sukurta atsižvelgiant į pramoninio masto laikraščių ir knygų skaitmenizaciją. Ji tvarkingai koduoja šriftų atributus, žodžių lygio koordinates, simbolių pasitikėjimo rodiklius ir tarpus.</li>
<li><strong>Moderni HTR palaikymas (ALTO 4):</strong> Ankstesnės ALTO versijos stipriai remtasi stačiakampėmis koordinatėmis (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Tačiau nuo <strong>ALTO 4 versijos</strong> schema pristatė <code>&lt;Shape&gt;</code> daugiakampius ir polilinijines bazines linijas, uždarydama funkcinį tarpą su PAGE XML ranka rašytų medžiagų atžvilgiu.</li>
<li><strong>Ilgalaikė išsaugojimas:</strong> Kadangi tai yra oficialus standartas, remiamas tarptautinių bibliotekų konsorciumų, ALTO garantuoja ilgalaikį stabilumą ir archyvo lygio atgalinę suderinamumą.</li>
</ul>
<h2 id="3-hocr-žiniatinklio-pirmumo-lengvas-standartas">3. hOCR: Žiniatinklio pirmumo, lengvas standartas</h2>
<p>Sukurtas Thomas Breuel, <strong>hOCR</strong> priima praktišką požiūrį: vietoj visiškai naujos XML schemos kūrimo, jis įterpia išdėstymo ir transkripcijos metaduomenis tiesiai į semantinį HTML/XHTML, naudodamas mikroformatus ir klasės atributus.</p>
<h3 id="tipinis-sintaksės-pavyzdys">Tipinis sintaksės pavyzdys</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="privalumai-ir-trūkumai-istoriniams-medžiagoms">Privalumai ir trūkumai istoriniams medžiagoms</h3>
<ul>
<li><strong>Privalumai:</strong> Naršyklės gali jį atvaizduoti natūraliai. Jis lengvai transformuojamas naudojant grynąjį CSS ir JavaScript, ir yra numatytasis struktūruotas eksporto formatas tokioms sistemoms kaip <strong>Tesseract</strong>.</li>
<li><strong>Trūkumai:</strong> Natūrali parama sudėtingoms, laisvai formuojamoms daugelio taškų bazinėms kreivėms yra ribota. Nors tai praktiška ankstyviems spausdintiems darbams (inkunabulai arba švarios broadsidės), hOCR susiduria su sunkumais netvarkingų rankraštinių išdėstymų ir daugiapakopės marginalijos atžvilgiu.</li>
</ul>
<h2 id="4-tei-xml-akademinis-ir-skaitmeninės-humanistikos-standartas">4. TEI-XML: Akademinis ir skaitmeninės humanistikos standartas</h2>
<p><strong>Text Encoding Initiative (TEI)</strong> formatas nėra griežtai OCR variklio išvesties formatas; priešingai, tai yra pirmaujantis standartas kritinėms skaitmeninėms leidiniams ir moksliniam literatūrinių bei istorinių tekstų atvaizdavimui.</p>
<h3 id="ocrhtr-susiejimas-su-tei">OCR/HTR susiejimas su TEI</h3>
<p>Šiuolaikiniai procesai retai sustoja ties žaliuoju ženklų atpažinimu. Mokslininkai naudoja įrankius, tokius kaip <strong>Transkribus TEI Exporter</strong> arba automatizuotus XSLT procesus, kad konvertuotų PAGE XML arba ALTO failus į TEI atitinkantį XML:</p>
<ul>
<li>Santrumpos išplečiamos (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Ištryniai, papildymai ir rašytojų rankų tipai yra formaliai klasifikuojami (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Išdėstymo duomenys išsaugomi kartu su literatūrine analize naudojant <code>&lt;facsimile&gt;</code> ir <code>&lt;surface&gt;</code> elementus.</li>
</ul>
<p>Jei jūsų istorinis projektas siekia sukurti interaktyvią kritinę leidinę arba semantiškai ieškomą mokslinį archyvą, OCR/HTR duomenų konvertavimas į TEI-XML dažnai yra būtinas galutinis žingsnis.</p>
<h2 id="palyginamoji-matrica-ocrhtr-formatai-iš-karto">Palyginamoji matrica: OCR/HTR formatai iš karto</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Savybė / Kriterijus</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Pagrindinė sritis</strong></td>
<td style="text-align:left">Kursyvinis HTR &amp; rankraštiai</td>
<td style="text-align:left">Masinė bibliotekų skaitmenizacija</td>
<td style="text-align:left">Interneto OCR &amp; lengva paieška</td>
<td style="text-align:left">Mokslinės kritinės leidiniai</td>
</tr>
<tr>
<td style="text-align:left"><strong>Pagrindinė parama</strong></td>
<td style="text-align:left">Vietiniai, daugelio taškų polilinijos</td>
<td style="text-align:left">Palaikoma (nuo v4.0)</td>
<td style="text-align:left">Paprasta (nuolydis/poslinkis)</td>
<td style="text-align:left">Per faksimilių žemėlapį</td>
</tr>
<tr>
<td style="text-align:left"><strong>Nereguliarios daugiakampiai</strong></td>
<td style="text-align:left">Pilna</td>
<td style="text-align:left">Pilna</td>
<td style="text-align:left">Ribota</td>
<td style="text-align:left">Per koordinatų elementus</td>
</tr>
<tr>
<td style="text-align:left"><strong>Įrankių ekosistema</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, Žiniatinklio peržiūros programos</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Standartizacijos organas</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Jungtų Valstijų Kongreso biblioteka</td>
<td style="text-align:left">Bendruomenės specifikacija</td>
<td style="text-align:left">TEI konsorciumas</td>
</tr>
</tbody>
</table>
<h2 id="praktinės-rekomendacijos-pasirinkti-savo-archyvų-procesą">Praktinės rekomendacijos: pasirinkti savo archyvų procesą</h2>
<p>Sukurti efektyvų, ateičiai atsparų skaitmeninimo procesą:</p>
<ol>
<li><strong>Gryni rankraštiniai rankraščiai ir archyvai:</strong>
Standartizuokite savo transkripciją ir išdėstymo išgavimą naudojant <strong>PAGE XML</strong>. Jo bazės linijos skaičiavimas ir daugiakampių kontūrų apdorojimas tvarko nestandartines rašymo rankas su minimalia duomenų praradimo rizika.</li>
<li><strong>Didelio masto bibliotekoms ir mišrioms kolekcijoms:</strong>
Pasirinkite <strong>ALTO XML (v4.2 arba aukštesnę)</strong> kartu su <strong>METS</strong>. Tai garantuoja sklandų integravimą į standartines skaitmeninių saugyklų architektūras ir skaitmeninių turto valdymo sistemas (DAMS).</li>
<li><strong>Skaitmeninei prezentacijai ir pilno teksto paieškos indeksams:</strong>
Naudokite <strong>hOCR</strong> arba išgaukite lengvus GeoJSON/Web anotacijų struktūras iš PAGE XML, kad valdyti interaktyvias IIIF peržiūros programas (pvz., Mirador arba Universal Viewer) su tiesioginiais naršyklės tekstiniais sluoksniais.</li>
<li><strong>Moksliniams leidiniams ir paleografiniams tyrimams:</strong>
Sukurkite savo pagrindinę tiesą PAGE XML formatu, atlikite atpažinimą ir perkelkite išvestį per automatizuotą konverterį, kad sukurtumėte <strong>TEI-XML</strong> redagavimo žymėjimui.</li>
</ol>
<p>Suderindami šių formatų struktūrines galimybes su jūsų šaltinio medžiagos paleografiniais reikalavimais, užtikrinate, kad kiekvienas brūkšnys, santrumpa ir istorinė niuansas išliktų iššifruojami šimtmečius ateityje.</p>
<h2 id="dažnai-užduodami-klausimai-duk">Dažnai užduodami klausimai (DUK)</h2>
<p><strong>K1. Koks yra pagrindinis skirtumas tarp standartinio OCR ir HTR?</strong> OCR atpažįsta nuoseklią mašininiu spausdinimu tipografiją, o HTR (rankraščio teksto atpažinimas) naudoja gilias neuronines tinklus, kad iššifruotų nuolatinį, kintamą žmogaus rankraštį ir kreivus bazinius linijas.</p>
<p><strong>K2. Ar Tesseract OCR gali generuoti PAGE XML arba ALTO išvestį istoriniams dokumentams?</strong> Taip, Tesseract gali generuoti natūrinį ALTO XML ir hOCR išvestį, o trečiųjų šalių apvalkalo programos gali konvertuoti šiuos rezultatus į PAGE XML.</p>
<p><strong>K3. Kodėl bazinės linijos yra svarbesnės nei ribų dėžutės rankraščio teksto transkripcijoje?</strong> Bazinės linijos seka natūralią, banginę žmogaus rašymo liniją, leidžiančią programinei įrangai atskirti persidengiančius viršutinius ir apatinus ženklus, kurie susiduria kietose ribų dėžutėse.</p>
<p><strong>Q4. Kaip IIIF standartas sąveikauja su šiais OCR failų formatais?</strong> IIIF teikia aukštos raiškos vaizdus per atviras žiniatinklio API, o tokie formatai kaip ALTO arba PAGE XML suteikia koordinatų duomenis, kuriuos galima konvertuoti į IIIF turinio paieškos anotacijas.</p>
<p><strong>Q5. Kuris failo formatas yra lengviausias tiesiogiai konvertuoti į ieškomą PDF?</strong> Tiek hOCR, tiek ALTO XML gali būti susieti su originaliomis puslapio nuotraukomis, kad būtų sukurtas ieškomas dviejų sluoksnių PDF failas naudojant įrankius, pvz., OCRmyPDF.</p>
<h2 id="taip-pat-žiūrėkite">Taip pat žiūrėkite</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Hibridinis monstras? Originalių duomenų įterpimas į jūsų OCR</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">OCR failų formatų supratimas – HOCR vs ALTO vs PDF/A paaiškinta</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Kuo skiriasi PDF ir FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Kam naudojamas FDF? Supratimas apie formų duomenų formato paskirtį</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: Kurį naudoti ir kada?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
