<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>OCR formāti on File Format Blog</title>
    <link>https://blog.fileformat.com/lv/tag/ocr-form%C4%81ti/</link>
    <description>Recent content in OCR formāti on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>lv</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/lv/tag/ocr-form%C4%81ti/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Kā izvēlēties pareizo faila formātu rokraksta teksta atpazīšanai (HTR)</title>
      <link>https://blog.fileformat.com/lv/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/lv/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Atklājiet labākos OCR un HTR failu formātus vēsturiskajiem rakstiem un rokraksta arhīviem, salīdzinot ALTO, PAGE XML, hOCR un TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Pēdējoreiz atjaunināts</strong>: 20 Aug, 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="ocr-failu-formāti-vēsturiskajiem-un-rakstītajiem-dokumentiem">OCR failu formāti vēsturiskajiem un rakstītajiem dokumentiem</h2>
<p>Digitālizācijas laikā kultūras mantojuma saglabāšana ir ieguvusi renesansi. Kamēr agrīnie optiskās rakstzīmju atpazīšanas (OCR) sistēmas tika izstrādātas, lai apstrādātu nevainojamu, mašīnapdrukātu divdesmitā gadsimta dokumentāciju, mūsdienu kultūras mantojuma iestādes saskaras ar daudz sarežģītāku, bagātāku izaicinājumu: viduslaiku rokrakstiem, XIX gadsimta kursīva sarakstēm, trausliem apgaismotajiem folijiem un gadsimtu vecām reģistrām.</p>
<p>Vēsturisko dokumentu transkribēšana vairs nav tikai par vienkārša ASCII teksta izguvi. Tas prasa <strong>kontekstu</strong>—fizisko ģeometriju, bāzes līnijas līknes, caurspīdīguma korekcijas, piezīmes, saīsinājumus un paleogrāfisko nenoteiktību. Šī specializētā joma, bieži klasificēta kā Rokas rakstības teksta atpazīšana (HTR), lielā mērā atkarīga no faila formāta, ko izmanto attēlu koordinātu un teksta slāņu glabāšanai un apmaiņai.</p>
<p>Neatbilstoša shēmas izvēle var noņemt svarīgus bāzes datus, pārtraukt saskaņošanu ar IIIF (International Image Interoperability Framework) manifestiem vai neļaut ilgtermiņa digitālo saglabāšanu. Šeit ir galīgs ceļvedis par vadošajiem OCR un HTR failu formātiem vēsturiskajiem dokumentiem, to struktūras stiprajām pusēm un to, kā noteikt pareizo izvēli jūsu arhīva caurulē.</p>
<h2 id="vēsturiskā-dilema-kāpēc-vienkāršais-teksts15-un-standarta-pdf1-neizdodas">Vēsturiskā dilema: Kāpēc <a href="https//docs.fileformat.com/word-processing/txt/">Vienkāršais teksts</a> un Standarta <a href="https://docs.fileformat.com/pdf/">PDF</a> neizdodas</h2>
<p>Mašīnas drukāts OCR bieži izvada vienkāršus <code>.txt</code> failus vai &ldquo;sandwich&rdquo; PDF failus ar slēptiem teksta slāņiem zem skenējuma. Vēsturiskajiem manuskriptam un kursīvai rokrakstam šie iznākumi neizdodas trīs galveno iemeslu dēļ:</p>
<ol>
<li><strong>Nelineārs teksts un sarežģīti izkārtojumi:</strong> Vēsturiskie rakstnieki neievēroja kārtīgus taisnstūra režģus. Teksts plūst uz malām, aptin apgaismotos iniciāļus, izšūjas starp ievietotajām starplīnijas korekcijām vai skrien vertikāli gar grāmatas mugurkaulu.</li>
<li><strong>Izliektas un slīpas bāzes līnijas:</strong> Rokraksts reti seko stingrai horizontālai asij. HTR dzinēji, piemēram, Transkribus, Kraken un eScriptorium, paļaujas uz daudzstūru bāzes līnijām, nevis uz robežkasti, lai interpretētu ligatūru bagātus rakstus.</li>
<li><strong>Paleogrāfiskā sarežģītība un metadati:</strong> Arhīvu pētījumiem ir jāseko saīsinājumiem, vēsturiskajām pareizrakstības variācijām, bojātām lasījumiem un rindas līmeņa pārliecības punktiem. Standarta dokumentu formāti izmet šo smalkumu.</li>
</ol>
<p>Lai saglabātu ticamību oriģinālajam artefaktam, arhīvu kopiena paļaujas uz strukturētām XML shēmām, kas izstrādātas, lai saglabātu izkārtojuma topoloģiju kopā ar transkribēto tekstu.</p>
<h2 id="1-page-xml-zelta-standarts-rakstītā-teksta-atpazīšanai-htr">1. PAGE XML: Zelta standarts rakstītā teksta atpazīšanai (HTR)</h2>
<p>Izstrādāts PRImA (Pattern Recognition &amp; Image Analysis) pētniecības laboratorijā, <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) tiek plaši uzskatīts par modernāko formātu rokraksta teksta atpazīšanai un uzlabotai izkārtojuma analīzei.</p>
<h3 id="pamatarchitektūra">Pamatarchitektūra</h3>
<p>PAGE XML uztver fizisko dokumentu kā hierarhisku struktūru:</p>
<ul>
<li><code>PcGts</code> (Sakne)
<ul>
<li><code>Page</code> (Attēla dimensijas un kopējā lasīšanas secība)
<ul>
<li><code>TextRegion</code> (Rindkopas, virsraksti, malas piezīmes, atslēgvārdi)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Poligona koordinātas ap līniju)</li>
<li><code>Baseline</code> (Punktu sērija, kas seko patiesajai rakstības bāzes līnijai)</li>
<li><code>TextEquiv</code> (Atpazītais teksts, ar izvēles pārliecības metriku)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="kāpēc-tas-izceļas-vēsturiskajos-manuskriptos">Kāpēc tas izceļas vēsturiskajos manuskriptos</h3>
<ul>
<li><strong>Poligona un Polilīnijas Precizitāte:</strong> Tā vietā, lai piespiestu rakstzīmes taisnstūrveida robežlodziņos, PAGE XML izmanto daudzpunktu poligona robežas un nepārtrauktas bāzes līnijas. Tas novērš pārklājošos kursīva augšējus un apakšējos elementus, kas traucē segmentēšanu.</li>
<li><strong>Granulāri Strukturālie Veidi:</strong> Reģioni var tikt precīzi klasificēti (piem., <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Plašs programmatūras ekosistēma:</strong> Tā kalpo kā galvenais iekšējais un eksporta shēma vadošajām HTR platformām, piemēram, <strong>Transkribus</strong>, <strong>eScriptorium</strong> un <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-bibliotēku-un-arhīvu-spēks">2. ALTO XML: Bibliotēku un arhīvu spēks</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> ir atvērtā XML standarts, ko uztur Kongresa bibliotēka, un plaši pieņem nacionālās bibliotēkas, tostarp Bibliothèque nationale de France (BnF) un Britu bibliotēka.</p>
<h3 id="pamatarchitektūra-1">Pamatarchitektūra</h3>
<p>ALTO strukturē izkārtojumu hierarhiskā veidā no <code>Page</code> līdz <code>PrintSpace</code>, tad <code>TextBlock</code>, <code>TextLine</code> un <code>String</code> (atsevišķi vārdi vai tokeni). To bieži pakot iekš <strong>METS</strong> (Metadata Encoding and Transmission Standard) ietvara, lai saistītu strukturālos metadatus ar augstas izšķirtspējas galvenajiem attēliem.</p>
<h3 id="galvenās-stiprās-puses-un-lietošanas-gadījumi">Galvenās stiprās puses un lietošanas gadījumi</h3>
<ul>
<li><strong>Masveida digitalizācijas darba plūsmas:</strong> ALTO tika izstrādāts, domājot par rūpnieciskā mēroga avīžu un grāmatu digitalizāciju. Tas skaidri kodē fonta atribūtus, vārda līmeņa koordinātas, rakstzīmju pārliecību un atstarpes.</li>
<li><strong>Mūsdienīgs HTR atbalsts (ALTO 4):</strong> Agrākas ALTO versijas lielā mērā balstījās uz taisnstūra koordinātām (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Tomēr, sākot ar <strong>ALTO versiju 4</strong>, shēma ieviesa <code>&lt;Shape&gt;</code> poligonus un polilīniju bāzes līnijas, aizverot funkcionālo plaisu ar PAGE XML rakstītām materiāliem.</li>
<li><strong>Ilgtermiņa saglabāšana:</strong> Tā kā tas ir oficiāls standarts, ko atbalsta starptautiskas bibliotēku konsorciji, ALTO garantē ilgtermiņa stabilitāti un arhīva līmeņa atpakaļējo saderību.</li>
</ul>
<h2 id="3-hocr-tīmekļa-pirmais-viegls-standarts">3. hOCR: Tīmekļa-pirmais, viegls standarts</h2>
<p>Izveidots Thomas Breuel, <strong>hOCR</strong> pieņem pragmatisku pieeju: nevis izveidojot pilnīgi jaunu XML shēmu, tas iekļauj izkārtojuma un transkripcijas metadatus tieši semantiskajā HTML/XHTML, izmantojot mikroformātus un klases atribūtus.</p>
<h3 id="tipisks-sintakses-piemērs">Tipisks sintakses piemērs</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="priekšrocības-un-trūkumi-vēsturiskajiem-materiāliem">Priekšrocības un trūkumi vēsturiskajiem materiāliem</h3>
<ul>
<li><strong>Priekšrocības:</strong> Pārlūkprogrammas var to attēlot iebūvēti. To ir viegli pārveidot, izmantojot vienkāršu CSS un JavaScript, un tas ir noklusējuma strukturētais eksporta formāts dzinējiem, piemēram, <strong>Tesseract</strong>.</li>
<li><strong>Trūkumi:</strong> Iebūvētais atbalsts sarežģītām, brīvi veidotām daudzpunktu bāzes līkņu krivām ir ierobežots. Lai gan tas ir praktisks agrīnām drukas darbiem (inkunabulas vai tīriem plakātiem), hOCR saskaras ar grūtībām neviendabīgos rokrakstu izkārtojumos un daudzslāņainajās marginalijās.</li>
</ul>
<h2 id="4-tei-xml-akadēmiskā-un-digitālo-humanitāru-standarts">4. TEI-XML: Akadēmiskā un digitālo humanitāru standarts</h2>
<p><strong>Text Encoding Initiative (TEI)</strong> formāts nav stingri OCR dzinēja izvades formāts; tas gan ir vadošais standarts kritiskajām digitālajām izdevumiem un akadēmiskai literāro un vēsturisko tekstu pārstāvībai.</p>
<h3 id="ocrhtr-savienošana-ar-tei">OCR/HTR savienošana ar TEI</h3>
<p>Mūsdienu caurules reti apstājas pie neapstrādātas rakstzīmju atpazīšanas. Zinātnieki izmanto rīkus, piemēram, <strong>Transkribus TEI Exporter</strong> vai automatizētas XSLT caurules, lai pārvērstu PAGE XML vai ALTO failus TEI atbilstošā XML:</p>
<ul>
<li>Saīsinājumi tiek paplašināti (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Dzēšanas, pievienošanas un rakstnieku rokas tiek formāli klasificētas (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Izkārtojuma dati tiek saglabāti kopā ar literāro analīzi, izmantojot <code>&lt;facsimile&gt;</code> un <code>&lt;surface&gt;</code> elementus.</li>
</ul>
<p>Ja jūsu vēsturiskais projekts mērķē izveidot interaktīvu kritisko izdevumu vai semantiski meklējamu akadēmisku arhīvu, OCR/HTR datu pārveidošana uz TEI-XML bieži ir nepieciešamais galīgais solis.</p>
<h2 id="salīdzinošā-matrica-ocrhtr-formāti-uz-skatiena">Salīdzinošā matrica: OCR/HTR formāti uz skatiena</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Īpašība / Kritērijs</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Primārais domēns</strong></td>
<td style="text-align:left">Rokas rakstība HTR &amp; rokopisi</td>
<td style="text-align:left">Masveida bibliotēku digitalizācija</td>
<td style="text-align:left">Tīmekļa OCR &amp; viegla meklēšana</td>
<td style="text-align:left">Zinātniskās kritiskās izdevumi</td>
</tr>
<tr>
<td style="text-align:left"><strong>Pamata atbalsts</strong></td>
<td style="text-align:left">Dzimtās, daudzpunktu līnijas</td>
<td style="text-align:left">Atbalstīts (kopš v4.0)</td>
<td style="text-align:left">Pamata (slīpums/novirze)</td>
<td style="text-align:left">Izmantojot faksimīles kartēšanu</td>
</tr>
<tr>
<td style="text-align:left"><strong>Neregulāri daudzstūri</strong></td>
<td style="text-align:left">Pilns</td>
<td style="text-align:left">Pilns</td>
<td style="text-align:left">Ierobežots</td>
<td style="text-align:left">Izmantojot koordinātu elementus</td>
</tr>
<tr>
<td style="text-align:left"><strong>Rīku ekosistēma</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, tīmekļa skatītāji</td>
<td style="text-align:left">Oxygen, TEI publicētājs</td>
</tr>
<tr>
<td style="text-align:left"><strong>Standartizācijas institūcija</strong></td>
<td style="text-align:left">PRImA grupa / Open</td>
<td style="text-align:left">Kongresa bibliotēka</td>
<td style="text-align:left">Kopienas specifikācija</td>
<td style="text-align:left">TEI konsorcijs</td>
</tr>
</tbody>
</table>
<h2 id="praktiski-ieteikumi-izvēloties-jūsu-arhīva-cauruļvadu">Praktiski ieteikumi: Izvēloties jūsu arhīva cauruļvadu</h2>
<p>Lai izveidotu efektīvu, nākotnei drošu digitalizācijas cauruļvadu:</p>
<ol>
<li><strong>Tikai tīri rokraksta manuskripti un arhīvi:</strong>
Standardizējiet savu transkripciju un izkārtojuma izvilkumu, izmantojot <strong>PAGE XML</strong>. Tā bāzes līnijas aprēķins un daudzstūra kontūru veidošana apstrādā nestandarta rakstības rokas ar minimālu datu zudumu.</li>
<li><strong>Lielapjoma bibliotēkām un jauktām kolekcijām:</strong>
Izvēlieties <strong>ALTO XML (v4.2 vai jaunāku)</strong> kopā ar <strong>METS</strong>. Tas nodrošina nevainojamu integrāciju ar standarta digitālo krātuves arhitektūrām un digitālo aktīvu pārvaldības sistēmām (DAMS).</li>
<li><strong>Tīmekļa prezentācijai un pilna teksta meklēšanas indeksiem:</strong>
Izmantojiet <strong>hOCR</strong> vai izveidojiet vieglas GeoJSON/Tīmekļa anotācijas struktūras no PAGE XML, lai vadītu interaktīvus IIIF skatītājus (piemēram, Mirador vai Universal Viewer) ar tiešsaistes pārlūkprogrammas teksta pārklājumiem.</li>
<li><strong>Zinātniskajām izdevumiem un paleogrāfijas pētījumiem:</strong>
Izveidojiet savu patieso datus PAGE XML formātā, veiciet atpazīšanu un caurvadiet rezultātu caur automatizētu pārveidotāju, lai ģenerētu <strong>TEI-XML</strong> redakcijas marķēšanai.</li>
</ol>
<p>Saskaņojot šo formātu struktūrvērtības ar jūsu avota materiāla paleogrāfiskajām prasībām, jūs nodrošināt, ka katra svītra, katrs saīsinājums un katra vēsturiskā niansa paliek atpazīstama nākamajām gadsimtiem.</p>
<h2 id="biežāk-uzdotie-jautājumi-buj">Biežāk uzdotie jautājumi (BUJ)</h2>
<p><strong>J1. Kāda ir būtiskā atšķirība starp standarta OCR un HTR?</strong> OCR atpazīst konsekventu mašīnas drukātu tipogrāfiju, savukārt HTR (Rokas raksta atpazīšana) izmanto dziļus neironu tīklus, lai atkodētu nepārtrauktu, mainīgu cilvēka rakstību un izliekotas bāzes līnijas.</p>
<p><strong>J2. Vai Tesseract OCR var ģenerēt PAGE XML vai ALTO izvadi vēsturiskajiem dokumentiem?</strong> Jā, Tesseract var izveidot iebūvēto ALTO XML un hOCR izvadi, un trešo pušu pārklājumi var pārvērst šos rezultātus PAGE XML formātā.</p>
<p><strong>J3. Kāpēc bāzes līnijas ir svarīgākas nekā robežkastiņas rokraksta teksta transkripcijā?</strong> Bāzes līnijas sekot dabiski, viļņojošai cilvēka rakstības līnijai, ļaujot programmatūrai atdalīt pārklājošos augšējos un apakšējos stieņus, kas saduras stingrās robežkastiņās.</p>
<p><strong>Q4. Kā IIIF standarts mijiedarbojas ar šiem OCR failu formātiem?</strong> IIIF nodrošina augstas izšķirtspējas attēlus caur atvērtām tīmekļa API, kamēr tādi formāti kā ALTO vai PAGE XML sniedz koordinātu datus, kurus var pārveidot par IIIF Content Search anotācijām.</p>
<p><strong>Q5. Kurš faila formāts ir visvieglāk tieši pārveidot meklējamu PDF?</strong> Gan hOCR, gan ALTO XML var tikt savienoti ar oriģinālajiem lapas attēliem, lai izveidotu meklējamus divslāņu PDF failus, izmantojot tādus rīkus kā OCRmyPDF.</p>
<h2 id="skatīt-arī">Skatīt arī</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Hibrīdbrieslis? Oriģinālo datu iegulšana jūsu OCR</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Izpratne par OCR failu formātiem - HOCR vs ALTO vs PDF/A paskaidrots</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Kāda ir atšķirība starp PDF un FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Kādam nolūkam tiek izmantots FDF? Izpratne par formu datu formāta mērķi</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: kuru vajadzētu izmantot un kad?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
