<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Formáty OCR on File Format Blog</title>
    <link>https://blog.fileformat.com/cs/tag/form%C3%A1ty-ocr/</link>
    <description>Recent content in Formáty OCR on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>cs</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/cs/tag/form%C3%A1ty-ocr/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Jak vybrat správný formát souboru pro rozpoznávání ručně psaného textu (HTR)</title>
      <link>https://blog.fileformat.com/cs/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/cs/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Objevte nejlepší formáty souborů OCR a HTR pro historické rukopisy a ručně psané archivy, porovnáním ALTO, PAGE XML, hOCR a TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Poslední aktualizace</strong>: 20 Aug, 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="formáty-souborů-ocr-pro-historické-a-ručně-psané-dokumenty">Formáty souborů OCR pro historické a ručně psané dokumenty</h2>
<p>Zachování kulturního dědictví prostřednictvím digitalizace vstoupilo do renesance. Zatímco první systémy optického rozpoznávání znaků (OCR) byly navrženy pro zpracování čistých, strojově tištěných dokumentů ze dvacátého století, moderní instituce kulturního dědictví čelí mnohem chaotičtějšímu a bohatšímu výzvě: středověkým rukopisům, devatenáctému století psané kurzívní korespondenci, křehkým iluminovaným listům a stoletým rejstříkům.</p>
<p>Přepisování historických dokumentů již není jen o získávání prostého ASCII textu. Vyžaduje zachycení <strong>kontextu</strong> — fyzické geometrie stránky, křivek základní čáry, korekcí proprosvítání, marginalií, zkratek a paleografické nejistoty. Toto specializované odvětví, často zařazované pod rozpoznávání ručně psaného textu (Handwritten Text Recognition (HTR)), silně závisí na formátu souboru používaném k ukládání a výměně jak obrazových souřadnic, tak textových vrstev.</p>
<p>Výběr nesprávného schématu může odebrat důležitá data základní čáry, narušit sladění s manifesty IIIF (International Image Interoperability Framework) nebo zabránit dlouhodobé digitální archivaci. Zde je definitivní průvodce předními formáty souborů OCR a HTR pro historické dokumenty, jejich strukturálními přednostmi a tím, jak určit správnou volbu pro váš archivní pipeline.</p>
<h2 id="historické-dilema-proč-prostý-text15-a-standardní-pdf-soubory1-selhávají">Historické dilema: Proč <a href="https//docs.fileformat.com/word-processing/txt/">prostý text</a> a standardní <a href="https://docs.fileformat.com/pdf/">PDF soubory</a> selhávají</h2>
<p>Strojově tištěný OCR často vytváří jednoduché soubory <code>.txt</code> nebo &ldquo;sandwich&rdquo; PDF s skrytými textovými vrstvami pod skenem. Pro historické rukopisy a kurzívní ruční písmo tyto výstupy selhávají ze tří hlavních důvodů:</p>
<ol>
<li><strong>Nelineární text a složité rozvržení:</strong> Historické písaře se nedrželi úhledných pravoúhlých mřížek. Text se rozlévá do okrajů, obtéká iluminované iniciály, proplétá se mezi vloženými interlineárními opravami nebo běží vertikálně podél hřbetu.</li>
<li><strong>Zakřivené a šikmé základní linie:</strong> Kurzívní psaní zřídka následuje pevnou horizontální osu. HTR enginy jako Transkribus, Kraken a eScriptorium se spoléhají na polyline základní linie místo ohraničujících rámečků při interpretaci skriptů bohatých na ligatury.</li>
<li><strong>Paleografická složitost a metadata:</strong> Archivní výzkum vyžaduje sledování zkratek, historických pravopisných variant, poškozených čtení a skóre důvěry na úrovni řádku. Standardní formáty dokumentů tuto granularitu zahoďují.</li>
</ol>
<p>Aby zachovala věrnost originálnímu artefaktu, archivní komunita spoléhá na strukturované XML schémata navržená k zachování topologie rozvržení spolu s přepsaným textem.</p>
<h2 id="1-page-xml-zlatý-standard-pro-rozpoznávání-ručně-psaného-textu-htr">1. PAGE XML: Zlatý standard pro rozpoznávání ručně psaného textu (HTR)</h2>
<p>Vyvinutý výzkumnou laboratoří PRImA (Pattern Recognition &amp; Image Analysis), <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) je široce považován za špičkový formát pro rozpoznávání ručně psaného textu a pokročilou analýzu rozvržení.</p>
<h3 id="základní-architektura">Základní architektura</h3>
<p>PAGE XML zachází s fyzickým dokumentem jako s hierarchickou strukturou:</p>
<ul>
<li><code>PcGts</code> (Kořen)
<ul>
<li><code>Page</code> (Rozměry obrázku a celkový pořad čtení)
<ul>
<li><code>TextRegion</code> (Odstavce, nadpisy, okrajové poznámky, slova na konci řádku)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Souřadnice polygonu kolem řádku)</li>
<li><code>Baseline</code> (Série bodů následujících skutečnou základní čáru písma)</li>
<li><code>TextEquiv</code> (Rozpoznaný text, s volitelnými metrikami důvěryhodnosti)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="proč-vyniká-u-historických-rukopisů">Proč vyniká u historických rukopisů</h3>
<ul>
<li><strong>Přesnost polygonů a polylinií:</strong> Místo nucení znaků do obdélníkových ohraničujících rámečků PAGE XML používá vícebodové polygonové hranice a kontinuální základní čáry. To zabraňuje překrývání kurzivních výčlenků a podstupů, které by rušily segmentaci.</li>
<li><strong>Detailní typy struktur:</strong> Oblasti lze přesně klasifikovat (např. <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Široký softwarový ekosystém:</strong> Slouží jako primární interní a exportní schéma pro vlajkové platformy HTR, jako jsou <strong>Transkribus</strong>, <strong>eScriptorium</strong> a <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-knihovní-a-archivní-mocnost">2. ALTO XML: Knihovní a archivní mocnost</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> je otevřený XML standard spravovaný Kongresovou knihovnou a široce přijatý národními knihovnami, včetně Bibliothèque nationale de France (BnF) a British Library.</p>
<h3 id="základní-architektura-1">Základní architektura</h3>
<p>ALTO strukturuje rozvržení hierarchicky od <code>Page</code> po <code>PrintSpace</code>, dále k <code>TextBlock</code>, <code>TextLine</code> a <code>String</code> (jednotlivá slova nebo tokeny). Často je zabalený do obalu <strong>METS</strong> (Metadata Encoding and Transmission Standard), aby spojil strukturální metadata s vysoce rozlišenými master obrazy.</p>
<h3 id="klíčové-silné-stránky-a-případy-použití">Klíčové silné stránky a případy použití</h3>
<ul>
<li><strong>Pracovní postupy hromadné digitalizace:</strong> ALTO bylo navrženo s ohledem na průmyslovou digitalizaci novin a knih. Čistě kóduje atributy fontů, souřadnice na úrovni slov, důvěryhodnost znaků a mezery.</li>
<li><strong>Moderní podpora HTR (ALTO 4):</strong> Starší verze ALTO se silně spoléhaly na obdélníkové souřadnice (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Nicméně od <strong>verze ALTO 4</strong> schéma zavedlo polygonové <code>&lt;Shape&gt;</code> a polylineové základní čáry, čímž uzavřelo funkční mezeru s PAGE XML pro ručně psané materiály.</li>
<li><strong>Dlouhodobá archivace:</strong> Protože se jedná o oficiální standard podporovaný mezinárodními knihovními konsorcii, ALTO zaručuje dlouhodobou stabilitu a archivní úroveň zpětné kompatibility.</li>
</ul>
<h2 id="3-hocr-webprvní-lehký-standard">3. hOCR: Web‑první, lehký standard</h2>
<p>Vytvořeno Thomasem Breuelem, <strong>hOCR</strong> přistupuje pragmaticky: místo vytváření zcela nového XML schématu vkládá metadata rozvržení a transkripce přímo do sémantického HTML/XHTML pomocí mikroformátů a atributů třídy.</p>
<h3 id="typický-příklad-syntaxe">Typický příklad syntaxe</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="výhody-a-nevýhody-historických-materiálů">Výhody a nevýhody historických materiálů</h3>
<ul>
<li><strong>Výhody:</strong> Prohlížeče jej dokážou nativně vykreslit. Lze jej snadno transformovat pomocí čistého CSS a JavaScriptu a je výchozím strukturovaným exportním formátem pro enginy jako <strong>Tesseract</strong>.</li>
<li><strong>Nevýhody:</strong> Nativní podpora pro složité, volně tvarované křivky základních čar s více body je omezená. Zatímco je praktické pro rané tištěné práce (inkunabuly nebo čisté brožury), hOCR má potíže s nepravidelným rozvržením rukopisů a vícevrstvými marginaliemi.</li>
</ul>
<h2 id="4-tei-xml-akademický-a-digitální-humanitní-referenční-bod">4. TEI-XML: Akademický a digitální humanitní referenční bod</h2>
<p>Formát <strong>Text Encoding Initiative (TEI)</strong> není striktně výstupním formátem OCR enginu; spíše je předním standardem pro kritické digitální edice a vědeckou reprezentaci literárních a historických textů.</p>
<h3 id="propojení-ocrhtr-s-tei">Propojení OCR/HTR s TEI</h3>
<p>Moderní pipeliney se zřídka zastavují u pouhého rozpoznání znaků. Vědci používají nástroje jako <strong>Transkribus TEI Exporter</strong> nebo automatizované XSLT pipeline k převodu PAGE XML nebo ALTO souborů do TEI‑kompatibilního XML:</p>
<ul>
<li>Zkratky jsou rozšířeny (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Smazání, doplnění a rukopisné ruce jsou formálně klasifikovány (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Data o rozložení jsou zachována vedle literární analýzy pomocí elementů <code>&lt;facsimile&gt;</code> a <code>&lt;surface&gt;</code>.</li>
</ul>
<p>Pokud váš historický projekt cílí na vytvoření interaktivní kritické edice nebo sémanticky prohledávatelného vědeckého archivu, převod vašich OCR/HTR dat do TEI‑XML je často nezbytným konečným krokem.</p>
<h2 id="komparativní-matice-formáty-ocrhtr-na-první-pohled">Komparativní matice: Formáty OCR/HTR na první pohled</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Vlastnost / Kritérium</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Primární doména</strong></td>
<td style="text-align:left">Kurzívní HTR &amp; rukopisy</td>
<td style="text-align:left">Masová digitalizace knihoven</td>
<td style="text-align:left">Web OCR &amp; lehké vyhledávání</td>
<td style="text-align:left">Vědecké kritické edice</td>
</tr>
<tr>
<td style="text-align:left"><strong>Základní podpora</strong></td>
<td style="text-align:left">Nativní, vícebodové polyliny</td>
<td style="text-align:left">Podporováno (od verze 4.0)</td>
<td style="text-align:left">Základní (sklon/posun)</td>
<td style="text-align:left">Pomocí facsimile mapování</td>
</tr>
<tr>
<td style="text-align:left"><strong>Nepravidelné polygony</strong></td>
<td style="text-align:left">Plný</td>
<td style="text-align:left">Plný</td>
<td style="text-align:left">Omezený</td>
<td style="text-align:left">Pomocí souřadnicových prvků</td>
</tr>
<tr>
<td style="text-align:left"><strong>Ekosystém nástrojů</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, webové prohlížeče</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Standardizační orgán</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Kongresová knihovna</td>
<td style="text-align:left">Komunitní specifikace</td>
<td style="text-align:left">Konsorcium TEI</td>
</tr>
</tbody>
</table>
<h2 id="praktická-doporučení-výběr-vašeho-archivního-pracovního-postupu">Praktická doporučení: Výběr vašeho archivního pracovního postupu</h2>
<p>Pro vytvoření efektivního, budoucnosti odolného digitalizačního řetězce:</p>
<ol>
<li><strong>Pro čisté rukopisné rukopisy a archivy:</strong>
Standardizujte svůj přepis a extrakci rozvržení na <strong>PAGE XML</strong>. Jeho výpočet základní linie a polygonové obrysování zvládá neobvyklé rukopisné styly s minimální ztrátou dat.</li>
<li><strong>Pro rozsáhlé knihovny a smíšené sbírky:</strong>
Zvolte <strong>ALTO XML (v4.2 nebo vyšší)</strong> v kombinaci s <strong>METS</strong>. To zaručuje bezproblémovou integraci do standardních architektur digitálních repozitářů a systémů pro správu digitálních aktiv (DAMS).</li>
<li><strong>Pro webovou prezentaci a indexy full-textového vyhledávání:</strong>
Použijte <strong>hOCR</strong> nebo odvoďte lehké struktury GeoJSON/Web Annotation z PAGE XML k ovládání interaktivních IIIF prohlížečů (např. Mirador nebo Universal Viewer) s živými textovými překryvy v prohlížeči.</li>
<li><strong>Pro vědecké edice a paleografický výzkum:</strong>
Vytvořte svůj ground truth v PAGE XML, proveďte rozpoznání a přeneste výstup přes automatizovaný konvertor k vytvoření <strong>TEI-XML</strong> pro editační značkování.</li>
</ol>
<p>Při sladění strukturálních možností těchto formátů s paleografickými požadavky vašeho zdrojového materiálu zajistíte, že každý tah, zkratka a historický odstín zůstane čitelný po staletí.</p>
<h2 id="často-kladené-otázky-faq">Často kladené otázky (FAQ)</h2>
<p><strong>Q1. Jaký je základní rozdíl mezi standardním OCR a HTR?</strong> OCR rozpoznává konzistentní strojově tištěnou typografii, zatímco HTR (rozpoznávání ručně psaného textu) využívá hluboké neuronové sítě k dekódování kontinuálního, proměnlivého lidského rukopisu a zakřivených základních čar.</p>
<p><strong>Q2. Dokáže Tesseract OCR vytvářet PAGE XML nebo ALTO výstup pro historické dokumenty?</strong> Ano, Tesseract může generovat nativní ALTO XML a hOCR výstup a třetí strany mohou tyto výsledky převést do PAGE XML.</p>
<p><strong>Q3. Proč jsou základní čáry důležitější než ohraničující rámečky při transkripci ručně psaného textu?</strong> Základní čáry sledují přirozenou, vlnitou linii lidského psaní, což umožňuje softwaru oddělit překrývající se výšky a spody písmen, které se střetávají uvnitř pevných ohraničujících rámečků.</p>
<p><strong>Q4. Jak standard IIIF interaguje s těmito formáty OCR souborů?</strong> IIIF poskytuje vysoce rozlišené obrázky prostřednictvím otevřených webových API, zatímco formáty jako ALTO nebo PAGE XML poskytují souřadnicová data, která lze převést na anotace IIIF Content Search.</p>
<p><strong>Q5. Který formát souboru je nejjednodušší přímo převést na prohledávatelný PDF?</strong> Jak hOCR, tak ALTO XML lze spojit s originálními obrázky stránek a vytvořit prohledávatelné PDF soubory s dvojitou vrstvou pomocí nástrojů jako OCRmyPDF.</p>
<h2 id="viz-také">Viz také</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 – Hybridní monstrum? Vkládání originálních dat do vašeho OCR</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Pochopení formátů OCR souborů – HOCR vs ALTO vs PDF/A vysvětleno</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Jaký je rozdíl mezi PDF a FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">K čemu se používá FDF? Pochopení účelu formátu dat formulářů</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: Který byste měli použít a kdy?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
