<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Rozpoznawanie tekstu odręcznego on File Format Blog</title>
    <link>https://blog.fileformat.com/pl/tag/rozpoznawanie-tekstu-odr%C4%99cznego/</link>
    <description>Recent content in Rozpoznawanie tekstu odręcznego on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>pl</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/pl/tag/rozpoznawanie-tekstu-odr%C4%99cznego/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Jak wybrać odpowiedni format pliku dla rozpoznawania tekstu odręcznego (HTR)</title>
      <link>https://blog.fileformat.com/pl/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/pl/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Odkryj najlepsze formaty plików OCR i HTR dla historycznych rękopisów i archiwów odręcznych, porównując ALTO, PAGE XML, hOCR i TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Ostatnia aktualizacja</strong>: 20 sierpnia 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="formaty-plików-ocr-dla-dokumentów-historycznych-i-odręcznych">Formaty plików OCR dla dokumentów historycznych i odręcznych</h2>
<p>Zachowanie dziedzictwa kulturowego poprzez digitalizację wkroczyło w renesans. Podczas gdy wczesne systemy rozpoznawania znaków optycznych (OCR) były projektowane do przetwarzania nieskazitelnych, maszynowo drukowanych dokumentów z XX wieku, współczesne instytucje dziedzictwa kulturowego stoją przed znacznie bardziej złożonym i bogatym wyzwaniem: średniowiecznymi rękopisami, XIX‑wieczną korespondencją pisma odręcznego, kruchemi iluminowanymi foliosami oraz stulecznymi rejestrami.</p>
<p>Transkrypcja dokumentów historycznych nie polega już tylko na wyodrębnianiu zwykłego tekstu ASCII. Wymaga uchwycenia <strong>kontekstu</strong>—fizycznej geometrii strony, krzywych linii bazowych, korekt przenikania atramentu, marginaliów, skrótów oraz niepewności paleograficznej. Ta specjalistyczna dziedzina, często klasyfikowana jako Rozpoznawanie Ręcznego Tekstu (HTR), zależy w dużym stopniu od formatu pliku używanego do przechowywania i wymiany zarówno współrzędnych obrazu, jak i warstw tekstowych.</p>
<p>Wybranie niewłaściwego schematu może usunąć istotne dane linii bazowych, zakłócić dopasowanie do manifestów IIIF (International Image Interoperability Framework) lub uniemożliwić długoterminowe zachowanie cyfrowe. Oto ostateczny przewodnik po wiodących formatach plików OCR i HTR dla dokumentów historycznych, ich mocnych stronach strukturalnych oraz o tym, jak określić właściwy wybór dla Twojego potoku archiwizacyjnego.</p>
<h2 id="dylemat-historyczny-dlaczego-zwykły-tekst15-i-standardowe-pdf-y1-zawodzą">Dylemat historyczny: dlaczego <a href="https//docs.fileformat.com/word-processing/txt/">Zwykły tekst</a> i standardowe <a href="https://docs.fileformat.com/pdf/">PDF-y</a> zawodzą</h2>
<p>OCR maszynowo drukowane często generuje proste pliki <code>.txt</code> lub &ldquo;sandwich&rdquo; PDF‑y z ukrytymi warstwami tekstu pod skanem. Dla historycznych rękopisów i pisma kursywą, te wyniki zawodzą z trzech podstawowych powodów:</p>
<ol>
<li><strong>Tekst nieliniowy i złożone układy:</strong> Historyczni skrybowie nie trzymali się schludnych prostokątnych siatek. Tekst spływa w marginesy, owija się wokół iluminowanych inicjałów, przeplata się między wstawionymi korektami interliniowymi lub biegnie pionowo wzdłuż grzbietu.</li>
<li><strong>Zakrzywione i pochyłe linie bazowe:</strong> Pismo odręczne rzadko podąża za sztywną poziomą osią. Silniki HTR takie jak Transkribus, Kraken i eScriptorium opierają się na wielokątnych liniach bazowych zamiast prostokątnych ram, aby interpretować skrypty bogate w ligatury.</li>
<li><strong>Złożoność paleograficzna i metadane:</strong> Badania archiwalne wymagają śledzenia skrótów, historycznych wariantów ortograficznych, uszkodzonych odczytów oraz ocen pewności na poziomie linii. Standardowe formaty dokumentów pomijają tę szczegółowość.</li>
</ol>
<p>Aby zachować wierność oryginalnemu artefaktowi, społeczność archiwalna opiera się na ustrukturyzowanych schematach XML zaprojektowanych do zachowania topologii układu wraz z przepisanym tekstem.</p>
<h2 id="1-page-xml-złoty-standard-rozpoznawania-tekstu-odręcznego-htr">1. PAGE XML: Złoty standard rozpoznawania tekstu odręcznego (HTR)</h2>
<p>Opracowany przez laboratorium badawcze PRImA (Pattern Recognition &amp; Image Analysis), <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) jest powszechnie uważany za najnowocześniejszy format do rozpoznawania tekstu odręcznego i zaawansowanej analizy układu.</p>
<h3 id="podstawowa-architektura">Podstawowa architektura</h3>
<p>PAGE XML traktuje fizyczny dokument jako strukturę hierarchiczną:</p>
<ul>
<li><code>PcGts</code> (Korzeń)
<ul>
<li><code>Page</code> (Wymiary obrazu i ogólna kolejność czytania)
<ul>
<li><code>TextRegion</code> (Akapity, nagłówki, notatki marginalne, słowa kluczowe)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Współrzędne wielokąta wokół linii)</li>
<li><code>Baseline</code> (Seria punktów podążająca za rzeczywistą linią bazową pisma)</li>
<li><code>TextEquiv</code> (Rozpoznany tekst, z opcjonalnymi miarami pewności)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="dlaczego-wyróżnia-się-w-przypadku-rękopisów-historycznych">Dlaczego wyróżnia się w przypadku rękopisów historycznych</h3>
<ul>
<li><strong>Precyzja wielokątów i polilinii:</strong> Zamiast zmuszać znaki do prostokątnych ram, PAGE XML używa wielopunktowych granic wielokątów i ciągłych linii bazowych. Zapobiega to nakładaniu się kursywnych górnych i dolnych części znaków, które mogłyby zakłócać segmentację.</li>
<li><strong>Szczegółowe typy strukturalne:</strong> Regiony mogą być precyzyjnie klasyfikowane (np. <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Szeroki ekosystem oprogramowania:</strong> Służy jako podstawowy wewnętrzny i eksportowy schemat dla flagowych platform HTR, takich jak <strong>Transkribus</strong>, <strong>eScriptorium</strong>, i <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-potęga-bibliotek-i-archiwów">2. ALTO XML: Potęga bibliotek i archiwów</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> jest otwartym standardem XML utrzymywanym przez Bibliotekę Kongresu i szeroko przyjętym przez biblioteki narodowe, w tym Bibliothèque nationale de France (BnF) oraz British Library.</p>
<h3 id="podstawowa-architektura-1">Podstawowa architektura</h3>
<p>ALTO strukturyzuje układ hierarchicznie od <code>Page</code> do <code>PrintSpace</code>, w dół do <code>TextBlock</code>, <code>TextLine</code> i <code>String</code> (poszczególne słowa lub tokeny). Jest często pakowany wewnątrz opakowania <strong>METS</strong> (Metadata Encoding and Transmission Standard), aby powiązać metadane strukturalne z obrazami wysokiej rozdzielczości.</p>
<h3 id="kluczowe-mocne-strony-i-przypadki-użycia">Kluczowe mocne strony i przypadki użycia</h3>
<ul>
<li><strong>Masowe przepływy cyfryzacji:</strong> ALTO został zaprojektowany z myślą o cyfryzacji gazet i książek na skalę przemysłową. Czytelnie koduje atrybuty czcionki, współrzędne na poziomie słowa, pewność znaków oraz spacje.</li>
<li><strong>Wsparcie nowoczesnego HTR (ALTO 4):</strong> Wcześniejsze wersje ALTO mocno opierały się na prostokątnych współrzędnych (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Jednak od <strong>wersji ALTO 4</strong>, schemat wprowadził wielokąty <code>&lt;Shape&gt;</code> oraz linie bazowe polilinii, zamykając funkcjonalną lukę w stosunku do PAGE XML dla materiałów odręcznych.</li>
<li><strong>Długoterminowa konserwacja:</strong> Ponieważ jest to oficjalny standard wspierany przez międzynarodowe konsorcja bibliotek, ALTO zapewnia długoterminową stabilność oraz kompatybilność wsteczną na poziomie archiwalnym.</li>
</ul>
<h2 id="3-hocr-standard-lekki-najpierw-internetowy">3. hOCR: Standard lekki, najpierw internetowy</h2>
<p>Stworzony przez Thomasa Breuela, <strong>hOCR</strong> przyjmuje pragmatyczne podejście: zamiast tworzyć zupełnie nowy schemat XML, osadza metadane układu i transkrypcji bezpośrednio w semantycznym HTML/XHTML przy użyciu mikroformatów i atrybutów klasy.</p>
<h3 id="przykładowa-składnia">Przykładowa składnia</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="zalety-i-wady-materiałów-historycznych">Zalety i wady materiałów historycznych</h3>
<ul>
<li><strong>Zalety:</strong> Przeglądarki mogą renderować go natywnie. Łatwo go przekształcić przy użyciu czystego CSS i JavaScript, a jest domyślnym formatem strukturalnym eksportu dla silników takich jak <strong>Tesseract</strong>.</li>
<li><strong>Wady:</strong> Natychmiastowe wsparcie dla złożonych, dowolnych krzywych bazowych z wieloma punktami jest ograniczone. Choć praktyczne dla wczesnych dzieł drukowanych (inkunabuły lub czyste druki), hOCR ma trudności z nieregularnymi układami rękopisów i wielowarstwowymi marginaliami.</li>
</ul>
<h2 id="4-tei-xml-wzorzec-akademicki-i-cyfrowych-nauk-humanistycznych">4. TEI-XML: Wzorzec akademicki i cyfrowych nauk humanistycznych</h2>
<p>Format <strong>Text Encoding Initiative (TEI)</strong> nie jest ściśle formatem wyjściowym silnika OCR; jest to natomiast wiodący standard dla krytycznych edycji cyfrowych oraz naukowej reprezentacji tekstów literackich i historycznych.</p>
<h3 id="łączenie-ocrhtr-z-tei">Łączenie OCR/HTR z TEI</h3>
<p>Nowoczesne potoki rzadko kończą się na surowym rozpoznawaniu znaków. Uczonymi używanymi narzędziami są m.in. <strong>Transkribus TEI Exporter</strong> lub zautomatyzowane potoki XSLT, które przekształcają pliki PAGE XML lub ALTO do XML zgodnego z TEI:</p>
<ul>
<li>Skróty są rozwijane (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Usunięcia, dodatki i rękopisy są formalnie klasyfikowane (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Dane układu są zachowywane wraz z analizą literacką przy użyciu elementów <code>&lt;facsimile&gt;</code> i <code>&lt;surface&gt;</code>.</li>
</ul>
<p>Jeśli Twój projekt historyczny ma na celu stworzenie interaktywnej krytycznej edycji lub semantycznie przeszukiwalnego archiwum naukowego, konwersja danych OCR/HTR do TEI-XML jest często niezbędnym końcowym krokiem.</p>
<h2 id="macierz-porównawcza-formaty-ocrhtr-w-skrócie">Macierz porównawcza: formaty OCR/HTR w skrócie</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Cecha / Kryterium</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Główna domena</strong></td>
<td style="text-align:left">Odręczne HTR &amp; rękopisy</td>
<td style="text-align:left">Masowa digitalizacja bibliotek</td>
<td style="text-align:left">Web OCR &amp; lekka wyszukiwarka</td>
<td style="text-align:left">Naukowe wydania krytyczne</td>
</tr>
<tr>
<td style="text-align:left"><strong>Podstawowe wsparcie</strong></td>
<td style="text-align:left">Natywne, wielopunktowe polilinie</td>
<td style="text-align:left">Obsługiwane (od v4.0)</td>
<td style="text-align:left">Podstawowe (nachylenie/przesunięcie)</td>
<td style="text-align:left">Poprzez mapowanie facsimile</td>
</tr>
<tr>
<td style="text-align:left"><strong>Nieregularne wielokąty</strong></td>
<td style="text-align:left">Pełny</td>
<td style="text-align:left">Pełny</td>
<td style="text-align:left">Ograniczone</td>
<td style="text-align:left">Poprzez elementy współrzędnych</td>
</tr>
<tr>
<td style="text-align:left"><strong>Ekosystem narzędziowy</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, przeglądarki internetowe</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Organizacja Standaryzacyjna</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Biblioteka Kongresu</td>
<td style="text-align:left">Specyfikacja społeczności</td>
<td style="text-align:left">TEI Consortium</td>
</tr>
</tbody>
</table>
<h2 id="praktyczne-rekomendacje-wybór-twojego-archiwalnego-potoku">Praktyczne rekomendacje: wybór Twojego archiwalnego potoku</h2>
<p>Aby ustanowić wydajny, przyszłościowy proces cyfryzacji:</p>
<ol>
<li><strong>Dla czystych rękopisów i archiwów:</strong>
Standaryzuj transkrypcję i ekstrakcję układu przy użyciu <strong>PAGE XML</strong>. Jego obliczanie linii bazowej i konturowanie wielokątów radzą sobie z niestandardowymi pismami ręcznymi przy minimalnej utracie danych.</li>
<li><strong>Dla dużych bibliotek i mieszanych zbiorów:</strong>
Wybierz <strong>ALTO XML (v4.2 lub wyższą)</strong> w połączeniu z <strong>METS</strong>. To zapewnia płynną integrację ze standardowymi architekturami repozytoriów cyfrowych oraz systemami zarządzania zasobami cyfrowymi (DAMS).</li>
<li><strong>Do prezentacji internetowej i indeksów pełnotekstowych:</strong>
Użyj <strong>hOCR</strong> lub wyprowadź lekkie struktury GeoJSON/Web Annotation z PAGE XML, aby zasilić interaktywne przeglądarki IIIF (takie jak Mirador lub Universal Viewer) z dynamicznymi nakładkami tekstowymi w przeglądarce.</li>
<li><strong>Dla edycji naukowych i badań paleograficznych:</strong>
Wygeneruj swoje dane referencyjne w formacie PAGE XML, przeprowadź rozpoznawanie i przekaż wynik przez automatyczny konwerter, aby wygenerować <strong>TEI-XML</strong> do oznaczania edytorskiego.</li>
</ol>
<p>Dopasowując możliwości strukturalne tych formatów do wymagań paleograficznych twojego materiału źródłowego, zapewniasz, że każde pociągnięcie, skrót i historyczna niuans pozostaną odczytywalne przez kolejne wieki.</p>
<h2 id="najczęściej-zadawane-pytania-faq">Najczęściej zadawane pytania (FAQ)</h2>
<p><strong>Q1. Jaka jest podstawowa różnica między standardowym OCR a HTR?</strong> OCR rozpoznaje jednolitą, maszynowo drukowaną typografię, podczas gdy HTR (Handwritten Text Recognition) wykorzystuje głębokie sieci neuronowe do dekodowania ciągłego, zmiennego ludzkiego pisma ręcznego i zakrzywionych linii bazowych.</p>
<p><strong>Q2. Czy Tesseract OCR może generować PAGE XML lub ALTO jako wynik dla dokumentów historycznych?</strong> Tak, Tesseract może generować natywny ALTO XML i wyjście hOCR, a zewnętrzne wrappery mogą konwertować te wyniki do PAGE XML.</p>
<p><strong>Q3. Dlaczego linie bazowe są ważniejsze niż ramki ograniczające w transkrypcji ręcznego tekstu?</strong> Linie bazowe śledzą naturalną, falującą linię ludzkiego pisma, umożliwiając oprogramowaniu oddzielenie nakładających się górnych i dolnych części liter, które kolidują wewnątrz sztywnych ramek ograniczających.</p>
<p><strong>Q4. Jak standard IIIF współdziała z tymi formatami plików OCR?</strong> IIIF udostępnia obrazy wysokiej rozdzielczości poprzez otwarte API internetowe, podczas gdy formaty takie jak ALTO lub PAGE XML dostarczają dane współrzędnych, które można przekształcić w adnotacje IIIF Content Search.</p>
<p><strong>Q5. Który format pliku jest najłatwiejszy do bezpośredniej konwersji na przeszukiwalny PDF?</strong> Zarówno hOCR, jak i ALTO XML mogą być połączone z oryginalnymi obrazami stron, aby stworzyć przeszukiwalne pliki PDF z podwójną warstwą przy użyciu narzędzi takich jak OCRmyPDF.</p>
<h2 id="zobacz-także">Zobacz także</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Potwór Hybrydowy? Osadzanie Oryginalnych Danych w Twoim OCR</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Zrozumienie formatów plików OCR – wyjaśnienie HOCR vs ALTO vs PDF/A</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Jaka jest różnica między PDF a FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Do czego służy FDF? Zrozumienie celu formatu danych formularzy</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: którego używać i kiedy?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
