<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Разпознаване на ръкописен текст on File Format Blog</title>
    <link>https://blog.fileformat.com/bg/tag/%D1%80%D0%B0%D0%B7%D0%BF%D0%BE%D0%B7%D0%BD%D0%B0%D0%B2%D0%B0%D0%BD%D0%B5-%D0%BD%D0%B0-%D1%80%D1%8A%D0%BA%D0%BE%D0%BF%D0%B8%D1%81%D0%B5%D0%BD-%D1%82%D0%B5%D0%BA%D1%81%D1%82/</link>
    <description>Recent content in Разпознаване на ръкописен текст on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>bg</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/bg/tag/%D1%80%D0%B0%D0%B7%D0%BF%D0%BE%D0%B7%D0%BD%D0%B0%D0%B2%D0%B0%D0%BD%D0%B5-%D0%BD%D0%B0-%D1%80%D1%8A%D0%BA%D0%BE%D0%BF%D0%B8%D1%81%D0%B5%D0%BD-%D1%82%D0%B5%D0%BA%D1%81%D1%82/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Как да изберете правилния файлов формат за разпознаване на ръкописен текст (HTR)</title>
      <link>https://blog.fileformat.com/bg/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/bg/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Открийте най-добрите файлови формати за OCR и HTR за исторически ръкописи и ръкописни архиви, сравнявайки ALTO, PAGE XML, hOCR и TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Последно актуализирано</strong>: 20 авг., 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="формати-на-ocr-файлове-за-исторически-и-ръкописни-документи">Формати на OCR файлове за исторически и ръкописни документи</h2>
<p>Запазването на културното наследство чрез дигитализация влезе в ренесанс. Докато ранните системи за оптично разпознаване на знаци (OCR) бяха проектирани да обработват безупречни, машинно отпечатани документи от двадесетото столетие, съвременните институции за културно наследство се изправят пред много по‑месивно и богато предизвикателство: средновековни ръкописи, кореспонденция от деветнадесетото столетие с курсив, крехки осветени листове и регистри на вековна възраст.</p>
<p>Транскрибирането на исторически документи вече не се свежда само до извличане на прост ASCII текст. То изисква улавяне на <strong>контекст</strong>—физическата геометрия на страницата, кривите на базовата линия, корекции на просветляване, маргиналии, съкращения и неопределеност в палеографията. Това специализирано поле, често категоризирано като разпознаване на ръкописен текст (HTR), силно зависи от файловия формат, използван за съхранение и обмен както на координатите на изображението, така и на текстовите слоеве.</p>
<p>Изборът на грешна схема може да премахне жизненоважни данни за базовата линия, да наруши съвместимостта с манифестите на IIIF (International Image Interoperability Framework) или да попречи на дългосрочното цифрово съхранение. Ето едно окончателно ръководство за водещите файлови формати за OCR и HTR при исторически документи, техните структурни предимства и как да определите правилния избор за вашия архивен процес.</p>
<h2 id="историческата-дилема-защо-обикновен-текст15-и-стандартни-pdf-файлове1-не-успяват">Историческата дилема: Защо <a href="https//docs.fileformat.com/word-processing/txt/">Обикновен текст</a> и Стандартни <a href="https://docs.fileformat.com/pdf/">PDF файлове</a> Не успяват</h2>
<p>OCR, базиран на машинен печат, често генерира прости <code>.txt</code> файлове или &ldquo;sandwich&rdquo; PDF‑ове със скрити текстови слоеве под сканирането. За исторически ръкописи и курсивно ръкописно писане, тези изходи се провалят по три основни причини:</p>
<ol>
<li><strong>Нелинерен текст и сложни оформления:</strong> Историческите писари не се придържаха към подредени правоъгълни мрежи. Текстът се разлива в полетата, обвива осветени инициали, се преплита между вмъкнати междуредови корекции или се движи вертикално по гърба.</li>
<li><strong>Извити и наклонени базови линии:</strong> Ръкописното писане рядко следва твърда хоризонтална ос. HTR двигатели като Transkribus, Kraken и eScriptorium разчитат на полилинейни базови линии, а не на ограничителни кутии, за да интерпретират скриптове с множество лигатури.</li>
<li><strong>Палеографска сложност и метаданни:</strong> Архивните изследвания изискват проследяване на съкращения, исторически правописни вариации, повредени четения и оценки на увереност на ниво ред. Стандартните формати за документи отхвърлят тази грануларност.</li>
</ol>
<p>За да се запази вярност към оригиналния артефакт, архивната общност разчита на структурираните XML схеми, проектирани да съхраняват топологията на оформлението заедно с транскрибирания текст.</p>
<h2 id="1-page-xml-златният-стандарт-за-разпознаване-на-ръкописен-текст-htr">1. PAGE XML: Златният стандарт за разпознаване на ръкописен текст (HTR)</h2>
<p>Разработен от изследователската лаборатория PRImA (Pattern Recognition &amp; Image Analysis), <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) се счита за водещ формат за разпознаване на ръкописен текст и напреднал анализ на оформлението.</p>
<h3 id="основна-архитектура">Основна архитектура</h3>
<p>PAGE XML третира физическия документ като йерархична структура:</p>
<ul>
<li><code>PcGts</code> (Корен)
<ul>
<li><code>Page</code> (Размери на изображението и общ ред за четене)
<ul>
<li><code>TextRegion</code> (Параграфи, заглавия, маргинални бележки, ключови думи)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Полигонални координати около линията)</li>
<li><code>Baseline</code> (Последователност от точки, следващи истинската базова линия на писмото)</li>
<li><code>TextEquiv</code> (Разпознатият текст, с опционални метрики за увереност)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="защо-се-отличава-при-исторически-ръкописи">Защо се отличава при исторически ръкописи</h3>
<ul>
<li><strong>Прецизност на полигоните и полилините:</strong> Вместо да принуждава символите в правоъгълни ограничителни кутии, PAGE XML използва многоточкови полигонални граници и непрекъснати базови линии. Това предотвратява препокриването на курсивните възходящи и низходящи части от символите, което би смущавало сегментацията.</li>
<li><strong>Гранулирани структурни типове:</strong> Регионите могат да бъдат класифицирани точно (например <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Широка софтуерна екосистема:</strong> Тя служи като основна вътрешна и експортна схема за водещи HTR платформи като <strong>Transkribus</strong>, <strong>eScriptorium</strong> и <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-силата-на-библиотеките-и-архивите">2. ALTO XML: Силата на библиотеките и архивите</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> е отворен XML стандарт, поддържан от Библиотеката на Конгреса и широко приет от национални библиотеки, включително Bibliothèque nationale de France (BnF) и Британската библиотека.</p>
<h3 id="основна-архитектура-1">Основна архитектура</h3>
<p>ALTO структурира оформлението йерархично от <code>Page</code> до <code>PrintSpace</code>, надолу до <code>TextBlock</code>, <code>TextLine</code> и <code>String</code> (отделни думи или токени). Често се пакетира в обвивка <strong>METS</strong> (Metadata Encoding and Transmission Standard), за да свърже структурните метаданни с висококачествени оригинални изображения.</p>
<h3 id="ключови-предимства-и-случаи-на-употреба">Ключови предимства и случаи на употреба</h3>
<ul>
<li><strong>Масови работни процеси за дигитализация:</strong> ALTO е проектиран с мисъл за индустриално мащабна дигитализация на вестници и книги. Той чисто кодира атрибути на шрифта, координати на ниво дума, увереност на знаците и празните пространства.</li>
<li><strong>Модерна поддръжка на HTR (ALTO 4):</strong> По-ранните версии на ALTO се опираха силно на правоъгълни координати (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Въпреки това, започвайки с <strong>ALTO версия 4</strong>, схемата въведе полигонални <code>&lt;Shape&gt;</code> форми и полилинейни базови линии, запълвайки функционалната пропаст с PAGE XML за ръкописни материали.</li>
<li><strong>Дългосрочно съхранение:</strong> Тъй като е официален стандарт, подкрепен от международни библиотечни консорциуми, ALTO гарантира дългосрочна стабилност и съвместимост с архивно ниво назад.</li>
</ul>
<h2 id="3-hocr-уебпървият-лек-стандарт">3. hOCR: Уеб‑първият, лек стандарт</h2>
<p>Създаден от Томас Бройел, <strong>hOCR</strong> приема прагматичен подход: вместо да създава напълно нов XML схеми, той вгражда метаданни за оформление и транскрипция директно в семантичен HTML/XHTML, използвайки микроформати и атрибути на класове.</p>
<h3 id="типичен-пример-за-синтаксис">Типичен пример за синтаксис</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Начало&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="предимства-и-недостатъци-за-исторически-материали">Предимства и недостатъци за исторически материали</h3>
<ul>
<li><strong>Предимства:</strong> Браузърите могат да го рендерират нативно. Лесно се трансформира с помощта на чист CSS и JavaScript и е подразбираният структуриран формат за експортиране за двигатели като <strong>Tesseract</strong>.</li>
<li><strong>Недостатъци:</strong> Поддръжката в родната среда за сложни, свободно оформени много-точкови базови криви е ограничена. Въпреки че е практичен за ранни печатни произведения (инкунабула или чисти листове), hOCR се затруднява с хаотични оформления на ръкописи и многослойни маргиналии.</li>
</ul>
<h2 id="4-tei-xml-академичният-и-дигиталният-хуманитарен-бенчмарк">4. TEI-XML: Академичният и дигиталният хуманитарен бенчмарк</h2>
<p>Форматът <strong>Text Encoding Initiative (TEI)</strong> не е строго изходен формат на OCR двигател; по-скоро, той е водещият стандарт за критични дигитални издания и академично представяне на литературни и исторически текстове.</p>
<h3 id="свързване-на-ocrhtr-с-tei">Свързване на OCR/HTR с TEI</h3>
<p>Съвременните процеси рядко спират на чистото разпознаване на знаци. Учените използват инструменти като <strong>Transkribus TEI Exporter</strong> или автоматизирани XSLT процеси, за да преведат PAGE XML или ALTO файлове в TEI‑съвместим XML:</p>
<ul>
<li>Съкращенията се разширяват (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Изтривания, добавки и писателски ръце се класифицират формално (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Данните за оформление се запазват заедно с литературния анализ чрез елементите <code>&lt;facsimile&gt;</code> и <code>&lt;surface&gt;</code>.</li>
</ul>
<p>Ако вашият исторически проект цели създаването на интерактивно критично издание или семантично претърсваем академичен архив, преобразуването на вашите OCR/HTR данни в TEI-XML често е необходимата последна стъпка.</p>
<h2 id="сравнителна-матрица-формати-ocrhtr-в-един-поглед">Сравнителна матрица: Формати OCR/HTR в един поглед</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Характеристика / Критерий</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Основен домейн</strong></td>
<td style="text-align:left">Курсивен HTR и ръкописи</td>
<td style="text-align:left">Масова дигитализация на библиотеки</td>
<td style="text-align:left">Уеб OCR и лека търсачка</td>
<td style="text-align:left">Научни критични издания</td>
</tr>
<tr>
<td style="text-align:left"><strong>Базова поддръжка</strong></td>
<td style="text-align:left">Вградени, многоточкови полилинии</td>
<td style="text-align:left">Поддържано (от v4.0)</td>
<td style="text-align:left">Основен (Наклон/Отместване)</td>
<td style="text-align:left">Чрез фасимилно картографиране</td>
</tr>
<tr>
<td style="text-align:left"><strong>Нередовни полигони</strong></td>
<td style="text-align:left">Пълен</td>
<td style="text-align:left">Пълен</td>
<td style="text-align:left">Ограничено</td>
<td style="text-align:left">Чрез координатни елементи</td>
</tr>
<tr>
<td style="text-align:left"><strong>Екосистема на инструментите</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, уеб прегледачи</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Орган за стандартизация</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Библиотека на Конгреса</td>
<td style="text-align:left">Общностна спецификация</td>
<td style="text-align:left">Консорциум TEI</td>
</tr>
</tbody>
</table>
<h2 id="практични-препоръки-избор-на-вашия-архивен-процес">Практични препоръки: Избор на вашия архивен процес</h2>
<p>За да създадете ефективен, бъдещност‑устойчив процес на дигитализация:</p>
<ol>
<li><strong>За чисти ръкописни ръкописи и архиви:</strong>
Стандартизирайте вашата транскрипция и извличане на оформление върху <strong>PAGE XML</strong>. Нейното изчисляване на базовата линия и полигонално контуриране обработват нестандартни почерци с минимална загуба на данни.</li>
<li><strong>За големи библиотечни и смесени колекции:</strong>
Изберете <strong>ALTO XML (v4.2 или по-нов)</strong> в комбинация с <strong>METS</strong>. Това гарантира безпроблемна интеграция в стандартните архитектури на цифрови репозитории и системи за управление на цифрови активи (DAMS).</li>
<li><strong>За уеб представяне и индекси за пълен текстов търсене:</strong>
Използвайте <strong>hOCR</strong> или извлечете леки структури GeoJSON/Web Annotation от PAGE XML, за да управлявате интерактивни IIIF визуализатори (като Mirador или Universal Viewer) с живи текстови слоеве в браузъра.</li>
<li><strong>За научни издания и палеографски изследвания:</strong>
Генерирайте вашите референтни данни в PAGE XML, извършете разпознаване и пренасочете изхода чрез автоматичен конвертор, за да създадете <strong>TEI-XML</strong> за редакторски маркиране.</li>
</ol>
<p>Съобразявайки структурните възможности на тези формати с палеографските изисквания на вашия изходен материал, вие гарантирате, че всеки щрих, съкращение и исторически нюанс ще останат разчетими в продължение на векове.</p>
<h2 id="често-задавани-въпроси-faq">Често задавани въпроси (FAQ)</h2>
<p><strong>Въпрос 1. Каква е фундаменталната разлика между стандартния OCR и HTR?</strong> OCR разпознава последователна машинно отпечатана типография, докато HTR (Разпознаване на ръкописен текст) използва дълбоки невронни мрежи за декодиране на непрекъснат, променлив човешки ръкопис и изкривени базови линии.</p>
<p><strong>Въпрос 2. Може ли Tesseract OCR да генерира PAGE XML или ALTO изход за исторически документи?</strong> Да, Tesseract може да създава нативен ALTO XML и hOCR изход, а външни обвивки могат да конвертират тези резултати в PAGE XML.</p>
<p><strong>Въпрос 3. Защо базовите линии са по-важни от ограничителните кутии при транскрипция на ръкописен текст?</strong> Базовите линии следят естествената, вълнообразна линия на човешкото писане, позволявайки на софтуера да отделя препокриващи се възходящи и низходящи части, които се сблъскват в рамките на твърдите ограничителни кутии.</p>
<p><strong>Q4. Как стандартът IIIF взаимодейства с тези OCR файлови формати?</strong> IIIF предоставя висококачествени изображения чрез отворени уеб API, докато формати като ALTO или PAGE XML предоставят координатни данни, които могат да бъдат конвертирани в анотации за търсене в съдържанието на IIIF.</p>
<p><strong>Q5. Кой файлов формат е най-лесен за директно конвертиране в търсим PDF?</strong> И hOCR, и ALTO XML могат да се комбинират с оригиналните изображения на страниците, за да се създадат търсимо двуслойни PDF файлове, използвайки инструменти като OCRmyPDF.</p>
<h2 id="вижте-още">Вижте още</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 – Хибридното чудовище? Вграждане на оригинални данни във вашия OCR</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Разбиране на OCR файловите формати – HOCR vs ALTO vs PDF/A обяснено</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Каква е разликата между PDF и FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">За какво се използва FDF? Разбиране на целта на формата за данни на формуляри</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF срещу Word: Кой да използвате и кога?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
