Последно актуализирано: 20 авг., 2026

OCR File Formats for Historical and Handwritten Documents

Формати на OCR файлове за исторически и ръкописни документи

Запазването на културното наследство чрез дигитализация влезе в ренесанс. Докато ранните системи за оптично разпознаване на знаци (OCR) бяха проектирани да обработват безупречни, машинно отпечатани документи от двадесетото столетие, съвременните институции за културно наследство се изправят пред много по‑месивно и богато предизвикателство: средновековни ръкописи, кореспонденция от деветнадесетото столетие с курсив, крехки осветени листове и регистри на вековна възраст.

Транскрибирането на исторически документи вече не се свежда само до извличане на прост ASCII текст. То изисква улавяне на контекст—физическата геометрия на страницата, кривите на базовата линия, корекции на просветляване, маргиналии, съкращения и неопределеност в палеографията. Това специализирано поле, често категоризирано като разпознаване на ръкописен текст (HTR), силно зависи от файловия формат, използван за съхранение и обмен както на координатите на изображението, така и на текстовите слоеве.

Изборът на грешна схема може да премахне жизненоважни данни за базовата линия, да наруши съвместимостта с манифестите на IIIF (International Image Interoperability Framework) или да попречи на дългосрочното цифрово съхранение. Ето едно окончателно ръководство за водещите файлови формати за OCR и HTR при исторически документи, техните структурни предимства и как да определите правилния избор за вашия архивен процес.

Историческата дилема: Защо Обикновен текст и Стандартни PDF файлове Не успяват

OCR, базиран на машинен печат, често генерира прости .txt файлове или “sandwich” PDF‑ове със скрити текстови слоеве под сканирането. За исторически ръкописи и курсивно ръкописно писане, тези изходи се провалят по три основни причини:

  1. Нелинерен текст и сложни оформления: Историческите писари не се придържаха към подредени правоъгълни мрежи. Текстът се разлива в полетата, обвива осветени инициали, се преплита между вмъкнати междуредови корекции или се движи вертикално по гърба.
  2. Извити и наклонени базови линии: Ръкописното писане рядко следва твърда хоризонтална ос. HTR двигатели като Transkribus, Kraken и eScriptorium разчитат на полилинейни базови линии, а не на ограничителни кутии, за да интерпретират скриптове с множество лигатури.
  3. Палеографска сложност и метаданни: Архивните изследвания изискват проследяване на съкращения, исторически правописни вариации, повредени четения и оценки на увереност на ниво ред. Стандартните формати за документи отхвърлят тази грануларност.

За да се запази вярност към оригиналния артефакт, архивната общност разчита на структурираните XML схеми, проектирани да съхраняват топологията на оформлението заедно с транскрибирания текст.

1. PAGE XML: Златният стандарт за разпознаване на ръкописен текст (HTR)

Разработен от изследователската лаборатория PRImA (Pattern Recognition & Image Analysis), PAGE XML (Page Analysis and Groundtruth Elements) се счита за водещ формат за разпознаване на ръкописен текст и напреднал анализ на оформлението.

Основна архитектура

PAGE XML третира физическия документ като йерархична структура:

  • PcGts (Корен)
    • Page (Размери на изображението и общ ред за четене)
      • TextRegion (Параграфи, заглавия, маргинални бележки, ключови думи)
        • TextLine
          • Coords (Полигонални координати около линията)
          • Baseline (Последователност от точки, следващи истинската базова линия на писмото)
          • TextEquiv (Разпознатият текст, с опционални метрики за увереност)

Защо се отличава при исторически ръкописи

  • Прецизност на полигоните и полилините: Вместо да принуждава символите в правоъгълни ограничителни кутии, PAGE XML използва многоточкови полигонални граници и непрекъснати базови линии. Това предотвратява препокриването на курсивните възходящи и низходящи части от символите, което би смущавало сегментацията.
  • Гранулирани структурни типове: Регионите могат да бъдат класифицирани точно (например marginalia, drop-capital, signature-mark, header, editorial-note).
  • Широка софтуерна екосистема: Тя служи като основна вътрешна и експортна схема за водещи HTR платформи като Transkribus, eScriptorium и Kraken.

2. ALTO XML: Силата на библиотеките и архивите

ALTO (Analyzed Layout and Text Object) е отворен XML стандарт, поддържан от Библиотеката на Конгреса и широко приет от национални библиотеки, включително Bibliothèque nationale de France (BnF) и Британската библиотека.

Основна архитектура

ALTO структурира оформлението йерархично от Page до PrintSpace, надолу до TextBlock, TextLine и String (отделни думи или токени). Често се пакетира в обвивка METS (Metadata Encoding and Transmission Standard), за да свърже структурните метаданни с висококачествени оригинални изображения.

Ключови предимства и случаи на употреба

  • Масови работни процеси за дигитализация: ALTO е проектиран с мисъл за индустриално мащабна дигитализация на вестници и книги. Той чисто кодира атрибути на шрифта, координати на ниво дума, увереност на знаците и празните пространства.
  • Модерна поддръжка на HTR (ALTO 4): По-ранните версии на ALTO се опираха силно на правоъгълни координати (HPOS, VPOS, WIDTH, HEIGHT). Въпреки това, започвайки с ALTO версия 4, схемата въведе полигонални <Shape> форми и полилинейни базови линии, запълвайки функционалната пропаст с PAGE XML за ръкописни материали.
  • Дългосрочно съхранение: Тъй като е официален стандарт, подкрепен от международни библиотечни консорциуми, ALTO гарантира дългосрочна стабилност и съвместимост с архивно ниво назад.

3. hOCR: Уеб‑първият, лек стандарт

Създаден от Томас Бройел, hOCR приема прагматичен подход: вместо да създава напълно нов XML схеми, той вгражда метаданни за оформление и транскрипция директно в семантичен HTML/XHTML, използвайки микроформати и атрибути на класове.

Типичен пример за синтаксис

<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
  <div class="ocr_carea" id="block_1_1">
    <p class="ocr_par" id="par_1_1">
      <span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
        <span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Начало</span>
      </span>
    </p>
  </div>
</div>

Предимства и недостатъци за исторически материали

  • Предимства: Браузърите могат да го рендерират нативно. Лесно се трансформира с помощта на чист CSS и JavaScript и е подразбираният структуриран формат за експортиране за двигатели като Tesseract.
  • Недостатъци: Поддръжката в родната среда за сложни, свободно оформени много-точкови базови криви е ограничена. Въпреки че е практичен за ранни печатни произведения (инкунабула или чисти листове), hOCR се затруднява с хаотични оформления на ръкописи и многослойни маргиналии.

4. TEI-XML: Академичният и дигиталният хуманитарен бенчмарк

Форматът Text Encoding Initiative (TEI) не е строго изходен формат на OCR двигател; по-скоро, той е водещият стандарт за критични дигитални издания и академично представяне на литературни и исторически текстове.

Свързване на OCR/HTR с TEI

Съвременните процеси рядко спират на чистото разпознаване на знаци. Учените използват инструменти като Transkribus TEI Exporter или автоматизирани XSLT процеси, за да преведат PAGE XML или ALTO файлове в TEI‑съвместим XML:

  • Съкращенията се разширяват (<choice><abbr>...</abbr><expan>...</expan></choice>).
  • Изтривания, добавки и писателски ръце се класифицират формално (<add>, <del>, <handShift>).
  • Данните за оформление се запазват заедно с литературния анализ чрез елементите <facsimile> и <surface>.

Ако вашият исторически проект цели създаването на интерактивно критично издание или семантично претърсваем академичен архив, преобразуването на вашите OCR/HTR данни в TEI-XML често е необходимата последна стъпка.

Сравнителна матрица: Формати OCR/HTR в един поглед

Характеристика / КритерийPAGE XMLALTO XML (v4+)hOCRTEI-XML
Основен домейнКурсивен HTR и ръкописиМасова дигитализация на библиотекиУеб OCR и лека търсачкаНаучни критични издания
Базова поддръжкаВградени, многоточкови полилинииПоддържано (от v4.0)Основен (Наклон/Отместване)Чрез фасимилно картографиране
Нередовни полигониПъленПъленОграниченоЧрез координатни елементи
Екосистема на инструментитеTranskribus, eScriptoriumMETS, Goobi, KitodoTesseract, уеб прегледачиOxygen, TEI Publisher
Орган за стандартизацияPRImA Group / OpenБиблиотека на КонгресаОбщностна спецификацияКонсорциум TEI

Практични препоръки: Избор на вашия архивен процес

За да създадете ефективен, бъдещност‑устойчив процес на дигитализация:

  1. За чисти ръкописни ръкописи и архиви: Стандартизирайте вашата транскрипция и извличане на оформление върху PAGE XML. Нейното изчисляване на базовата линия и полигонално контуриране обработват нестандартни почерци с минимална загуба на данни.
  2. За големи библиотечни и смесени колекции: Изберете ALTO XML (v4.2 или по-нов) в комбинация с METS. Това гарантира безпроблемна интеграция в стандартните архитектури на цифрови репозитории и системи за управление на цифрови активи (DAMS).
  3. За уеб представяне и индекси за пълен текстов търсене: Използвайте hOCR или извлечете леки структури GeoJSON/Web Annotation от PAGE XML, за да управлявате интерактивни IIIF визуализатори (като Mirador или Universal Viewer) с живи текстови слоеве в браузъра.
  4. За научни издания и палеографски изследвания: Генерирайте вашите референтни данни в PAGE XML, извършете разпознаване и пренасочете изхода чрез автоматичен конвертор, за да създадете TEI-XML за редакторски маркиране.

Съобразявайки структурните възможности на тези формати с палеографските изисквания на вашия изходен материал, вие гарантирате, че всеки щрих, съкращение и исторически нюанс ще останат разчетими в продължение на векове.

Често задавани въпроси (FAQ)

Въпрос 1. Каква е фундаменталната разлика между стандартния OCR и HTR? OCR разпознава последователна машинно отпечатана типография, докато HTR (Разпознаване на ръкописен текст) използва дълбоки невронни мрежи за декодиране на непрекъснат, променлив човешки ръкопис и изкривени базови линии.

Въпрос 2. Може ли Tesseract OCR да генерира PAGE XML или ALTO изход за исторически документи? Да, Tesseract може да създава нативен ALTO XML и hOCR изход, а външни обвивки могат да конвертират тези резултати в PAGE XML.

Въпрос 3. Защо базовите линии са по-важни от ограничителните кутии при транскрипция на ръкописен текст? Базовите линии следят естествената, вълнообразна линия на човешкото писане, позволявайки на софтуера да отделя препокриващи се възходящи и низходящи части, които се сблъскват в рамките на твърдите ограничителни кутии.

Q4. Как стандартът IIIF взаимодейства с тези OCR файлови формати? IIIF предоставя висококачествени изображения чрез отворени уеб API, докато формати като ALTO или PAGE XML предоставят координатни данни, които могат да бъдат конвертирани в анотации за търсене в съдържанието на IIIF.

Q5. Кой файлов формат е най-лесен за директно конвертиране в търсим PDF? И hOCR, и ALTO XML могат да се комбинират с оригиналните изображения на страниците, за да се създадат търсимо двуслойни PDF файлове, използвайки инструменти като OCRmyPDF.

Вижте още