<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Распознавание рукописного текста on File Format Blog</title>
    <link>https://blog.fileformat.com/ru/tag/%D1%80%D0%B0%D1%81%D0%BF%D0%BE%D0%B7%D0%BD%D0%B0%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5-%D1%80%D1%83%D0%BA%D0%BE%D0%BF%D0%B8%D1%81%D0%BD%D0%BE%D0%B3%D0%BE-%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0/</link>
    <description>Recent content in Распознавание рукописного текста on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>ru</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/ru/tag/%D1%80%D0%B0%D1%81%D0%BF%D0%BE%D0%B7%D0%BD%D0%B0%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5-%D1%80%D1%83%D0%BA%D0%BE%D0%BF%D0%B8%D1%81%D0%BD%D0%BE%D0%B3%D0%BE-%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Как выбрать правильный формат файла для распознавания рукописного текста (HTR)</title>
      <link>https://blog.fileformat.com/ru/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/ru/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Узнайте о лучших форматах файлов OCR и HTR для исторических рукописей и рукописных архивов, сравнивая ALTO, PAGE XML, hOCR и TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Последнее обновление</strong>: 20 авг., 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="форматы-файлов-ocr-для-исторических-и-рукописных-документов">Форматы файлов OCR для исторических и рукописных документов</h2>
<p>Сохранение культурного наследия посредством оцифровки вступило в эпоху возрождения. В то время как ранние системы оптического распознавания символов (OCR) были разработаны для обработки безупречных, машинно напечатанных документов двадцатого века, современные учреждения, занимающиеся культурным наследием, сталкиваются с гораздо более сложной и богатой задачей: средневековыми манускриптами, рукописной корреспонденцией XIX века, хрупкими иллюминированными листами и столетними реестрами.</p>
<p>Транскрибирование исторических документов больше не ограничивается извлечением простого ASCII‑текста. Оно требует захвата <strong>контекста</strong> — физической геометрии страницы, кривых базовых линий, коррекции просвечивания, маргиналий, аббревиатур и палеографической неопределённости. Эта специализированная область, часто относимая к распознаванию рукописного текста (Handwritten Text Recognition, HTR), сильно зависит от формата файлов, используемых для хранения и обмена как координатами изображений, так и текстовыми слоями.</p>
<p>Выбор неправильной схемы может удалить важные данные базовой линии, нарушить согласование с манифестами IIIF (International Image Interoperability Framework) или препятствовать долгосрочному цифровому сохранению. Ниже представлено окончательное руководство по ведущим форматам файлов OCR и HTR для исторических документов, их структурным преимуществам и тому, как определить правильный выбор для вашего архивного конвейера.</p>
<h2 id="историческая-дилемма-почему-простой-текст15-и-стандартные-pdf1-не-работают">Историческая дилемма: почему <a href="https//docs.fileformat.com/word-processing/txt/">Простой текст</a> и стандартные <a href="https://docs.fileformat.com/pdf/">PDF</a> не работают</h2>
<p>Машинный OCR часто выводит простые файлы <code>.txt</code> или &ldquo;сэндвич‑PDF&rdquo; с скрытыми текстовыми слоями под сканированием. Для исторических рукописей и курсивного почерка такие результаты не подходят по трем основным причинам:</p>
<ol>
<li><strong>Нелинейный текст и сложные макеты:</strong> Исторические писцы не придерживались аккуратных прямоугольных сеток. Текст стекает в поля, обтекает иллюминированные инициалы, переплетается с вставленными межстрочными исправлениями или проходит вертикально вдоль корешка.</li>
<li><strong>Изогнутые и наклонные базовые линии:</strong> Курсивное письмо редко следует жёсткой горизонтальной оси. HTR‑движки, такие как Transkribus, Kraken и eScriptorium, полагаются на полилинейные базовые линии вместо ограничивающих рамок для интерпретации скриптов с большим количеством лигатур.</li>
<li><strong>Палеографическая сложность и метаданные:</strong> Архивные исследования требуют отслеживания аббревиатур, исторических вариантов написания, повреждённых чтений и оценок уверенности на уровне строк. Стандартные форматы документов отбрасывают эту детализацию.</li>
</ol>
<p>Чтобы сохранить достоверность оригинального артефакта, архивное сообщество опирается на структурированные схемы XML, разработанные для сохранения топологии макета вместе с транскрибированным текстом.</p>
<h2 id="1-page-xml-золотой-стандарт-для-распознавания-рукописного-текста-htr">1. PAGE XML: Золотой стандарт для распознавания рукописного текста (HTR)</h2>
<p>Разработанный исследовательской лабораторией PRImA (Pattern Recognition &amp; Image Analysis), <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) широко считается передовым форматом для распознавания рукописного текста и продвинутого анализа макетов.</p>
<h3 id="основная-архитектура">Основная архитектура</h3>
<p>PAGE XML рассматривает физический документ как иерархическую структуру:</p>
<ul>
<li><code>PcGts</code> (Корень)
<ul>
<li><code>Page</code> (Размеры изображения и общий порядок чтения)
<ul>
<li><code>TextRegion</code> (Абзацы, заголовки, полевые заметки, ключевые слова)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Координаты полигона вокруг линии)</li>
<li><code>Baseline</code> (Последовательность точек, следящих за истинной базовой линией текста)</li>
<li><code>TextEquiv</code> (Распознанный текст, с необязательными метриками уверенности)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="почему-он-превосходит-в-работе-с-историческими-рукописями">Почему он превосходит в работе с историческими рукописями</h3>
<ul>
<li><strong>Точность полигонов и полилиний:</strong> Вместо принудительного размещения символов в прямоугольных ограничивающих коробках, PAGE XML использует многоточечные границы полигонов и непрерывные базовые линии. Это предотвращает перекрытие курсивных восходящих и нисходящих элементов, мешающих сегментации.</li>
<li><strong>Тонкие типы структуры:</strong> Области могут быть точно классифицированы (например, <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Широкая программная экосистема:</strong> Она служит основной внутренней и экспортной схемой для флагманских HTR‑платформ, таких как <strong>Transkribus</strong>, <strong>eScriptorium</strong>, и <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-сила-библиотек-и-архивов">2. ALTO XML: Сила библиотек и архивов</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> — открытый стандарт XML, поддерживаемый Библиотекой Конгресса и широко используемый национальными библиотеками, включая Bibliothèque nationale de France (BnF) и Британскую библиотеку.</p>
<h3 id="основная-архитектура-1">Основная архитектура</h3>
<p>ALTO структурирует макет иерархически от <code>Page</code> до <code>PrintSpace</code>, далее <code>TextBlock</code>, <code>TextLine</code> и <code>String</code> (отдельные слова или токены). Часто он упаковывается в обёртку <strong>METS</strong> (Metadata Encoding and Transmission Standard) для связывания структурных метаданных с высокоразрешёнными оригинальными изображениями.</p>
<h3 id="ключевые-преимущества-и-варианты-использования">Ключевые преимущества и варианты использования</h3>
<ul>
<li><strong>Массовые рабочие процессы оцифровки:</strong> ALTO был разработан с учётом промышленного масштабирования оцифровки газет и книг. Он чисто кодирует атрибуты шрифтов, координаты на уровне слов, уверенность символов и пробелы.</li>
<li><strong>Современная поддержка HTR (ALTO 4):</strong> Ранние версии ALTO сильно опирались на прямоугольные координаты (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Однако, начиная с <strong>ALTO версии 4</strong>, схема ввела полигоны <code>&lt;Shape&gt;</code> и полилинейные базовые линии, закрывая функциональный разрыв с PAGE XML для рукописных материалов.</li>
<li><strong>Долгосрочное сохранение:</strong> Поскольку это официальный стандарт, поддерживаемый международными библиотечными консорциумами, ALTO гарантирует долгосрочную стабильность и совместимость архивного уровня.</li>
</ul>
<h2 id="3-hocr-веб-ориентированный-лёгкий-стандарт">3. hOCR: Веб-ориентированный, лёгкий стандарт</h2>
<p>Созданный Томасом Бройелем, <strong>hOCR</strong> использует прагматичный подход: вместо создания полностью новой XML‑схемы он встраивает метаданные разметки и транскрипции непосредственно в семантический HTML/XHTML, используя микроформаты и атрибуты классов.</p>
<h3 id="пример-типичного-синтаксиса">Пример типичного синтаксиса</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;ocr_line\&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;line_1_1\&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;bbox</span> <span style="color:#a6e22e">150</span> <span style="color:#a6e22e">320</span> <span style="color:#a6e22e">2200</span> <span style="color:#a6e22e">410</span><span style="color:#960050;background-color:#1e0010">;</span> <span style="color:#a6e22e">baseline</span> <span style="color:#a6e22e">0</span> <span style="color:#a6e22e">-5</span><span style="color:#960050;background-color:#1e0010">\&#34;</span>&gt;\n        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;ocrx_word\&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;word_1_1\&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;bbox</span> <span style="color:#a6e22e">150</span> <span style="color:#a6e22e">325</span> <span style="color:#a6e22e">380</span> <span style="color:#a6e22e">405</span><span style="color:#960050;background-color:#1e0010">;</span> <span style="color:#a6e22e">x_wconf</span> <span style="color:#a6e22e">92</span><span style="color:#960050;background-color:#1e0010">\&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;\n      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="плюсы-и-минусы-для-исторических-материалов">Плюсы и минусы для исторических материалов</h3>
<ul>
<li><strong>Плюсы:</strong> Браузеры могут отображать его нативно. Его легко преобразовать с помощью обычного CSS и JavaScript, и это формат экспорта по умолчанию для движков, таких как <strong>Tesseract</strong>.</li>
<li><strong>Минусы:</strong> Нативная поддержка сложных, свободных многоточечных базовых кривых ограничена. Хотя это практично для ранних печатных изданий (инкунабула или чистые листовки), hOCR сталкивается с проблемами при работе с хаотичными макетами рукописей и многослойными маргиналиями.</li>
</ul>
<h2 id="4-tei-xml-академический-и-цифровой-гуманитарный-эталон">4. TEI-XML: Академический и цифровой гуманитарный эталон</h2>
<p>Формат <strong>Text Encoding Initiative (TEI)</strong> не является строго форматом вывода OCR‑движка; скорее, это ведущий стандарт для критических цифровых изданий и научного представления литературных и исторических текстов.</p>
<h3 id="связывание-ocrhtr-с-tei">Связывание OCR/HTR с TEI</h3>
<p>Современные конвейеры редко останавливаются на простом распознавании символов. Учёные используют инструменты, такие как <strong>Transkribus TEI Exporter</strong>, или автоматизированные XSLT‑конвейеры для преобразования PAGE XML или файлов ALTO в TEI‑совместимый XML:</p>
<ul>
<li>Сокращения раскрываются (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Удаления, вставки и почерки писцов формально классифицируются (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Данные о макете сохраняются вместе с литературным анализом с помощью элементов <code>&lt;facsimile&gt;</code> и <code>&lt;surface&gt;</code>.</li>
</ul>
<p>Если ваш исторический проект направлен на создание интерактивного критического издания или семантически поискового научного архива, преобразование ваших OCR/HTR‑данных в TEI‑XML часто является необходимым завершающим шагом.</p>
<h2 id="сравнительная-матрица-форматы-ocrhtr-в-одном-взгляде">Сравнительная матрица: форматы OCR/HTR в одном взгляде</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Функция / Критерий</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Основной домен</strong></td>
<td style="text-align:left">Курсивный HTR и рукописи</td>
<td style="text-align:left">Массовая оцифровка библиотек</td>
<td style="text-align:left">Веб-OCR и лёгкий поиск</td>
<td style="text-align:left">Учёные критические издания</td>
</tr>
<tr>
<td style="text-align:left"><strong>Базовая поддержка</strong></td>
<td style="text-align:left">Нативные, многоточечные полилинии</td>
<td style="text-align:left">Поддерживается (с версии v4.0)</td>
<td style="text-align:left">Базовый (наклон/смещение)</td>
<td style="text-align:left">Через факсимильное отображение</td>
</tr>
<tr>
<td style="text-align:left"><strong>Неправильные полигоны</strong></td>
<td style="text-align:left">Полный</td>
<td style="text-align:left">Полный</td>
<td style="text-align:left">Ограничено</td>
<td style="text-align:left">Через координатные элементы</td>
</tr>
<tr>
<td style="text-align:left"><strong>Экосистема инструментов</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, веб‑просмотрщики</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Орган стандартизации</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Библиотека Конгресса</td>
<td style="text-align:left">Спецификация сообщества</td>
<td style="text-align:left">Консорциум TEI</td>
</tr>
</tbody>
</table>
<h2 id="практические-рекомендации-выбор-вашего-архивного-конвейера">Практические рекомендации: выбор вашего архивного конвейера</h2>
<p>Для создания эффективного, устойчивого к будущим изменениям конвейера оцифровки:</p>
<ol>
<li><strong>Для чистых рукописных манускриптов и архивов:</strong>
Стандартизируйте вашу транскрипцию и извлечение макета с помощью <strong>PAGE XML</strong>. Его расчёт базовой линии и построение полигональных контуров обрабатывают нестандартные почерки с минимальными потерями данных.</li>
<li><strong>Для крупномасштабных библиотек и смешанных коллекций:</strong>
Выберите <strong>ALTO XML (v4.2 или выше)</strong> в сочетании с <strong>METS</strong>. Это гарантирует бесшовную интеграцию в стандартные архитектуры цифровых репозиториев и системы управления цифровыми активами (DAMS).</li>
<li><strong>Для веб‑представления и полнотекстовых поисковых индексов:</strong>
Используйте <strong>hOCR</strong> или получайте лёгкие структуры GeoJSON/Web Annotation из PAGE XML для управления интерактивными IIIF‑просмотрщиками (например, Mirador или Universal Viewer) с живыми текстовыми наложениями в браузере.</li>
<li><strong>Для научных изданий и палеографических исследований:</strong>
Создайте ваш эталонный набор данных в формате PAGE XML, выполните распознавание и пропустите вывод через автоматический конвертер, чтобы сгенерировать <strong>TEI-XML</strong> для редакционной разметки.</li>
</ol>
<p>Сопоставляя структурные возможности этих форматов с палеографическими требованиями вашего исходного материала, вы гарантируете, что каждый штрих, аббревиатура и исторический нюанс остаются читаемыми на протяжении веков.</p>
<h2 id="часто-задаваемые-вопросы-faq">Часто задаваемые вопросы (FAQ)</h2>
<p><strong>Q1. В чём фундаментальное различие между стандартным OCR и HTR?</strong> OCR распознаёт последовательную машинно напечатанную типографику, тогда как HTR (распознавание рукописного текста) использует глубокие нейронные сети для декодирования непрерывного, изменчивого человеческого почерка и изогнутых базовых линий.</p>
<p><strong>Q2. Может ли Tesseract OCR создавать PAGE XML или ALTO‑вывод для исторических документов?</strong> Да, Tesseract может генерировать нативный ALTO XML и hOCR‑вывод, а сторонние обёртки могут преобразовать эти результаты в PAGE XML.</p>
<p><strong>Q3. Почему базовые линии важнее ограничивающих рамок при транскрипции рукописного текста?</strong> Базовые линии отслеживают естественную, волнообразную линию человеческого почерка, позволяя программному обеспечению разделять перекрывающиеся восходящие и нисходящие элементы, которые сталкиваются внутри жёстких ограничивающих рамок.</p>
<p><strong>Вопрос 4. Как стандарт IIIF взаимодействует с этими форматами OCR‑файлов?</strong> IIIF предоставляет изображения высокого разрешения через открытые веб‑API, в то время как такие форматы, как ALTO или PAGE XML, предоставляют координатные данные, которые можно преобразовать в аннотации поиска контента IIIF.</p>
<p><strong>Вопрос 5. Какой формат файла проще всего напрямую преобразовать в поисковый PDF?</strong> Как hOCR, так и ALTO XML можно сочетать с оригинальными изображениями страниц для создания поисковых PDF‑файлов с двойным слоем с помощью таких инструментов, как OCRmyPDF.</p>
<h2 id="см-также">См. также</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Гибридный монстр? Встраивание оригинальных данных в ваш OCR</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Понимание форматов OCR‑файлов — объяснение HOCR vs ALTO vs PDF/A</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">В чём разница между PDF и FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Для чего используется FDF? Понимание назначения формата данных форм</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF против Word: какой использовать и когда?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
