最后更新: 20 Aug, 2026

OCR File Formats for Historical and Handwritten Documents

历史和手写文档的 OCR 文件格式

通过数字化保存文化遗产已进入复兴时期。早期的光学字符识别(OCR)系统旨在解析整洁的、机器印刷的二十世纪文件,而现代文化遗产机构面临更为混乱、更加丰富的挑战:中世纪手稿、十九世纪的草写信件、易碎的彩绘卷轴以及百年老登记册。

转录历史文献不再仅仅是提取纯ASCII文本。它需要捕获上下文——页面的物理几何形状、基线曲线、渗透校正、边注、缩写以及古文字学的不确定性。这个专门领域通常归类于手写文本识别(HTR),在很大程度上依赖于用于存储和交换图像坐标及文本层的文件格式。

选择错误的模式可能会剥夺关键的基线数据,破坏与 IIIF(International Image Interoperability Framework)清单的对齐,或阻碍长期数字保存。以下是一份关于历史文献的主流 OCR 与 HTR 文件格式的权威指南,涵盖它们的结构优势以及如何为您的档案流水线确定最佳选择。

历史困境:为什么纯文本和标准PDF会失败

机器打印的 OCR 通常输出简单的 .txt 文件或带有隐藏文本层的"夹心" PDF(位于扫描图像下方)。对于历史手稿和连笔手写,这些输出因以下三个核心原因而失效:

  1. 非线性文本和复杂布局: 历史抄写员并未遵循整齐的矩形网格。文本会流入页边,环绕装饰首字母,穿插于插入的行间批注之间,或沿书脊垂直排列。
  2. 弯曲和倾斜的基线: 草写文字很少遵循严格的水平轴线。像 Transkribus、Kraken 和 eScriptorium 这样的手写文本识别(HTR)引擎依赖多段线基线,而非边界框,以解释连字密集的手稿。
  3. 古文字学复杂性与元数据: 档案研究需要追踪缩写、历史拼写变体、损毁的读法以及行级置信度分数。标准文档格式会丢弃这些细粒度信息。

为了保持对原始文物的忠实,档案界依赖于旨在在转录文本的同时保留布局拓扑的结构化 XML 架构。

1. PAGE XML:手写文本识别(HTR)的黄金标准

由 PRImA(模式识别与图像分析)研究实验室开发的 PAGE XML(页面分析与真值元素),被广泛认为是手写文本识别和高级布局分析的最先进格式。

核心架构

PAGE XML 将实体文档视为层级结构:

  • PcGts(根)
    • Page (图像尺寸和整体阅读顺序)
      • TextRegion (段落、标题、边注、页首词)
        • TextLine
          • Coords (围绕该行的多边形坐标)
          • Baseline (一系列沿文字真实基线的点)
          • TextEquiv (识别的文本,可选的置信度指标)

为何它在历史手稿中表现出色

  • 多边形和折线精度: 与其将字符强制放入矩形边框,PAGE XML 使用多点多边形边界和连续基线。这可以防止重叠的连笔上升部和下降部干扰分割。
  • 细粒度结构类型: 区域可以精确分类(例如 marginalia、drop-capital、signature-mark、header、editorial-note)。
  • 广泛的软件生态系统: 它作为旗舰 HTR 平台(如 Transkribus、eScriptorium 和 Kraken)的主要内部和导出模式。

2. ALTO XML:图书馆和档案的强大工具

ALTO(分析布局和文本对象) 是由美国国会图书馆维护的开放 XML 标准,已被包括法国国家图书馆(Bibliothèque nationale de France,BnF)和大英图书馆在内的众多国家图书馆广泛采用。

核心架构

ALTO 将布局层次化地从 Page 到 PrintSpace,再到 TextBlock、TextLine 和 String(单个词或标记)进行组织。它常常被封装在 METS(元数据编码与传输标准)包装中,以将结构化元数据与高分辨率主图像关联起来。

关键优势与使用案例

  • 大规模数字化工作流: ALTO 的设计考虑了工业规模的报纸和图书数字化。它能够清晰地编码字体属性、词级坐标、字符置信度以及空白。
  • 现代 HTR 支持(ALTO 4): 早期的 ALTO 版本在矩形坐标(HPOS、VPOS、WIDTH、HEIGHT)上依赖甚多。然而,从 ALTO 版本 4 开始,模式引入了 <Shape> 多边形和折线基线,弥补了与 PAGE XML 在手写材料方面的功能差距。
  • 长期保存: 由于它是由国际图书馆联盟支持的官方标准,ALTO 保证长期稳定性和档案级向后兼容性。

3. hOCR:网络优先、轻量级标准

由 Thomas Breuel 创建,hOCR 采用务实的方法:它并未创建全新的 XML 模式,而是使用微格式和类属性将布局和转录元数据直接嵌入语义化的 HTML/XHTML 中。

典型语法示例

<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
  <div class="ocr_carea" id="block_1_1">
    <p class="ocr_par" id="par_1_1">
      <span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
        <span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">开篇</span>
      </span>
    </p>
  </div>
</div>

历史材料的优缺点

  • 优点: 浏览器可以原生渲染它。它可以轻松通过原生 CSS 和 JavaScript 进行转换,并且是像 Tesseract 这样的引擎的默认结构化导出格式。
  • 缺点: 对复杂、自由形状的多点基线曲线的原生支持有限。虽然对早期印刷作品(古籍或干净的单页)实用,但 hOCR 在处理不规则手稿布局和多层边注时会遇到困难。

4. TEI-XML:学术与数字人文基准

Text Encoding Initiative (TEI) 格式并非严格的 OCR 引擎输出格式;相反,它是批判性数字版和学术性文学及历史文本呈现的首要标准。

将 OCR/HTR 连接到 TEI

现代流水线很少仅止于原始字符识别。学者们使用诸如 Transkribus TEI Exporter 或自动化 XSLT 流水线,将 PAGE XML 或 ALTO 文件转换为符合 TEI 标准的 XML:

  • 缩写会被展开(<choice><abbr>...</abbr><expan>...</expan></choice>)。
  • 删除、添加和书写手迹被正式分类(<add>、<del>、<handShift>)。
  • 布局数据通过 <facsimile> 和 <surface> 元素与文学分析一起被保留。

如果您的历史项目旨在创建交互式批判版或语义可检索的学术档案,将您的 OCR/HTR 数据转换为 TEI-XML 通常是必需的最终步骤。

比较矩阵:OCR/HTR 格式一览

特性 / 标准PAGE XMLALTO XML (v4+)hOCRTEI-XML
主要领域手写体 HTR 与手稿大规模图书馆数字化网络 OCR 与轻量搜索学术批判版
基线支持本地,多点折线支持(自 v4.0 起)基础(斜率/偏移)通过复制映射
不规则多边形完整完整有限通过坐标元素
工具生态系统Transkribus, eScriptoriumMETS, Goobi, KitodoTesseract, 网页查看器Oxygen, TEI Publisher
标准化组织PRImA Group / Open美国国会图书馆社区规范TEI联盟

实用建议:选择您的档案流水线

建立高效、面向未来的数字化工作流:

  1. 针对纯手写稿件和档案: 在 PAGE XML 上标准化您的转录和布局提取。其基线计算和多边形轮廓处理能够以最小的数据损失应对非标准手写体。
  2. 针对大规模图书馆和混合藏品: 选择 ALTO XML(v4.2 或更高) 与 METS 配合使用。这可确保无缝集成到标准数字存储库架构和数字资产管理系统(DAMS)中。
  3. 针对网络展示和全文检索索引: 使用 hOCR,或从 PAGE XML 派生轻量级 GeoJSON/网页注释结构,以驱动交互式 IIIF 查看器(如 Mirador 或 Universal Viewer),实现浏览器内实时文本叠加。
  4. 用于学术版和古文字学研究: 在 PAGE XML 中生成您的真实数据,执行识别,并通过自动转换器将输出管道化,以生成用于编辑标记的 TEI-XML。

通过将这些格式的结构能力与源材料的古文字学需求相匹配,您可以确保每一笔、每个缩写以及历史细微之处在未来数百年仍然可辨认。

常见问题解答(FAQ)

Q1. 标准 OCR 与 HTR 的根本区别是什么? OCR 识别一致的机器印刷排版,而 HTR(手写文本识别)利用深度神经网络解码连续、可变的人类手写以及弯曲的基线。

Q2. Tesseract OCR 能为历史文档生成 PAGE XML 或 ALTO 输出吗? 是的,Tesseract 可以生成原生的 ALTO XML 和 hOCR 输出,第三方包装器可以将这些结果转换为 PAGE XML。

Q3. 为什么在手写文本转录中基线比边界框更重要? 基线跟踪人类书写的自然起伏线,使软件能够分离在刚性边界框内相互重叠的上升部和下降部。

Q4. IIIF 标准如何与这些 OCR 文件格式交互? IIIF 通过开放的网络 API 提供高分辨率图像,而 ALTO 或 PAGE XML 等格式提供坐标数据,可转换为 IIIF 内容搜索注释。

Q5. 哪种文件格式最容易直接转换为可搜索的 PDF? hOCR 和 ALTO XML 都可以与原始页面图像配合,使用 OCRmyPDF 等工具构建可搜索的双层 PDF 文件。

另见