最后更新: 20 Aug, 2026
历史和手写文档的 OCR 文件格式 通过数字化保存文化遗产已进入复兴时期。早期的光学字符识别(OCR)系统旨在解析整洁的、机器印刷的二十世纪文件,而现代文化遗产机构面临更为混乱、更加丰富的挑战:中世纪手稿、十九世纪的草写信件、易碎的彩绘卷轴以及百年老登记册。
转录历史文献不再仅仅是提取纯ASCII文本。它需要捕获上下文——页面的物理几何形状、基线曲线、渗透校正、边注、缩写以及古文字学的不确定性。这个专门领域通常归类于手写文本识别(HTR),在很大程度上依赖于用于存储和交换图像坐标及文本层的文件格式。
选择错误的模式可能会剥夺关键的基线数据,破坏与 IIIF(International Image Interoperability Framework)清单的对齐,或阻碍长期数字保存。以下是一份关于历史文献的主流 OCR 与 HTR 文件格式的权威指南,涵盖它们的结构优势以及如何为您的档案流水线确定最佳选择。
历史困境:为什么纯文本和标准PDF会失败 机器打印的 OCR 通常输出简单的 .txt 文件或带有隐藏文本层的"夹心" PDF(位于扫描图像下方)。对于历史手稿和连笔手写,这些输出因以下三个核心原因而失效:
非线性文本和复杂布局: 历史抄写员并未遵循整齐的矩形网格。文本会流入页边,环绕装饰首字母,穿插于插入的行间批注之间,或沿书脊垂直排列。 弯曲和倾斜的基线: 草写文字很少遵循严格的水平轴线。像 Transkribus、Kraken 和 eScriptorium 这样的手写文本识别(HTR)引擎依赖多段线基线,而非边界框,以解释连字密集的手稿。 古文字学复杂性与元数据: 档案研究需要追踪缩写、历史拼写变体、损毁的读法以及行级置信度分数。标准文档格式会丢弃这些细粒度信息。 为了保持对原始文物的忠实,档案界依赖于旨在在转录文本的同时保留布局拓扑的结构化 XML 架构。
1. PAGE XML:手写文本识别(HTR)的黄金标准 由 PRImA(模式识别与图像分析)研究实验室开发的 PAGE XML(页面分析与真值元素),被广泛认为是手写文本识别和高级布局分析的最先进格式。
核心架构 PAGE XML 将实体文档视为层级结构:
PcGts(根) Page (图像尺寸和整体阅读顺序) TextRegion (段落、标题、边注、页首词) TextLine Coords (围绕该行的多边形坐标) Baseline (一系列沿文字真实基线的点) TextEquiv (识别的文本,可选的置信度指标) 为何它在历史手稿中表现出色 多边形和折线精度: 与其将字符强制放入矩形边框,PAGE XML 使用多点多边形边界和连续基线。这可以防止重叠的连笔上升部和下降部干扰分割。 细粒度结构类型: 区域可以精确分类(例如 marginalia、drop-capital、signature-mark、header、editorial-note)。 广泛的软件生态系统: 它作为旗舰 HTR 平台(如 Transkribus、eScriptorium 和 Kraken)的主要内部和导出模式。 2.