Cập nhật lần cuối: 20 Tháng 8, 2026

Định dạng tệp OCR cho tài liệu lịch sử và viết tay
Bảo tồn di sản văn hoá thông qua số hoá đã bước vào một thời kỳ phục hưng. Trong khi các hệ thống nhận dạng ký tự quang học (OCR) ban đầu được thiết kế để xử lý các tài liệu in máy sạch sẽ, không tì vết của thế kỷ XX, các tổ chức di sản văn hoá hiện đại đang đối mặt với một thách thức phức tạp và phong phú hơn: bản thảo trung cổ, thư từ viết tay cursive của thế kỷ XIX, các cuốn sách minh hoạ dễ gãy, và các sổ đăng ký có tuổi đời hàng thế kỷ.
Việc chép lại các tài liệu lịch sử không còn chỉ là trích xuất văn bản ASCII đơn giản. Nó đòi hỏi việc nắm bắt ngữ cảnh—địa hình vật lý của trang, các đường cong baseline, sửa chữa hiện tượng thấm mực, ghi chú lề, viết tắt và sự không chắc chắn trong paleography. Lĩnh vực chuyên môn này, thường được xếp vào Nhận dạng Văn bản Thủ viết (HTR), phụ thuộc mạnh mẽ vào định dạng tệp được sử dụng để lưu trữ và trao đổi cả tọa độ hình ảnh và lớp văn bản.
Việc chọn sai lược đồ có thể làm mất dữ liệu baseline quan trọng, phá vỡ sự đồng bộ với các manifest của IIIF (International Image Interoperability Framework), hoặc ngăn cản việc bảo tồn kỹ thuật số lâu dài. Dưới đây là hướng dẫn chi tiết về các định dạng tệp OCR và HTR hàng đầu cho tài liệu lịch sử, những điểm mạnh cấu trúc của chúng, và cách xác định lựa chọn phù hợp cho quy trình lưu trữ của bạn.
Nghịch lý lịch sử: Tại sao Văn bản thuần và PDF tiêu chuẩn không hiệu quả
OCR in máy thường xuất ra các tệp .txt đơn giản hoặc PDF “sandwich” với các lớp văn bản ẩn phía dưới bản quét. Đối với bản thảo lịch sử và chữ viết tay cursive, các đầu ra này thất bại vì ba lý do cốt lõi:
- Văn bản phi tuyến và bố cục phức tạp: Các nhà viết tay lịch sử không tuân theo các lưới hình chữ nhật gọn gàng. Văn bản chảy vào lề, quấn quanh các chữ cái đầu được trang trí, dệt xen kẽ giữa các sửa chữa nội dòng được chèn vào, hoặc chạy dọc theo gáy sách.
- Đường cơ sở cong và nghiêng: Văn viết tay thường không tuân theo trục ngang cứng nhắc. Các công cụ HTR như Transkribus, Kraken và eScriptorium dựa vào các đường cơ sở dạng polyline thay vì các hộp bao để giải thích các chữ viết có nhiều ligature.
- Độ phức tạp cổ văn và siêu dữ liệu: Nghiên cứu lưu trữ đòi hỏi việc theo dõi các từ viết tắt, biến thể chính tả lịch sử, các đoạn đọc bị hư hỏng và điểm tin cậy ở mức dòng. Các định dạng tài liệu tiêu chuẩn loại bỏ độ chi tiết này.
Để duy trì độ trung thực với hiện vật gốc, cộng đồng lưu trữ dựa vào các sơ đồ XML có cấu trúc được thiết kế để bảo tồn cấu trúc bố cục cùng với văn bản đã sao chép.
1. PAGE XML: Tiêu chuẩn vàng cho Nhận dạng Văn bản viết tay (HTR)
Được phát triển bởi Phòng thí nghiệm Nghiên cứu PRImA (Pattern Recognition & Image Analysis), PAGE XML (Page Analysis and Groundtruth Elements) được xem rộng rãi là định dạng tiên tiến nhất cho nhận dạng văn bản viết tay và phân tích bố cục nâng cao.
Kiến trúc cốt lõi
PAGE XML coi tài liệu vật lý như một cấu trúc phân cấp:
PcGts(Gốc)Page(Kích thước hình ảnh và thứ tự đọc tổng thể)TextRegion(Đoạn văn, tiêu đề, ghi chú lề, từ khóa)TextLineCoords(Tọa độ đa giác quanh dòng)Baseline(Một chuỗi các điểm theo đường cơ sở thực của văn bản)TextEquiv(Văn bản đã nhận dạng, kèm các chỉ số độ tin cậy tùy chọn)
Lý do nó xuất sắc cho bản thảo lịch sử
- Độ chính xác Đa giác và Đa đường: Thay vì ép các ký tự vào các hộp bao hình chữ nhật, PAGE XML sử dụng ranh giới đa điểm đa giác và các đường cơ sở liên tục. Điều này ngăn các phần trên và dưới của chữ viết tay chồng lấn gây cản trở việc phân đoạn.
- Các loại cấu trúc chi tiết: Các vùng có thể được phân loại một cách chính xác (ví dụ,
marginalia,drop-capital,signature-mark,header,editorial-note). - Hệ sinh thái phần mềm rộng lớn: Nó phục vụ như lược đồ nội bộ và xuất khẩu chính cho các nền tảng HTR hàng đầu như Transkribus, eScriptorium, và Kraken.
2. ALTO XML: Trụ cột mạnh mẽ cho Thư viện và Lưu trữ
ALTO (Analyzed Layout and Text Object) là một tiêu chuẩn XML mở do Thư viện Quốc hội Hoa Kỳ duy trì và được nhiều thư viện quốc gia áp dụng rộng rãi, bao gồm Thư viện Quốc gia Pháp (BnF) và Thư viện Anh.
Kiến trúc cốt lõi
ALTO cấu trúc bố cục theo cấp bậc từ Page đến PrintSpace, sau đó đến TextBlock, TextLine, và String (các từ hoặc token riêng lẻ). Nó thường được đóng gói trong một lớp bao METS (Metadata Encoding and Transmission Standard) để liên kết siêu dữ liệu cấu trúc với các hình ảnh gốc độ phân giải cao.
Các điểm mạnh chính và trường hợp sử dụng
- Quy trình số hoá hàng loạt: ALTO được thiết kế với mục tiêu số hoá báo chí và sách ở quy mô công nghiệp. Nó mã hoá một cách sạch sẽ các thuộc tính phông chữ, tọa độ mức từ, độ tin cậy của ký tự, và khoảng trắng.
- Hỗ trợ HTR hiện đại (ALTO 4): Các phiên bản trước của ALTO dựa mạnh vào các tọa độ hình chữ nhật (
HPOS,VPOS,WIDTH,HEIGHT). Tuy nhiên, bắt đầu với phiên bản ALTO 4, lược đồ đã giới thiệu các đa giác<Shape>và đường cơ sở polyline, lấp đầy khoảng trống chức năng so với PAGE XML cho tài liệu viết tay. - Bảo tồn lâu dài: Vì đây là tiêu chuẩn chính thức được hỗ trợ bởi các liên minh thư viện quốc tế, ALTO đảm bảo tính ổn định lâu dài và khả năng tương thích ngược cấp lưu trữ.
3. hOCR: Tiêu chuẩn nhẹ, ưu tiên web
Được tạo ra bởi Thomas Breuel, hOCR áp dụng cách tiếp cận thực dụng: thay vì tạo một lược đồ XML hoàn toàn mới, nó nhúng siêu dữ liệu bố cục và phiên âm trực tiếp vào HTML/XHTML ngữ nghĩa bằng cách sử dụng microformat và thuộc tính lớp.
Ví dụ cú pháp điển hình
<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
<div class="ocr_carea" id="block_1_1">
<p class="ocr_par" id="par_1_1">
<span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
<span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Mở đầu</span>
</span>
</p>
</div>
</div>
Ưu và nhược điểm cho tài liệu lịch sử
- Ưu điểm: Trình duyệt có thể hiển thị nó một cách tự nhiên. Nó dễ dàng được chuyển đổi bằng CSS và JavaScript thuần, và là định dạng xuất có cấu trúc mặc định cho các công cụ như Tesseract.
- Nhược điểm: Hỗ trợ gốc cho các đường cơ sở cong đa điểm phức tạp, tự do là hạn chế. Mặc dù thực tế cho các tác phẩm in sớm (incunabula hoặc bản in sạch), hOCR gặp khó khăn với bố cục bản thảo hỗn loạn và các ghi chú lề đa lớp.
4. TEI-XML: Tiêu chuẩn cho học thuật và nhân văn số
Định dạng Text Encoding Initiative (TEI) không phải là định dạng đầu ra của công cụ OCR một cách nghiêm ngặt; thay vào đó, nó là tiêu chuẩn hàng đầu cho các ấn bản kỹ thuật số phê bình và việc biểu diễn học thuật các văn bản văn học và lịch sử.
Kết nối OCR/HTR với TEI
Các quy trình hiện đại hiếm khi dừng lại ở việc nhận dạng ký tự thô. Các học giả sử dụng các công cụ như Transkribus TEI Exporter hoặc các quy trình XSLT tự động để chuyển đổi PAGE XML hoặc tệp ALTO thành XML tuân theo TEI:
- Các từ viết tắt được mở rộng (
<choice><abbr>...</abbr><expan>...</expan></choice>). - Các phần xóa, thêm và tay viết được phân loại chính thức (
<add>,<del>,<handShift>). - Dữ liệu bố cục được bảo tồn cùng với phân tích văn học thông qua các phần tử
<facsimile>và<surface>.
Nếu dự án lịch sử của bạn nhằm tạo ra một ấn bản phê bình tương tác hoặc một kho lưu trữ học thuật có khả năng tìm kiếm ngữ nghĩa, việc chuyển đổi dữ liệu OCR/HTR của bạn sang TEI-XML thường là bước cuối cùng cần thiết.
Ma trận so sánh: Định dạng OCR/HTR trong một cái nhìn
| Tính năng / Tiêu chí | PAGE XML | ALTO XML (v4+) | hOCR | TEI-XML |
|---|---|---|---|---|
| Miền chính | HTR viết tay & Bản thảo | Số hoá Thư viện Đại chúng | OCR Web & Tìm kiếm Nhẹ | Bản phê bình học thuật |
| Hỗ trợ Cơ bản | Gốc, Polyline đa điểm | Được hỗ trợ (từ v4.0) | Cơ bản (Độ dốc/Độ dịch) | Thông qua ánh xạ sao chép |
| Đa giác bất thường | Đầy đủ | Đầy đủ | Giới hạn | Thông qua các phần tử tọa độ |
| Hệ sinh thái công cụ | Transkribus, eScriptorium | METS, Goobi, Kitodo | Tesseract, Trình xem web | Oxygen, TEI Publisher |
| Cơ quan tiêu chuẩn hoá | PRImA Group / Open | Thư viện Quốc hội | Đặc tả cộng đồng | Liên minh TEI |
Khuyến nghị thực tiễn: Lựa chọn quy trình lưu trữ của bạn
Để thiết lập một quy trình số hóa hiệu quả, bền vững cho tương lai:
- Đối với Bản thảo và Lưu trữ Viết tay Thuần túy: Chuẩn hoá việc sao chép và trích xuất bố cục của bạn trên PAGE XML. Việc tính toán đường cơ sở và vẽ đa giác của nó xử lý các nét viết không chuẩn với mức mất dữ liệu tối thiểu.
- Đối với Thư viện Quy mô Lớn và Bộ sưu tập Hỗn hợp: Chọn ALTO XML (v4.2 hoặc cao hơn) kết hợp với METS. Điều này đảm bảo tích hợp liền mạch vào kiến trúc kho lưu trữ kỹ thuật số tiêu chuẩn và hệ thống quản lý tài sản kỹ thuật số (DAMS).
- Đối với Trình bày Web & Chỉ mục Tìm kiếm Toàn văn: Sử dụng hOCR hoặc tạo ra các cấu trúc GeoJSON/Annotation Web nhẹ từ PAGE XML để điều khiển các trình xem IIIF tương tác (như Mirador hoặc Universal Viewer) với các lớp phủ văn bản trực tiếp trong trình duyệt.
- Cho các ấn bản học thuật & Nghiên cứu cổ văn bản: Tạo dữ liệu ground truth của bạn ở định dạng PAGE XML, thực hiện nhận dạng, và truyền đầu ra qua một bộ chuyển đổi tự động để tạo TEI-XML cho việc đánh dấu biên tập.
Bằng cách ghép nối khả năng cấu trúc của các định dạng này với yêu cầu cổ văn bản của tài liệu nguồn, bạn đảm bảo rằng mọi nét viết, viết tắt và sắc thái lịch sử đều được giải mã được trong nhiều thế kỷ tới.
Câu hỏi thường gặp (FAQ)
Q1. Sự khác biệt cơ bản giữa OCR tiêu chuẩn và HTR là gì? OCR nhận dạng kiểu chữ máy in đồng nhất, trong khi HTR (Nhận dạng Văn bản viết tay) sử dụng mạng nơ-ron sâu để giải mã chữ viết tay liên tục, biến đổi của con người và các đường cơ sở cong.
Q2. Tesseract OCR có thể tạo ra PAGE XML hoặc đầu ra ALTO cho tài liệu lịch sử không? Có, Tesseract có thể tạo XML ALTO gốc và đầu ra hOCR, và các wrapper của bên thứ ba có thể chuyển đổi các kết quả này sang PAGE XML.
Q3. Tại sao các đường cơ sở lại quan trọng hơn các hộp bao quanh trong việc chuyển đổi văn bản viết tay? Các đường cơ sở theo dõi đường nét tự nhiên, gợn sóng của chữ viết tay con người, cho phép phần mềm tách các phần lên và xuống chồng chéo mà va chạm trong các hộp bao quanh cứng nhắc.
Câu 4. Tiêu chuẩn IIIF tương tác như thế nào với các định dạng tệp OCR này? IIIF cung cấp hình ảnh độ phân giải cao thông qua các API web mở, trong khi các định dạng như ALTO hoặc PAGE XML cung cấp dữ liệu tọa độ có thể được chuyển đổi thành các chú thích Tìm kiếm Nội dung IIIF.
Câu 5. Định dạng tệp nào dễ dàng chuyển đổi trực tiếp thành PDF có thể tìm kiếm? Cả hOCR và ALTO XML đều có thể kết hợp với hình ảnh trang gốc để tạo ra các tệp PDF hai lớp có thể tìm kiếm bằng các công cụ như OCRmyPDF.