آخرین به‌روزرسانی: 20 Aug, 2026

OCR File Formats for Historical and Handwritten Documents

قالب‌های فایل OCR برای اسناد تاریخی و دست‌نویس

حفظ میراث فرهنگی از طریق دیجیتالی‌سازی وارد دوره‌ای از رنسانس شده است. در حالی که سیستم‌های اولیه تشخیص نوری کاراکتر (OCR) برای پردازش اسناد بی‌نقص و چاپ‌ماشینی قرن بیستم طراحی شده بودند، مؤسسات مدرن میراث فرهنگی با چالشی بسیار پیچیده‌تر و غنی‌تر مواجه هستند: نسخه‌های خطی قرون وسطی، مکاتبات دست‌نویس قرن نوزدهم، صفحات نورانی شکننده، و ثبت‌نام‌های صدساله.

رونوشت‌برداری از اسناد تاریخی دیگر فقط به استخراج متن ساده ASCII محدود نیست. این کار نیاز به ضبط زمینه—ژئومتری فیزیکی صفحه، منحنی‌های خط پایه، اصلاحات نفوذ رنگ، حاشیه‌نویسی‌ها، اختصارات و عدم قطعیت پالیوگرافی. این حوزه تخصصی که اغلب تحت دسته‌بندی تشخیص متن دست‌نویس (HTR) قرار می‌گیرد، به شدت به فرمت فایل مورد استفاده برای ذخیره و تبادل هر دو مختصات تصویر و لایه‌های متنی وابسته است.

انتخاب طرح‌وارهٔ نادرست می‌تواند داده‌های حیاتی خط پایه را حذف کند، هم‌راستایی با مانیفست‌های IIIF (International Image Interoperability Framework) را خراب کند، یا مانع از حفظ دیجیتال بلندمدت شود. در اینجا یک راهنمای قطعی برای فرمت‌های برتر فایل‌های OCR و HTR برای اسناد تاریخی، نقاط قوت ساختاری آن‌ها، و چگونگی تعیین انتخاب مناسب برای خط لولهٔ بایگانی شما ارائه شده است.

معضل تاریخی: چرا متن ساده و استاندارد PDFها شکست می‌خورند

OCR چاپ‌ماشینی اغلب فایل‌های سادهٔ .txt یا PDFهای “ساندویچی” با لایه‌های متن مخفی زیر اسکن را خروجی می‌دهد. برای نسخه‌های تاریخی و دست‌خط‌های خوش‌خط، این خروجی‌ها به دلایل اصلی سه‌گانه‌ای ناکام می‌مانند:

  1. متن غیرخطی و چیدمان‌های پیچیده: نویسندگان تاریخی به شبکه‌های مستطیلی منظم پایبند نبودند. متن به حاشیه‌ها جاری می‌شود، دور حروف بزرگ نورانی می‌پیچد، بین اصلاحات بین‌خطی درج‌شده می‌درخشد، یا به صورت عمودی در طول پشت کتاب می‌چرخد.
  2. خط پایه‌های منحنی و مایل: نوشتار دست‌خط به ندرت محور افقی سفت و سختی را دنبال می‌کند. موتورهای HTR مانند Transkribus، Kraken و eScriptorium به جای جعبه‌های محدودکننده، بر خطوط پایه چندخطی برای تفسیر اسکریپت‌های پر از لیگچر تکیه می‌کنند.
  3. پیچیدگی پالیگرافی و فراداده‌ها: پژوهش‌های بایگانی نیاز به ردیابی اختصارات، تغییرات املایی تاریخی، خوانش‌های آسیب‌دیده و امتیازهای اطمینان در سطح خط دارند. فرمت‌های استاندارد سند این جزئیات را حذف می‌کنند.

برای حفظ صحت به شیء اصلی، جامعه بایگانی بر طرح‌واره‌های XML ساختاریافته‌ای که برای حفظ توپولوژی چیدمان همراه با متن رونویسی‌شده طراحی شده‌اند، تکیه می‌کند.

1. PAGE XML: استاندارد طلایی برای تشخیص متن دست‌نویس (HTR)

توسط آزمایشگاه تحقیقاتی PRImA (تشخیص الگو و تحلیل تصویر) توسعه یافته، PAGE XML (عناصر تجزیه و تحلیل صفحه و حقیقت پایه) به طور گسترده به عنوان فرمت پیشرفته‌ترین برای تشخیص متن دست‌نویس و تجزیه و تحلیل پیشرفته چیدمان شناخته می‌شود.

معماری اصلی

PAGE XML سند فیزیکی را به عنوان یک ساختار سلسله‌مراتبی در نظر می‌گیرد:

  • PcGts (ریشه)
    • Page (ابعاد تصویر و ترتیب خواندن کلی)
      • TextRegion (پاراگراف‌ها، عناوین، حاشیه‌نویسی‌ها، کلمات کلیدی)
        • TextLine
          • Coords (مختصات چندضلعی اطراف خط)
          • Baseline (یک سری نقطه که خط پایه واقعی متن را دنبال می‌کند)
          • TextEquiv (متن شناسایی‌شده، با معیارهای اختیاری اطمینان)

چرا برای نسخه‌های خطی تاریخی برتر است

  • دقت چندضلعی و چندخطی: به‌جای مجبور کردن حروف به جعبه‌های مستطیلی، PAGE XML از مرزهای چندنقطه‌ای چندضلعی و خطوط پایه پیوسته استفاده می‌کند. این کار از تداخل حروف دست‌نویس با بالا رفتن‌ها و پایین رفتن‌ها که می‌تواند بر تقسیم‌بندی تأثیر بگذارد، جلوگیری می‌کند.
  • انواع ساختاری جزئی: نواحی می‌توانند به‌دقت طبقه‌بندی شوند (مثلاً marginalia، drop-capital، signature-mark، header، editorial-note).
  • اکوسیستم گسترده نرم‌افزاری: به عنوان طرح‌وارهٔ اصلی داخلی و صادراتی برای پلتفرم‌های برجسته HTR مانند Transkribus، eScriptorium و Kraken عمل می‌کند.

2. ALTO XML: قدرت‌مند کتابخانه‌ای و بایگانی

ALTO (Analyzed Layout and Text Object) یک استاندارد باز XML است که توسط کتابخانه کنگره نگهداری می‌شود و به‌طور گسترده‌ای توسط کتابخانه‌های ملی، از جمله Bibliothèque nationale de France (BnF) و کتابخانه بریتانیا، پذیرفته شده است.

معماری اصلی

ALTO ساختار چیدمان را به‌صورت سلسله‌مراتبی از Page تا PrintSpace و سپس به TextBlock، TextLine و String (کلمات یا توکن‌های منفرد) تعریف می‌کند. این استاندارد اغلب داخل یک بستهٔ METS (Metadata Encoding and Transmission Standard) قرار می‌گیرد تا متادیتای ساختاری را با تصاویر اصلی با وضوح بالا مرتبط سازد.

نقاط قوت کلیدی و موارد استفاده

  • گردش‌کارهای دیجیتالی‌سازی انبوه: ALTO با در نظر گرفتن دیجیتالی‌سازی صنعتی روزنامه‌ها و کتاب‌ها طراحی شده است. این استاندارد به‌صورت تمیز ویژگی‌های قلم، مختصات سطح کلمه، اطمینان کاراکتر و فواصل سفید را کدگذاری می‌کند.
  • پشتیبانی مدرن HTR (ALTO 4): نسخه‌های قبلی ALTO به شدت بر مختصات مستطیلی (HPOS, VPOS, WIDTH, HEIGHT) تکیه داشتند. اما با شروع نسخه 4 ALTO، طرح‌واره <Shape> چندضلعی‌ها و خطوط پایه پلی‌لاین را معرفی کرد و شکاف عملکردی با PAGE XML برای مواد دست‌نویس را پر کرد.
  • حفظ طولانی‌مدت: چون یک استاندارد رسمی است که توسط کنسرسیوم‌های بین‌المللی کتابخانه‌ها پشتیبانی می‌شود، ALTO پایداری طولانی‌مدت و سازگاری عقب‌گرد در سطح آرشیوی را تضمین می‌کند.

3. hOCR: استاندارد وب-محور، سبک وزن

ساخته شده توسط توماس بروئل، hOCR رویکردی عملی اتخاذ می‌کند: به جای ایجاد یک طرح‌واره XML کاملاً جدید، متادیتای چیدمان و رونوشت را مستقیماً در HTML/XHTML معنایی با استفاده از میکروفورمت‌ها و ویژگی‌های کلاس جاسازی می‌کند.

مثال معمولی نحو

<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
  <div class="ocr_carea" id="block_1_1">
    <p class="ocr_par" id="par_1_1">
      <span class=\"ocr_line\" id=\"line_1_1\" title=\"bbox 150 320 2200 410; baseline 0 -5\">\n        <span class=\"ocrx_word\" id=\"word_1_1\" title=\"bbox 150 325 380 405; x_wconf 92\">مقدمه</span>\n      </span>
    </p>
  </div>
</div>

مزایا و معایب برای مواد تاریخی

  • مزایا: مرورگرها می‌توانند آن را به‌صورت بومی رندر کنند. به راحتی با استفاده از CSS و JavaScript ساده قابل تبدیل است و فرمت خروجی ساختار یافته پیش‌فرض برای موتورهایی مانند Tesseract می‌باشد.
  • معایب: پشتیبانی بومی برای منحنی‌های پایه چندنقطه‌ای پیچیده و آزاد محدود است. اگرچه برای آثار چاپی اولیه (اینکونابولا یا برگه‌های تمیز) عملی است، hOCR با چیدمان‌های دست‌نویس ناپایدار و حاشیه‌نویسی‌های چندلایه مشکل دارد.

4. TEI-XML: معیار آکادمیک و علوم انسانی دیجیتال

فرمت Text Encoding Initiative (TEI) به‌طور دقیق فرمت خروجی یک موتور OCR نیست؛ بلکه استاندارد برتر برای نسخه‌های دیجیتال انتقادی و نمایش علمی متون ادبی و تاریخی است.

اتصال OCR/HTR به TEI

خطوط لولهٔ مدرن به‌ندرت فقط به تشخیص کاراکترهای خام متوقف می‌شوند. پژوهشگران از ابزارهایی مانند Transkribus TEI Exporter یا خطوط لولهٔ خودکار XSLT برای تبدیل فایل‌های PAGE XML یا ALTO به XML سازگار با TEI استفاده می‌کنند:

  • اختصارات گسترش می‌یابند (<choice><abbr>...</abbr><expan>...</expan></choice>).
  • حذف‌ها، افزودنی‌ها و دست‌نویس‌های خطاطی به‌صورت رسمی طبقه‌بندی می‌شوند (<add>, <del>, <handShift>).
  • داده‌های چیدمان همراه با تحلیل ادبی از طریق عناصر <facsimile> و <surface> حفظ می‌شوند.

اگر پروژهٔ تاریخی شما هدف ایجاد یک نسخهٔ انتقادی تعاملی یا آرشیوی علمی با قابلیت جستجوی معنایی را دارد، تبدیل داده‌های OCR/HTR شما به TEI-XML اغلب گام نهایی مورد نیاز است.

ماتریس مقایسه‌ای: فرمت‌های OCR/HTR در یک نگاه

ویژگی / معیارPAGE XMLALTO XML (v4+)hOCRTEI-XML
حوزه اصلیتشخیص دست‌خط خوش‌خط و نسخه‌های خطیدیجیتالی‌سازی کتابخانه‌های بزرگOCR وب و جستجوی سبکنسخه‌های انتقادی علمی
پشتیبانی پایهپلی‌لاین‌های بومی، چندنقطه‌ایپشتیبانی شده (از نسخه ۴.۰)پایه (شیب/جابه‌جایی)از طریق نقشه‌برداری فاکسیمیل
چندضلعی‌های نامنظمکاملکاملمحدوداز طریق عناصر مختصاتی
اکوسیستم ابزارهاTranskribus, eScriptoriumMETS, Goobi, KitodoTesseract, نمایشگرهای وبOxygen, TEI Publisher
نهاد استانداردسازیPRImA Group / Openکتابخانه کنگرهمشخصات جامعهکنسرسیوم TEI

توصیه‌های عملی: انتخاب خط لوله بایگانی شما

برای ایجاد یک خط لوله دیجیتالی کارآمد و آینده‌نگر:

  1. برای دست‌نوشته‌ها و آرشیوهای کاملاً دست‌نویس: استانداردسازی رونوشت و استخراج چیدمان خود بر روی PAGE XML. محاسبه خط پایه و ترسیم چندضلعی آن، دست‌خط‌های غیر استاندارد را با حداقل از دست رفتن داده‌ها مدیریت می‌کند.
  2. برای کتابخانه‌های بزرگ‌مقیاس و مجموعه‌های ترکیبی: از ALTO XML (v4.2 یا بالاتر) همراه با METS استفاده کنید. این کار یکپارچه‌سازی بدون درز را در معماری‌های استاندارد مخازن دیجیتال و سیستم‌های مدیریت دارایی‌های دیجیتال (DAMS) تضمین می‌کند.
  3. برای ارائه وب و فهرست‌های جستجوی متن کامل: از hOCR استفاده کنید یا ساختارهای سبک وزن GeoJSON/Web Annotation را از PAGE XML استخراج کنید تا نمایشگرهای تعاملی IIIF (مانند Mirador یا Universal Viewer) را با لایه‌های متن زنده در مرورگر هدایت کنید.
  4. برای نسخه‌های علمی و پژوهش‌های پالیوگرافی: داده‌های مرجع خود را در قالب PAGE XML تولید کنید، شناسایی را انجام دهید و خروجی را از طریق یک مبدل خودکار عبور دهید تا TEI-XML برای نشانه‌گذاری ویرایشی تولید شود.

با تطبیق قابلیت‌های ساختاری این فرمت‌ها با نیازهای پالیوگرافی مواد منبع خود، اطمینان می‌یابید که هر خط، اختصار و نکته تاریخی برای قرن‌ها قابل درک باقی می‌ماند.

سوالات متداول (FAQ)

س.۱. تفاوت اساسی بین OCR استاندارد و HTR چیست؟ OCR حروف چاپی ثابت ماشین را شناسایی می‌کند، در حالی که HTR (تشخیص متن دست‌نویس) از شبکه‌های عصبی عمیق برای رمزگشایی دست‌نویس انسانی متغیر و پیوسته و خطوط پایه منحنی استفاده می‌کند.

س.۲. آیا Tesseract OCR می‌تواند خروجی PAGE XML یا ALTO برای اسناد تاریخی تولید کند؟ بله، Tesseract می‌تواند XML بومی ALTO و خروجی hOCR تولید کند و بسته‌های جانبی شخص ثالث می‌توانند این نتایج را به PAGE XML تبدیل کنند.

س.۳. چرا خطوط پایه نسبت به جعبه‌های محدودکننده در رونویسی متن دست‌نویس مهم‌تر هستند؟ خطوط پایه مسیر طبیعی و موج‌دار نوشتار انسانی را دنبال می‌کنند و به نرم‌افزار امکان می‌دهند تا حروف بالارونده و پایین‌روندهٔ همپوشانی که در جعبه‌های محدودکننده سفت برخورد می‌کنند، جدا کنند.

سوال ۴. استاندارد IIIF چگونه با این فرمت‌های فایل OCR تعامل می‌کند؟ IIIF تصاویر با وضوح بالا را از طریق APIهای وب باز ارائه می‌دهد، در حالی که فرمت‌هایی مانند ALTO یا PAGE XML داده‌های مختصاتی را فراهم می‌کنند که می‌توانند به حاشیه‌نویسی‌های جستجوی محتوا در IIIF تبدیل شوند.

سوال ۵. کدام فرمت فایل به‌راحتی می‌تواند مستقیماً به PDF جستجوپذیر تبدیل شود؟ هر دو hOCR و ALTO XML می‌توانند با تصاویر اصلی صفحات ترکیب شوند تا فایل‌های PDF دو لایه جستجوپذیر را با استفاده از ابزارهایی مانند OCRmyPDF بسازند.

موارد مرتبط