সর্বশেষ আপডেট: 20 Aug, 2026

OCR File Formats for Historical and Handwritten Documents

ঐতিহাসিক এবং হস্তলিখিত নথির জন্য OCR ফাইল ফরম্যাটগুলি

ডিজিটাইজেশনের মাধ্যমে সাংস্কৃতিক ঐতিহ্য সংরক্ষণ একটি পুনর্জাগরণে প্রবেশ করেছে। যদিও প্রাথমিক অপটিক্যাল ক্যারেক্টার রিকগনিশন (OCR) সিস্টেমগুলি বিশ শতকের পরিষ্কার, মেশিন-প্রিন্টেড কাগজপত্র বিশ্লেষণের জন্য তৈরি করা হয়েছিল, আধুনিক সাংস্কৃতিক ঐতিহ্য সংস্থাগুলি এখন আরও জটিল ও সমৃদ্ধ চ্যালেঞ্জের মুখোমুখি: মধ্যযুগীয় পাণ্ডুলিপি, উনবিংশ শতাব্দীর কুর্সিভ চিঠিপত্র, ভঙ্গুর আলোকিত পাতা, এবং শতাব্দী পুরনো রেজিস্ট্রি।

ঐতিহাসিক নথি ট্রান্সক্রাইব করা আর শুধুমাত্র সাধারণ ASCII টেক্সট বের করার ব্যাপার নয়। এটি প্রসঙ্গ—পৃষ্ঠার শারীরিক জ্যামিতি, বেসলাইন কার্ভ, ব্লিড-থ্রু সংশোধন, মার্জিনালিয়া, সংক্ষিপ্ত রূপ, এবং প্যালিওগ্রাফিক অনিশ্চয়তা—ধরনটি ধারণ করতে হয়। এই বিশেষায়িত ক্ষেত্র, যা প্রায়ই হ্যান্ডরিটেন টেক্সট রিকগনিশন (HTR) হিসেবে শ্রেণীবদ্ধ হয়, ইমেজ কোঅর্ডিনেট এবং টেক্সট লেয়ার উভয়ই সংরক্ষণ ও বিনিময়ের জন্য ব্যবহৃত ফাইল ফরম্যাটের উপর ব্যাপকভাবে নির্ভরশীল।

ভুল স্কিমা নির্বাচন করলে গুরুত্বপূর্ণ বেসলাইন ডেটা হারিয়ে যেতে পারে, IIIF (International Image Interoperability Framework) ম্যানিফেস্টের সাথে সামঞ্জস্য ভেঙে যেতে পারে, অথবা দীর্ঘমেয়াদী ডিজিটাল সংরক্ষণে বাধা সৃষ্টি হতে পারে। এখানে ঐতিহাসিক নথির জন্য শীর্ষ OCR এবং HTR ফাইল ফরম্যাটগুলির একটি চূড়ান্ত গাইড দেওয়া হয়েছে, তাদের কাঠামোগত শক্তি এবং আপনার আর্কাইভাল পাইপলাইনের জন্য সঠিক পছন্দ কীভাবে নির্ধারণ করবেন।

ঐতিহাসিক দ্বিধা: কেন সাধারণ টেক্সট এবং স্ট্যান্ডার্ড PDF গুলো ব্যর্থ হয়

মেশিন-প্রিন্টেড OCR প্রায়ই সহজ .txt ফাইল বা “স্যান্ডউইচ” PDF আউটপুট করে, যেখানে স্ক্যানের নিচে লুকানো টেক্সট লেয়ার থাকে। ঐতিহাসিক পাণ্ডুলিপি এবং কার্সিভ হ্যান্ডরাইটিংয়ের জন্য, এই আউটপুটগুলি তিনটি মূল কারণে ব্যর্থ হয়:

  1. নন-লিনিয়ার টেক্সট এবং জটিল লেআউট: ঐতিহাসিক লিপিকরা সুশৃঙ্খল আয়তাকার গ্রিড অনুসরণ করতেন না। টেক্সট মার্জিনে প্রবাহিত হয়, আলোকিত অক্ষরের চারপাশে মোড়ানো হয়, সন্নিবেশিত আন্তঃরৈখিক সংশোধনের মধ্যে বুনে যায়, অথবা স্পাইনের বরাবর উল্লম্বভাবে চলে।
  2. বক্র এবং ঢালু বেসলাইন: কার্সিভ লেখনী খুব কমই কঠোর অনুভূমিক অক্ষ অনুসরণ করে। ট্রান্সক্রিবাস, ক্রেকেন এবং ইস্ক্রিপ্টোরিয়ামের মতো HTR ইঞ্জিনগুলি লিগেচার-সমৃদ্ধ স্ক্রিপ্ট ব্যাখ্যা করতে বাউন্ডিং বক্সের পরিবর্তে পলিলাইন বেসলাইন ব্যবহার করে।
  3. প্যালিওগ্রাফিক জটিলতা এবং মেটাডেটা: আর্কাইভাল গবেষণার জন্য সংক্ষিপ্ত রূপ, ঐতিহাসিক বানানের বৈচিত্র্য, ক্ষতিগ্রস্ত পাঠ এবং লাইন-লেভেল কনফিডেন্স স্কোর ট্র্যাক করা প্রয়োজন। স্ট্যান্ডার্ড ডকুমেন্ট ফরম্যাটগুলি এই সূক্ষ্মতা বাদ দেয়।

মূল আর্টিফ্যাক্টের প্রতি সত্যনিষ্ঠা বজায় রাখতে, আর্কাইভাল কমিউনিটি লেআউট টপোলজি এবং ট্রান্সক্রাইব করা টেক্সট উভয়ই সংরক্ষণ করার জন্য ডিজাইন করা গঠিত XML স্কিমার উপর নির্ভর করে।

১. PAGE XML: হস্তলিখিত টেক্সট স্বীকৃতির (HTR) স্বর্ণ মানদণ্ড

PRImA (প্যাটার্ন রিকগনিশন ও ইমেজ অ্যানালাইসিস) রিসার্চ ল্যাব দ্বারা উন্নত, PAGE XML (পেজ অ্যানালাইসিস এবং গ্রাউন্ডট্রুথ এলিমেন্টস) হ্যান্ডরিটেন টেক্সট রিকগনিশন এবং উন্নত লেআউট বিশ্লেষণের জন্য সর্বাধুনিক ফরম্যাট হিসেবে ব্যাপকভাবে স্বীকৃত।

মূল স্থাপত্য

PAGE XML শারীরিক ডকুমেন্টকে একটি হায়ারার্কিক্যাল কাঠামো হিসেবে বিবেচনা করে:

  • PcGts (রুট)
    • Page (ইমেজের মাত্রা এবং সামগ্রিক পাঠের ক্রম)
      • TextRegion (অনুচ্ছেদ, শিরোনাম, মার্জিন নোট, ক্যাচওয়ার্ডস)
        • TextLine
          • Coords (লাইনটির চারপাশের পলিগন কোঅর্ডিনেটস)
          • Baseline (লিপির প্রকৃত বেসলাইন অনুসরণকারী পয়েন্টের একটি সিরিজ)
          • TextEquiv (সনাক্তকৃত টেক্সট, ঐচ্ছিক কনফিডেন্স মেট্রিক্স সহ)

কেন এটি ঐতিহাসিক পাণ্ডুলিপির জন্য উৎকৃষ্ট

  • পলিগন এবং পলিলাইন নির্ভুলতা: আয়তাকার বাউন্ডিং বক্সে অক্ষরগুলোকে জোরপূর্বক ফিট করার পরিবর্তে, PAGE XML বহু-বিন্দু পলিগন সীমানা এবং ধারাবাহিক বেসলাইন ব্যবহার করে। এটি ওভারল্যাপিং কার্সিভ অ্যাসেন্ডার এবং ডেসেন্ডারকে সেগমেন্টেশনে বাধা দেওয়া থেকে রোধ করে।
  • বিস্তৃত কাঠামোগত ধরন: অঞ্চলগুলোকে সুনির্দিষ্টভাবে শ্রেণীবদ্ধ করা যায় (যেমন, marginalia, drop-capital, signature-mark, header, editorial-note).
  • ব্রড সফটওয়্যার ইকোসিস্টেম: এটি ফ্ল্যাগশিপ HTR প্ল্যাটফর্মগুলোর জন্য প্রধান অভ্যন্তরীণ এবং রপ্তানি স্কিমা হিসেবে কাজ করে, যেমন Transkribus, eScriptorium, এবং Kraken।

২. ALTO XML: লাইব্রেরি এবং সংরক্ষণাগার শক্তি কেন্দ্র

ALTO (Analyzed Layout and Text Object) হল একটি ওপেন XML স্ট্যান্ডার্ড যা Library of Congress দ্বারা রক্ষণাবেক্ষণ করা হয় এবং জাতীয় লাইব্রেরিগুলোর দ্বারা ব্যাপকভাবে গ্রহণ করা হয়েছে, যার মধ্যে Bibliothèque nationale de France (BnF) এবং British Library অন্তর্ভুক্ত।

মূল স্থাপত্য

ALTO লেআউটকে হায়ারার্কিক্যালভাবে Page থেকে PrintSpace, তারপর TextBlock, TextLine, এবং String (ব্যক্তিগত শব্দ বা টোকেন) পর্যন্ত গঠন করে। এটি প্রায়ই একটি METS (Metadata Encoding and Transmission Standard) র‍্যাপার-এর ভিতরে প্যাকেজ করা হয় যাতে গঠনমূলক মেটাডেটা উচ্চ-রেজোলিউশনের মাস্টার ইমেজের সাথে যুক্ত করা যায়।

প্রধান শক্তি এবং ব্যবহারিক ক্ষেত্র

  • বৃহৎ ডিজিটাইজেশন কর্মপ্রবাহ: ALTO শিল্প-স্কেল সংবাদপত্র এবং বই ডিজিটাইজেশনকে মাথায় রেখে ডিজাইন করা হয়েছে। এটি ফন্টের বৈশিষ্ট্য, শব্দ-স্তরের কোঅর্ডিনেট, ক্যারেক্টার কনফিডেন্স, এবং হোয়াইট স্পেসগুলোকে পরিষ্কারভাবে এনকোড করে।
  • আধুনিক HTR সমর্থন (ALTO 4): পূর্বের ALTO সংস্করণগুলি আয়তাকার কোঅর্ডিনেট (HPOS, VPOS, WIDTH, HEIGHT) উপর ব্যাপকভাবে নির্ভরশীল ছিল। তবে, ALTO সংস্করণ 4 থেকে শুরু করে, স্কিমা <Shape> পলিগন এবং পলিলাইন বেসলাইন পরিচয় করিয়ে দেয়, হ্যান্ডরাইটেন উপকরণের জন্য PAGE XML এর সঙ্গে কার্যকর ফাঁকটি বন্ধ করে।
  • দীর্ঘমেয়াদী সংরক্ষণ: এটি আন্তর্জাতিক লাইব্রেরি কনসোর্টিয়ামের সমর্থিত একটি অফিসিয়াল স্ট্যান্ডার্ড হওয়ায়, ALLO দীর্ঘমেয়াদী স্থিতিশীলতা এবং আর্কাইভ-গ্রেড ব্যাকওয়ার্ডস সামঞ্জস্যতা নিশ্চিত করে।

৩. hOCR: ওয়েব-প্রথম, হালকা মানদণ্ড

থমাস ব্রয়েল দ্বারা তৈরি, hOCR একটি বাস্তববাদী পদ্ধতি গ্রহণ করে: সম্পূর্ণ নতুন XML স্কিমা তৈরি করার পরিবর্তে, এটি লেআউট এবং ট্রান্সক্রিপশন মেটাডেটা সরাসরি সেমান্টিক HTML/XHTML-এ মাইক্রোফরম্যাট এবং ক্লাস অ্যাট্রিবিউট ব্যবহার করে এম্বেড করে।

সাধারণ সিনট্যাক্স উদাহরণ

<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
  <div class="ocr_carea" id="block_1_1">
    <p class="ocr_par" id="par_1_1">
      <span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
        <span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">ইনসিপিট</span>
      </span>
    </p>
  </div>
</div>

ঐতিহাসিক সামগ্রীর জন্য সুবিধা ও অসুবিধা

  • সুবিধা: ব্রাউজারগুলি এটি নেটিভভাবে রেন্ডার করতে পারে। এটি ভ্যানিলা CSS এবং জাভাস্ক্রিপ্ট ব্যবহার করে সহজে রূপান্তরিত করা যায়, এবং এটি Tesseract এর মতো ইঞ্জিনের জন্য ডিফল্ট স্ট্রাকচার্ড এক্সপোর্ট ফরম্যাট।
  • অসুবিধা: জটিল, ফ্রি-ফর্ম বহু-পয়েন্ট বেসলাইন কার্ভের জন্য নেটিভ সমর্থন সীমিত। যদিও প্রাথমিক মুদ্রিত কাজ (ইনকুনাবুলা বা পরিষ্কার ব্রডসাইড) জন্য ব্যবহারিক, hOCR অস্থির পাণ্ডুলিপি লেআউট এবং বহু-স্তরের মার্জিনালিয়ার সঙ্গে সংগ্রাম করে।

৪. TEI-XML: একাডেমিক ও ডিজিটাল মানবিকশাস্ত্রের বেঞ্চমার্ক

Text Encoding Initiative (TEI) ফরম্যাটটি কঠোরভাবে OCR ইঞ্জিনের আউটপুট ফরম্যাট নয়; বরং, এটি সমালোচনামূলক ডিজিটাল সংস্করণ এবং সাহিত্যিক ও ঐতিহাসিক টেক্সটের শিক্ষাবিদ্যপূর্ণ উপস্থাপনার শীর্ষ মানদণ্ড।

OCR/HTR-কে TEI-র সাথে সংযোগ করা

আধুনিক পাইপলাইনগুলি কাঁচা অক্ষর স্বীকৃতিতে বিরলভাবে থামে। পণ্ডিতরা Transkribus TEI Exporter অথবা স্বয়ংক্রিয় XSLT পাইপলাইন ব্যবহার করে PAGE XML বা ALTO ফাইলগুলোকে TEI-সম্মত XML-এ রূপান্তর করে:

  • সংক্ষিপ্ত রূপগুলো প্রসারিত করা হয় (<choice><abbr>...</abbr><expan>...</expan></choice>)।
  • মুছে ফেলা, সংযোজন এবং লেখকের হাতগুলো আনুষ্ঠানিকভাবে শ্রেণীবদ্ধ করা হয় (<add>, <del>, <handShift>)।
  • লেআউট ডেটা সাহিত্য বিশ্লেষণের সঙ্গে <facsimile> এবং <surface> উপাদানগুলির মাধ্যমে সংরক্ষিত থাকে।

যদি আপনার ঐতিহাসিক প্রকল্পের লক্ষ্য একটি ইন্টারেক্টিভ সমালোচনামূলক সংস্করণ বা অর্থগতভাবে অনুসন্ধানযোগ্য শিক্ষাবিদ্যপূর্ণ আর্কাইভ তৈরি করা হয়, তবে আপনার OCR/HTR ডেটা TEI-XML-এ রূপান্তর করা প্রায়শই প্রয়োজনীয় শেষ ধাপ হয়।

তুলনামূলক ম্যাট্রিক্স: এক নজরে OCR/HTR ফরম্যাটগুলি

বৈশিষ্ট্য / মানদণ্ডPAGE XMLALTO XML (v4+)hOCRTEI-XML
প্রাথমিক ডোমেইনকর্সিভ HTR & পাণ্ডুলিপিবৃহৎ লাইব্রেরি ডিজিটাইজেশনওয়েব OCR & হালকা অনুসন্ধানশিক্ষাগত সমালোচনামূলক সংস্করণ
বেসলাইন সাপোর্টনেটিভ, মাল্টি-পয়েন্ট পলিলাইনসমর্থিত (v4.0 থেকে)বেসিক (স্লোপ/অফসেট)ফ্যাক্সিমিলি ম্যাপিং এর মাধ্যমে
অনিয়মিত বহুভুজপূর্ণপূর্ণসীমিতকোঅর্ডিনেট উপাদানগুলির মাধ্যমে
টুলিং ইকোসিস্টেমTranskribus, eScriptoriumMETS, Goobi, KitodoTesseract, ওয়েব ভিউয়ার্সOxygen, TEI Publisher
মানকীকরণ সংস্থাPRImA Group / Openকংগ্রেস লাইব্রেরিকমিউনিটি স্পেসিফিকেশনTEI কনসোর্টিয়াম

প্রায়োগিক সুপারিশ: আপনার আর্কাইভাল পাইপলাইন নির্বাচন করা

একটি কার্যকর, ভবিষ্যৎ-প্রমাণ ডিজিটাইজেশন পাইপলাইন প্রতিষ্ঠার জন্য:

  1. শুদ্ধ হস্তলিখিত পাণ্ডুলিপি ও আর্কাইভের জন্য: আপনার ট্রান্সক্রিপশন এবং লেআউট এক্সট্রাকশনকে PAGE XML-এ মানসম্মত করুন। এর বেসলাইন গণনা এবং পলিগন কন্ট্যুরিং অ-মানক লেখকের হাতে ন্যূনতম ডেটা ক্ষতি সহ পরিচালনা করে।
  2. বৃহৎ-স্কেল লাইব্রেরি ও মিশ্র সংগ্রহের জন্য: ALTO XML (v4.2 বা তার উপরে) কে METS এর সাথে যুক্ত করুন। এটি স্ট্যান্ডার্ড ডিজিটাল রেপোজিটরি আর্কিটেকচার এবং ডিজিটাল অ্যাসেট ম্যানেজমেন্ট সিস্টেম (DAMS)-এ নিরবচ্ছিন্ন ইন্টিগ্রেশন নিশ্চিত করে।
  3. ওয়েব উপস্থাপন ও পূর্ণ-পাঠ্য অনুসন্ধান সূচকের জন্য: ইন্টারেক্টিভ IIIF ভিউয়ার (যেমন Mirador বা Universal Viewer) চালানোর জন্য hOCR ব্যবহার করুন অথবা PAGE XML থেকে হালকা ওজনের GeoJSON/Web Annotation কাঠামো তৈরি করুন, যা ব্রাউজার-ভিত্তিক লাইভ টেক্সট ওভারলে প্রদান করে।
  4. শৈল্পিক সংস্করণ ও প্যালিওগ্রাফিক গবেষণার জন্য: PAGE XML-এ আপনার গ্রাউন্ড ট্রুথ তৈরি করুন, স্বীকৃতি সম্পাদন করুন, এবং স্বয়ংক্রিয় কনভার্টার ব্যবহার করে আউটপুটকে TEI-XML-এ রূপান্তর করুন সম্পাদনামূলক মার্কআপের জন্য।

এই ফরম্যাটগুলোর কাঠামোগত সক্ষমতাকে আপনার উৎস সামগ্রীর প্যালিওগ্রাফিক চাহিদার সঙ্গে মিলিয়ে, আপনি নিশ্চিত করেন যে প্রতিটি স্ট্রোক, সংক্ষিপ্ত রূপ এবং ঐতিহাসিক সূক্ষ্মতা শতাব্দী পরেও বোধগম্য থাকবে।

প্রায়শই জিজ্ঞাসিত প্রশ্ন (FAQ)

Q1. স্ট্যান্ডার্ড OCR এবং HTR এর মৌলিক পার্থক্য কী? OCR ধারাবাহিক মেশিন-প্রিন্টেড টাইপোগ্রাফি সনাক্ত করে, যেখানে HTR (হ্যান্ডরিটেন টেক্সট রিকগনিশন) গভীর নিউরাল নেটওয়ার্ক ব্যবহার করে ধারাবাহিক, পরিবর্তনশীল মানব হ্যান্ডরাইটিং এবং বক্র বেসলাইন ডিকোড করে।

Q2. ঐতিহাসিক নথির জন্য Tesseract OCR কি PAGE XML বা ALTO আউটপুট তৈরি করতে পারে? হ্যাঁ, Tesseract নেটিভ ALTO XML এবং hOCR আউটপুট তৈরি করতে পারে, এবং তৃতীয় পক্ষের র্যাপারগুলি এই ফলাফলগুলোকে PAGE XML-এ রূপান্তর করতে পারে।

Q3. হ্যান্ডরিটেন টেক্সট ট্রান্সক্রিপশনে বেসলাইনগুলি বাউন্ডিং বক্সের চেয়ে কেন বেশি গুরুত্বপূর্ণ? বেসলাইনগুলি মানব লেখার স্বাভাবিক, তরঙ্গায়িত লাইনকে ট্র্যাক করে, যা সফটওয়্যারকে কঠোর বাউন্ডিং বক্সের মধ্যে সংঘর্ষকারী ওভারল্যাপিং অ্যাসেন্ডার এবং ডেসেন্ডারগুলোকে আলাদা করতে সক্ষম করে।

প্রশ্ন ৪. IIIF মানদণ্ড কীভাবে এই OCR ফাইল ফরম্যাটগুলোর সঙ্গে মিথস্ক্রিয়া করে? IIIF ওপেন ওয়েব API এর মাধ্যমে উচ্চ রেজোলিউশনের ছবি সরবরাহ করে, আর ALTO বা PAGE XML এর মতো ফরম্যাটগুলো কোঅর্ডিনেট ডেটা প্রদান করে যা IIIF কন্টেন্ট সার্চ অ্যানোটেশনে রূপান্তর করা যায়।

প্রশ্ন ৫. কোন ফাইল ফরম্যাটটি সরাসরি একটি অনুসন্ধানযোগ্য PDF-এ রূপান্তর করা সবচেয়ে সহজ? hOCR এবং ALTO XML উভয়ই মূল পৃষ্ঠার ছবির সঙ্গে যুক্ত করে OCRmyPDF এর মতো টুল ব্যবহার করে অনুসন্ধানযোগ্য দ্বি-স্তরীয় PDF ফাইল তৈরি করা যায়।

আরও দেখুন