<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Pengenalan Teks Tulisan Tangan on File Format Blog</title>
    <link>https://blog.fileformat.com/ms/tag/pengenalan-teks-tulisan-tangan/</link>
    <description>Recent content in Pengenalan Teks Tulisan Tangan on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>ms</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/ms/tag/pengenalan-teks-tulisan-tangan/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Cara Memilih Format Fail yang Betul untuk Pengenalan Teks Tulisan Tangan (HTR)</title>
      <link>https://blog.fileformat.com/ms/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/ms/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Temui format fail OCR dan HTR terbaik untuk manuskrip sejarah dan arkib tulisan tangan, membandingkan ALTO, PAGE XML, hOCR, dan TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Kemas Kini Terakhir</strong>: 20 Ogos, 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="format-fail-ocr-untuk-dokumen-sejarah-dan-tulisan-tangan">Format Fail OCR untuk Dokumen Sejarah dan Tulisan Tangan</h2>
<p>Pemeliharaan warisan budaya melalui digitalisasi telah memasuki zaman kebangkitan. Walaupun sistem pengenalan aksara optik (OCR) awal direka untuk menguraikan dokumen bersih yang dicetak mesin pada abad ke-20, institusi warisan budaya moden menghadapi cabaran yang jauh lebih rumit dan kaya: manuskrip abad pertengahan, korespondensi tulisan sambung abad ke-19, folio beriluminasi yang rapuh, dan daftar berusia satu abad.</p>
<p>Mentranskripsi dokumen sejarah tidak lagi sekadar mengekstrak teks ASCII biasa. Ia memerlukan penangkapan <strong>konteks</strong>—geometri fizikal halaman, lengkung garis dasar, pembetulan tembusan, marginalia, singkatan, dan ketidakpastian paleografik. Bidang khusus ini, yang sering dikategorikan di bawah Pengiktirafan Teks Tangan (HTR), sangat bergantung pada format fail yang digunakan untuk menyimpan dan menukar koordinat imej serta lapisan teks.</p>
<p>Memilih skema yang salah boleh menghilangkan data garis dasar penting, memutuskan penyelarasan dengan manifes IIIF (International Image Interoperability Framework), atau menghalang pemeliharaan digital jangka panjang. Berikut ialah panduan definitif mengenai format fail OCR dan HTR terkemuka untuk dokumen sejarah, kekuatan struktur mereka, dan cara menentukan pilihan yang tepat untuk aliran kerja arkib anda.</p>
<h2 id="dilema-sejarah-mengapa-teks-biasa15-dan-pdf1-standard-gagal">Dilema Sejarah: Mengapa <a href="https//docs.fileformat.com/word-processing/txt/">Teks Biasa</a> dan <a href="https://docs.fileformat.com/pdf/">PDF</a> Standard Gagal</h2>
<p>OCR yang dicetak mesin selalunya menghasilkan fail <code>.txt</code> ringkas atau PDF &ldquo;sandwich&rdquo; dengan lapisan teks tersembunyi di bawah imbasan. Untuk manuskrip sejarah dan tulisan sambung, output ini gagal atas tiga sebab utama:</p>
<ol>
<li><strong>Teks Tidak Linear dan Susun Atur Kompleks:</strong> Penyalin sejarah tidak mematuhi grid segi empat tepat yang kemas. Teks mengalir ke dalam margin, melilit huruf permulaan yang diterangi, menyelit antara pembetulan interlinear yang dimasukkan, atau berjalan menegak di sepanjang punggung.</li>
<li><strong>Garis Dasar Melengkung dan Condong:</strong> Penulisan sambung jarak jarang mengikuti paksi mendatar yang kaku. Enjin HTR seperti Transkribus, Kraken, dan eScriptorium bergantung pada garis dasar polilinia bukan kotak sempadan untuk mentafsir skrip yang banyak ligatur.</li>
<li><strong>Kerumitan Paleografi dan Metadata:</strong> Penyelidikan arkib memerlukan penjejakan singkatan, variasi ejaan sejarah, bacaan rosak, dan skor keyakinan per baris. Format dokumen standard mengabaikan butiran halus ini.</li>
</ol>
<p>Untuk mengekalkan kesetiaan kepada artifak asal, komuniti arkib bergantung pada skema XML berstruktur yang direka untuk memelihara topologi susun atur bersama teks yang ditranskripsi.</p>
<h2 id="1-page-xml-standard-emas-untuk-pengenalan-teks-tulisan-tangan-htr">1. PAGE XML: Standard Emas untuk Pengenalan Teks Tulisan Tangan (HTR)</h2>
<p>Dibangunkan oleh Makmal Penyelidikan PRImA (Pattern Recognition &amp; Image Analysis), <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) secara meluas dianggap sebagai format terkini untuk pengenalan teks tulisan tangan dan analisis susun atur lanjutan.</p>
<h3 id="senibina-teras">Senibina Teras</h3>
<p>PAGE XML menganggap dokumen fizikal sebagai struktur hierarki:</p>
<ul>
<li><code>PcGts</code> (Akar)
<ul>
<li><code>Page</code> (Dimensi imej dan susunan bacaan keseluruhan)
<ul>
<li><code>TextRegion</code> (Perenggan, tajuk, nota marginal, kata kunci)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Koordinat poligon di sekitar garis)</li>
<li><code>Baseline</code> (Siri titik yang mengikuti garis dasar sebenar skrip)</li>
<li><code>TextEquiv</code> (Teks yang dikenali, dengan metrik keyakinan pilihan)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="mengapa-ia-cemerlang-untuk-manuskrip-sejarah">Mengapa Ia Cemerlang untuk Manuskrip Sejarah</h3>
<ul>
<li><strong>Ketepatan Poligon dan Polilin:</strong> Daripada memaksa aksara ke dalam kotak sempadan segi empat tepat, PAGE XML menggunakan sempadan poligon berbilang titik dan garis dasar berterusan. Ini mengelakkan aksara sambung yang bertindih (ascender dan descender) mengganggu segmentasi.</li>
<li><strong>Jenis Struktur Granular:</strong> Ruang dapat diklasifikasikan dengan tepat (contoh, <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Ekosistem Perisian Luas:</strong> Ia berfungsi sebagai skema dalaman dan eksport utama untuk platform HTR unggulan seperti <strong>Transkribus</strong>, <strong>eScriptorium</strong>, dan <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-kuasa-perpustakaan-dan-arkib">2. ALTO XML: Kuasa Perpustakaan dan Arkib</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> ialah standard XML terbuka yang diselenggarakan oleh Library of Congress dan meluas digunakan oleh perpustakaan kebangsaan, termasuk Bibliothèque nationale de France (BnF) dan British Library.</p>
<h3 id="senibina-teras-1">Senibina Teras</h3>
<p>ALTO menyusun susun atur secara hierarki dari <code>Page</code> ke <code>PrintSpace</code>, turun ke <code>TextBlock</code>, <code>TextLine</code>, dan <code>String</code> (perkataan atau token individu). Ia kerap dibungkus dalam pembalut <strong>METS</strong> (Metadata Encoding and Transmission Standard) untuk mengaitkan metadata struktur dengan imej master beresolusi tinggi.</p>
<h3 id="kekuatan-utama-dan-kes-penggunaan">Kekuatan Utama dan Kes Penggunaan</h3>
<ul>
<li><strong>Aliran Kerja Digitasi Besar-besaran:</strong> ALTO direka dengan mempertimbangkan digitasi surat khabar dan buku berskala industri. Ia dengan jelas mengekod atribut fon, koordinat peringkat perkataan, keyakinan aksara, dan ruang putih.</li>
<li><strong>Sokongan HTR Moden (ALTO 4):</strong> Versi-versi awal ALTO sangat bergantung pada koordinat segiempat (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Walau bagaimanapun, bermula dengan <strong>versi ALTO 4</strong>, skema memperkenalkan poligon <code>&lt;Shape&gt;</code> dan baseline polyline, menutup jurang fungsi dengan PAGE XML untuk bahan tulisan tangan.</li>
<li><strong>Pemeliharaan Jangka Panjang:</strong> Oleh kerana ia merupakan standard rasmi yang disokong oleh konsortium perpustakaan antarabangsa, ALTO menjamin kestabilan jangka panjang dan keserasian mundur setaraf arkib.</li>
</ul>
<h2 id="3-hocr-standard-ringan-web-first">3. hOCR: Standard Ringan Web-First</h2>
<p>Dicipta oleh Thomas Breuel, <strong>hOCR</strong> mengambil pendekatan pragmatik: bukannya mencipta skema XML yang sepenuhnya baru, ia menyematkan metadata susun atur dan transkripsi secara langsung ke dalam HTML/XHTML semantik menggunakan mikroformat dan atribut kelas.</p>
<h3 id="contoh-sintaks-biasa">Contoh Sintaks Biasa</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="kelebihan-dan-kekurangan-bahan-sejarah">Kelebihan dan Kekurangan Bahan Sejarah</h3>
<ul>
<li><strong>Kelebihan:</strong> Penyemak imbas dapat memaparkannya secara asli. Ia mudah diubah menggunakan CSS dan JavaScript asas, dan ia merupakan format eksport berstruktur lalai untuk enjin seperti <strong>Tesseract</strong>.</li>
<li><strong>Kekurangan:</strong> Sokongan asli untuk lengkung baseline berbilang titik yang kompleks dan bebas bentuk adalah terhad. Walaupun praktikal untuk karya cetakan awal (incunabula atau lembaran bersih), hOCR menghadapi kesukaran dengan susun atur manuskrip yang tidak menentu dan marginalia berlapis banyak.</li>
</ul>
<h2 id="4-tei-xml-penanda-aras-akademik-dan-kemanusiaan-digital">4. TEI-XML: Penanda Aras Akademik dan Kemanusiaan Digital</h2>
<p>Format <strong>Text Encoding Initiative (TEI)</strong> bukanlah secara ketat format output enjin OCR; sebaliknya, ia merupakan standard utama untuk edisi digital kritikal dan representasi ilmiah teks sastera serta sejarah.</p>
<h3 id="menyambungkan-ocrhtr-ke-tei">Menyambungkan OCR/HTR ke TEI</h3>
<p>Saluran moden jarang berhenti pada pengenalan aksara mentah. Sarjana menggunakan alat seperti <strong>Transkribus TEI Exporter</strong> atau saluran XSLT automatik untuk menukar fail PAGE XML atau ALTO kepada XML yang mematuhi TEI:</p>
<ul>
<li>Singkatan diperluas (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Penghapusan, penambahan, dan tangan penulis diklasifikasikan secara formal (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Data susun atur dipelihara bersama analisis sastera melalui elemen <code>&lt;facsimile&gt;</code> dan <code>&lt;surface&gt;</code>.</li>
</ul>
<p>Jika projek sejarah anda bertujuan untuk menghasilkan edisi kritikal interaktif atau arkib ilmiah yang boleh dicari secara semantik, menukar data OCR/HTR anda ke dalam TEI-XML selalunya merupakan langkah akhir yang diperlukan.</p>
<h2 id="matriks-perbandingan-format-ocrhtr-sekilas">Matriks Perbandingan: Format OCR/HTR Sekilas</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Ciri / Kriteria</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Domain Utama</strong></td>
<td style="text-align:left">HTR Kursif &amp; Manuskrip</td>
<td style="text-align:left">Digitalisasi Perpustakaan Besar</td>
<td style="text-align:left">OCR Web &amp; Carian Ringan</td>
<td style="text-align:left">Edisi Kritikal Ilmiah</td>
</tr>
<tr>
<td style="text-align:left"><strong>Sokongan Asas</strong></td>
<td style="text-align:left">Asli, Polilin Berbilang Titik</td>
<td style="text-align:left">Disokong (sejak v4.0)</td>
<td style="text-align:left">Asas (Kecerunan/Offset)</td>
<td style="text-align:left">Melalui pemetaan faksimili</td>
</tr>
<tr>
<td style="text-align:left"><strong>Poligon Tidak Teratur</strong></td>
<td style="text-align:left">Penuh</td>
<td style="text-align:left">Penuh</td>
<td style="text-align:left">Terhad</td>
<td style="text-align:left">Melalui elemen koordinat</td>
</tr>
<tr>
<td style="text-align:left"><strong>Ekosistem Alat</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, penonton Web</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Badan Penstandardan</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Perpustakaan Kongres</td>
<td style="text-align:left">Spesifikasi Komuniti</td>
<td style="text-align:left">Konsortium TEI</td>
</tr>
</tbody>
</table>
<h2 id="cadangan-praktikal-memilih-alur-kerja-arkib-anda">Cadangan Praktikal: Memilih Alur Kerja Arkib Anda</h2>
<p>Untuk mewujudkan saluran digitasi yang cekap dan tahan masa depan:</p>
<ol>
<li><strong>Untuk Manuskrip Tangan Tulisan Tulen &amp; Arkib:</strong>
Standardkan transkripsi dan pengekstrakan susun atur anda pada <strong>PAGE XML</strong>. Pengiraan garis dasar dan kontur poligonnya mengendalikan tulisan tangan yang tidak standard dengan kehilangan data yang minimum.</li>
<li><strong>Untuk Perpustakaan Skala Besar &amp; Koleksi Campuran:</strong>
Pilih <strong>ALTO XML (v4.2 atau lebih tinggi)</strong> yang dipasangkan dengan <strong>METS</strong>. Ini menjamin integrasi lancar ke dalam seni bina repositori digital standard dan sistem pengurusan aset digital (DAMS).</li>
<li><strong>Untuk Persembahan Web &amp; Indeks Carian Teks Penuh:</strong>
Gunakan <strong>hOCR</strong> atau hasilkan struktur GeoJSON/Anotasi Web yang ringan daripada PAGE XML untuk menggerakkan penonton IIIF interaktif (seperti Mirador atau Universal Viewer) dengan lapisan teks langsung dalam pelayar.</li>
<li><strong>Untuk Edisi Ilmiah &amp; Penyelidikan Paleografik:</strong>
Jana data rujukan anda dalam PAGE XML, lakukan pengecaman, dan alirkan output melalui penukar automatik untuk menghasilkan <strong>TEI-XML</strong> bagi penanda editorial.</li>
</ol>
<p>Dengan menyelaraskan keupayaan struktur format-format ini dengan keperluan paleografik bahan sumber anda, anda memastikan setiap goresan, singkatan, dan nuansa sejarah tetap dapat difahami selama berabad-abad akan datang.</p>
<h2 id="soalan-lazim-faq">Soalan Lazim (FAQ)</h2>
<p><strong>Q1. Apakah perbezaan asas antara OCR standard dan HTR?</strong> OCR mengenali tipografi cetakan mesin yang konsisten, manakala HTR (Pengiktirafan Teks Tangan) menggunakan rangkaian neural mendalam untuk menafsir tulisan tangan manusia yang berterusan, berubah-ubah dan garis dasar melengkung.</p>
<p><strong>Q2. Bolehkah Tesseract OCR menghasilkan PAGE XML atau output ALTO untuk dokumen sejarah?</strong> Ya, Tesseract dapat menjana ALTO XML asli dan output hOCR, dan pembungkus pihak ketiga boleh menukar hasil ini ke dalam PAGE XML.</p>
<p><strong>Q3. Mengapa garis dasar lebih penting daripada kotak sempadan dalam transkripsi teks tulisan tangan?</strong> Garis dasar menjejaki garis semula jadi yang beralun dalam tulisan manusia, membolehkan perisian memisahkan aksara naik dan turun yang bertindih yang bertembung di dalam kotak sempadan yang kaku.</p>
<p><strong>Q4. Bagaimana standard IIIF berinteraksi dengan format fail OCR ini?</strong> IIIF menyediakan imej resolusi tinggi melalui API web terbuka, manakala format seperti ALTO atau PAGE XML menyediakan data koordinat yang boleh ditukar menjadi anotasi Carian Kandungan IIIF.</p>
<p><strong>Q5. Format fail mana yang paling mudah untuk ditukar secara langsung menjadi PDF yang boleh dicari?</strong> Kedua-dua hOCR dan ALTO XML boleh digabungkan dengan imej halaman asal untuk membina fail PDF berlapis dua yang boleh dicari menggunakan alat seperti OCRmyPDF.</p>
<h2 id="lihat-juga">Lihat Juga</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Raksasa Hibrid? Menyemat Data Asal Dalam OCR Anda</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Memahami Format Fail OCR - HOCR vs ALTO vs PDF/A Dijelaskan</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Apakah Perbezaan Antara PDF dan FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Untuk Apa FDF Digunakan? Memahami Tujuan Format Data Borang</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: Mana yang Patut Anda Gunakan dan Bila?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
