<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Format OCR on File Format Blog</title>
    <link>https://blog.fileformat.com/id/tag/format-ocr/</link>
    <description>Recent content in Format OCR on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>id</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/id/tag/format-ocr/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Cara Memilih Format File yang Tepat untuk Pengakuan Teks Tulisan Tangan (HTR)</title>
      <link>https://blog.fileformat.com/id/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/id/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Temukan format file OCR dan HTR terbaik untuk manuskrip historis dan arsip tulisan tangan, membandingkan ALTO, PAGE XML, hOCR, dan TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Terakhir Diperbarui</strong>: 20 Aug, 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="format-file-ocr-untuk-dokumen-historis-dan-tulisan-tangan">Format File OCR untuk Dokumen Historis dan Tulisan Tangan</h2>
<p>Mengarsip warisan budaya melalui digitalisasi telah memasuki era kebangkitan. Sementara sistem pengenalan karakter optik (OCR) awal dirancang untuk menguraikan dokumen bersih yang dicetak mesin pada abad kedua puluh, institusi warisan budaya modern menghadapi tantangan yang jauh lebih rumit dan kaya: manuskrip abad pertengahan, korespondensi kursif abad kesembilan belas, folio beriluminasi yang rapuh, dan registri berusia abad.</p>
<p>Mentranskripsi dokumen bersejarah tidak lagi hanya tentang mengekstrak teks ASCII biasa. Ini memerlukan penangkapan <strong>konteks</strong>—geometri fisik halaman, kurva baseline, koreksi bleed-through, marginalia, singkatan, dan ketidakpastian paleografis. Bidang khusus ini, yang sering dikategorikan di bawah Handwritten Text Recognition (HTR), sangat bergantung pada format file yang digunakan untuk menyimpan dan bertukar koordinat gambar serta lapisan teks.</p>
<p>Memilih skema yang salah dapat menghilangkan data baseline penting, merusak penyelarasan dengan manifes IIIF (International Image Interoperability Framework), atau menghalangi preservasi digital jangka panjang. Berikut adalah panduan definitif tentang format file OCR dan HTR terkemuka untuk dokumen bersejarah, kekuatan strukturalnya, dan cara menentukan pilihan yang tepat untuk alur kerja arsip Anda.</p>
<h2 id="dilema-historis-mengapa-teks-biasa15-dan-pdf1-standar-gagal">Dilema Historis: Mengapa <a href="https//docs.fileformat.com/word-processing/txt/">Teks Biasa</a> dan <a href="https://docs.fileformat.com/pdf/">PDF</a> Standar Gagal</h2>
<p>OCR yang dicetak mesin sering menghasilkan file <code>.txt</code> sederhana atau PDF &ldquo;sandwich&rdquo; dengan lapisan teks tersembunyi di bawah pemindaian. Untuk manuskrip bersejarah dan tulisan tangan kursif, output ini gagal karena tiga alasan utama:</p>
<ol>
<li><strong>Teks Non-Linear dan Tata Letak Kompleks:</strong> Penyalin sejarah tidak mematuhi kisi persegi panjang yang rapi. Teks mengalir ke margin, melilit inisial yang diterangi, menyusuri koreksi interlinear yang disisipkan, atau berjalan secara vertikal sepanjang punggung buku.</li>
<li><strong>Garis Dasar Melengkung dan Miring:</strong> Tulisan sambung jarang mengikuti sumbu horizontal yang kaku. Mesin HTR seperti Transkribus, Kraken, dan eScriptorium mengandalkan garis dasar polyline daripada kotak pembatas untuk menafsirkan skrip yang kaya ligatur.</li>
<li><strong>Kompleksitas Paleografis dan Metadata:</strong> Penelitian arsip memerlukan pelacakan singkatan, variasi ejaan historis, bacaan yang rusak, dan skor kepercayaan tingkat baris. Format dokumen standar mengabaikan granularitas ini.</li>
</ol>
<p>Untuk mempertahankan kesetiaan pada artefak asli, komunitas arsip mengandalkan skema XML terstruktur yang dirancang untuk melestarikan topologi tata letak bersama teks yang ditranskripsi.</p>
<h2 id="1-page-xml-standar-emas-untuk-pengakuan-teks-tulisan-tangan-htr">1. PAGE XML: Standar Emas untuk Pengakuan Teks Tulisan Tangan (HTR)</h2>
<p>Dikembangkan oleh Laboratorium Penelitian PRImA (Pattern Recognition &amp; Image Analysis), <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) secara luas dianggap sebagai format mutakhir untuk pengenalan teks tulisan tangan dan analisis tata letak lanjutan.</p>
<h3 id="arsitektur-inti">Arsitektur Inti</h3>
<p>PAGE XML memperlakukan dokumen fisik sebagai struktur hierarkis:</p>
<ul>
<li><code>PcGts</code> (Akar)
<ul>
<li><code>Page</code> (Dimensi gambar dan urutan baca keseluruhan)
<ul>
<li><code>TextRegion</code> (Paragraf, judul, catatan marginal, kata penangkap)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Koordinat poligon di sekitar garis)</li>
<li><code>Baseline</code> (Serangkaian titik yang mengikuti baseline sebenarnya dari tulisan)</li>
<li><code>TextEquiv</code> (Teks yang dikenali, dengan metrik kepercayaan opsional)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="mengapa-ini-unggul-untuk-naskah-historis">Mengapa Ini Unggul untuk Naskah Historis</h3>
<ul>
<li><strong>Presisi Poligon dan Poliline:</strong> Alih-alih memaksa karakter ke dalam kotak pembatas persegi panjang, PAGE XML menggunakan batas poligon multi-titik dan baseline kontinu. Ini mencegah aksen naik dan turun tulisan sambung yang tumpang tindih mengganggu segmentasi.</li>
<li><strong>Tipe Struktural Granular:</strong> Wilayah dapat diklasifikasikan secara tepat (mis., <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Ekosistem Perangkat Lunak Luas:</strong> Ini berfungsi sebagai skema internal dan ekspor utama untuk platform HTR unggulan seperti <strong>Transkribus</strong>, <strong>eScriptorium</strong>, dan <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-kekuatan-perpustakaan-dan-arsip">2. ALTO XML: Kekuatan Perpustakaan dan Arsip</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> adalah standar XML terbuka yang dipelihara oleh Library of Congress dan banyak diadopsi oleh perpustakaan nasional, termasuk Bibliothèque nationale de France (BnF) dan British Library.</p>
<h3 id="arsitektur-inti-1">Arsitektur Inti</h3>
<p>ALTO menyusun tata letak secara hierarkis dari <code>Page</code> ke <code>PrintSpace</code>, turun ke <code>TextBlock</code>, <code>TextLine</code>, dan <code>String</code> (kata atau token individu). Ini sering dikemas di dalam pembungkus <strong>METS</strong> (Metadata Encoding and Transmission Standard) untuk mengaitkan metadata struktural dengan gambar master resolusi tinggi.</p>
<h3 id="kekuatan-utama-dan-kasus-penggunaan">Kekuatan Utama dan Kasus Penggunaan</h3>
<ul>
<li><strong>Alur Kerja Digitalisasi Massal:</strong> ALTO dirancang dengan mempertimbangkan digitalisasi surat kabar dan buku berskala industri. Ia secara bersih mengkodekan atribut font, koordinat tingkat kata, kepercayaan karakter, dan spasi putih.</li>
<li><strong>Dukungan HTR Modern (ALTO 4):</strong> Versi-versi sebelumnya dari ALTO sangat bergantung pada koordinat persegi panjang (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Namun, mulai dengan <strong>versi ALTO 4</strong>, skema memperkenalkan poligon <code>&lt;Shape&gt;</code> dan baseline polyline, menutup kesenjangan fungsional dengan PAGE XML untuk bahan tulisan tangan.</li>
<li><strong>Preservasi Jangka Panjang:</strong> Karena merupakan standar resmi yang didukung oleh konsorsium perpustakaan internasional, ALTO menjamin stabilitas jangka panjang dan kompatibilitas mundur tingkat arsip.</li>
</ul>
<h2 id="3-hocr-standar-ringan-berbasis-web">3. hOCR: Standar Ringan Berbasis Web</h2>
<p>Dibuat oleh Thomas Breuel, <strong>hOCR</strong> mengambil pendekatan pragmatis: alih-alih membuat skema XML yang sepenuhnya baru, ia menyematkan metadata tata letak dan transkripsi langsung ke dalam HTML/XHTML semantik menggunakan mikroformat dan atribut kelas.</p>
<h3 id="contoh-sintaks-umum">Contoh Sintaks Umum</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;ocr_line\&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;line_1_1\&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;bbox</span> <span style="color:#a6e22e">150</span> <span style="color:#a6e22e">320</span> <span style="color:#a6e22e">2200</span> <span style="color:#a6e22e">410</span><span style="color:#960050;background-color:#1e0010">;</span> <span style="color:#a6e22e">baseline</span> <span style="color:#a6e22e">0</span> <span style="color:#a6e22e">-5</span><span style="color:#960050;background-color:#1e0010">\&#34;</span>&gt;\n        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;ocrx_word\&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;word_1_1\&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;bbox</span> <span style="color:#a6e22e">150</span> <span style="color:#a6e22e">325</span> <span style="color:#a6e22e">380</span> <span style="color:#a6e22e">405</span><span style="color:#960050;background-color:#1e0010">;</span> <span style="color:#a6e22e">x_wconf</span> <span style="color:#a6e22e">92</span><span style="color:#960050;background-color:#1e0010">\&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;\n      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="keuntungan-dan-kerugian-untuk-bahan-sejarah">Keuntungan dan Kerugian untuk Bahan Sejarah</h3>
<ul>
<li><strong>Keuntungan:</strong> Browser dapat merendernya secara native. Ia mudah diubah menggunakan CSS dan JavaScript standar, dan merupakan format ekspor terstruktur default untuk mesin seperti <strong>Tesseract</strong>.</li>
<li><strong>Kerugian:</strong> Dukungan native untuk kurva baseline multi-titik yang kompleks dan bebas bentuk terbatas. Meskipun praktis untuk karya cetak awal (incunabula atau brosur bersih), hOCR kesulitan dengan tata letak manuskrip yang tidak teratur dan marginalia berlapis.</li>
</ul>
<h2 id="4-tei-xml-tolok-ukur-akademik-dan-humaniora-digital">4. TEI-XML: Tolok Ukur Akademik dan Humaniora Digital</h2>
<p>Format <strong>Text Encoding Initiative (TEI)</strong> bukanlah secara ketat format output mesin OCR; melainkan standar utama untuk edisi digital kritis dan representasi ilmiah teks sastra dan sejarah.</p>
<h3 id="menghubungkan-ocrhtr-ke-tei">Menghubungkan OCR/HTR ke TEI</h3>
<p>Pipeline modern jarang berhenti pada pengenalan karakter mentah. Para sarjana menggunakan alat seperti <strong>Transkribus TEI Exporter</strong> atau pipeline XSLT otomatis untuk menerjemahkan file PAGE XML atau ALTO menjadi XML yang sesuai dengan TEI:</p>
<ul>
<li>Singkatan diperluas (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Penghapusan, penambahan, dan tangan penulis diklasifikasikan secara formal (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Data tata letak dipertahankan bersama analisis sastra melalui elemen <code>&lt;facsimile&gt;</code> dan <code>&lt;surface&gt;</code>.</li>
</ul>
<p>Jika proyek sejarah Anda bertujuan membuat edisi kritis interaktif atau arsip ilmiah yang dapat dicari secara semantik, mengonversi data OCR/HTR Anda ke TEI-XML seringkali merupakan langkah akhir yang diperlukan.</p>
<h2 id="matriks-perbandingan-format-ocrhtr-sekilas">Matriks Perbandingan: Format OCR/HTR Sekilas</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Fitur / Kriteria</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Domain Utama</strong></td>
<td style="text-align:left">HTR Kursif &amp; Manuskrip</td>
<td style="text-align:left">Digitalisasi Perpustakaan Massal</td>
<td style="text-align:left">OCR Web &amp; Pencarian Ringan</td>
<td style="text-align:left">Edisi Kritis Ilmiah</td>
</tr>
<tr>
<td style="text-align:left"><strong>Dukungan Dasar</strong></td>
<td style="text-align:left">Asli, Poliline Multi-titik</td>
<td style="text-align:left">Didukung (sejak v4.0)</td>
<td style="text-align:left">Dasar (Kemiringan/Offset)</td>
<td style="text-align:left">Melalui pemetaan faksimili</td>
</tr>
<tr>
<td style="text-align:left"><strong>Poligon Tidak Beraturan</strong></td>
<td style="text-align:left">Penuh</td>
<td style="text-align:left">Penuh</td>
<td style="text-align:left">Terbatas</td>
<td style="text-align:left">Melalui elemen koordinat</td>
</tr>
<tr>
<td style="text-align:left"><strong>Ekosistem Alat</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, Penampil Web</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Badan Standardisasi</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Perpustakaan Kongres</td>
<td style="text-align:left">Spesifikasi Komunitas</td>
<td style="text-align:left">Konsorsium TEI</td>
</tr>
</tbody>
</table>
<h2 id="rekomendasi-praktis-memilih-jalur-arsip-anda">Rekomendasi Praktis: Memilih Jalur Arsip Anda</h2>
<p>Untuk membangun alur digitalisasi yang efisien dan tahan masa depan:</p>
<ol>
<li><strong>Untuk Manuskrip Tangan Murni &amp; Arsip:</strong>
Standarisasi transkripsi dan ekstraksi tata letak Anda pada <strong>PAGE XML</strong>. Perhitungan baseline dan kontur poligon-nya menangani tulisan tangan yang tidak standar dengan kehilangan data minimal.</li>
<li><strong>Untuk Perpustakaan Skala Besar &amp; Koleksi Campuran:</strong>
Pilih <strong>ALTO XML (v4.2 atau lebih tinggi)</strong> yang dipasangkan dengan <strong>METS</strong>. Ini menjamin integrasi mulus ke dalam arsitektur repositori digital standar dan sistem manajemen aset digital (DAMS).</li>
<li><strong>Untuk Presentasi Web &amp; Indeks Pencarian Teks Penuh:</strong>
Gunakan <strong>hOCR</strong> atau hasilkan struktur GeoJSON/Web Annotation yang ringan dari PAGE XML untuk menggerakkan penampil IIIF interaktif (seperti Mirador atau Universal Viewer) dengan lapisan teks langsung di dalam peramban.</li>
<li><strong>Untuk Edisi Ilmiah &amp; Penelitian Paleografik:</strong>
Hasilkan ground truth Anda dalam PAGE XML, lakukan pengenalan, dan alirkan output melalui konverter otomatis untuk menghasilkan <strong>TEI-XML</strong> untuk penandaan editorial.</li>
</ol>
<p>Dengan mencocokkan kemampuan struktural format-format ini dengan tuntutan paleografik bahan sumber Anda, Anda memastikan bahwa setiap goresan, singkatan, dan nuansa historis tetap dapat dibaca selama berabad-abad yang akan datang.</p>
<h2 id="pertanyaan-yang-sering-diajukan-faq">Pertanyaan yang Sering Diajukan (FAQ)</h2>
<p><strong>Q1. Apa perbedaan mendasar antara OCR standar dan HTR?</strong> OCR mengenali tipografi mesin cetak yang konsisten, sedangkan HTR (Handwritten Text Recognition) menggunakan jaringan saraf dalam untuk mendekode tulisan tangan manusia yang kontinu, variabel, dan garis dasar melengkung.</p>
<p><strong>Q2. Bisakah Tesseract OCR menghasilkan PAGE XML atau output ALTO untuk dokumen historis?</strong> Ya, Tesseract dapat menghasilkan ALTO XML native dan output hOCR, dan pembungkus pihak ketiga dapat mengonversi hasil tersebut menjadi PAGE XML.</p>
<p><strong>Q3. Mengapa baseline lebih penting daripada bounding box dalam transkripsi teks tulisan tangan?</strong> Baseline melacak garis alami yang berombak dari tulisan tangan manusia, memungkinkan perangkat lunak memisahkan ascender dan descender yang tumpang tindih yang bertabrakan di dalam bounding box yang kaku.</p>
<p><strong>Q4. Bagaimana standar IIIF berinteraksi dengan format file OCR ini?</strong> IIIF menyajikan gambar resolusi tinggi melalui API web terbuka, sementara format seperti ALTO atau PAGE XML menyediakan data koordinat yang dapat dikonversi menjadi anotasi Pencarian Konten IIIF.</p>
<p><strong>Q5. Format file mana yang paling mudah dikonversi langsung menjadi PDF yang dapat dicari?</strong> Baik hOCR maupun ALTO XML dapat dipasangkan dengan gambar halaman asli untuk membuat file PDF berlapis ganda yang dapat dicari menggunakan alat seperti OCRmyPDF.</p>
<h2 id="lihat-juga">Lihat Juga</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Monster Hibrida? Menyematkan Data Asli di Dalam OCR Anda</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Memahami Format File OCR - HOCR vs ALTO vs PDF/A Dijelaskan</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Apa Perbedaan Antara PDF dan FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Untuk Apa FDF Digunakan? Memahami Tujuan Format Data Formulir</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: Mana yang Harus Anda Gunakan dan Kapan?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
