<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Optik Karakter Tanıma on File Format Blog</title>
    <link>https://blog.fileformat.com/tr/tag/optik-karakter-tan%C4%B1ma/</link>
    <description>Recent content in Optik Karakter Tanıma on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>tr</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/tr/tag/optik-karakter-tan%C4%B1ma/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>El Yazısı Metin Tanıma (HTR) İçin Doğru Dosya Formatını Nasıl Seçersiniz</title>
      <link>https://blog.fileformat.com/tr/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/tr/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Tarihî el yazmaları ve el yazısı arşivleri için en iyi OCR ve HTR dosya formatlarını keşfedin, ALTO, PAGE XML, hOCR ve TEI-XML&amp;#39;i karşılaştırarak.</description>
      <content:encoded><![CDATA[<p><strong>Son Güncelleme</strong>: 20 Aug, 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="tarihî-ve-el-yazısı-belgeler-için-ocr-dosya-formatları">Tarihî ve El Yazısı Belgeler İçin OCR Dosya Formatları</h2>
<p>Kültürel mirası dijitalleştirerek korumak bir yeniden doğuma girdi. Erken optik karakter tanıma (OCR) sistemleri, temiz, makineyle basılmış yirminci yüzyıl belgelerini çözümlemek için tasarlanmışken, modern kültürel miras kurumları çok daha dağınık ve zengin bir zorlukla karşı karşıya: ortaçağ el yazmaları, on dokuzuncu yüzyılın el yazısı mektupları, kırılgan aydınlatmalı folyolar ve yüzyıllık kayıtlar.</p>
<p>Tarihî belgeleri transkribe etmek artık sadece düz ASCII metin çıkarmakla sınırlı değil. <strong>Bağlam</strong>—sayfanın fiziksel geometrisi, temel hat eğrileri, geçiş lekesi düzeltmeleri, kenar notları, kısaltmalar ve paleografik belirsizlik gibi unsurları yakalamayı gerektirir. El Yazısı Tanıma (HTR) altında sıkça sınıflandırılan bu uzmanlaşmış alan, hem görüntü koordinatlarını hem de metin katmanlarını depolamak ve değiştirmek için kullanılan dosya formatına büyük ölçüde bağlıdır.</p>
<p>Yanlış şemayı seçmek, hayati temel veri satırlarını kaldırabilir, IIIF (International Image Interoperability Framework) manifestleriyle hizalamayı bozabilir veya uzun vadeli dijital korumayı engelleyebilir. İşte tarihî belgeler için önde gelen OCR ve HTR dosya formatlarına, bunların yapısal güçlü yönlerine ve arşivleme hattınız için doğru seçimi nasıl belirleyeceğinize dair kesin bir rehber.</p>
<h2 id="tarihî-ikilem-neden-düz-metin15-ve-standart-pdfler1-başarısız-olur">Tarihî İkilem: Neden <a href="https//docs.fileformat.com/word-processing/txt/">Düz Metin</a> ve Standart <a href="https://docs.fileformat.com/pdf/">PDF&rsquo;ler</a> Başarısız Olur</h2>
<p>Makineyle basılmış OCR genellikle basit <code>.txt</code> dosyaları veya taramanın altında gizli metin katmanları bulunan &ldquo;sandviç&rdquo; PDF&rsquo;ler üretir. Tarihî el yazmaları ve akıcı el yazısı için bu çıktılar üç temel nedenden dolayı başarısız olur:</p>
<ol>
<li><strong>Doğrusal Olmayan Metin ve Karmaşık Düzenler:</strong> Tarihi yazıcılar düzenli dikdörtgen ızgaralara bağlı kalmazlardı. Metin kenarlıklara dökülür, aydınlatılmış baş harflerin etrafını sarar, eklenen satır içi düzeltmeler arasında örülür veya omurga boyunca dikey olarak akar.</li>
<li><strong>Eğri ve Eğimli Alt Çizgiler:</strong> El yazısı nadiren katı bir yatay eksene uyar. Transkribus, Kraken ve eScriptorium gibi HTR motorları, bağlaç yoğun betikleri yorumlamak için sınırlayıcı kutular yerine çoklu çizgi alt çizgilerine dayanır.</li>
<li><strong>Paleografik Karmaşıklık ve Üst Veri:</strong> Arşiv araştırması, kısaltmaları, tarihsel yazım varyasyonlarını, hasar görmüş okumaları ve satır düzeyinde güven skorlarını izlemeyi gerektirir. Standart belge formatları bu ayrıntıyı atar.</li>
</ol>
<p>Orijinal esere sadakati korumak için, arşiv topluluğu, düzen topolojisini transkribe edilmiş metinle birlikte korumak üzere tasarlanmış yapılandırılmış XML şemalarına dayanır.</p>
<h2 id="1-page-xml-el-yazısı-metin-tanıma-htr-için-altın-standart">1. PAGE XML: El Yazısı Metin Tanıma (HTR) İçin Altın Standart</h2>
<p>PRImA (Pattern Recognition &amp; Image Analysis) Araştırma Laboratuvarı tarafından geliştirilen <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements), el yazısı tanıma ve gelişmiş düzen analizi için en modern format olarak geniş çapta kabul edilir.</p>
<h3 id="temel-mimari">Temel Mimari</h3>
<p>PAGE XML, fiziksel belgeyi hiyerarşik bir yapı olarak ele alır:</p>
<ul>
<li><code>PcGts</code> (Kök)
<ul>
<li><code>Page</code> (Görüntü boyutları ve genel okuma sırası)
<ul>
<li><code>TextRegion</code> (Paragraflar, başlıklar, kenar notları, yakalama kelimeleri)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Çizgi etrafındaki çokgen koordinatları)</li>
<li><code>Baseline</code> (Metnin gerçek temel çizgisini izleyen bir dizi nokta)</li>
<li><code>TextEquiv</code> (Tanınan metin, isteğe bağlı güven ölçütleriyle)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="neden-tarihi-el-yazmaları-için-üstün-performans-gösterir">Neden Tarihi El Yazmaları İçin Üstün Performans Gösterir</h3>
<ul>
<li><strong>Polygon ve Polilin Kesinliği:</strong> Karakterleri dikdörtgen sınırlayıcı kutulara zorlamak yerine, PAGE XML çok noktalı çokgen sınırları ve sürekli temel çizgileri kullanır. Bu, üst üste binen el yazısı yükselticileri ve alçaltıcıların segmentasyona müdahalesini önler.</li>
<li><strong>Granüler Yapısal Türler:</strong> Bölgeler kesin olarak sınıflandırılabilir (ör. <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Geniş Yazılım Ekosistemi:</strong> Bayrak taşıyan HTR platformları olan <strong>Transkribus</strong>, <strong>eScriptorium</strong> ve <strong>Kraken</strong> için birincil iç ve dış şema olarak hizmet eder.</li>
</ul>
<h2 id="2-alto-xml-kütüphane-ve-arşiv-güç-merkezi">2. ALTO XML: Kütüphane ve Arşiv Güç Merkezi</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong>, Bibliothèque nationale de France (BnF) ve British Library dahil olmak üzere ulusal kütüphaneler tarafından yaygın olarak benimsenen, Kongre Kütüphanesi tarafından sürdürülen açık bir XML standardıdır.</p>
<h3 id="temel-mimari-1">Temel Mimari</h3>
<p>ALTO, düzeni hiyerarşik olarak <code>Page</code>&lsquo;den <code>PrintSpace</code>&lsquo;e, ardından <code>TextBlock</code>, <code>TextLine</code> ve <code>String</code> (bireysel kelimeler veya tokenler) seviyelerine yapılandırır. Yapısal meta verileri yüksek çözünürlüklü ana görüntülerle ilişkilendirmek için sık sık <strong>METS</strong> (Metadata Encoding and Transmission Standard) sarmalayıcısı içinde paketlenir.</p>
<h3 id="ana-güçlü-yönler-ve-kullanım-durumları">Ana Güçlü Yönler ve Kullanım Durumları</h3>
<ul>
<li><strong>Kitle Dijitalleştirme İş Akışları:</strong> ALTO, endüstriyel ölçekli gazete ve kitap dijitalleştirmeyi göz önünde bulundurarak tasarlandı. Yazı tipi özelliklerini, kelime düzeyindeki koordinatları, karakter güvenini ve boşlukları temiz bir şekilde kodlar.</li>
<li><strong>Modern HTR Desteği (ALTO 4):</strong> ALTO&rsquo;nun önceki sürümleri dikdörtgen koordinatlara (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>) büyük ölçüde dayanıyordu. Ancak, <strong>ALTO sürüm 4</strong> ile birlikte şema <code>&lt;Shape&gt;</code> çokgenlerini ve çoklu çizgi taban hatlarını tanıttı, el yazısı materyaller için PAGE XML ile işlevsel boşluğu kapattı.</li>
<li><strong>Uzun Vadeli Koruma:</strong> Uluslararası kütüphane konsorsiyumları tarafından desteklenen resmi bir standart olduğu için ALTO, uzun vadeli istikrar ve arşiv düzeyinde geriye dönük uyumluluk garantiler.</li>
</ul>
<h2 id="3-hocr-web-öncelikli-hafif-standart">3. hOCR: Web-Öncelikli, Hafif Standart</h2>
<p>Thomas Breuel tarafından oluşturulan <strong>hOCR</strong>, pragmatik bir yaklaşım benimser: tamamen yeni bir XML şeması oluşturmak yerine, düzen ve transkripsiyon meta verilerini doğrudan anlamsal HTML/XHTML içine mikroformatlar ve sınıf öznitelikleri kullanarak gömer.</p>
<h3 id="tipik-söz-dizimi-örneği">Tipik Söz Dizimi Örneği</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Başlangıç&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="tarihî-materyaller-için-artılar-ve-eksiler">Tarihî Materyaller İçin Artılar ve Eksiler</h3>
<ul>
<li><strong>Artılar:</strong> Tarayıcılar bunu yerel olarak render edebilir. Saf CSS ve JavaScript kullanılarak kolayca dönüştürülebilir ve <strong>Tesseract</strong> gibi motorlar için varsayılan yapılandırılmış dışa aktarma formatıdır.</li>
<li><strong>Eksiler:</strong> Karmaşık, serbest biçimli çok noktalı taban eğrileri için yerel destek sınırlıdır. Erken basım eserleri (incunabula veya temiz broadsides) için pratik olsa da, hOCR düzensiz el yazması düzenleri ve çok katmanlı kenar notalarıyla mücadele eder.</li>
</ul>
<h2 id="4-tei-xml-akademik-ve-dijital-beşeri-bilimler-ölçütü">4. TEI-XML: Akademik ve Dijital Beşeri Bilimler Ölçütü</h2>
<p><strong>Text Encoding Initiative (TEI)</strong> formatı, kesinlikle bir OCR motoru çıktı formatı değildir; aksine, edebi ve tarihsel metinlerin eleştirel dijital edisyonları ve akademik temsili için birincil standarttır.</p>
<h3 id="ocrhtryi-teiye-bağlamak">OCR/HTR&rsquo;yi TEI&rsquo;ye Bağlamak</h3>
<p>Modern iş akışları nadiren ham karakter tanıma aşamasında durur. Akademisyenler, <strong>Transkribus TEI Exporter</strong> gibi araçları veya otomatik XSLT iş akışlarını kullanarak PAGE XML veya ALTO dosyalarını TEI uyumlu XML&rsquo;e dönüştürürler:</p>
<ul>
<li>Kısaltmalar genişletilir (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Silmeler, eklemeler ve yazma elleri resmi olarak sınıflandırılır (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Düzen verileri, <code>&lt;facsimile&gt;</code> ve <code>&lt;surface&gt;</code> öğeleri aracılığıyla edebi analizle birlikte korunur.</li>
</ul>
<p>Tarihi projeniz etkileşimli bir eleştirel edisyon veya anlamsal olarak aranabilir bir akademik arşiv oluşturmayı hedefliyorsa, OCR/HTR verilerinizi TEI-XML&rsquo;e dönüştürmek genellikle gerekli son adımdır.</p>
<h2 id="karşılaştırmalı-matris-ocrhtr-formatlarına-genel-bakış">Karşılaştırmalı Matris: OCR/HTR Formatlarına Genel Bakış</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Özellik / Kriter</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Ana Alan</strong></td>
<td style="text-align:left">El yazısı HTR &amp; El Yazmaları</td>
<td style="text-align:left">Kütüphane Toplu Dijitalleştirme</td>
<td style="text-align:left">Web OCR &amp; Hafif Arama</td>
<td style="text-align:left">Akademik Eleştirel Baskılar</td>
</tr>
<tr>
<td style="text-align:left"><strong>Temel Destek</strong></td>
<td style="text-align:left">Yerel, Çok Noktalı Çizgiler</td>
<td style="text-align:left">Desteklenen (v4.0&rsquo;dan beri)</td>
<td style="text-align:left">Temel (Eğim/Ofset)</td>
<td style="text-align:left">Faksimile eşleme ile</td>
</tr>
<tr>
<td style="text-align:left"><strong>Düzensiz Çokgenler</strong></td>
<td style="text-align:left">Tam</td>
<td style="text-align:left">Tam</td>
<td style="text-align:left">Sınırlı</td>
<td style="text-align:left">Koordinat öğeleri aracılığıyla</td>
</tr>
<tr>
<td style="text-align:left"><strong>Araç Ekosistemi</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, Web görüntüleyicileri</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Standardizasyon Kurumu</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Kongre Kütüphanesi</td>
<td style="text-align:left">Topluluk Şartnamesi</td>
<td style="text-align:left">TEI Konsorsiyumu</td>
</tr>
</tbody>
</table>
<h2 id="pratik-öneriler-arşivleme-sürecinizi-seçmek">Pratik Öneriler: Arşivleme Sürecinizi Seçmek</h2>
<p>Verimli ve geleceğe dayanıklı bir dijitalleştirme hattı kurmak için:</p>
<ol>
<li><strong>Saf El Yazması Belgeler ve Arşivler İçin:</strong>
Transkripsiyon ve düzen çıkarımını <strong>PAGE XML</strong> üzerinde standartlaştırın. Temel çizgi hesaplaması ve çokgen konturlama, standart dışı el yazılarını minimum veri kaybıyla işler.</li>
<li><strong>Büyük Ölçekli Kütüphane ve Karışık Koleksiyonlar İçin:</strong>
<strong>ALTO XML (v4.2 veya üzeri)</strong> ile <strong>METS</strong>&lsquo;i seçin. Bu, standart dijital depo mimarileri ve dijital varlık yönetim sistemlerine (DAMS) sorunsuz entegrasyon sağlar.</li>
<li><strong>Web Sunumu ve Tam Metin Arama İndeksleri İçin:</strong>
<strong>hOCR</strong> kullanın veya PAGE XML&rsquo;den hafif GeoJSON/Web Annotation yapıları türetin ve bu yapıları, Mirador veya Universal Viewer gibi interaktif IIIF görüntüleyicileriyle tarayıcı içinde canlı metin katmanları sağlayarak çalıştırın.</li>
<li><strong>Akademik Baskılar ve Paleografik Araştırmalar İçin:</strong>
PAGE XML formatında gerçek veri setinizi oluşturun, tanıma işlemini gerçekleştirin ve çıktıyı otomatik bir dönüştürücü aracılığıyla <strong>TEI-XML</strong>&rsquo;e dönüştürerek editöryal işaretleme yapın.</li>
</ol>
<p>Bu formatların yapısal yeteneklerini kaynak materyalinizin paleografik gereksinimleriyle eşleştirerek, her bir çizgi, kısaltma ve tarihsel nüansın yüzyıllar boyunca anlaşılabilir kalmasını sağlarsınız.</p>
<h2 id="sıkça-sorulan-sorular-sss">Sıkça Sorulan Sorular (SSS)</h2>
<p><strong>S1. Standart OCR ile HTR arasındaki temel fark nedir?</strong> OCR, tutarlı makineyle basılmış tipografiyi tanırken, HTR (El Yazısı Tanıma) derin sinir ağlarını kullanarak sürekli, değişken insan el yazısını ve eğimli taban çizgilerini çözer.</p>
<p><strong>S2. Tesseract OCR, tarihsel belgeler için PAGE XML veya ALTO çıktısı üretebilir mi?</strong> Evet, Tesseract yerel ALTO XML ve hOCR çıktısı oluşturabilir ve üçüncü taraf sarmalayıcılar bu sonuçları PAGE XML&rsquo;e dönüştürebilir.</p>
<p><strong>S3. El yazısı transkripsiyonunda taban çizgileri neden sınırlayıcı kutulardan daha önemlidir?</strong> Taban çizgileri, insan el yazısının doğal, dalgalı hattını izler ve yazılımın katı sınırlayıcı kutular içinde çarpışan üst ve alt uzantıları ayırmasını sağlar.</p>
<p><strong>S4. IIIF standardı bu OCR dosya formatlarıyla nasıl etkileşir?</strong> IIIF, açık web API&rsquo;leri aracılığıyla yüksek çözünürlüklü görüntüler sunar, ALTO veya PAGE XML gibi formatlar koordinat verileri sağlar ve bu veriler IIIF İçerik Arama ek açıklamalarına dönüştürülebilir.</p>
<p><strong>S5. Hangi dosya formatı doğrudan aranabilir bir PDF&rsquo;ye dönüştürmek için en kolaydır?</strong> Hem hOCR hem de ALTO XML, OCRmyPDF gibi araçlar kullanılarak orijinal sayfa görüntüleriyle eşleştirilerek aranabilir çift katmanlı PDF dosyaları oluşturulabilir.</p>
<h2 id="ayrıca-bakınız">Ayrıca Bakınız</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - Hibrit Canavar? OCR&rsquo;nuzun İçine Orijinal Verileri Gömme</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">OCR Dosya Formatlarını Anlamak - HOCR vs ALTO vs PDF/A Açıklaması</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">PDF ve FDF Arasındaki Fark Nedir?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">FDF Ne İçin Kullanılır? Form Veri Formatının Amacını Anlamak</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: Hangisini Ne Zaman Kullanmalısınız?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
