Son Güncelleme: 20 Aug, 2026

Tarihî ve El Yazısı Belgeler İçin OCR Dosya Formatları
Kültürel mirası dijitalleştirerek korumak bir yeniden doğuma girdi. Erken optik karakter tanıma (OCR) sistemleri, temiz, makineyle basılmış yirminci yüzyıl belgelerini çözümlemek için tasarlanmışken, modern kültürel miras kurumları çok daha dağınık ve zengin bir zorlukla karşı karşıya: ortaçağ el yazmaları, on dokuzuncu yüzyılın el yazısı mektupları, kırılgan aydınlatmalı folyolar ve yüzyıllık kayıtlar.
Tarihî belgeleri transkribe etmek artık sadece düz ASCII metin çıkarmakla sınırlı değil. Bağlam—sayfanın fiziksel geometrisi, temel hat eğrileri, geçiş lekesi düzeltmeleri, kenar notları, kısaltmalar ve paleografik belirsizlik gibi unsurları yakalamayı gerektirir. El Yazısı Tanıma (HTR) altında sıkça sınıflandırılan bu uzmanlaşmış alan, hem görüntü koordinatlarını hem de metin katmanlarını depolamak ve değiştirmek için kullanılan dosya formatına büyük ölçüde bağlıdır.
Yanlış şemayı seçmek, hayati temel veri satırlarını kaldırabilir, IIIF (International Image Interoperability Framework) manifestleriyle hizalamayı bozabilir veya uzun vadeli dijital korumayı engelleyebilir. İşte tarihî belgeler için önde gelen OCR ve HTR dosya formatlarına, bunların yapısal güçlü yönlerine ve arşivleme hattınız için doğru seçimi nasıl belirleyeceğinize dair kesin bir rehber.
Tarihî İkilem: Neden Düz Metin ve Standart PDF’ler Başarısız Olur
Makineyle basılmış OCR genellikle basit .txt dosyaları veya taramanın altında gizli metin katmanları bulunan “sandviç” PDF’ler üretir. Tarihî el yazmaları ve akıcı el yazısı için bu çıktılar üç temel nedenden dolayı başarısız olur:
- Doğrusal Olmayan Metin ve Karmaşık Düzenler: Tarihi yazıcılar düzenli dikdörtgen ızgaralara bağlı kalmazlardı. Metin kenarlıklara dökülür, aydınlatılmış baş harflerin etrafını sarar, eklenen satır içi düzeltmeler arasında örülür veya omurga boyunca dikey olarak akar.
- Eğri ve Eğimli Alt Çizgiler: El yazısı nadiren katı bir yatay eksene uyar. Transkribus, Kraken ve eScriptorium gibi HTR motorları, bağlaç yoğun betikleri yorumlamak için sınırlayıcı kutular yerine çoklu çizgi alt çizgilerine dayanır.
- Paleografik Karmaşıklık ve Üst Veri: Arşiv araştırması, kısaltmaları, tarihsel yazım varyasyonlarını, hasar görmüş okumaları ve satır düzeyinde güven skorlarını izlemeyi gerektirir. Standart belge formatları bu ayrıntıyı atar.
Orijinal esere sadakati korumak için, arşiv topluluğu, düzen topolojisini transkribe edilmiş metinle birlikte korumak üzere tasarlanmış yapılandırılmış XML şemalarına dayanır.
1. PAGE XML: El Yazısı Metin Tanıma (HTR) İçin Altın Standart
PRImA (Pattern Recognition & Image Analysis) Araştırma Laboratuvarı tarafından geliştirilen PAGE XML (Page Analysis and Groundtruth Elements), el yazısı tanıma ve gelişmiş düzen analizi için en modern format olarak geniş çapta kabul edilir.
Temel Mimari
PAGE XML, fiziksel belgeyi hiyerarşik bir yapı olarak ele alır:
PcGts(Kök)Page(Görüntü boyutları ve genel okuma sırası)TextRegion(Paragraflar, başlıklar, kenar notları, yakalama kelimeleri)TextLineCoords(Çizgi etrafındaki çokgen koordinatları)Baseline(Metnin gerçek temel çizgisini izleyen bir dizi nokta)TextEquiv(Tanınan metin, isteğe bağlı güven ölçütleriyle)
Neden Tarihi El Yazmaları İçin Üstün Performans Gösterir
- Polygon ve Polilin Kesinliği: Karakterleri dikdörtgen sınırlayıcı kutulara zorlamak yerine, PAGE XML çok noktalı çokgen sınırları ve sürekli temel çizgileri kullanır. Bu, üst üste binen el yazısı yükselticileri ve alçaltıcıların segmentasyona müdahalesini önler.
- Granüler Yapısal Türler: Bölgeler kesin olarak sınıflandırılabilir (ör.
marginalia,drop-capital,signature-mark,header,editorial-note). - Geniş Yazılım Ekosistemi: Bayrak taşıyan HTR platformları olan Transkribus, eScriptorium ve Kraken için birincil iç ve dış şema olarak hizmet eder.
2. ALTO XML: Kütüphane ve Arşiv Güç Merkezi
ALTO (Analyzed Layout and Text Object), Bibliothèque nationale de France (BnF) ve British Library dahil olmak üzere ulusal kütüphaneler tarafından yaygın olarak benimsenen, Kongre Kütüphanesi tarafından sürdürülen açık bir XML standardıdır.
Temel Mimari
ALTO, düzeni hiyerarşik olarak Page‘den PrintSpace‘e, ardından TextBlock, TextLine ve String (bireysel kelimeler veya tokenler) seviyelerine yapılandırır. Yapısal meta verileri yüksek çözünürlüklü ana görüntülerle ilişkilendirmek için sık sık METS (Metadata Encoding and Transmission Standard) sarmalayıcısı içinde paketlenir.
Ana Güçlü Yönler ve Kullanım Durumları
- Kitle Dijitalleştirme İş Akışları: ALTO, endüstriyel ölçekli gazete ve kitap dijitalleştirmeyi göz önünde bulundurarak tasarlandı. Yazı tipi özelliklerini, kelime düzeyindeki koordinatları, karakter güvenini ve boşlukları temiz bir şekilde kodlar.
- Modern HTR Desteği (ALTO 4): ALTO’nun önceki sürümleri dikdörtgen koordinatlara (
HPOS,VPOS,WIDTH,HEIGHT) büyük ölçüde dayanıyordu. Ancak, ALTO sürüm 4 ile birlikte şema<Shape>çokgenlerini ve çoklu çizgi taban hatlarını tanıttı, el yazısı materyaller için PAGE XML ile işlevsel boşluğu kapattı. - Uzun Vadeli Koruma: Uluslararası kütüphane konsorsiyumları tarafından desteklenen resmi bir standart olduğu için ALTO, uzun vadeli istikrar ve arşiv düzeyinde geriye dönük uyumluluk garantiler.
3. hOCR: Web-Öncelikli, Hafif Standart
Thomas Breuel tarafından oluşturulan hOCR, pragmatik bir yaklaşım benimser: tamamen yeni bir XML şeması oluşturmak yerine, düzen ve transkripsiyon meta verilerini doğrudan anlamsal HTML/XHTML içine mikroformatlar ve sınıf öznitelikleri kullanarak gömer.
Tipik Söz Dizimi Örneği
<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
<div class="ocr_carea" id="block_1_1">
<p class="ocr_par" id="par_1_1">
<span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
<span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Başlangıç</span>
</span>
</p>
</div>
</div>
Tarihî Materyaller İçin Artılar ve Eksiler
- Artılar: Tarayıcılar bunu yerel olarak render edebilir. Saf CSS ve JavaScript kullanılarak kolayca dönüştürülebilir ve Tesseract gibi motorlar için varsayılan yapılandırılmış dışa aktarma formatıdır.
- Eksiler: Karmaşık, serbest biçimli çok noktalı taban eğrileri için yerel destek sınırlıdır. Erken basım eserleri (incunabula veya temiz broadsides) için pratik olsa da, hOCR düzensiz el yazması düzenleri ve çok katmanlı kenar notalarıyla mücadele eder.
4. TEI-XML: Akademik ve Dijital Beşeri Bilimler Ölçütü
Text Encoding Initiative (TEI) formatı, kesinlikle bir OCR motoru çıktı formatı değildir; aksine, edebi ve tarihsel metinlerin eleştirel dijital edisyonları ve akademik temsili için birincil standarttır.
OCR/HTR’yi TEI’ye Bağlamak
Modern iş akışları nadiren ham karakter tanıma aşamasında durur. Akademisyenler, Transkribus TEI Exporter gibi araçları veya otomatik XSLT iş akışlarını kullanarak PAGE XML veya ALTO dosyalarını TEI uyumlu XML’e dönüştürürler:
- Kısaltmalar genişletilir (
<choice><abbr>...</abbr><expan>...</expan></choice>). - Silmeler, eklemeler ve yazma elleri resmi olarak sınıflandırılır (
<add>,<del>,<handShift>). - Düzen verileri,
<facsimile>ve<surface>öğeleri aracılığıyla edebi analizle birlikte korunur.
Tarihi projeniz etkileşimli bir eleştirel edisyon veya anlamsal olarak aranabilir bir akademik arşiv oluşturmayı hedefliyorsa, OCR/HTR verilerinizi TEI-XML’e dönüştürmek genellikle gerekli son adımdır.
Karşılaştırmalı Matris: OCR/HTR Formatlarına Genel Bakış
| Özellik / Kriter | PAGE XML | ALTO XML (v4+) | hOCR | TEI-XML |
|---|---|---|---|---|
| Ana Alan | El yazısı HTR & El Yazmaları | Kütüphane Toplu Dijitalleştirme | Web OCR & Hafif Arama | Akademik Eleştirel Baskılar |
| Temel Destek | Yerel, Çok Noktalı Çizgiler | Desteklenen (v4.0’dan beri) | Temel (Eğim/Ofset) | Faksimile eşleme ile |
| Düzensiz Çokgenler | Tam | Tam | Sınırlı | Koordinat öğeleri aracılığıyla |
| Araç Ekosistemi | Transkribus, eScriptorium | METS, Goobi, Kitodo | Tesseract, Web görüntüleyicileri | Oxygen, TEI Publisher |
| Standardizasyon Kurumu | PRImA Group / Open | Kongre Kütüphanesi | Topluluk Şartnamesi | TEI Konsorsiyumu |
Pratik Öneriler: Arşivleme Sürecinizi Seçmek
Verimli ve geleceğe dayanıklı bir dijitalleştirme hattı kurmak için:
- Saf El Yazması Belgeler ve Arşivler İçin: Transkripsiyon ve düzen çıkarımını PAGE XML üzerinde standartlaştırın. Temel çizgi hesaplaması ve çokgen konturlama, standart dışı el yazılarını minimum veri kaybıyla işler.
- Büyük Ölçekli Kütüphane ve Karışık Koleksiyonlar İçin: ALTO XML (v4.2 veya üzeri) ile METS‘i seçin. Bu, standart dijital depo mimarileri ve dijital varlık yönetim sistemlerine (DAMS) sorunsuz entegrasyon sağlar.
- Web Sunumu ve Tam Metin Arama İndeksleri İçin: hOCR kullanın veya PAGE XML’den hafif GeoJSON/Web Annotation yapıları türetin ve bu yapıları, Mirador veya Universal Viewer gibi interaktif IIIF görüntüleyicileriyle tarayıcı içinde canlı metin katmanları sağlayarak çalıştırın.
- Akademik Baskılar ve Paleografik Araştırmalar İçin: PAGE XML formatında gerçek veri setinizi oluşturun, tanıma işlemini gerçekleştirin ve çıktıyı otomatik bir dönüştürücü aracılığıyla TEI-XML’e dönüştürerek editöryal işaretleme yapın.
Bu formatların yapısal yeteneklerini kaynak materyalinizin paleografik gereksinimleriyle eşleştirerek, her bir çizgi, kısaltma ve tarihsel nüansın yüzyıllar boyunca anlaşılabilir kalmasını sağlarsınız.
Sıkça Sorulan Sorular (SSS)
S1. Standart OCR ile HTR arasındaki temel fark nedir? OCR, tutarlı makineyle basılmış tipografiyi tanırken, HTR (El Yazısı Tanıma) derin sinir ağlarını kullanarak sürekli, değişken insan el yazısını ve eğimli taban çizgilerini çözer.
S2. Tesseract OCR, tarihsel belgeler için PAGE XML veya ALTO çıktısı üretebilir mi? Evet, Tesseract yerel ALTO XML ve hOCR çıktısı oluşturabilir ve üçüncü taraf sarmalayıcılar bu sonuçları PAGE XML’e dönüştürebilir.
S3. El yazısı transkripsiyonunda taban çizgileri neden sınırlayıcı kutulardan daha önemlidir? Taban çizgileri, insan el yazısının doğal, dalgalı hattını izler ve yazılımın katı sınırlayıcı kutular içinde çarpışan üst ve alt uzantıları ayırmasını sağlar.
S4. IIIF standardı bu OCR dosya formatlarıyla nasıl etkileşir? IIIF, açık web API’leri aracılığıyla yüksek çözünürlüklü görüntüler sunar, ALTO veya PAGE XML gibi formatlar koordinat verileri sağlar ve bu veriler IIIF İçerik Arama ek açıklamalarına dönüştürülebilir.
S5. Hangi dosya formatı doğrudan aranabilir bir PDF’ye dönüştürmek için en kolaydır? Hem hOCR hem de ALTO XML, OCRmyPDF gibi araçlar kullanılarak orijinal sayfa görüntüleriyle eşleştirilerek aranabilir çift katmanlı PDF dosyaları oluşturulabilir.