Son Yenilənmə: 20 Avqust, 2026

Tarixi və əl yazısı sənədlər üçün OCR fayl formatları
Rəqəmsallaşma vasitəsilə mədəni irsin qorunması yeni bir renaissansa qədəm qoymuşdur. Erkən optik xarakter tanıma (OCR) sistemləri təmiz, maşınla çap olunmuş 20-ci əsrin sənədlərini oxumaq üçün hazırlanmışdı, lakin müasir mədəni irs müəssisələri daha qarışıq, daha zəngin bir çətinliklə üzləşir: orta əsr əl yazmaları, on doqquzuncu əsrin əl yazısı məktubları, qırılmağa meylli işıqlı foliyalar və əsrlik qeydiyyatlar.
Tarixi sənədlərin transkripsiyası artıq yalnız sadə ASCII mətnini çıxarmaqla məhdudlaşmır. Bu, kontekst—səhifənin fiziki geometriyasını, əsas xətt əyrilərini, keçidlərin düzəlişlərini, kənar qeydləri, qısaltmaları və paleoqrafik qeyri-müəyyənliyi tutmağı tələb edir. Tez-tez Əl Yazısı Mətn Tanıma (HTR) altında təsnif edilən bu ixtisaslaşmış sahə, həm şəkil koordinatlarını, həm də mətn qatlarını saxlamaq və mübadilə etmək üçün istifadə olunan fayl formatına çox bağlıdır.
Səhv sxemi seçmək vacib əsas xətt məlumatlarını itirə, IIIF (Beynəlxalq Şəkil İnteroperabilik Çərçivəsi) manifestləri ilə uyğunluğu poza və ya uzunmüddətli rəqəmsal qorunmanı əngəlləyə bilər. Budur, tarixi sənədlər üçün aparıcı OCR və HTR fayl formatlarına, onların struktur güclərinə və arxivləşdirmə prosesiniz üçün doğru seçimi necə müəyyənləşdirməyə dair qətiyyətli bələdçi.
Tarixi dilemması: Niyə Sadə mətn və Standart PDF-lər uğursuz olur
Maşın-çaplı OCR tez-tez sadə .txt faylları və ya skan altında gizli mətn qatları olan "sandviç" PDF-lər çıxarır. Tarixi əlyazmalar və əyri əl yazısı üçün bu çıxışlar üç əsas səbəbdən uğursuz olur:
- Qeyri-xətti mətn və mürəkkəb tərtibatlar: Tarixi nüsxəçiçilər nizamlı dördbucaqlı şəbəkələrə riayət etmirdilər. Mətn kənarlara axır, işıqlı baş hərflərin ətrafını bürüyür, əlavə edilmiş interlinial düzəlişlər arasında toxunur, ya da onurğa boyunca şaquli şəkildə uzanır.
- Əyri və əyilmiş əsas xətlər: Əl yazısı nadir hallarda sərt üfüqi oxu izləyir. Transkribus, Kraken və eScriptorium kimi HTR mühərrikləri, bağlayıcı çoxlu skriptləri şərh etmək üçün sərhəd qutularından çox polyline əsas xətlərinə etibar edir.
- Paleoqrafik mürəkkəblik və metadata: Arxiv tədqiqatları qısaltmaların, tarixi orfoqrafik varyasiyaların, zədələnmiş oxunuşların və sətir səviyyəli etibarlılıq ballarının izlənməsini tələb edir. Standart sənəd formatları bu incəliyi itirir.
Orijinal əsərə sadiqliyi qorumaq üçün arxiv icması, transkrib edilmiş mətnlə yanaşı tərtibat topologiyasını saxlamaq üçün hazırlanmış strukturlaşdırılmış XML sxemlərinə əsaslanır.
1. PAGE XML: Əl yazısı mətn tanıması (HTR) üçün Qızıl standart
PRImA (Pattern Recognition & Image Analysis) Araşdırma Laboratoriyası tərəfindən hazırlanmış PAGE XML (Page Analysis and Groundtruth Elements) əl yazısı mətn tanıması və inkişaf etmiş tərtibat analizləri üçün ən müasir format kimi geniş qəbul edilir.
Əsas memarlıq
PAGE XML fiziki sənədi iyerarxik bir struktur kimi qəbul edir:
PcGts(Kök)Page(Şəkil ölçüləri və ümumi oxuma sırası)TextRegion(Paraqraflar, başlıqlar, kənar qeydlər, tutma sözləri)TextLineCoords(Xətt ətrafındakı çoxbucaqlı koordinatlar)Baseline(Yazının həqiqi əsas xəttini izləyən nöqtələr seriyası)TextEquiv(Tanınmış mətn, istəyə bağlı etibarlılıq ölçüləri ilə)
Niyə tarixi əl yazıları üçün üstünlük təşkil edir
- Çoxbucaqlı və Çoxxətli Dəqiqlik: Simvolları dördbucaqlı sərhəd qutularına məcbur etmək əvəzinə, PAGE XML çoxnöqtəli çoxbucaqlı sərhədlər və davamlı əsas xətlərdən istifadə edir. Bu, üst-üstə düşən əyri yüksəldicilər və aşağı salıcıların seqmentasiyaya mane olmasının qarşısını alır.
- Granular Struktural Növlər: Regionlar dəqiq şəkildə təsnif edilə bilər (məsələn,
marginalia,drop-capital,signature-mark,header,editorial-note). - Geniş Proqram Təminatı Ekosistemi: O, Transkribus, eScriptorium və Kraken kimi qabaqcıl HTR platformaları üçün əsas daxili və ixrac sxemi kimi xidmət edir.
2. ALTO XML: Kitabxana və arxiv gücü
ALTO (Analyzed Layout and Text Object) açıq XML standartıdır, Library of Congress tərəfindən saxlanılır və Fransa Milli Kitabxanası (Bibliothèque nationale de France - BnF) və British Library daxil olmaqla milli kitabxanalar tərəfindən geniş şəkildə qəbul edilir.
Əsas memarlıq
ALTO, layout-u iyerarxik şəkildə Page‑dən PrintSpace‑ə, sonra TextBlock, TextLine və String (fərdi sözlər və ya tokenlər) qədər qurur. Struktur metadata‑sını yüksək çözünürlüklü master şəkillərlə əlaqələndirmək üçün tez-tez METS (Metadata Encoding and Transmission Standard) qabığının içində paketlənir.
Əsas güclü tərəflər və istifadə halları
- Kütləvi Rəqəmsallaşdırma İş Axınları: ALTO, sənaye ölçülü qəzet və kitab rəqəmsallaşdırmasını nəzərə alaraq hazırlanmışdır. O, şrift atributlarını, söz səviyyəli koordinatları, simvol etibarlılığını və boşluqları dəqiq şəkildə kodlayır.
- Müasir HTR Dəstəyi (ALTO 4): ALTO-nun əvvəlki versiyaları düzbucaqlı koordinatlara (
HPOS,VPOS,WIDTH,HEIGHT) çox güvənirdi. Lakin ALTO versiya 4-dən başlayaraq sxem<Shape>çoxbucaqlı və polyline əsas xətləri təqdim etdi, əl yazısı materialları üçün PAGE XML ilə funksional boşluğu bağladı. - Uzunmüddətli Qoruma: Beynəlxalq kitabxana konsorsiumları tərəfindən dəstəklənən rəsmi standart olduğu üçün ALTO uzunmüddətli sabitliyi və arxiv‑səviyyəli geriyə uyğunluğu təmin edir.
3. hOCR: Veb-İlk, Yüngül Standart
Thomas Breuel tərəfindən yaradılan hOCR, praktik yanaşma qəbul edir: tamamilə yeni bir XML sxemi yaratmaq əvəzinə, layout və transkripsiya metadata‑sını birbaşa semantik HTML/XHTML‑ə mikroformatlar və sinif atributları vasitəsilə yerləşdirir.
Tipik Sintaksis Nümunəsi
<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
<div class="ocr_carea" id="block_1_1">
<p class="ocr_par" id="par_1_1">
<span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
<span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Başlanğıc</span>
</span>
</p>
</div>
</div>
Tarixi Materiallar üçün Üstünlüklər və Çatışmazlıqlar
- Üstünlüklər: Brauzerlər onu təbii şəkildə göstərə bilir. Vanilla CSS və JavaScript istifadə edərək asanlıqla çevrilə bilər və Tesseract kimi mühərriklər üçün standart strukturlaşdırılmış ixrac formatıdır.
- Mənfi cəhətlər: Kompleks, sərbəst çox‑nöqtəli əsas xətt əyriləri üçün yerli dəstək məhduddur. Erkən çap əsərləri (incunabula və ya təmiz broadsidlər) üçün praktik olsa da, hOCR qeyri‑sabit əl yazısı layoutları və çox‑qatlı kənar qeydlərlə çətinlik çəkir.
4. TEI-XML: Akademik və Rəqəmsal Humanitar Elmlərin Benchmarkı
Text Encoding Initiative (TEI) formatı məcburi olaraq OCR mühərrikinin çıxış formatı deyil; əksinə, ədəbi və tarixi mətnlərin tənqidi rəqəmsal nəşrləri və elmi təmsili üçün qabaqcıl standartdır.
OCR/HTR-i TEI-ə Bağlamaq
Müasir boru kəmərləri nadir hallarda xam simvol tanıma mərhələsində dayanır. Alimlər Transkribus TEI Exporter kimi alətləri və ya avtomatlaşdırılmış XSLT boru kəmərlərini PAGE XML və ya ALTO fayllarını TEI-uyğun XML-ə çevirmək üçün istifadə edirlər:
- Qısaltmalar genişləndirilir (
<choice><abbr>...</abbr><expan>...</expan></choice>). - Silinmələr, əlavələr və nüsxəçi əl yazıları formal olaraq təsnif edilir (
<add>,<del>,<handShift>). - Dizayn məlumatları ədəbi təhlil ilə birlikdə
<facsimile>və<surface>elementləri vasitəsilə saxlanılır.
Əgər tarixi layihəniz interaktiv tənqidi nəşr və ya semantik axtarışa yararlı elmi arxiv yaratmağı hədəfləyirsə, OCR/HTR məlumatlarınızı TEI-XML-ə çevirmək tez-tez tələb olunan son addımdır.
Müqayisəli Matris: OCR/HTR Formatlarına Bir Baxış
| Xüsusiyyət / Kriteriya | PAGE XML | ALTO XML (v4+) | hOCR | TEI-XML |
|---|---|---|---|---|
| Əsas Sahə | Əl yazısı HTR & Əlyazmalar | Kütləvi Kitabxana Rəqəmsallaşdırması | Veb OCR & Yüngül Axtarış | Elmi Kritik Nəşrlər |
| Əsas Dəstək | Yerli, Çox nöqtəli polilinlər | Dəstəklənir (v4.0-dan bəri) | Əsas (Meyil/Ofset) | Faksimili xəritələmə ilə |
| Qeyri‑düzgün çoxbucaqlar | Tam | Tam | Məhdud | Koordinat elementləri ilə |
| Alət Ekosistemi | Transkribus, eScriptorium | METS, Goobi, Kitodo | Tesseract, Veb görüntüləyiciləri | Oxygen, TEI Publisher |
| Standartlaşdırma Orqanı | PRImA Group / Open | Kongress Kitabxanası | İcma Spesifikasiyası | TEI Konsorsiumu |
Praktik Tövsiyələr: Arxiv Boru Kəmərinizi Seçmək
Səmərəli, gələcəyə davamlı rəqəmsallaşma boru kəməri yaratmaq üçün:
- Təmiz əl yazısı əlyazmalar və arxivlər üçün: Transkripsiyanızı və layout çıxarışınızı PAGE XML üzərində standartlaşdırın. Onun baz xətti hesablaması və çoxbucaqlı konturları qeyri-standart əl yazılarını minimal məlumat itkisi ilə idarə edir.
- Böyük miqyaslı kitabxana və qarışıq kolleksiyalar üçün: ALTO XML (v4.2 və ya daha yuxarı)-ı METS ilə birlikdə seçin. Bu, standart rəqəmsal depo arxitekturaları və rəqəmsal aktiv idarəetmə sistemlərinə (DAMS) problemsiz inteqrasiyanı təmin edir.
- Veb təqdimatı və tam mətn axtarış indeksləri üçün: hOCR-dən istifadə edin və ya PAGE XML-dən yüngül GeoJSON/Veb Anotasiya strukturları çıxarın ki, interaktiv IIIF görüntüləyiciləri (məsələn, Mirador və ya Universal Viewer) canlı brauzer içi mətn örtükləri ilə idarə olunsun.
- Elmi Nəşrlər və Paleoqrafik Araşdırmalar üçün: PAGE XML-də əsas həqiqətinizi yaradın, tanıma həyata keçirin və çıxışı avtomatlaşdırılmış konvertor vasitəsilə TEI-XML-ə çevirərək redaktə işarələməsi üçün yaradın.
Bu formatların struktur imkanlarını mənbə materialınızın paleoqrafik tələbləri ilə uyğunlaşdıraraq, hər bir xətt, qısaltma və tarixi incəliyin əsrlər boyu oxunaqlı qalmasını təmin edirsiniz.
Tez-tez Soruşulan Suallar (FAQ)
Q1. Standart OCR ilə HTR arasındakı əsas fərq nədir? OCR sabit maşın çapı tipografiyanı tanıyır, halbuki HTR (Əl Yazısı Tanıma) davamlı, dəyişkən insan əl yazısını və əyri əsas xətləri şifrələmək üçün dərin neyron şəbəkələrindən istifadə edir.
Q2. Tesseract OCR tarix sənədləri üçün PAGE XML və ya ALTO çıxışı verə bilərmi? Bəli, Tesseract yerli ALTO XML və hOCR çıxışı yarada bilər, və üçüncü tərəf paketləri bu nəticələri PAGE XML-ə çevirə bilər.
Q3. Əl yazısı transkripsiyasında əsas xətlərin sərhəd qutularından niyə daha önəmli olduğu? Əsas xətlər insan əl yazısının təbii, dalğalı xəttini izləyir, bu da proqram təminatına sərt sərhəd qutularında toqquşan üstə düşən yüksəklik və aşağı düşən hissələri ayırmağa imkan verir.
Q4. IIIF standartı bu OCR fayl formatları ilə necə qarşılıqlı əlaqə qurur? IIIF açıq veb API-ləri vasitəsilə yüksək çözünürlüklü şəkilləri təqdim edir, ALTO və ya PAGE XML kimi formatlar isə koordinat məlumatları təmin edir ki, bu da IIIF Content Search annotasiyalarına çevrilə bilər.
Q5. Hansı fayl formatı axtarışa yararlı PDF-ə birbaşa çevirmək üçün ən asandır? Həm hOCR, həm də ALTO XML orijinal səhifə şəkilləri ilə birləşdirilərək OCRmyPDF kimi alətlərdən istifadə edərək axtarışa yararlı ikiqat təbəqəli PDF faylları yaratmaq mümkündür.