Ultimo aggiornamento: 20 Aug, 2026

Formati di File OCR per Documenti Storici e Scritti a Mano
La conservazione del patrimonio culturale attraverso la digitalizzazione è entrata in una rinascita. Mentre i primi sistemi di riconoscimento ottico dei caratteri (OCR) erano progettati per analizzare documenti impeccabili, stampati meccanicamente del ventesimo secolo, le moderne istituzioni del patrimonio culturale si trovano ad affrontare una sfida molto più complessa e ricca: manoscritti medievali, corrispondenza corsiva del XIX secolo, fogli illuminati fragili e registri centenari.
Trascrivere documenti storici non è più solo una questione di estrarre testo ASCII semplice. Richiede la cattura del contesto—la geometria fisica della pagina, le curve di base, le correzioni di trasparenze, le marginalia, le abbreviazioni e l’incertezza paleografica. Questo campo specializzato, spesso classificato sotto il riconoscimento del testo manoscritto (HTR), dipende fortemente dal formato file utilizzato per memorizzare e scambiare sia le coordinate delle immagini sia gli strati testuali.
Scegliere lo schema sbagliato può rimuovere dati di base vitali, rompere l’allineamento con i manifesti IIIF (International Image Interoperability Framework) o impedire la conservazione digitale a lungo termine. Ecco una guida definitiva ai principali formati file OCR e HTR per documenti storici, i loro punti di forza strutturali e come determinare la scelta giusta per la tua pipeline archivistica.
Il Dilemma Storico: Perché il Testo Semplice e i PDF Standard Falliscono
L’OCR stampato meccanicamente produce spesso semplici file .txt o PDF “sandwich” con livelli di testo nascosti sotto la scansione. Per manoscritti storici e scrittura corsiva, questi output falliscono per tre ragioni fondamentali:
- Testo non lineare e layout complessi: Gli scribi storici non si attenevano a griglie rettangolari ordinate. Il testo scorre nei margini, si avvolge attorno alle iniziali illuminate, si intreccia tra correzioni interlineari inserite, o corre verticalmente lungo il dorso.
- Linee di base curve e inclinate: La scrittura corsiva raramente segue un asse orizzontale rigido. I motori HTR come Transkribus, Kraken e eScriptorium si basano su linee di base poligonali anziché su riquadri di delimitazione per interpretare script ricchi di legature.
- Complessità paleografica e metadati: La ricerca archivistica richiede il tracciamento di abbreviazioni, variazioni ortografiche storiche, letture danneggiate e punteggi di confidenza a livello di riga. I formati di documento standard scartano questa granularità.
Per mantenere la fedeltà all’oggetto originale, la comunità archivistica si affida a schemi XML strutturati progettati per preservare la topologia del layout insieme al testo trascritto.
1. PAGE XML: Lo Standard d’Oro per il Riconoscimento del Testo Scritto a Mano (HTR)
Sviluppato dal laboratorio di ricerca PRImA (Pattern Recognition & Image Analysis), PAGE XML (Page Analysis and Groundtruth Elements) è ampiamente considerato il formato all’avanguardia per il riconoscimento del testo manoscritto e l’analisi avanzata del layout.
Architettura di Base
PAGE XML tratta il documento fisico come una struttura gerarchica:
PcGts(Radice)Page(Dimensioni dell’immagine e ordine di lettura complessivo)TextRegion(Paragrafi, intestazioni, note marginali, parole di testa)TextLineCoords(Coordinate del poligono intorno alla linea)Baseline(Una serie di punti che seguono la vera linea di base della scrittura)TextEquiv(Il testo riconosciuto, con metriche di confidenza opzionali)
Perché Eccelle per i Manoscritti Storici
- Precisione di Poligoni e Polilinee: Invece di costringere i caratteri in riquadri rettangolari, PAGE XML utilizza confini poligonali a più punti e linee di base continue. Questo impedisce che gli ascensori e discensori corsivi sovrapposti interferiscano con la segmentazione.
- Tipi Strutturali Granulari: Le regioni possono essere classificate con precisione (ad es.,
marginalia,drop-capital,signature-mark,header,editorial-note). - Ampio ecosistema software: Serve come schema interno ed di esportazione principale per le piattaforme HTR di punta come Transkribus, eScriptorium e Kraken.
2. ALTO XML: Il Motore delle Biblioteche e degli Archivi
ALTO (Analyzed Layout and Text Object) è uno standard XML aperto mantenuto dalla Library of Congress e ampiamente adottato dalle biblioteche nazionali, tra cui la Bibliothèque nationale de France (BnF) e la British Library.
Architettura di Base
ALTO struttura il layout gerarchicamente da Page a PrintSpace, fino a TextBlock, TextLine e String (parole o token individuali). Viene spesso confezionato all’interno di un wrapper METS (Metadata Encoding and Transmission Standard) per associare i metadati strutturali alle immagini master ad alta risoluzione.
Punti di Forza Chiave e Casi d’Uso
- Flussi di lavoro per la digitalizzazione di massa: ALTO è stato progettato pensando alla digitalizzazione su scala industriale di giornali e libri. Codifica in modo chiaro le caratteristiche dei font, le coordinate a livello di parola, la confidenza dei caratteri e gli spazi bianchi.
- Supporto HTR Moderno (ALTO 4): Le versioni precedenti di ALTO si basavano fortemente su coordinate rettangolari (
HPOS,VPOS,WIDTH,HEIGHT). Tuttavia, a partire da ALTO versione 4, lo schema ha introdotto poligoni<Shape>e baseline polilineari, colmando il divario funzionale con PAGE XML per i materiali manoscritti. - Conservazione a Lungo Termine: Poiché è uno standard ufficiale supportato da consorzi internazionali di biblioteche, ALTO garantisce stabilità a lungo termine e compatibilità retroattiva di livello archivistico.
3. hOCR: Lo standard leggero e orientato al web
Creato da Thomas Breuel, hOCR adotta un approccio pragmatico: invece di creare uno schema XML completamente nuovo, incorpora i metadati di layout e trascrizione direttamente in HTML/XHTML semantico usando microformati e attributi di classe.
Esempio tipico di sintassi
<div class="ocr_page" id="page_1" title="bbox 0 0 2480 3508">
<div class="ocr_carea" id="block_1_1">
<p class="ocr_par" id="par_1_1">
<span class="ocr_line" id="line_1_1" title="bbox 150 320 2200 410; baseline 0 -5">
<span class="ocrx_word" id="word_1_1" title="bbox 150 325 380 405; x_wconf 92">Incipit</span>
</span>
</p>
</div>
</div>
Pro e contro per i materiali storici
- Vantaggi: I browser possono renderizzarlo nativamente. È facilmente trasformabile usando CSS e JavaScript vanilla, ed è il formato di esportazione strutturato predefinito per motori come Tesseract.
- Svantaggi: Il supporto nativo per curve di baseline complesse e libere a più punti è limitato. Sebbene sia pratico per le prime opere stampate (incunaboli o ampie stampe pulite), hOCR fatica con layout manoscritti irregolari e marginalia a più livelli.
4. TEI-XML: Il punto di riferimento accademico e per le discipline umanistiche digitali
Il formato Text Encoding Initiative (TEI) non è strettamente un formato di output di un motore OCR; piuttosto, è lo standard di riferimento per edizioni digitali critiche e la rappresentazione accademica di testi letterari e storici.
Collegare OCR/HTR a TEI
Le pipeline moderne raramente si fermano al riconoscimento grezzo dei caratteri. Gli studiosi usano strumenti come il Transkribus TEI Exporter o pipeline XSLT automatizzate per tradurre file PAGE XML o ALTO in XML conforme a TEI:
- Le abbreviazioni sono espanse (
<choice><abbr>...</abbr><expan>...</expan></choice>). - Cancellazioni, aggiunte e mani di scrittura sono formalmente classificate (
<add>,<del>,<handShift>). - I dati di layout sono conservati insieme all’analisi letteraria tramite gli elementi
<facsimile>e<surface>.
Se il tuo progetto storico mira a creare un’edizione critica interattiva o un archivio accademico semanticamente ricercabile, convertire i dati OCR/HTR in TEI-XML è spesso il passaggio finale necessario.
Matrice comparativa: Formati OCR/HTR a colpo d’occhio
| Caratteristica / Criterio | PAGE XML | ALTO XML (v4+) | hOCR | TEI-XML |
|---|---|---|---|---|
| Dominio Principale | HTR corsivo e manoscritti | Digitalizzazione di massa delle biblioteche | OCR web e ricerca leggera | Edizioni critiche accademiche |
| Supporto di base | Nativo, Polilinee Multi-punto | Supportato (da v4.0) | Base (Pendenza/Scostamento) | Tramite mappatura facsimile |
| Poligoni Irregolari | Completo | Completo | Limitato | Tramite elementi di coordinate |
| Ecosistema di strumenti | Transkribus, eScriptorium | METS, Goobi, Kitodo | Tesseract, visualizzatori web | Oxygen, TEI Publisher |
| Ente di standardizzazione | PRImA Group / Open | Biblioteca del Congresso | Specifiche della comunità | Consorzio TEI |
Raccomandazioni pratiche: scegliere il tuo flusso di lavoro archivistico
Per creare una pipeline di digitalizzazione efficiente e a prova di futuro:
- Per manoscritti e archivi scritti a mano puri: Standardizza la tua trascrizione e l’estrazione del layout su PAGE XML. Il suo calcolo della linea di base e il contorno poligonale gestiscono mani di scrittura non standard con una perdita minima di dati.
- Per biblioteche su larga scala e collezioni miste: Scegli ALTO XML (v4.2 o superiore) abbinato a METS. Questo garantisce un’integrazione senza soluzione di continuità nelle architetture standard di repository digitali e nei sistemi di gestione delle risorse digitali (DAMS).
- Per presentazione web e indici di ricerca full-text: Usa hOCR o genera strutture leggere GeoJSON/Web Annotation da PAGE XML per alimentare visualizzatori IIIF interattivi (come Mirador o Universal Viewer) con sovrapposizioni di testo in tempo reale nel browser.
- Per edizioni accademiche e ricerca paleografica: Genera il tuo ground truth in PAGE XML, esegui il riconoscimento e indirizza l’output attraverso un convertitore automatizzato per generare TEI-XML per il markup editoriale.
Allineando le capacità strutturali di questi formati alle esigenze paleografiche del tuo materiale di origine, garantisci che ogni tratto, abbreviazione e sfumatura storica rimangano decifrabili per i secoli a venire.
Domande frequenti (FAQ)
Q1. Qual è la differenza fondamentale tra OCR standard e HTR? L’OCR riconosce tipografia stampata meccanicamente in modo coerente, mentre l’HTR (Riconoscimento del Testo Manuscritto) utilizza reti neurali profonde per decodificare la scrittura a mano continua e variabile e le linee di base curve.
Q2. Tesseract OCR può produrre PAGE XML o output ALTO per documenti storici? Sì, Tesseract può generare ALTO XML nativo e output hOCR, e wrapper di terze parti possono convertire questi risultati in PAGE XML.
Q3. Perché le linee di base sono più importanti delle bounding box nella trascrizione di testo scritto a mano? Le linee di base tracciano la linea naturale e ondulata della calligrafia umana, consentendo al software di separare ascensori e discensori sovrapposti che si scontrano all’interno di rigide bounding box.
Q4. Come interagisce lo standard IIIF con questi formati di file OCR? IIIF fornisce immagini ad alta risoluzione tramite API web aperte, mentre formati come ALTO o PAGE XML forniscono dati di coordinate che possono essere convertiti in annotazioni di Ricerca Contenuti IIIF.
Q5. Quale formato di file è più facile convertire direttamente in un PDF ricercabile? Sia hOCR che ALTO XML possono essere associati alle immagini originali delle pagine per costruire file PDF a doppio strato ricercabili usando strumenti come OCRmyPDF.