<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>OCR-format on File Format Blog</title>
    <link>https://blog.fileformat.com/sv/tag/ocr-format/</link>
    <description>Recent content in OCR-format on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>sv</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/sv/tag/ocr-format/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Hur man väljer rätt filformat för handskriven textigenkänning (HTR)</title>
      <link>https://blog.fileformat.com/sv/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/sv/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>Upptäck de bästa OCR- och HTR-filformaten för historiska manuskript och handskrivna arkiv, jämför ALTO, PAGE XML, hOCR och TEI-XML.</description>
      <content:encoded><![CDATA[<p><strong>Senast uppdaterad</strong>: 20 Aug, 2026</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="ocr-filformat-för-historiska-och-handskrivna-dokument">OCR-filformat för historiska och handskrivna dokument</h2>
<p>Att bevara kulturarvet genom digitalisering har gått in i en renässans. Medan de tidiga optiska teckenigenkänningssystemen (OCR) konstruerades för att tolka oklanderlig, maskintryckt pappersdokument från 1900‑talet, står moderna kulturarvsinstitutioner inför en mycket rörigare och rikare utmaning: medeltida manuskript, 1800‑tals handskriven korrespondens, sköra upplysta folios och århundraden gamla register.</p>
<p>Att transkribera historiska dokument handlar inte längre bara om att extrahera vanlig ASCII‑text. Det kräver att man fångar <strong>kontext</strong>—sidans fysiska geometri, baslinjekurvor, korrigeringar för genomblödning, marginalia, förkortningar och paleografisk osäkerhet. Detta specialiserade område, ofta kategoriserat under Handwritten Text Recognition (HTR), är starkt beroende av det filformat som används för att lagra och utbyta både bildkoordinater och textlager.</p>
<p>Att välja fel schema kan ta bort viktig baslinjedata, bryta alignment med IIIF (International Image Interoperability Framework)-manifest eller hindra långsiktig digital bevarande. Här är en definitiv guide till de ledande OCR- och HTR‑filformaten för historiska dokument, deras strukturella styrkor och hur man avgör rätt val för din arkivpipeline.</p>
<h2 id="det-historiska-dilemmat-varför-vanlig-text15-och-standard-pdf-filer1-misslyckas">Det historiska dilemmat: Varför <a href="https//docs.fileformat.com/word-processing/txt/">Vanlig text</a> och standard <a href="https://docs.fileformat.com/pdf/">PDF-filer</a> misslyckas</h2>
<p>Maskintryckt OCR ger ofta enkla <code>.txt</code>‑filer eller &ldquo;sandwich&rdquo; PDFs med dolda textlager under skanningen. För historiska manuskript och kursiv handstil misslyckas dessa utdata av tre huvudorsaker:</p>
<ol>
<li><strong>Icke-linjär text och komplexa layouter:</strong> Historiska skrivare följde inte rena rektangulära rutnät. Texten rinner in i marginalerna, omsluter upplysta initialer, väver sig mellan insatta interlinjära korrigeringar, eller löper vertikalt längs ryggraden.</li>
<li><strong>Kurviga och snedställda baslinjer:</strong> Kalligrafi följer sällan en stel horisontell axel. HTR-motorer som Transkribus, Kraken och eScriptorium förlitar sig på polylinje-baslinjer snarare än begränsningsrutor för att tolka ligaturtunga skript.</li>
<li><strong>Paleografisk komplexitet och metadata:</strong> Arkivforskning kräver spårning av förkortningar, historiska stavningsvarianter, skadade avläsningar och radnivåns konfidenspoäng. Standarddokumentformat kastar bort denna detaljrikedom.</li>
</ol>
<p>För att bevara troheten mot det ursprungliga artefaktet förlitar sig arkivgemenskapen på strukturerade XML-scheman som är utformade för att bevara layoutens topologi tillsammans med transkriberad text.</p>
<h2 id="1-page-xml-gyllene-standarden-för-handskriven-textigenkänning-htr">1. PAGE XML: Gyllene standarden för handskriven textigenkänning (HTR)</h2>
<p>Utvecklat av PRImA (Pattern Recognition &amp; Image Analysis) Research Lab, <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements) anses allmänt vara det mest avancerade formatet för handskriven textigenkänning och avancerad layoutanalys.</p>
<h3 id="kärnarkitektur">Kärnarkitektur</h3>
<p>PAGE XML behandlar det fysiska dokumentet som en hierarkisk struktur:</p>
<ul>
<li><code>PcGts</code> (Rot)
<ul>
<li><code>Page</code> (Bilddimensioner och övergripande läsordning)
<ul>
<li><code>TextRegion</code> (Paragrafer, rubriker, marginalanteckningar, kaptord)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (Polygonkoordinater runt linjen)</li>
<li><code>Baseline</code> (En serie punkter som följer den verkliga baslinjen för skriptet)</li>
<li><code>TextEquiv</code> (Den igenkända texten, med valfria förtroendemått)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="varför-den-utmärker-sig-för-historiska-manuskript">Varför den utmärker sig för historiska manuskript</h3>
<ul>
<li><strong>Polygon- och polylinjeprecision:</strong> Istället för att tvinga tecken in i rektangulära avgränsningsrutor använder PAGE XML polygongränser med flera punkter och kontinuerliga baslinjer. Detta förhindrar att överlappande kursiva upphöjare och nedsänkningar stör segmenteringen.</li>
<li><strong>Granulära strukturella typer:</strong> Regioner kan klassificeras exakt (t.ex. <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>Brett mjukvaruekosystem:</strong> Det fungerar som det primära interna och exportschemat för flaggskepps-HTR-plattformar som <strong>Transkribus</strong>, <strong>eScriptorium</strong> och <strong>Kraken</strong>.</li>
</ul>
<h2 id="2-alto-xml-bibliotekets-och-arkivens-kraftpaket">2. ALTO XML: Bibliotekets och arkivens kraftpaket</h2>
<p><strong>ALTO (Analyzed Layout and Text Object)</strong> är en öppen XML-standard som underhålls av Library of Congress och som har antagits brett av nationella bibliotek, inklusive Bibliothèque nationale de France (BnF) och British Library.</p>
<h3 id="kärnarkitektur-1">Kärnarkitektur</h3>
<p>ALTO strukturerar layout hierarkiskt från <code>Page</code> till <code>PrintSpace</code>, ner till <code>TextBlock</code>, <code>TextLine</code> och <code>String</code> (individuella ord eller token). Det paketeras ofta i ett <strong>METS</strong> (Metadata Encoding and Transmission Standard)-omslag för att associera strukturell metadata med högupplösta originalbilder.</p>
<h3 id="viktiga-styrkor-och-användningsområden">Viktiga styrkor och användningsområden</h3>
<ul>
<li><strong>Massdigitaliseringsarbetsflöden:</strong> ALTO designades med industriell skala för tidnings- och bokdigitalisering i åtanke. Det kodar tydligt teckensnittsattribut, koordinater på ordnivå, teckenkonfidens och mellanslag.</li>
<li><strong>Modern HTR-stöd (ALTO 4):</strong> Tidigare versioner av ALTO förlitade sig starkt på rektangulära koordinater (<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>). Men från och med <strong>ALTO version 4</strong> introducerade schemat <code>&lt;Shape&gt;</code>-polygoner och polylinjebaslinjer, vilket stänger det funktionella gapet mot PAGE XML för handskrivet material.</li>
<li><strong>Långsiktig bevarande:</strong> Eftersom det är en officiell standard som stöds av internationella biblioteks konsortier, garanterar ALTO långsiktig stabilitet och arkivklassad bakåtkompatibilitet.</li>
</ul>
<h2 id="3-hocr-den-webbförst-lätta-standarden">3. hOCR: Den webb‑först, lätta standarden</h2>
<p>Skapad av Thomas Breuel, <strong>hOCR</strong> tar ett pragmatiskt tillvägagångssätt: snarare än att skapa ett helt nytt XML-schema, inbäddar den layout- och transkriptionsmetadata direkt i semantisk HTML/XHTML med hjälp av mikroformat och klassattribut.</p>
<h3 id="exempel-på-typisk-syntax">Exempel på typisk syntax</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_line&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;line_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 320 2200 410; baseline 0 -5&#34;</span>&gt;
</span></span><span style="display:flex;"><span>        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocrx_word&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;word_1_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 150 325 380 405; x_wconf 92&#34;</span>&gt;Incipit&lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="fördelar-och-nackdelar-för-historiska-material">Fördelar och nackdelar för historiska material</h3>
<ul>
<li><strong>Fördelar:</strong> Webbläsare kan rendera det nativt. Det kan enkelt transformeras med vanlig CSS och JavaScript, och det är standardformatet för strukturerad export för motorer som <strong>Tesseract</strong>.</li>
<li><strong>Nackdelar:</strong> Inbyggt stöd för komplexa, fria flerpunktsbaslinjekurvor är begränsat. Även om det är praktiskt för tidiga tryckta verk (incunabula eller rena bredblad), har hOCR svårt med oregelbundna manuskriptlayouter och flerskikts marginalia.</li>
</ul>
<h2 id="4-tei-xml-den-akademiska-och-digitala-humaniorareferensstandarden">4. TEI-XML: Den akademiska och digitala humaniora‑referensstandarden</h2>
<p>Formatet <strong>Text Encoding Initiative (TEI)</strong> är inte strikt ett OCR-motorutdataformat; snarare är det den främsta standarden för kritiska digitala utgåvor och vetenskaplig representation av litterära och historiska texter.</p>
<h3 id="koppla-ocrhtr-till-tei">Koppla OCR/HTR till TEI</h3>
<p>Moderna pipeline‑processer stannar sällan vid rå teckenigenkänning. Forskare använder verktyg som <strong>Transkribus TEI Exporter</strong> eller automatiserade XSLT‑pipeline för att översätta PAGE XML‑ eller ALTO‑filer till TEI‑kompatibel XML:</p>
<ul>
<li>Förkortningar expanderas (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>Raderingar, tillägg och skrivhandar klassificeras formellt (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>Layoutdata bevaras tillsammans med litterär analys via elementen <code>&lt;facsimile&gt;</code> och <code>&lt;surface&gt;</code>.</li>
</ul>
<p>Om ditt historiska projekt syftar till att skapa en interaktiv kritisk utgåva eller ett semantiskt sökbart vetenskapligt arkiv, är konvertering av dina OCR/HTR‑data till TEI‑XML ofta det nödvändiga sista steget.</p>
<h2 id="jämförande-matris-ocrhtr-format-i-översikt">Jämförande matris: OCR/HTR-format i översikt</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Funktion / Kriterium</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>Primär domän</strong></td>
<td style="text-align:left">Kursiv HTR &amp; Manuskript</td>
<td style="text-align:left">Massbibliotek digitalisering</td>
<td style="text-align:left">Webb-OCR &amp; Lättsökning</td>
<td style="text-align:left">Vetenskapliga kritiska utgåvor</td>
</tr>
<tr>
<td style="text-align:left"><strong>Grundläggande stöd</strong></td>
<td style="text-align:left">Inbyggda, flerpunktspolylinjer</td>
<td style="text-align:left">Stöds (sedan v4.0)</td>
<td style="text-align:left">Grundläggande (Lutning/Offset)</td>
<td style="text-align:left">Via faksimilekartläggning</td>
</tr>
<tr>
<td style="text-align:left"><strong>Oregelbundna polygoner</strong></td>
<td style="text-align:left">Full</td>
<td style="text-align:left">Full</td>
<td style="text-align:left">Begränsad</td>
<td style="text-align:left">Via koordinatelement</td>
</tr>
<tr>
<td style="text-align:left"><strong>Verktygs ekosystem</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, Webbläsare</td>
<td style="text-align:left">Oxygen, TEI Publisher</td>
</tr>
<tr>
<td style="text-align:left"><strong>Standardiseringsorgan</strong></td>
<td style="text-align:left">PRImA Group / Open</td>
<td style="text-align:left">Library of Congress</td>
<td style="text-align:left">Gemenskaps Specifikation</td>
<td style="text-align:left">TEI-konsortiet</td>
</tr>
</tbody>
</table>
<h2 id="praktiska-rekommendationer-välja-din-arkivpipeline">Praktiska rekommendationer: Välja din arkivpipeline</h2>
<p>För att etablera en effektiv, framtidssäker digitaliseringspipeline:</p>
<ol>
<li><strong>För rena handskrivna manuskript och arkiv:</strong>
Standardisera din transkription och layoututdrag på <strong>PAGE XML</strong>. Dess baslinjebereäkning och polygonkonturering hanterar icke-standardiserade skrivstilar med minimal dataförlust.</li>
<li><strong>För storskaliga bibliotek och blandade samlingar:</strong>
Välj <strong>ALTO XML (v4.2 eller högre)</strong> i kombination med <strong>METS</strong>. Detta garanterar sömlös integration i standardarkitekturer för digitala arkiv och system för hantering av digitala tillgångar (DAMS).</li>
<li><strong>För webbpresentation och fulltextsökindex:</strong>
Använd <strong>hOCR</strong> eller härleda lätta GeoJSON/Web Annotation-strukturer från PAGE XML för att driva interaktiva IIIF-visare (såsom Mirador eller Universal Viewer) med live textöverlägg i webbläsaren.</li>
<li><strong>För vetenskapliga utgåvor &amp; paleografisk forskning:</strong>
Generera ditt ground truth i PAGE XML, utför igenkänning och skicka utdata genom en automatiserad konverterare för att generera <strong>TEI-XML</strong> för redaktionell markup.</li>
</ol>
<p>Genom att matcha de strukturella möjligheterna i dessa format med de paleografiska kraven på ditt källmaterial säkerställer du att varje streck, förkortning och historisk nyans förblir avkodningsbar i århundraden framöver.</p>
<h2 id="vanliga-frågor-faq">Vanliga frågor (FAQ)</h2>
<p><strong>Q1. Vad är den grundläggande skillnaden mellan standard-OCR och HTR?</strong> OCR känner igen konsekvent maskintryckt typografi, medan HTR (Handwritten Text Recognition) använder djupa neurala nätverk för att avkoda kontinuerlig, variabel mänsklig handskrift och böjda baslinjer.</p>
<p><strong>Q2. Kan Tesseract OCR producera PAGE XML eller ALTO-utdata för historiska dokument?</strong> Ja, Tesseract kan generera inbyggd ALTO XML och hOCR-utdata, och tredjeparts‑omslag kan konvertera dessa resultat till PAGE XML.</p>
<p><strong>Q3. Varför är baslinjer viktigare än begränsningsrutor i transkription av handskrift?</strong> Baslinjer följer den naturliga, svallande linjen i mänsklig penningstil, vilket gör att mjukvaran kan separera överlappande upphöjda och sänkta tecken som kolliderar inom stela begränsningsrutor.</p>
<p><strong>Q4. Hur interagerar IIIF-standarden med dessa OCR-filformat?</strong> IIIF levererar högupplösta bilder via öppna webb-API:er, medan format som ALTO eller PAGE XML tillhandahåller koordinatdata som kan konverteras till IIIF Content Search-annotationer.</p>
<p><strong>Q5. Vilket filformat är enklast att konvertera direkt till en sökbar PDF?</strong> Både hOCR och ALTO XML kan kombineras med originalsidbilder för att skapa sökbara dubbla lager PDF-filer med verktyg som OCRmyPDF.</p>
<h2 id="se-även">Se även</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 – Hybridmonstret? Inbäddning av originaldata i din OCR</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">Förstå OCR-filformat – HOCR vs ALTO vs PDF/A förklarat</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">Vad är skillnaden mellan PDF och FDF?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">Vad används FDF för? Förstå syftet med Forms Data Format</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF vs Word: Vilken bör du använda och när?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
