<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>광학 문자 인식 on File Format Blog</title>
    <link>https://blog.fileformat.com/ko/tag/%EA%B4%91%ED%95%99-%EB%AC%B8%EC%9E%90-%EC%9D%B8%EC%8B%9D/</link>
    <description>Recent content in 광학 문자 인식 on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>ko</language>
    <lastBuildDate>Wed, 07 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/ko/tag/%EA%B4%91%ED%95%99-%EB%AC%B8%EC%9E%90-%EC%9D%B8%EC%8B%9D/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>손글씨 텍스트 인식(HTR)을 위한 올바른 파일 형식 선택 방법</title>
      <link>https://blog.fileformat.com/ko/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</link>
      <pubDate>Wed, 07 Oct 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/ko/ocr/ocr-file-formats-for-historical-and-handwritten-documents/</guid>
      <description>역사적 원고와 손글씨 아카이브를 위한 최고의 OCR 및 HTR 파일 형식을 발견하고, ALTO, PAGE XML, hOCR, 그리고 TEI-XML을 비교합니다.</description>
      <content:encoded><![CDATA[<p><strong>마지막 업데이트</strong>: 2026년 8월 20일</p>
<figure class="align-center ">
    <img loading="lazy" src="images/ocr-file-formats-for-historical-and-handwritten-documents.png#center"
         alt="OCR File Formats for Historical and Handwritten Documents"/> 
</figure>

<h2 id="역사적-및-손글씨-문서를-위한-ocr-파일-형식">역사적 및 손글씨 문서를 위한 OCR 파일 형식</h2>
<p>디지털화를 통한 문화유산 보존이 르네상스를 맞이했습니다. 초기 광학 문자 인식(OCR) 시스템은 깨끗하고 기계 인쇄된 20세기 문서를 분석하도록 설계되었지만, 현대 문화유산 기관들은 훨씬 더 복잡하고 풍부한 도전에 직면하고 있습니다: 중세 필사본, 19세기 필기 서신, 부서지기 쉬운 채색 사본, 그리고 수세기 된 기록들.</p>
<p>역사 문서를 전사하는 것은 이제 단순히 평범한 ASCII 텍스트를 추출하는 것만이 아닙니다. 페이지의 물리적 기하학, 기준선 곡선, 누출 보정, 여백 주석, 약어, 그리고 고문서학적 불확실성 등 <strong>context</strong>—을 포착해야 합니다. 이 전문 분야는 종종 손글씨 텍스트 인식(Handwritten Text Recognition, HTR)으로 분류되며, 이미지 좌표와 텍스트 레이어를 모두 저장하고 교환하는 파일 형식에 크게 의존합니다.</p>
<p>잘못된 스키마를 선택하면 중요한 기준선 데이터가 사라지고, IIIF (International Image Interoperability Framework) 매니페스트와의 정렬이 깨지며, 장기 디지털 보존을 방해할 수 있습니다. 여기에는 역사 문서를 위한 주요 OCR 및 HTR 파일 형식, 각 형식의 구조적 강점, 그리고 아카이브 파이프라인에 적합한 선택을 결정하는 방법에 대한 확정적인 가이드가 있습니다.</p>
<h2 id="역사적-딜레마-왜-일반-텍스트15와-표준-pdf1가-실패하는가">역사적 딜레마: 왜 <a href="https//docs.fileformat.com/word-processing/txt/">일반 텍스트</a>와 표준 <a href="https://docs.fileformat.com/pdf/">PDF</a>가 실패하는가</h2>
<p>기계 인쇄 OCR은 종종 간단한 <code>.txt</code> 파일이나 스캔 아래에 숨겨진 텍스트 레이어가 있는 &ldquo;sandwich&rdquo; PDF를 출력합니다. 역사적 원고와 필기체 손글씨의 경우, 이러한 출력은 세 가지 핵심 이유로 실패합니다:</p>
<ol>
<li><strong>비선형 텍스트와 복잡한 레이아웃:</strong> 역사적인 서기들은 깔끔한 직사각형 격자에 얽매이지 않았습니다. 텍스트는 여백으로 흐르고, 장식된 이니셜 주위를 감싸며, 삽입된 행간 교정 사이를 엮고, 혹은 책등을 따라 수직으로 흐릅니다.</li>
<li><strong>곡선 및 기울어진 기준선:</strong> 필기체는 드물게 고정된 수평 축을 따릅니다. Transkribus, Kraken, eScriptorium과 같은 HTR 엔진은 결합문자가 많은 스크립트를 해석하기 위해 경계 상자보다 폴리라인 기준선에 의존합니다.</li>
<li><strong>고문서학적 복잡성 및 메타데이터:</strong> 아카이브 연구는 약어, 역사적 철자 변형, 손상된 판독, 그리고 행 수준 신뢰도 점수를 추적해야 합니다. 표준 문서 형식은 이러한 세부 정보를 버립니다.</li>
</ol>
<p>원본 유물에 대한 충실성을 유지하기 위해, 아카이브 커뮤니티는 전사된 텍스트와 함께 레이아웃 토폴로지를 보존하도록 설계된 구조화된 XML 스키마에 의존합니다.</p>
<h2 id="1-page-xml-손글씨-텍스트-인식을-위한-최고-표준-htr">1. PAGE XML: 손글씨 텍스트 인식을 위한 최고 표준 (HTR)</h2>
<p>PRImA (Pattern Recognition &amp; Image Analysis) 연구실에서 개발한 <strong>PAGE XML</strong> (Page Analysis and Groundtruth Elements)은 손글씨 텍스트 인식 및 고급 레이아웃 분석을 위한 최첨단 형식으로 널리 인정받고 있습니다.</p>
<h3 id="핵심-아키텍처">핵심 아키텍처</h3>
<p>PAGE XML은 물리적 문서를 계층 구조로 취급합니다:</p>
<ul>
<li><code>PcGts</code> (루트)
<ul>
<li><code>Page</code> (이미지 차원 및 전체 읽기 순서)
<ul>
<li><code>TextRegion</code> (단락, 제목, 여백 주석, 캣치워드)
<ul>
<li><code>TextLine</code>
<ul>
<li><code>Coords</code> (선 주위의 폴리곤 좌표)</li>
<li><code>Baseline</code> (스크립트의 실제 기준선에 따라 이어지는 일련의 점)</li>
<li><code>TextEquiv</code> (인식된 텍스트, 선택적 신뢰도 메트릭 포함)</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
</li>
</ul>
<h3 id="역사적-원고에-탁월한-이유">역사적 원고에 탁월한 이유</h3>
<ul>
<li><strong>다각형 및 폴리라인 정밀도:</strong> 문자를 직사각형 경계 상자에 강제로 넣는 대신, PAGE XML은 다점 다각형 경계와 연속 기준선을 사용합니다. 이는 겹치는 필기체 상승선과 하강선이 세분화에 방해가 되는 것을 방지합니다.</li>
<li><strong>세분화된 구조 유형:</strong> 영역은 정확하게 분류될 수 있습니다 (예: <code>marginalia</code>, <code>drop-capital</code>, <code>signature-mark</code>, <code>header</code>, <code>editorial-note</code>).</li>
<li><strong>광범위한 소프트웨어 생태계:</strong> 이는 <strong>Transkribus</strong>, <strong>eScriptorium</strong>, <strong>Kraken</strong>과 같은 대표적인 HTR 플랫폼을 위한 기본 내부 및 내보내기 스키마 역할을 합니다.</li>
</ul>
<h2 id="2-alto-xml-도서관-및-아카이브의-핵심-엔진">2. ALTO XML: 도서관 및 아카이브의 핵심 엔진</h2>
<p>**ALTO (Analyzed Layout and Text Object)**는 미국 의회도서관이 유지 관리하는 개방형 XML 표준이며, 프랑스 국립도서관(BnF)과 영국 도서관을 포함한 여러 국가 도서관에서 널리 채택되고 있습니다.</p>
<h3 id="핵심-아키텍처-1">핵심 아키텍처</h3>
<p>ALTO는 레이아웃을 <code>Page</code>에서 <code>PrintSpace</code>로, 그리고 <code>TextBlock</code>, <code>TextLine</code>, <code>String</code>(개별 단어 또는 토큰)까지 계층적으로 구조화합니다. 구조 메타데이터를 고해상도 원본 이미지와 연결하기 위해 <strong>METS</strong>(Metadata Encoding and Transmission Standard) 래퍼 안에 자주 패키징됩니다.</p>
<h3 id="핵심-강점-및-활용-사례">핵심 강점 및 활용 사례</h3>
<ul>
<li><strong>대량 디지털화 워크플로우:</strong> ALTO는 산업 규모의 신문 및 도서 디지털화를 염두에 두고 설계되었습니다. 글꼴 속성, 단어 수준 좌표, 문자 신뢰도 및 공백을 깔끔하게 인코딩합니다.</li>
<li><strong>현대 HTR 지원 (ALTO 4):</strong> ALTO의 이전 버전은 직사각형 좌표(<code>HPOS</code>, <code>VPOS</code>, <code>WIDTH</code>, <code>HEIGHT</code>)에 크게 의존했습니다. 하지만 <strong>ALTO 버전 4</strong>부터는 스키마가 <code>&lt;Shape&gt;</code> 다각형과 폴리라인 기준선을 도입하여 손필기 자료에 대한 PAGE XML과의 기능 격차를 메웠습니다.</li>
<li><strong>장기 보존:</strong> ALTO는 국제 도서관 연합이 지원하는 공식 표준이기 때문에 장기적인 안정성과 아카이브 수준의 역호환성을 보장합니다.</li>
</ul>
<h2 id="3-hocr-웹-우선-경량-표준">3. hOCR: 웹 우선, 경량 표준</h2>
<p>Thomas Breuel이 만든 <strong>hOCR</strong>는 실용적인 접근 방식을 취합니다: 완전히 새로운 XML 스키마를 만들기보다는 마이크로포맷과 클래스 속성을 사용하여 레이아웃 및 전사 메타데이터를 의미론적 HTML/XHTML에 직접 삽입합니다.</p>
<h3 id="전형적인-구문-예시">전형적인 구문 예시</h3>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-html" data-lang="html"><span style="display:flex;"><span>&lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_page&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;page_1&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;bbox 0 0 2480 3508&#34;</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;<span style="color:#f92672">div</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_carea&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;block_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;<span style="color:#f92672">p</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;ocr_par&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">&#34;par_1_1&#34;</span>&gt;
</span></span><span style="display:flex;"><span>      &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;ocr_line\&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;line_1_1\&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;bbox</span> <span style="color:#a6e22e">150</span> <span style="color:#a6e22e">320</span> <span style="color:#a6e22e">2200</span> <span style="color:#a6e22e">410</span><span style="color:#960050;background-color:#1e0010">;</span> <span style="color:#a6e22e">baseline</span> <span style="color:#a6e22e">0</span> <span style="color:#a6e22e">-5</span><span style="color:#960050;background-color:#1e0010">\&#34;</span>&gt;\n        &lt;<span style="color:#f92672">span</span> <span style="color:#a6e22e">class</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;ocrx_word\&#34;</span> <span style="color:#a6e22e">id</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;word_1_1\&#34;</span> <span style="color:#a6e22e">title</span><span style="color:#f92672">=</span><span style="color:#e6db74">\&#34;bbox</span> <span style="color:#a6e22e">150</span> <span style="color:#a6e22e">325</span> <span style="color:#a6e22e">380</span> <span style="color:#a6e22e">405</span><span style="color:#960050;background-color:#1e0010">;</span> <span style="color:#a6e22e">x_wconf</span> <span style="color:#a6e22e">92</span><span style="color:#960050;background-color:#1e0010">\&#34;</span>&gt;시작&lt;/<span style="color:#f92672">span</span>&gt;\n      &lt;/<span style="color:#f92672">span</span>&gt;
</span></span><span style="display:flex;"><span>    &lt;/<span style="color:#f92672">p</span>&gt;
</span></span><span style="display:flex;"><span>  &lt;/<span style="color:#f92672">div</span>&gt;
</span></span><span style="display:flex;"><span>&lt;/<span style="color:#f92672">div</span>&gt;
</span></span></code></pre></div><h3 id="역사-자료의-장단점">역사 자료의 장단점</h3>
<ul>
<li><strong>장점:</strong> 브라우저가 이를 기본적으로 렌더링할 수 있습니다. 일반 CSS와 JavaScript를 사용해 쉽게 변환할 수 있으며, <strong>Tesseract</strong>와 같은 엔진의 기본 구조화된 내보내기 형식입니다.</li>
<li><strong>단점:</strong> 복잡하고 자유형 다점 기준선 곡선에 대한 기본 지원이 제한적입니다. 초기 인쇄물(인쿠나불라 또는 깔끔한 대형 인쇄물)에는 실용적이지만, hOCR는 불규칙한 원고 레이아웃과 다층 주석에 어려움을 겪습니다.</li>
</ul>
<h2 id="4-tei-xml-학술-및-디지털-인문학-기준">4. TEI-XML: 학술 및 디지털 인문학 기준</h2>
<p><strong>Text Encoding Initiative (TEI)</strong> 형식은 엄격히 OCR 엔진 출력 형식이 아니라, 문학 및 역사 텍스트의 비평 디지털 판과 학술적 표현을 위한 최고의 표준입니다.</p>
<h3 id="ocrhtr을-tei와-연결하기">OCR/HTR을 TEI와 연결하기</h3>
<p>현대 파이프라인은 원시 문자 인식 단계에서 거의 멈추지 않습니다. 학자들은 <strong>Transkribus TEI Exporter</strong>와 같은 도구나 자동화된 XSLT 파이프라인을 사용하여 PAGE XML 또는 ALTO 파일을 TEI 호환 XML로 변환합니다:</p>
<ul>
<li>약어는 확장됩니다 (<code>&lt;choice&gt;&lt;abbr&gt;...&lt;/abbr&gt;&lt;expan&gt;...&lt;/expan&gt;&lt;/choice&gt;</code>).</li>
<li>삭제, 추가, 그리고 필사자 손은 공식적으로 분류됩니다 (<code>&lt;add&gt;</code>, <code>&lt;del&gt;</code>, <code>&lt;handShift&gt;</code>).</li>
<li>레이아웃 데이터는 <code>&lt;facsimile&gt;</code> 및 <code>&lt;surface&gt;</code> 요소를 통해 문학 분석과 함께 보존됩니다.</li>
</ul>
<p>귀하의 역사 프로젝트가 인터랙티브 비평 판이나 의미론적으로 검색 가능한 학술 아카이브를 만드는 것을 목표로 한다면, OCR/HTR 데이터를 TEI-XML로 변환하는 것이 종종 필요한 최종 단계입니다.</p>
<h2 id="비교-매트릭스-ocrhtr-형식-한눈에-보기">비교 매트릭스: OCR/HTR 형식 한눈에 보기</h2>
<table>
<thead>
<tr>
<th style="text-align:left">기능 / 기준</th>
<th style="text-align:left">PAGE XML</th>
<th style="text-align:left">ALTO XML (v4+)</th>
<th style="text-align:left">hOCR</th>
<th style="text-align:left">TEI-XML</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>주요 도메인</strong></td>
<td style="text-align:left">필기체 HTR 및 원고</td>
<td style="text-align:left">대규모 도서관 디지털화</td>
<td style="text-align:left">웹 OCR 및 라이트 검색</td>
<td style="text-align:left">학술 비평 판본</td>
</tr>
<tr>
<td style="text-align:left"><strong>기본 지원</strong></td>
<td style="text-align:left">네이티브, 다중점 폴리라인</td>
<td style="text-align:left">지원 (v4.0부터)</td>
<td style="text-align:left">기본 (경사/오프셋)</td>
<td style="text-align:left">팩시밀리 매핑을 통해</td>
</tr>
<tr>
<td style="text-align:left"><strong>불규칙 다각형</strong></td>
<td style="text-align:left">전체</td>
<td style="text-align:left">전체</td>
<td style="text-align:left">제한됨</td>
<td style="text-align:left">좌표 요소를 통해</td>
</tr>
<tr>
<td style="text-align:left"><strong>툴링 생태계</strong></td>
<td style="text-align:left">Transkribus, eScriptorium</td>
<td style="text-align:left">METS, Goobi, Kitodo</td>
<td style="text-align:left">Tesseract, 웹 뷰어</td>
<td style="text-align:left">Oxygen, TEI 퍼블리셔</td>
</tr>
<tr>
<td style="text-align:left"><strong>표준화 기관</strong></td>
<td style="text-align:left">PRImA Group / 오픈</td>
<td style="text-align:left">미국 의회 도서관</td>
<td style="text-align:left">커뮤니티 사양</td>
<td style="text-align:left">TEI 컨소시엄</td>
</tr>
</tbody>
</table>
<h2 id="실용적인-권고사항-아카이브-파이프라인-선택하기">실용적인 권고사항: 아카이브 파이프라인 선택하기</h2>
<p>효율적이고 미래 지향적인 디지털화 파이프라인을 구축하려면:</p>
<ol>
<li><strong>순수 손필 원고 및 아카이브용:</strong>
전사와 레이아웃 추출을 <strong>PAGE XML</strong>로 표준화하십시오. 이의 기준선 계산 및 폴리곤 윤곽은 비표준 필기체를 최소한의 데이터 손실로 처리합니다.</li>
<li><strong>대규모 도서관 및 혼합 컬렉션용:</strong>
표준 디지털 저장소 아키텍처와 디지털 자산 관리 시스템(DAMS)에 원활하게 통합될 수 있도록 **ALTO XML (v4.2 이상)**과 <strong>METS</strong>를 선택하십시오.</li>
<li><strong>웹 프레젠테이션 및 전체 텍스트 검색 인덱스용:</strong>
<strong>hOCR</strong>를 사용하거나 PAGE XML에서 경량 GeoJSON/웹 주석 구조를 파생시켜 인터랙티브 IIIF 뷰어(예: Mirador 또는 Universal Viewer)를 실시간 브라우저 내 텍스트 오버레이와 함께 구동하십시오.</li>
<li><strong>학술 판본 및 고문서 연구를 위해:</strong>
PAGE XML에서 실제 데이터(ground truth)를 생성하고, 인식을 수행한 뒤 자동 변환기를 통해 출력물을 파이프하여 편집 마크업용 <strong>TEI-XML</strong>을 생성합니다.</li>
</ol>
<p>이러한 형식들의 구조적 기능을 원본 자료의 고문서 요구에 맞추면, 모든 획, 약어 및 역사적 뉘앙스가 앞으로 수세기 동안 해독 가능하도록 보장합니다.</p>
<h2 id="자주-묻는-질문-faq">자주 묻는 질문 (FAQ)</h2>
<p><strong>Q1. 표준 OCR과 HTR의 근본적인 차이점은 무엇인가요?</strong> OCR은 일관된 기계 인쇄 타이포그래피를 인식하는 반면, HTR(Handwritten Text Recognition)은 심층 신경망을 활용해 연속적이고 가변적인 인간 손글씨와 곡선 기반선을 해독합니다.</p>
<p><strong>Q2. Tesseract OCR이 역사 문서에 대해 PAGE XML 또는 ALTO 출력을 생성할 수 있나요?</strong> 네, Tesseract은 기본 ALTO XML 및 hOCR 출력을 생성할 수 있으며, 서드파티 래퍼를 사용해 이러한 결과를 PAGE XML로 변환할 수 있습니다.</p>
<p><strong>Q3. 손글씨 전사에서 기준선이 경계 상자보다 중요한 이유는 무엇인가요?</strong> 기준선은 인간 필체의 자연스럽고 물결치는 라인을 추적하여, 소프트웨어가 경직된 경계 상자 안에서 겹치는 상승선과 하강선을 구분하도록 합니다.</p>
<p><strong>Q4. IIIF 표준은 이러한 OCR 파일 형식과 어떻게 상호 작용합니까?</strong> IIIF는 오픈 웹 API를 통해 고해상도 이미지를 제공하고, ALTO 또는 PAGE XML과 같은 형식은 좌표 데이터를 제공하여 IIIF 콘텐츠 검색 주석으로 변환할 수 있습니다.</p>
<p><strong>Q5. 어떤 파일 형식이 검색 가능한 PDF로 직접 변환하기 가장 쉽습니까?</strong> hOCR와 ALTO XML 모두 원본 페이지 이미지와 결합하여 OCRmyPDF와 같은 도구를 사용해 검색 가능한 이중 레이어 PDF 파일을 만들 수 있습니다.</p>
<h2 id="관련-항목">관련 항목</h2>
<ul>
<li><a href="https://blog.fileformat.com/en/pdf/pdfa-3-the-hybrid-monster-embedding-original-data-inside-your-ocr/">PDF/A-3 - 하이브리드 괴물? OCR 내부에 원본 데이터 삽입</a></li>
<li><a href="https://blog.fileformat.com/ocr/understanding-ocr-file-formats-hocr-vs-alto-vs-pdfa-explained/">OCR 파일 형식 이해 - HOCR vs ALTO vs PDF/A 설명</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-the-difference-between-pdf-and-fdf/">PDF와 FDF의 차이점은 무엇인가요?</a></li>
<li><a href="https://blog.fileformat.com/pdf/what-is-fdf-used-for/">FDF는 무엇에 사용되나요? 양식 데이터 형식의 목적 이해</a></li>
<li><a href="https://blog.fileformat.com/file-formats/pdf-vs-word-which-one-should-you-use-and-when/">PDF와 Word: 언제 어떤 것을 사용해야 할까요?</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
