<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Tömörítés a DOCX-ben on File Format Blog</title>
    <link>https://blog.fileformat.com/hu/tag/t%C3%B6m%C3%B6r%C3%ADt%C3%A9s-a-docx-ben/</link>
    <description>Recent content in Tömörítés a DOCX-ben on File Format Blog</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>hu</language>
    <lastBuildDate>Thu, 10 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.fileformat.com/hu/tag/t%C3%B6m%C3%B6r%C3%ADt%C3%A9s-a-docx-ben/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Hogyan működik a tömörítés az EPUB, DOCX, XLSX és PPTX fájlokban?</title>
      <link>https://blog.fileformat.com/hu/compression/how-compression-works-inside-epub-docx-xlsx-and-pptx/</link>
      <pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate>
      
      <guid>https://blog.fileformat.com/hu/compression/how-compression-works-inside-epub-docx-xlsx-and-pptx/</guid>
      <description>Kíváncsi vagy, mi rejlik egy .docx vagy .epub fájl motorháztetője alatt? Fedezd fel, hogyan tartja a ZIP csomagolás és a DEFLATE tömörítés a modern irodai dokumentumokat és e‑könyveket könnyűsúlyú és rendezett állapotban. </description>
      <content:encoded><![CDATA[<p><strong>Utoljára frissítve</strong>: 2026. szeptember 10.</p>
<figure class="align-center ">
    <img loading="lazy" src="images/how-compression-works-inside-epub-docx-xlsx-and-pptx.png#center"
         alt="How Compression Works Inside EPUB, DOCX, XLSX, &amp; PPTX: The Hidden ZIP Architecture"/> 
</figure>

<h2 id="hogyan-működik-a-tömörítés-az-epub-docx-xlsx-és-pptx-fájlokban">Hogyan működik a tömörítés az EPUB, DOCX, XLSX és PPTX fájlokban</h2>
<p>Ha átnevezel egy <code>.docx</code>, <code>.xlsx</code>, <code>.pptx</code> vagy <code>.epub</code> fájlt <code>.zip</code>-re, és duplán kattintasz rá, valami meglepő történik: nem dob hibát. Az operációs rendszer mappaként nyitja meg, amely alkönyvtárakkal, XML konfigurációs fájlokkal, stíluslapokkal, betűtípusokkal és beágyazott képekkel van tele.</p>
<p>A modern dokumentumarchitektúrák évtizedekkel ezelőtt felhagytak a monolitikus bináris blobokkal. Helyettük ipari szabványok—nevezetesen a Microsoft Office számára a <strong>Open Packaging Conventions (OPC)</strong> és az EPUB-hez a <strong>Open Container Format (OCF)</strong>—alkottak egy meglepően elegáns alapot: az egyszerű <strong>ZIP archívum</strong>.</p>
<p>Megérteni, hogyan működik a tömörítés ezekben a formátumokban, feltárja, miért olyan ellenállóak, könnyűek és bővíthetőek a modern dokumentumok – és miért sűrűsödnek egyes fájlok akár 90%-kal, míg mások alig zsugorodnak.</p>
<h2 id="1-a-konténer-architektúra-álcázott-zip9-csomagok">1. A Konténer Architektúra: Álcázott <a href="https://docs.fileformat.com/compression/zip/">ZIP</a> Csomagok</h2>
<p>Mielőtt megértenénk magát a tömörítési algoritmust, hasznos megérteni, miért vannak a modern dokumentumformátumok csomagokként felépítve, nem pedig önálló nyers fájlként.</p>
<h3 id="a-probléma-a-régi-bináris-formátumokkal">A Probléma a Régi Bináris Formátumokkal</h3>
<p>Az 1990-es évek és a 2000-es évek elején a Microsoft Office saját tulajdonú bináris formátumokat használt (<code>.doc</code>, <code>.xls</code>, <code>.ppt</code>). Ezek a fájlok lényegében memória-dumpok voltak, amelyek a Compound File Binary Format (CFBF) köré szerveződtek. Hírhedten törékenyek voltak:</p>
<ul>
<li>Egyetlen bitváltás is tönkreteheti az egész fájlszerkezetet.</li>
<li>Képek beágyazása kiszámíthatatlanul felrobbantotta a fájlméreteket.</li>
<li>A feldolgozáshoz sűrű bináris specifikációk visszafejtése volt szükséges.</li>
<li>A többplatformos interoperabilitás rémálom volt.</li>
</ul>
<h3 id="az-áttérés-a-nyílt-moduláris-konténerekre">Az Áttérés a Nyílt, Moduláris Konténerekre</h3>
<p>A 2000-es évek közepén két párhuzamos evolúció zajlott le:</p>
<ol>
<li><strong>Office Open XML (OOXML / ISO/IEC 29500):</strong> Microsoft bevezette az <code>x</code>-re végződő XML-alapú formátumokat (<a href="https://docs.fileformat.com/word-processing/docx/">DOCX</a>, <a href="https://docs.fileformat.com/spreadsheet/xlsx/">XLSX</a>, <a href="https://docs.fileformat.com/presentation/pptx/">PPTX</a>). A háttérben ezek a fájlok követik a <strong>Open Packaging Conventions (OPC)</strong>.</li>
<li><strong><a href="https://docs.fileformat.com/ebook/epub/">EPUB</a> (IDPF / W3C):</strong> A digitális kiadók elmozdultak a proprietáris olvasóformátumoktól a szabványos webes technológiák (HTML, CSS, SVG) felé, amelyek az <strong>EPUB Open Container Format (OCF)</strong>-ben vannak csomagolva.</li>
</ol>
<p>Mindkét architektúra a szabványos <strong>PKZIP 2.0 / ZIP specifikációra</strong> támaszkodik. A fájlkiterjesztés egyszerűen meghatározza a várt sémát, az alapértelmezett megjelenítő alkalmazást és a mime-típus deklarációkat.</p>
<pre tabindex="0"><code>Sample DOCX File (Unzipped):
├── [Content_Types].xml        &lt;-- Registry of MIME types for parts
├── _rels/                     &lt;-- Package-level relationships
│   └── .rels
├── docProps/                  &lt;-- Core and extended metadata
│   ├── app.xml
│   └── core.xml
└── word/                      &lt;-- Main content payload
    ├── document.xml           &lt;-- Text, paragraphs, and tags
    ├── styles.xml             &lt;-- Typography and presets
    ├── numbering.xml          &lt;-- Lists and counters
    ├── media/                 &lt;-- Embedded images (PNG, JPG)
    └── _rels/
        └── document.xml.rels  &lt;-- Internal hyperlinks &amp; resource pointers
</code></pre><h2 id="2-a-motor-a-motorháztető-alatt-a-deflate-algoritmus">2. A Motor a Motorháztető alatt: A DEFLATE Algoritmus</h2>
<p>Amikor egy szoftveralkalmazás DOCX vagy EPUB fájlt ment, nem csak fájlokat helyez el egy tömörítetlen archívumban. A belső eszközöket <strong>DEFLATE</strong>-tel tömöríti (az RFC 1951-ben meghatározott módon).</p>
<p>A DEFLATE egy kétszintű veszteségmentes tömörítési rendszer, amely két alapvető informatikai algoritmust kombinál:</p>
<h3 id="1-lépés-lz77-lempel-ziv-1977--csúszó-ablak-redundancia-eltávolítás">1. lépés: LZ77 (Lempel-Ziv 1977) — Csúszó Ablak Redundancia Eltávolítás</h3>
<p>Az XML és a HTML rendkívül szótagos. Tekintsd meg, milyen gyakran jelennek meg címkék egy szabványos <code>document.xml</code> vagy <code>chapter1.xhtml</code> fájlban:</p>
<ul>
<li><code>&lt;w:p&gt;&lt;w:r&gt;&lt;w:rPr&gt;&lt;w:sz w:val=&quot;24&quot;/&gt;&lt;/w:rPr&gt;&lt;w:t&gt;</code> ez ezerszer ismétlődik a Wordben.</li>
<li><code>row r=&quot;1&quot; spans=&quot;1:15&quot;&gt;&lt;c r=&quot;A1&quot; t=&quot;s&quot;&gt;&lt;v&gt;</code> ismétlődik az Excelben tízezrek cellájában.</li>
<li><code>&lt;p class=&quot;calibre1&quot;&gt;&lt;span class=&quot;body-text&quot;&gt;</code> ismétlődik az EPUB könyvfejezetekben.</li>
</ul>
<p>Az LZ77 egy csúszó szótárablakot (általában 32 KB) használva vizsgálja a adatfolyamot. Amikor egy nemrég látott karakterláncot talál, a duplikált szöveget egy apró visszamutató mutatóval helyettesíti:</p>
<ul>
<li><code>(distance, length)</code> — például: &ldquo;menj vissza 142 bájttal, másolj 28 bájtot&rdquo;.</li>
</ul>
<p>Ahelyett, hogy ismételten tárolná a terjengős jelölőnyelvet, az LZ77 ezrek ismétlődő XML címkéjét tömör koordináta-referenciákká sűríti.</p>
<h3 id="2-lépés-huffman-kódolás--változó-hosszúságú-frekvencia-kódolás">2. lépés: Huffman-kódolás — Változó Hosszúságú Frekvencia Kódolás</h3>
<p>Miután az LZ77 a redundáns sorozatokat hossz‑távolság tokenekkel helyettesíti, a <strong>Huffman-kódolás</strong> elemzi a folyam minden szimbólumának gyakoriságát:</p>
<ul>
<li>Gyakran előforduló szimbólumok (például gyakori karakterek <code>e</code>, <code>t</code>, szóközök vagy gyakori távolságjelzők) rövid bináris bitkódot kapnak (például 2‑4 bit).</li>
<li>Ritkán használt szimbólumok hosszabb bináris bitkódot kapnak (például 12‑16 bit).</li>
</ul>
<p>Az eredmény egy változó hosszúságú bitkódok áramlata, amely a sima szöveges XML-t <strong>75%‑tól 88%‑ig</strong> tömöríti.</p>
<h2 id="3-formátumról-formátumra-felbontás-hogyan-kezeli-az-egyes-a-tömörítést">3. Formátumról-Formátumra Felbontás: Hogyan Kezeli Az Egyes a Tömörítést</h2>
<p>Miközben a DOCX, XLSX, PPTX és EPUB is ugyanazt a ZIP burkot használja, belső adatjellemzőik drámaian eltérnek.</p>
<h3 id="a-docx-a-szöveg-és-stílus-egyensúlyozó-művelete">A. DOCX: A Szöveg és Stílus Egyensúlyozó Művelete</h3>
<ul>
<li><strong>Mi van benne:</strong> Egyszerű XML (<code>word/document.xml</code>), betűtáblák, stílusok, kapcsolati katalógusok és egy <code>word/media/</code> mappa.</li>
<li><strong>Hogyan működik a tömörítés:</strong>
<ul>
<li>A nyers szöveg és az XML jelölés hatalmas tömörítési arányokat ér el (gyakran 5 MB nyers XML‑ről 500 KB‑ra csökken).</li>
<li>Azonban a modern dokumentumok gyakran beágyaznak képernyőképeket, illusztrációkat és fényképeket. Mivel a JPEG és PNG fájlok <strong>már tömörítettek</strong>, a DEFLATE nem tudja tovább csökkenteni őket. Valójában egy már tömörített képen a DEFLATE futtatása gyakorlatilag 0 % megtakarítást eredményez (sőt, a tömörítési fejlécek miatt akár enyhén is növelheti a méretet).</li>
<li>Ennek következtében a képek nélküli DOCX fájlok rendkívül kicsik, míg a képekben gazdag jelentések szinte pontosan a tartalmazott képfájlok méretét tükrözik.</li>
</ul>
</li>
</ul>
<h3 id="b-xlsx-nagy-mennyiségű-numerikus-adat-és-megosztott-karakterláncok">B. XLSX: Nagy mennyiségű numerikus adat és megosztott karakterláncok</h3>
<p>A táblázatok egyedi kihívást jelentenek: egy munkalap akár több százezer sort is tartalmazhat, ami okos kezelés hiányában csillagászati méretű XML‑fájlokhoz vezet.</p>
<ul>
<li><strong>A megosztott karakterláncok stratégiája (<code>xl/sharedStrings.xml</code>):</strong>
<ul>
<li>Ha egy szövegcímke, például &ldquo;United States&rdquo; vagy &ldquo;In Progress&rdquo;, 50,000 alkalommal jelenik meg egy táblázatban, akkor a <code>&lt;c t=\&quot;inlineStr\&quot;&gt;&lt;is&gt;&lt;t&gt;United States&lt;/t&gt;&lt;/is&gt;&lt;/c&gt;</code> tárolása 50,000 cellában a tömörítetlen XML-t gigabájtra növelné.</li>
<li>Az Excel a tömörítés előtt deduplikálja a szöveget, úgy, hogy minden egyedi karakterláncot egyszer tárol egy megosztott karakterlánc táblában, és numerikus indexszel hivatkozik rá (például <code>&lt;v&gt;0&lt;/v&gt;</code>, <code>&lt;v&gt;1&lt;/v&gt;</code>).</li>
</ul>
</li>
<li><strong>Miért zsugorodik drámaian az XLSX:</strong>
<ul>
<li>A numerikus sorrekordok (<code>sheet1.xml</code>) ismétlődő, előre látható szintaxist követnek.</li>
<li>A DEFLATE könnyen felismeri a táblázatos XML-ben az ismétlődő mintákat. Gyakori, hogy egy 120 MB nyers <code>sheet1.xml</code> fájl kevesebb, mint 6 MB-ra zsugorodik egy XLSX archívumban.</li>
</ul>
</li>
</ul>
<h3 id="c-pptx-médiával-teli-diavetítések">C. PPTX: Médiával teli diavetítések</h3>
<p>A prezentációk alapvetően különböznek a dokumentumoktól és a táblázatoktól:</p>
<ul>
<li><strong>A képek dilemmája:</strong> A PPTX fájlok általában vektoros alakzatok, háttérgrafikák, videoklipek és nagy felbontású diák uralják.</li>
<li><strong>Compression Profile:</strong> Miközben a <code>ppt/slides/slide1.xml</code>-től a <code>slideN.xml</code>-ig terjedő fájlok hatékonyan tömörülnek, a média terhelés (<code>ppt/media/</code>) a teljes archívum súlyának 85%‑tól 95%‑ig teszi ki.</li>
<li><strong>Why Re-Zipping a PPTX Changes Nothing:</strong> Ha megpróbálsz egy már mentett PPTX fájlt 7-Zip‑pel vagy WinRAR‑ral tömöríteni, szinte semmilyen méretcsökkenést nem fogsz észrevenni. Mivel a belső rész már egy DEFLATE‑tömörített ZIP archívum, amely előre tömörített JPEG‑eket és MP4‑ket tartalmaz, az entrópia már közel a maximumhoz.</li>
</ul>
<h3 id="d-epub-webes-technológiák-kötelező-tömörítetlen-fejléccel">D. EPUB: Webes technológiák kötelező tömörítetlen fejléccel</h3>
<p>Az EPUB fájl lényegében egy reszponzív, csomagolt mikro-weboldal, amely XHTML fejezeteket, CSS stíluslapokat, TTF/WOFF betűtípusokat és metaadatokat tartalmaz. Azonban az EPUB egy szigorú csomagolási szabályt követ, amely megkülönbözteti a Microsoft Office fájloktól:</p>
<pre tabindex="0"><code>EPUB Internal Structure:
├── mimetype                    &lt;-- MUST be uncompressed (Stored) &amp; at byte offset 38
├── META-INF/
│   └── container.xml           &lt;-- Tells reader where the OPF manifest lives
└── OEBPS/ (or EPUB/)
    ├── content.opf             &lt;-- Manifest of all book assets
    ├── toc.ncx / nav.xhtml     &lt;-- Table of contents navigation
    ├── styles/style.css        &lt;-- CSS formatting
    ├── images/                 &lt;-- Book cover &amp; illustrations
    └── text/                   &lt;-- chapter1.xhtml, chapter2.xhtml
</code></pre><ul>
<li><strong>A varázslatos <code>mimetype</code> fájl:</strong>
<ul>
<li>Az e-olvasóknak azonnal fel kell ismerniük egy EPUB-ot anélkül, hogy kicsomagolnák a teljes archívumot vagy futtatnák a dekódolási folyamatokat.</li>
<li>Az Open Container Format (OCF) előírja, hogy a <code>mimetype</code> fájl:
<ol>
<li>Az ZIP archívum legelső fájlja kell legyen.</li>
<li>Pontosan a <code>application/epub+zip</code> karakterláncot kell tartalmazza.</li>
<li><strong>Nem szabad tömöríteni</strong> (ZIP tömörítési módszer <code>0</code> / &ldquo;Tárolt&rdquo;).</li>
<li>Nem lehetnek extra mezőadatok, biztosítva, hogy a MIME karakterlánc mindig a fizikai fájl 38. bájtjánál kezdődjön.</li>
</ol>
</li>
</ul>
</li>
<li><strong>Szöveg tömörítés:</strong> Az összes többi fájl (<code>.xhtml</code>, <code>.css</code>, <code>.opf</code>) a szabványos DEFLATE (ZIP módszer <code>8</code>) segítségével van tömörítve, lehetővé téve, hogy a teljes hosszúságú regények néhány száz kilobájt méretre zsugorodjanak.</li>
</ul>
<h2 id="4-a-tömörítés-összehasonlítása-formátumok-között">4. A tömörítés összehasonlítása formátumok között</h2>
<table>
<thead>
<tr>
<th style="text-align:left">Formátum</th>
<th style="text-align:left">Alap hasznos adat</th>
<th style="text-align:left">Elsődleges redundancia forrás</th>
<th style="text-align:left">Tipikus tömörítési arány (szöveg/jelölőnyelv)</th>
<th style="text-align:left">Média kezelése</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>DOCX</strong></td>
<td style="text-align:left">WordprocessingML (<code>document.xml</code>)</td>
<td style="text-align:left">Ismétlődő XML bekezdés/futtatás címkék</td>
<td style="text-align:left">75% – 85%</td>
<td style="text-align:left">Tárolva a <code>word/media/</code> (többnyire előre tömörített)</td>
</tr>
<tr>
<td style="text-align:left"><strong>XLSX</strong></td>
<td style="text-align:left">SpreadsheetML (<code>sheet*.xml</code>)</td>
<td style="text-align:left">Ismétlődő cella/sor címkék; Megosztott karakterláncok</td>
<td style="text-align:left">80% – 92%</td>
<td style="text-align:left">Ritka; képek/grafikonok a <code>xl/media/</code>-ben</td>
</tr>
<tr>
<td style="text-align:left"><strong>PPTX</strong></td>
<td style="text-align:left">PresentationML (<code>slide*.xml</code>)</td>
<td style="text-align:left">Diaelrendezés metaadata, alakzatkoordináták</td>
<td style="text-align:left">70% – 80%</td>
<td style="text-align:left">Nagy <code>ppt/media/</code> terhelés korlátozza az összes megtakarítást</td>
</tr>
<tr>
<td style="text-align:left"><strong>EPUB</strong></td>
<td style="text-align:left">XHTML, CSS, OPF, NCX</td>
<td style="text-align:left">HTML címkék, ismétlődő CSS szelektorok</td>
<td style="text-align:left">65% – 80%</td>
<td style="text-align:left"><code>mimetype</code> tömörítetlen; média alkönyvtárakban</td>
</tr>
</tbody>
</table>
<h2 id="5-gyakorlati-tanulságok-hogyan-optimalizáljuk-dokumentumait">5. Gyakorlati tanulságok: Hogyan optimalizáljuk dokumentumait</h2>
<p>Mivel most már tudod, hogyan működik a belső csomagolás, kihasználhatod a tömörítési mechanizmusokat a valós problémák megoldásához:</p>
<ol>
<li><strong>Sérült dokumentumok javítása:</strong>
Ha egy dokumentum nem nyílik meg, a kiterjesztés <code>.zip</code>-re változtatása lehetővé teszi a tartalom kicsomagolását és a nyers szöveg visszaállítását a <code>document.xml</code>-ből vagy az EPUB <code>text/</code> könyvtárában található egyes fejezetekből.</li>
<li><strong>Óriási Office fájlok zsugorítása:</strong>
Mivel az XML tömörítés már optimalizált, a hatalmas fájlok szinte mindig a <code>media/</code> mappában lévő nem optimalizált képek miatt keletkeznek. A harmadik féltől származó PDF vagy DOCX tömörítőkkel való helyett nyissa meg a ZIP konténert, bontsa ki a képeket, futtassa őket egy képtömörítővel (például WebP, TinyPNG vagy MozJPEG), és cserélje vissza őket az archívumban.</li>
<li><strong>Dokumentumgenerálás automatizálása:</strong>
A fejlesztőknek nem kell nehéz irodai csomagokhoz fordulniuk a jelentések elkészítéséhez. Nyers XML sablonokat generálhat, azokat szabványos zlib/ZIP könyvtárakkal csomagolhatja, és programozottan, milliszekundumok alatt érvényes DOCX vagy XLSX fájlokat állíthat elő.</li>
</ol>
<h2 id="6-gyakran-ismételt-kérdések-gyik">6. Gyakran Ismételt Kérdések (GYIK)</h2>
<p><strong>Át tudom konvertálni a DOCX vagy EPUB fájlt ZIP fájlra csak a fájlkiterjesztés átnevezésével?</strong> Igen; a kiterjesztés <code>.zip</code>-re való átnevezése lehetővé teszi, hogy bármely szabványos archívum eszköz (például 7‑Zip, macOS Archive Utility vagy Windows Explorer) közvetlenül megnyissa és megvizsgálja a belső fájlokat.</p>
<p><strong>Miért nem teszi lényegesen kisebbé egy DOCX vagy PPTX 7‑Zip‑pel való tömörítése?</strong> Mivel a fájl már egy belsőleg tömörített ZIP archívum, amely DEFLATE‑kódolt XML‑t és előre tömörített képeket tartalmaz, csak minimális redundancia marad, amit egy külső eszköz eltávolíthat.</p>
<p><strong>Miért követeli az EPUB specifikáció, hogy a <code>mimetype</code> fájl legyen tömörítetlen?</strong> Lehetővé teszi az e-olvasó szoftverek számára, hogy ellenőrizzék, hogy a fájl hiteles EPUB-e, a MIME karakterláncot egy rögzített bájteltolásnál ellenőrizve, anélkül, hogy egy dekompressziós motor indítására lenne szükség.</p>
<p><strong>Növeli-e a cellaformázás módosítása az Excelben a tömörített XLSX fájl méretét?</strong> Igen; a kiterjedt egyéni formázás megtöri a cellák közötti egységes mintaismétlést, hosszabb XML definíciókat hozva létre, amelyek csökkentik a DEFLATE tömörítési hatékonyságát.</p>
<p><strong>Lehetőség van magas felbontású eredeti képek kinyerésére egy Word vagy PowerPoint fájlból minőségromlás nélkül?</strong> Igen; nevezze át a fájlt <code>.zip</code>-re, nyissa meg a <code>word/media</code> vagy <code>ppt/media</code> mappát, és megtalálja az eredeti, tömörítetlen forrásképeket pontosan úgy, ahogy be lettek illesztve.</p>
<h2 id="lásd-még">Lásd még</h2>
<ul>
<li><a href="https://blog.fileformat.com/compression/compression-file-formats-at-fileformat-com/">Tömörítési fájlformátumok a FileFormat.com oldalon</a></li>
<li><a href="https://blog.fileformat.com/compression/zip-bombs-exploding-your-storage/">ZIP bombák – A tároló felrobbantása</a></li>
<li><a href="https://blog.fileformat.com/compression/what-is-7z-file-format-comprehensive-guide-and-faqs/">A 7z fájlformátum megértése – Átfogó útmutató és GYIK</a></li>
<li><a href="https://blog.fileformat.com/compression/how-to-open-rar-files-with-best-rar-openers/">A 7 legjobb eszköz a RAR fájlok megnyitásához vagy kibontásához</a></li>
</ul>
<!-- raw HTML omitted -->
]]></content:encoded>
    </item>
    
  </channel>
</rss>
