压缩在 EPUB、DOCX、XLSX 和 PPTX 中是如何工作的?

最后更新:2026年9月10日 压缩在 EPUB、DOCX、XLSX 和 PPTX 中的工作原理 如果你将 .docx、.xlsx、.pptx 或 .epub 文件重命名为 .zip 并双击它,会出现令人惊讶的情况:它不会报错。你的操作系统会将其打开为一个包含子目录、XML 配置文件、样式表、字体和嵌入图像的文件夹。 现代文档架构在数十年前就抛弃了单块二进制文件。取而代之的是行业标准——即 Microsoft Office 的 Open Packaging Conventions (OPC) 和 EPUB 的 Open Container Format (OCF)——采用了一个出人意料的简洁基础:朴素的 ZIP archive。 了解这些格式内部的压缩工作原理,就能揭示现代文档为何如此坚韧、轻量且可扩展——以及为何有些文件能压缩至原始大小的 90%,而另一些几乎没有缩小。 1. 容器架构:伪装的 ZIP 包 在了解压缩算法本身之前,先弄清楚为何现代文档格式被构建为包而不是独立的原始文件会更有帮助。 传统二进制格式的问题 在整个 1990 年代和 2000 年代初,Microsoft Office 使用专有的二进制格式(.doc、.xls、.ppt)。这些文件本质上是围绕复合文件二进制格式(Compound File Binary Format (CFBF))结构的内存转储。它们以极其脆弱而闻名: 一次单比特翻转就可能破坏整个文件结构。 嵌入图像会导致文件大小不可预测地急剧膨胀。 解析需要逆向工程繁复的二进制规范。 跨平台互操作性是一场噩梦。 向开放、模块化容器的转变 在2000年代中期,发生了两条平行的演进: Office Open XML (OOXML / ISO/IEC 29500): 微软推出了以 x 结尾的基于 XML 的格式(DOCX、XLSX、PPTX)。在内部,这些文件遵循 Open Packaging Conventions (OPC)。 EPUB (IDPF / W3C): 数字出版从专有阅读器格式转向基于标准网页技术(HTML、CSS、SVG)的方式,并封装在 EPUB Open Container Format (OCF) 中。 这两种架构都依赖于标准的 PKZIP 2.
九月 10, 2026 · 4 分钟 · Sher Azam Khan