跳到主要内容
全部文章
格式转换

EPUB → HTML

小说从 EPUB(.epub)转成超文本(.html、.htm、.xhtml、.xml、.mhtml)是很常见的一步 —— HTML 能被任何浏览器直接打开,也方便嵌进网页。好在 EPUB 与超文本结构相近,没有太多会丢的东西。下面详细说明 EPUB 如何转成超文本以及注意点,文末附带 EPUB 转超文本的转换工具,可以直接在浏览器里上传文件转换。

阅竹编辑部

EPUB 是什么

EPUB 是除 Kindle 生态外最通用的电子书格式,本质是一个 ZIP 包,里面装着 XHTML 正文、CSS 样式、图片,以及一份规定阅读顺序的清单文件。它把内容与排版分开存放,所以同一个文件在手机、平板和电脑上都能自动排出合适的版面,读者也能随时调整字号;目录、封面、书名与作者都有标准位置,书库软件能正确识别和排序。对以文字为主的小说来说,EPUB 通常是分发和长期保存最稳妥的格式。 查看 EPUB 格式详情

扩展名.epub
典型用途主流电子书分发与长文阅读,适合小说等以文字为主、需要按屏幕重排的书。

HTML 是什么

HTML / XHTML 是网页的结构语言,也正是 EPUB 内部真正用来装正文的格式 —— 所以 HTML 与 EPUB 之间的转换,本质上只是换一层外壳和资源打包方式。.mhtml 更进一步,把网页连同图片和样式一起打包成单个文件,适合保存随时可能失效的在线页面。HTML 的优点是通用、任何浏览器都能打开;缺点是样式和图片常以外链形式存在,要「一个文件带走」必须先把资源内联进去。 查看 HTML 格式详情

扩展名.html.htm.xhtml.xml.mhtml
典型用途网页正文抓取、EPUB 内部正文、以及作为其他格式的通用中间表示。

如何把 EPUB 转成 HTML

EPUB 的正文是 XHTML 片段 + 独立的 CSS,抽取时必须同时解析 OPF 清单里的 spine 顺序(阅读顺序)和 toc(目录)。如果只按压缩包里的文件名字典序拼正文,章节顺序会错乱 —— 这是把 EPUB 转成单个 TXT 时最常见的错误。

生成 HTML 时,图片与样式是外链还是内嵌决定了它能否单文件分发。要「一个文件带走」,需要把资源内联(data URI)或改用 MHTML;否则移动文件就会丢图。同时保留语义化标签(h1–h6、p),这样后续再转 EPUB 时目录才不会丢。

若希望HTML文件仍有目录导航能力,可考虑用小说阅读软件(例如阅竹)通过解析正文中明确的章标题行进行智能分章。

把结构化压缩包压平成一个文本文件时,章节顺序必须按清单文件(spine)而不是压缩包内的文件名字典序来拼接 —— 这是此类转换中最容易出错、且错误最隐蔽的一点:文件能打开,但章节是乱的。

EPUB 转 HTML 工具

EPUB → HTML

转换完全在你的浏览器里完成,文件不会上传到任何服务器。

全平台同步阅读进度的小说阅读器

阅竹 Tide Reader 支持 TXT 与 EPUB,导入即自动识别章节、按你的习惯排版,阅读进度在 Windows、macOS、iOS、Android 之间同步。转换出来的文件直接拖进来就能读。

免费下载阅竹

支持 TXT / EPUB;本地阅读优先,可选云同步与 WebDAV。