HTML → EPUB
小说从超文本(.html、.htm、.xhtml、.xml、.mhtml)转成 EPUB(.epub)是很常见的一步 —— EPUB 是通用电子书格式,能自动适配屏幕和字号,还带目录。好在超文本与 EPUB 结构相近,没有太多会丢的东西。下面详细说明超文本如何转成 EPUB 以及注意点,文末附带超文本转 EPUB 的转换工具,可以直接在浏览器里上传文件转换。
HTML 是什么
HTML / XHTML 是网页的结构语言,也正是 EPUB 内部真正用来装正文的格式 —— 所以 HTML 与 EPUB 之间的转换,本质上只是换一层外壳和资源打包方式。.mhtml 更进一步,把网页连同图片和样式一起打包成单个文件,适合保存随时可能失效的在线页面。HTML 的优点是通用、任何浏览器都能打开;缺点是样式和图片常以外链形式存在,要「一个文件带走」必须先把资源内联进去。 查看 HTML 格式详情
| 扩展名 | .html.htm.xhtml.xml.mhtml |
|---|---|
| 典型用途 | 网页正文抓取、EPUB 内部正文、以及作为其他格式的通用中间表示。 |
EPUB 是什么
EPUB 是除 Kindle 生态外最通用的电子书格式,本质是一个 ZIP 包,里面装着 XHTML 正文、CSS 样式、图片,以及一份规定阅读顺序的清单文件。它把内容与排版分开存放,所以同一个文件在手机、平板和电脑上都能自动排出合适的版面,读者也能随时调整字号;目录、封面、书名与作者都有标准位置,书库软件能正确识别和排序。对以文字为主的小说来说,EPUB 通常是分发和长期保存最稳妥的格式。 查看 EPUB 格式详情
| 扩展名 | .epub |
|---|---|
| 典型用途 | 主流电子书分发与长文阅读,适合小说等以文字为主、需要按屏幕重排的书。 |
如何把 HTML 转成 EPUB
HTML 的结构全在标签里,但真实网页混杂导航、广告、页脚等噪声,直接整页转换会把它们一起带进去。建议先用可读性算法(如 Readability)抽出正文容器,并注意 <img> 多为外链 —— 转成单文件格式前必须把图片下载并内嵌。
EPUB 不是「压缩一下就行」:它必须包含 mimetype(且必须是第一个条目、不压缩)、META-INF/container.xml、内容 OPF 与 nav 目录,缺一项阅读器就会报「文件损坏」。所以转 EPUB 优先用成熟的转换器,不要手工拼 ZIP。
源文件的章节只是普通文字行,而目标格式要求一份真正的目录。转换器会尝试用正则识别「第X章」「Chapter N」这类模式 —— 识别不准就会出现目录条目错乱或整本书只有一个章节。转换后请检查目录条目数与实际章数是否一致。
从单个文本文件变成有目录结构的压缩包,是信息「增加」的方向:工具需要替你生成清单文件、目录页与元数据。这些生成物的质量(章节切分是否准确、语言标注是否正确)直接决定成品好不好用。
HTML 转 EPUB 工具
HTML → EPUB
这些设置会写进生成的 EPUB。字号用相对值,读者在阅读器里仍能自行调整。
转换完全在你的浏览器里完成,文件不会上传到任何服务器。
全平台同步阅读进度的小说阅读器
阅竹 Tide Reader 支持 TXT 与 EPUB,导入即自动识别章节、按你的习惯排版,阅读进度在 Windows、macOS、iOS、Android 之间同步。转换出来的文件直接拖进来就能读。
免费下载阅竹支持 TXT / EPUB;本地阅读优先,可选云同步与 WebDAV。
