Skip to content

Repository files navigation

📖 小说文本整理器

一键修复网络小说排版、智能换行、章节重排、繁简转换、广告清理

English · 简体中文

License: MIT 在线体验

小说文本整理器 专治从小说站下载来的杂乱 txt:修复错乱的换行与缩进、清掉夹带的广告水印、规范章节标题、按章节重排,可选繁简转换。整个处理流程在浏览器本地运行,文件不会上传到任何服务器。

👉 在线体验https://tools.newzone.top/zh/novel-processor

小说文本整理器界面

这个工具能解决什么问题?

下载的小说常见痛点:

  • 排版乱:段落不分、章节连写、空行混乱
  • 广告水印:下载器标记、群号推广、"分卷阅读"
  • 格式不统一:繁简混杂、全角 / 半角字符乱
  • 断行错乱:句子被错误打断、不该断的地方多空行
  • 章节错位:目录乱序、章节标题没换行

核心功能

  • 📝 智能换行:根据中文标点、纯数字行、特殊起始符判断段落边界,重新合并 / 分段。
  • 🏷️ 章节格式化:识别"第 X 章"、"Chapter N"等格式并规范化,支持章节分割与按序号重排。
  • 🎨 排版优化:段落缩进、长段落自动拆分、全角→半角、首尾空格清理、相邻重复行去除。
  • 🧹 内容清洗:自定义关键词过滤、行尾数字移除、保护正文阈值,自动清理下载器水印 / 分卷阅读标记。
  • 🔄 繁简转换:内置 OpenCC 引擎,支持高精度繁简互转。
  • 🛡️ 保护词典:与简繁转换工具共享同一份词典,定义"不被转换"的词组清单。
  • 📦 批量处理:支持多文件批量处理、大文件模式、自动导出,无文件大小限制(300 万字超长小说也能处理)。
  • 💻 本地运行:整个处理流程在浏览器本地完成,文件不上传任何服务器。
  • 🌐 多语言 UI:基于 next-intl,支持 18 种界面语言。

页面结构

左右两栏布局:

  • 左栏:文件上传 + 文本输入 + 三个主操作按钮 + 结果卡
  • 右栏:三段式配置 Collapse + 保护词典面板

文件上传

  • 拖拽或点击上传,支持 .txt.md.markdown 等文本格式,也可直接粘贴文本
  • 默认多文件模式,可同时拖入整个小说合集批量处理
  • 单文件模式下(在高级设置里开启)新上传会替换当前文件

三个主操作按钮

按钮 行为
开始处理 跑完整流程:按右侧配置依次执行换行、清理、章节、过滤等所有勾选项
章节分割 只做一件事 —— 把行内连写的章节标题拆成独立行,其他内容不动
章节重排 从每章标题里提取序号(第十二章 / Chapter 5 / 第三卷 第四章 等),按序号重排整本小说。无序号章节置后

处理完成后内容会自动复制到剪贴板并显示在结果卡。

配置面板(右栏三段 Collapse)

1. 排版(默认展开)

  • 智能换行(默认开):根据中文标点重新合并断行
    • 子开关 段落缩进(仅在智能换行启用时显示,默认开):每段开头加 \t 缩进
  • 智能分段(默认关):长段落按句子算法(compromise NLP + 中文标点)拆分成更短段落

2. 内容清理(默认折叠)

  • 章节标题格式化(默认开):识别 "第 X 章"、"Chapter N" 等格式并规范化
  • 清除行尾数字(默认关):仅对长度 ≥ 10 的行移除末尾数字(避免误删短标题里的年份)
  • 修整空格(默认开):移除每行首尾空格
  • 去除相邻重复行(默认关):仅删除相邻重复行,避免误删频繁出现的短对白("嗯"、"好"等)
  • 特殊起始文本:填小说名或常见标题词。匹配的行会强制独立成段
  • 过滤词 + 过滤阈值
    • 过滤词:逗号分隔的关键词(如 群号,下载器),所有含这些词的整行被删除
    • 过滤阈值:长度大于 N 的行豁免删除(保护正文);填 0 表示不启用豁免

3. 高级设置(默认折叠)

  • 繁简转换 Segmented:
    • 不转换 → 跳过此步
    • 繁 → 简 → 使用 tw → cn
    • 简 → 繁 → 使用 cn → tw
  • 单文件模式:限制为一次只处理一个文件
  • 直接导出:处理完直接下载,跳过页面预览(仅单文件模式可见)

保护词典

页面右下角的「保护词典」面板:

  • 总开关:启用 / 禁用全部规则
  • 显示当前 s2t / t2s 规则数量
  • 管理规则按钮:打开抽屉,增删改单条规则、批量导入 / 导出

工具与「简繁转换」共享同一份保护词典(同 localStorage 键),一处编辑两处生效。仅在高级设置的繁简转换实际启用时才参与处理;设为"不转换"时面板会显示「规则当前未生效」。

自动处理流程(开始处理按钮)

点击「开始处理」会按以下顺序执行完整管道(未勾选的步骤自动跳过):

  1. 繁简转换(如启用):应用对应的保护规则
  2. 规范换行 + 清理小说杂质:统一 \r\n\n,移除常见下载器水印 / 分卷阅读 标记 / 等号横线行
  3. 全角转半角:英文字母、数字、标点统一为半角
  4. 章节标记格式化:把 第 X 章: 中的冒号换为空格、压缩章节标记后的多余空格
  5. 章节分割(如启用):拆分行内连写的章节标题
  6. 关键词过滤(如填了):删除含关键词的整行(受阈值豁免保护)
  7. 行尾数字清除(如启用):长行去掉末尾数字
  8. 智能分段(如启用):长段落拆分
  9. 智能换行 / 段落缩进:合并断句、分段、加缩进、压缩多余空行

结果区

处理完成后底部出现结果卡:

  • 自动复制到剪贴板
  • 复制 / 导出文件 / 编辑结果:与简繁转换工具一致
  • 结果 → 原文本:把结果填回输入区做下一步处理(少用)
  • 启用「直接导出」时跳过结果显示直接下载

使用建议

  • 先小后大:先用一小段(1-2 章)测试效果,调好配置再处理整本
  • 过滤阈值是核心:设成 50(或文本平均段落长度)能精确删除短水印行而保留长正文;关键词先填 1-2 个明显的水印词,确认无误后再扩充
  • 章节重排单独跑:只想理顺章节顺序时直接点「章节重排」,不要走「开始处理」全流程
  • 保护词典预先编辑:简繁混杂的稀有人名先加入词典,再走「开始处理」
  • 导出到阅读器:启用「章节分割」后导出的 TXT 可让 Kindle 自动生成目录,也适配微信读书、掌阅、静读天下等
  • 复杂混淆水印:故意打乱字符顺序的推广信息,可先用 多功能文本处理 配合自定义正则处理,再交给本工具做排版

适用场景

  • 从小说站下载的格式混乱文本
  • 爬虫 / 自动下载器获取的小说合集
  • OCR / PDF 复制后的长篇文本
  • 准备导入 Kindle / Moon+ Reader / 微信读书前的预处理

支持的文件格式

支持拖拽上传 .txt.md.markdown 文件,或直接粘贴文本到输入框。

快速开始

环境要求

  • Node.js >= 20.9.0
  • 包管理器:Yarn(推荐)、npm 或 pnpm

安装与启动

git clone https://github.com/rockbenben/novel-processor.git
cd novel-processor

# 安装依赖
yarn install

# 启动开发服务器
yarn dev

打开 http://localhost:3000 即可使用。

构建生产版本

yarn build

贡献指南

欢迎提交 Pull Request 或 Issue 改进本项目。

  1. Fork 本仓库
  2. 创建分支:git checkout -b feature/AmazingFeature
  3. 提交更改:git commit -m 'feat: add some AmazingFeature'
  4. 推送分支:git push origin feature/AmazingFeature
  5. 提交 Pull Request

相关链接

About

📖 一键修复网络小说排版,智能换行、章节重排、繁简转换、广告清理 | Downloaded a novel that's one giant wall of text? Fix line breaks, chapter order, ads and 简/繁 in one pass

Topics

Resources

Stars

29 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages