文本分割器
文本分割器 是一款长文本处理工具,适用于 ChatGPT、DeepSeek 等 AI 模型的上下文切分,以及分段发布、逐句翻译、字幕稿整理等场景。工具提供四种切分模式:符号、长度、中文、英文,结果可复制成合并全文,也可每段导出为独立文件。

- 粘贴或上传长文本(非 UTF-8 文件请直接上传,别粘贴)
- 选 切分模式:
- 按标点、逗号、竖线等符号断行 → 符号(默认)
- 切成固定字符块 → 长度
- 中文长文按整句 → 中文
- 英文按整句 → 英文
- 符号模式:填分隔符 + 用「每段分隔符数」定粒度;长度模式:填字符数(留空 = 5000)
- 点执行 → 「复制合并文本」/「导出合并文本」/「导出分段文件」三选一
四种切分模式
四种模式通过配置卡顶部的 Segmented 选择器切换,标签为「符号 / 长度 / 中文 / 英文」,鼠标悬停可看到每种模式的详细说明。每种模式只显示自己的配置项,互不干扰。
1. 符号(默认)
按你填的分隔符切分:每命中一个分隔符切出一个最小段,分隔符保留在段尾;再按「每段分隔符数」把相邻的最小段合并成最终结果。
两个参数
- 分隔符:决定在哪里切。多个符号用空格隔开,命中任意一个都会切
- 每段分隔符数:默认 1,即每个分隔符都断一行;填 N 表示每 N 个最小段合成一段。末尾不足 N 个的残余单独成一段
按逗号切分的例子
以 苹果,香蕉,橙子,葡萄,西瓜,芒果 为例,分隔符填 ,:
换成句末标点也是同一套逻辑:分隔符填 。 ? !、每段分隔符数填 3,就是每三句合成一段。
默认分隔符随界面语言
- 中文 / 繁体中文 / 日文界面:
。 ? ! - 其他语言界面:
. ? !
两套不合并成一份,是因为裸 ASCII 句点在真实文本里常常不是句末标记 —— 合并后 3.5 会被切成 3. 和 5、config.json 被切成 config. 和 json、tools.newzone.top 被切成三段。输入框下方的「中日韩」「英文/拉丁」两个预设按钮可一键切换。
分隔符输入框支持
- 手动输入任意符号,多个用空格隔开,如
, ; |或。 ? ! . ? !(中英混排) - 多字符分隔符,如
……、--- - 转义字符:
\n(换行)、\r(回车)、\t(制表符)、\s(空格)、\\(反斜杠) - 正则特殊字符按字面处理,填
.就是切句点,不会被当成"任意字符"
边界行为
- 连续出现的分隔符(如
一句。。两句)归并到前一段,不产生空段 - 位于开头的分隔符积攒为下一段的前缀
- 因此把结果用同样的连接方式合并回去,可以还原原始字符
一个都没命中时:会提示「分隔符未在文本中出现」并且不做切分。阿拉伯语 ؟、印地语 danda ।、泰语无句末标点等情况不在默认值覆盖范围内,需要手动填该语言的实际标点,或改用分段模式。
2. 长度
按设定的字符数把文本切成块。留空即回落到 5000 字符(最小 1)。
选 5000 是因为如今以字符计的硬限制主要来自机器翻译 API——Google 翻译与 DeepL 免费版都是 5000 字符/次,超了直接被拒;而 LLM 上下文早已不是瓶颈(GPT-5 约 400K token,Claude / Gemini / DeepSeek 均 1M token,切成 2000 字符等于没切)。
这个模式下方还有一个独立的分隔符字段,用途与符号模式完全不同——它只用于对齐切点,填了才生效:
- 填了分隔符:按长度切块,切点自动回退到最近的分隔符,避免句子被拦腰截断
- 留空:硬按长度切,不管句子边界
符号模式的「分隔符」和长度模式的对齐分隔符各存各的,因为二者对"空"的含义相反:前者空 = 没得切(所以有默认值),后者空 = 就是要纯硬切(所以没有默认值)。改其中一个不会影响另一个。
该模式会先把换行统一成空格再切分。
3. 中文
按中文标点和段落规则识别整句边界后切分,一句一段。适合中文文章、博客、字幕稿的逐句处理。无需额外配置。
中英混排也用这个模式——它同时识别中文(。!?)和英文(. ! ?)句末标点,不会在单词中间切断。
4. 英文
用 compromise NLP 库的英文句子算法识别边界,每句一段。适合英文文档、邮件、论文。无需额外配置。
合并分隔符
配置卡下半部分(分隔线以下)是「切完拿什么」的设置。合并分隔符决定「复制合并文本」和「导出合并文本」时各段之间用什么连接:
- 默认两个换行符
\n\n,即段与段之间空一行 - 支持
\n、\t、\s等转义字符 - 留空即回落到默认的两个换行符
- 设置会被记住,下次打开仍是你上次填的值
想拼成一行 CSV?填 ,。想拼成不带空行的连续文本?填 \n。
「长度」与「中文」「英文」分段模式会先把换行压成空格、丢弃空行,所以合并回去得到的是重新拼接的文本,不是原文的排版。需要严格还原原文时用「符号」模式——它保留分隔符,合并可还原。
通用设置
- 隐藏结果:切分结果过多(超过 500 段时自动触发)可开启本项隐藏预览,避免页面卡顿。此时仍可正常导出,也可点「仍要显示」强制渲染。
- 导出文件名:自定义导出文件的基础名。默认用上传的文件名,未上传则用
split_text,派生的文件固定.txt后缀。
结果与导出
结果区三个按钮按「动作 × 形态」区分:
此外每段卡片右上角有单独的复制按钮,点击后图标变为打勾确认。
场景配方
按符号切分
按长度切分
- 喂给机器翻译 API:长度模式,字符数留空(= 5000,正好卡在 Google / DeepL 免费版上限),分隔符填
。 ? !或. ? !,切点自动对齐句末 - 喂给本地小模型:长度模式,字符数按模型上下文调小(如 2000),分隔符同上
- 代码 / Markdown 按块切:长度模式 + 对齐分隔符填
\n\n
按整句切分
- 分段发布到社交平台:中文用「中文」模式、英文用「英文」模式保证句子完整,再用「导出分段文件」按 1/N、2/N 依次发布。各平台上限参考:Twitter 280、Threads 500、微博 140、小红书 1000、豆瓣广播 140、LinkedIn 3000
- 逐句翻译 / 字幕稿整理:中文或英文模式,一句一行,方便逐条对照
与其他工具搭配
- 切出来的块是 i18n JSON 片段 → 用 JSON 翻译 批量翻译并保留键名结构
- 切出来的块是 Markdown 章节 → 用 Markdown 翻译 保留代码块与 Front Matter
- 需要先去重、正则提取、抽 URL 再投喂 AI → 先过一遍 多功能文本处理
- 切完还想按模板重新拼装(如拼成 CSV、SQL) → 用 文本拼接
编码与文件
非 UTF-8 编码的文件(法语 GBK、日语 Shift-JIS、韩语 EUC-KR 等)请直接上传文件而不是粘贴内容——工具会自动检测编码,避免乱码。
工具完全在浏览器本地运行,不会上传任何内容到服务器。

