• 简体中文
  • 文本分割器

    文本分割器 是一款长文本处理工具,适用于 ChatGPT、DeepSeek 等 AI 模型的上下文切分,以及分段发布、逐句翻译、字幕稿整理等场景。工具提供四种切分模式:符号、长度、中文、英文,结果可复制成合并全文,也可每段导出为独立文件。

    文本分割器界面

    30 秒上手
    1. 粘贴或上传长文本(非 UTF-8 文件请直接上传,别粘贴)
    2. 切分模式
      • 按标点、逗号、竖线等符号断行 → 符号(默认)
      • 切成固定字符块 → 长度
      • 中文长文按整句 → 中文
      • 英文按整句 → 英文
    3. 符号模式:填分隔符 + 用「每段分隔符数」定粒度;长度模式:填字符数(留空 = 5000)
    4. 点执行 → 「复制合并文本」/「导出合并文本」/「导出分段文件」三选一

    四种切分模式

    四种模式通过配置卡顶部的 Segmented 选择器切换,标签为「符号 / 长度 / 中文 / 英文」,鼠标悬停可看到每种模式的详细说明。每种模式只显示自己的配置项,互不干扰。

    1. 符号(默认)

    按你填的分隔符切分:每命中一个分隔符切出一个最小段,分隔符保留在段尾;再按「每段分隔符数」把相邻的最小段合并成最终结果。

    两个参数

    • 分隔符:决定在哪里切。多个符号用空格隔开,命中任意一个都会切
    • 每段分隔符数:默认 1,即每个分隔符都断一行;填 N 表示每 N 个最小段合成一段。末尾不足 N 个的残余单独成一段

    按逗号切分的例子

    苹果,香蕉,橙子,葡萄,西瓜,芒果 为例,分隔符填 ,

    每段分隔符数结果段数输出
    16 段苹果, / 香蕉, / 橙子, / 葡萄, / 西瓜, / 芒果
    23 段苹果,香蕉, / 橙子,葡萄, / 西瓜,芒果
    32 段苹果,香蕉,橙子, / 葡萄,西瓜,芒果

    换成句末标点也是同一套逻辑:分隔符填 。 ? !、每段分隔符数填 3,就是每三句合成一段

    默认分隔符随界面语言

    • 中文 / 繁体中文 / 日文界面:。 ? !
    • 其他语言界面:. ? !

    两套不合并成一份,是因为裸 ASCII 句点在真实文本里常常不是句末标记 —— 合并后 3.5 会被切成 3.5config.json 被切成 config.jsontools.newzone.top 被切成三段。输入框下方的「中日韩」「英文/拉丁」两个预设按钮可一键切换。

    分隔符输入框支持

    • 手动输入任意符号,多个用空格隔开,如 , ; |。 ? ! . ? !(中英混排)
    • 多字符分隔符,如 ……---
    • 转义字符:\n(换行)、\r(回车)、\t(制表符)、\s(空格)、\\(反斜杠)
    • 正则特殊字符按字面处理,填 . 就是切句点,不会被当成"任意字符"

    边界行为

    • 连续出现的分隔符(如 一句。。两句)归并到前一段,不产生空段
    • 位于开头的分隔符积攒为下一段的前缀
    • 因此把结果用同样的连接方式合并回去,可以还原原始字符

    一个都没命中时:会提示「分隔符未在文本中出现」并且不做切分。阿拉伯语 ؟、印地语 danda 、泰语无句末标点等情况不在默认值覆盖范围内,需要手动填该语言的实际标点,或改用分段模式。

    2. 长度

    按设定的字符数把文本切成块。留空即回落到 5000 字符(最小 1)。

    选 5000 是因为如今以字符计的硬限制主要来自机器翻译 API——Google 翻译与 DeepL 免费版都是 5000 字符/次,超了直接被拒;而 LLM 上下文早已不是瓶颈(GPT-5 约 400K token,Claude / Gemini / DeepSeek 均 1M token,切成 2000 字符等于没切)。

    这个模式下方还有一个独立的分隔符字段,用途与符号模式完全不同——它只用于对齐切点,填了才生效:

    • 填了分隔符:按长度切块,切点自动回退到最近的分隔符,避免句子被拦腰截断
    • 留空:硬按长度切,不管句子边界
    两个分隔符字段是独立的

    符号模式的「分隔符」和长度模式的对齐分隔符各存各的,因为二者对"空"的含义相反:前者空 = 没得切(所以有默认值),后者空 = 就是要纯硬切(所以没有默认值)。改其中一个不会影响另一个。

    该模式会先把换行统一成空格再切分。

    3. 中文

    按中文标点和段落规则识别整句边界后切分,一句一段。适合中文文章、博客、字幕稿的逐句处理。无需额外配置。

    中英混排也用这个模式——它同时识别中文(。!?)和英文(. ! ?)句末标点,不会在单词中间切断。

    4. 英文

    用 compromise NLP 库的英文句子算法识别边界,每句一段。适合英文文档、邮件、论文。无需额外配置。

    合并分隔符

    配置卡下半部分(分隔线以下)是「切完拿什么」的设置。合并分隔符决定「复制合并文本」和「导出合并文本」时各段之间用什么连接:

    • 默认两个换行符 \n\n,即段与段之间空一行
    • 支持 \n\t\s 等转义字符
    • 留空即回落到默认的两个换行符
    • 设置会被记住,下次打开仍是你上次填的值

    想拼成一行 CSV?填 ,。想拼成不带空行的连续文本?填 \n

    合并结果不等于原始排版

    「长度」与「中文」「英文」分段模式会先把换行压成空格、丢弃空行,所以合并回去得到的是重新拼接的文本,不是原文的排版。需要严格还原原文时用「符号」模式——它保留分隔符,合并可还原。

    通用设置

    • 隐藏结果:切分结果过多(超过 500 段时自动触发)可开启本项隐藏预览,避免页面卡顿。此时仍可正常导出,也可点「仍要显示」强制渲染。
    • 导出文件名:自定义导出文件的基础名。默认用上传的文件名,未上传则用 split_text,派生的文件固定 .txt 后缀。

    结果与导出

    结果区三个按钮按「动作 × 形态」区分:

    按钮做什么
    复制合并文本用合并分隔符把所有分段接成一份全文,复制到剪贴板
    导出合并文本同一份全文,存成单个 .txt 文件
    导出分段文件每段一个文件;超过 3 段自动打包<文件名>_split_files.zip

    此外每段卡片右上角有单独的复制按钮,点击后图标变为打勾确认。

    场景配方

    按符号切分

    场景模式分隔符每段分隔符数
    逗号列表逐项拆开符号,1
    逗号列表每 3 项一组符号,3
    中文长文逐句拆开符号。 ? !1
    中文长文每 3 句一段符号。 ? !3
    中英混排逐句拆开符号。 ? ! . ? !1
    CSV / 日志按字段拆符号, ; |1
    按空行分段(保留原排版)符号\n\n1
    按制表符拆表格列符号\t1
    省略号分隔的小说对白符号……1

    按长度切分

    • 喂给机器翻译 API:长度模式,字符数留空(= 5000,正好卡在 Google / DeepL 免费版上限),分隔符填 。 ? !. ? !,切点自动对齐句末
    • 喂给本地小模型:长度模式,字符数按模型上下文调小(如 2000),分隔符同上
    • 代码 / Markdown 按块切:长度模式 + 对齐分隔符填 \n\n

    按整句切分

    • 分段发布到社交平台:中文用「中文」模式、英文用「英文」模式保证句子完整,再用「导出分段文件」按 1/N、2/N 依次发布。各平台上限参考:Twitter 280、Threads 500、微博 140、小红书 1000、豆瓣广播 140、LinkedIn 3000
    • 逐句翻译 / 字幕稿整理:中文或英文模式,一句一行,方便逐条对照

    与其他工具搭配

    • 切出来的块是 i18n JSON 片段 → 用 JSON 翻译 批量翻译并保留键名结构
    • 切出来的块是 Markdown 章节 → 用 Markdown 翻译 保留代码块与 Front Matter
    • 需要先去重、正则提取、抽 URL 再投喂 AI → 先过一遍 多功能文本处理
    • 切完还想按模板重新拼装(如拼成 CSV、SQL) → 用 文本拼接

    编码与文件

    非 UTF-8 编码的文件(法语 GBK、日语 Shift-JIS、韩语 EUC-KR 等)请直接上传文件而不是粘贴内容——工具会自动检测编码,避免乱码。

    工具完全在浏览器本地运行,不会上传任何内容到服务器。