• 简体中文
  • 多功能文本处理

    多功能文本处理(Text Toolbox)是一款集成式的浏览器文本工具,把日常最常用的清洗、提取、格式化操作集中到一个页面上。无论是从网页粘贴下来的混乱文本、字段列表,还是需要批量重排的内容,都能一键处理。

    多功能文本处理界面

    这个工具能解决什么问题?

    • 提取特定内容:从大段文本中找出网址、JSON 键名、特定模式的字段
    • 清理冗余信息:删除广告行、引用残留、HTML 标签、空行
    • 整理终端复制的文本:去掉 Claude Code / 终端输出的引用竖线和硬折行,一键还原成可粘贴的整段文字
    • 批量格式化:给每行加前缀/后缀,转成 Markdown 列表、CSV、SQL IN 等格式
    • 统一大小写:全部大写 / 全部小写 / 词首大写 / 句首大写
    • 数据排序整理:升降序、反转、去重(可设"去重时忽略"清单)
    • 多行并一行:用任意连接符把一列内容接成单行,方便贴进表格或查询语句
    • 复杂组合任务:先过滤、再正则、最后加前后缀的多步骤管道

    页面结构

    页面是两栏布局。主栏自上而下是操作主线,右侧侧栏放使用频率较低的专项面板:

    主栏

    1. 待匹配文本 —— 输入区 + 文件上传 + 右下角的「智能清理」开关
    2. LINES 逐行整理 —— 排序 / 删行 / 合并 / 加字四行操作,参数输入框就地内联
    3. CASE 大小写转换 —— 四个转换按钮
    4. 结果区(有结果时出现)—— 复制 / 导出 / 格式化 / 结果回填

    侧栏

    • REGEX 正则引擎 —— 正则输入框 + 4 个预设 + 3 个匹配标志 + 执行匹配 / 移除匹配内容 / 提取链接与互动数
    • FORMAT 转换 —— 格式化文本、智能分段、命令行文本整理、JSON 美化
    • LINKS 链接与批量转换 —— HuggingFace 转 ModelScope、微博链接转换、提取链接并倒序

    行处理与大小写转换是最高频操作,因此放在输入区与结果区之间;正则、整段重排、链接类操作更专项,收进侧栏以免把结果区推到屏幕之外。

    输入区

    • 粘贴:直接把内容粘贴到顶部文本框
    • 文件上传:右下的"拖拽或点击上传"按钮,支持 TXT、MD、JSON、CSV 等富文本格式
    • 智能清理开关(默认开启):开启时,几乎所有处理按钮执行前先剪掉每行首尾空格、跳过空行;关闭则保留原始结构

    REGEX 正则引擎(侧栏)

    • 正则输入框:手动输入任意 JavaScript 正则
    • 4 个常用预设(Tag.CheckableTag):点击即填入正则并应用对应标志
      • URL(无参数):匹配标准 https:// 链接,不带尾部标点
      • URL(宽松匹配):匹配链接含括号、分号等更多场景
      • 去序号(.、):删除行首的"1. "、"2、"、"3) "等序号
      • 提取 JSON 键名:提取 JSON 中所有的键名(多行模式)
    • 3 个匹配标志:全局匹配 (g) / 多行模式 (m) / 忽略大小写 (i)
    • 三个按钮
      • 执行匹配:把所有命中行抽出来,按命中数提示
      • 移除匹配内容:从原文中删除所有命中部分,并把连续 3+ 换行压缩为 2 个
      • 提取链接与互动数:URL → 数字配对的专用流程 —— 在每行中找 URL,再抓取跟在后面的指标数字,按指标分组,每行输出「链接,数值」。指标词是写死的 7 个中文词:点赞 / 转发 / 评论 / 播放 / 差 / 曝光 / 阅读,因此只对含这些中文词的文本有效

    LINES 逐行整理(主栏)

    面板标题写明了四组操作:排序 · 删行 · 合并 · 加字,每组一行,参数输入框就地内联。

    排序

    • 升序排列 / 降序排列:按 Unicode 字符串顺序排序(点一下切换方向)
    • 反转顺序:行顺序前后颠倒
    • 相邻行交换:两两交换相邻行。先删空行(剩下的行数必须是偶数,否则报错),交换后在每对之间插回一个空行,结果自动复制。适用于数值在链接上一行、需要配合「提取链接与互动数」的场景

    删行

    • 去重:删除完全重复的行
    • 去重时忽略(同行输入框):列在这里的内容不参与去重判定,本地保存。例如填 首页关于,这两行即使重复也都保留
    • 删含关键词的行:在右侧输入框填逗号分隔的关键词(如 广告,推广,群号),点击后删掉所有含这些关键词的整行,其余保留

    合并

    • 合并为一行:把多行接成一行
    • 连接符(同行输入框):用什么把各行连起来,留空即直接相接,支持 \t 等转义字符
    • 例:连接符填 , → 把一列清单变成 A, B, C 的单行;填 \t → 变成可直接粘进 Excel 一行的制表符分隔串

    每行加字

    • 前缀框:每行开头添加的内容(默认空)
    • 后缀框:每行结尾添加的内容(默认 ,100,可清空或改成任意内容)
    • 正则提取 + 前后缀:同一行右侧的按钮,先用侧栏 REGEX 面板的正则提取内容,再批量加前后缀(一步完成两个操作)
    • 示例:前缀 - 、后缀空 → 把纯文本一键转成 Markdown 列表
    • 示例:前缀 '、后缀 ', → 把字符串列表转成 SQL IN (...) 子句

    CASE 大小写转换(主栏)

    四个按钮,对全文逐行生效:

    • 全部大写 / 全部小写
    • 词首大写:每个单词首字母大写(Title Case)
    • 句首大写:每句首字母大写,其余转小写(Sentence case)

    FORMAT 转换(侧栏)

    • 格式化文本:清理多余空行 + 智能清理(根据开关决定是否 trim)
    • 智能分段:用 compromise 英文 NLP 库识别句子边界 + 中文段落规则
    • 命令行文本整理:专治从 Claude Code / 终端复制出来的文本——去掉行首的引用竖线(▎ ▌ │)和缩进,把按终端宽度硬折的行重排成完整段落(中文折行直接拼接、英文补单空格),列表项和代码块逐行保留。整理完成后结果自动复制到剪贴板,可直接去别处粘贴
    • JSON 美化:宽容解析(支持未加引号的键、单引号、注释)+ 2 空格缩进格式化
    • HuggingFace 转 ModelScope:把 https://huggingface.co 前缀整体换成 https://modelscope.cn/models(适合在国内访问 HF 模型时改链)。注意它不校验目标页是否存在 —— datasetsspaces 等非模型路径换完会变成死链;执行时还会顺带删掉空行,结果自动复制到剪贴板
    • 微博链接转换:把手机版微博(m.weibo.cn)链接批量转成 PC 端 weibo.com 链接,并附带博主主页地址。输出分「PC 端链接」「博主主页」「未解析」三段;只含 uid 的链接可本地推导,详情页需要联网解析 uid/bid,失败的会逐条标注原因(链接不含 uid、页面未匹配到 uid/bid、网络请求失败等)
    • 提取链接并倒序:提取文中所有链接,按出现顺序倒序,用逗号连成一行并自动复制(适合做 URL 列表反查)。若上方「删行」的关键词框有内容,命中的行会先被排除再提取

    结果区

    有结果时,主栏在输入区下方出现结果区,提供:

    • 复制:一键复制结果到剪贴板
    • 导出文件:下载为 text-processed.txt
    • 格式化:清理结果中的多余空行
    • 结果 ➔ 原文:把当前结果填回输入区,做下一步处理(多步处理利器)

    使用建议

    新手起步

    • 先试预设:侧栏「正则引擎」面板里点击预设标签一键填入
    • 小数据测试:处理重要数据前用一小段试跑
    • 组合操作:「过滤 → 提取 → 加前后缀」三步搞定大多数清洗任务

    高效技巧

    • 智能清理默认开启即可,绝大多数场景适用
    • 复杂任务善用「结果 ➔ 原文」做多步管道
    • 写不出正则时让 AI 帮忙(描述需求 + 输入样例 + 期望输出)

    工具完全在浏览器本地运行,不上传任何数据,可放心处理敏感信息。