文本清洗
文本处理所有处理都在浏览器本地完成,数据不上传服务器
输入
输出
从日志、表格或聊天记录里复制出来的一列内容,常常带着重复行、空行、行首编号和多出来的空格。这个工具把它们拆成六个可单独勾选的规则,勾上哪条就只做哪条。处理顺序是固定的(去行号 → 合并空白 → 去首尾空白 → 去空行 → 去重 → 排序),因为顺序会改变结果:先排序再去重和先去重再排序,留下的那一行并不相同。
功能
- 去重行:保留第一次出现的那条,其余行的相对顺序不变
- 排序行:按 Unicode 码位升序,结果与浏览器语言环境无关
- 去空行:只含空格或制表符的行,配合「去首尾空白」一起勾选即可清除
- 去首尾空白:清掉每行两端的空格与制表符
- 去行号:支持 1. / 1、/ (1) / 12) / 1: 等写法,且不会把日期与时间当成编号切掉
- 合并多空格:连续的半角空格、制表符、全角空格压成一个
- 六条规则独立开关,一条都不勾就原样输出(仅把换行统一成 LF)
使用方法
- 把要清洗的文本粘贴进输入框
- 按需要勾选规则,结果实时更新
- 点「复制」取走结果
常见问题
- 去重是按什么规则?
- 区分大小写,保留第一次出现的那一行,其余相同的行被删除,行序不变。想忽略大小写,可以先用「大小写与命名风格」把它们统一,再来去重。
- 勾了「删除空行」,为什么还有空行?
- 只含空格或制表符的行在字符串层面不是空行。把「去掉每行首尾空白」一起勾上,它们被清成空串之后就会被删除。这两条规则本来就是配套的。
- 去行号会不会误删正文里的数字?
- 不会。规则要求数字后面必须跟明确的分隔符(. 、 , : ) 等)并且分隔符后跟空白,所以 2026.09 这样的日期、3:00 这样的时间都不会被当成编号。
- 排序稳定吗?
- 稳定 —— 按 Unicode 码位比较,不用 localeCompare(那个会随系统语言给出不同顺序)。注意码位顺序下大写字母排在小写字母之前。
相关工具
字数统计
文本处理中英混排的文本到底有多长?中文按字、英文按词分开统计,再给出字符数、行数、字节数与阅读时长。全部在浏览器本地完成,不上传。
文本对比
文本处理把两份文本逐行对比,高亮标出新增、删除与未改动的行,改动按最小差异对齐,而不是整段标成变了。全部在浏览器本地完成,内容不上传。
命名风格转换
文本处理在八种命名风格之间转换标识符,拆词时认得 fooBarBaz 与 FOO_BAR 这类混写,连续大写也会按词拆开。全部在浏览器本地完成,不上传。
简繁转换
文本处理在简体与繁体之间互转中文,常用词整词替换,其余字取最常见写法,因此个别字词仍需人工核对。全部在浏览器本地完成,不上传。
正则测试
文本处理在浏览器里调试正则:匹配实时高亮、捕获组连名字一起列出、替换结果即时预览,并挡住灾难性回溯。文本与正则都在本机处理,不上传。
Markdown 预览
文本处理左栏写 Markdown、右栏实时渲染;粘进来的 HTML 只会当文本显示,图片也不会向外发请求。全部在浏览器本地完成,内容不上传。