编码解码哈希加密格式化时间转换开发生成文本处理网络工具其他工具
首页 / 文本处理 / 信息提取

信息提取

从文本中一键提取邮箱网址手机号等信息

输入
结果

这个工具能做什么

信息提取工具解决的是「从一大段混杂文本里只捞出某一类内容」的问题。日常拿到的原始数据往往是聊天记录、网页复制的段落、日志片段或表格导出的文本,邮箱、网址、手机号和正文全混在一起,手动一个个找又慢又容易漏。这个工具让你把整段文本粘进来,选一个类型——邮箱、网址、手机号、IP地址、数字或中文——点击提取,匹配到的内容就会每行一条列出来,勾选去重还能把重复项自动合并。它不改动原文,只做筛选和搬运,适合在正式录入或数据清洗前先把目标内容单独拎出来。

提取的核心是浏览器里的正则表达式(RegExp)带全局标志一次性扫描全文。不同类型对应不同的匹配规则:邮箱按「用户名@域名.后缀」的结构匹配,手机号用 1[3-9]\d{9} 锁定国内 11 位号段,IP 按四段点分十进制的形状匹配,数字抓连续的阿拉伯数字串。中文的识别则是按 Unicode 码位区间来的,基本汉字落在 一 到 龥 这一段,工具把落在该区间的字符逐个挑出来。去重用的是集合(Set)结构,按首次出现的顺序保留、丢弃后面重复的项,所以结果顺序和原文一致而不是被重新排序。整个匹配过程都在你自己的浏览器本地完成,文本不上传。

最常见的用法是整理联系方式:把一份客户名单或群成员导出文本粘进来,选「手机号」或「邮箱」,几秒就得到一份干净的、每行一个的清单,直接贴进 Excel 或通讯录即可。做数据清洗时也顺手,比如从一堆网页源码或 Markdown 里选「网址」,快速收集所有链接再去做去重和归类。写爬虫或调试接口时,想从一段返回内容里快速看有哪些 IP 或数字,也可以粘进来筛一遍,比临时写个脚本再跑要快得多。

需要注意的是纯正则只认「形状」不做语义校验:IP 提取能匹配出 999.999.1.1 这种格式对但实际非法的地址,每段是否在 0-255 内正则并不判断,拿到结果后若要求严格仍需再校验一遍。手机号规则针对的是中国大陆 11 位号码,带国际区号(如 +86、+1)或座机号不在匹配范围内。中文提取只覆盖基本汉字区,像「①」「㈠」、生僻字扩展区以及中文标点符号默认都不算在内。另外提取是按类型单选的,一次只出一类结果,需要多类内容就分几次提取。

信息提取是一个免费的在线工具,打开网页就能用,不用下载也不用注册。平时大家搜的“提取邮箱”、“提取网址”、“提取手机号”,说的都是这个。

常见使用场景

使用方法

  1. 把内容粘贴到输入框(生成类工具直接设置选项)。
  2. 按需要选择选项,点操作按钮。
  3. 结果出现在下方,点「复制结果」即可带走。

常见问题

这个工具支持提取哪些类型的内容?
目前支持邮箱、网址、手机号、IP地址、数字和中文六类。每次选择一种类型进行提取,匹配结果每行一条列出,可勾选去重合并重复项。
提取手机号支持座机或带 +86 的号码吗?
不支持。手机号规则匹配的是中国大陆 1 开头的 11 位号码(1[3-9]\d{9}),座机、带国际区号(+86/+1)或含分机号的格式不会被识别。
为什么提取出的 IP 里会有 300.1.1.1 这种不合法地址?
正则只按「四段点分十进制」的形状匹配,不校验每段是否在 0-255 范围内,因此这类格式正确但数值越界的地址会被一并提取。需要严格 IP 时请对结果再做一次范围校验。
提取中文会把标点和数字也带出来吗?
不会。中文提取只挑 Unicode 基本汉字区(一-龥)内的字符,中文标点、全角符号、阿拉伯数字以及生僻字扩展区默认都不包含在内。
粘贴的文本会被上传到服务器吗,处理隐私内容安全吗?
不会上传。所有匹配都在你自己的浏览器里用正则完成,文本不经过任何服务器,关闭页面即清空,处理含隐私信息的内容也放心。

相关工具

查看全部「文本处理」工具 →