编码解码哈希加密格式化时间转换开发生成文本处理网络工具其他工具
首页 / 文本处理 / 词频统计

词频统计

统计中英文词频,按次数降序排列

输入
结果

这个工具能做什么

词频统计做的事情很直接:把你粘贴进来的一段文本拆成一个个统计单位,数清楚每个单位出现了多少次,再按次数从高到低排出来。中文和英文的最小统计单位不一样,所以工具提供了两种模式——「中文单字」按单个汉字计数,「英文单词」按空格和标点切分出的单词计数。日常写作、做内容分析或者整理语料时,靠人工去数某个字、某个词出现了几次几乎不现实,文本一长就更容易数错数漏,这个工具就是把这件机械又枯燥的活交给浏览器一次算完。

它的工作方式可以拆成分词、计数、排序三步。中文单字模式会逐字符遍历文本,跳过空白和标点,把每个汉字作为一个键累加;英文单词模式则先统一转成小写做大小写归一化,再按非字母边界切分出单词序列,因此 Apple 和 apple 会被算作同一个词。计数阶段本质上是维护一张哈希表,键是字或词、值是出现次数,遍历一遍文本即可把频次累积完;最后对这张表按值做降序排序输出。整个过程是线性遍历加一次排序,几万字的文本也能几乎瞬间出结果。

最常见的用法是提取高频关键词。比如写完一篇文章想知道有没有反复啰嗦同一个词,把全文贴进来跑一遍中文单字或英文单词模式,排在前面的往往就是你的口头禅或过度使用的表达。做内容分析或 SEO 时,可以把一批标题、评论汇总起来统计,快速看出用户最关心的字词是什么。学英语背单词时,把一篇外刊文章丢进英文单词模式,按词频优先记高频词,也比逐句硬啃效率高。

需要注意的是,中文单字模式统计的是单个汉字而不是词语,它不做中文分词,所以数据会被拆成数和据分别计数;如果你要的是按词语粒度统计,这个模式并不适合。英文单词模式依赖字母边界切分,带连字符或撇号的写法(如 state-of-the-art、don't)可能被拆开,纯数字一般不计入单词。中英文标点、空格、换行都不会被当作统计对象,结果里只保留真正的字或词。所有计算都在浏览器本地完成,文本不会上传服务器,长文本也不必担心隐私。

词频统计是一个免费的在线工具,打开网页就能用,不用下载也不用注册。平时大家搜的“词频统计”、“字频统计”、“单词计数”,说的都是这个。

常见使用场景

使用方法

  1. 把内容粘贴到输入框(生成类工具直接设置选项)。
  2. 按需要选择选项,点操作按钮。
  3. 结果出现在下方,点「复制结果」即可带走。

常见问题

中文模式为什么把「数据」拆成了两个字?
因为中文单字模式按单个汉字逐字计数,不做中文分词,所以「数据」会被算作「数」和「据」两次。如果你需要按词语统计,得先用专门的分词工具处理,本工具目前只支持单字粒度。
英文单词模式区分大小写吗?
不区分。统计前会统一转成小写做归一化,因此 The、the、THE 会被合并成同一个词累加计数。
一次能统计多长的文本?
没有硬性字数限制,词频统计在本地完成,几万字通常都能几乎瞬间出结果;文本极长时速度取决于你设备的性能,一般不成问题。
标点符号、空格和数字会被算进去吗?
不会。中文模式只统计汉字,英文模式只统计由字母组成的单词,空格、标点、换行都会被跳过,纯数字一般也不计入单词。
我粘贴的文本会被上传或保存吗?
不会。所有分词、计数、排序都在你的浏览器里运行,文本不发送到服务器,也不会被保存,关闭或刷新页面即清空。

相关工具

查看全部「文本处理」工具 →