词频统计
统计中英文词频,按次数降序排列
这个工具能做什么
词频统计做的事情很直接:把你粘贴进来的一段文本拆成一个个统计单位,数清楚每个单位出现了多少次,再按次数从高到低排出来。中文和英文的最小统计单位不一样,所以工具提供了两种模式——「中文单字」按单个汉字计数,「英文单词」按空格和标点切分出的单词计数。日常写作、做内容分析或者整理语料时,靠人工去数某个字、某个词出现了几次几乎不现实,文本一长就更容易数错数漏,这个工具就是把这件机械又枯燥的活交给浏览器一次算完。
它的工作方式可以拆成分词、计数、排序三步。中文单字模式会逐字符遍历文本,跳过空白和标点,把每个汉字作为一个键累加;英文单词模式则先统一转成小写做大小写归一化,再按非字母边界切分出单词序列,因此 Apple 和 apple 会被算作同一个词。计数阶段本质上是维护一张哈希表,键是字或词、值是出现次数,遍历一遍文本即可把频次累积完;最后对这张表按值做降序排序输出。整个过程是线性遍历加一次排序,几万字的文本也能几乎瞬间出结果。
最常见的用法是提取高频关键词。比如写完一篇文章想知道有没有反复啰嗦同一个词,把全文贴进来跑一遍中文单字或英文单词模式,排在前面的往往就是你的口头禅或过度使用的表达。做内容分析或 SEO 时,可以把一批标题、评论汇总起来统计,快速看出用户最关心的字词是什么。学英语背单词时,把一篇外刊文章丢进英文单词模式,按词频优先记高频词,也比逐句硬啃效率高。
需要注意的是,中文单字模式统计的是单个汉字而不是词语,它不做中文分词,所以数据会被拆成数和据分别计数;如果你要的是按词语粒度统计,这个模式并不适合。英文单词模式依赖字母边界切分,带连字符或撇号的写法(如 state-of-the-art、don't)可能被拆开,纯数字一般不计入单词。中英文标点、空格、换行都不会被当作统计对象,结果里只保留真正的字或词。所有计算都在浏览器本地完成,文本不会上传服务器,长文本也不必担心隐私。
词频统计是一个免费的在线工具,打开网页就能用,不用下载也不用注册。平时大家搜的“词频统计”、“字频统计”、“单词计数”,说的都是这个。
常见使用场景
- 检查文章里有没有反复使用的口头禅
- 从一批标题或评论中提取高频关键词
- 背单词前按词频决定先记哪些单词
- 统计一段中文里出现最多的汉字
- 整理语料时快速核对用词分布
使用方法
- 把内容粘贴到输入框(生成类工具直接设置选项)。
- 按需要选择选项,点操作按钮。
- 结果出现在下方,点「复制结果」即可带走。