日语单词计数器(免费)|无空格也能准确统计

免费的日语单词计数器。日语单词之间没有空格,普通的字符计数器无法准确统计。本工具在浏览器内进行形态学分析(不会上传到服务器),自动统计单词数、词符数,并显示出现频率TOP20。

单词数(不含符号)
总词符数(含符号)

单词出现频率 TOP20

排名 单词 次数
输入文本后,将显示单词出现频率。

什么是日语单词计数

像中文这样以标点和阅读习惯来断句的语言尚且不难判断词语,而英语等以空格分隔单词的语言,只需数空格即可得到单词数。日语既没有空格,断句方式也和中文不同,所以第一步必须先判断一个词在哪里结束、下一个词从哪里开始。本工具会根据字符的排列推测这些边界,然后给出单词数、总词符数(包含标点符号)以及最常出现的20个单词。

边界判断采用统计方法而非词典查询,因此整个分析都在浏览器内完成,输入的内容不会发送到任何服务器。代价是遇到大量专业术语或全新造词时,切分结果偶尔会不太自然。如果需要严格的、基于词典的结果,建议将本工具与专业的形态学分析工具搭配使用。

如何统计日语单词数

  1. 粘贴文本 粘贴或输入想要统计的日语文本,输入的同时会自动开始分析。
  2. 区分两个指标 "单词数"不含标点符号,"总词符数"则连标点符号也一并计入,请根据需要选择合适的指标。
  3. 查看出现频率 出现频率最高的20个单词会附带次数一起显示,方便一眼看出是否有某个词被异常频繁地使用。

用好本工具的小技巧

  • 与英语、德语等以空格分隔单词的语言不同,日语需要自动判断单词边界。本工具使用轻量级的统计方法(TinySegmenter)来推测这些边界。
  • 单词出现频率 TOP20 便于检查博客文章或 SEO 内容中是否存在关键词使用过于频繁、不自然的情况。
  • 标点符号和括号等也会被计为1个词符(token),因此本工具将"总词符数"与"单词数(不含符号)"分开显示为两个指标。
  • 专有名词、新词以及词典中没有的单词,有时会因上下文而被不自然地分割。如果需要严格的(基于词典的)形态学分析,请考虑使用 MeCab 等专业工具。

这款单词计数器的使用场景

检查文章的关键词密度

通过频率表可以一目了然地发现某个关键词是否明显多于自然表达的程度,这是SEO写作中常见的警示信号。

发现自己的写作习惯

习惯性使用的连接词和句尾表达往往会排在列表前列,为修改时替换措辞提供了具体的线索。

估算翻译或外包的工作量

当报价按单词数而非字符数计算时,本工具可以给出日语原文的单词数,方便与供应商的报价进行对比。

比较修改前后的文稿

将修改前后的同一段文字分别进行分析,单词数和频率分布的变化可以用数字直观地体现文章变得多精炼。

日语文本分析相关术语

分词
将句子切分为一个个单词的处理过程。日语原本没有类似空格的分隔标记,因此需要由计算机来推测这些边界。
形态学分析
将文本拆分为具有意义的最小单位,并判断词性等属性的更广义技术,是大多数日语自然语言处理的起点。
词符(token)
分析后切分出的每一个单位。标点符号和括号等虽然不是单词,也各自被计为一个词符。
TinySegmenter
本工具用来根据字符排列推测单词边界的轻量级、不依赖词典的分词库,体积仅数十KB,完全在浏览器内运行。
出现频率
统计某个单词在文本中出现的次数,是发现措辞重复或偏向的基本指标。
字符数与单词数
字符数只是单纯统计输入的每一个字符,而单词数反映的是这些字符组成了多少个独立的词——同一段文字用这两种指标衡量,结果可能大不相同。

常见问题

英语文本基本以半角空格分隔单词,但日语文本没有这样的分隔符。如果简单地按空格分割,无法正确统计日语单词数,因此需要通过分析字符序列来推测单词边界的形态学分析(分词)技术。

本工具使用的 TinySegmenter 是一种不依赖词典的轻量级统计方法,因此精度略逊于 MeCab 等基于词典的形态学分析引擎。对于日常文本已足够实用,但在包含大量专业术语或新词的文本中,分词结果可能会出现偏差。

不会。形态学分析全部在浏览器内通过 JavaScript 执行,输入的文本不会被发送到任何服务器。

可用于检查博客文章或 SEO 文章中是否存在特定关键词被不自然地反复使用,检查措辞是否存在偏向,以及分析文本的整体倾向等。

现有的字符计数器按半角空格分隔来统计单词数,因此不支持日语。本工具专门针对日语进行形态学分析,除了单词数之外还会显示单词出现频率。
工具君

闲话 ― 从"すもももももももものうち"看日语分词的难点

日语中没有像英语那样区分单词的空格(即"分词书写"),这也是自然语言处理领域公认的一大难点。一个常被提起的例子是绕口令"すもももももももものうち"(读作 sumomo mo momo mo momo no uchi,大意为"李子也是桃子的一种")。人类可以凭直觉将其切分为"李子/也/桃子/也/桃子的/其中",但对于手边没有词典的机器来说,判断词语边界却是相当棘手的挑战。

正是为了应对这一难题,本工具选用了 TinySegmenter 这个轻量级日语分词库,它出自同时以 Google 研究者身份知名的工藤拓(Taku Kudo)之手。有意思的是,它完全不依赖任何词典,而是通过统计学习字符种类(平假名、片假名、汉字、数字等)的转换模式来推断词语边界的可能性,因此尽管体积仅有数十 KB,却依然能在浏览器中高速运行。

相比之下,正规的形态学分析引擎(如 MeCab、Kuromoji 等)通常需要数 MB 至数十 MB 的词典数据才能工作,而 TinySegmenter 完全不需要词典即可完成分词。也正因为如此,本工具才能像现在这样,完全不向服务器发送任何数据,仅在浏览器内完成全部处理。虽然精度略逊于基于词典的方法,但对于日常文本的单词数统计而言,这已经足够实用。