日語單詞計數器|無空格也能準確統計
日語單詞之間沒有空格,普通的字元計數器無法準確統計。本工具在瀏覽器內進行形態學分析(不會上傳到伺服器),自動統計單詞數、詞符數,並顯示出現頻率TOP20。
單詞數(不含符號)
總詞符數(含符號)
單詞出現頻率 TOP20
| 排名 | 單詞 | 次數 |
|---|---|---|
| 輸入文本後,將顯示單詞出現頻率。 | ||
Tips
- 與英語、德語等以空格分隔單詞的語言不同,日語需要自動判斷單詞邊界。本工具使用輕量級的統計方法(TinySegmenter)來推測這些邊界。
- 單詞出現頻率 TOP20 便於檢查部落格文章或 SEO 內容中是否存在關鍵詞使用過於頻繁、不自然的情況。
- 標點符號和括號等也會被計為1個詞符(token),因此本工具將"總詞符數"與"單詞數(不含符號)"分開顯示為兩個指標。
- 專有名詞、新詞以及詞典中沒有的單詞,有時會因上下文而被不自然地分割。如果需要嚴格的(基於詞典的)形態學分析,請考慮使用 MeCab 等專業工具。
常見問題
英語文本基本以半形空格分隔單詞,但日語文本沒有這樣的分隔符。如果簡單地按空格分割,無法正確統計日語單詞數,因此需要通過分析字元序列來推測單詞邊界的形態學分析(分詞)技術。
本工具使用的 TinySegmenter 是一種不依賴詞典的輕量級統計方法,因此精度略遜於 MeCab 等基於詞典的形態學分析引擎。對於日常文本已足夠實用,但在包含大量專業術語或新詞的文本中,分詞結果可能會出現偏差。
不會。形態學分析全部在瀏覽器內通過 JavaScript 執行,輸入的文本不會被發送到任何伺服器。
可用於檢查部落格文章或 SEO 文章中是否存在特定關鍵詞被不自然地反覆使用,檢查措辭是否存在偏向,以及分析文本的整體傾向等。
現有的字元計數器按半形空格分隔來統計單詞數,因此不支援日語。本工具專門針對日語進行形態學分析,除了單詞數之外還會顯示單詞出現頻率。
閒話 ― 從"すもももももももものうち"看日語分詞的難點
日語中沒有像英語那樣區分單詞的空格(即"分詞書寫"),這也是自然語言處理領域公認的一大難點。一個常被提起的例子是繞口令"すもももももももものうち"(讀作 sumomo mo momo mo momo no uchi,大意為"李子也是桃子的一種")。人類可以憑直覺將其切分為"李子/也/桃子/也/桃子的/其中",但對於手邊沒有詞典的機器來說,判斷詞語邊界卻是相當棘手的挑戰。
正是為了應對這一難題,本工具選用了 TinySegmenter 這個輕量級日語分詞庫,它出自同時以 Google 研究者身份知名的工藤拓(Taku Kudo)之手。有意思的是,它完全不依賴任何詞典,而是通過統計學習字元種類(平假名、片假名、漢字、數字等)的轉換模式來推斷詞語邊界的可能性,因此儘管體積僅有數十 KB,卻依然能在瀏覽器中高速執行。
相比之下,正規的形態學分析引擎(如 MeCab、Kuromoji 等)通常需要數 MB 至數十 MB 的詞典資料才能工作,而 TinySegmenter 完全不需要詞典即可完成分詞。也正因為如此,本工具才能像現在這樣,完全不向伺服器傳送任何資料,僅在瀏覽器內完成全部處理。雖然精度略遜於基於詞典的方法,但對於日常文本的單詞數統計而言,這已經足夠實用。