Conteggio Gratuito delle Parole Giapponesi | Preciso anche senza spazi

Strumento gratuito per il conteggio delle parole giapponesi. Il giapponese non separa le parole con gli spazi, quindi i normali contatori non riescono a contarle. Un motore di analisi morfologica divide automaticamente il testo in parole e ne analizza numero, token e le venti forme più frequenti, tutto nel browser e senza alcuna trasmissione.

Parole (esclusi i simboli)
Token totali (simboli inclusi)

Le venti parole più frequenti

Posizione Parola Occorrenze
Inserite un testo per vedere la frequenza delle parole.

Cos'è il conteggio delle parole giapponesi?

In lingue come l'italiano, dove gli spazi separano le parole, basta contare gli spazi per ottenere il numero di parole. Il giapponese non dispone di questo separatore, quindi il primo passo è decidere dove finisce una parola e dove ne inizia un'altra. Questo strumento deduce quei confini dalla sequenza dei caratteri e poi mostra il numero di parole, il numero totale di token (che include anche la punteggiatura) e le 20 parole più frequenti.

Il riconoscimento dei confini si basa su un metodo statistico e non su un dizionario, perciò l'intera analisi avviene nel browser e nulla di ciò che scrivete viene inviato a un server. Il rovescio della medaglia è che un testo ricco di termini tecnici o di parole appena coniate può essere suddiviso in modo un po' insolito in alcuni punti. Se vi serve un risultato rigoroso basato su dizionario, affiancate questo strumento a un analizzatore morfologico specializzato.

Va anche detto che il conteggio delle parole, in giapponese, non coincide quasi mai con il conteggio dei caratteri: una stessa frase può risultare relativamente breve in caratteri ma composta da molte parole se contiene molte particelle grammaticali, oppure il contrario se è ricca di composti lunghi scritti con più ideogrammi. Per questo motivo affiancare i due indicatori, invece di affidarsi a uno solo, aiuta a farsi un'idea più realistica della lunghezza effettiva di un testo.

Come contare le parole giapponesi

  1. Incollate il testo Incollate o digitate il brano in giapponese che volete misurare. L'analisi parte automaticamente man mano che scrivete.
  2. Interpretate i due contatori «Parole» esclude la punteggiatura, mentre «Token totali» conta anche ogni simbolo. Scegliete quello adatto a ciò che dovete comunicare.
  3. Controllate l'elenco di frequenza Le 20 parole più usate compaiono con il relativo numero di occorrenze, così potete individuare a colpo d'occhio una parola ripetuta in modo anomalo.
  4. Copiate o annotate i risultati Se dovete documentare l'analisi altrove, riportate i due totali e, se utile, le prime voci dell'elenco di frequenza prima di modificare nuovamente il testo.

Consigli per sfruttarlo al meglio

  • A differenza dell'italiano o dell'inglese, in cui le parole sono separate da spazi, in giapponese il confine fra le parole va determinato automaticamente. Questo strumento lo stima con un metodo statistico leggero (TinySegmenter).
  • L'elenco delle venti parole più frequenti è comodo per verificare che in un articolo di blog o in un testo ottimizzato per i motori di ricerca una parola chiave non sia ripetuta in modo innaturale.
  • Poiché anche la punteggiatura e le parentesi contano come token, mostriamo due indicatori distinti: i «token totali» e le «parole, esclusi i simboli».
  • Nomi propri, neologismi e termini assenti dai dizionari possono essere suddivisi in modo poco naturale a seconda del contesto. Se vi serve un'analisi morfologica rigorosa, basata su dizionario, valutate strumenti specialistici come MeCab.

A cosa serve questo contatore di parole

Verificare la densità di una parola chiave in un articolo

La tabella di frequenza mostra a colpo d'occhio se una parola chiave ricorre molto più spesso di quanto farebbe una formulazione naturale, un segnale tipico da controllare nella scrittura SEO.

Individuare i propri automatismi di scrittura

Congiunzioni e finali di frase usati per abitudine tendono a salire in cima all'elenco, offrendo punti precisi su cui intervenire durante una revisione.

Stimare il costo di una traduzione o di un incarico esterno

Quando un preventivo si basa sul numero di parole anziché sui caratteri, questo strumento fornisce il conteggio in giapponese da confrontare con la tariffa proposta da un fornitore.

Confrontare una bozza prima e dopo la revisione

Analizzate lo stesso brano prima e dopo la riscrittura: la variazione del numero di parole e della distribuzione delle frequenze offre una misura numerica di quanto il testo sia diventato più snello.

Termini dell'analisi del testo giapponese

Segmentazione delle parole
La suddivisione di una frase in parole singole. Il giapponese non ha spazi nativi che segnino questi confini, quindi una macchina deve stimarli.
Analisi morfologica
La tecnica più ampia di scomporre un testo nelle sue unità minime dotate di significato e di identificarne proprietà come la categoria grammaticale. È il punto di partenza della maggior parte dell'elaborazione automatica del giapponese.
Token
Una singola unità prodotta dall'analisi. Punteggiatura e parentesi contano ciascuna come un token, anche se non sono parole.
TinySegmenter
La libreria leggera e priva di dizionario usata da questo strumento per stimare i confini fra parole a partire da pattern nella sequenza di caratteri. Pesa poche decine di kilobyte e funziona interamente nel browser.
Frequenza delle parole
Il numero di volte in cui ogni parola compare nel testo. È un indicatore di base per individuare ripetizioni o squilibri nella formulazione.
Numero di caratteri e numero di parole
Il numero di caratteri somma semplicemente ogni carattere digitato, mentre il numero di parole riflette quante parole distinte quei caratteri formano: due misure diverse che possono raccontare storie molto diverse sullo stesso brano.

Domande frequenti

In italiano e in inglese le parole sono di norma separate da spazi, mentre in un testo giapponese quei confini non esistono. Dividendo semplicemente sugli spazi il conteggio sarebbe errato, quindi serve la segmentazione morfologica, cioè la stima dei confini di parola a partire dalla sequenza dei caratteri.

TinySegmenter è un metodo statistico leggero e privo di dizionario, quindi la precisione resta inferiore a quella dei motori basati su dizionario come MeCab. Per i testi comuni è più che adeguata, ma in scritti ricchi di termini tecnici o neologismi la suddivisione può risultare imprecisa.

No. L'analisi morfologica è eseguita interamente in JavaScript nel browser e il testo non viene mai trasmesso.

Serve a verificare che in un articolo di blog o in un testo ottimizzato una parola chiave non sia ripetuta in modo innaturale, a controllare eventuali ripetizioni stilistiche e ad analizzare le tendenze di un testo.

Il contatore di caratteri conta le parole separandole sugli spazi e non funziona quindi con il giapponese. Questo strumento è dedicato all'analisi morfologica di quella lingua e, oltre al numero di parole, ne mostra la frequenza.
Tool-kun

A proposito — «Sumomo mo momo mo momo no uchi» e la difficoltà di separare le parole

Il giapponese non separa le parole con gli spazi, ed è una delle ragioni principali per cui l'elaborazione automatica di questa lingua è difficile. L'esempio classico è lo scioglilingua «sumomo mo momo mo momo no uchi» («sia la susina sia la pesca appartengono alle pesche»): un essere umano lo divide d'istinto in «sumomo / mo / momo / mo / momo no / uchi», ma per una macchina priva di dizionario stabilire quei confini è arduo.

Lo strumento usa TinySegmenter, una libreria leggera di segmentazione del giapponese sviluppata da Taku Kudo, noto anche per il lavoro svolto in Google. Non impiega alcun dizionario: divide il testo con un modello che ha appreso statisticamente la probabilità di un confine di parola dalla sequenza dei caratteri, cioè dai passaggi fra hiragana, katakana, ideogrammi e cifre. Pesa poche decine di kilobyte e funziona rapidamente nel browser.

I motori di analisi morfologica completi, come MeCab o Kuromoji, richiedono dizionari da alcuni megabyte a diverse decine. TinySegmenter, non avendone bisogno, permette a uno strumento come questo di concludere l'elaborazione interamente nel browser senza trasmettere alcun dato. La precisione resta un gradino sotto ai metodi con dizionario, ma per farsi un'idea del numero di parole di un testo comune è più che sufficiente.