PlayPendium
WordChess · Spunti di riflessione

Insegnare 149.000 parole a una macchina, in 22 lingue

Un gioco di parole ha bisogno di più di un elenco di stringhe ammesse. Deve dire che cosa ciascuna significa, e il significato è la cosa più difficile da archiviare.

Scritto e redatto in inglese. Questa versione italiana è stata prodotta con traduzione automatica; dove conta la precisione, fa fede l'originale inglese. Leggi l'originale in inglese →

01 · Il lemma e le sue ombre

Una parola, e tutte le forme che assume

WordChess si gioca su una tavola 25×25 con un dizionario inglese di 148.941 parole 6, voci lunghe in media 8,6 lettere, la più lunga di 27. Questa è la parte facile. Un elenco di parole ammesse è solo un insieme di stringhe che il gioco accetterà. La parte interessante è dire a un giocatore che cosa significa la stringa sulla tavola, e farlo in ventidue lingue contemporaneamente.

I lessicografi tracciano una linea netta tra un lemma e le sue forme flesse. Il lemma è la parola d'entrata che si cerca nel dizionario: run ("correre"), house ("casa"), be ("essere"). Intorno a esso orbita un paradigma di forme superficiali: runs, ran, running. Ognuna porta lo stesso senso di fondo, vestito per un diverso ruolo grammaticale. 3 Un dizionario spende la sua prosa sul lemma e lascia che le ombre rimandino a casa.

Quante ombre proietta una parola dipende dalla lingua. L'inglese è analitico: si appoggia all'ordine delle parole e a piccole parole ausiliarie, così un verbo ha di rado più di una manciata di forme. Il finlandese è agglutinante: costruisce il significato incollando suffissi a una radice. Un singolo sostantivo finlandese si declina in una quindicina di casi, al singolare e al plurale, prima che vi si impilino sopra desinenze possessive e clitici; il numero pratico di forme distinte arriva alle migliaia. 4 L'ungherese condensa un'intera frase inglese, in my house ("nella mia casa"), in una sola parola, házamban. 5

02 · Un dizionario scritto da tutti

Dove vivono le definizioni

Le definizioni provengono da Wiktionary (in italiano Wikizionario), il dizionario libero che chiunque può modificare. È enorme e multilingue: il progetto comprende ben oltre un centinaio di edizioni linguistiche attive e decine di milioni di voci, scritte collaborativamente da volontari anziché da una redazione retribuita. 1 Per un gioco che funziona in 22 lingue, nessun altro lessico libero gli si avvicina per copertura.

Ma la copertura sulla carta non è una copertura che si possa leggere ad alta voce. Wiktionary archivia le forme flesse in un modo che risparmia ai redattori umani di scrivere la stessa glossa diecimila volte. Invece di esplicitare una definizione, una voce non lemmatica contiene un template "form of", un piccolo puntatore che dice, in sostanza, "questa è una particolare forma grammaticale di quel lemma". 2 La voce smoulders ("cova sotto la cenere") non è prosa; è un template che viene reso come "third-person singular simple present form of smoulder" ("forma della terza persona singolare del presente semplice di smoulder"). 1

Questi puntatori non sono un errore di arrotondamento. Sul Wiktionary inglese, su circa 1,27 milioni di definizioni, circa 478.000, ben più di un terzo, sono definizioni "form of" anziché significati scritti per esteso. 1 I dati ci sono. Sono solo ripiegati.

03 · Un problema di parsing, non una lacuna nei dati

La glossa sta nel dispiegare il template

Quindi la sfida che contava non è mai stata "la parola manca". Era che il significato della parola stava dentro un template che un parser ingenuo avrebbe buttato via. Le definizioni di WordChess sono state costruite leggendo i dump grezzi di Wiktionary ed espandendo i template di flessione lingua per lingua, insegnando al parser che cosa significa ciascun puntatore e riscrivendolo come una glossa semplice. 6

Ogni lingua nasconde le sue forme dietro un meccanismo diverso. Lo spagnolo nasconde le forme verbali dietro {{forma verbo}}, risolto in "forma verbale di X". Il tedesco usa {{Grundformverweis Dekl/Konj}} per le forme declinate e coniugate. Il finlandese si affida a {{taivutusmuoto}}. Il russo spesso non archivia alcun template di forma: la parola flessa è un semplice reindirizzamento (собаки → собака) che bisogna seguire per ricavare una glossa "forma di". 6 Gestisci ciascuna convenzione, e la copertura fa un balzo.

Copertura delle definizioni, prima → dopo l'espansione dei template
LinguaPrimaDopoGuadagno
Tedesco45%92%+47
Olandese58%90%+32
Finlandese54%74%+20
Russo20%70%+50
Greco15%57%+42

Rilevato dalle note di progettazione e sviluppo di questo progetto. Le percentuali indicano la quota di voci del dizionario che hanno una definizione utilizzabile o una glossa "forma di" risolta.

I dati non sono mai mancati. Erano ripiegati in un puntatore, e dare la parola a una macchina ha significato imparare a dispiegarli.

04 · Che cosa significa "conoscere una parola" per una macchina

Una stringa, e una frase su di essa

Vale la pena essere onesti su ciò che il gioco contiene ora. Quando WordChess mostra che собаки è una forma di собака, "cane", non ha capito nulla. Ha associato una stringa a un'altra stringa, una glossa, seguendo gli stessi puntatori lasciati da un redattore umano. Questa è la lemmatizzazione, il cavallo da tiro dell'elaborazione del linguaggio naturale: ridurre una forma superficiale alla sua base, così che una macchina abbia meno cose distinte da seguire. 7

È un tipo di conoscenza reale e utile. Permette al gioco di rispondere a "che parola è questa?" ad Atene o ad Amsterdam senza un lessicografo in organico. Ma è conoscenza come consultazione, non conoscenza come significato. La glossa è una promessa che una persona, leggendola, riconoscerà la parola. La macchina custodisce la promessa; il lettore fornisce il senso.

Dov'è il muro

Alcune lingue incontrano un tetto che nessun parser può sollevare, perché i dati da dispiegare semplicemente non ci sono. Le voci ungheresi spesso contengono solo un'etimologia e una tabella di traduzioni, nessun testo di definizione, così anche un lettore perfetto resta a mani vuote. I casi più difficili si concentrano dove la linguistica è più difficile: le lingue agglutinanti come il finlandese e l'ungherese, che generano paradigmi enormi, e le scritture cirillica e greca, dove la copertura della comunità è già più scarsa in partenza. Il greco è salito dal 15% al 57%; il fatto che si fermi ben al di sotto del 92% del tedesco dice qualcosa della fonte, non del codice. 6

Sources & notes
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, and the "form of" definition counts (including the smoulders example). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", how non-lemma entries point back to a lemma on the definition line. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", reducing inflected forms to a base form in NLP. en.wikipedia.org/wiki/Lemmatization
  8. Further reading on Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Further reading on Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Further reading on Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026