Un gioco di parole richiede più di una lista di stringhe valide. Deve dire cosa significa ciascuna di esse means, e il significato è la cosa più difficile da memorizzare.
WordChess plays on a 25×25 board with a 148,941-word English dictionary6, voci con una media di 8,6 lettere, alcune che arrivano a 25. Questa è la parte facile. Una lista di parole valide è solo un insieme di stringhe che il gioco accetterà. La parte interessante è dire a un giocatore cosa significa la stringa sulla scacchiera means, e farlo in ventidue lingue contemporaneamente.
I lessicografi tracciano una netta linea tra un lemma e le sue forme flesse. Il lemma è la voce principale che si consulta, run, house, be. Intorno ad essa orbita un paradigma di forme superficiali: runs, ran, running. Ognuna porta lo stesso senso fondamentale, abbigliata per un diverso ruolo grammaticale.3 Un dizionario spende la sua prosa sul lemma e lascia alle ombre il compito di indicare la via di casa.
Quante ombre proietti una parola dipende dalla lingua. L'inglese è analitico: si affida all'ordine delle parole e a piccole parole ausiliarie, così un verbo raramente ha più di un pugno di forme. Il finlandese è agglutinante, costruisce il significato incollando suffissi a un tema. Un singolo nome finlandese declina in circa quindici casi, al singolare e al plurale, prima che si accumulino le desinenze possessive e i clitici; il numero pratico di forme distinte raggiunge le migliaia.4 L'ungherese racchiude un'intera frase inglese, nella mia casa, in una sola parola, házamban.5
Le definizioni provengono da Wiktionary, il dizionario gratuito che chiunque può modificare. È enorme e multilingue: il progetto copre oltre cento edizioni linguistiche attive e decine di milioni di voci, scritte in modo collaborativo da volontari anziché da un comitato editoriale retribuito.1 Per un gioco che funziona in 22 lingue, nessun altro lessico gratuito si avvicina in termini di copertura.
Ma la copertura sulla carta non è una copertura che si può leggere ad alta voce. Wiktionary archivia le forme flesse in modo da risparmiare ai redattori umani la stesura della stessa glossa diecimila volte. Invece di esplicitare una definizione, una voce non lemmatica reca un modello di forma, un piccolo riferimento che dice, in sostanza, "questa è una particolare forma grammaticale di quel lemma."2 La voce per smoulders non è prosa; è un modello che viene reso come "terza persona singolare presente semplice di smoulder".1
Questi puntatori non sono un errore di arrotondamento. Sul Wiktionary in inglese, su circa 1,27 milioni di definizioni, circa 478.000, ben più di un terzo, sono definizioni di "forma di" anziché sensi scritti in esteso.1 I dati sono lì. Sono semplicemente piegati.
Quindi la sfida che contava non è mai stata "la parola è mancante". Era che il significato della parola era racchiuso in un modello che un parser ingenuo avrebbe scartato. Le definizioni di WordChess sono state costruite leggendo i dump grezzi di Wiktionary e espandendo i modelli di flessione lingua per lingua, insegnando al parser cosa significa ogni puntatore e riscrivendolo in una glossa semplice.6
Ogni lingua nasconde le sue forme dietro meccanismi diversi. Lo spagnolo nasconde le forme verbali dietro {{forma verbo}}, risolte in "forma verbale di X". Il tedesco usa {{Grundformverweis Dekl/Konj}} per le forme declinate e coniugate. Il finlandese si affida a {{taivutusmuoto}}. Il russo spesso non memorizza alcun modello di forma, la parola declinata è un semplice riferimento (собаки → собака) che deve essere seguito per recuperare una glossa "forma di".6 Gestire ciascuna convenzione e la copertura aumenta.
| Lingua | Prima | Dopo | Guadagno |
|---|---|---|---|
| Tedesco | 45% | 92% | +47 |
| Olandese | 58% | 90% | +32 |
| Finlandese | 54% | 74% | +20 |
| Russo | 20% | 70% | +50 |
| Greco | 15% | 57% | +42 |
Misurato dalle note di progettazione e costruzione di questo progetto. Le percentuali indicano la quota di voci del dizionario che possiedono una definizione utilizzabile o una glossa "forma di" risolta.
I dati non erano mai mancanti. Erano ripiegati in un puntatore, e dare a una macchina la parola significava imparare a dispiegarlo.
Vale la pena essere onesti su ciò che il gioco contiene ora. Quando WordChess mostra che собаки è una forma di собака, "cane", non ha compreso nulla. Ha mappato una stringa su un'altra stringa, una glossa, seguendo gli stessi puntatori lasciati da un editor umano. Questo è lemmatization, il cavallo da lavoro dell'elaborazione del linguaggio naturale: ridurre una forma superficiale alla sua forma base in modo che una macchina abbia meno elementi distinti da tracciare.7
Si tratta di un tipo di conoscenza reale e utile. Permette al gioco di rispondere a "cos'è questa parola?" ad Atene o ad Amsterdam senza un lessicografo in organico. Ma è conoscenza come ricerca, non conoscenza come significato. La glossa è una promessa che una persona, leggendola, riconoscerà la parola. La macchina detiene la promessa; il lettore fornisce il senso.
Alcune lingue raggiungono un limite che nessun parser può superare, perché i dati semplicemente non sono lì da dispiegare. Le voci ungheresi spesso riportano solo un'etimologia e una tabella di traduzioni, senza alcun testo di definizione, così che anche un lettore perfetto se ne va a mani vuote. I casi più difficili si concentrano dove la linguistica è più difficile: le lingue agglutinanti come il finlandese e l'ungherese, che generano paradigmi enormi, e le scritture cirillica e greca, dove la copertura della comunità è più sottile fin dall'inizio. Il greco è salito dal 15% al 57%; il fatto che si fermi ben al di sotto del 92% del tedesco è un fatto sulla fonte, non sul codice. 6