Un gioco di parole ha bisogno di più di un elenco di stringhe ammesse. Deve dire che cosa ciascuna significa, e il significato è la cosa più difficile da archiviare.
Scritto e redatto in inglese. Questa versione italiana è stata prodotta con traduzione automatica; dove conta la precisione, fa fede l'originale inglese. Leggi l'originale in inglese →
WordChess si gioca su una tavola 25×25 con un dizionario inglese di 148.941 parole 6, voci lunghe in media 8,6 lettere, la più lunga di 27. Questa è la parte facile. Un elenco di parole ammesse è solo un insieme di stringhe che il gioco accetterà. La parte interessante è dire a un giocatore che cosa significa la stringa sulla tavola, e farlo in ventidue lingue contemporaneamente.
I lessicografi tracciano una linea netta tra un lemma e le sue forme flesse. Il lemma è la parola d'entrata che si cerca nel dizionario: run ("correre"), house ("casa"), be ("essere"). Intorno a esso orbita un paradigma di forme superficiali: runs, ran, running. Ognuna porta lo stesso senso di fondo, vestito per un diverso ruolo grammaticale. 3 Un dizionario spende la sua prosa sul lemma e lascia che le ombre rimandino a casa.
Quante ombre proietta una parola dipende dalla lingua. L'inglese è analitico: si appoggia all'ordine delle parole e a piccole parole ausiliarie, così un verbo ha di rado più di una manciata di forme. Il finlandese è agglutinante: costruisce il significato incollando suffissi a una radice. Un singolo sostantivo finlandese si declina in una quindicina di casi, al singolare e al plurale, prima che vi si impilino sopra desinenze possessive e clitici; il numero pratico di forme distinte arriva alle migliaia. 4 L'ungherese condensa un'intera frase inglese, in my house ("nella mia casa"), in una sola parola, házamban. 5
Le definizioni provengono da Wiktionary (in italiano Wikizionario), il dizionario libero che chiunque può modificare. È enorme e multilingue: il progetto comprende ben oltre un centinaio di edizioni linguistiche attive e decine di milioni di voci, scritte collaborativamente da volontari anziché da una redazione retribuita. 1 Per un gioco che funziona in 22 lingue, nessun altro lessico libero gli si avvicina per copertura.
Ma la copertura sulla carta non è una copertura che si possa leggere ad alta voce. Wiktionary archivia le forme flesse in un modo che risparmia ai redattori umani di scrivere la stessa glossa diecimila volte. Invece di esplicitare una definizione, una voce non lemmatica contiene un template "form of", un piccolo puntatore che dice, in sostanza, "questa è una particolare forma grammaticale di quel lemma". 2 La voce smoulders ("cova sotto la cenere") non è prosa; è un template che viene reso come "third-person singular simple present form of smoulder" ("forma della terza persona singolare del presente semplice di smoulder"). 1
Questi puntatori non sono un errore di arrotondamento. Sul Wiktionary inglese, su circa 1,27 milioni di definizioni, circa 478.000, ben più di un terzo, sono definizioni "form of" anziché significati scritti per esteso. 1 I dati ci sono. Sono solo ripiegati.
Quindi la sfida che contava non è mai stata "la parola manca". Era che il significato della parola stava dentro un template che un parser ingenuo avrebbe buttato via. Le definizioni di WordChess sono state costruite leggendo i dump grezzi di Wiktionary ed espandendo i template di flessione lingua per lingua, insegnando al parser che cosa significa ciascun puntatore e riscrivendolo come una glossa semplice. 6
Ogni lingua nasconde le sue forme dietro un meccanismo diverso. Lo spagnolo nasconde le forme verbali dietro {{forma verbo}}, risolto in "forma verbale di X". Il tedesco usa {{Grundformverweis Dekl/Konj}} per le forme declinate e coniugate. Il finlandese si affida a {{taivutusmuoto}}. Il russo spesso non archivia alcun template di forma: la parola flessa è un semplice reindirizzamento (собаки → собака) che bisogna seguire per ricavare una glossa "forma di". 6 Gestisci ciascuna convenzione, e la copertura fa un balzo.
| Lingua | Prima | Dopo | Guadagno |
|---|---|---|---|
| Tedesco | 45% | 92% | +47 |
| Olandese | 58% | 90% | +32 |
| Finlandese | 54% | 74% | +20 |
| Russo | 20% | 70% | +50 |
| Greco | 15% | 57% | +42 |
Rilevato dalle note di progettazione e sviluppo di questo progetto. Le percentuali indicano la quota di voci del dizionario che hanno una definizione utilizzabile o una glossa "forma di" risolta.
I dati non sono mai mancati. Erano ripiegati in un puntatore, e dare la parola a una macchina ha significato imparare a dispiegarli.
Vale la pena essere onesti su ciò che il gioco contiene ora. Quando WordChess mostra che собаки è una forma di собака, "cane", non ha capito nulla. Ha associato una stringa a un'altra stringa, una glossa, seguendo gli stessi puntatori lasciati da un redattore umano. Questa è la lemmatizzazione, il cavallo da tiro dell'elaborazione del linguaggio naturale: ridurre una forma superficiale alla sua base, così che una macchina abbia meno cose distinte da seguire. 7
È un tipo di conoscenza reale e utile. Permette al gioco di rispondere a "che parola è questa?" ad Atene o ad Amsterdam senza un lessicografo in organico. Ma è conoscenza come consultazione, non conoscenza come significato. La glossa è una promessa che una persona, leggendola, riconoscerà la parola. La macchina custodisce la promessa; il lettore fornisce il senso.
Alcune lingue incontrano un tetto che nessun parser può sollevare, perché i dati da dispiegare semplicemente non ci sono. Le voci ungheresi spesso contengono solo un'etimologia e una tabella di traduzioni, nessun testo di definizione, così anche un lettore perfetto resta a mani vuote. I casi più difficili si concentrano dove la linguistica è più difficile: le lingue agglutinanti come il finlandese e l'ungherese, che generano paradigmi enormi, e le scritture cirillica e greca, dove la copertura della comunità è già più scarsa in partenza. Il greco è salito dal 15% al 57%; il fatto che si fermi ben al di sotto del 92% del tedesco dice qualcosa della fonte, non del codice. 6