Lee è esemplare:
ELABORAZIONE DEL LINGUAGGIO NATURALE GENERALE AUTOCONTROLLATA
Recentemente, tuttavia, è emerso un nuovo approccio semplice ma elegante per l’apprendimento auto-supervisionato. L’apprendimento auto-supervisionato significa che l’IA si supervisiona da sola e non è richiesta alcuna etichettatura umana, (…) Questo approccio è chiamato “trasduzione di sequenza”. Per addestrare una rete neurale di trasduzione di sequenza, l’input è semplicemente la sequenza di tutte le parole fino a un punto e l’output è semplicemente la sequenza di parole dopo quel punto. Ad esempio, un input di “ottantasette anni fa” trasdurrà l’output predittivo “i nostri padri hanno generato, su questo continente”. Probabilmente ne utilizzi già versioni semplici ogni giorno nella funzione “composizione intelligente” di Gmail o nella funzione di “completamento automatico” della ricerca di Google. Nel 2017, i ricercatori di Google hanno inventato il “trasformatore”, un nuovo modello di trasduzione della sequenza che, se addestrato su enormi quantità di testo, può mostrare meccanismi selettivi di memoria e attenzione in grado di ricordare selettivamente qualsiasi cosa “importante e rilevante” del passato. Questa “memoria selettiva” può essere “recuperata” in base a ciascun input inserito. (…) Con dati sufficienti, questo deep learning avanzato può essenzialmente insegnare a se stesso una lingua da zero. Piuttosto che utilizzare costrutti umani come la coniugazione e la grammatica, il deep learning si basa su costrutti e astrazioni auto-inventati, raccolti dai dati e incorporati in una gigantesca rete neurale. (…) Dopo il lavoro sui trasformatori di Google, nel 2020 è stata rilasciata un’estensione più nota chiamata GPT-3 (GPT sta per “trasformatori generativi pre-addestrati”) da OpenAI, un laboratorio di ricerca fondato da Elon Musk e altri. GPT-3 è un gigantesco motore di trasduzione di sequenze che ha imparato ad analizzare il linguaggio da un modello così enorme da includere quasi tutti i concetti immaginabili. Sfruttando uno dei supercomputer più potenti al mondo, GPT-3 è stato addestrato su oltre 45 terabyte di testo, che richiederebbero 500.000 vite per essere letto da un essere umano. E questa cifra di 500.000 vite aumenta di dieci volte ogni anno, aggiungendo capacità a un ritmo esponenziale incredibile. Dopo un processo di addestramento molto lungo e costoso, GPT-3 ha prodotto un modello gigantesco con 175 miliardi di parametri. Se presenti una sequenza di parole a GPT-3, produrrà ciò che pensa dovrebbe seguire queste parole. Dagli enormi dati di addestramento, GPT-3 sa che una domanda generalmente stimola una risposta. (…) GPT-3 differisce notevolmente dall’NLP specifico del dominio. A differenza della funzionalità ristretta della tecnologia precedente, GPT-3 è in grado di svolgere un’intera gamma di compiti ragionevolmente bene (…) Grazie alle sue ampie capacità, GPT-3 può essere rapidamente sintonizzato su un determinato dominio alimentando la rete gigante con ulteriori informazioni specifiche del dominio. Di solito ciò richiede solo una piccola quantità di dati specifici del dominio, grazie alla capacità di GPT-3 di sfruttare l’enorme tesoro di dati fondamentali su cui è stato pre-addestrato. (…) GPT-3 è anche debole nel ragionamento causale, nel pensiero astratto, nelle dichiarazioni esplicative, nel buon senso e nella creatività (intenzionale). Inoltre, avendo ingerito così tanti dati tratti dagli esseri umani, ha purtroppo assorbito pregiudizi, bias e malizia umani. (…) Nel gennaio 2021, a soli sette mesi dal rilascio di GPT-3, Google ha annunciato un modello linguistico con 1,75 trilioni di parametri, nove volte più grande di GPT-3. Ciò ha continuato la tendenza dell’abilità del modello linguistico a crescere di circa dieci volte all’anno. Questo modello linguistico ha già letto più di quanto chiunque di noi potrebbe leggere in milioni di vite. (K. Lee, C. Qiufan, “AI 2041: Ten Visions for Our Future” – traduzione in proprio)