se nella stessa internet, come è avvenuto per allenare gpt-2, la seconda versione di Chatgpt, si utilizzano i contenuti di Reddit, la nota piattaforma americana per l’aggregazione di notizie e la discussione tra i suoi utenti, le statistiche indicano che questi ultimi sono per il 67% uomini e per il 64% giovani tra i 18 e i 29 anni. Se si ricorre a Wikipedia, come si fa sempre con gli llm, solo il 15% delle persone che vi scrivono sono donne. Se, come si è fatto per gpt-3, si filtrano i dati di Common Crawl per eliminare automaticamente parole sconvenienti, maleducate o sessiste, si rischia di cancellarne alcune che in certi contesti non sono tali, come nel caso del termine twink nella comunità lgbtq+. Se, per parlare dell’attualità, si prendono in considerazione solo i siti dei giornali e della stampa in generale, quasi certamente non si rappresentano tutti quei movimenti non violenti che portano avanti le proprie cause in maniera poco notiziabile. Se non si ri-allenano continuamente le ia – e di solito questo non viene fatto spesso, dati i costi, sia in termini economici che ambientali – si rischia di non riprodurre in tempo reale i rapidi cambiamenti nel modo di vedere le cose al di fuori dei database utilizzati a questo scopo- (…) l’ondata di emozione legata al movimento Black Lives Matter (..) [ha] indotto una super-produzione improvvisa di contenuti in suo favore su internet, con una velocità che non avrebbe potuto essere intercettata da nessuna intelligenza artificiale allenata in un periodo anche solo di poco antecedente). (AA. VV, “Critica di ChatGPT”)