Chiarisce Cristianini:
[Si tratta della] similarità tra gli obiettivi di un agente e quelli del suo utente: l’idea è che l’agente deve allineare i suoi obiettivi ai nostri, ma noi dobbiamo comunicarglieli. Attualmente questo processo prende una forma simile al modo in cui facciamo l’annotazione dei dati, ovvero tramite collaudatori umani che valutano le azioni dell’agente, con un voto positivo o negativo. Una tipica interazione prende questa forma: l’addestratore vede sullo schermo un prompt, seguito da due possibili risposte affiancate, e deve indicare quella preferibile. Per fare questo, i collaudatori hanno bisogno di linee guida che chiariscano quali sono i comportamenti da incoraggiare e quelli da scoraggiare. (N. Cristianini,”Machina Sapiens. L’algoritmo che ci ha rubato il segreto della conoscenza”)