Corso AI in 10 puntate

Cos’è il RLHF?

RLHF (Reinforcement Learning from Human Feedback) è una fase dopo il pretraining: persone confrontano due risposte, e il modello impara a preferire quella che gli umani giudicano meglio. Non gli insegna i fatti di ieri: gli insegna uno stile — più utile, più cauto, meno rozzo.

Senza questa fase (o una simile) un foundation model tende a completare testo, non a fare da assistente. Il fine-tuning supervisionato gli dà esempi; il RLHF gli dà preferenze. Oggi molti usano varianti con lo stesso scopo.

Cosa non è

Non è magia morale e non elimina le allucinazioni. Non è RAG: non gli passa i tuoi file. Non è il system prompt: quello è testo in cima alla chat, non un cambio dei parametri.

Nel corso si distingue allenare i pesi da dare istruzioni al momento.

Poi, se vuoi la mappa intera. Inizia dalla puntata gratis. Il Corso AI in 10 puntate costa 9,90 € una tantum, e resta tuo. Home: corso-intelligenza-artificiale.com.