Come si valuta un modello AI?
Valutare un LLM significa misurare se fa bene un compito, non se è «intelligente». Si usano benchmark (test pubblici), eval su i tuoi esempi, e a volte persone che confrontano due risposte (come nel RLHF). Un punteggio alto su un quiz non dice se il modello tiene i tuoi documenti o evita allucinazioni sul lavoro.
Serve per scegliere un modello con un criterio, non con il marketing. In pratica conti: qualità sul compito, costo e latenza in inferenza, e quanto spesso inventa. Per dati tuoi, un eval sul RAG (recupera il pezzo giusto?) conta più di una classifica generica.
Cosa non è
Non è una votazione definitiva. Non è il pretraining. Non è un guardrail, anche se gli eval di sicurezza esistono. Un leaderboard può essere saturato o lontano dal tuo uso (italiano, documenti interni, tools).
Nel corso si vede perché «è arrivato primo» non basta per usarlo in produzione.
Poi, se vuoi la mappa intera. Inizia dalla puntata gratis. Il Corso AI in 10 puntate costa 9,90 € una tantum, e resta tuo. Home: corso-intelligenza-artificiale.com.