Corso AI in 10 puntate

Cos’è la KV cache (nei transformer)?

La KV cache è una memoria intermedia usata in inferenza dai modelli transformer: salva i vettori Key e Value già calcolati dal meccanismo di attenzione, così a ogni nuovo token non si ricalcola tutto il contesto da zero. Senza di essa, generare una risposta lunga sarebbe molto più lento e costoso.

Serve perché i LLM generano pezzo dopo pezzo: il passato (il prompt e i token già scritti) resta utile. La cache cresce con la finestra di contesto, quindi conversazioni lunghe occupano più memoria GPU/RAM.

Cosa non è

Non è la memoria a lungo termine del modello (i parametri). Non è un database vettorialeRAG. Non «ricorda» tra sessioni diverse: di solito vive solo per quella generazione. Non è quantizzazione, anche se spesso si combinano per far girare modelli grandi.

Nel corso si distingue «cosa sa il modello» da «quanto costa continuare a generare».

Poi, se vuoi la mappa intera. Inizia dalla puntata gratis. Il Corso AI in 10 puntate costa 9,90 € una tantum, e resta tuo. Home: corso-intelligenza-artificiale.com.