Cos’è il prompt caching?
Il prompt caching riusa pezzi già processati di un prompt lungo (spesso il system prompt o un contesto fisso) così le chiamate successive allo stesso LLM costano meno e rispondono più in fretta. È un trucco di inferenza, legato anche alla KV cache.
Serve quando ripeti lo stesso prefisso (istruzioni, schema, documentazione) in molte richieste. Non «insegna» fatti nuovi al modello e non sostituisce il RAG: il testo va comunque nel contesto. Se il prefisso cambia spesso, il cache non aiuta.
Cosa non è
Non è fine-tuning. Non è memoria a lungo termine dell’utente. Non è MCP. Non toglie le allucinazioni. Non è la stessa cosa di un database vettoriale.
Nel corso si distingue «cosa metti nel prompt» da «come il provider lo fa costare meno».
Poi, se vuoi la mappa intera. Inizia dalla puntata gratis. Il Corso AI in 10 puntate costa 9,90 € una tantum, e resta tuo. Home: corso-intelligenza-artificiale.com.