Corso AI in 10 puntate

Cosa sono i modelli multimodali?

Un modello multimodale lavora con più tipi di input (e a volte output): testo, immagini, audio, video. Non «vede» come un occhio umano: trasforma pixel o audio in rappresentazioni interne e le collega al linguaggio. Per questo puoi chiedere «cosa c’è in questa foto?» o far descrivere uno screenshot.

Utile per documenti scansionati, diagrammi, screenshot di errori. Resta un LLM (o una famiglia vicina) con capacità extra: può ancora inventare dettagli (allucinazioni), soprattutto su testo piccolo o immagini ambigue.

Cosa non è

Non è visione perfetta né OCR legale al 100%. Non sostituisce un dataset tuo in tempo reale (RAG resta utile per i documenti). Non tutti i prodotti multimodali sono uguali: alcuni solo descrivono immagini, altri generano anche immagini.

Nel corso si parte dal testo (token, embedding) e si arriva a capire cosa cambia quando il modello «guarda» oltre le parole.

Poi, se vuoi la mappa intera. Inizia dalla puntata gratis. Il Corso AI in 10 puntate costa 9,90 € una tantum, e resta tuo. Home: corso-intelligenza-artificiale.com.