Un'icona di video che si scompone in fotogrammi analizzati da un'intelligenza artificiale
Gemini ora sceglie da solo quali parti di un video guardare con attenzione.
Novità · Gemini

Gemini capisce i video meglio e spende meno token

Redazione IA da Zero · 2 settembre 2026 · Lettura 4 min

Google ha lanciato una nuova funzione per Gemini: la comprensione video "agentica". Il modello analizza i video in modo più intelligente. Consuma meno token e costa meno, ma è più preciso.

In breve

Cos'è la comprensione video agentica

Google DeepMind ha annunciato una nuova funzione per Gemini il 1 settembre 2026. Si chiama "agentic video understanding".

È disponibile per tre modelli: Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. Funziona sui video caricati e sui video di YouTube.

Prima, Gemini analizzava i video a una velocità fissa. Guardava un'immagine ogni secondo, di default. Questo si chiama processamento "statico".

Con la nuova funzione, Gemini decide da solo cosa guardare. Sceglie quali momenti del video ispezionare. Sceglie anche a che velocità guardarli. Può usare i fotogrammi, l'audio o la trascrizione del video.

In parole povere

In parole povere: prima Gemini guardava tutto il video allo stesso ritmo. Ora sceglie da solo dove concentrarsi, come fa una persona che riavvolge un video per capire meglio una scena.

Un'icona di video che si scompone in fotogrammi analizzati da un'intelligenza artificiale

I numeri del miglioramento

Secondo Google, la funzione riduce il consumo di token fino all'88%. I costi calano fino al 66%. La qualità delle risposte migliora fino al 7%.

Questi guadagni sono più grandi sui video lunghi. Si va da guide pratiche di 10 minuti fino a lezioni di 90 minuti e registrazioni di più ore.

Il modello Gemini 3.7 Flash, con questa funzione attiva, offre la miglior combinazione tra qualità e costo tra tutti i modelli testati.

Come funziona in pratica

Gemini usa uno strumento interno per caricare solo la parte del video che serve. Prima, gli sviluppatori dovevano fare questo lavoro a mano.

Ora il modello lo fa da solo, con un ciclo agentico. Cerca, scansiona e ispeziona i segmenti giusti del video.

Questo apre nuove possibilità. Per esempio:

In parole povere

In parole povere: Gemini può ora "riguardare" un pezzo di video più volte, come fa una persona quando cerca un dettaglio.

Dove si trova e come si attiva

La funzione è già disponibile oggi. Si trova nella API di Gemini, dentro Google AI Studio. È disponibile anche nella Gemini Enterprise Agent Platform.

Per attivarla, basta impostare la configurazione API su "agentic".

Gli autori dell'annuncio sono Rohan Doshi, Senior Product Manager di Google DeepMind, e Mario Lučić, Research Director di Google DeepMind.

Cosa cambia per te

Cosa cambia per te

Ecco cosa significa questa novità per chi lavora con video e intelligenza artificiale.

In una riga

Gemini adesso sceglie da solo cosa guardare in un video, e lo fa spendendo meno.

Fonti

Articolo divulgativo: i fatti sono rielaborati con parole nostre a partire dalle fonti citate. Per i dettagli ufficiali rimandiamo alle pagine originali. Aggiornato al 2 settembre 2026.

Immagini: sono illustrazioni generate con l'intelligenza artificiale e portano incisa l'icona ufficiale UE «AI GENERATED» (art. 50 AI Act). Non sono fotografie di fatti realmente accaduti e le persone ritratte non esistono: nessuna immagine raffigura persone reali citate nell'articolo.

Domande frequenti

Quali modelli Gemini supportano questa funzione?

Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite.

Come si attiva la comprensione video agentica?

Basta impostare la configurazione API su "agentic" in Google AI Studio o nella Gemini Enterprise Agent Platform.

Ti interessa Gemini?

Tutti gli articoli Gemini →

Continua a leggere · Ultime uscite

Tutte le novità →

Le novità sull'IA, una volta a settimana

Un'email breve con le notizie sull'IA che contano davvero, verificate alla fonte. Niente spam, disiscrizione con un clic.