Gemini capisce i video meglio e spende meno token
Google ha lanciato una nuova funzione per Gemini: la comprensione video "agentica". Il modello analizza i video in modo più intelligente. Consuma meno token e costa meno, ma è più preciso.
In breve
- Google lancia la comprensione video agentica per tre modelli Gemini.
- La funzione riduce i token fino all'88% e i costi fino al 66%.
- La precisione migliora fino al 7%, soprattutto sui video lunghi.
Cos'è la comprensione video agentica
Google DeepMind ha annunciato una nuova funzione per Gemini il 1 settembre 2026. Si chiama "agentic video understanding".
È disponibile per tre modelli: Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. Funziona sui video caricati e sui video di YouTube.
Prima, Gemini analizzava i video a una velocità fissa. Guardava un'immagine ogni secondo, di default. Questo si chiama processamento "statico".
Con la nuova funzione, Gemini decide da solo cosa guardare. Sceglie quali momenti del video ispezionare. Sceglie anche a che velocità guardarli. Può usare i fotogrammi, l'audio o la trascrizione del video.
In parole povere: prima Gemini guardava tutto il video allo stesso ritmo. Ora sceglie da solo dove concentrarsi, come fa una persona che riavvolge un video per capire meglio una scena.

I numeri del miglioramento
Secondo Google, la funzione riduce il consumo di token fino all'88%. I costi calano fino al 66%. La qualità delle risposte migliora fino al 7%.
Questi guadagni sono più grandi sui video lunghi. Si va da guide pratiche di 10 minuti fino a lezioni di 90 minuti e registrazioni di più ore.
Il modello Gemini 3.7 Flash, con questa funzione attiva, offre la miglior combinazione tra qualità e costo tra tutti i modelli testati.
Come funziona in pratica
Gemini usa uno strumento interno per caricare solo la parte del video che serve. Prima, gli sviluppatori dovevano fare questo lavoro a mano.
Ora il modello lo fa da solo, con un ciclo agentico. Cerca, scansiona e ispeziona i segmenti giusti del video.
Questo apre nuove possibilità. Per esempio:
- Recupero di momenti di durata inferiore al secondo (sub-second moment retrieval).
- I guadagni di efficienza sono più marcati sui video lunghi, fino a registrazioni di più ore.
- Rilevare anomalie in modo più accurato.
- Contare oggetti o movimenti ripetuti con precisione.
In parole povere: Gemini può ora "riguardare" un pezzo di video più volte, come fa una persona quando cerca un dettaglio.
Dove si trova e come si attiva
La funzione è già disponibile oggi. Si trova nella API di Gemini, dentro Google AI Studio. È disponibile anche nella Gemini Enterprise Agent Platform.
Per attivarla, basta impostare la configurazione API su "agentic".
Gli autori dell'annuncio sono Rohan Doshi, Senior Product Manager di Google DeepMind, e Mario Lučić, Research Director di Google DeepMind.
Cosa cambia per te
Ecco cosa significa questa novità per chi lavora con video e intelligenza artificiale.
- Se usi l'API Gemini per analizzare video, puoi ridurre subito i costi impostando la modalità "agentic".
- La funzione conviene soprattutto con video lunghi, come lezioni o registrazioni di più ore.
- Puoi ottenere risposte più precise senza dover gestire manualmente i fotogrammi da analizzare.
Gemini adesso sceglie da solo cosa guardare in un video, e lo fa spendendo meno.
Fonti
Articolo divulgativo: i fatti sono rielaborati con parole nostre a partire dalle fonti citate. Per i dettagli ufficiali rimandiamo alle pagine originali. Aggiornato al 2 settembre 2026.
Immagini: sono illustrazioni generate con l'intelligenza artificiale e portano incisa l'icona ufficiale UE «AI GENERATED» (art. 50 AI Act). Non sono fotografie di fatti realmente accaduti e le persone ritratte non esistono: nessuna immagine raffigura persone reali citate nell'articolo.
Domande frequenti
Quali modelli Gemini supportano questa funzione?
Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite.
Come si attiva la comprensione video agentica?
Basta impostare la configurazione API su "agentic" in Google AI Studio o nella Gemini Enterprise Agent Platform.





