Icone di testo, immagine, audio e video che convergono in un unico punto luminoso
Testo, immagini, audio e video uniti in un solo spazio digitale.
Novità · Gemini

EmbeddingGemma 2: il modello aperto che capisce testo, foto e audio

Redazione IA da Zero · 7 ottobre 2026 · Lettura 4 min

Google ha presentato EmbeddingGemma 2. È un modello leggero e gratuito. Capisce testo, immagini, video e audio insieme. Funziona anche senza internet, dentro al telefono.

In breve

Cos'è EmbeddingGemma 2

Google DeepMind ha lanciato EmbeddingGemma 2. È il successore di EmbeddingGemma, uscito l'anno scorso.

Il primo modello aveva avuto molto successo. Ha superato 20 milioni di download, secondo Google DeepMind.

Il nuovo modello fa un passo in più. Non lavora solo con il testo.

Capisce anche codice, immagini, video e audio. Li trasforma tutti in un unico linguaggio comune, chiamato "embedding".

In parole povere

In parole povere: è come un traduttore universale. Prende foto, suoni, video e testo. Li mette tutti sulla stessa "mappa" digitale, così il computer può confrontarli.

Icone di testo, immagine, audio e video che convergono in un unico punto luminoso

Un modello piccolo ma capace

EmbeddingGemma 2 ha 740 milioni di parametri. È costruito sull'architettura Gemma 4.

Ha una licenza Apache 2.0. Questo significa che le aziende possono usarlo liberamente, anche per scopi commerciali.

Secondo Google DeepMind, il modello ottiene i punteggi migliori tra i modelli multimodali con meno di un miliardo di parametri, chiamati "sub-1B". Il primato riguarda in particolare i benchmark MTEB Code e MAEB.

Riesce a battere o eguagliare modelli anche più grandi, su testo, immagini e audio.

Il modello è anche modulare. Per lavorare solo con testo, bastano 270 milioni di parametri.

Si possono aggiungere moduli extra per vedere immagini (170 milioni) o ascoltare audio (300 milioni).

In parole povere

In parole povere: puoi usare solo i "pezzi" che ti servono, risparmiando spazio e memoria.

Funziona offline, anche sul telefono

EmbeddingGemma 2 usa una tecnica chiamata Matryoshka Representation Learning. Permette di ridurre la dimensione dei dati fino a 6 volte, risparmiando spazio di archiviazione.

Secondo Google DeepMind, su un Google Pixel 11 Pro il modello usa solo circa 191MB di RAM per il solo testo. Per la versione completa multimodale servono circa 567MB.

Il modello ha anche una finestra di contesto più ampia: 8.000 token. È quattro volte più grande rispetto alla prima versione.

Questo gli permette di analizzare fino a 5,5 minuti di audio, oppure 29 immagini, direttamente sul dispositivo.

In parole povere

In parole povere: il modello gira dentro al telefono, senza bisogno di internet, e occupa poca memoria.

A cosa serve nella pratica

Il modello può aiutare a trovare un clip video specifico partendo da un memo vocale. Può anche cercare dentro ore di registrazioni audio, usando una semplice frase di testo.

Google DeepMind spiega che EmbeddingGemma 2 è utile anche per cercare codice informatico. Il miglioramento sul benchmark MTEB Code è di 9,92 punti, da 68,76 a 78,68.

Questo lo rende adatto a indicizzare codebase in locale, fare ricerca semantica nel codice, e aiutare agenti di programmazione a recuperare informazioni.

Il modello può essere usato insieme a Gemma 4 per creare sistemi di ricerca intelligente (RAG) che funzionano interamente offline.

Cosa cambia per te

Cosa cambia per te

Cosa significa questa novità per chi usa app o sviluppa tecnologia:

In una riga

Un modello piccolo che capisce testo, immagini, video e audio, tutto dentro al tuo telefono.

Fonti

Articolo divulgativo: i fatti sono rielaborati con parole nostre a partire dalle fonti citate. Per i dettagli ufficiali rimandiamo alle pagine originali. Aggiornato al 7 ottobre 2026.

Immagini: sono illustrazioni generate con l'intelligenza artificiale e portano incisa l'icona ufficiale UE «AI GENERATED» (art. 50 AI Act). Non sono fotografie di fatti realmente accaduti e le persone ritratte non esistono: nessuna immagine raffigura persone reali citate nell'articolo.

Domande frequenti

Cosa fa di diverso EmbeddingGemma 2 rispetto alla prima versione?

Capisce anche immagini, video e audio, non solo testo. Prima gestiva solo il testo.

Serve internet per usarlo?

No. Secondo Google DeepMind, funziona offline, direttamente sul dispositivo.

Ti interessa Gemini?

Tutti gli articoli Gemini →

Continua a leggere · Ultime uscite

Tutte le novità →

Le novità sull'IA, una volta a settimana

Un'email breve con le notizie sull'IA che contano davvero, verificate alla fonte. Niente spam, disiscrizione con un clic.