EmbeddingGemma 2: il modello aperto che capisce testo, foto e audio
Google ha presentato EmbeddingGemma 2. È un modello leggero e gratuito. Capisce testo, immagini, video e audio insieme. Funziona anche senza internet, dentro al telefono.
In breve
- EmbeddingGemma 2 è un modello aperto di Google DeepMind.
- Unisce testo, codice, immagini, video e audio in un unico sistema.
- È leggero: funziona anche su un telefono, senza internet.
Cos'è EmbeddingGemma 2
Google DeepMind ha lanciato EmbeddingGemma 2. È il successore di EmbeddingGemma, uscito l'anno scorso.
Il primo modello aveva avuto molto successo. Ha superato 20 milioni di download, secondo Google DeepMind.
Il nuovo modello fa un passo in più. Non lavora solo con il testo.
Capisce anche codice, immagini, video e audio. Li trasforma tutti in un unico linguaggio comune, chiamato "embedding".
In parole povere: è come un traduttore universale. Prende foto, suoni, video e testo. Li mette tutti sulla stessa "mappa" digitale, così il computer può confrontarli.

Un modello piccolo ma capace
EmbeddingGemma 2 ha 740 milioni di parametri. È costruito sull'architettura Gemma 4.
Ha una licenza Apache 2.0. Questo significa che le aziende possono usarlo liberamente, anche per scopi commerciali.
Secondo Google DeepMind, il modello ottiene i punteggi migliori tra i modelli multimodali con meno di un miliardo di parametri, chiamati "sub-1B". Il primato riguarda in particolare i benchmark MTEB Code e MAEB.
Riesce a battere o eguagliare modelli anche più grandi, su testo, immagini e audio.
Il modello è anche modulare. Per lavorare solo con testo, bastano 270 milioni di parametri.
Si possono aggiungere moduli extra per vedere immagini (170 milioni) o ascoltare audio (300 milioni).
In parole povere: puoi usare solo i "pezzi" che ti servono, risparmiando spazio e memoria.
Funziona offline, anche sul telefono
EmbeddingGemma 2 usa una tecnica chiamata Matryoshka Representation Learning. Permette di ridurre la dimensione dei dati fino a 6 volte, risparmiando spazio di archiviazione.
Secondo Google DeepMind, su un Google Pixel 11 Pro il modello usa solo circa 191MB di RAM per il solo testo. Per la versione completa multimodale servono circa 567MB.
Il modello ha anche una finestra di contesto più ampia: 8.000 token. È quattro volte più grande rispetto alla prima versione.
Questo gli permette di analizzare fino a 5,5 minuti di audio, oppure 29 immagini, direttamente sul dispositivo.
In parole povere: il modello gira dentro al telefono, senza bisogno di internet, e occupa poca memoria.
A cosa serve nella pratica
Il modello può aiutare a trovare un clip video specifico partendo da un memo vocale. Può anche cercare dentro ore di registrazioni audio, usando una semplice frase di testo.
Google DeepMind spiega che EmbeddingGemma 2 è utile anche per cercare codice informatico. Il miglioramento sul benchmark MTEB Code è di 9,92 punti, da 68,76 a 78,68.
Questo lo rende adatto a indicizzare codebase in locale, fare ricerca semantica nel codice, e aiutare agenti di programmazione a recuperare informazioni.
Il modello può essere usato insieme a Gemma 4 per creare sistemi di ricerca intelligente (RAG) che funzionano interamente offline.
Cosa cambia per te
Cosa significa questa novità per chi usa app o sviluppa tecnologia:
- Le app potranno cercare foto, video e audio insieme, non solo testo.
- I dati restano sul telefono: più privacy, meno bisogno di internet.
- Gli sviluppatori hanno un modello gratuito e leggero da usare liberamente.
Un modello piccolo che capisce testo, immagini, video e audio, tutto dentro al tuo telefono.
Fonti
Articolo divulgativo: i fatti sono rielaborati con parole nostre a partire dalle fonti citate. Per i dettagli ufficiali rimandiamo alle pagine originali. Aggiornato al 7 ottobre 2026.
Immagini: sono illustrazioni generate con l'intelligenza artificiale e portano incisa l'icona ufficiale UE «AI GENERATED» (art. 50 AI Act). Non sono fotografie di fatti realmente accaduti e le persone ritratte non esistono: nessuna immagine raffigura persone reali citate nell'articolo.
Domande frequenti
Cosa fa di diverso EmbeddingGemma 2 rispetto alla prima versione?
Capisce anche immagini, video e audio, non solo testo. Prima gestiva solo il testo.
Serve internet per usarlo?
No. Secondo Google DeepMind, funziona offline, direttamente sul dispositivo.





