EmbeddingGemma 2 doorzoekt foto’s, video en audio lokaal
3 mins read

EmbeddingGemma 2 doorzoekt foto’s, video en audio lokaal

Google DeepMind heeft op 6 oktober EmbeddingGemma 2 uitgebracht, een open embeddingmodel van 740 miljoen parameters dat tekst, code, beelden, video en audio in één gezamenlijke vectorruimte plaatst. Het model is gemaakt om op een telefoon of laptop te draaien, zonder dat gegevens naar de cloud hoeven. De gewichten staan onder de Apache 2.0-licentie op Hugging Face en Kaggle.

Wat een embeddingmodel doet

Een embeddingmodel schrijft geen tekst. Het zet inhoud om in een reeks getallen, een vector, zodat software kan berekenen welke stukken op elkaar lijken. Zoekfuncties en RAG-systemen, waarin een taalmodel eerst relevante documenten opzoekt, draaien op zulke vectoren. Bij EmbeddingGemma 2 belanden alle vijf soorten inhoud in dezelfde ruimte van 768 dimensies. Volgens Unite.AI kun je daardoor met een getypte omschrijving naar een foto zoeken, of met een spraakmemo een videofragment terugvinden.

De eerste EmbeddingGemma verscheen in 2025 en werkte alleen met tekst. Die versie is volgens Google zo’n 20 miljoen keer gedownload.

Vrouw op een parkbankje bladert door foto's op haar telefoon

Hoe het model is opgebouwd

De 740 miljoen parameters zijn verdeeld over een tekstmodel van 270 miljoen, een beeldencoder van 170 miljoen en een audio-encoder van 300 miljoen parameters. Het contextvenster groeide naar 8.192 tokens, vier keer zoveel als bij de eerste versie. Een afbeelding kost 280 tokens, een videoframe 140 en een seconde audio 25. In één invoer passen zo tot 29 afbeeldingen of ruim vijf minuten geluid.

Op MTEB Code scoort het model 78,68, bijna tien punten meer dan de voorganger. Voor zoeken in geluid (MSEB) haalt het 69,54. Google zegt dat het model sommige gespecialiseerde modellen verslaat die meer dan twee keer zo groot zijn. Onafhankelijke metingen zijn er nog niet.

Zuinig met geheugen en opslag

In de aankondiging op het Google Developers Blog staat dat de tekstversie op een Pixel 11 Pro met ongeveer 191 MB werkgeheugen toekan. Het volledige multimodale model gebruikt rond de 567 MB. Google heeft de gewichten met quantization-aware training teruggebracht naar INT4 en INT8. Op een MacBook met M5 Pro verwerkt de beeldencoder een afbeelding in 37,3 milliseconden.

Ook de vectoren zelf kunnen kleiner. Dankzij zogeheten Matryoshka-training mag een ontwikkelaar ze inkorten tot 512, 256 of 128 dimensies. Een miljoen vectoren op volle lengte nemen ongeveer 1,5 GB in beslag; op 128 dimensies is dat zo’n 250 MB. Daar staat kwaliteitsverlies tegenover. Bij 128 dimensies blijft volgens Google ongeveer 90 procent over voor tekst en code, en zo’n 75 procent voor multimodale zoekopdrachten.

Het model werkt met Transformers, sentence-transformers, llama.cpp, Ollama, LM Studio en vLLM, en in de browser via transformers.js en WebGPU. Ondersteuning in ML Kit voor Android volgt de komende weken, schrijft Google.

Wat betekent dit

Wie gevoelige documenten, foto’s of opnames doorzoekbaar wil maken, hoeft die niet meer naar een externe dienst te sturen. Een model van een halve gigabyte past op vrijwel elke recente laptop en op veel telefoons. Dat sluit aan bij wat we eerder zagen: open modellen doen inmiddels 56 procent van het AI-werk, Perplexity houdt gevoelige data op de Mac en PewDiePie bracht met Ajax een eigen lokale AI uit. Ook hardware als de Surface Laptop Ultra met RTX Spark is gebouwd voor modellen die op het apparaat zelf draaien.

De open vraag voor Nederlandse gebruikers is hoe goed EmbeddingGemma 2 met Nederlandstalige inhoud omgaat. Google noemt een meertalige MTEB-score van 61,36, maar geen cijfers per taal. Wie het wil weten, kan de gewichten nu downloaden en zelf testen op eigen materiaal.