Nyhet

Google DeepMind lanserar EmbeddingGemma 2 – öppen multimodal embeddingmodell för mobiler

✍ tolvers.se-redaktionen Publicerad: 6 oktober 2026 ⏱ 3 min läsning

Google DeepMind presenterade den 6 oktober 2026 EmbeddingGemma 2, en öppen och lätt embeddingmodell som hanterar text, bild, ljud, video och kod i ett gemensamt vektorrum. Modellen har 740 miljoner parametrar, bygger på Gemma 4 och släpps under Apache 2.0-licens. Enligt Google DeepMind är den den mest kapabla modellen för multimodala embeddings direkt på enheten.

Det viktigaste i korthet

• EmbeddingGemma 2 har 740 miljoner parametrar, bygger på Gemma 4-arkitekturen och släpps under Apache 2.0-licens.

• Modellen kopplar ihop text, bilder, ljud, video och kod i ett gemensamt embedding-rum.

• Kontextfönstret är 8K token, fyra gånger större än i första versionen. Det motsvarar upp till 5,5 minuter ljud, 29 bilder eller 58 videobildrutor.

• Enligt Google DeepMind ökar resultatet i MTEB Code från 68,76 till 78,68, alltså 9,92 poäng.

• Med kvantisering krävs cirka 191 MB aktivt RAM för enbart text och cirka 567 MB för hela den multimodala modellen på en Google Pixel 11 Pro.

• Modellvikterna finns på Hugging Face och Kaggle. Tillgänglighet i Gemini Enterprise Agent Platform Model Garden anges som kommande.

Vad har hänt

Google DeepMind lanserade EmbeddingGemma 2 den 6 oktober 2026. En embeddingmodell omvandlar innehåll till vektorer som gör det möjligt att söka och koppla ihop information utifrån betydelse. Första EmbeddingGemma kom förra året och hanterade bara text. Enligt bolaget har den laddats ned över 20 miljoner gånger och använts för sökverktyg på enheten och integritetsvänliga RAG-flöden.

Nyheten är att modellen nu är multimodal. Den kan till exempel hitta ett visst videoklipp utifrån ett röstmemo, eller söka igenom timmar av ljudinspelningar med en textfråga. Allt hanteras av en enda modell.

Modellen är modulär. Enligt Google DeepMind krävs så lite som 270 miljoner parametrar för textarbete. Valfria bildkodare (170 miljoner) och ljudkodare (300 miljoner) lägger till fullt multimodalt stöd. Med Matryoshka Representation Learning kan utvecklare korta av vektorerna från 768 till 512, 256 eller 128 dimensioner. Det ger upp till sex gånger mindre lagringsutrymme i lokala vektordatabaser.

Google DeepMind uppger att modellen är bäst i sin storlek bland multimodala embeddingmodeller under 1 miljard parametrar, bland annat i testerna MTEB Code och MAEB (Massive Audio Embedding Benchmark). Den ska också matcha eller slå flera större modeller i text-, bild- och ljuduppgifter, och till och med vissa specialistmodeller som är mer än dubbelt så stora. Den flerspråkiga textprestandan anges vara i nivå med föregångaren. Kodförbättringen lyfts fram som relevant för lokal kodindexering, semantisk kodsökning och sökning för kodagenter.

Eftersom modellen delar textuppdelare (tokenizer) och ljudkodare med Gemma 4 kan de köras tillsammans i ett flöde med lägre sammanlagd minnesanvändning, enligt bolaget. Då kan man bygga RAG-flöden på enheten som förstår komplex multimodal data.

Google visar modellen i Google AI Edge Gallery (Instant Media Search och Video Moments Finder) och i appen Google AI Edge Foresight. Via MediaPipe Decision Task API kan man bygga beslutsmotorer för klassificering, routing och prediktion. För utveckling nämns MediaPipe, LiteRT, transformers.js, WebGPU, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio och Qdrant. Unsloth har tagit fram guide för finjustering.

Vad det betyder för dig i Sverige

Källan tar inte upp Sverige specifikt. Apache 2.0 är dock en licens som tillåter kommersiell användning, och modellvikterna kan hämtas via Hugging Face och Kaggle. Svenska utvecklare kan därför i princip bygga sök- och RAG-funktioner som körs helt lokalt. Enligt Google DeepMind hjälper lokal körning till att skydda data, minskar fördröjningen och gör det möjligt att söka offline. Det kan vara relevant för appar som hanterar känsligt material. Källan nämner inga regionala begränsningar, men säger heller inget om svenska användare.

Det här vet vi inte än

• Hur bra modellen fungerar på svenska anges inte, bara att den flerspråkiga textprestandan är i nivå med föregångaren.

• Prestandapåståendena kommer från Google DeepMind. Oberoende tester redovisas inte.

• Det finns ingen uppgift om när modellen blir tillgänglig i Model Garden, bara att det sker snart.

• Minneskraven är angivna för Google Pixel 11 Pro. Källan redovisar inga siffror för andra enheter.

• Några kostnader för användning via molntjänster nämns inte.

Källor och vidare läsning