Google hat mit EmbeddingGemma 2 ein neues multimodales Einbettungsmodell präsentiert, das speziell für den lokalen Betrieb direkt auf Endgeräten konzipiert ist.
Das System basiert auf der Gemma-4-Architektur, umfasst 740 Millionen Parameter und wird unter der freien Apache-2.0-Lizenz bereitgestellt, wie das Unternehmen in einem Bericht vom 06.10.2026 mitteilte. Ziel der Veröffentlichung ist es, anspruchsvolle KI-Verarbeitungen ohne den Rückgriff auf externe Cloud-Infrastrukturen zu ermöglichen.
Geringer Speicherbedarf und multimodale Vektorräume
Ein zentrales Merkmal des Modells liegt in seiner Ressourceneffizienz bei mobilen Einsätzen. Auf einem Google Pixel 11 Pro liegt der Arbeitsspeicherbedarf für die reine Textverarbeitung bei rund 191 Megabyte. Bei der vollständigen multimodalen Nutzung benötigt das Modell etwa 567 Megabyte RAM.
EmbeddingGemma 2 vereint Text, Bild, Video und Audio in einem gemeinsamen Vektorraum. Auf der Grafikeinheit eines MacBook M5 Pro erreicht das System bei visuellen Einbettungen eine Verarbeitungszeit von 37,3 Millisekunden pro Bild, was einer Rate von rund 26,9 Bildern pro Sekunde entspricht.
Darüber hinaus erlaubt das Modell sogenanntes Zero-Shot-Intent-Routing ohne zusätzliches Feintuning innerhalb von Millisekunden. Im Rahmen der MediaPipe Decision Task liegt die Antwortzeit bei 500 Optionen pro Zug im Schach bei unter 100 Millisekunden. Das zugehörige Werkzeug MediaPipe Embedder erzeugt standardmäßig Vektoren mit 768 Dimensionen, unterstützt alternativ aber auch 128 bis 512 Dimensionen.
Integration in mobile Plattformen und Desktop-Software
Wer die neuen Möglichkeiten lokaler KI auf Apple-Geräten voll ausschöpfen möchte, findet in diesem kostenlosen Ratgeber die entscheidenden Grundlagen für den perfekten Start. So werden Sie in kürzester Zeit zum Mac-Profi – völlig kostenlos
Die Technologie wird über verschiedene Schnittstellen bereitgestellt. Aktuell steht EmbeddingGemma 2 über die Google AI Edge Gallery für Android und iOS sowie über die Desktop-Anwendung Foresight für Mac zur Verfügung. Ein dedizierter ML-Kit-Service für Android ist für die kommenden Wochen geplant.
Mit Google AI Edge Foresight demonstriert der Konzern zugleich ein konkretes Einsatzszenario für die lokale Verarbeitung. Die experimentelle Mac-Anwendung ist auf Apple-Silicon-Prozessoren optimiert und dient der automatisierten Erfassung von Inhalten.
Das Programm transkribiert Systemaudio sowie Mikrofonsignale aus Plattformen wie Google Meet, Zoom oder aus Präsenzmeetings direkt auf dem Gerät. Handschriftliche Notizen und Stichpunkte lassen sich auf Basis des Transkripts zu vollständigen Protokollen ausbauen.
Vollständige Datenverarbeitung auf dem Endgerät
Um die effizienten neuen Funktionen Ihres Rechners noch produktiver im Alltag zu nutzen, helfen die richtigen Tastenkombinationen für einen schnelleren Workflow. Mac-Experte verrät: Mit diesen 19 Shortcuts sparen Sie jeden Tag messbar Zeit
Foresight indiziert neben lokalen Dateien auch Inhalte aus Google Drive, darunter Projektordner, Referenzmaterialien, Diagramme und Kalenderdaten. Unterstützt werden unter anderem PDF-Dateien, Google Docs, Dokumente aus Microsoft Office, Text- und Markdown-Dateien sowie Web-Lesezeichen, die sich über Labels und Kategorien filtern lassen.
Die Anwendung bietet einen Retrieval-Chat und Live-Unterstützung mit exakten Quellenangaben. Sämtliche Inferenzprozesse laufen lokal über Modelle der Gemma-Reihe, sodass keine Daten an Cloud-Server übertragen werden und keine Abonnementgebühren anfallen.
Ergänzt wird das Portfolio lokaler Desktop-Werkzeuge durch weitere Mac-Anwendungen von Google. Dazu zählen AI Edge Eloquent für die reine Offline-Transkription sowie die AI Edge Gallery, die Demonstrationen für unmittelbare Mediensuche und das Auffinden bestimmter Videomomente beinhaltet.

