Google und NVIDIA haben die neuesten offenen Modelle der Gemma-4-Familie für NVIDIA-GPUs optimiert. Die Unterstützung reicht von Rechenzentrums-Deployments bis zu NVIDIA-RTX-PCs und -Workstations, dem persönlichen KI-Supercomputer NVIDIA DGX Spark sowie NVIDIA Jetson Orin Nano Edge-AI-Modulen.
Die neuen Gemma-4-Varianten umfassen E2B, E4B, 26B und 31B. Sie sind für effiziente Ausführung auf unterschiedlichen Geräten ausgelegt und decken Aufgaben wie Reasoning, Coding, strukturierte Tool-Nutzung per Function Calling sowie multimodale Eingaben mit Bild, Video und Audio ab. Hinzu kommen interleaved multimodale Prompts mit Text und Bildern in beliebiger Reihenfolge sowie Unterstützung für mehr als 35 Sprachen; vortrainiert wurden die Modelle laut NVIDIA auf über 140 Sprachen.
Die Modelle E2B und E4B sind auf besonders effiziente Inferenz mit niedriger Latenz am Edge ausgerichtet. Sie sollen vollständig offline und mit nahezu null Latenz auf vielen Geräten laufen, darunter Jetson-Nano-Module. Die 26B- und 31B-Modelle zielen auf leistungsstarkes Reasoning und entwicklerorientierte Workflows und sind damit für agentische KI vorgesehen. Laut NVIDIA laufen sie effizient auf NVIDIA-RTX-GPUs und DGX Spark und eignen sich für Entwicklungsumgebungen, Coding-Assistenten und agentengesteuerte Abläufe.
Als Beispiel für lokale agentische KI nennt NVIDIA OpenClaw. Die aktuellen Gemma-4-Modelle sind damit kompatibel und können lokale Agenten unterstützen, die Kontext aus persönlichen Dateien, Anwendungen und Workflows beziehen, um Aufgaben zu automatisieren.
Für den lokalen Einsatz hat NVIDIA nach eigenen Angaben mit Ollama und llama.cpp zusammengearbeitet. Gemma 4 lässt sich lokal über Ollama ausführen oder über llama.cpp mit dem Gemma-4-GGUF-Checkpoint auf Hugging Face. Unsloth bietet außerdem Unterstützung zum Start mit optimierten und quantisierten Modellen für lokales Fine-Tuning und Deployment über Unsloth Studio.
NVIDIA führt die Leistung auf den eigenen GPUs auf Tensor Cores zurück, die Inferenz mit höherem Durchsatz und geringerer Latenz für lokale Ausführung beschleunigen sollen. Der CUDA-Software-Stack soll dabei breite Kompatibilität mit gängigen Frameworks und Tools sichern, sodass neue Modelle ohne umfangreiche zusätzliche Optimierung auf Systemen vom Jetson Orin Nano bis zu RTX-PCs, Workstations und DGX Spark eingesetzt werden können.
Im weiteren Umfeld verweist NVIDIA auf zusätzliche Ankündigungen zu offenen Modellen für lokale Agenten, darunter NVIDIA Nemotron 3 Nano 4B, Nemotron 3 Super 120B sowie Optimierungen für Qwen 3.5 und Mistral Small 4. Außerdem nennt das Unternehmen NemoClaw als Open-Source-Stack zur Optimierung von OpenClaw auf NVIDIA-Geräten mit Fokus auf mehr Sicherheit und Unterstützung lokaler Modelle. Erwähnt wird zudem Accomplish FREE, eine kostenlose Version eines Open-Source-Desktop-Agenten, der offene Modelle lokal auf NVIDIA-GPUs ausführt und Workloads zwischen lokaler RTX-Hardware und Cloud verteilt.
