NVIDIA hat Nemotron 3 Nano Omni vorgestellt, ein offenes multimodales Modell, das Vision, Audio und Sprache in einem einzigen System vereint. Damit sollen AI-Agent-Systeme nicht mehr zwischen getrennten Modellen für Bild-, Sprach- und Textverarbeitung wechseln müssen, was laut NVIDIA Zeitverlust, Kontextbrüche und zusätzliche Ungenauigkeiten reduziert.
Das Modell basiert auf einer 30B-A3B-Hybrid-Mixture-of-Experts-Architektur mit integrierten Vision- und Audio-Encodern. NVIDIA beschreibt Nemotron 3 Nano Omni als effizientes offenes Omni-Modell mit führender Genauigkeit und niedrigen Kosten. Nach Angaben des Unternehmens erreicht es bei gleicher Interaktivität einen bis zu neunfach höheren Durchsatz als andere offene Omni-Modelle und führt sechs Leaderboards für komplexe Document Intelligence sowie Video- und Audioverständnis an.
Für agentische Systeme ist Nemotron 3 Nano Omni als Wahrnehmungskomponente für multimodale Aufgaben vorgesehen. Genannt werden unter anderem Computer-Use-Agents, die grafische Benutzeroberflächen navigieren und Bildschirmzustände über die Zeit verstehen, sowie Anwendungen für Document Intelligence mit PDFs, Tabellen, Diagrammen, Screenshots und gemischten Eingaben. Auch Audio- und Videoverständnis für Kundenservice-, Forschungs- und Monitoring-Workflows zählt zu den beschriebenen Einsatzfeldern, bei denen gesprochene, gezeigte und dokumentierte Informationen in einem gemeinsamen Reasoning-Stream zusammengeführt werden sollen.
NVIDIA nennt als Beispiel H Company, deren aktueller Computer-Use-Agent mit Nemotron 3 Nano Omni in einer nativen Eingabeauflösung von 1920×1080 Pixeln arbeitet. In vorläufigen Auswertungen auf dem OSWorld-Benchmark habe diese Integration einen deutlichen Fortschritt bei der Navigation komplexer grafischer Oberflächen gezeigt und die Fähigkeit des Modells zur Verarbeitung sehr hochauflösender Bilder genutzt.
Das Modell kann laut NVIDIA in agentischen Workflows zusammen mit proprietären Cloud-Modellen oder anderen offenen NVIDIA-Nemotron-Modellen wie Nemotron 3 Super für häufige Ausführungsschritte oder Nemotron 3 Ultra für komplexe Planung eingesetzt werden. Auch proprietäre Modelle anderer Anbieter werden als mögliche Kombination genannt, etwa für Sub-Agents in Workflows rund um Computer Use, Document Intelligence und Audio-Video-Reasoning.
Nemotron 3 Nano Omni wird mit offenen Gewichten, Datensätzen und Trainingstechniken veröffentlicht. NVIDIA hebt hervor, dass Organisationen damit Transparenz und Kontrolle für Anpassung und Bereitstellung erhalten. Für Anpassung, Evaluierung und Optimierung auf domänenspezifische Anwendungsfälle verweist das Unternehmen auf Werkzeuge wie NVIDIA NeMo. Durch die offene Modellfamilie sollen zudem Deployments in Umgebungen möglich sein, die regulatorische, souveränitätsbezogene oder datenlokalisierungsbezogene Anforderungen erfüllen.
Zur Verfügbarkeit nennt NVIDIA Hugging Face, OpenRouter und build.nvidia.com, wo das Modell als NVIDIA-NIM-Microservice angeboten wird. Außerdem soll es über ein breites Ökosystem von NVIDIA-Cloud-Partnern, Inference-Plattformen und Cloud-Service-Providern verfügbar sein. Die offene, leichtgewichtige Architektur soll konsistente Deployments von lokalen Systemen wie NVIDIA Jetson, NVIDIA DGX Spark und DGX Station bis in Rechenzentrums- und Cloud-Umgebungen unterstützen.
Zu den bereits genannten Anwendern von Nemotron 3 Nano Omni zählen Aible, Applied Scientific Intelligence (ASI), Eka Care, Foxconn, H Company, Palantir und Pyler. Dell Technologies, Docusign, Infosys, K-Dense, Lila, Oracle und Zefr evaluieren das Modell nach Angaben von NVIDIA.
