NVIDIA hat Nemotron 3 Nano Omni als neues Modell der Nemotron-3-Familie vorgestellt. Das Modell bündelt multimodales Reasoning für visuelle, auditive und textuelle Eingaben in einem einzelnen offenen Modell und ist als Wahrnehmungs- und Kontext-Sub-Agent für agentische Systeme gedacht. Ziel ist es, getrennte Vision-, Audio- und Text-Stacks zu ersetzen, um Orchestrierungskomplexität, Inference-Kosten und Inkonsistenzen zwischen Modalitäten zu verringern.
Nach Angaben von NVIDIA erreicht Nemotron 3 Nano Omni Bestwerte auf Dokumenten-Benchmarks wie MMlongbench-Doc und OCRBenchV2 sowie bei Video- und Audioverständnis in WorldSense, DailyOmni und VoiceBench. Im offenen Benchmark MediaPerf, der Qualität, Kosten und Durchsatz auf realen Mediendaten und Produktionsaufgaben vergleicht, erreiche das Modell über alle Aufgaben hinweg den höchsten Durchsatz und beim Video-Level-Tagging die niedrigsten Inference-Kosten.
Die Architektur basiert auf einem 30B-A3B Hybrid Mixture-of-Experts-Modell. Dabei werden je nach Aufgabe und Modalität nur die jeweils benötigten Experten aktiviert. NVIDIA beschreibt das Modell als leichtgewichtiges 30B-A3B-System für Cross-Modality-Reasoning mit hohem Durchsatz. Es unterstützt Text-, Bild-, Video- und Audioeingaben nativ und hält einen gemeinsamen multimodalen Kontext über Agenten-Loops hinweg aufrecht.
Der Hybrid-MoE-Kern kombiniert Mamba-Layer für Sequenz- und Speichereffizienz mit Transformer-Layern für präzises Reasoning. Laut NVIDIA verbessert dieser Aufbau die Speicher- und Recheneffizienz um bis zu den Faktor 4. Für Videoverarbeitung nutzt das Modell 3D-Convolutions zur Erfassung zeitlicher Bewegung zwischen Frames sowie eine Efficient Video Sampling-Schicht, die visuelle Tokens mehrerer Frames für das LLM komprimiert. Für Audio verweist NVIDIA auf NVIDIA Parakeet als Encoderbasis und spezialisierte Datensätze jenseits reiner Transkription. Für visuelle Eingaben kommt unter anderem C-RADIOv4-H zum Einsatz, um hochauflösende Bilder effizient zu verarbeiten und OCR-Präzision auch auf Teilbereichen eines Bildes zu erhalten.
Für die Inference nennt NVIDIA hardwarebewusst optimierte Unterstützung auf NVIDIA-Ampere-, Hopper- und Blackwell-GPUs sowie für vLLM und NVIDIA TensorRT-LLM. Unterstützt werden FP8- und NVFP4-Quantisierung, effizientes Video-Sampling und NVIDIA-optimierte Kernel. Zusammen mit convolutional 3D-basierter temporal-spatial Verarbeitung soll dies niedrige, vorhersagbare Latenzen und geringere Rechenkosten von Workstations bis zu Rechenzentrums- und Cloud-Deployments ermöglichen.
In Benchmarks unter einem festen Interaktivitätsschwellenwert, bei dem die Reaktionsfähigkeit pro Nutzer konstant gehalten wird, berichtet NVIDIA für Video-Reasoning eine bis zu etwa 9,2-fach höhere effektive Systemkapazität im Vergleich zu alternativen offenen Omni-Modellen. Für Multi-Document-Reasoning nennt das Unternehmen bis zu etwa 7,4-fach höhere effektive Systemkapazität. Auf Blackwell-GPUs erreiche Nemotron 3 Nano Omni mit NVFP4-Quantisierung den höchsten Durchsatz unter offenen omnimodalen Modellen für Enterprise-Workloads mit komplexen Dokumenten, Long-Horizon-Reasoning und großen Video-Batches.
Das Training umfasst laut NVIDIA mehrere Stufen. Adapter- und Encoder-Training nutzt großskalige Daten über Dokumente, Screenshots, Audio und Video. Das Supervised Fine-Tuning wird als mehrstufige Pipeline mit NVIDIA Megatron-LM beschrieben, bei der zunächst Vision-Language- und Audio-Encoder eingebunden und anschließend die Kontextlänge von 16K über 49K auf 262K erweitert wird. Das Post-SFT-Reinforcement-Learning erfolgte laut NVIDIA über 25 Umgebungskonfigurationen mit NVIDIA NeMo Gym und NeMo RL sowie mehr als 2,3 Millionen Environment-Rollouts.
NVIDIA hebt die Offenheit des Modells hervor und stellt vollständige Gewichte, Datensätze und Trainingsrezepte in Aussicht. Die Modellgewichte sind auf Hugging Face verfügbar, zusätzlich soll das Modell als NVIDIA-NIM-Microservice bereitgestellt werden. Veröffentlicht werden auch Rezepte für Pre-Training, Post-Training und Evaluation sowie Cookbooks für vLLM, SGLang, NVIDIA TensorRT LLM und Dynamo. Für Fine-Tuning nennt NVIDIA unter anderem LoRA-SFT- und GRPO/MPO-Rezepte.
Auch die Datengrundlage wird detailliert beschrieben. Für Adapter- und Encoder-Training nennt NVIDIA rund 127 Milliarden Tokens über gemischte Modalitäten. Für das Post-Training auf realen Aufgaben werden rund 124 Millionen kuratierte Beispiele genannt. Hinzu kommen 20 RL-Datensätze über 25 Umgebungen für fünf neue multimodale Aufgaben, darunter Visual Grounding, Diagramm- und Dokumentenverständnis, vision-kritische STEM-Probleme, Videoverständnis und automatische Spracherkennung. Für das Post-Training bei komplexem Langdokumentverständnis wurden laut NVIDIA außerdem synthetische Daten mit NeMo Data Designer erzeugt; in das finale Trainingsgemisch flossen demnach rund 11,4 Millionen synthetische visuelle Frage-Antwort-Paare mit etwa 45 Milliarden Tokens ein.
Das Modell ist als Sub-Agent für größere Agentensysteme vorgesehen und soll sich mit Ausführungs- und Planungsmodellen wie NVIDIA Nemotron 3 Super und NVIDIA Nemotron 3 Ultra kombinieren lassen. NVIDIA nennt als Einsatzfelder unter anderem Dokumenten-Reasoning, Computer Use, Long-Horizon-Workflows und Videoverständnis. In Verbindung mit OpenShell und NemoClaw beschreibt das Unternehmen zudem lokale und datenschutzorientierte Videoverarbeitung, bei der Videodaten die lokale Infrastruktur nicht verlassen.
Nemotron 3 Nano Omni ist laut NVIDIA unter anderem über Hugging Face, OpenRouter, SGLang, vLLM sowie lokale Laufzeitumgebungen wie Ollama, llama.cpp, LM Studio und Unsloth verfügbar. Genannt werden außerdem verschiedene Cloud-, Inference- und Infrastrukturpartner sowie eine geplante Verfügbarkeit in Microsoft Foundry.
