NVIDIA stellt Nemotron 3 Nano Omni für lange multimodale Kontexte vor

NVIDIA hat mit Nemotron 3 Nano Omni ein neues Verständnismodell vorgestellt, das Text, Bild, Video und Audio in einem gemeinsamen System verarbeitet. Das Modell ist für Dokumentenanalyse, Multiple-Image-Reasoning, Automatic Speech Recognition, langes Audio- und Videoverständnis, agentische Computernutzung und allgemeines Reasoning ausgelegt.

Nemotron 3 Nano Omni erweitert die Nemotron-Multimodalreihe von einem Vision-Language-System zu einem breiteren Text-, Bild-, Video- und Audiomodell. Laut den genannten Benchmarks erreicht es hohe Genauigkeit bei komplexer Dokumentenintelligenz, darunter MMlongbench-Doc und OCRBenchV2, sowie bei Video- und Audioaufgaben auf WorldSense, DailyOmni und VoiceBench. Auf MediaPerf wird es als kosteneffizientestes offenes Modell für Videoverständnis eingeordnet.

Das Modell zielt auf fünf Klassen von Arbeitslasten: lange und komplexe Dokumente mit Layout, Tabellen, Formeln und seitenübergreifenden Bezügen; Sprachverständnis und Transkription in unterschiedlichen Audiobedingungen; gemeinsame Analyse von Audio und visuellen Inhalten in Videos; agentische Nutzung grafischer Oberflächen; sowie Reasoning-intensive Aufgaben über lange Kontexte und mehrere Modalitäten hinweg. Für Dokumente nennt NVIDIA Kontexte von mehr als 100 Seiten.

Architektonisch nutzt Nemotron 3 Nano Omni ein einheitliches Encoder-Projector-Decoder-Design. Als Sprach-Backbone dient Nemotron 3 Nano 30B-A3B, kombiniert mit dem Vision-Encoder C-RADIOv4-H und dem Audio-Encoder Parakeet-TDT-0.6B-v2. Die modalspezifischen Encoder werden über leichte 2-Layer-MLP-Projectors in den gemeinsamen Embedding-Raum eingebunden, sodass Vision-, Audio- und Text-Tokens gemeinsam verarbeitet werden.

Das Backbone kombiniert 23 Mamba-Selective-State-Space-Layer für effiziente Verarbeitung langer Kontexte, 23 MoE-Layer mit 128 Experten, Top-6-Routing und einem Shared Expert sowie 6 Grouped-Query-Attention-Layer. Laut NVIDIA soll diese Kombination langes multimodales Reasoning ermöglichen, ohne die globale Interaktion zu verlieren.

Auf der Bildseite ersetzt das Modell die frühere Tiling-Strategie durch dynamische Auflösungsverarbeitung im nativen Seitenverhältnis. Pro Bild werden zwischen 1.024 und 13.312 visuelle 16-x-16-Patches verwendet, was bei quadratischen Bildern etwa 512 x 512 bis 1840 x 1840 entspricht. Diese Flexibilität ist für hochauflösende Dokumente, Tabellen, Folien, Forschungsabbildungen, Screenshots und GUI-Layouts vorgesehen.

Für Video verwendet das Modell einen Conv3D-Tubelet-Embedding-Pfad. Dabei werden jeweils zwei aufeinanderfolgende Frames vor dem ViT zu einem Tubelet zusammengeführt, wodurch sich die Zahl der Vision-Tokens halbiert. Zusätzlich wird zur Inferenz EVS eingesetzt, das nach dem Vision-Encoder redundante Video-Tokens entfernt: Das erste Frame bleibt vollständig erhalten, bei den folgenden Frames werden nur dynamische Tokens beibehalten, während statische Bereiche verworfen werden. NVIDIA beschreibt dies als Kombination aus Kompression, geringerer Latenz und höherem Durchsatz bei erhaltener Genauigkeit.

Die Audioseite basiert auf Parakeet-TDT-0.6B-v2 und ist über einen eigenen 2-Layer-MLP-Projector angebunden. Audio wird mit 16 kHz verarbeitet. Trainiert wurde mit Eingaben bis zu 1.200 Sekunden beziehungsweise 20 Minuten, während die maximale Kontextlänge des LLM laut NVIDIA mehr als fünf Stunden unterstützt. Damit soll Audio nativ innerhalb einer gemeinsamen multimodalen Sequenz mit Text- und Bildinformationen verarbeitet werden.

Beim Training setzt NVIDIA auf mehrstufige multimodale Ausrichtung und Kontexterweiterung, gefolgt von Preference Optimization und multimodalem Reinforcement Learning. Die SFT-Phasen liefen auf NVIDIA-H100-Systemen mit 32 bis 128 Nodes und nutzen Megatron-LM, Transformer Engine und Megatron Energon. Für das Post-SFT-Reinforcement-Learning kommen NeMo-RL und NeMo Gym mit einem Ray-basierten verteilten Setup über B200- und H100-Cluster zum Einsatz. NVIDIA schreibt, wesentliche Teile des Training-Codes als Open Source bereitzustellen.

Für Text-RL nennt NVIDIA mehrere Umgebungen in NeMo-Gym, in denen Folgen von Aktionen wie Tool Calling, Code-Erstellung und mehrteilige Planung anhand verifizierbarer Kriterien bewertet werden. Omni RL soll das Modell für gemeinsames Reasoning über Bilder, Video, Audio und Text trainieren. Die Verifier decken unter anderem Multiple-Choice, Mathematik, GUI-Grounding und ASR ab und enthalten bewusst auch nicht beantwortbare Fälle, damit das Modell bei unzureichender Evidenz eher enthält als halluziniert.

Beim Datensatz hebt NVIDIA eine stärkere Ausrichtung auf qualitativ hochwertiges multimodales Reasoning hervor. Die Aufgabenabdeckung wurde erweitert, und für komplexe Reasoning-Szenarien mit begrenzten öffentlichen Datensätzen wurde synthetische Daten erzeugt. Als Beispiel nennt das Unternehmen rund 11,4 Millionen synthetische QA-Paare mit etwa 45 Milliarden Tokens aus einem großen Bestand realer PDFs, erstellt mit NeMo Data Designer. Dieses Datenset wurde für das Post-Training von Long-Context-Dokumentenverständnis verwendet und führte laut NVIDIA zu einer 2,19-fachen Verbesserung der Gesamtgenauigkeit auf MMLongBench-Doc.

Bei der Effizienz nennt NVIDIA gegenüber anderen offenen Omni-Modellen mit gleicher Interaktivität eine 7,4-fach höhere Systemeffizienz für Multi-Dokument-Anwendungen und eine 9,2-fach höhere Systemeffizienz für Video-Anwendungen. Außerdem werden bis zu 9-fach höherer Durchsatz und 2,9-fache Single-Stream-Reasoning-Geschwindigkeit für multimodale Anwendungsfälle gegenüber Alternativen angegeben.

Die Beispiele im Bericht zeigen lange Dokumentenabfragen über mehr als 100 Seiten, gemeinsames Audio-Video-Reasoning, GUI-Agenten für Weboberflächen sowie Audioverständnis für Sprache, Umgebungsgeräusche und Musik. Die Checkpoints werden in BF16, FP8 und NVFP4 auf Hugging Face angeboten; für Architektur, Trainingsrezept, Datenpipelines und Benchmarks verweist NVIDIA auf den vollständigen technischen Bericht.

Quelle

Originalquelle: Hugging Face Blog

Aktuelle Artikel

spot_img

Ähnliche Artikel

Leave A Reply

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein

Bleib auf dem Laufenden – Hol dir die täglichen Nachrichten direkt in deinen Posteingang