DeepSeek hat mit DeepSeek-V4-Pro und DeepSeek-V4-Flash die vierte Generation seiner Flaggschiffmodelle vorgestellt. Beide Modelle sind auf effiziente Inferenz mit einem Kontextfenster von bis zu 1 Million Tokens ausgelegt und zielen auf Anwendungsfälle wie Long-Context-Coding, Dokumentenanalyse, Retrieval und agentische KI-Workflows.
DeepSeek-V4-Pro ist das größte Modell der Familie mit insgesamt 1,6 Billionen Parametern und 49 Milliarden aktiven Parametern. DeepSeek-V4-Flash ist mit 284 Milliarden Parametern und 13 Milliarden aktiven Parametern kleiner ausgelegt und für schnellere sowie effizientere Workloads gedacht.
Die V4-Familie baut auf der DeepSeek-MoE-Architektur auf und legt einen stärkeren Schwerpunkt auf die Optimierung der Attention-Komponente der Transformer-Architektur. Laut NVIDIA sollen diese Änderungen die Inferenz-FLOPs pro Token gegenüber DeepSeek-V3.2 um 73 Prozent senken und die Speicherlast des KV-Cache um 90 Prozent reduzieren.
Als zentrale architektonische Lösung beschreibt NVIDIA eine Hybrid Attention aus zwei Komponenten. Compressed Sparse Attention (CSA) nutzt dynamische Sequenzkompression, um KV-Einträge zu komprimieren und damit den Speicherbedarf des KV-Cache zu verringern; anschließend wird DeepSeek Sparse Attention (DSA) verwendet, um die Attention-Matrizen zu sparsifizieren und den Rechenaufwand zu senken. Heavily Compressed Attention (HCA) komprimiert deutlich aggressiver, indem KV-Einträge über Gruppen von Tokens hinweg zu einem einzigen komprimierten Eintrag zusammengefasst werden, was den KV-Cache weiter verkleinert.
NVIDIA ordnet diese Architektur als Ausrichtung auf Multi-Turn- und Long-Context-Inferenz sowie agentische Systeme ein. In solchen Workflows tragen Agenten nicht nur Prompt und Antwort, sondern auch Systemanweisungen, Tool-Ausgaben, abgerufenen Kontext, Code, Logs, Speicher und mehrstufige Reasoning-Spuren mit. Mit größeren Kontextfenstern werden Attention und KV-Cache dabei zu zentralen Engpässen.
Für diese Lastklasse verweist NVIDIA auf die Blackwell-Plattform. In Out-of-the-box-Tests mit DeepSeek-V4-Pro auf NVIDIA GB200 NVL72 wurden nach Unternehmensangaben mehr als 150 Tokens pro Sekunde und Nutzer erreicht. Zusätzlich habe das NVIDIA-Team mit dem Day-0-Blackwell-B300-Recipe von vLLM eine Momentaufnahme der Out-of-the-box-Performance über das Pareto erstellt. Weitere Optimierungen nennt NVIDIA für Dynamo, NVFP4, optimierte CUDA-Kernels und weitergehende Parallelisierungstechniken.
Entwickler können DeepSeek V4 über GPU-beschleunigte Endpoints auf build.nvidia.com im Rahmen des NVIDIA Developer Program nutzen. Die gehosteten Endpoints sind als schneller Weg zum Prototyping mit den aktuellen Modellen gedacht, bevor ein Wechsel auf Self-Hosting erfolgt. DeepSeek V4 ist außerdem ab dem ersten Tag über NVIDIA NIM zum Download verfügbar, um Long-Context-Coding, Dokumentenanalyse und agentische Workflows über vertraute API-Muster bereitzustellen.
Für das Serving nennt NVIDIA mehrere Rezepte. SGLang bietet drei primäre Serving-Profile für DeepSeek-V4 auf NVIDIA Blackwell und Hopper, abgestimmt auf niedrige Latenz, ausgewogene Latenz und Durchsatz sowie maximalen Durchsatz. Hinzu kommen spezielle Rezepte für Long-Context-Workloads und für die Entkopplung von Prefill und Decode. vLLM stellt Single-Node- und Multinode-Serving-Setups für NVIDIA Blackwell und Hopper bereit, darunter Multinode-Rezepte für Prefill/Decode-Disaggregation mit Skalierung auf mehr als 100 GPUs sowie Unterstützung für Tool Calling, Reasoning und Speculative Decoding.
Als Einsatzmöglichkeiten für Agenten nennt NVIDIA mehrere eigene Werkzeuge und Blueprints. NVIDIA NemoClaw kann in einer OpenShell-Umgebung mit DeepSeek V4 als LLM konfiguriert werden. Das NVIDIA AI-Q Blueprint auf Basis von LangChain Deep Agents lässt sich für Orchestrierung und Planung um DeepSeek V4 erweitern. Der NVIDIA Data Explorer Agent, der laut NVIDIA im DABstep-Benchmark den ersten Platz erreicht hat, kann ebenfalls auf DeepSeek V4 umgestellt werden. Zudem nennt NVIDIA ein Open-Source-Recipe zum Post-Training von DeepSeek V4 Flash mit der Bibliothek NVIDIA NeMo AutoModel; Unterstützung für Fine-Tuning der Pro-Variante sei angekündigt.
NVIDIA beschreibt darüber hinaus verschiedene Integrationspfade von Rechenzentrums-Deployments auf Blackwell über verwaltete NIM-Microservices bis zu Fine-Tuning-Workflows. Zum Einstieg verweist das Unternehmen auf DeepSeek-V4 bei Hugging Face sowie auf den Test von DeepSeek-V4-Pro über build.nvidia.com.
