NVIDIA beschreibt Enterprise Reference Architectures für On-Premises-AI-Factories

NVIDIA positioniert Enterprise Reference Architectures (Enterprise RAs) als Infrastrukturleitfaden für On-Premises-AI-Factories. Sie sollen festlegen, wie Compute, Netzwerk, Storage, Software und weitere Systemkomponenten zu einer produktionsreifen AI-Plattform zusammengeführt werden, um Integrationsrisiken zu verringern, die Bereitstellung zu beschleunigen und Leistung im größeren Maßstab planbar zu machen.

Der Beitrag ordnet Infrastruktur als eine der fünf Schichten von KI ein und beschreibt AI-Factories als Grundlage für agentische KI-Systeme mit Reasoning, Automatisierung und Echtzeitentscheidungen im großen Maßstab. Laut NVIDIA reicht dafür reine Rechenleistung nicht aus; benötigt werde eine skalierbare und vorhersagbare Basis für Orchestrierung, Datenbewegung und konsistente Performance vom Pilotprojekt bis zum Produktivbetrieb.

Die Enterprise RAs basieren auf NVIDIA-Certified Systems und entstehen in Zusammenarbeit mit Partnern. Sie geben durchgängige Vorgaben zu GPU-Anzahl, Speicher, Storage, Netzwerk und Observability sowie zur Full-Stack-Integration von Hardware, Software, Orchestrierung und Monitoring. Ergänzend nennt NVIDIA das Enterprise AI Factory validated design, das einen von NVIDIA validierten Full Stack aus NVIDIA-Software und Software von Ökosystempartnern für agentische KI-Workloads zusammenstellt.

Für den Einstieg nennt NVIDIA drei AI-Factory-Konfigurationen mit unterschiedlichen Größenordnungen, Infrastrukturanforderungen, Workloads und Leistungszielen: die NVIDIA RTX PRO AI Factory mit NVIDIA RTX PRO Servers, die NVIDIA HGX AI Factory mit HGX-basierten Systemen und die NVIDIA NVL72 AI Factory mit Rack-Scale-Systemen auf Basis der NVIDIA GB300 NVL72-Plattform. Organisationen könnten mit der Konfiguration beginnen, die zu den aktuellen Anforderungen passt, und später ausbauen; für reifere Umgebungen beschreibt NVIDIA auch gemischte Portfolios dieser Konfigurationen für Inference-, Training- und Visual-Computing-Workloads.

Drei Referenzkonfigurationen

Die NVIDIA RTX PRO AI Factory basiert auf der Referenzkonfiguration 2-8-5-200 (CPU-GPU-NIC – E/W Bandwidth). NVIDIA beschreibt sie als modulare und energieeffiziente Grundlage für Unternehmens-KI. Sie ist auf kleine bis mittlere Modell-Inference, Fine-Tuning, generative KI, Visual Computing und industrielle KI-Workloads mit NVIDIA RTX PRO Blackwell Server Edition GPUs ausgerichtet. Ein NVIDIA-Certified RTX PRO Server integriert bis zu acht GPUs in einem luftgekühlten Serverdesign. Cluster lassen sich laut Beitrag von einigen Dutzend bis zu Hunderten GPUs skalieren; als Beispiele werden 128- und 256-GPU-Cluster genannt. Spectrum-X-Ethernet und BlueField-3 sollen dabei die East-West-Kommunikation sowie den sicheren North-South-Datenfluss unterstützen.

Die NVIDIA HGX AI Factory wird als Standardgrundlage für größere Unternehmen beschrieben, die KI-Modelle im größeren Maßstab trainieren, feinabstimmen und bereitstellen. Sie basiert auf der Referenzkonfiguration 2-8-9-800 und ist auf kontinuierlichen Betrieb sowie eine ausgewogene Leistung zwischen Training und Inference ausgelegt. Als Kern nennt NVIDIA die HGX B300-Plattform mit acht NVIDIA Blackwell Ultra GPUs, verbunden über NVLink und NVSwitch der fünften Generation. Pro GPU werden bis zu 270 GB HBM3 genannt, pro Node bis zu 2,1 TB aggregierter GPU-Speicher. Als Ziel nennt der Beitrag Training und Fine-Tuning großer Sprachmodelle sowie AI-Inference für mittlere bis große Parametergrößen. Über Spectrum-X-Ethernet mit ConnectX-8 SuperNICs werden bis zu 800 Gb/s pro GPU für East-West-Kommunikation im Cluster angegeben.

Die NVIDIA NVL72 AI Factory beschreibt NVIDIA als Rack-Scale-Plattform für Modelle mit Billionen Parametern und KI-Reasoning-Systeme. Sie basiert auf dem NVIDIA GB300 NVL72-System und soll Leistung pro Rack sowie Effizienz bei Compute, Speicher und Netzwerk maximieren. Das flüssigkeitsgekühlte System kombiniert 36 Grace CPUs und 72 Blackwell Ultra GPUs, die über NVLink der fünften Generation verbunden sind. Laut Beitrag kann dabei jede GPU mit jeder anderen GPU über ein einheitliches NVLink-Fabric kommunizieren, sodass das Rack als zusammenhängende Compute-Domäne arbeitet. ConnectX-8 SuperNICs und BlueField DPUs sollen East-West- und North-South-Datenverkehr entsprechend unterstützen.

Partner, Validierung und Einsatz

NVIDIA verweist darauf, dass die architektonische Grundlage durch validierte Implementierungen von Systempartnern ergänzt wird. Partnerlösungen, die auf Enterprise RAs aufbauen, werden demnach vom NVIDIA Design Review Board anhand vorgegebener Kriterien geprüft. Einige Partner validieren einzelne Schichten des Stacks, andere vollständige End-to-End-Systeme über Hardware, Software und Netzwerk hinweg. Erfüllte Designs werden als von NVIDIA empfohlene Lösungen geführt; eine aktuelle Liste verweist NVIDIA auf der Dokumentationsseite zu Enterprise RAs.

Als Nutzen nennt der Beitrag unter anderem weniger Unsicherheit bei Infrastrukturentscheidungen, weniger Redesign-Zyklen und operativen Aufwand, kürzere Bereitstellungszeiten, bessere Auslastung und langfristige TCO sowie hohe Verfügbarkeit und Performance mit Enterprise Support. In Kombination mit der Software-Architektur und den Empfehlungen des Enterprise AI Factory validated design sollen Unternehmen damit von Proof-of-Concepts zu produktiven On-Premises-AI-Factories übergehen können.

Quelle

Originalquelle: NVIDIA Technical Blog

Aktuelle Artikel

spot_img

Ähnliche Artikel

Leave A Reply

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein

Bleib auf dem Laufenden – Hol dir die täglichen Nachrichten direkt in deinen Posteingang