NVIDIA und Emerald AI haben auf der CERAWeek einen Ansatz vorgestellt, der AI Factories nicht als statische Stromlasten, sondern als flexible und intelligent steuerbare Netzressourcen auslegt. Die Architektur kombiniert beschleunigtes Computing, Referenzdesigns für AI Factories und Echtzeit-Energieorchestrierung, um große KI-Deployments schneller an das Stromnetz anzubinden, effizienter zu betreiben und die Systemzuverlässigkeit zu stärken.
Die Lösung basiert auf dem NVIDIA Vera Rubin DSX AI Factory Reference Design und der Conductor-Plattform von Emerald AI. Compute, Stromnetzwerk und Steuerung werden dabei in einer gemeinsamen Architektur zusammengeführt. Dadurch soll eine AI Factory hochwertige AI-Tokens erzeugen und gleichzeitig dynamisch auf Netzbedingungen reagieren können, um bei Bedarf flexibel zu fahren, die Zuverlässigkeit zu unterstützen und den Ausbau auf Spitzenlasten zu begrenzen.
AES, Constellation, Invenergy, NextEra Energy, Nscale Energy & Power und Vistra arbeiten laut NVIDIA daran, die zusätzliche Erzeugungskapazität für den schnell wachsenden Strombedarf bereitzustellen. Geplant ist eine Zusammenarbeit an optimierten Erzeugungsstrategien für AI Factories auf Basis der NVIDIA- und-Emerald-AI-Architektur, darunter hybride Projekte mit co-located power, die die Zeit bis zur Stromversorgung verkürzen und zugleich dem breiteren Netz Nutzen bringen sollen.
NVIDIA beschreibt dies als Teil eines Infrastrukturansatzes, den Jensen Huang als fünfschichtigen „AI cake“ bezeichnet hat, bei dem Energie die Grundschicht bildet. Im Text wird Leistung pro Watt beziehungsweise tokens per second per watt als zentrale Kennzahl moderner Computing-Infrastruktur hervorgehoben. Huang sagte in einem Lex-Fridman-Podcast, NVIDIA setze deshalb stark auf extremes Co-Design, um tokens per second per watt von Jahr zu Jahr um Größenordnungen zu verbessern.
Nach Angaben des Unternehmens ist die Zahl der innerhalb desselben Strombudgets erzeugten Tokens von der NVIDIA Kepler GPU im Jahr 2012 bis zur NVIDIA Vera Rubin Plattform in diesem Jahr um mehr als das Millionenfache gestiegen. NVIDIA verknüpft diese Entwicklung mit einer Zusammenarbeit über alle fünf Ebenen der AI-Infrastruktur hinweg, von Energie und Chips bis zu Infrastruktur, Modellen und Anwendungen.
Weitere auf der Veranstaltung vorgestellte Beispiele betreffen Energieinfrastruktur, Simulation und Qualifizierung. Maximo, ein bei AES inkubiertes Solarrobotik-Unternehmen, meldete die Fertigstellung einer robotergestützten Solarinstallation mit 100 Megawatt am AES-Standort Bellefield. Die Installation nutzt KI-gestützte Robotik auf Basis von NVIDIA accelerated computing, NVIDIA-Omniverse-Bibliotheken und dem NVIDIA Isaac Sim Framework. Laut Text soll der Ansatz Geschwindigkeit, Sicherheit und Konsistenz beim Aufbau verbessern.
TerraPower zeigte gemeinsam mit SoftServe eine mit NVIDIA Omniverse betriebene Digital-Twin-Plattform für Standortplanung und Design fortgeschrittener Kernkraftwerke. Durch den Einsatz von KI und Simulation in frühen Engineering-Phasen sollen sich Designzyklen von Jahren auf Monate verkürzen, um die Einführung von TerraPowers Natrium-Energieanlagen und deren Netzintegration zu beschleunigen.
Adaptive Construction Solutions kündigte in Zusammenarbeit mit NVIDIA eine landesweite registrierte Ausbildungsinitiative an, um Fachkräfte für AI Factories und Energieinfrastruktur aufzubauen. Das Programm soll Schulungen für kritische Gewerke ausweiten und damit den schnellen Ausbau KI-gestützter Energiesysteme unterstützen.
Im Bereich der Infrastruktur für AI Factories hoben GE Vernova, Schneider Electric und Vertiv hervor, dass Digital Twins, validierte Referenzdesigns und konvergente Infrastruktur für die Skalierung solcher Anlagen als verlässliche Netzteilnehmer wichtiger werden. Im Mittelpunkt steht die „power-to-rack“-Herausforderung, also AI-Infrastruktur von Beginn an als integriertes Energie- und Compute-System zu entwerfen.
GE Vernova erläuterte, wie hochauflösende Digital Twins in Verbindung mit dem NVIDIA Omniverse DSX Blueprint es Versorgern und Entwicklern ermöglichen sollen, Netzverhalten, Umspannwerke und Lasten von AI Factories schon vor dem Deployment gemeinsam zu simulieren. Das soll Interconnection-Strategien validieren, Risiken senken und die Zeit bis zur Stromversorgung in angespannten Netzumgebungen verkürzen.
Schneider Electric stellte neue validierte NVIDIA-Vera-Rubin-Referenzdesigns sowie mit AVEVA entwickelte Lifecycle-Digital-Twin-Architekturen vor. Durch die Simulation von Stromversorgung, Kühlung und Steuerung in Omniverse sollen Betreiber performance per watt optimieren, Designs vor dem Ausbau validieren und AI Factories im großen Maßstab effizienter und planbarer betreiben können.
Vertiv beschrieb eine konvergente, simulationsfähige physische Infrastruktur mit wiederholbaren Bausteinen für Stromversorgung und Kühlung. In Verbindung mit dem Vera Rubin DSX Reference Design soll dies die Komplexität von Design und Deployment reduzieren und eine schnellere Skalierung von AI Factories unterstützen.
