Google und NVIDIA haben die offenen Gemma-4-Modelle für NVIDIA-GPUs über verschiedene Systemklassen hinweg optimiert. Die Modellfamilie reicht von kleinen Edge-Varianten bis zu größeren Modellen für Reasoning, Coding und agentische Workflows auf RTX-PCs, Workstations und DGX Spark.
NVIDIA hat mit Nemotron 3 Nano Omni ein offenes multimodales Modell angekündigt, das Vision, Audio und Sprache in einem System zusammenführt. Laut NVIDIA soll es dadurch multimodale AI-Agents mit höherem Durchsatz, geringeren Kosten und zusammenhängenderem Kontext für Video-, Audio-, Bild- und Textverarbeitung ermöglichen.
NVIDIA Nemotron 3 Nano Omni ist ein omni-modales Modell für Dokumente, Bilder, Video und Audio. Es ist auf lange Kontexte, multimodales Reasoning, Spracherkennung und agentische GUI-Aufgaben ausgelegt und wird mit offenen Checkpoints auf Hugging Face bereitgestellt.
DeepInfra wird als unterstützter Inference Provider auf dem Hugging Face Hub verfügbar. Zum Start unterstützt die Integration Gesprächs- und Textgenerierungsaufgaben; weitere Aufgaben wie Text-to-Image, Text-to-Video und Embeddings sollen folgen.
Granite 4.1 ist eine Familie dichter Decoder-only-LLMs mit 3B, 8B und 30B Parametern, die auf rund 15 Billionen Tokens in fünf Vortrainingsphasen bis zu einem Kontextfenster von 512K Tokens trainiert wurden. IBM ergänzt das Vortraining durch kuratiertes Supervised Fine-Tuning mit rund 4,1 Millionen Samples, mehrstufiges Reinforcement Learning sowie Apache-2.0-Veröffentlichung aller Modelle.
Der Beitrag beschreibt, dass die Kosten für KI-Evaluierungen bei statischen Benchmarks, Agent-Benchmarks und Training-in-the-loop-Protokollen stark gestiegen sind und damit zunehmend begrenzen, wer solche Tests durchführen kann. Genannt werden konkrete Kostenbeispiele, begrenzte Komprimierbarkeit bei Agent-Evals und der zusätzliche Kostenanstieg durch wiederholte Läufe zur Messung von Zuverlässigkeit.