EVA ist ein End-to-End-Bewertungsframework für mehrturnige gesprochene Interaktionen mit Voice Agents. Es bewertet gemeinsam Genauigkeit und Gesprächserlebnis und wurde mit einem ersten Airline-Datensatz sowie Benchmark-Ergebnissen für 20 Systeme veröffentlicht.
Granite 4.0 3B Vision ist ein kompaktes multimodales Modell für Enterprise-Dokumente, das als LoRA-Adapter auf Granite 4.0 Micro bereitgestellt wird. Es zielt auf Tabellenextraktion, Chart Understanding und semantische Key-Value-Pair-Extraktion und kann allein oder zusammen mit Docling eingesetzt werden.
Granite 4.1 ist eine Familie dichter Decoder-only-LLMs mit 3B, 8B und 30B Parametern, die auf rund 15 Billionen Tokens in fünf Vortrainingsphasen bis zu einem Kontextfenster von 512K Tokens trainiert wurden. IBM ergänzt das Vortraining durch kuratiertes Supervised Fine-Tuning mit rund 4,1 Millionen Samples, mehrstufiges Reinforcement Learning sowie Apache-2.0-Veröffentlichung aller Modelle.
Der Beitrag beschreibt, dass die Kosten für KI-Evaluierungen bei statischen Benchmarks, Agent-Benchmarks und Training-in-the-loop-Protokollen stark gestiegen sind und damit zunehmend begrenzen, wer solche Tests durchführen kann. Genannt werden konkrete Kostenbeispiele, begrenzte Komprimierbarkeit bei Agent-Evals und der zusätzliche Kostenanstieg durch wiederholte Läufe zur Messung von Zuverlässigkeit.
Google richtet in Seoul einen AI Campus ein, um mit koreanischen Hochschulen, Forschungseinrichtungen und dem Wissenschaftsministerium bei KI-gestützter Forschung zusammenzuarbeiten. Geplant sind Kooperationen zu Modellen für Life Sciences, Energie, Wetter und Klima sowie zu Talentförderung und AI Safety.
NVIDIA beschreibt die Integration von Muon und weiteren höherwertigen Optimierern in Megatron Core und erläutert, wie sich diese Verfahren auf große GPU-Cluster skalieren lassen. Für Kimi K2 und Qwen3 30B zeigen Messungen auf NVIDIA-GB300-Systemen laut NVIDIA nur geringe Durchsatzverluste gegenüber AdamW.