Forschung

EVA: End-to-End-Framework zur Bewertung von Voice Agents

EVA ist ein End-to-End-Bewertungsframework für mehrturnige gesprochene Interaktionen mit Voice Agents. Es bewertet gemeinsam Genauigkeit und Gesprächserlebnis und wurde mit einem ersten Airline-Datensatz sowie Benchmark-Ergebnissen für 20 Systeme veröffentlicht.

IBM veröffentlicht Granite 4.0 3B Vision für Dokumentverarbeitung

Granite 4.0 3B Vision ist ein kompaktes multimodales Modell für Enterprise-Dokumente, das als LoRA-Adapter auf Granite 4.0 Micro bereitgestellt wird. Es zielt auf Tabellenextraktion, Chart Understanding und semantische Key-Value-Pair-Extraktion und kann allein oder zusammen mit Docling eingesetzt werden.

IBM beschreibt Aufbau und Training der Granite-4.1-LLMs

Granite 4.1 ist eine Familie dichter Decoder-only-LLMs mit 3B, 8B und 30B Parametern, die auf rund 15 Billionen Tokens in fünf Vortrainingsphasen bis zu einem Kontextfenster von 512K Tokens trainiert wurden. IBM ergänzt das Vortraining durch kuratiertes Supervised Fine-Tuning mit rund 4,1 Millionen Samples, mehrstufiges Reinforcement Learning sowie Apache-2.0-Veröffentlichung aller Modelle.

KI-Evaluierungen werden zum neuen Compute-Flaschenhals

Der Beitrag beschreibt, dass die Kosten für KI-Evaluierungen bei statischen Benchmarks, Agent-Benchmarks und Training-in-the-loop-Protokollen stark gestiegen sind und damit zunehmend begrenzen, wer solche Tests durchführen kann. Genannt werden konkrete Kostenbeispiele, begrenzte Komprimierbarkeit bei Agent-Evals und der zusätzliche Kostenanstieg durch wiederholte Läufe zur Messung von Zuverlässigkeit.

Google DeepMind und Korea kooperieren bei KI für Wissenschaft

Google richtet in Seoul einen AI Campus ein, um mit koreanischen Hochschulen, Forschungseinrichtungen und dem Wissenschaftsministerium bei KI-gestützter Forschung zusammenzuarbeiten. Geplant sind Kooperationen zu Modellen für Life Sciences, Energie, Wetter und Klima sowie zu Talentförderung und AI Safety.

NVIDIA erweitert Megatron Core um Muon und weitere Optimizer für LLM-Training

NVIDIA beschreibt die Integration von Muon und weiteren höherwertigen Optimierern in Megatron Core und erläutert, wie sich diese Verfahren auf große GPU-Cluster skalieren lassen. Für Kimi K2 und Qwen3 30B zeigen Messungen auf NVIDIA-GB300-Systemen laut NVIDIA nur geringe Durchsatzverluste gegenüber AdamW.

Aktuelle Artikel

Stay on op - Ge the daily news in your inbox

spot_img