Microsoft Research stellt mit AgentRx ein Open-Source-Framework vor, das in Ausführungspfaden von KI-Agenten den ersten nicht mehr behebbaren Fehlerschritt identifizieren soll. Ergänzend erscheint mit dem AgentRx Benchmark ein Datensatz mit 115 manuell annotierten fehlgeschlagenen Trajektorien aus drei Domänen.
HCompany stellt mit HoloTab eine Chrome-Erweiterung vor, die Webaufgaben direkt im Browser automatisiert. Die Erweiterung basiert auf dem Computer-Use-Modell Holo3 und kann wiederkehrende Abläufe als Routinen aufzeichnen, erneut ausführen oder planen.
IBM Research beschreibt mit VAKRA einen ausführbaren, tool-basierten Benchmark für KI-Agenten in unternehmensähnlichen Umgebungen. Der Beitrag erläutert Aufbau, Auswertung und Fehlermuster über vier Fähigkeitsbereiche hinweg, darunter API-Auswahl, Multi-Hop-Reasoning, Dokumentabruf und Policy-Vorgaben.
Hugging Face beschreibt einen Skill und ein separates Test-Harness, die das Portieren von Sprachmodellen aus transformers nach mlx-lm unterstützen sollen. Das System ist als Hilfe für Beitragende und Reviewer gedacht, nicht als vollautomatische PR-Erstellung ohne menschliche Verantwortung.
Google stellt die native Bildausgabe von Gemini 2.0 Flash als experimentelle Funktion in Google AI Studio und über die Gemini API für Entwickler in den unterstützten Regionen bereit. Das Modell kombiniert multimodale Eingaben, Reasoning und Sprachverständnis, um Text und Bilder mit einem einzigen Modell zu erzeugen.
Eedi setzt ein von Microsoft Research entwickeltes KI-Modell ein, das auf Basis von zehn diagnostischen Multiple-Choice-Fragen die naechste passende Frage auswaehlt und Wissensluecken in Mathematik eingrenzt. Auf dieser Grundlage werden Schuelerinnen und Schueler individuellen Lernpfaden zugeordnet; Eedi verweist zudem auf interne Daten, nach denen 95 % der Fehlvorstellungen aufgeloest werden.