Tools

Microsoft Research veröffentlicht AgentRx zur systematischen Diagnose von Fehlern in KI-Agenten

Microsoft Research stellt mit AgentRx ein Open-Source-Framework vor, das in Ausführungspfaden von KI-Agenten den ersten nicht mehr behebbaren Fehlerschritt identifizieren soll. Ergänzend erscheint mit dem AgentRx Benchmark ein Datensatz mit 115 manuell annotierten fehlgeschlagenen Trajektorien aus drei Domänen.

HoloTab bringt HCompanys Computer-Use-Modell als Chrome-Erweiterung in den Browser

HCompany stellt mit HoloTab eine Chrome-Erweiterung vor, die Webaufgaben direkt im Browser automatisiert. Die Erweiterung basiert auf dem Computer-Use-Modell Holo3 und kann wiederkehrende Abläufe als Routinen aufzeichnen, erneut ausführen oder planen.

VAKRA analysiert Reasoning, Tool-Nutzung und Fehlermuster von KI-Agenten

IBM Research beschreibt mit VAKRA einen ausführbaren, tool-basierten Benchmark für KI-Agenten in unternehmensähnlichen Umgebungen. Der Beitrag erläutert Aufbau, Auswertung und Fehlermuster über vier Fähigkeitsbereiche hinweg, darunter API-Auswahl, Multi-Hop-Reasoning, Dokumentabruf und Policy-Vorgaben.

Hugging Face stellt Skill und Test-Harness für Ports von transformers nach mlx-lm vor

Hugging Face beschreibt einen Skill und ein separates Test-Harness, die das Portieren von Sprachmodellen aus transformers nach mlx-lm unterstützen sollen. Das System ist als Hilfe für Beitragende und Reviewer gedacht, nicht als vollautomatische PR-Erstellung ohne menschliche Verantwortung.

Gemini 2.0 Flash mit nativer Bildgenerierung für Entwickler freigegeben

Google stellt die native Bildausgabe von Gemini 2.0 Flash als experimentelle Funktion in Google AI Studio und über die Gemini API für Entwickler in den unterstützten Regionen bereit. Das Modell kombiniert multimodale Eingaben, Reasoning und Sprachverständnis, um Text und Bilder mit einem einzigen Modell zu erzeugen.

Eedi nutzt Microsoft-KI fuer adaptive Mathe-Diagnostik und Lernpfade

Eedi setzt ein von Microsoft Research entwickeltes KI-Modell ein, das auf Basis von zehn diagnostischen Multiple-Choice-Fragen die naechste passende Frage auswaehlt und Wissensluecken in Mathematik eingrenzt. Auf dieser Grundlage werden Schuelerinnen und Schueler individuellen Lernpfaden zugeordnet; Eedi verweist zudem auf interne Daten, nach denen 95 % der Fehlvorstellungen aufgeloest werden.

Aktuelle Artikel

Stay on op - Ge the daily news in your inbox

spot_img