AsgardBench prüft visuell fundierte Plananpassung bei Embodied-AI-Agenten

AsgardBench ist ein von Microsoft Research vorgestellter Benchmark, der prüfen soll, ob Embodied-AI-Agenten ihre Pläne auf Basis visueller Beobachtungen während einer laufenden Aufgabe anpassen können. Der Benchmark umfasst 108 kontrollierte Aufgabeninstanzen aus 12 Aufgabentypen und fokussiert darauf, ob ein Agent auf Widersprüche zwischen erwartetem und beobachtetem Zustand reagiert.

Im Mittelpunkt stehen Haushaltsaufgaben in AI2-THOR, einer interaktiven 3D-Simulationsumgebung. Agenten starten dabei bereits in einer Position, in der Interaktionen möglich sind, sodass Navigation und Kamerawahl keine Rolle spielen. Sie erhalten einen kleinen festen Aktionssatz wie find, pickup, put, clean und toggle_on/off. In jedem Schritt schlägt der Agent eine vollständige Aktionsfolge zur Lösung der Aufgabe vor, ausgeführt wird aber jeweils nur der erste Schritt.

Der Benchmark ist so angelegt, dass dieselbe Anweisung je nach beobachtetem Objektzustand unterschiedliche Aktionsfolgen erfordern kann. Ein Becher kann etwa sauber, schmutzig oder mit Kaffee gefüllt sein; ein Waschbecken kann leer oder mit anderen Gegenständen belegt sein. Die Eingaben bestehen nur aus Farbbildern, einer Historie zuvor versuchter Aktionen mit einfachen Erfolg- oder Fehlschlagssignalen und dem eigenen Plan des Agenten. Detaillierte Rückmeldungen aus der Umgebung sind nicht vorgesehen.

Dieses Setup soll verhindern, dass Agenten Aufgaben vollständig im Voraus skripten. Nach jedem ausgeführten Schritt erhalten sie neue Bilder und nur das Signal, ob die Aktion erfolgreich war oder nicht. Zusätzlich begrenzen eingebaute Limits die Gesamtzahl der Schritte und wiederholte Aktionen, um Endlosschleifen zu vermeiden. Dadurch liegt der Schwerpunkt auf Plananpassung statt auf Navigation, Objektmanipulation oder der Auswahl geeigneter Ablageorte; auch Details wie Containergröße und Platzierung werden von der Umgebung behandelt.

Auswertung

Microsoft Research testete mehrere führende vision-fähige Modelle auf AsgardBench. Dabei zeigte sich laut den Autoren, dass hohe Leistung eine konsistente visuelle Fundierung erfordert. Über die Modelle hinweg verbesserte visueller Input die Erfolgsraten deutlich; die meisten Modelle erzielten mit Bildern mehr als doppelt so hohe Erfolgsraten wie mit reinen Textbeschreibungen der Szene.

Detaillierteres Fehler-Feedback erhöhte die Leistung ebenfalls, konnte nach Darstellung der Autoren aber das eigentliche Problem verdecken. Die stärksten vision-fähigen Modelle übertrafen Text-only-Agenten auch dann noch, wenn diese detaillierte Rückmeldungen erhielten. Das soll zeigen, dass AsgardBench Anforderungen an visuelle Fundierung stellt, die durch Text allein nicht ersetzt werden können.

Die Ergebnisse zeigen zugleich wiederkehrende Schwächen heutiger Agenten. Modelle versuchten nicht ausführbare Aktionen, etwa das Reinigen eines Bechers, der sich nicht im Waschbecken befand, gerieten in wiederholte Aktionsschleifen, deuteten feine visuelle Hinweise wie on/off oder clean/dirty falsch und verloren den Überblick über den Aufgabenfortschritt über mehrere Schritte hinweg. Daraus leiten die Autoren drei Schwachstellen ab: Schwierigkeiten bei feinen visuellen Unterscheidungen in unübersichtlichen Szenen, unzureichendes Zustands- und Fortschritts-Tracking über mehrere Schritte sowie eine inkonsistente Übertragung visueller Beobachtungen in rechtzeitige Plananpassungen.

Verfügbarkeit

AsgardBench soll sowohl als Diagnose- als auch als Entwicklungswerkzeug dienen. Durch unterschiedliche Feedback-Stufen – kein, minimales oder detailliertes Feedback – soll sich trennen lassen, ob Leistungsgewinne aus besserer Wahrnehmung, besserem Gedächtnis oder besserer Planung entstehen. Das Projekt ist als Open Source auf GitHub verfügbar.

Quelle

Originalquelle: Microsoft Research

Aktuelle Artikel

spot_img

Ähnliche Artikel

Leave A Reply

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein

Bleib auf dem Laufenden – Hol dir die täglichen Nachrichten direkt in deinen Posteingang