Microsoft Research stellt mit GroundedPlanBench einen Benchmark für Vision-Language-Modelle vor, der prüft, ob Modelle Roboteraktionen und deren räumliche Ausführung gemeinsam planen können. Mit dem Trainingsverfahren V2GP wurden in Benchmark- und Robotiktests Verbesserungen gegenüber entkoppelten Ansätzen berichtet, auch wenn lange Aufgabenfolgen und implizite Anweisungen schwierig bleiben.
Microsoft Research stellt mit AsgardBench einen Benchmark für visuell fundierte interaktive Planung vor. Er soll isoliert messen, ob Embodied-AI-Agenten ihre Pläne anhand von Bildbeobachtungen und minimalem Feedback während einer Aufgabe anpassen können.
Das Tutorial zeigt eine einfache VLA-Konfiguration mit Gemma 4 auf einem NVIDIA Jetson Orin Nano Super mit 8 GB, lokaler Speech-to-Text- und Text-to-Speech-Verarbeitung sowie optionaler Webcam-Nutzung. Die Demo nutzt tool calling über llama-server, sodass das Modell je nach Anfrage selbst entscheidet, ob ein Kamerabild aufgenommen und in die Antwort einbezogen werden soll.
Google DeepMind skizziert einen mehrschichtigen Sicherheitsansatz für Gemini Robotics und Gemini Robotics-ER, der von motorischer Kontrolle bis zu semantischem Verständnis reicht. Zusätzlich kündigt das Unternehmen das ASIMOV-Dataset sowie einen Rahmen für datengetriebene, in natürlicher Sprache formulierte Constitutions für Roboter an.