Robotics

GroundedPlanBench untersucht räumlich verankerte Langzeitplanung für Robotermanipulation

Microsoft Research stellt mit GroundedPlanBench einen Benchmark für Vision-Language-Modelle vor, der prüft, ob Modelle Roboteraktionen und deren räumliche Ausführung gemeinsam planen können. Mit dem Trainingsverfahren V2GP wurden in Benchmark- und Robotiktests Verbesserungen gegenüber entkoppelten Ansätzen berichtet, auch wenn lange Aufgabenfolgen und implizite Anweisungen schwierig bleiben.

AsgardBench prüft visuell fundierte Plananpassung bei Embodied-AI-Agenten

Microsoft Research stellt mit AsgardBench einen Benchmark für visuell fundierte interaktive Planung vor. Er soll isoliert messen, ob Embodied-AI-Agenten ihre Pläne anhand von Bildbeobachtungen und minimalem Feedback während einer Aufgabe anpassen können.

Gemma-4-VLA-Demo auf Jetson Orin Nano Super mit lokaler Sprach- und Vision-Verarbeitung

Das Tutorial zeigt eine einfache VLA-Konfiguration mit Gemma 4 auf einem NVIDIA Jetson Orin Nano Super mit 8 GB, lokaler Speech-to-Text- und Text-to-Speech-Verarbeitung sowie optionaler Webcam-Nutzung. Die Demo nutzt tool calling über llama-server, sodass das Modell je nach Anfrage selbst entscheidet, ob ein Kamerabild aufgenommen und in die Antwort einbezogen werden soll.

Google DeepMind beschreibt Sicherheitsansatz für Gemini Robotics und Gemini Robotics-ER

Google DeepMind skizziert einen mehrschichtigen Sicherheitsansatz für Gemini Robotics und Gemini Robotics-ER, der von motorischer Kontrolle bis zu semantischem Verständnis reicht. Zusätzlich kündigt das Unternehmen das ASIMOV-Dataset sowie einen Rahmen für datengetriebene, in natürlicher Sprache formulierte Constitutions für Roboter an.

Aktuelle Artikel

Stay on op - Ge the daily news in your inbox

spot_img