Forschung

Microsoft-Research-Podcast vergleicht LLMs mit der Architektur des Gehirns

In der ersten Folge von „The Shape of Things to Come“ diskutieren Doug Burger, Nicolò Fusi und Subutai Ahmad, ob heutige KI-Systeme als intelligent gelten können. Im Mittelpunkt stehen Unterschiede zwischen transformerbasierten Large Language Models und der verteilten, kontinuierlich lernenden Architektur des menschlichen Gehirns.

GroundedPlanBench untersucht räumlich verankerte Langzeitplanung für Robotermanipulation

Microsoft Research stellt mit GroundedPlanBench einen Benchmark für Vision-Language-Modelle vor, der prüft, ob Modelle Roboteraktionen und deren räumliche Ausführung gemeinsam planen können. Mit dem Trainingsverfahren V2GP wurden in Benchmark- und Robotiktests Verbesserungen gegenüber entkoppelten Ansätzen berichtet, auch wenn lange Aufgabenfolgen und implizite Anweisungen schwierig bleiben.

AsgardBench prüft visuell fundierte Plananpassung bei Embodied-AI-Agenten

Microsoft Research stellt mit AsgardBench einen Benchmark für visuell fundierte interaktive Planung vor. Er soll isoliert messen, ob Embodied-AI-Agenten ihre Pläne anhand von Bildbeobachtungen und minimalem Feedback während einer Aufgabe anpassen können.

VAKRA analysiert Reasoning, Tool-Nutzung und Fehlermuster von KI-Agenten

IBM Research beschreibt mit VAKRA einen ausführbaren, tool-basierten Benchmark für KI-Agenten in unternehmensähnlichen Umgebungen. Der Beitrag erläutert Aufbau, Auswertung und Fehlermuster über vier Fähigkeitsbereiche hinweg, darunter API-Auswahl, Multi-Hop-Reasoning, Dokumentabruf und Policy-Vorgaben.

Multimodale Embedding- und Reranker-Modelle mit Sentence Transformers trainieren und finetunen

Der Hugging Face Blog zeigt anhand von Visual Document Retrieval, wie sich Qwen/Qwen3-VL-Embedding-2B mit Sentence Transformers auf domänenspezifische multimodale Daten finetunen lässt. Im Beispiel steigt NDCG@10 auf dem Evaluationssatz von 0,888 beim Basismodell auf 0,947 beim finetunten Modell; außerdem werden Training, Loss-Funktionen, Evaluation und Optionen für multimodale Reranker beschrieben.

Hugging Face stellt Skill und Test-Harness für Ports von transformers nach mlx-lm vor

Hugging Face beschreibt einen Skill und ein separates Test-Harness, die das Portieren von Sprachmodellen aus transformers nach mlx-lm unterstützen sollen. Das System ist als Hilfe für Beitragende und Reviewer gedacht, nicht als vollautomatische PR-Erstellung ohne menschliche Verantwortung.

Aktuelle Artikel

Stay on op - Ge the daily news in your inbox

spot_img