Forschung

Waypoint-1.5 erweitert Echtzeit-Weltmodelle für Consumer-Hardware

Hugging Face stellt Waypoint-1.5 als nächstes Echtzeit-Video-Weltmodell von Overworld vor. Die Version erhöht die Bildqualität, ergänzt eine 360p-Stufe für breitere Hardware-Unterstützung und soll interaktive generative Umgebungen lokal auf Alltags-Hardware zugänglicher machen.

FACTS Grounding: Neuer Benchmark zur Bewertung der Faktentreue von Sprachmodellen

Google DeepMind und Google Research stellen mit FACTS Grounding einen neuen Benchmark zur Bewertung der Faktentreue großer Sprachmodelle vor. Der Fokus liegt auf der Frage, wie gut Modellantworten durch bereitgestellte Quellen gestützt sind.

Fünf Beispiele, wie NVIDIA KI für Klima, Naturschutz und Recycling hervorhebt

NVIDIA stellt zum Earth Day fünf Projekte vor, die KI und beschleunigtes Rechnen für Wettervorhersage, Artenschutz, Recycling, Tsunami-Warnungen und satellitengestützte Erdbeobachtung einsetzen. Der Beitrag nennt dabei konkrete Modelle, Verfahren, Leistungswerte und Grenzen der bisherigen Ansätze.

KI und GPUs helfen bei der Analyse früher Galaxien aus JWST-Daten

Brant Robertsons Team an der UC Santa Cruz nutzt KI-Modelle und GPUs, um die großen und komplexen Datensätze des James Webb Space Telescope zu verarbeiten. Dabei wurden unter anderem rotierende Scheibengalaxien im frühen Universum identifiziert und Werkzeuge für die strukturierte Auswertung von zehntausenden Galaxien aufgebaut.

PlugMem: Allgemeines Speichermodul für KI-Agenten

Microsoft Research beschreibt mit PlugMem ein Plug-and-play-Speichersystem für LLM-Agenten, das Interaktionsverläufe in strukturierte, wiederverwendbare Wissenseinheiten umwandelt. In drei unterschiedlichen Benchmarks erzielte das Modul laut den Autoren bessere Ergebnisse als generische Retrieval-Verfahren und aufgabenspezifische Speicheransätze, bei geringerem Speicher-Token-Bedarf.

Microsoft Research veröffentlicht AgentRx zur systematischen Diagnose von Fehlern in KI-Agenten

Microsoft Research stellt mit AgentRx ein Open-Source-Framework vor, das in Ausführungspfaden von KI-Agenten den ersten nicht mehr behebbaren Fehlerschritt identifizieren soll. Ergänzend erscheint mit dem AgentRx Benchmark ein Datensatz mit 115 manuell annotierten fehlgeschlagenen Trajektorien aus drei Domänen.

Aktuelle Artikel

Stay on op - Ge the daily news in your inbox

spot_img