Open Source

QIMMA: qualitaetsgeprueftes Leaderboard fuer arabische LLM-Bewertung

QIMMA bewertet arabische Benchmarks vor der Modellevaluation und soll so sicherstellen, dass gemeldete Ergebnisse tatsaechlich arabische Sprachfaehigkeit abbilden. Die Plattform fuehrt 109 Teilmengen aus 14 Benchmarks zusammen, prueft jedes Sample in einer mehrstufigen Pipeline und veroeffentlicht darauf basierende Modellranglisten.

Transformers.js in einer Chrome-Erweiterung unter Manifest V3

Der Beitrag beschreibt eine Referenzarchitektur für lokale KI-Funktionen in einer Chrome-Erweiterung mit Transformers.js unter den Einschränkungen von Manifest V3. Im Mittelpunkt stehen die Aufteilung auf Background-Service-Worker, Side-Panel und Content-Script, das Nachrichtenmodell, das Laden der Modelle sowie Zustands- und Berechtigungsfragen.

DeepSeek-V4 zielt auf lange agentische Workloads mit bis zu 1 Million Token Kontext

DeepSeek-V4 wurde fuer lange agentische Ablaufe entwickelt, bei denen heutige offene Frontier-Modelle an Kontextkosten, KV-Cache und Tool-Aufrufen scheitern. Der Beitrag beschreibt eine Architektur mit komprimierter Attention, agentenspezifisches Post-Training sowie Benchmark- und Modellangaben.

Aktuelle Artikel

Stay on op - Ge the daily news in your inbox

spot_img