KI-Evaluierungen werden zum neuen Compute-Flaschenhals

Die Kosten für KI-Evaluierungen haben laut dem Beitrag eine Schwelle erreicht, die verändert, wer sie noch durchführen kann. Als Beispiele nennt der Text den Holistic Agent Leaderboard (HAL) mit rund 40.000 US-Dollar für 21.730 Agent-Rollouts über 9 Modelle und 9 Benchmarks, einen einzelnen GAIA-Durchlauf auf einem Frontier-Modell mit 2.829 US-Dollar vor Caching, Exgentics Sweep über Agent-Konfigurationen für 22.000 US-Dollar mit einem 33-fachen Kostenunterschied bei identischen Aufgaben sowie The Well mit etwa 960 H100-Stunden für die Bewertung einer neuen Architektur und 3.840 H100-Stunden für einen vollständigen Sweep über vier Baselines. Bei neuen Agent-Benchmarks seien Komprimierungstechniken nur eingeschränkt wirksam, Training-in-the-loop-Benchmarks seien konstruktionsbedingt teuer, und wiederholte Läufe zur Erhöhung der Zuverlässigkeit vervielfachten die Kosten weiter.

Schon vor Agenten seien statische LLM-Benchmarks teuer gewesen. Für HELM nennt der Text modellabhängige API-Kosten von 85 bis 10.926 US-Dollar sowie 540 bis 4.200 GPU-Stunden für offene Modelle. Über 30 Modelle und 42 Szenarien habe sich der Gesamtaufwand auf rund 100.000 US-Dollar summiert. Bei EleutherAIs Pythia-Checkpoints habe sich zudem gezeigt, dass Evaluierung während der Modellentwicklung wiederholt anfällt: Laut Perlitz et al. können Evaluierungskosten beim Testen vieler Checkpoints sogar über den Kosten des Pretrainings liegen. Gleichzeitig zeigen Arbeiten wie Flash-HELM, tinyBenchmarks und Anchor Points, dass sich statische Benchmarks oft stark verkleinern lassen, ohne die Rangfolge wesentlich zu verändern, weil Modellunterschiede häufig auf einen kleinen Teil der Beispiele konzentriert sind.

Bei Agent-Evaluierungen greift diese Vereinfachung deutlich schlechter. HAL standardisiert Agent-Harnesses über neun Benchmarks aus Bereichen wie Coding, Web-Navigation, Wissenschaftsaufgaben und Kundenservice. Der Beitrag beschreibt, dass die Kosten einzelner Benchmark-Läufe über vier Größenordnungen zwischen HAL-Aufgaben und über drei Größenordnungen innerhalb einzelner Benchmarks schwanken. Dazu kommen große Preisunterschiede bei den verwendeten Modellen: Claude Opus 4.1 wird mit 15 US-Dollar pro Million Input-Tokens und 75 US-Dollar pro Million Output-Tokens angegeben, Gemini 2.0 Flash mit 0,10 beziehungsweise 0,40 US-Dollar. Benchmarks messen dabei laut Text selten nur ein Modell, sondern ein Produkt aus Modell, Scaffold und Token-Budget; kleine Scaffold-Entscheidungen könnten die Kosten um den Faktor 10 erhöhen.

Höhere Ausgaben führen dabei nicht zuverlässig zu besseren Ergebnissen. Für Online Mind2Web wird Browser-Use mit Claude Sonnet 4 mit 1.577 US-Dollar für 40 Prozent Genauigkeit genannt, während SeeAct mit GPT-5 Medium 42 Prozent für 171 US-Dollar erreicht habe. Auf GAIA kostete ein HAL Generalist mit o3 Medium 2.828 US-Dollar bei 28,5 Prozent Genauigkeit, während ein anderer Agent 57,6 Prozent für 1.686 US-Dollar erreicht habe. CLEAR berichtet laut Beitrag über 300 Unternehmensaufgaben hinweg, dass genauigkeitsoptimale Konfigurationen 4,4- bis 10,8-mal mehr kosten als Pareto-effiziente Alternativen bei vergleichbarer realer Leistung. Verfahren wie Ndzomgas Mid-Difficulty-Filter reduzierten die Kosten bei Agent-Evals zwar um das 2- bis 3,5-Fache bei erhaltener Rangtreue, blieben aber deutlich hinter den 100- bis 200-fachen Reduktionen statischer Benchmarks zurück.

Ein Teil der Benchmarks verlässt den Rahmen reiner API-Kosten, weil die Evaluierung selbst Training von Grund auf verlangt. The Well bündelt 16 SciML-Datensätze mit insgesamt 15 TB. Nach dem beschriebenen Protokoll werden Baseline-Modelle je 12 Stunden auf einer einzelnen H100 trainiert, mit fünf Learning Rates pro Modell-Datensatz-Paar, über vier Architekturen und 16 Datensätze hinweg. Das ergibt 3.840 H100-Stunden für den vollständigen Sweep und etwa 960 H100-Stunden für eine neue Architektur. Der Beitrag hebt hervor, dass ein einzelner Neural Operator in einem 12-Stunden-Lauf trainiert werden kann, die Evaluierung über den Benchmark aber 80 solcher Trainings erfordert. Ähnliche Muster beschreibt der Text für MLE-Bench, RE-Bench, ResearchGym und PaperBench, wo GPU-Zeit, API-Kosten und Grading zusammen pro Evaluierung auf mehrere Tausend bis weit über Zehntausend US-Dollar steigen können.

Zusätzliche Kosten entstehen durch Zuverlässigkeitsmessung. Einzelläufe hätten oft nur begrenzte statistische Aussagekraft. Als Beispiel nennt der Beitrag τ-bench beziehungsweise CLEAR, wo die Leistung von 60 Prozent in einem Einzellauf auf 25 Prozent bei 8-Run-Consistency sinken könne. HALs interne Analysen zeigen laut Text weitere Fragilität: Auf SciCode und CORE-Bench wurden Läufe fast nie ohne Tool-Calling-Fehler abgeschlossen, auf AssistantBench und CORE-Bench traten Umweltfehler in etwa 40 Prozent der Läufe auf, und bei fehlgeschlagenen Aufgaben verletzten Agenten in über 60 Prozent der Fälle explizite Benchmark-Anweisungen in ihrer finalen Antwort. Eine HAL-artige Evaluierung mit k = 8 Wiederholungen würde den aggregierten Aufwand von 40.000 auf etwa 320.000 US-Dollar erhöhen; bei PaperBench würde sich ein Lauf pro Agent von rund 9.500 auf über 75.000 US-Dollar verteuern.

Der Beitrag leitet daraus ab, dass Evaluierungskosten zu einer Hürde für Rechenschaft und unabhängige Prüfung geworden sind. Akademische Gruppen, AI Safety Institutes und Journalisten träfen demnach oft früher auf Budgetgrenzen als auf technische Grenzen. Zugleich erweitere sich die bisher vor allem auf Training bezogene Compute Divide auf die Evaluierung. Wenn Leaderboards nur rohe Genauigkeit ohne Kostenangaben ausweisen, entstehe ein Anreiz, mehr Tokens und Inference-Time-Compute einzusetzen, auch wenn HAL laut Text zeigt, dass höherer Reasoning-Aufwand in der Mehrzahl der Läufe die Genauigkeit sogar senkt. Pareto-Frontiers würden diesen Vergleich verbessern, seien aber noch nicht der Standard.

Ein weiterer Kostentreiber ist laut Beitrag die wiederholte Durchführung weitgehend identischer Evaluierungen durch verschiedene Gruppen. Frontier-Labs, akademische Reproduktionen, Audit-Organisationen und journalistische Prüfungen zahlten häufig erneut für überlappende Modelle und Benchmarks, während Instanzdaten, Trajektorien, Seeds, Scaffolds und Grading-Spuren oft nicht in wiederverwendbarer Form veröffentlicht würden. Der Text schlägt daher standardisierte Dokumentation und die Veröffentlichung detaillierter Artefakte als naheliegenden Hebel vor, damit spätere Arbeiten auf bestehenden Ergebnissen aufbauen können, statt Baselines erneut zu bezahlen.

In der Zusammenfassung hält der Beitrag fest, dass sich die Ökonomie verschoben hat: Früher sei Training teuer und Evaluierung günstig gewesen, heute koste eine belastbare Evaluierung bei Frontier-LLMs oft Zehntausende US-Dollar pro Benchmark-Lauf, bei Neural Operators, ML-Research-Agenten und Replikationsbenchmarks teils mehr als das Training des zu bewertenden Modells. Für statische Benchmarks gebe es wirksame Verfahren zur Kostensenkung, für Agent-Evaluierungen nur teilweise und für Training-in-the-loop-Benchmarks keine allgemeine Kompressionsmethode. Wiederholte Läufe zur Messung von Zuverlässigkeit erhöhen die Kosten in allen drei Kategorien weiter.

Quelle

Originalquelle: Hugging Face Blog

Aktuelle Artikel

spot_img

Ähnliche Artikel

Leave A Reply

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein

Bleib auf dem Laufenden – Hol dir die täglichen Nachrichten direkt in deinen Posteingang