Google DeepMind aktualisiert das Frontier Safety Framework

Google DeepMind hat eine aktualisierte Version seines Frontier Safety Framework (FSF) veröffentlicht, das Protokolle für den Umgang mit möglichen schwerwiegenden Risiken leistungsfähiger Frontier-AI-Modelle festlegt. Nach Angaben des Unternehmens basiert die zweite Version auf der Zusammenarbeit mit Fachleuten aus Industrie, Wissenschaft und Regierung sowie auf Erfahrungen aus der Anwendung des Frameworks bei Sicherheits- und Governance-Prozessen für Frontier-Modelle wie Gemini 2.0.

Zu den wichtigsten Änderungen gehören Empfehlungen für Security Levels in Bezug auf die Critical Capability Levels (CCLs), ein konsistenteres Verfahren für Deployment-Mitigationen und ein ausgearbeiteter Ansatz zum Risiko von deceptive alignment.

Empfehlungen für erhöhte Sicherheit

Security-Mitigationen sollen verhindern, dass unbefugte Akteure Model Weights exfiltrieren. DeepMind betont, dass mit Zugriff auf Model Weights die meisten Schutzmaßnahmen entfernt werden können. Das ursprüngliche Framework sah bereits einen abgestuften Sicherheitsansatz vor, damit Mitigationen mit unterschiedlicher Stärke an das jeweilige Risiko angepasst werden können. Dieser proportionale Ansatz soll laut DeepMind auch die Balance zwischen Risikominderung, Zugang und Innovation wahren.

In der überarbeiteten Fassung ordnet DeepMind jedem CCL eine empfohlene Sicherheitsstufe zu. Diese Empfehlungen beschreiben laut Unternehmen das jeweils angemessene Mindestniveau an Sicherheit, das im Bereich Frontier AI für Modelle auf einem bestimmten CCL gelten sollte. Die Zuordnung soll helfen, Bereiche mit dem größten Bedarf an starken Mitigationen zu identifizieren. DeepMind ergänzt, dass Teile der eigenen Sicherheitspraktiken in der Praxis über diese Basisempfehlungen hinausgehen können.

Besonders hohe Sicherheitsniveaus empfiehlt das Framework für CCLs im Bereich Machine-Learning-Forschung und -Entwicklung. DeepMind hält starke Sicherheitsmaßnahmen für wichtig in Szenarien, in denen Modelle die KI-Entwicklung selbst deutlich beschleunigen oder automatisieren könnten. Eine unkontrollierte Verbreitung solcher Fähigkeiten könnte nach Darstellung des Unternehmens die Fähigkeit der Gesellschaft erschweren, das hohe Entwicklungstempo von KI sorgfältig zu steuern und sich daran anzupassen.

DeepMind beschreibt die Sicherung hochentwickelter KI-Systeme als gemeinsame globale Aufgabe führender Entwickler. Zugleich verweist das Unternehmen auf ein Collective-Action-Problem: Der gesellschaftliche Nutzen einzelner Sicherheitsmaßnahmen sinke deutlich, wenn diese nicht breit im Feld umgesetzt würden. Der Aufbau der dafür nötigen Sicherheitsfähigkeiten werde Zeit benötigen, weshalb DeepMind gemeinsame Anstrengungen und die Beschleunigung hin zu gemeinsamen Industriestandards fordert.

Verfahren für Deployment-Mitigationen

Das Framework beschreibt auch Deployment-Mitigationen, die den Missbrauch kritischer Fähigkeiten in bereitgestellten Systemen verhindern sollen. DeepMind hat diesen Teil nach eigenen Angaben überarbeitet, damit für Modelle, die in einem Missbrauchsrisikobereich einen CCL erreichen, ein strengerer Sicherheitsprozess gilt.

Der aktualisierte Ablauf umfasst zunächst die Vorbereitung eines Mitigationspakets durch iterative Weiterentwicklung von Safeguards. Parallel dazu wird ein Safety Case erstellt, also ein prüfbares Argument dafür, dass die mit den CCLs eines Modells verbundenen schwerwiegenden Risiken auf ein akzeptables Maß reduziert wurden. Anschließend prüft das zuständige Corporate-Governance-Gremium diesen Safety Case. Eine allgemeine Verfügbarkeit soll nur nach dessen Freigabe erfolgen. Nach dem Deployment sollen Safeguards und Safety Case weiter überprüft und aktualisiert werden. DeepMind begründet die Änderung damit, dass alle kritischen Fähigkeiten diesen gründlichen Mitigationsprozess rechtfertigten.

Ansatz zum Risiko von deceptive alignment

Die erste Version des Frameworks konzentrierte sich vor allem auf Missbrauchsrisiken, also auf Szenarien, in denen Akteure kritische Fähigkeiten bereitgestellter oder exfiltrierter Modelle für Schaden nutzen. Die neue Version erweitert dies um einen proaktiven Ansatz gegenüber dem Risiko von deceptive alignment, also dem Risiko, dass ein autonomes System menschliche Kontrolle absichtlich untergräbt.

Ein erster Ansatzpunkt besteht darin, zu erkennen, wann Modelle eine grundlegende instrumental reasoning ability entwickeln könnten, mit der sie ohne vorhandene Schutzmaßnahmen menschliche Kontrolle unterlaufen könnten. Als Gegenmaßnahme untersucht DeepMind automatisiertes Monitoring, um eine unerlaubte Nutzung solcher instrumental-reasoning-Fähigkeiten zu erkennen.

Gleichzeitig schreibt DeepMind, dass automatisiertes Monitoring langfristig voraussichtlich nicht ausreichen werde, falls Modelle noch stärkere Formen von instrumental reasoning erreichen. Deshalb arbeite das Unternehmen an weiteren Mitigationsansätzen für solche Szenarien und ermutige auch zu weiterer Forschung in diesem Bereich. Wie wahrscheinlich das Entstehen solcher Fähigkeiten ist, sei noch unklar; dennoch hält DeepMind eine Vorbereitung des Feldes auf diese Möglichkeit für wichtig.

Das Framework soll laut DeepMind weiter überprüft und fortentwickelt werden, orientiert an den eigenen AI Principles. Wenn das Unternehmen zu der Einschätzung gelangt, dass ein Modell einen CCL erreicht hat, der ein nicht mitigiertes und erhebliches Risiko für die öffentliche Sicherheit darstellt, will es Informationen an zuständige staatliche Stellen weitergeben, sofern dies die Entwicklung sicherer KI unterstützt. Die aktuelle Fassung nennt außerdem weitere mögliche Forschungsfelder, bei denen DeepMind eine Zusammenarbeit mit der Forschungsgemeinschaft, anderen Unternehmen und Regierungen anstrebt. In diesem Zusammenhang verweist das Unternehmen auch auf die Seoul Frontier AI Safety Commitments als einen wichtigen Schritt für gemeinsame Standards und Verfahren.

Quelle

Originalquelle: Google DeepMind News

Aktuelle Artikel

spot_img

Ähnliche Artikel

Leave A Reply

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein

Bleib auf dem Laufenden – Hol dir die täglichen Nachrichten direkt in deinen Posteingang