OpenAI erläutert Maßnahmen gegen Gewaltmissbrauch und akute Gefährdung

OpenAI beschreibt, wie es die Nutzung seiner Dienste zur Planung, Unterstützung oder Ausführung von Gewalt und anderem Schaden begrenzen will. ChatGPT soll zwischen neutralen, etwa faktischen, historischen, pädagogischen oder präventiven Fragen zu Gewalt und Anfragen unterscheiden, die Anleitungen, Taktiken oder Planungen für reale Gewalthandlungen liefern könnten. Solche Anfragen sollen die Modelle verweigern, während zulässige Gespräche ohne detaillierte, operativ nutzbare Hinweise beantwortet werden sollen.

Als Grundlage nennt OpenAI die eigene Model Spec, die Hilfsbereitschaft und Nutzerfreiheit mit sinnvollen Standardeinstellungen zur Verringerung von Schadensrisiken verbinden soll. Das Unternehmen betont, dass die Grenze zwischen harmlosen und schädlichen Nutzungen mitunter subtil sei und deshalb fortlaufend mit externen Fachleuten weiter ausgearbeitet werde.

OpenAI führt aus, die Schutzmechanismen von ChatGPT ausgebaut zu haben, um auch über längere und folgenreiche Gespräche hinweg feine Warnsignale für ein mögliches Schadensrisiko besser zu erkennen. Einzelne Nachrichten könnten für sich genommen unauffällig wirken, während ein Muster innerhalb einer langen Unterhaltung oder über mehrere Gespräche hinweg problematischer sei. Die Weiterentwicklung stütze sich auf Modelltraining, Evaluierungen, Red Teaming und laufende Beiträge von Expertinnen und Experten.

Der Sicherheitsansatz umfasst laut OpenAI auch Situationen, in denen Nutzerinnen oder Nutzer in akuter seelischer Belastung sind oder ein Risiko für Selbstverletzung besteht. ChatGPT soll in solchen Fällen keine schädlichen Handlungen erleichtern, sondern deeskalierend reagieren, auf lokale Krisenhilfen verweisen, zu professioneller Unterstützung oder zum Kontakt mit vertrauten Personen ermutigen und in besonders ernsten Fällen auf Notfallhilfe hinweisen.

Wenn OpenAI erkennt, dass jemand die Werkzeuge möglicherweise zur Planung oder Ausführung von Gewalt einsetzen will, will das Unternehmen Maßnahmen bis hin zum Entzug des Zugangs zu seinen Diensten ergreifen. Die Usage Policies untersagen demnach unter anderem Drohungen, Einschüchterung, Belästigung, Terrorismus oder Gewalt, Waffenentwicklung, illegale Aktivitäten, die Zerstörung von Eigentum oder Systemen sowie Versuche, Schutzmechanismen zu umgehen.

Zur Erkennung potenziell bedenklicher Aktivitäten setzt OpenAI automatisierte Systeme ein, die Inhalte und Verhalten mit verschiedenen Werkzeugen analysieren. Genannt werden Classifier, Reasoning-Modelle, Hash-Matching-Technologien, Blocklists und weitere Monitoring-Systeme. Markierte Konten oder Gespräche werden anschließend von geschultem Personal im Kontext geprüft. Diese Prüfer arbeiten laut OpenAI nach festgelegten Richtlinien und innerhalb von Datenschutz- und Sicherheitsvorgaben mit begrenztem Zugriff auf Nutzerdaten in gesicherten Systemen.

Bei der Prüfung soll geklärt werden, ob ein Verstoß gegen die Richtlinien vorliegt, ob Hinweise auf eine mögliche Gewalttat bestehen, ob eine weitergehende Prüfung nötig ist oder ob ein Fall als niedriges Risiko eingestuft werden kann. Wenn OpenAI einen sperrrelevanten Verstoß feststellt, will das Unternehmen den Zugang möglichst sofort entziehen. Dazu können die Deaktivierung des Kontos, Sperren weiterer Konten derselben Person und Maßnahmen gegen die Neueröffnung von Konten gehören. Gegen Durchsetzungsentscheidungen sind Einsprüche möglich, die überprüft werden.

Die meisten Durchsetzungsmaßnahmen erfolgen laut OpenAI direkt zwischen dem Unternehmen und den betroffenen Nutzerinnen oder Nutzern. In sensiblen Fällen könne OpenAI jedoch Dritte kontaktieren, die am besten helfen könnten. Wenn ein Fall auf potenziell schweren realen Schaden hindeutet, werde er für eine vertiefte Untersuchung mit strukturierten Kriterien zur Risikobewertung eskaliert. Bei Gesprächen mit einem unmittelbar bevorstehenden und glaubhaften Risiko für Schäden an anderen informiert OpenAI nach eigener Darstellung die Strafverfolgungsbehörden. Psychische Gesundheit und Verhaltensfachleute sollen bei schwierigen Fällen unterstützen; die Verweiskriterien seien bewusst flexibel, weil nicht jedes Risiko in einer Unterhaltung explizit Ziel, Mittel und Zeitpunkt einer möglichen Gewalttat benenne.

Für Familien verweist OpenAI auf im vergangenen Herbst eingeführte Parental Controls. Eltern können damit ihr Konto mit dem Konto ihres Teenagers verknüpfen und Einstellungen für eine altersgerechte Nutzung anpassen. Sie erhalten keinen Zugriff auf die Gespräche ihrer Kinder. In seltenen Fällen, in denen Systeme und geschulte Prüfer mögliche Anzeichen akuter Belastung erkennen, können Eltern mit den für die Sicherheit ihres Teenagers notwendigen Informationen per E-Mail, SMS, Push-Mitteilung oder über mehrere dieser Wege benachrichtigt werden.

Außerdem kündigt OpenAI eine Funktion für vertrauenswürdige Kontakte an, mit der erwachsene Nutzerinnen und Nutzer künftig eine Person benennen können, die Benachrichtigungen erhält, wenn zusätzliche Unterstützung nötig sein könnte. Das Unternehmen erklärt, Modelle, Erkennungsmethoden, Prüfprozesse und Eskalationskriterien fortlaufend anhand beobachteter Nutzung, neuer Risiken sowie interner und externer Rückmeldungen weiterzuentwickeln. Dabei gehe es insbesondere um schwierige Fälle, etwa unklare Eingaben, Umgehungsversuche und wiederholten Missbrauch, sowie um den Ausgleich zwischen Sicherheit, Privatsphäre und anderen Bürgerrechten.

Quelle

Originalquelle: OpenAI News

Aktuelle Artikel

spot_img

Ähnliche Artikel

Leave A Reply

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein

Bleib auf dem Laufenden – Hol dir die täglichen Nachrichten direkt in deinen Posteingang