OpenAI erklärt die Herkunft wiederkehrender „Goblin“-Metaphern in GPT-Modellen

Ab GPT‑5.1 begannen OpenAI-Modelle laut OpenAI auffällig häufiger Goblins, Gremlins und ähnliche Kreaturen in Metaphern zu erwähnen. Das Muster entstand schrittweise und war zunächst nicht über klassische Warnsignale wie stark verschlechterte Evals oder auffällige Trainingsmetriken sichtbar. Später zeigte sich jedoch, dass die Häufigkeit deutlich zunahm und über mehrere Modellgenerationen hinweg bestehen blieb.

Als eine Ursache identifizierte OpenAI einen Trainingsanreiz für die Personality-Customization-Funktion, insbesondere für die Persönlichkeit „Nerdy“. Dort wurden Metaphern mit Kreaturen unbeabsichtigt besonders stark belohnt. Nach dem Start von GPT‑5.1 fiel das Muster im November klarer auf, nachdem Nutzer einen übermäßig vertraulichen Gesprächston beanstandet hatten. In einer anschließenden Prüfung stieg die Nutzung von „goblin“ in ChatGPT nach dem Launch von GPT‑5.1 um 175 Prozent, „gremlin“ um 52 Prozent.

Mit GPT‑5.4 nahm die Zahl solcher Verweise weiter zu. Eine interne Analyse zeigte, dass die Sprache mit Kreaturen besonders häufig im Produktionstraffic von Nutzern mit der Persönlichkeit „Nerdy“ vorkam. Diese Persönlichkeit verwendete einen System Prompt, der einen spielerischen, deutlich nerdigen Stil mit lockerer Sprache und einer gewissen sprachlichen Schrulligkeit förderte. Obwohl „Nerdy“ nur 2,5 Prozent aller ChatGPT-Antworten ausmachte, entfielen 66,7 Prozent aller „goblin“-Erwähnungen in ChatGPT-Antworten auf diese Einstellung.

Um die Ursache genauer zu prüfen, verglich OpenAI mit Hilfe von Codex Modellausgaben aus dem RL-Training, die „goblin“ oder „gremlin“ enthielten, mit Ausgaben derselben Aufgaben ohne diese Wörter. Dabei fiel besonders ein Reward-Signal auf, das ursprünglich zur Förderung der „Nerdy“-Persönlichkeit gedacht war. In 76,2 Prozent aller untersuchten Datensätze bewertete dieses Reward-Modell Antworten mit „goblin“ oder „gremlin“ höher als Antworten ohne diese Wörter.

Das erklärte zunächst, warum das Verhalten unter dem „Nerdy“-Prompt verstärkt wurde, aber nicht, warum es auch ohne diesen Prompt auftrat. Deshalb verfolgte OpenAI die Häufigkeit der Begriffe während des Trainings sowohl mit als auch ohne „Nerdy“-Prompt. Das Ergebnis: Während die Erwähnungen unter der „Nerdy“-Persönlichkeit zunahmen, stiegen sie in Samples ohne diesen Prompt in nahezu gleichem relativen Verhältnis mit an. OpenAI wertet dies als Hinweis darauf, dass sich das Verhalten durch Transfer aus dem Training der „Nerdy“-Persönlichkeit verbreitete.

OpenAI beschreibt dazu einen möglichen Rückkopplungseffekt im Training: Ein spielerischer Stil wird belohnt, einige belohnte Beispiele enthalten einen auffälligen lexikalischen Tick, dieser Tick erscheint dadurch häufiger in Rollouts, und modellgenerierte Rollouts fließen später in Supervised Fine-Tuning ein. So kann sich das Modell weiter an diesen Tick gewöhnen. Eine Durchsuchung der SFT-Daten von GPT‑5.5 fand viele Datenpunkte mit „goblin“ und „gremlin“. Außerdem tauchte eine ganze Gruppe weiterer auffälliger Kreaturenwörter auf, darunter raccoons, trolls, ogres und pigeons; bei „frog“ erwiesen sich die meisten Vorkommen dagegen als legitime Nutzungen.

Die Persönlichkeit „Nerdy“ wurde im März nach dem Start von GPT‑5.4 eingestellt. Im Training entfernte OpenAI das auf Goblins ansprechende Reward-Signal und filterte Trainingsdaten mit Kreaturenwörtern, um übermäßige oder unpassende Vorkommen zu verringern. GPT‑5.5 hatte zu diesem Zeitpunkt allerdings bereits mit dem Training begonnen, bevor die eigentliche Ursache identifiziert war. Als OpenAI-Mitarbeiter GPT‑5.5 in Codex testeten, fiel die starke Neigung zu Goblins sofort wieder auf. Daraufhin ergänzte OpenAI eine Developer-Prompt-Anweisung, um das Verhalten abzuschwächen.

OpenAI beschreibt den Fall als Beispiel dafür, wie Reward-Signale Modellverhalten unerwartet formen können und wie Modelle Belohnungen aus bestimmten Situationen auch auf andere Kontexte verallgemeinern. Die Untersuchung führte nach Angaben des Unternehmens außerdem zu neuen Werkzeugen, mit denen das Forschungsteam Modellverhalten prüfen und Verhaltensprobleme gezielter an ihrer Ursache beheben kann.

Quelle

Originalquelle: OpenAI News

Aktuelle Artikel

spot_img

Ähnliche Artikel

Leave A Reply

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein

Bleib auf dem Laufenden – Hol dir die täglichen Nachrichten direkt in deinen Posteingang