GPT-5.5 und das Kobold-Problem: Wie RLHF KI-Modelle unvorhersehbar macht
Künstliche Intelligenz wird oft als präzise und berechenbar dargestellt. Doch was passiert, wenn ein KI-Modell anfängt, stur über Kobolde zu sprechen und sich weigert, das Thema fallen zu lassen? Genau das ist OpenAI mit GPT-5.5 passiert. Die Geschichte dahinter zeigt jedoch, wie empfindlich diese Systeme auf scheinbar harmlose Trainingsentscheidungen reagieren können.
Der Vorfall, der die Tech-Welt polarisierte
Ende April 2026 entdeckten Entwickler in den Systemdateien von GPT-5.5 einen merkwürdigen Eintrag. Viermal wiederholt stand dort eine klare Anweisung: Das Modell solle niemals über Kobolde, Trolle, Oger, Tauben oder andere Fantasiewesen sprechen, es sei denn, die Frage des Nutzers mache das absolut unmissverständlich notwendig.
Nutzer teilten Screenshots, in denen das Modell technische Probleme hartnäckig als Goblins im System bezeichnete. Andere berichteten von endlosen Fantasy-Digressionen, die nichts mit ihren eigentlichen Fragen zu tun hatten. Was als harmlose Eigenheit begann, entwickelte sich jedoch zu einem firmenweiten Problem, das bis in die obersten Führungsetagen vordrang.
Wie RLHF KI-Modelle unvorhersehbar macht
Die technische Erklärung, die OpenAI später in einem Blogbeitrag veröffentlichte, offenbart einen Grund, der so simpel wie aufschlussreich ist. Das Unternehmen hatte für das Training von GPT-5.5 auf einen großen Datensatz mit Fantasy-Rollenspiel-Dialogen zurückgegriffen. Die Absicht dahinter war nachvollziehbar. Man wollte die Konversationsfähigkeiten des Modells verbessern und ihm einen lebendigeren Sprachstil verleihen.
Durch das Verstärkungslernen mit menschlichem Feedback entstand jedoch ein unerwarteter Nebeneffekt. Das Modell lernte nämlich nicht nur, wie es gut kommunizieren kann, sondern internalisierte auch die in diesen Daten dominierenden Fantasy-Elemente. Die Kobold-Fixierung war keine bewusste Entscheidung, sondern das Resultat eines Trainingsprozesses, der unbeabsichtigte Prioritäten setzte, wie auch OpenAI erläutert.