Eine bahnbrechende Studie der University of California San Diego beweist es erstmals empirisch: Moderne KI-Modelle können den klassischen Turing-Test bestehen. GPT-4.5 wurde dabei in 73 Prozent der Fälle für einen Menschen gehalten. Das erschüttert unser Vertrauen in digitale Kommunikation grundlegend.
Was ist der Turing-Test?
Alan Turing stellte 1950 die Frage, ob eine Maschine so überzeugend menschlich kommunizieren kann, dass ein Gegenüber nicht mehr zwischen Mensch und Maschine unterscheiden kann. Seit 76 Jahren galt dieser Test als unerreichter Maßstab für maschinelle Intelligenz. Die Idee ist simpel: Ein menschlicher Frager chattet gleichzeitig mit einem Menschen und einer KI. Danach muss er entscheiden, wer von beiden der echte Mensch ist. Über 76 Jahre lang hat kein System diesen Test bestanden.
Die Studie im Detail
Cameron Jones und Benjamin Bergen von der UC San Diego veröffentlichten ihre Ergebnisse in den Proceedings of the National Academy of Sciences. Das Team organisierte ein rigoroses Turnier mit 284 Teilnehmern und 1.023 Spielen. Dabei chatteten Frager fünf oder 15 Minuten lang gleichzeitig mit einem Menschen und einer KI. Anschließend mussten sie entscheiden, wer der echte Mensch war.
Getestet wurden vier Systeme: GPT-4.5 und LLaMA-3.1-405B als aktuelle Modelle sowie GPT-4o und ELIZA als Basislinien. Die Ergebnisse sind bemerkenswert. GPT-4.5 wurde in 73 Prozent der Fälle als Mensch identifiziert. Damit lag die KI sogar häufiger vor dem echten Menschen. LLaMA-3.1-405B erreichte 56 Prozent und lag damit statistisch auf Augenhöhe mit menschlichen Gesprächspartnern. Die älteren Systeme hingegen fielen durch. ELIZA kam auf nur 23 Prozent, GPT-4o sogar auf nur 21 Prozent.
Personen-Prompts machen den Unterschied
Ein zentraler Befund der Studie: Ohne gezielte Prompts stürzten die Erfolgsraten ab. GPT-4.5 fiel von 73 auf 36 Prozent, LLaMA-3.1 von 56 auf 38 Prozent. Die Modelle brauchten also ausdrückliche Anweisungen, um menschlich zu wirken. Benjamin Bergen, Professor für Kognitionswissenschaft an der UC San Diego, erklärte es so: Die Modelle überzeugten nicht durch Wissen, sondern durch menschliche Fehlerhaftigkeit. Sie machten typische menschliche Fehler, zeigten Humor und Direktheit. Genau diese Eigenschaften täuschten die Frager.
Gefahr der Gegenmenschen
Die Autoren warnen vor sogenannten counterfeit people, also täuschend echt wirkenden KI-Agenten. Cameron Jones, mittlerweile Assistenzprofessor an der Stony Brook University, betont: Es sei erschreckend einfach, diese Modelle so zu steuern, dass sie von Menschen nicht mehr zu unterscheiden seien. Bergen ergänzt: Viele Akteure hätten Interesse daran, Bots zu überzeugen, Sozialversicherungsnummern preiszugeben, für Parteien zu stimmen oder Produkte zu kaufen.
Dabei sind die Testgespräche keine kurzen Chat-Snippets. Sie dauerten fünf bis 15 Minuten. Wer also denkt, nach ein paar Nachfragen liege die Maschine auf dem Flur, irrt sich. Die KI hält auch ausgedehnte Gespräche durch. Das hat gravierende Konsequenzen für Online-Vertrauen, soziale Manipulation und politische Desinformation.
Warum der Turing-Test neu gedacht werden muss
Die Studie zeigt auch, dass der Turing-Test selbst auf dem Prüfstand steht. Ursprünglich sollte er messen, ob Maschinen menschliche Intelligenz erreichen. Heute misst er zunehmend etwas anderes: menschenähnliches Verhalten. Bergen formuliert es treffend: Wir wissen inzwischen, dass KI viele Fragen schneller und genauer beantworten kann als Menschen. Die eigentliche Frage ist also nicht mehr Rohe Intelligenz. Stattdessen geht es darum, wie überzeugend eine Maschine menschliche Sozialverhaltensweisen imitiert.
Diese Neubewertung ist wichtig. Denn wer den Turing-Test besteht, beweist nicht zwingend Intelligenz. Stattdessen beweist er die Fähigkeit zur Täuschung. Jones nennt den Test ein Spiel über das Lügen. Genau diese Fähigkeit macht KI in den falschen Händen so gefährlich.
Was bedeutet das für die Praxis?
Die Ergebnisse sind nicht nur akademischer Natur. Sie betreffen jeden, der online mit Unbekannten kommuniziert. In Chatrooms, auf Social Media, in Kundensupports oder bei Online-Dating: Die Gewissheit, mit einem Menschen zu sprechen, gibt es nicht mehr. Zudem zeigt die Studie, dass die Gefahr nicht von durchschnittlichen KI-Systemen ausgeht. Sondern von gezielt prompting-gesteuerten Modellen, die mit wenigen Zeilen Anweisung zum perfekten Imitat werden.
Für Unternehmen und Plattformen bedeutet das: Identitätsverifikation wird zum Kernthema. Für Regulierer stellt sich die Frage, wie KI-gestützte Täuschung eingedämmt werden kann. Und für jeden Einzelnen gilt die Empfehlung von Jones: Seien Sie viel weniger zuversichtlich, dass Sie wissen, mit wem Sie online sprechen.
Diese Studie markiert einen Wendepunkt. 76 Jahre nach Turings Frage hat die KI die Antwort gegeben. Die Frage ist jetzt nur noch, wie wir damit umgehen.