Wenn KI der Wirklichkeit misstraut: Was hinter dem „Press X to Doubt“-Eval steckt
Der Name ist zugespitzt, das Ergebnis unangenehm klar: In einem viel diskutierten „Press X to Doubt“-Eval wurden 14 KI-Modelle so getestet, als befänden sie sich im September 2026. Dann bekamen sie 20 Ereignisse vorgelegt, die in diesem Jahr tatsächlich passiert sind – ohne Zugriff auf Websuche. Im Schnitt gaben die Modelle der Realität nur eine Wahrscheinlichkeit von 36 Prozent.
Das ist mehr als ein netter Internet-Benchmark. Es legt einen wunden Punkt aktueller KI offen: Sprachmodelle sind gut darin, plausibel zu klingen. Aber sie haben oft kein belastbares Bild davon, was in der Welt tatsächlich passiert ist, wenn frische Informationen fehlen.
Das Problem ist nicht nur Halluzination. Es ist Weltbezug.
Bei klassischen KI-Fehlern geht es oft um erfundene Fakten, falsche Zitate oder unsaubere Zahlen. Der Befund hier liegt etwas anders. Die Modelle wurden nicht dabei erwischt, irgendetwas frei zu erfinden. Sie misstrauten echten Ereignissen, weil diese für sie offenbar weniger wahrscheinlich wirkten als das, was aus ihrem trainierten Erwartungsmuster heraus „normal“ klingt.
Genau das ist für den Alltag mit KI wichtig. Viele Nutzer behandeln Modelle noch immer wie Wissensmaschinen. In Wahrheit arbeiten sie zuerst mit statistischer Plausibilität. Wenn eine reale Entwicklung neu, ungewöhnlich oder politisch schwer einzuordnen ist, kann ein Modell sie wie eine schlechte Fälschung behandeln.
Warum solche Tests gerade jetzt Aufmerksamkeit bekommen
Die Debatte kommt nicht aus dem Nichts. Rund um aktuelle KI-Systeme laufen seit Monaten neue Vergleiche zu Halluzinationsraten, Benchmark-Sättigung und der Frage, wie aussagekräftig bestehende Tests überhaupt noch sind. Der alte Reflex der Branche war oft simpel: besseres Modell, höhere Punktzahl, Problem kleiner. So einfach ist es nicht.
Der „Press X to Doubt“-Ansatz trifft deshalb einen Nerv. Er prüft nicht nur Sprachgewandtheit oder Aufgabenlösung, sondern eine sehr praktische Fähigkeit: Kann ein Modell glaubhaft einschätzen, dass die Welt sich weitergedreht hat – auch ohne frischen Abruf von Informationen?
Für viele produktive Systeme ist das keine Nebensache. Wer KI in Recherche, Assistenz, Analyse oder Agenten-Workflows einsetzt, braucht Modelle, die Unsicherheit sauber handhaben. Wenn ein System reale Entwicklungen systematisch unterschätzt, entsteht ein stiller Fehler. Das Modell klingt vernünftig, liegt aber an der Gegenwart vorbei.
36 Prozent sind als Signal heftiger als als exakte Messlatte
Natürlich ist so ein Eval kein Naturgesetz. Auswahl der Ereignisse, Formulierung der Prompts und Zusammensetzung der Modelle beeinflussen das Ergebnis. Die Zahl 36 Prozent sollte man daher nicht wie einen TÜV-Wert lesen.
Als Signal ist sie trotzdem stark. Denn selbst wenn man über das genaue Setup streiten will, bleibt der Kern bestehen: Ohne aktuellen Zugriff auf Außenwelt und ohne belastbare Mechanismen zur Kalibrierung geraten viele Modelle ins Schlingern, sobald Wirklichkeit nicht in ihr Erwartungsraster passt.
Das ist auch ein Hinweis auf ein tieferes Architekturproblem. Große Sprachmodelle sind keine lebenden Wissensspeicher. Sie haben kein eingebautes Gegenwartsbewusstsein. Ohne Retrieval, Webzugriff oder andere Formen externer Verankerung bleiben sie in einem Sprachraum gefangen, der Vergangenes verallgemeinert und Neues nur rät.
Was das für Nutzer und Anbieter heißt
Für Nutzer ist die Konsequenz ziemlich direkt: Wer ein Modell ohne externe Anbindung nach aktuellen Ereignissen fragt, bekommt keine verlässliche Weltprüfung, sondern eine Plausibilitätsmaschine. Das kann im Alltag reichen. Bei Politik, Wirtschaft, Sicherheit oder Medizin reicht es eben nicht.
Für Anbieter ist die Sache heikler. Der Wettlauf um Benchmarks und Agentenfähigkeiten hilft wenig, wenn Modelle bei realen Entwicklungen falsch kalibriert sind. Systeme müssen nicht nur Antworten erzeugen. Sie müssen auch besser markieren, wann ihnen der Boden unter den Füßen fehlt.
Genau dort trennt sich Demo-KI von Werkzeug-KI. Ein Modell, das schön formuliert, aber echte Ereignisse für unwahrscheinlich hält, ist kein guter Navigator durch die Gegenwart. Es ist ein redegewandter Zweifler.
Der Hype um das Eval kommt also nicht bloß von einer zugespitzten Zahl. Er kommt daher, dass der Test etwas sichtbar macht, was viele im Alltag mit KI längst spüren: Sprachmodelle wirken oft souverän, solange man sie nicht hart mit Realität konfrontiert.


