Technik

Humanity’s Sixth Sense legt offen, wie weit KI bei visuellem Alltagsverständnis noch zurückliegt

Mit Humanity’s Sixth Sense kommt ein neuer Benchmark auf den Tisch, der ein oft übersehenes Problem moderner KI sehr sauber freilegt: Systeme können Bilder beschreiben, Muster erkennen und in vielen Tests gut aussehen. Beim intuitiven visuellen Denken brechen sie aber noch immer deutlich ein.

Genau darum geht es hier. Der Benchmark prüft offene Aufgaben zu Bildern und Videos – insgesamt 522 Tasks – und deckt dabei mehrere Ebenen ab: räumliches Denken, kausales Verstehen und soziales Erfassen von Situationen. Also Dinge, die Menschen im Alltag meist ohne bewusste Anstrengung leisten.

Die Ergebnisse sind klar. Menschen kommen auf 93,1 Prozent. Das stärkste genannte Modell, GPT-6-astra, erreicht 53,6 Prozent. Der Median der getesteten Modelle liegt bei 30,9 Prozent. Das ist kein kleiner Abstand. Das ist eine andere Liga.

Warum dieser Benchmark mehr ist als nur eine weitere Rangliste

Viele bekannte KI-Tests belohnen trainierte Routinen: Texterkennung, Wiedererkennen, Standardmuster, Aufgaben mit engem Antwortkorridor. Humanity’s Sixth Sense setzt an einer Stelle an, an der Maschinen oft unsicher werden: wenn aus einem Bild nicht nur Objekte gelesen, sondern Zusammenhänge verstanden werden müssen.

Ein Modell muss dann eben nicht nur sehen, dass ein Mensch an einem Tisch sitzt. Es muss auch begreifen, was als Nächstes passieren könnte, welche Ursache zu welcher Folge passt oder welche soziale Situation gerade vorliegt. Genau dort zeigt sich, ob ein System Weltverständnis hat – oder nur sehr gutes Pattern Matching.

Der Abstand zu Menschen ist zu groß, um ihn wegzuerklären

93,1 zu 53,6 Prozent: Diese Differenz ist hart. Vor allem deshalb, weil es hier nicht um exotische Wissenschaftsaufgaben geht, sondern um Fähigkeiten, auf denen viele Hoffnungen für multimodale KI aufbauen. Wer Assistenten, Agenten oder Roboter in echte Umgebungen schicken will, braucht mehr als Objekterkennung. Er braucht robuste visuelle Intuition.

Der Medianwert von 30,9 Prozent macht das Problem noch deutlicher. Es geht also nicht nur darum, dass selbst das beste Modell noch weit von Menschen entfernt ist. Es heißt auch: Ein großer Teil des Feldes hat in diesem Bereich noch nicht einmal ein solides Grundniveau.

Was das für den KI-Markt bedeutet

Der neue Benchmark trifft einen wunden Punkt der Branche. Viele Produktdemos vermitteln den Eindruck, multimodale Modelle könnten visuelle Szenen schon ziemlich tief verstehen. In kontrollierten Vorführungen mag das oft so aussehen. Unter offeneren Bedingungen mit räumlichen, kausalen und sozialen Fragen fällt die Leistung aber deutlich ab.

Das hat direkte Folgen für Anwendungen:

  • KI-Assistenten können Bild- oder Videosituationen falsch deuten.
  • Autonome Systeme stoßen bei unklaren Alltagsszenen schneller an Grenzen.
  • Robotik bleibt auf verlässliche menschliche Kontrolle angewiesen.
  • Enterprise-Tools für Analyse, Sicherheit oder Support brauchen harte Absicherungen, wenn visuelle Urteile eine Rolle spielen.

Wer solche Systeme einkauft oder integriert, sollte diese Lücke nicht als Randnotiz behandeln. Sie betrifft genau die Momente, in denen ein Modell nicht nur antworten, sondern eine Situation richtig erfassen muss.

Ein wichtiger Reality-Check für die AGI-Debatte

Der Benchmark ist auch ein nützlicher Kontrapunkt zur oft überhitzten Debatte über allgemeine Intelligenz. Sprachmodelle wirken schnell kompetent, weil sie flüssig formulieren und in vielen Wissensaufgaben stark sind. Visuelles Alltagsverständnis ist aber ein härterer Test. Hier geht es um implizites Wissen, räumliche Logik, Ursache und Wirkung und soziale Feinheiten.

Dass Menschen in diesem Setup fast doppelt so stark abschneiden wie das beste Modell, erinnert an etwas Simples: Sprachgewandtheit ist noch kein tiefes Weltverständnis.

Humanity’s Sixth Sense ist deshalb kein PR-Nebenprodukt, sondern ein Benchmark mit echter Aussagekraft. Er misst einen Bereich, in dem sich entscheidet, wie zuverlässig KI außerhalb sauberer Demo-Szenen wirklich ist. Das Ergebnis fällt klar aus: Bei intuitivem visuellen Denken bleibt der Mensch vorerst sehr deutlich vorn.