Technik

Griffin setzt bei KI-Video einen neuen Maßstab

Griffin markiert einen auffälligen Schritt bei KI-gestützter Video-Interaktion. Das System wird als erstes Human Interaction Model beschrieben, das einen Video-Turing-Test bestanden hat. 44 Prozent der befragten Menschen hielten die Interaktion demnach für real. Frühere Systeme lagen bei weniger als 3 Prozent. Dazu kommt ein zweiter Punkt: Griffin steht laut den Angaben auch auf Platz 1 in einem NVIDIA-Benchmark für Full-Duplex-AI-Video.

Das klingt erst einmal nach typischer KI-Selbstdarstellung. Diesmal ist die Aussage aber härter als viele übliche Demo-Versprechen. Wenn fast die Hälfte der Testpersonen eine Video-KI für einen echten Menschen hält, geht es nicht mehr bloß um hübsche Lippenbewegungen oder gute Sprachsynthese. Dann geht es um Timing, Unterbrechungen, Blickkontakt, Reaktionsgeschwindigkeit und dieses schwer greifbare Gefühl, ob ein digitales Gegenüber wirklich präsent wirkt.

Genau da lag bisher die Schwäche vieler Systeme. Textmodelle können überzeugend schreiben. Sprachmodelle können flüssig reden. Avatare können Gesichter animieren. Aber die Mischung aus Sehen, Hören, Antworten und dabei natürlich zu wirken, in Echtzeit und ohne peinliche Pausen, war lange die eigentliche Hürde. Full-Duplex-Video heißt am Ende: reden und reagieren wie in einem echten Gespräch, nicht wie ein Sprachcomputer mit Wartezimmer-Logik.

Falls sich die Zahlen halten, ist das für mehrere Branchen wichtig. Für Kundendienst etwa, wo digitale Agenten nicht mehr wie ein roboterhaftes Callcenter-Skript wirken sollen. Für Bildung, Coaching und Vertrieb ebenso, weil dort soziale Signale einen großen Unterschied machen. Und für Unterhaltung sowieso: virtuelle Hosts, NPCs und KI-Personas werden erst dann massentauglich, wenn Gespräche nicht wie eine verkleidete Chatbot-Session wirken.

Es gibt aber noch eine zweite, unbequemere Seite. Je glaubwürdiger solche Modelle werden, desto unschärfer wird die Grenze zwischen Assistenz und Täuschung. Ein System, das in Video-Gesprächen glaubhaft menschlich wirkt, ist nicht nur ein Produktivitätswerkzeug. Es ist auch ein Instrument, das Vertrauen sehr schnell gewinnen kann. Genau deshalb sind Kennzeichnung, Einsatzregeln und klare Produktgrenzen kein Nebenthema. Sie gehören direkt an den Anfang.

Technisch ist der Begriff Human Interaction Model bemerkenswert. Er deutet auf eine Verschiebung hin: weg vom einzelnen Sprachmodell, hin zu Systemen, die menschliche Interaktion als Ganzes nachbilden sollen. Also nicht nur Sprache generieren, sondern Verhalten. Wer in diesem Feld vorn liegt, baut nicht einfach bessere Avatare. Er baut Schnittstellen, die klassische Apps, Menüs und Support-Prozesse an vielen Stellen ersetzen könnten.

Ob Griffin den Vorsprung halten kann, ist offen. In diesem Markt werden Benchmarks schnell gejagt und schnell überholt. Der wichtige Punkt ist ein anderer: Die Messlatte hat sich verschoben. Bei Video-KI reicht es nicht mehr, irgendwie zu sprechen und zu lächeln. Jetzt zählt, ob Menschen für einen Moment vergessen, dass sie mit einer Maschine reden.