Participantes conversaron con un avatar digital sin sospechar que se trataba de una suplantación.

Casi la mitad de los participantes en el experimento de Tavus, tras una videollamada de un minuto, decidió que había conversado con una persona real, aunque el rostro, la voz y las respuestas del interlocutor en tiempo real las generó la inteligencia artificial Griffin-Lite. De 54 personas, 26 no reconocieron la máquina, es decir el 48%, y los desarrolladores calificaron el resultado como la primera superación de la versión en vídeo de la prueba de Turing en una conversación en directo.
Los participantes de EE. UU. y Europa fueron reclutados a través de una plataforma de investigación independiente. Se les informó de que el sistema les conectaría con otro participante para una conversación de un minuto sobre planes y expectativas para el año. Al otro lado de la videollamada estaba Griffin-Lite, que por sí mismo generaba el rostro, la voz y las respuestas de la interlocutora. A los participantes no se les informó de la presencia de IA con antelación.
Tras la llamada, los participantes relataron la respuesta del interlocutor y evaluaron la naturalidad de la comunicación, la confianza en la otra persona, la fluidez de la conversación y la sensación de que realmente los escuchaban. Solo al final de la encuesta los organizadores preguntaron si había surgido la idea de que el interlocutor podría ser una inteligencia artificial. Al terminar el experimento se les reveló la sustitución a todos.
Las personas que confundieron a Griffin-Lite con un humano estaban seguras de su respuesta en un 79% de media. Los participantes que reconocieron la IA evaluaron su confianza en un 81%. Más de la mitad de los voluntarios durante la conversación no consideraron en absoluto una posible sustitución, y las sospechas en el resto suelen aparecer en los primeros 20 segundos.
Tavus comparó Griffin-Lite con su sistema anterior, en el que modelos separados se encargaban de la imagen, de percibir al interlocutor y de dirigir la conversación. En una prueba análoga, el sistema anterior fue tomado por humano solo por uno de 41 participantes, es decir el 2,4%.
Los desarrolladores vinculan la principal diferencia de Griffin-Lite con la forma en que el modelo conduce la conversación. Una IA de voz habitual a menudo funciona por turnos: primero escucha la intervención, luego reconoce el habla, prepara la respuesta y solo después comienza a hablar. Griffin-Lite continúa simultáneamente mirando, escuchando y generando su propia reacción. El modelo puede asentir durante la frase de otra persona, mantener una pausa, empezar a responder sin un largo silencio o detenerse si la persona lo interrumpe.
La imagen también se crea de forma continua, en vez de ensamblarse con vídeos pregrabados. Griffin-Lite entrega vídeo en resolución 720p en fragmentos de aproximadamente 320 ms. En aceleradores Nvidia H100 la latencia desde la llegada del sonido hasta la reacción facial correspondiente en el vídeo fue de media 0,43 segundos. Según Tavus, el sistema también tiene en cuenta la mirada, la expresión facial, las pausas y los movimientos frente a la cámara, por lo que la conversación depende no solo de las palabras reconocidas.
La capacidad para trabajar con señales no verbales se comprobó por separado en el banco de pruebas independiente VideoFDB, construido a partir de 237 fragmentos de videollamadas reales. La prueba evalúa si el modelo detecta pausas, la mirada, la expresividad y otras señales, así como cuán natural responde con voz e imagen. Griffin-Lite obtuvo 3,73 puntos de cinco en la percepción de lo ocurrido, frente al estándar humano de 4,20, y 3,83 puntos en sus propias reacciones, con un resultado humano de 3,92.
No obstante, el 48% por ahora no demuestra que sea imposible distinguir a Griffin-Lite de una persona en la vida cotidiana. El experimento fue organizado por la propia Tavus, la muestra consistió solo en 54 personas, la conversación duró un minuto y a los participantes se les dijo de antemano que el interlocutor sería otra persona. Se desconoce si el resultado se mantendría en una conversación de diez minutos, al abordar un tema complejo, al comunicarse en otros idiomas o en una situación en la que el usuario desde el principio intenta desenmascarar a la IA.
Por sí mismo, la prueba de Turing tampoco la supera Griffin por primera vez. Modelos de texto ya han convencido a interlocutores de su humanidad con aún mayor frecuencia. La novedad del experimento de Tavus radica precisamente en la videoconferencia, donde la máquina debe mantener simultáneamente de forma plausible el habla, la voz, la expresión facial, la mirada y el ritmo de una conversación real.
Tavus por ahora no ha abierto Griffin-Lite a clientes habituales y suministra la versión de investigación solo a un grupo limitado de probadores. Los desarrolladores reconocen abiertamente el riesgo: el sistema, capaz de representar convincentemente a una persona en una videollamada, obtiene a la vez una herramienta potente para el engaño. Antes de un lanzamiento más amplio, la empresa planea añadir mecanismos que informen de forma explícita al interlocutor de que se trata de una inteligencia artificial.