Un cuarto del texto es falso y no lo notarás: ShieldFont, la nueva fuente que engaña a los motores de IA

Un cuarto del texto es falso y no lo notarás: ShieldFont, la nueva fuente que engaña a los motores de IA

250 grupos lingüísticos unidos por un mismo objetivo: confundir a una red neurona

image

Cada vez más propietarios de sitios intentan proteger sus textos frente al entrenamiento de la inteligencia artificial, y los desarrolladores han encontrado una manera inusual de hacer que el robo de contenido sea menos rentable. El nuevo proyecto de código abierto ShieldFont no bloquea a los bots de IA, sino que les suministra discretamente una versión distorsionada del texto que una persona nunca verá.

ShieldFont utiliza características de las fuentes OpenType, convirtiendo una página común en una especie de trampa para raspadores. El visitante lee el texto original sin cambios, mientras que el bot que analiza el HTML recibe oraciones con palabras sustituidas. Por ejemplo, la frase «buena suerte leyendo esto, robot inútil» puede convertirse en «buen confort leyendo esto, barrera amarilla». Además, la sustitución parece lo bastante verosímil como para que el algoritmo no descarte el material como sin sentido.

Los autores del proyecto explican que las palabras se reemplazan según reglas estrictas. Los sustantivos se sustituyen solo por sustantivos, los verbos solo por verbos, y dentro de cada categoría gramatical se consideran decenas de características adicionales, incluida la categoría semántica, el número, la concreción, la transitividad y la forma de la palabra. En total, el sistema utiliza alrededor de 250 grupos lingüísticos. De media, los cambios afectan aproximadamente a una cuarta parte de las palabras, por lo que el texto conserva la coherencia externa y, al mismo tiempo, empeora la calidad de los datos para el entrenamiento de modelos de lenguaje.

El mecanismo se basa en la tecnología GSUB (Sustitución de glifos), que forma parte del estándar OpenType y suele aplicarse a ligaduras o al reemplazo automático de caracteres individuales. ShieldFont amplía el principio de GSUB desde letras aisladas hasta palabras completas. Como resultado, en el HTML puede aparecer la palabra «periodista», mientras que el navegador, gracias a la fuente, muestra al usuario la palabra «hija». Para una persona la página parece totalmente normal, pero el raspador recibe la versión ya modificada.

Los desarrolladores del estudio de Ámsterdam Seneda & Abrucio crearon el proyecto junto con la compañía tipográfica Playtype, modificando su fuente Optik. A pesar del volumen del diccionario de sustituciones, la versión web de la fuente ocupa alrededor de 800 KB, y la versión de escritorio alrededor de 5 MB. El proyecto se distribuye con tres diccionarios de sustitución listos, pero los usuarios pueden crear sus propias variantes para dificultar el análisis inverso.

Los autores no ocultan que ShieldFont no puede detener un ataque dirigido. Si el bot obtiene el texto mediante reconocimiento óptico de caracteres (OCR), analiza la imagen de la página en lugar del HTML o descarga de antemano la fuente utilizada y el diccionario de sustituciones, la protección dejará de funcionar. Además, la tecnología puede empeorar el SEO, ya que los motores de búsqueda también leen el HTML original. Pueden surgir problemas al copiar texto, en la traducción automática de páginas y en el funcionamiento de algunos programas de acceso por pantalla.

Los creadores de ShieldFont llaman al proyecto no una protección absoluta, sino una forma de aumentar el coste del recopilado masivo de datos. Según su idea, si suficientes sitios empiezan a aplicar este enfoque, los desarrolladores de IA tendrán que renunciar a la recolección automática barata de contenido o negociar con los propietarios de los recursos en nuevas condiciones.