Integran un modelo de IA de 2.000 millones de parámetros directamente en unas gafas inteligentes

Integran un modelo de IA de 2.000 millones de parámetros directamente en unas gafas inteligentes

El modelo percibe el entorno y responde sin tener que recurrir a la nube.

image

Dos mil millones de parámetros ahora no caben en un bastidor de servidores ni siquiera en un teléfono inteligente, sino directamente en la montura de unas gafas. PrismML presentó el modelo multimodal Bonsai, que funciona localmente en gafas inteligentes con la plataforma Qualcomm Snapdragon AR1 Gen 1 y es capaz de interpretar en tiempo real lo que ve el usuario.

El modelo combina una parte lingüística de 1,7 mil millones de parámetros y un codificador visual de otros 0,3 mil millones. La cámara transmite la imagen a la IA local, tras lo cual el usuario puede preguntar sobre los objetos frente a sus ojos y recibir una respuesta sin tener que enviar la consulta a la nube. Este escenario acerca las gafas inteligentes al papel de asistente personal constante, y no solo al de cámara o auricular.

La característica principal de Bonsai no está en el número de parámetros, sino en cómo se almacenan los pesos del modelo. La parte lingüística usa una representación de 1 bit, mientras que el codificador visual permanece en 4 bits. Por eso sería inexacto llamar a todo el sistema de dos mil millones completamente de 1 bit.

Según las pruebas de Qualcomm, los pesos de la parte lingüística ocupan alrededor de 0,43 GB en lugar de 1,66 GB en la versión comparable de 4 bits. La reducción, casi de cuatro veces, permitió ejecutar un modelo considerablemente mayor con las mismas limitaciones de memoria. En la plataforma de prueba con 4 GB de memoria y un rendimiento de hasta 6 TOPS, la velocidad de generación alcanzó 15,36 tokens por segundo frente a 7,44 en la versión de 4 bits. Una carrera similar por trasladar la IA local desde la nube al hardware compacto ya está en marcha en otras categorías de dispositivos.

Para las gafas el ahorro es especialmente valioso. En una montura delgada hay poco espacio para memoria y batería, y el calor excesivo pronto se convierte en un problema. PrismML, junto con Qualcomm, optimizó la arquitectura para el neuroprocesador Hexagon, con el fin de reducir el volumen de datos y acelerar el procesamiento sin conexión continua con el centro de datos.

Los números anunciados por ahora deben considerarse como resultados de pruebas controladas. Pruebas de PrismML y Qualcomm se realizaron en configuraciones especiales, incluyendo una versión interna del paquete de software QNN con soporte para cálculos de 1 bit. Los desarrolladores advierten que la velocidad depende de la configuración del modelo, del software y de la carga.

La tecnología aún no ha llegado al producto en serie. Ni PrismML ni sus socios han presentado gafas de consumo con Bonsai, por lo que la demostración actual muestra una posibilidad técnica, no un dispositivo listo. No se han anunciado todavía gafas comerciales con ese modelo.

Hace apenas dos días, Qualcomm mostró otra escala de modelos locales: el nuevo procesador móvil es capaz de ejecutar IA de 30 mil millones de parámetros directamente en un teléfono inteligente. En las gafas, el volumen de memoria disponible y el consumo de energía son mucho más restrictivos, por eso la apuesta de PrismML no es por el tamaño absoluto, sino por la máxima compresión.

Otra experimentación muestra hasta qué punto ha avanzado la miniaturización. En agosto, el desarrollador lanzó una red neuronal en un microcontrolador que costaba menos de $10. En ese contexto, 2 mil millones de parámetros dentro de unas gafas parecen otro paso hacia una IA que cada vez más trabaja junto al usuario, y no en un servidor remoto.