El PDF ya no basta: científicos convierten artículos en agentes de IA funcionales

El PDF ya no basta: científicos convierten artículos en agentes de IA funcionales

Paper2Agent ejecuta cálculos de artículos científicos, comprueba el código y aplica sus métodos a nuevos datos.

image

Investigadores presentaron Paper2Agent, un sistema que convierte un artículo científico convencional en un agente de IA funcional. En lugar de leer un PDF, buscar el código fuente y ajustar manualmente programas, el investigador puede formular una pregunta en lenguaje natural, pedir reproducir un cálculo o aplicar el método descrito a nuevos datos. Los autores consideran este enfoque como una posible nueva forma de publicar investigaciones computacionales, aunque por ahora el sistema no reemplaza a los artículos tradicionales.

Paper2Agent no funciona como un chatbot al que simplemente se le carga el texto del artículo. El sistema compila la propia publicación, materiales suplementarios, conjuntos de datos, código fuente y flujos de trabajo listos, y transforma los métodos de los autores en un conjunto de herramientas ejecutables. Como resultado, la IA puede no solo relatar el contenido, sino ejecutar los cálculos descritos en el trabajo.

La capa de conexión es el protocolo de contexto del modelo (MCP), destinado a conectar modelos de lenguaje con datos externos y herramientas de software. Paper2Agent crea automáticamente un servidor MCP para un artículo concreto. En el servidor se incluyen funciones para cálculos, materiales fuente e instrucciones que describen la secuencia correcta de acciones. Luego se puede conectar un agente de IA compatible al servidor y trabajar con el artículo mediante diálogo.

Antes de publicar las herramientas listas, el sistema las verifica con ejemplos del trabajo original. Paper2Agent ejecuta el código, compara los resultados numéricos y las imágenes con los referentes, intenta corregir errores del entorno y dependencias. Si una función no supera la verificación tras varios intentos, el sistema la excluye del conjunto final. Este enfoque debería reducir el riesgo de que un modelo de lenguaje invente código verosímil pero incorrecto en lugar del método real de los autores.

Una de las pruebas fue AlphaGenome, un sistema para predecir el efecto de cambios en el ADN. Paper2Agent creó para este sistema 22 herramientas en aproximadamente 45 minutos, y cada una superó la verificación automática. Los autores estimaron que el costo de preparar el agente una sola vez es de aproximadamente 14 USD en un ordenador personal común. Tras la creación, el investigador podía, por ejemplo, describir una variante genética en lenguaje natural y pedir al sistema que evaluara su posible impacto en la expresión génica, el empalme o la accesibilidad de la cromatina en tejidos seleccionados.

En uno de los experimentos, el agente reexaminó la asociación de una variante genética con los niveles de colesterol de lipoproteínas de baja densidad. El trabajo original destacaba los genes CELSR2 y PSRC1, mientras que el agente colocó en primer lugar a SORT1. Una comprobación adicional con datos independientes de expresión génica respaldó la asociación de la variante con SORT1 en hígado. Los autores subrayan que tal discrepancia no invalida automáticamente la conclusión inicial, pero muestra la posibilidad de revisar rápidamente interpretaciones publicadas mediante los mismos métodos computacionales.

Otro experimento mostró cómo varios agentes pueden trabajar de forma conjunta. El sistema combinó métodos y datos de tres estudios distintos para encontrar un gen potencialmente asociado con una variante de riesgo de psoriasis. La IA propuso diez formas de comprobación, tras lo cual una persona eligió el análisis de correlación. Los cálculos posteriores señalaron a GPR137 como el candidato más probable bajo ciertas condiciones de activación celular. Los autores consideran el resultado un ejemplo de un nuevo esquema de análisis de datos, pero no una prueba biológica definitiva de causalidad.

Al evaluar una muestra mayor, la automatización no funcionó para todos los artículos. De 100 trabajos computacionales en biología se pudo construir un agente completo para 74. Las principales causas de fracaso fueron código ausente o que no funcionaba, datos y modelos faltantes, problemas de dependencias y scripts que no se podían adaptar correctamente a otras entradas. Según los autores, la propia posibilidad de transformar automáticamente una publicación en un agente ejecutable puede convertirse en una forma de verificar la reproducibilidad de la investigación.

En 300 preguntas formuladas a partir de ejemplos de estos trabajos, Paper2Agent con el modelo Sonnet 4 alcanzó una precisión del 91,2%. El mismo modelo con acceso directo al artículo y al repositorio obtuvo 80,3%, y la versión más reciente, Sonnet 4.6, en un modo similar alcanzó 86,3%. En una verificación separada con 42 tareas ejecutables extraídas de diez trabajos sobre inteligencia artificial, estadística, econometría, teoría de juegos y astrofísica, la precisión media de Paper2Agent fue del 98,1%.

También es posible transformar artículos que no tengan código ejecutable, pero las capacidades de ese agente serán más limitadas. En ese caso, Paper2Agent crea un almacenamiento estructurado de texto, tablas, figuras y materiales suplementarios, mediante el cual la IA puede buscar información y cotejar distintas partes de la publicación. En 100 tareas de este tipo, el sistema obtuvo un 89% de respuestas correctas.

Los resultados altos no significan que la IA haya aprendido a establecer por sí sola la verdad científica. Los autores advierten aparte que las pruebas miden, ante todo, la capacidad de reproducir correctamente cálculos existentes. En preguntas científicas abiertas caben varias interpretaciones, por lo que la elección de la dirección de investigación, la evaluación de las pruebas y las conclusiones finales deben quedar en manos humanas.

La limitación clave de Paper2Agent muestra a la vez por qué la idea puede ser importante para las publicaciones científicas. El agente funciona bien cuando el artículo va acompañado de código comprensible, datos accesibles y un proceso de análisis reproducible. El PDF con este enfoque no desaparece, pero deja de ser la única manera de transmitir el resultado: junto al texto, el investigador obtiene una versión interactiva del trabajo, capaz de mostrar sus propios cálculos en acción. Código del proyecto publicado abiertamente.