Llega la versión de código abierto de Claude Science: cero dependencias, licencia MIT y más de 30 Skills de investigación incorporados

marsbitPublicado a 2026-08-04Actualizado a 2026-08-04

Resumen

OpenAI4S (Open AI for Scientist), un agente de investigación de IA de código abierto con licencia MIT y cero dependencias, ha sido lanzado por el Laboratorio Conjunto de la Universidad de Pekín y YuanAI. Este proyecto replica el enfoque "Code-as-Action" de Claude Science, permitiendo que la IA ejecute código Python/R en un kernel persistente para automatizar flujos completos de investigación: búsqueda de literatura, descarga y limpieza de datos, análisis, visualización y generación de informes. Incluye más de 30 "Skills" preconstruidos para áreas como análisis de proteínas, biología computacional y minería de datos científicos, 14 de los cuales requieren GPU. Aplica una política estricta de "no fabricación", utilizando únicamente datos y cálculos reales, y admite la integración con entornos de computación privados (por ejemplo, clústeres de GPU) para tareas especializadas. Diseñado como una plataforma colaborativa entre humanos e IA, OpenAI4S versiona todos los resultados y permite modificaciones mediante lenguaje natural. El proyecto invita a contribuciones de la comunidad para ampliar sus capacidades a más disciplinas científicas.

Claude Science, quizás hayas oído hablar de él.

Ese agente de investigación de Anthropic que puede buscar literatura por sí mismo, escribir código, ejecutar análisis y generar gráficos e informes, ha hecho que la gente exclame "¡Así es como debe ser la IA para la Ciencia!".

Pero es de código cerrado.

Ahora, alguien lo ha recreado: de código abierto, licencia MIT, y núcleo con cero dependencias.

El proyecto se llama OpenAI4S (Open AI for Scientist), un proyecto de agente inteligente de investigación liberado oficialmente por el Laboratorio Conjunto de la Universidad de Pekín y YuanAI Agent.

Punto clave: no es solo "parecido" a Claude Science, sino que, siguiendo la idea de Code-as-Action, ha recreado de forma independiente y en código abierto el motor, el núcleo persistente, el protocolo host-RPC y la capa de seguridad.

El proyecto se liberó en GitHub el 6 de julio de 2026 bajo la licencia MIT.

Actualmente, OpenAI4S ofrece una aplicación web de investigación completa, docenas de Skills incorporados, capacidad de conexión a recursos computacionales propios y versionado de los resultados de investigación.

YuanAI Science: https://www.chatexcel.com/homesite/openAI4S

No se conforma con dar una respuesta que parezca correcta, sino que pretende que la IA entre verdaderamente en el flujo de trabajo de investigación, llevando un problema desde su "planteamiento" hasta su "finalización".

No es charlar unas cuantas rondas más, sino hacer que la IA realmente actúe

Muchos agentes de IA actuales hacen esencialmente lo mismo: el modelo, frente a un "menú de herramientas" preparado de antemano, decide qué herramienta invocar y avanza paso a paso. Para tareas simples, este método sirve.

Pero la investigación no es algo que se pueda resolver en tres o cinco pasos.

Consultar múltiples bases de datos, descargar datos, limpiarlos, modificar código repetidamente, invocar algoritmos especializados, solicitar potencia de GPU, generar gráficos, preparar informes... Cualquier paso que falle puede requerir volver atrás.

La respuesta de OpenAI4S es Code-as-Action, es decir, "el código es la acción".

Hace que el agente genere directamente código Python o R y lo ejecute en un entorno de kernel en ejecución continua.

Bucles, condicionales, procesamiento por lotes de datos y gráficos pueden combinarse en una sola ejecución; los datos y resultados intermedios no tienen que pasarse nuevamente al modelo en cada paso, sino que se conservan en el entorno de trabajo.

Para el usuario, el cambio más directo no es un término técnico más, sino que la IA puede encadenar tareas más largas y complejas:

Los datos descargados en un paso anterior pueden pasarse directamente para análisis en el siguiente;

Las imágenes, tablas e informes generados se guardan automáticamente;

Los investigadores también pueden abrir el Notebook en cualquier momento para revisar el código, tomar el control del análisis o modificar resultados.

"El código es la acción, el kernel es el entorno."

En una única interfaz, completar el flujo de investigación desde los datos hasta la conclusión

OpenAI4S se parece más a una mesa de trabajo de investigación compartida entre humanos e IA.

Le das una tarea y ella puede buscar por sí misma en fuentes de datos de investigación pública, escribir y ejecutar código de análisis, invocar capacidades de cálculo especializadas y organizar los resultados en imágenes, tablas, estructuras tridimensionales o informes en Markdown.

Todo el proceso no se desvanece al terminar. Cada resultado de investigación se registra, guarda y versiona, facilitando su revisión, modificación y reutilización posteriores.

Por ejemplo, pídele que analice una proteína.

Puede ir primero a buscar datos reales de secuencia y estructura de proteínas, luego completar el cálculo de características y la visualización, y finalmente escribir todo el proceso de análisis, las fuentes de datos y los resultados en un artículo.

Lo clave: los datos son reales y el cálculo también es real.

Si no se puede conectar a un servicio externo, o si las condiciones de cálculo no están disponibles, te dirá claramente qué no se puede hacer. No te colará datos simulados a escondidas, ni mucho menos inventará un resultado para completar el artículo a la fuerza.

La investigación a menudo también requiere modificaciones repetidas.

En el flujo tradicional, los investigadores podrían tener que volver a encontrar el script de gráficos, modificar parámetros, ejecutarlo de nuevo y exportar el archivo;

En OpenAI4S, se puede pedir directamente en lenguaje natural el ajuste deseado. El agente regenerará el resultado basándose en los datos y código existentes, manteniendo al mismo tiempo el historial de versiones.

Decenas de Skills de investigación, incorporando capacidades profesionales al agente inteligente

Para que un modelo genérico se convierta en un asistente de investigación, solo con "ser listo" no basta.

Tiene que saber dónde buscar datos profesionales, cómo usar herramientas especializadas y cómo ejecutar algoritmos complejos.

OpenAI4S incorpora de serie más de 30 Skills de investigación.

Análisis de estructura y secuencia de proteínas, diseño de proteínas, acoplamiento molecular, análisis de células individuales, búsqueda de literatura, búsqueda de datos abiertos... Cubre básicamente una serie de escenarios comunes de investigación computacional.

Entre ellos, 14 Skills encapsulan capacidades de cálculo científico que requieren GPU o modelos especializados.

Estos Skills no son una tabla fija de parámetros de herramientas. Se parecen más a un conjunto de "recetas de código" que el agente inteligente puede leer, comprender y ejecutar.

Qué datos se necesitan, qué servicios se invocan, cómo se escribe el código, cómo se revisan los resultados, todo puede quedar plasmado en un Skill.

Cuando en el futuro haya nuevas bases de datos, algoritmos o flujos experimentales, los desarrolladores pueden seguir integrándolos.

Es decir, esta capacidad no está sellada de una vez por todas; puede crecer junto con la evolución de las necesidades de investigación.

¿Los datos de investigación necesitan conectarse a un entorno de cálculo real? Envía la tarea a tu propia GPU

El cálculo científico tiene otro problema muy real: la capacidad de cálculo.

Tareas como el plegamiento de proteínas, puntuación de mutaciones o simulaciones moleculares no se pueden completar ejecutando un par de veces en un portátil común.

Además, muchos cálculos profesionales dependen de modelos específicos, entornos de software complejos y recursos de GPU.

OpenAI4S soporta la conexión a entornos de cálculo propios. La interacción y organización de tareas se gestionan localmente, mientras que los cálculos profesionales que requieren GPU pueden enviarse para su ejecución en servidores propios. Una vez terminados, los resultados regresan al mismo flujo de trabajo de investigación.

Por ejemplo, para la predicción de estructuras de proteínas y la puntuación de efectos de mutaciones, lo realmente difícil a menudo no es generar el código de llamada, sino llevar la entrada al entorno de cálculo correcto y traer de vuelta los resultados completos al flujo de trabajo.

No es necesario apretujar todo en un solo ordenador, ni reescribir todo el flujo para conectar un servidor de cálculo. Esto es especialmente importante para laboratorios y equipos de investigación.

Los datos, modelos y potencia de cálculo pueden permanecer en tu propio entorno; el agente inteligente se encarga de conectarlos.

Datos reales, cálculo real; realmente no inventa

¿A qué se teme más al usar modelos baratos para investigación? A que inventen con seriedad.

OpenAI4S establece una regla estricta llamada no-fabrication policy (política de no falsificación): usar np.random para simular resultados experimentales, inventar "conservación", hacer pasar BLOSUM por ESM, usar conjuntos de datos simulados como si fueran reales... todo prohibido.

O servicio real, o informar honestamente del error.

Por eso, si miras el caso de la INS, la secuencia se extrajo realmente de UniProt, la estructura se descargó realmente de RCSB; si no puede conectarse a internet, lo omite honestamente, sin inventarte nada falso.

Si realmente hay que calcular una estructura proteica, realmente invoca una GPU: host.fold se conectará por SSH a una máquina con 8×A100, ejecutará la inferencia de Protenix (nivel AlphaFold3) para una secuencia única y devolverá la estructura con pLDDT; host.score_mutations ejecutará la puntuación real con ESM para seleccionar mutaciones.

¿Sin GPU configurada? Entonces simplemente informará del error, sin inventarte una estructura falsa.

Prefiere decirte "no se puede calcular" antes que inventarte una estructura falsa que parezca plausible.

Para un agente de investigación, esto puede ser más importante que "saber hacer de todo".

El código abierto es una práctica del laboratorio conjunto de la Universidad de Pekín y YuanAI para promover la colaboración entre industria, academia e investigación

El lanzamiento de OpenAI4S no es solo añadir un proyecto de código abierto, sino también una práctica de la Universidad de Pekín y YuanAI para promover la colaboración entre industria, academia e investigación.

Como resultado de una fase del laboratorio conjunto, el desarrollo y liberación de OpenAI4S no habría sido posible sin la dedicación y promoción continua del estudiante Zhang Gongbo del laboratorio conjunto.

La investigación de Zhang Gongbo se centra en IA para la Ciencia. Como co-primer autor de UniGenX, exploró modelos base científicos universales para moléculas, materiales y proteínas. Esta experiencia acumulada en torno a la inteligencia científica se extendió también al desarrollo y puesta en práctica de OpenAI4S.

Al mismo tiempo, OpenAI4S es fruto del esfuerzo conjunto de los compañeros del equipo Li Hao, Wang Yu, Liu Yuyang, Lü Liuzhenghao, Mao Yicheng, Lin Mujie, Peng Xinyao, Jiang Zhengxiang, Wang Yimi, entre otros, desde el diseño del marco y el desarrollo de funciones hasta la liberación en código abierto; cada etapa contó con la colaboración y aportación de todos.

YuanAI es una empresa de IA del lado del cliente, especializada en permitir que la IA complete tareas complejas en entornos locales y sin conexión a través de técnicas de posentrenamiento de modelos, Runtime de Agente, memoria a largo plazo e inferencia en el dispositivo.

Actualmente, la empresa ha formado dos líneas de producto: YuanAI Work y YuanAI Science, incursionando respectivamente en el campo del trabajo inteligente y el descubrimiento científico.

Esta liberación en código abierto de OpenAI4S también refleja el juicio compartido del laboratorio conjunto y YuanAI sobre los agentes de investigación:

Los agentes inteligentes de investigación no deben quedarse en Demos, sino convertirse en infraestructura de investigación realmente ejecutable, verificable y ampliable.

Por lo tanto, lo que se abre no son solo ejemplos, sino también la arquitectura central, los Skills de investigación y la aplicación completa.

Instituciones académicas, centros de investigación, desarrolladores y socios industriales pueden integrar en esta base fuentes de datos, algoritmos, herramientas y flujos de investigación, impulsando juntos que los agentes de investigación entren en más tareas reales.

Bienvenido a ejecutarlo, y también a seguir desarrollándolo juntos

Para participar en OpenAI4S, puedes empezar por ejecutarlo.

La instalación no es complicada; con tres líneas puede iniciarse:

Para iniciar el proyecto en sí, no es necesario configurar primero una clave de modelo.

Una vez dentro de la interfaz, se puede rellenar en Customize → Models.

El proyecto incluye también un conjunto completo de casos reales que se pueden ejecutar directamente: flujo de trabajo de Live API, análisis de datos reales de insulina humana INS, modificación de gráficos con una frase, y predicciones de solubilidad de artemisinina y paclitaxel en modo planificado, ingeniería de proteínas...

Pero ejecutar el proyecto es solo el primer paso.

La investigación real abarca numerosos campos: ciencias de la vida, química, materiales, medicina, ciencias de la Tierra, etc.

Cada área tiene sus propias bases de datos, modelos especializados y flujos de cálculo. Es imposible que un solo equipo cubra de una vez un panorama de capacidades tan vasto.

Por lo tanto, OpenAI4S extiende una llamada a contribuyentes (Call for Contributors) a instituciones académicas, centros de investigación, desarrolladores y equipos industriales.

Actualmente, la interfaz de usuario de Skills de TuZhan Intelligence ya ha ofrecido cierto soporte a este proyecto de código abierto.

Si estás familiarizado con algún campo de investigación, puedes desarrollar nuevos Skills de investigación, conectar bases de datos profesionales, modelos algorítmicos y plataformas de cálculo;

Si te especializas en agentes o ingeniería de software, también puedes participar en mejorar la arquitectura central, el cálculo remoto, los mecanismos de seguridad, las pruebas y la documentación.

También se puede participar sin escribir código.

Enviar un Issue, completar un caso reproducible, informar de una tarea fallida, o decirle a la comunidad qué necesita realmente cierta disciplina, son contribuciones valiosas.

Si tú también crees que los agentes de investigación no deberían quedarse solo en Demos, bienvenido a ejecutarlo, y también bienvenido a seguir desarrollándolo juntos.

Enlaces

https://github.com/PKU-YuanGroup/OpenAI4S

https://www.chatexcel.com/homesite/openAI4S

Este artículo proviene del WeChat público "量子位", autor: Atención a la Tecnología de Vanguardia

Preguntas relacionadas

Q¿Qué es OpenAI4S y quién está detrás de su desarrollo?

AOpenAI4S es una versión de código abierto y con licencia MIT de un agente de investigación científica inspirado en Claude Science. Es un proyecto de agente de IA para científicos, desarrollado y publicado de manera conjunta por el Laboratorio Conjunto de Agentes de IA de la Universidad de Pekín y Yuan Kong AI Agent.

Q¿Cuál es el enfoque principal de OpenAI4S para que la IA participe en el flujo de trabajo científico?

ASu enfoque principal es 'Code-as-Action' (Código como Acción). En lugar de simplemente seleccionar herramientas de un menú, el agente genera y ejecuta código Python o R en un entorno de kernel persistente. Esto permite encadenar tareas complejas, mantener datos y resultados intermedios, y generar productos finales como gráficos o informes.

Q¿Cuántas 'Skills' (habilidades) científicas integradas incluye inicialmente OpenAI4S y qué áreas cubren?

AOpenAI4S incluye inicialmente más de 30 'Skills' científicas integradas. Cubren áreas comunes de investigación computacional como análisis de estructura y secuencia de proteínas, diseño de proteínas, acoplamiento molecular, análisis de células individuales (single-cell), búsqueda de literatura y recuperación de datos abiertos.

Q¿Cómo maneja OpenAI4S los requisitos de capacidad de cálculo intensiva, como los que necesitan GPU?

AOpenAI4S admite la conexión a entornos de cálculo propios. Puede gestionar tareas de interacción localmente y enviar cálculos profesionales que requieren GPU (como el plegamiento de proteínas) a sus propios servidores. Los resultados se recuperan e integran de nuevo en el mismo flujo de trabajo científico.

Q¿Qué política importante sigue OpenAI4S respecto a la veracidad de los datos y los resultados?

ASigue una estricta 'política de no fabricación' (no-fabrication policy). Se prohíbe la invención o simulación de resultados experimentales, datos o estructuras. Si un servicio externo no está disponible o falta la capacidad de cálculo necesaria, el sistema informa honestamente del error en lugar de generar un resultado falso.

Lecturas Relacionadas

En Anchorage desvelan un plan de protección contra amenazas cuánticas

El criptobanco regulado Anchorage Digital ha presentado su estrategia para preparar los activos institucionales para la era post-cuántica, incluyendo la implementación de protección híbrida para sus conexiones TLS internas. El principal riesgo para las criptomonedas reside en las firmas digitales, ya que el algoritmo de Shor podría, en teoría, computar una clave privada a partir de una clave pública conocida. Anchorage afirma que los bitcoins de sus clientes están más protegidos al utilizar direcciones basadas en el hash de la clave pública, la cual no se revela hasta que se envía una transacción. La empresa ya utiliza encapsulación de claves post-cuántica en los dispositivos ChromeOS de sus empleados para las conexiones TLS. Su estrategia también incluye módulos de seguridad de hardware y el despliegue de criptografía post-cuántica en su infraestructura. Anchorage propone además un mecanismo llamado "Post-Quantum Turnstile" para migrar cuentas antiguas a claves post-cuánticas utilizando pruebas de conocimiento cero STARK. Este enfoque permitiría transferir la autoridad de firma sin revelar la clave privada o pública anterior, y podría aplicarse a aproximadamente dos tercios de las monedas en circulación. La compañía ha abierto el código de su implementación en Rust de la firma digital SQIsign, que ofrece firmas significativamente más pequeñas que otras alternativas como Falcon. Esto contrasta con análisis previos que señalaban la falta de preparación del mercado para la transición a la criptografía post-cuántica.

cryptonews.ruHace 7 min(s)

En Anchorage desvelan un plan de protección contra amenazas cuánticas

cryptonews.ruHace 7 min(s)

Un K3 de Kimi que necesitaba 16 B200 para funcionar, ahora cabe en solo 8 AMD

Éste podría ser el momento que AMD llevaba mucho tiempo esperando. Wafer AI desplegó recientemente el modelo Kimi K3 en GPU AMD MI355X. El resultado: un modelo que originalmente requería 16 NVIDIA B200 repartidos en dos servidores, ahora puede ejecutarse en un único servidor AMD equipado con 8 MI355X. El Kimi K3 tiene 2.8 billones de parámetros y necesita más de 1.5 TB de memoria solo para sus pesos. Con 288 GB de memoria HBM por tarjeta, las 8 MI355X (2.3 TB total) pueden contener el modelo completo en un solo nodo, evitando la comunicación lenta entre servidores necesaria en la configuración de 16 B200 (192 GB cada una). En las pruebas, las 8 MI355X lograron un rendimiento total de 952 tokens/segundo, unas 3.8 veces más que el rendimiento promedio por nodo de la solución de 16 B200. Aunque las 8 B300 son más rápidas (1568 tokens/s), el análisis de costo por rendimiento favorece a las MI355X, ofreciendo aproximadamente 48 tokens/s por dólar, frente a los 33 tokens/s de las B300 y los 7 tokens/s de las B200. Sorprendentemente, el software ROCm de AMD funcionó casi de inmediato, requiriendo solo ajustes menores como solucionar un error en la decodificación especulativa y optimizar un kernel de atención para reducir el tiempo hasta el primer token. Este caso muestra que para modelos de billones de parámetros, la capacidad de memoria puede ser más crítica que la pura potencia de cálculo. La estrategia de AMD de ofrecer más memoria HBM se está convirtiendo en una ventaja tangible. Aunque el ecosistema CUDA de NVIDIA sigue siendo más fuerte, si AMD mejora la estabilidad y compatibilidad de ROCm, sus GPUs podrían convertirse en una opción viable y más económica para centros de datos que ejecutan modelos de lenguaje grandes.

marsbitHace 7 min(s)

Un K3 de Kimi que necesitaba 16 B200 para funcionar, ahora cabe en solo 8 AMD

marsbitHace 7 min(s)

Trading

Spot
活动图片