Mientras DeepSeek-V4-Flash sorprendía al panorama mundial de los modelos de lenguaje general, su versión china para ciencias de la vida ya seguía sus pasos.
Recientemente, GeneLLM, un modelo de lenguaje grande multómico para ciencias de la vida desarrollado por Jindushenke (fundado por 4 talentos retornados de la Universidad de Oxford), ha sido publicado sucesivamente en prestigiosas revistas académicas internacionales como Nature Communications y Advanced Science.
Como el primer modelo de lenguaje grande multómico del mundo entrenado directamente con datos omicos originales, GeneLLM es otro modelo destacado después de AlphaFold de Google y EVO 2 de la Universidad de Stanford, llenando el vacío en los modelos base de ciencias de la vida en China, mereciendo ser llamado el 'DeepSeek' chino de ciencias de la vida, permitiendo que la IA comience a comprender los múltiples 'lenguajes' y el 'sistema' completo de la vida.



Predecir el siguiente mensaje de vida, como predecir el siguiente token
La identificación de enfermedades es solo un escenario de aplicación de GeneLLM. Lo que Jindushenke realmente quiere hacer es crear el 'Claude Code' de las ciencias de la vida.
El núcleo de modelos de lenguaje grande como ChatGPT, Claude y DeepSeek es la predicción del siguiente token.
GeneLLM tiene un enfoque similar, pero no predice palabras, sino información vital.
Las cuatro bases nitrogenadas en la secuencia de ARN - adenina (A), uracilo (U), guanina (G) y citosina (C) - se convierten en los tokens básicos para que GeneLLM comprenda el lenguaje de la vida.
El análisis bioinformático tradicional suele depender de anotaciones genéticas, alineación de secuencias y etiquetas definidas manualmente. Este método, aunque preciso, limita de antemano el alcance cognitivo del modelo y puede perder muchas señales biológicas desconocidas ocultas en los datos originales.
GeneLLM toma un camino diferente, aprendiendo directamente de los datos de secuenciación original sin procesar.
Utiliza datos originales multómicos (transcriptómica, proteómica, metabolómica, etc.) como datos de entrenamiento, permitiendo que el modelo descubra de forma autónoma patrones relacionados con enfermedades.
Actualmente, GeneLLM ha completado el preentrenamiento de un modelo de 1.5 mil millones de parámetros con 3.5 billones de secuencias de bases, y la versión XLarge ha logrado el preentrenamiento de un modelo de 30 mil millones de parámetros, ampliando continuamente la barrera tecnológica.
Como el primer modelo grande multómico del mundo preentrenado con datos de secuenciación original, GeneLLM incluye dos etapas principales:
(1) Preentrenamiento no supervisado y minería de prototipos
(2) Ajuste fino a nivel de paciente (Disease Tuning)

GeneLLM primero necesita resolver un problema:
¿Cómo convertir datos vitales complejos en un lenguaje que la IA pueda entender?
En el Procesamiento del Lenguaje Natural, el algoritmo BPE divide las oraciones en tokens; GeneLLM, por su parte, divide fragmentos de secuenciación de ARN de aproximadamente 150 pb de longitud en 'tokens de vida' utilizando una ventana deslizante de 7 bases (7-mer).
Posteriormente, el modelo utiliza la arquitectura Transformer para predecir la siguiente base nitrogenada sin anotaciones genéticas ni etiquetas manuales.
Esto significa que la IA no consulta primero el 'diccionario' compilado por humanos, sino que aprende directamente de las señales originales de la vida.
Durante el entrenamiento, GeneLLM procesó decenas de billones de 'reads' de ARN, entrenándose en un clúster de cientos de GPUs NVIDIA A100.
A partir de aquí, las capacidades de generalización de GeneLLM comienzan a 'emerger'.
Como un importante avance innovador en el campo de las ciencias de la vida, este modelo nacional GeneLLM puede aplicarse en múltiples áreas como el descubrimiento de fármacos, medicina de precisión, biología sintética, monitoreo ambiental, microbiología y agrobiología, diseño de proteínas y moléculas, siendo uno de los pocos modelos grandes en el mundo que ha logrado una implementación práctica en escenarios reales.

Solo después de examinar las innovaciones subyacentes de GeneLLM en 'datos, arquitectura, entrenamiento', podemos comprender realmente: ¿por qué representa el 'DeepSeek biológico' de China?
Silicon Valley apila decenas de miles de H100 para lograr billones de parámetros, DeepSeek mejora la eficiencia computacional mediante innovaciones algorítmicas, y GeneLLM, con una estrategia similar, aprovecha miles de millones de datos de ciencias de la vida.
Si AlphaFold permitió que la IA viera por primera vez la 'estructura' de la vida, y EVO2 que comenzara a entender el 'código', entonces GeneLLM busca comprender aún más el 'sistema' de la vida.

Y lo más impactante es la eficiencia. Los métodos tradicionales dependen de secuenciación profunda de 6 Gb, con costos altos y difícil implementación. GeneLLM mantiene un AUC > 0.8 incluso con una profundidad extremadamente baja de 1 Gb (reducción del 83% en costos).
Esto significa una verdadera esperanza de hacer realidad una medicina de precisión accesible.
Comienza a emerger un nuevo paradigma de investigación: dejar que la IA aprenda de los datos vitales, llevando a las ciencias de la vida a una nueva etapa de exploración predecible, computable y escalable.
No solo es un modelo, es la infraestructura inteligente del 'último kilómetro'
Pero la estrategia de Jindushenke no se limita al modelo base.
Tomando el modelo grande multómico GeneLLM como base cognitiva de la vida, Jindushenko construye un sistema de ejecución que conecta la inteligencia de la IA con el mundo físico. A través de la capa de ejecución de experimentos inteligentes Harness y el ciclo cerrado de datos DBTL (Diseñar-Construir-Probar-Aprender), se logra un ciclo completo de IA para la Ciencia: desde la comprensión de las leyes de la vida y la generación de hipótesis científicas, hasta la verificación experimental automatizada y la optimización iterativa continua.
Como dijo Liam Fedus, ex vicepresidente de OpenAI y responsable de entrenamiento posterior, los LLM actuales ya han agotado el texto y código limitados de Internet, y el próximo avance significativo en el descubrimiento científico debe depender de la iteración experimental.

Es decir, no se puede depender solo de leer lo que los humanos ya han escrito para descubrir nuevos conocimientos; la IA debe realizar sus propios experimentos.
Pero surge un problema:
Los servicios de Internet tienen API de forma natural, la información en red es digital por naturaleza, pero los equipos de investigación provienen de diferentes fabricantes, con protocolos diversos, complejos y costosos, y nadie puede reconstruirlos en unos meses.
La mayoría de los laboratorios actuales están diseñados para humanos: paneles de instrumentos, movimientos de pipeteo, estado de las muestras, juicios in situ, la gran mayoría no se convierte en señales que las máquinas puedan entender.
Que la IA entre en el laboratorio no es solo un problema de capacidad del modelo actual, sino que requiere una nueva infraestructura.
Por lo tanto, que la IA entre en el laboratorio no es solo un problema de capacidad del modelo, necesita un Harness físico: convertir el laboratorio en un sistema compilable, programable, observable y rastreable.
Este es el verdadero 'último kilómetro' de la IA4S.
BioFord Harness, haciendo que el laboratorio 'se mueva solo'
Para ello, Jindu desarrolló un sistema llamado BioFord Harness.
Es una infraestructura que conecta la IA con el laboratorio físico.
No hacen que el brazo robótico imite la mano humana, sino que convierten el laboratorio en un sistema compilable, programable, observable y rastreable.
En este proceso, el Harness físico debe lograr al menos tres cosas:
1. Compilar la intención científica o el DSL experimental en instrucciones ejecutables por diferentes dispositivos;
2. Gestionar la programación entre múltiples dispositivos, la gestión de restricciones de recursos y seguridad, y manejar excepciones;
3. Hacer que los resultados experimentales, registros de dispositivos y parámetros ambientales fluyan de vuelta, convirtiéndose en la entrada para el siguiente ciclo de diseño de modelos y experimentos.
Problema científico → Comprensión de IA → Diseño experimental → Programación de dispositivos → Ejecución → Flujo de datos → Optimización del modelo → Siguiente ciclo.
Así se pone en marcha la rueda volante de los datos científicos experimentales.

Cinco agentes inteligentes, convirtiendo el flujo de investigación en una 'línea de ensamblaje'
La plataforma de investigación de inteligencia incorporada BioFord Agent, por su parte, conecta hacia abajo con la capa física del laboratorio, y hacia arriba soporta la capa cognitiva del científico, utilizando la IA física en el medio para cerrar la brecha entre el razonamiento y la ejecución.
En la capa cognitiva, BioFord Agent está compuesto por una red colaborativa de cinco agentes inteligentes, que cubren todo el proceso de investigación en ciencias de la vida, pudiendo mejorar la eficiencia de la investigación varias veces.
Agente de recuperación de literatura
Agente de diseño experimental
Agente científico
Agente de programación experimental
Agente de análisis de datos
Por ejemplo, el agente de recuperación de literatura puede ayudarte rápidamente a buscar y leer una gran cantidad de literatura, completar revisiones bibliográficas y ayudar a plantear hipótesis.

El agente de diseño experimental permite que los equipos de investigación acorten el ciclo de diseño experimental de varios meses a una semana.
Y el agente de programación experimental lanzado por Jindushenke, basado en la Capa de Abstracción de Instrumentos Universales (Universal Instrument Abstraction Layer), rompe las barreras de protocolo entre múltiples tipos de dispositivos heterogéneos.
Ya sea un termociclador (PCR), un lector de microplacas, un citómetro de flujo o una estación de trabajo de pipeteo automatizado, todos pueden ser gestionados y programados de manera unificada. El sistema incorpora algoritmos de programación dinámica, puede planificar lotes automáticamente, evitar conflictos en tiempo real y registrar los parámetros experimentales en todo el proceso, formando una cadena de auditoría rastreable.

Esto significa que la IA ya no se queda en la fase de 'dar consejos', sino que realmente entra en el laboratorio, opera equipos, ejecuta tareas, convirtiéndose en un 'asistente de investigación' confiable.
Los datos de fracaso, quizás más valiosos que los de éxito
El valor más profundo que resuelve este sistema es: hacer que cada experimento, ya sea exitoso o fallido, se convierta en datos que el sistema puede digerir.
En un laboratorio tradicional, un registro de fracaso puede ser solo una línea de 'resultado no conforme a lo esperado', la experiencia queda en la mente de la persona, y cuando esa persona se va, la experiencia también se pierde.
En el sistema BioFord, cada fracaso es un valioso dato de entrenamiento: la lógica de selección de parámetros, el registro de condiciones ambientales, la prueba de caminos erróneos... todo se sedimenta, convirtiéndose en parte de la 'experiencia' del sistema.
La próxima vez, la IA sabrá: este camino no lleva a ninguna parte.
Es significativo que en esta carrera, no gana quien tiene más potencia de cálculo, ni quien tiene el modelo más grande.
La potencia de cálculo se puede comprar, pero los datos de investigación no.
Jin Yongcheng, fundador y CEO de Jindushenke, dijo: 'Durante el proceso de investigación y desarrollo, gradualmente descubrimos que la IA para BioScience no es simplemente acumular modelos y datos. Para quienes realizan experimentos, el problema final a resolver sigue siendo la incapacidad de ejecutar después del cálculo, y el error al ejecutar.'
Esta es la barrera más importante y difícil de replicar en el campo de la IA4S.
Cuatro personas de Oxford, incluido un compañero de Luo Fuli
En 2022, cuando Jin Yongcheng obtuvo su doctorado en Bioingeniería de la Universidad de Oxford, enfrentó una elección.
Su tutor era Hagan Bayley, miembro de la Royal Society y fundador de Oxford Nanopore, una empresa británica líder en secuenciación de tercera generación, y el laboratorio tenía una profunda tradición de 'implementación de resultados'. Quedarse en el Reino Unido era un camino claro y seguro.
Pero eligió otro camino: meter una 'tecnología prototipo' del laboratorio en su maleta y llevarla de vuelta a China. Junto a él viajaron otros tres exalumnos de Oxford: el doctor en Biología Deng Siwei, el investigador asociado de la Facultad de Informática Sha Lei (doctor en Informática de la Universidad de Pekín, compañero de Luo Fuli, responsable del modelo grande de Xiaomi), y Zhou Tianyao, experto en implementación de productos. Los cuatro poseen conocimientos complementarios en bioingeniería, inteligencia artificial, biología computacional y operaciones comerciales, formando un equipo indispensable. Formaron un equipo para proyectos de investigación conjuntos, logrando la predicción y detección de enfermedades combinando IA y tecnología transcriptómica. Las cuatro personas, como piezas de un rompecabezas, se complementan perfectamente y pueden llevar a cabo investigaciones altamente interdisciplinarias.
El nombre de la empresa 'Jindushenke': 'Jin' proviene de Oxford (Jin en chino suena similar a Ox-), simbolizando su partida desde las alturas académicas de los laboratorios de Oxford; 'Du' significa cruzar, ayudar a otros a cruzar, que es el destino al que creen que la IA para la Ciencia debería llegar.
Actualmente, la plataforma de investigación de IA física BioFord Agent de Jindushenke ya se ha implementado en algunas universidades prestigiosas de China, con resultados significativos, reduciendo el ciclo de investigación de varios meses a solo una semana.
El viento sopla: 4 rondas de financiación en 1 año, escena del 'verdadero interés' del capital
Sin embargo, seguir un camino 'nunca antes recorrido' inevitablemente conlleva soledad.
Al inicio de la empresa, las dificultades fueron abrumadoras. En ese momento, el emprendimiento en IA estaba en auge, pero los intentos de 'IA+' en ciencias de la vida eran escasos. 'Quienes entienden de IA no necesariamente entienden de ciencias de la vida, y la mayoría de quienes entienden de ciencias de la vida no entienden de IA.'
Jin Yongcheng admitió: 'Los inversores no podían entender lo que estábamos haciendo.'
El equipo eligió el 'camino más difícil': comenzar desde un modelo base biológico grande, una dirección en la que a nivel global hay muy pocas empresas.
En 2025, llegó un punto de inflexión.
En ese momento, el Consejo de Estado emitió las 'Opiniones sobre la implementación profunda de la acción 'Inteligencia Artificial+', incluyendo la IA para la Ciencia, y el campo comenzó a despegar.
Jindushenke logró el récord de 'completar 4 rondas de financiación en un año'. La línea de tiempo principal de financiación de la empresa puede considerarse un referente en la industria.
Ronda Ángel+: Liderada por Sequoia Capital China Seed Fund;
Ronda Pre-A+: Liderada por Chuangdongfang Investment con una inversión de decenas de millones de yuanes;
Ronda Pre-A+: Inversión de decenas de millones de yuanes de Nanshan Zhanxintou;
Ronda Serie A: Liderada por Gaotejia Investment con una inversión cercana a los 100 millones de yuanes.
Teng Yuhang, socio ejecutivo de Gaotejia Investment, comentó: 'Jindushenke ha convertido la investigación básica en ciencias de la vida en una infraestructura de 'capacidad de cálculo + experimentación' suscribible y escalable.'
Y el objetivo de Jin Yongcheng es aún más lejano: 'No nos conformamos con vender software, queremos construir el sistema operativo inteligente para el campo de las ciencias de la vida. Así como Intel definió la capacidad de cálculo de la era de las PC, esperamos definir un nuevo paradigma de investigación y desarrollo para las ciencias de la vida en la era de la IA.'
Desde el laboratorio de Oxford hasta Shenzhen, desde la incomprensión hasta recibir fuertes inversiones de capital de primer nivel, la historia de estos cuatro talentos de Oxford no es solo una leyenda empresarial, sino también una profunda reflexión sobre 'qué podemos hacer por la humanidad'.
Cuando la IA aprende a 'investigar toda la noche' por sí misma, el descubrimiento científico tal vez ya no dependa de la inspiración casual de un genio, sino que se convierta en una expectativa inevitable. Este camino, ellos apenas lo están comenzando.
Mapa de la industria: Jindu sigue el camino de la IA física ligera
En el mapa más amplio de la IA para BioScience, Jindu no está solo, pero su enfoque es completamente diferente.
El primer tipo es el científico de IA en el extremo digital.
Biomni (ahora comercializado como Phylo), incubado en Stanford, tiene más de 150 herramientas especializadas y puede ejecutar automáticamente revisiones de literatura, generación de hipótesis y análisis bioinformático.
FutureHouse, respaldado por Eric Schmidt, se dedica a construir científicos de IA que puedan generar hipótesis y escribir artículos de forma autónoma.
Sin embargo, aunque son poderosos, todavía se limitan al mundo digital.
El segundo tipo es la ruta autónoma de pila completa.
XtalPi (晶泰科技) ha desplegado más de 300 estaciones de trabajo 'IA + robótica' a nivel mundial.
Lila Sciences, incubada por Flagship Pioneering, con 550 millones de dólares en financiación, intenta que la IA se haga cargo completamente del diseño, ejecución y rediseño de experimentos, con el objetivo de lograr una 'súper inteligencia científica'.
Pero todo esto requiere demasiado dinero.
El tercer tipo es la ruta de tubería integral (end-to-end).
Insilico Medicine (英矽智能) lleva la IA directamente a su propia tubería de descubrimiento de fármacos innovadores, con su primer fármaco descubierto por IA en fase clínica III, pero ellos son 'constructores de automóviles', no 'reparadores de caminos'.
Y la elección de Jindushenke es: centrarse en construir el Harness físico, ser la infraestructura del 'último kilómetro' entre el modelo y el sistema experimental físico.
No competir en la base, no hacer tuberías integrales, no hacer científicos de IA puramente digitales. Solo hacer ese kilómetro es, sin duda, un enfoque más ligero.
Jin Yongcheng lo expresa claramente: 'El verdadero punto de inflexión de la IA para la Ciencia no es cuán parecido responda el modelo a un científico, sino si el laboratorio puede comenzar a funcionar como un sistema de aprendizaje continuo.'
Además, en el campo global de la IA para la Ciencia, Jindu no se limita simplemente a 'hacer solo el último kilómetro'.
Para ser más precisos, utiliza el último kilómetro como punto de entrada para competir por la orquestación de todo el flujo de trabajo de investigación.
En comparación con los científicos de IA puramente digitales, puede tocar el mundo físico; en comparación con la construcción de fábricas científicas con activos pesados propios, tiene la oportunidad de tomar el control de los laboratorios existentes de los clientes; en comparación con las empresas integrales de descubrimiento de fármacos con IA, no tiene que apostar su destino a una sola tubería clínica.

Su verdadera barrera de entrada no será el número de parámetros, sino la acumulación continua de trayectorias experimentales, interfaces de dispositivos, experiencias de fracaso y la red de ejecución entre laboratorios.
Como dijo Jin Yongcheng, las miles de vías de señalización y los mecanismos de reacción llenos de incógnitas dentro del organismo son fascinantes. 'Cuán rica es la biología, cuán hermoso es el futuro de la IA para la Ciencia.'
Explorar los misterios de la vida con la inteligencia de la IA, el vasto océano estelar de estos talentos de Oxford, acaba de comenzar.
Este artículo proviene del WeChat público 'Xinzhiyuan' (新智元), autor: Xinzhiyuan; editor: Aeneas KingHZ







