DeepSeek -V4-Flash официальная версия только что взорвала глобальное сообщество общих больших моделей, и китайская версия Deepseek для наук о жизни последовала за ней.
Недавно, многоуровневая большая модель GeneLLM для наук о жизни, самостоятельно разработанная компанией Jindu Life Sciences (основанной четырьмя выпускниками Оксфордского университета, вернувшимися в Китай), была опубликована в ведущих международных академических журналах — «Nature Communications» и «Advanced Science».
Как первая в мире многоуровневая большая модель, использующая для предварительного обучения исходные омиксные данные, GeneLLM является еще одной важной моделью после AlphaFold от Google и EVO 2 от Стэнфордского университета, заполняет пробел в фундаментальных больших моделях для наук о жизни в Китае, по праву называясь китайской версией Deepseek для наук о жизни, позволяя ИИ начать понимать множество «языков» жизни и всю «систему».



Как предсказать следующий токен, так и предсказать следующую информацию о жизни
Распознавание болезней — это лишь один из сценариев применения GeneLLM. То, к чему на самом деле стремится Jindu Life Sciences, — это создание «Claude Code» для области наук о жизни.
Ядро больших языковых моделей, таких как ChatGPT, Claude, DeepSeek , — это предсказание следующего токена.
Идея GeneLLM аналогична, но она предсказывает не текст, а информацию о жизни.
Четыре основания в последовательности РНК — аденин (A), урацил (U), гуанин (G), цитозин (C) — становятся базовыми токенами для понимания GeneLLM языка жизни.
Традиционный биоинформатический анализ обычно полагается на аннотацию генов, выравнивание последовательностей и искусственно заданные метки. Хотя этот метод точен, он заранее ограничивает познавательные возможности модели и может терять огромное количество неизвестных биологических сигналов, скрытых в исходных данных.
GeneLLM же идет другим путем, непосредственно изучая закономерности жизни из необработанных исходных данных секвенирования.
Она использует в качестве обучающих данных исходные омиксные данные, такие как транскриптомные, протеомные, метаболомные, позволяя модели самостоятельно обнаруживать паттерны, связанные с заболеваниями.
В настоящее время GeneLLM завершила предварительное обучение модели с 1,5 миллиардами параметров и 3,5 триллионами пар оснований, а версия XLarge реализовала предварительное обучение модели с 30 миллиардами параметров, постоянно расширяя технологические барьеры.
Как первая в мире многоуровневая большая модель, прошедшая предварительное обучение на основе исходных данных секвенирования, GeneLLM включает два основных этапа:
(1) Неконтролируемое предварительное обучение и извлечение прототипов
(2) Микронастройка на уровне пациентов (Disease Tuning)

Сначала GeneLLM должна решить проблему:
Как превратить сложные данные о жизни в язык, понятный ИИ?
В обработке естественного языка алгоритм BPE разбивает предложения на токены; GeneLLM же разбивает фрагменты РНК-секвенирования длиной около 150 пар оснований на токены жизни с помощью скользящего окна, состоящего из 7 оснований (7-mer).
Затем модель, используя архитектуру Transformer, напрямую предсказывает следующее основание без аннотации генов и искусственных меток.
Это означает, что ИИ сначала не смотрит на «словарь», составленный человеком, а напрямую учится на исходных сигналах жизни.
В процессе обучения GeneLLM обработала десятки триллионов ридов РНК, обучаясь на кластере из сотен GPU NVIDIA A100.
С этого момента у GeneLLM начали «возникать» способности к обобщению и другие.
Как важный инновационный прорыв в области наук о жизни, эта отечественная модель GeneLLM может применяться в разработке новых лекарств, прецизионной медицине, синтетической биологии, мониторинге окружающей среды, микробиологии и сельскохозяйственной биологии, дизайне белков и молекул и многих других областях. Это одна из немногих больших моделей в мире, реализованных в практических сценариях.

Только рассмотрев базовые инновации GeneLLM в «данных, архитектуре, обучении», можно по-настоящему понять: почему она представляет собой китайскую «биологическую версию DeepSeek ».
Силиконовая долина строит триллионы параметров на десятках тысяч H100, DeepSeek же повышает эффективность вычислений за счет алгоритмических инноваций, и GeneLLM аналогично «малой силой двигает большие веса», приводя в движение миллиарды данных наук о жизни.
Если AlphaFold позволила ИИ впервые увидеть «структуру» жизни, EVO2 заставила ИИ начать понимать «код» жизни, то GeneLLM пытается понять «систему» жизни еще дальше.

Что еще более впечатляет — это эффективность. Традиционные методы зависят от глубокого секвенирования в 6 Гб, что связано с высокими затратами и трудно реализуемо. GeneLLM при сверхмалой глубине в 1 Гб (сокращение затрат на 83%) сохраняет AUC > 0,8.
Это означает реальную надежду на то, что доступная прецизионная медицина станет реальностью.
Начинает проявляться новая научная парадигма: позволить ИИ учиться на данных о жизни, позволить наукам о жизни войти в новую фазу предсказуемого, вычисляемого и масштабируемого исследования.
Не только модель, но и интеллектуальная инфраструктура «последней мили»
Но амбиции Jindu Life Sciences распространяются не только на базовую модель.
На основе многоуровневой большой модели GeneLLM как основы для понимания жизни, Jindu Life Sciences далее строит исполнительную систему, соединяющую интеллект ИИ с физическим миром. Через исполнительный уровень умных экспериментов Harness и замкнутый цикл данных DBTL (Design-Build-Test-Learn) реализуется полный цикл AI for Science — от понимания законов жизни, генерации научных гипотез до автоматизированной экспериментальной проверки и постоянной итеративной оптимизации.
Как сказал бывший вице-президент OpenAI, затем руководитель дообучения Лиам Федус, современные LLM уже исчерпали ограниченный текст и код в интернете, и следующее значительное продвижение в научных открытиях должно зависеть от экспериментальных итераций.

Другими словами, нельзя полагаться только на чтение уже написанного человеком, чтобы открывать новые знания, ИИ должен сам проводить эксперименты.
Но возникает вопрос —
Интернет-сервисы по своей природе имеют API, сетевая информация по своей природе оцифрована, но научное оборудование поступает от разных производителей, протоколы различны, сложны и дороги, никто не может снести и перестроить все за несколько месяцев.
Сегодня большинство лабораторий созданы для человека: панели приборов, действия пипетирования, состояние образцов, ситуативные решения — подавляющее большинство этого не превращено в сигналы, понятные машине.
Внедрение ИИ в лабораторию сегодня — это не только проблема возможностей модели, но и потребность в новой инфраструктуре.
Следовательно, внедрение ИИ в лабораторию сегодня — это не только вопрос возможностей модели, но и физический Harness: превращение лаборатории в компилируемую, планируемую, наблюдаемую, отслеживаемую систему.
Это и есть настоящая «последняя миля» AI4S.
BioFord Harness: заставить лабораторию начать «работать самостоятельно»
Для этого Jindu разработала систему под названием BioFord Harness.
Это инфраструктура, соединяющая ИИ и физическую лабораторию.
Они не заставляют роботизированные манипуляторы имитировать человеческую руку, а превращают лабораторию в компилируемую, планируемую, наблюдаемую, отслеживаемую систему.
В этом процессе физический Harness должен выполнить как минимум три задачи:
1. Скомпилировать научное намерение или экспериментальный DSL в инструкции, исполняемые различными устройствами;
2. Выполнить планирование между множеством устройств, управление ресурсами и ограничениями безопасности, а также обработку исключений;
3. Обеспечить возврат экспериментальных результатов, журналов устройств и параметров окружающей среды в качестве входных данных для следующего цикла моделирования и экспериментального проектирования.
Научная проблема → понимание ИИ → план эксперимента → планирование устройств → выполнение → возврат данных → оптимизация модели → следующий цикл.
Так запускается маховик данных научных экспериментов.

Пять интеллектуальных агентов, превращающих научный процесс в «конвейер»
Платформа эмбодированного интеллектуального исследования BioFord Agent, в свою очередь, соединяется внизу с физическим уровнем лаборатории, а вверху поддерживает когнитивный уровень ученых, посередине используя физический ИИ для преодоления разрыва между рассуждением и исполнением.
На когнитивном уровне BioFord Agent состоит из сети пяти интеллектуальных агентов, охватывающих весь процесс исследований в науках о жизни, что может в разы повысить научную эффективность.
Интеллектуальный агент поиска литературы
Интеллектуальный агент проектирования экспериментов
Научный интеллектуальный агент
Интеллектуальный агент планирования экспериментов
Интеллектуальный агент анализа данных
Например, интеллектуальный агент поиска литературы может быстро помочь вам найти и прочитать огромное количество литературы, завершить обзор литературы и помочь сформулировать гипотезу.

Интеллектуальный агент проектирования экспериментов позволил научной группе сократить цикл проектирования экспериментов с нескольких месяцев до одной недели.
А представленный Jindu Life Sciences интеллектуальный агент планирования экспериментов, опираясь на уровень абстракции универсальных приборов (Universal Instrument Abstraction Layer), разрушает барьеры протоколов между различными типами гетерогенного оборудования.
Будь то ПЦР1-амплификатор, микропланшетный ридер, проточный цитометр или автоматизированная пипетировочная станция, все они могут быть унифицированно управляемы и планируемы. Система имеет встроенные алгоритмы динамического планирования, может автоматически выполнять пакетное планирование, избегать конфликтов в реальном времени и полностью записывать параметры экспериментов, формируя отслеживаемую цепочку аудита.

Это означает, что ИИ больше не останавливается на этапе «предоставления советов», а действительно входит в лабораторию, управляет оборудованием, выполняет задачи, становясь надежным «научным помощником».
Данные неудач, возможно, ценнее данных об успехах
Глубокая ценность этой системы заключается в следующем: она позволяет каждому эксперименту — успешному или неудачному — стать данными, которые система может переработать.
В традиционной лаборатории запись о неудачном эксперименте может быть всего лишь строкой «результат не соответствует ожиданиям», опыт хранится в голове человека, человек уходит — опыт тоже исчезает.
В системе BioFord каждая неудача — это ценные обучающие данные: логика выбора параметров, запись условий окружающей среды, доказательство ошибочного пути... все это оседает, становясь частью «опыта» системы.
В следующий раз ИИ будет знать: этот путь ведет в тупик.
Интересно, что в этой гонке побеждает не тот, у кого самая большая вычислительная мощность, и не тот, у кого самая большая модель.
Вычислительную мощность можно купить, но научные данные — нет.
Основатель и генеральный директор Jindu Life Sciences Цзинь Юнчэн заявил: «В процессе разработки мы постепенно обнаружили, что AI for BioScience — это не просто нагромождение моделей и данных. Для тех, кто проводит эксперименты, конечная проблема, которую нужно решить, — это дилемма: «после расчетов не знаешь, как делать, а сделав — получается неправильно».
Это и есть самый важный, и самый трудный для копирования барьер в области AI4S.
Четыре оксфордца, среди которых даже однокурсник Ло Фули
В 2022 году, в момент получения Цзинь Юнчэном докторской степени по биоинженерии в Оксфордском университете, перед ним стоял выбор.
Его научный руководитель — член Лондонского королевского общества, основатель британской публичной компании Oxford Nanopore, лидера в области секвенирования третьего поколения, Хэган Бейли. В его лаборатории сильна традиция «внедрения результатов». Остаться в Великобритании было ясным и легким путем.
Но он выбрал другой путь — упаковал «прототип технологии» из лаборатории в чемодан и увез в Китай. Вместе с ним были еще три выпускника Оксфорда: доктор биологии Дэн Сывэй, заместитель научного сотрудника факультета компьютерных наук Ша Лэй (доктор компьютерных наук Пекинского университета, однокурсник Ло Фули, руководителя больших моделей Xiaomi), а также Чжоу Тяньяо, специализирующийся на внедрении продуктов. Вчетвером они обладали соответствующими фоновыми знаниями в области биоинженерии, искусственного интеллекта, вычислительной биологии, коммерческой деятельности и т.д., идеально дополняя друг друга. Они объединялись для совместных научных проектов, реализуя прогнозирование и обнаружение заболеваний путем сочетания ИИ и транскриптомных технологий. Четверо, как кусочки пазла, идеально дополнили друг друга, что позволило выполнять междисциплинарные исследования высокой сложности.
Название компании «Jindu Life Sciences»: «Цзинь» (津) взято из Оксфорда, символизируя их отправную точку из ведущих лабораторий и академических вершин Оксфорда, «Ду» (渡) означает «переправлять/перевозить людей», что, по их мнению, и есть конечная точка, к которой должен прийти AI for Science.
В настоящее время платформа физического ИИ для исследований BioFord Agent от Jindu Life Sciences уже внедрена в некоторых известных китайских университетах с заметными результатами, сокращая научный цикл с нескольких месяцев до одной недели.
Поднялся ветер: 4 раунда финансирования за год, капитал показывает «истинный вкус»
Однако, идя по пути, «нехоженому предшественниками», неизбежно сопровождаешься одиночеством.
На начальном этапе стартапа трудности были огромны. Тогда предпринимательство в области ИИ было в самом разгаре, но попытки «ИИ+» в области наук о жизни были редки. «Те, кто разбирается в ИИ, не обязательно разбираются в науках о жизни, а большинство тех, кто разбирается в науках о жизни, не разбираются в ИИ».
Цзинь Юнчэн откровенно признался: «Инвесторы изначально не могли понять, что мы делаем».
Команда выбрала «самый трудный путь»: начать с фундаментальной большой модели для биологии. Компаний, занимающихся этим направлением в мире, можно пересчитать по пальцам.
В 2025 году наступил переломный момент.
Тогда Госсовет издал «Мнение о глубоком внедрении действий «искусственный интеллект+»», где AI for Science был указан в числе направлений, и в этой области поднялся ветер.
Jindu Life Sciences достигла результата «завершить 4 раунда финансирования за год». Основная временная шкала финансирования компании может служить отраслевым эталоном.
Ангельский+ раунд: Получено лидирующее финансирование от Sequoia China Seed Fund;
Pre-A+ раунд: Получено лидирующее финансирование на уровне десятков миллионов юаней от Chuangdongfang Investment;
Pre-A+ раунд: Получено финансирование на уровне десятков миллионов юаней от Nanshan Zhanxintou;
Раунд A: Получено лидирующее финансирование на сумму почти 100 миллионов юаней от Gaotegjia Investment.
Исполнительный партнер Gaotegjia Investment Тэн Юйхан заявил: «Jindu Life Sciences превратила фундаментальные исследования в науках о жизни в «вычислительные мощности + эксперименты» — инфраструктуру, доступную по подписке и масштабируемую».
А цель Цзинь Юнчэна более амбициозна: «Нас не устраивает просто продажа программного обеспечения, мы хотим создать интеллектуальную операционную систему для области наук о жизни. Подобно тому, как Intel определил вычислительную мощность эпохи ПК, мы надеемся определить новую парадигму разработки в науках о жизни в эпоху ИИ».
От оксфордской лаборатории до Шэньчжэня, от непонимания до серьезных инвестиций от капитала первого эшелона, история четырех оксфордцев — это не просто легенда о стартапе, но и вопрос, обращенный к душе: «Что мы можем сделать для человечества?».
Когда ИИ научится сам «проводить исследования ночи напролет», научные открытия, возможно, перестанут зависеть от случайного озарения гения и станут предсказуемой необходимостью. Этот путь они только начали.
Карта отрасли: Jindu выбирает путь облегченного физического ИИ
На более широкой карте AI for BioScience, Jindu не одинока, но точки входа совершенно разные.
Первый тип — это ИИ-ученые в цифровом пространстве.
Основанная в Стэнфорде Biomni (коммерциализирована как Phylo) имеет более 150 профессиональных инструментов, может автоматически выполнять обзор литературы, генерацию гипотез и биоинформатический анализ.
FutureHouse, поддерживаемая Эриком Шмидтом, стремится создать ИИ-ученых, способных самостоятельно генерировать гипотезы и писать научные статьи.
Однако, хотя они и мощны, они все еще ограничены цифровым миром.
Второй тип — это путь полного самостоятельного стека.
XtalPi с помощью «ИИ+робототехника» развернула по всему миру более 300 рабочих станций.
Lila Sciences, инкубированная Flagship Pioneering, с финансированием в 550 миллионов долларов пытается позволить ИИ полностью взять на себя проектирование, выполнение и перепроектирование экспериментов, целью является «научный сверхинтеллект».
Но все это слишком дорого.
Третий тип — это путь сквозного трубопровода.
Insilico Medicine напрямую продвигает ИИ в собственные трубопроводы инновационных лекарств, первый препарат, созданный с помощью ИИ, уже достиг III фазы клинических испытаний, но они — «производители автомобилей», а не «строители дорог».
А выбор Jindu Life Sciences таков: сосредоточиться на создании физического Harness, стать инфраструктурой «последней мили» между моделью и системой физических экспериментов.
Не участвовать в гонке за базовые платформы, не делать сквозных трубопроводов, не создавать ИИ-ученых исключительно в цифровом мире. Заниматься только этой милей — несомненно, более облегченная стратегия.
Цзинь Юнчэн четко сформулировал это суждение: «Настоящий водораздел в AI for Science — это не то, насколько ответы модели похожи на ответы ученого, а то, может ли лаборатория начать функционировать как система непрерывного обучения».
Более того, в глобальной сфере AI for Science, Jindu не просто «занимается только последней милей».
Более точно сказать, что она использует последнюю милю как точку входа, стремясь получить контроль над оркестрацией всего рабочего процесса научных исследований.
По сравнению с чисто цифровыми ИИ-учеными, она может взаимодействовать с физическим миром; по сравнению со строительством собственных капиталоемких научных фабрик, у нее есть возможность управлять уже существующими лабораториями клиентов; по сравнению со сквозными компаниями по разработке лекарств с помощью ИИ, ей не нужно ставить свою судьбу на кон в каком-то одном клиническом трубопроводе.

Ее настоящим барьером для входа будут не количество параметров, а постоянно накапливаемые траектории экспериментов, интерфейсы устройств, опыт неудач и сеть выполнения задач между лабораториями.
Как сказал Цзинь Юнчэн, тысячи сигнальных путей в организме и полные неизвестности механизмы реакций завораживают. «Насколько богата биология, настолько же прекрасны перспективы AI for Science».
Исследовать тайны жизни с помощью интеллекта ИИ — звездные просторы этой группы оксфордских отличников только начинают открываться.
Эта статья из WeChat Official Account «New Zhiyuan», автор: New Zhiyuan; редактор: Aeneas KingHZ









