Ngay sau khi DeepSeek -V4-Flash bản chính thức gây chấn động cộng đồng mô hình lớn tổng quát toàn cầu, phiên bản DeepSeek dành riêng cho lĩnh vực Khoa học Sự sống của Trung Quốc đã nhanh chóng xuất hiện.
Mới đây, công ty Tân Độ Sinh Khoa (Jindu Bio) do 4 học bá Đại học Oxford về nước sáng lập, đã tự nghiên cứu và phát triển mô hình lớn đa hệ sinh học GeneLLM chuyên sâu cho lĩnh vực Khoa học Sự sống, liên tiếp được đăng tải trên các tạp chí học thuật hàng đầu quốc tế - "Nature Communications" và "Advanced Science".
Là mô hình lớn đa hệ sinh học đầu tiên trên thế giới được huấn luyện trước trực tiếp bằng dữ liệu thô sinh học, GeneLLM là một mô hình trọng yếu tiếp theo sau AlphaFold của Google và EVO 2 của Đại học Stanford, lấp đầy khoảng trống về mô hình lớn cơ bản trong Khoa học Sự sống của Trung Quốc, được coi là phiên bản DeepSeek của Trung Quốc trong lĩnh vực sinh học, cho phép AI bắt đầu hiểu nhiều "ngôn ngữ" và toàn bộ "hệ thống" của sự sống.



Dự đoán thông tin sự sống tiếp theo, giống như dự đoán token tiếp theo
Nhận diện bệnh chỉ là một trong các tình huống ứng dụng của GeneLLM, điều Tân Độ Sinh Khoa thực sự muốn làm là tạo ra "Claude Code" trong lĩnh vực Khoa học Sự sống.
Cốt lõi của các mô hình ngôn ngữ lớn như ChatGPT, Claude, DeepSeek là dự đoán token tiếp theo.
Tư duy của GeneLLM tương tự, nhưng nó dự đoán không phải là văn bản, mà là thông tin sự sống.
Bốn loại base trong chuỗi RNA - Adenine (A), Uracil (U), Guanine (G), Cytosine (C), trở thành Token cơ bản để GeneLLM hiểu ngôn ngữ của sự sống.
Phân tích tin sinh học truyền thống thường dựa vào chú thích gen, so sánh trình tự và gắn nhãn định nghĩa thủ công. Phương pháp này tuy chính xác, nhưng sẽ giới hạn trước phạm vi nhận thức của mô hình, cũng có thể làm mất đi một lượng lớn tín hiệu sinh học chưa biết tiềm ẩn trong dữ liệu thô.
GeneLLM lại đi theo một hướng khác, trực tiếp học các quy luật sự sống từ dữ liệu giải trình tự thô chưa qua xử lý.
Nó sử dụng dữ liệu thô đa hệ sinh học như RNA, proteomics, metabolomics... làm dữ liệu huấn luyện, để mô hình tự động phát hiện các mẫu hình liên quan đến bệnh tật.
Hiện tại, GeneLLM đã hoàn thành huấn luyện trước mô hình với 1.5 tỷ tham số và 3.5 nghìn tỷ trình tự base, phiên bản XLarge đạt huấn luyện trước mô hình 30 tỷ tham số, liên tục mở rộng rào cản kỹ thuật.
Là mô hình lớn đa hệ sinh học đầu tiên trên thế giới được huấn luyện trước dựa trên dữ liệu giải trình tự thô, GeneLLM bao gồm hai giai đoạn:
(1) Huấn luyện trước không giám sát và khai phá nguyên mẫu
(2) Tinh chỉnh theo bệnh ở cấp độ bệnh nhân (Disease Tuning)

GeneLLM trước tiên cần giải quyết một vấn đề:
Làm thế nào để biến dữ liệu sự sống phức tạp thành ngôn ngữ mà AI có thể hiểu?
Trong xử lý ngôn ngữ tự nhiên, thuật toán BPE sẽ cắt câu thành các Token; còn GeneLLM thì cắt các đoạn RNA giải trình tự dài khoảng 150bp, thông qua cửa sổ trượt gồm 7 base (7-mer), thành các Token sự sống.
Sau đó, mô hình sử dụng kiến trúc Transformer, trong điều kiện không có chú thích gen và nhãn gắn thủ công, trực tiếp dự đoán base tiếp theo.
Điều này có nghĩa là AI không phải xem trước "từ điển" do con người tổ chức, mà trực tiếp học từ tín hiệu thô của sự sống.
Trong quá trình huấn luyện, GeneLLM đã xử lý khoảng hàng chục nghìn tỷ reads RNA, được huấn luyện trên cụm trăm card GPU NVIDIA A100.
Đến đây, khả năng tổng quát hóa và các khả năng khác của GeneLLM bắt đầu "xuất hiện".
Là một đột phá sáng tạo lớn trong lĩnh vực sinh học, mô hình sinh học nội địa này của Trung Quốc có thể ứng dụng trong nhiều lĩnh vực như nghiên cứu phát triển thuốc mới, y học chính xác, sinh học tổng hợp, giám sát môi trường, vi sinh vật và nông nghiệp sinh học, thiết kế protein và phân tử... là một trong số ít mô hình lớn trên phạm vi toàn cầu đạt được triển khai thực tế trong các tình huống thực tế.

Chỉ khi chúng ta xem xét xong những đổi mới cơ bản của GeneLLM về "dữ liệu, kiến trúc, huấn luyện" thì mới thực sự hiểu: tại sao nó đại diện cho "phiên bản sinh học DeepSeek" của Trung Quốc.
Thung lũng Silicon dùng hàng chục nghìn card H100 để xếp chồng nghìn tỷ tham số, DeepSeek thì dùng sáng tạo thuật toán để nâng cao hiệu quả tính toán, GeneLLM cũng dùng sức nhỏ đẩy vật nặng, khơi động dữ liệu Khoa học Sự sống hàng tỷ.
Nếu nói AlphaFold để AI lần đầu tiên nhìn thấy "cấu trúc" của sự sống, EVO2 để AI bắt đầu hiểu "mã" của sự sống, thì GeneLLM cố gắng hiểu thêm về "hệ thống" của sự sống.

Còn hiệu quả thì càng đáng gờm. Phương pháp truyền thống dựa vào giải trình tự sâu 6Gb, chi phí cao, khó triển khai. GeneLLM ở độ sâu cực nông 1Gb (giảm 83% chi phí) vẫn duy trì AUC > 0.8.
Điều này có nghĩa là thực sự có hy vọng biến y học chính xác phổ quát thành hiện thực.
Một mô hình nghiên cứu khoa học mới bắt đầu xuất hiện: để AI học từ dữ liệu sự sống, đưa Khoa học Sự sống vào giai đoạn mới có thể dự đoán, có thể tính toán, có thể khám phá quy mô hóa.
Không chỉ là mô hình, mà còn là cơ sở hạ tầng thông minh "kilômét cuối cùng"
Nhưng bố cục của Tân Độ Sinh Khoa không chỉ nằm ở mô hình cơ bản.
Lấy mô hình lớn đa hệ sinh học GeneLLM làm nền tảng nhận thức sự sống, Tân Độ Sinh Khoa tiếp tục xây dựng hệ thống thực thi kết nối trí tuệ AI với thế giới vật lý, thông qua lớp thực thi thí nghiệm thông minh Harness và vòng lặp dữ liệu DBTL (Design-Build-Test-Learn), thực hiện vòng lặp kín hoàn chỉnh AI for Science từ hiểu quy luật sự sống, tạo giả thuyết khoa học, đến xác minh thí nghiệm tự động và tối ưu hóa lặp liên tục.
Như cựu Phó Chủ tịch OpenAI, người phụ trách huấn luyện sau này Liam Fedus từng nói, các LLM hiện tại đã cạn kiệt văn bản và mã hữu hạn trên internet, tiến bộ quan trọng tiếp theo trong khám phá khoa học phải dựa vào lặp thí nghiệm.

Tức là, không thể chỉ dựa vào việc đọc nội dung con người đã viết để phát hiện kiến thức mới, AI phải tự mình làm thí nghiệm.
Vấn đề là ở chỗ -
Dịch vụ internet vốn có API, thông tin mạng vốn là số hóa, nhưng thiết bị nghiên cứu đến từ các nhà sản xuất khác nhau, giao thức khác nhau, vừa phức tạp vừa đắt tiền, không ai có thể đập bỏ và xây lại trong vài tháng.
Hầu hết các phòng thí nghiệm ngày nay được thiết kế dành riêng cho con người: bảng điều khiển thiết bị, động tác hút mẫu, trạng thái mẫu, phán đoán tại chỗ, phần lớn không trở thành tín hiệu máy móc có thể hiểu.
AI bước vào phòng thí nghiệm, hiện nay không chỉ là vấn đề năng lực mô hình, mà còn cần một cơ sở hạ tầng mới.
Vì vậy, AI bước vào phòng thí nghiệm, hiện nay không chỉ là vấn đề năng lực mô hình, mà còn cần Harness vật lý: biến phòng thí nghiệm thành một hệ thống có thể biên dịch, có thể điều phối, có thể quan sát, có thể truy xuất.
Đây mới thực sự là kilômét cuối cùng của AI4S.
BioFord Harness, để phòng thí nghiệm bắt đầu "tự động"
Vì vậy, Tân Độ đã phát triển một hệ thống có tên BioFord Harness.
Đây là một cơ sở hạ tầng kết nối AI và phòng thí nghiệm vật lý.
Họ không để cánh tay robot bắt chước bàn tay con người, mà biến phòng thí nghiệm thành một hệ thống có thể biên dịch, có thể điều phối, có thể quan sát, có thể truy xuất.
Trong quá trình này, Harness vật lý ít nhất phải hoàn thành ba việc:
1. Biên dịch ý đồ khoa học hoặc DSL thí nghiệm thành các lệnh mà các thiết bị khác nhau có thể thực thi;
2. Hoàn thành điều phối, quản lý ràng buộc tài nguyên và an toàn giữa nhiều thiết bị, và xử lý ngoại lệ;
3. Để kết quả thí nghiệm, nhật ký thiết bị và tham số môi trường quay về, trở thành đầu vào cho thiết kế mô hình và thí nghiệm tiếp theo.
Vấn đề khoa học → AI hiểu → Phương án thí nghiệm → Điều phối thiết bị → Thực thi → Dữ liệu quay về → Tối ưu mô hình → Vòng tiếp theo.
Một bánh đà dữ liệu thí nghiệm khoa học, cứ thế được khởi động.

Năm đại lý thông minh, "cuốn" quy trình nghiên cứu thành dây chuyền
Nền tảng nghiên cứu trí tuệ vật hóa BioFord Agent, thì kết nối xuống lớp vật lý phòng thí nghiệm, hỗ trợ trên lớp nhận thức của nhà khoa học, ở giữa dùng vật lý AI để nối liền đoạn gãy giữa suy luận và thực thi.
Ở lớp nhận thức, BioFord Agent có mạng lưới phối hợp gồm năm đại lý thông minh, thông suốt toàn bộ quy trình nghiên cứu Khoa học Sự sống, có thể nâng cao hiệu quả nghiên cứu gấp nhiều lần.
Đại lý thông minh tìm kiếm tài liệu
Đại lý thông minh thiết kế thí nghiệm
Đại lý thông minh khoa học
Đại lý thông minh điều phối thí nghiệm
Đại lý thông minh phân tích dữ liệu
Ví dụ, đại lý thông minh tìm kiếm tài liệu có thể nhanh chóng giúp bạn tìm kiếm và đọc lượng lớn tài liệu, hoàn thành tổng quan tài liệu và hỗ trợ đưa ra giả thuyết.

Đại lý thông minh thiết kế thí nghiệm giúp nhóm nghiên cứu rút ngắn chu kỳ thiết kế thí nghiệm vốn mất hàng tháng xuống còn một tuần.
Còn đại lý thông minh điều phối thí nghiệm do Tân Độ Sinh Khoa giới thiệu, dựa vào lớp trừu tượng hóa thiết bị phổ quát (Universal Instrument Abstraction Layer), đã phá vỡ rào cản giao thức giữa nhiều loại thiết bị không đồng nhất.
Cho dù là máy PCR, máy đọc microplate, máy phân tích tế bào dòng chảy, hay trạm làm việc hút mẫu tự động, đều có thể thực hiện quản lý thống nhất và điều phối thống nhất. Hệ thống tích hợp thuật toán điều phối động, có thể tự động lập lịch hàng loạt, tránh xung đột thời gian thực, và ghi lại đầy đủ tham số thí nghiệm, hình thành chuỗi kiểm toán có thể truy xuất.

Điều này có nghĩa là, AI không còn dừng lại ở giai đoạn "đề xuất ý kiến", mà thực sự bước vào phòng thí nghiệm, vận hành thiết bị, thực hiện nhiệm vụ, trở thành một "trợ lý nghiên cứu" đáng tin cậy.
Dữ liệu thất bại, có lẽ còn quý giá hơn dữ liệu thành công
Giá trị sâu sắc hơn mà hệ thống này giải quyết nằm ở: biến mỗi thí nghiệm - dù thành công hay thất bại - đều trở thành dữ liệu mà hệ thống có thể xử lý.
Trong phòng thí nghiệm truyền thống, một bản ghi thất bại có thể chỉ là một dòng "kết quả không đúng như dự kiến", kinh nghiệm tồn tại trong đầu người, người đi rồi, kinh nghiệm cũng mất.
Nhưng trong hệ thống BioFord, mỗi lần thất bại đều là dữ liệu huấn luyện quý giá - logic lựa chọn tham số, ghi chép điều kiện môi trường, chứng minh con đường sai... tất cả đều lắng đọng, trở thành một phần "kinh nghiệm" của hệ thống.
Lần sau, AI sẽ biết: con đường này không thông.
Điều đáng suy ngẫm là, trong đường đua này, không phải người có sức mạnh tính toán mạnh nhất sẽ thắng, cũng không phải mô hình lớn nhất sẽ thắng.
Sức mạnh tính toán có thể mua được, nhưng dữ liệu nghiên cứu thì không mua được.
Kim Vịnh Thành, người sáng lập kiêm CEO Tân Độ Sinh Khoa cho biết: "Trong quá trình nghiên cứu phát triển, chúng tôi dần phát hiện ra AI for BioScience không đơn giản là chất đống mô hình, chất đống dữ liệu. Đối với người làm thí nghiệm, cuối cùng vẫn phải giải quyết khó khăn là tính toán xong không biết làm, làm rồi lại không đúng."
Đó chính là hào rào quan trọng nhất, cũng là khó sao chép nhất trong đường đua AI4S.
Bốn người Oxford, trong đó còn có sư huynh đồng môn của La Phúc Lệ
Năm 2022, vào thời điểm Kim Vịnh Thành nhận được bằng Tiến sĩ Kỹ thuật Sinh học của Đại học Oxford, anh phải đối mặt với một lựa chọn.
Người hướng dẫn của anh là thành viên Hội Hoàng gia Anh, người sáng lập công ty niêm yết Anh Oxford Nanopore, nhà tiên phong về giải trình tự thế hệ thứ ba Hagan Bayley, phòng thí nghiệm có truyền thống sâu sắc về "ứng dụng thành quả". Ở lại Anh, là một con đường bằng phẳng rõ ràng.
Nhưng anh đã chọn một con đường khác - đem một "công nghệ nguyên mẫu" trong phòng thí nghiệm bỏ vào vali, mang về nước. Cùng đi với anh, còn có ba cựu sinh viên Oxford: Tiến sĩ Sinh học Đặng Tư Vĩ, Phó nghiên cứu viên khoa Máy tính Sa Lỗi (Tiến sĩ Máy tính Đại học Bắc Kinh, sư huynh đồng môn của La Phúc Lệ, người phụ trách mô hình lớn của Xiaomi), cùng với Chu Thiên Nghiêu giỏi triển khai sản phẩm. Bốn người có kiến thức nền tảng liên quan đến kỹ thuật sinh học, trí tuệ nhân tạo, sinh học tính toán, vận hành thương mại, không thể thiếu cái nào. Họ từng thành lập đội tiến hành dự án nghiên cứu liên ngành, thông qua kết hợp AI và công nghệ transcriptome để thực hiện dự đoán và phát hiện bệnh. 4 người giống như những mảnh ghép vừa khớp bổ sung cho nhau, có thể hoàn thành nghiên cứu liên ngành cao độ.
Tên công ty "Tân Độ Sinh Khoa", "Tân" lấy từ Oxford, hàm ý họ xuất phát từ cao địa học thuật như phòng thí nghiệm đỉnh cao Oxford, "Độ" ý ở độ nhân, đó là điểm đến mà họ cho rằng AI for Science nên chạm tới.
Hiện tại, nền tảng nghiên cứu AI vật lý BioFord Agent của Tân Độ Sinh Khoa đã được triển khai tại một số trường đại học nổi tiếng trong nước, hiệu quả rõ rệt, rút ngắn chu kỳ nghiên cứu từ hàng tháng xuống còn một tuần.
Cơn gió nổi lên: 4 vòng gọi vốn trong 1 năm, hiện trường "thơm thật" của vốn
Tuy nhiên, đi một con đường "chưa từng có người đi trước", tất nhiên đi kèm với sự cô đơn.
Giai đoạn đầu khởi nghiệp, khó khăn chồng chất. Lúc đó, khởi nghiệp AI sôi động, nhưng thử nghiệm "AI+" trong lĩnh vực Khoa học Sự sống thì hiếm hoi. "Người hiểu AI chưa chắc đã hiểu Khoa học Sự sống, người hiểu Khoa học Sự sống phần lớn không hiểu AI."
Kim Vịnh Thành thừa nhận: "Các bên đầu tư từng không thể hiểu chúng tôi đang làm gì."
Đội ngũ chọn một con đường "khó nhất": bắt đầu từ mô hình lớn cơ bản sinh học, số công ty làm hướng này trên toàn cầu đếm trên đầu ngón tay.
Năm 2025, bước ngoặt xuất hiện.
Lúc đó, Quốc vụ viện ban hành "Ý kiến về việc thực hiện sâu sắc hành động 'Trí tuệ nhân tạo +'", AI for Science nằm trong đó, đường đua nổi gió.
Tân Độ Sinh Khoa lập thành tích "hoàn thành 4 vòng gọi vốn trong một năm". Dòng thời gian gọi vốn chính của công ty xứng đáng là hình mẫu ngành.
Vòng Thiên thần+: Nhận Sequoia Capital China Seed Fund dẫn đầu đầu tư;
Vòng Pre-A+: Nhận Chuangdongfang Investment dẫn đầu đầu tư cấp chục triệu;
Vòng Pre-A+: Nhận Nanshan Zhanxintou đầu tư cấp chục triệu;
Vòng A: Nhận Gaotegia Investment gần trăm triệu nhân dân tệ dẫn đầu đầu tư.
Đằng Vũ Hàng, Đối tác Điều hành Gaotegia Investment cho biết: "Tân Độ Sinh Khoa biến nghiên cứu cơ bản Khoa học Sự sống thành cơ sở hạ tầng 'sức mạnh tính toán + thí nghiệm' có thể đăng ký, có thể mở rộng."
Trong khi mục tiêu của Kim Vịnh Thành còn xa hơn: "Chúng tôi không bằng lòng với việc bán phần mềm, muốn xây dựng hệ điều hành thông minh trong lĩnh vực Khoa học Sự sống. Giống như Intel định nghĩa sức mạnh tính toán thời đại PC, chúng tôi hy vọng định nghĩa mô hình nghiên cứu mới của Khoa học Sự sống trong thời đại AI."
Từ phòng thí nghiệm Oxford đến Thâm Quyến, từ không ai hiểu đến được vốn hạng nhất rót mạnh, câu chuyện của bốn người Oxford, không chỉ là truyền kỳ khởi nghiệp, mà còn là một sự tra vấn tâm hồn về "chúng ta có thể làm gì cho nhân loại".
Khi AI học cách tự mình nghiên cứu khoa học "thâu đêm", khám phá khoa học có lẽ sẽ không còn dựa vào linh cảm ngẫu nhiên của thiên tài, mà trở thành điều tất yếu có thể dự đoán. Con đường này, họ mới chỉ bắt đầu.
Bản đồ ngành: Tân Độ đi theo đường AI vật lý nhẹ hóa
Trên bản đồ AI for BioScience lớn hơn, Tân Độ không đơn độc, nhưng điểm tiếp cận hoàn toàn khác biệt.
Loại thứ nhất, là nhà khoa học AI đầu số.
Biomni ấp ủ từ Stanford (đã thương mại hóa thành Phylo) sở hữu hơn 150 công cụ chuyên nghiệp, có thể tự động thực hiện đánh giá tài liệu, tạo giả thuyết và phân tích tin sinh học.
FutureHouse được Eric Schmidt hỗ trợ, nỗ lực xây dựng nhà khoa học AI có thể tự chủ tạo giả thuyết, viết luận văn.
Tuy nhiên, dù mạnh mẽ, chúng vẫn bị giới hạn trong thế giới số.
Loại thứ hai, là đường tự chủ toàn stack.
Công ty Trinh Thái Khoa Kỹ (Jingtai) với "AI + robot" đã triển khai hơn 300 trạm làm việc trên toàn cầu.
Lila Sciences ấp ủ từ Flagship Pioneering, với 550 triệu USD gọi vốn, cố gắng để AI hoàn toàn tiếp quản thiết kế, thực thi và thiết kế lại thí nghiệm, mục tiêu là "siêu trí tuệ khoa học".
Nhưng những cái này đều quá đốt tiền.
Loại thứ ba, là đường pipeline end-to-end.
Insilico Medicine (Anh Ma Thông Minh) đẩy AI trực tiếp vào pipeline thuốc sáng tạo riêng, loại thuốc AI đầu tiên đã vào giai đoạn lâm sàng III, nhưng họ là "người chế tạo xe" chứ không phải "người sửa đường".
Còn sự lựa chọn của Tân Độ Sinh Khoa là: tập trung xây dựng Harness vật lý, làm cơ sở hạ tầng "kilômét cuối cùng" giữa mô hình và hệ thống thí nghiệm thực thể.
Không thi đấu làm nền tảng, không làm pipeline end-to-end, không làm nhà khoa học AI thuần thế giới số. Chỉ làm kilômét đó, rõ ràng là cách đánh nhẹ hơn.
Kim Vịnh Thành nói rõ phán đoán này: "Đường phân thủy thực sự của AI for Science, không phải là mô hình trả lời giống nhà khoa học đến mức nào, mà là phòng thí nghiệm có thể bắt đầu giống như một hệ thống học tập liên tục hay không."
Hơn nữa, trong lĩnh vực AI for Science toàn cầu, Tân Độ không đơn giản là "chỉ làm kilômét cuối cùng".
Nói chính xác hơn, nó lấy kilômét cuối cùng làm lối vào, tranh giành quyền biên đạo toàn bộ luồng công việc nghiên cứu.
So với nhà khoa học AI thuần số, nó có thể chạm vào thế giới vật lý; so với nhà máy khoa học tự xây tài sản nặng, nó có cơ hội tiếp quản phòng thí nghiệm sẵn có của khách hàng; so với công ty AI dược end-to-end, nó không cần đặt số phận vào một pipeline lâm sàng nào đó.

Hào rào thực sự của nó, sẽ không phải là số lượng tham số, mà là mạng lưới thực thi liên phòng thí nghiệm, giao diện thiết bị, kinh nghiệm thất bại và quỹ đạo thí nghiệm tích lũy không ngừng.
Như Kim Vịnh Thành nói, hàng vạn con đường truyền tín hiệu trong cơ thể sinh vật và cơ chế phản ứng đầy ẩn số khiến người ta mê đắm. "Sinh học phong phú đến đâu, triển vọng của AI for Science đẹp đến đó."
Dùng trí tuệ AI khám phá bí ẩn sự sống, biển sao vũ trụ của nhóm học bá Oxford này, mới chỉ vừa mở màn.
Bài viết này đến từ tài khoản công chúng WeChat "Tân Trí Nguyên", tác giả: Tân Trí Nguyên; Biên tập: Aeneas KingHZ








