Cuối tuần ở nhà lướt mạng xã hội, một video khiến tôi sửng sốt.
Một robot đang lái xe kart phóng vun vút trên đường đua, vào cua, tăng tốc, đánh lái, cảnh quay một mạch.
Không ngờ robot của chúng ta giờ đã có thể khoe kỹ năng trên đường đua kart rồi!

Khoan đã?
Hình ảnh này khác xa với những gì tôi thấy ở WRC!
Tại triển lãm, robot chạy bộ, còn có tia lửa điện, không ngờ robot trong video lúc nào đã bí mật đăng ký lớp đào tạo đua xe rồi?
Nó hoàn toàn là một tay lái lão luyện, vào cua tốc độ cao, linh hoạt tránh chướng ngại vật, chạy một vòng mạch lạc.
So với những demo robot chậm chạp đi qua, cúi xuống nhặt đồ trước đây, robot trong video này thực sự tự mình ngồi vào xe, tay, mắt, chân phối hợp đồng bộ, hoàn thành cân bằng đa điểm tiếp xúc và kiểm soát lực tinh vi ở trạng thái toàn tốc.
Loại robot hình người hai chân này có thể phối hợp toàn thân mắt, tay, chân, thực hiện thao tác chi tiết trong sự thay đổi tư thế phức tạp và chuyển động tốc độ cao, điều này hầu như chưa từng xuất hiện trong các demo robot hình người trước đây.
Đơn vị tung ra video này là một công ty tên Symbiotic Cognition.
Symbiotic Cognition làm về bộ não tích hợp cảm biến-điều khiển từ đầu đến cuối cho robot hình người hai chân, tức là mô hình nền tảng.
Người sáng lập Đinh Bằng Tường sinh năm 1996, các thành viên cốt lõi còn lại đều sinh sau năm 2000, toàn bộ đang học tiến sĩ, công ty thành lập vừa tròn hai tháng.
Về Demo trông có vẻ hơi "lạc đề" này, Đinh Bằng Tường giải thích:
Tôi hy vọng robot có thể giống con người hơn, chứ không chỉ làm những chức năng phục vụ rất máy móc. Giống như con người có thể lái kart, robot cũng có thể làm được.
Một câu hỏi theo đó nảy sinh: Tại sao một nhóm thanh niên thậm chí chưa lấy được bằng tốt nghiệp, lại dám đụng vào lĩnh vực khó và tiên phong nhất trong trí tuệ thể hiện?
Đặt cược vào con đường khó nhất: Nghiên cứu đã có phân tầng, giờ thách thức từ đầu đến cuối
Lĩnh vực mô hình robot hình người hai chân "từ đầu đến cuối" mới đến mức nào?
Mới đến mức thị trường không tìm được nhân tài có sẵn.
Theo cách nói của Đinh Bằng Tường, hướng này mới nóng lên gần đây, người hiểu công nghệ vẫn đang học tiến sĩ, họ gần như không thể tìm được người đáp ứng nhu cầu từ kho nhân tài.
Người tốt nghiệp nhiều năm không theo kịp nhịp độ, người chưa học đến tiến sĩ thì sự hiểu biết nền tảng lại thiếu một chút. Đột phá tiên phong nhất, nằm trong tay lứa nghiên cứu sinh tiến sĩ đỉnh cao này.
Đội ngũ Symbiotic Cognition chính là những người trẻ tuổi và tiên phong như vậy.
Họ đã giành được danh hiệu học thuật uy tín nhất trong lĩnh vực trí tuệ thể hiện trong nước - hai giải Best Paper, và một giải được chọn vào Best Paper Candidate; cũng tạo ra mô hình nền tảng thể hiện đầu tiên trong nước đạt 2K GitHub Stars.
Quan trọng hơn, họ không phải là người theo đuôi sau khi cơn sốt đến, mà là những người tiên phong sớm nhất trong nước khám phá mô hình nền tảng thể hiện, cũng là những người theo đuổi lâu dài kiên định nhất của lĩnh vực này. Đội ngũ đã công bố tổng cộng hơn 40 bài báo hội nghị đỉnh cao, bản đồ công nghệ bao phủ toàn bộ ngăn xếp từ cảm biến, quyết định, điều khiển, dữ liệu đến hệ thống; từ hệ thống kép, nhẹ hóa đến đa cấu hình, một loạt công trình sáng tạo đầu tiên ngành, đều xuất phát từ đội ngũ trẻ tuổi này.

Phán đoán của họ rất rõ ràng: Hình thái cuối cùng và phổ biến nhất để robot bước vào cuộc sống con người là hai chân;
Theo quỹ đạo tiến hóa của lái xe tự động và mô hình lớn, từ đầu đến cuối là chế độ công nghệ hiệu quả cao nhất.
Phán đoán này bắt nguồn từ kinh nghiệm nghiên cứu tuyến đầu của họ.
Ngay từ tháng 12/2023, Đinh Bằng Tường đã bắt đầu lắp "bộ não" cho robot bốn chân.
Anh với vai trò tác giả chính phát hành QUAR-VLA, là khuôn mẫu nhiệm vụ VLA đầu tiên hướng đến robot bốn chân, để mô hình cấp cao (bộ não) chịu trách nhiệm hiểu thị giác, ngôn ngữ và ý định nhiệm vụ, sau đó giao quyết định cho hệ thống vận động cấp thấp (tiểu não) thực hiện.
Tư duy phân tầng "bộ não quản lý quyết định, tiểu não quản lý thực hiện vận động" này, chính là phân tầng mà ngành nói đến, ngày nay các công ty như Figure vẫn đang áp dụng phương án.
Trong nghiên cứu sau đó, anh dần phát hiện ra vấn đề.
Anh mô tả phân tầng là "phương án khả thi về lý thuyết, nhưng không thanh lịch lắm":
Bộ não và tiểu não làm việc riêng, mỗi khi tiếp nhận một nhiệm vụ mới, đều phải tinh chỉnh tùy chỉnh đầu ra thượng nguồn, mới có thể điều chỉnh hiệu quả tốt.
Sâu hơn một tầng, là khuyết tật bẩm sinh về cấu trúc.
Bộ não và tiểu não tách riêng huấn luyện, triển khai rồi mới ghép lại, mỗi cục bộ tốt hơn, cũng không đảm bảo tổng thể tối ưu;
Giữa hai tầng mỗi lần dịch một lần, lại tăng thêm một lần sai số tầng và tổn thất thông tin.
Đinh Bằng Tường phán đoán, "Chỉ cần phân tầng, ở giữa sẽ có nút cổ chai thông tin, thiết kế giao diện này quyết định kiến trúc phân tầng không thể đạt được Scaling thực sự."
Phán đoán này cũng đến từ quan sát lâu dài của anh về sự phát triển của lái xe tự động và mô hình lớn.
Lái xe tự động thời kỳ đầu dựa vào sự phối hợp của nhiều mô-đun cảm biến, dự đoán, quy hoạch, điều khiển, sau đó bắt đầu khám phá để mô hình học trực tiếp khả năng lái xe từ dữ liệu.

Sau khi Tesla FSD chuyển hướng sang từ đầu đến cuối, hiệu suất tăng mạnh.
Theo quan điểm của Đinh Bằng Tường, robot cũng có thể trải qua thay đổi tương tự, để mô hình học quá trình hoàn chỉnh "cảm biến—hiểu—hành động" từ dữ liệu.
Logic của anh là, từ năm 2023 đã từng làm đi làm lại con đường phân tầng, nếu phán đoán quy mô hóa dữ liệu tương lai cuối cùng sẽ đẩy hệ thống đến từ đầu đến cuối, thì không cần thiết phải đi vòng thêm một lần nữa.
Bước này đang xảy ra vào năm 2026.
Gemini Robotics 2 của Google đã dùng một chiến lược duy nhất thống nhất toàn bộ động tác từ chân đến đầu ngón tay vào một mô hình;
Nhưng sự đồng thuận của hội nghị đỉnh cao RSS 2026 lại ghi rõ, mô hình đơn từ đầu đến cuối không thể bao phủ động lực học phức tạp toàn thân, mô-đun hóa phân tầng là phương án triển khai tối ưu ở giai đoạn hiện tại.
Con đường từ đầu đến cuối thuần túy mà Symbiotic Cognition đặt cược, là một con đường cấp tiến hơn, ít người đi hơn.

Tại sao lại là hai chân? Câu trả lời của Đinh Bằng Tường là nguyên lý đầu tiên: Kiến trúc, công cụ, môi trường xã hội loài người, đều được xây dựng theo cấu hình cơ thể con người.
Dạng bánh xe chỉ có thể làm việc cố định trong dây chuyền sản xuất và trung tâm thương mại, dạng hai chân có thể ra ngoài, lên xuống cầu thang, lái xe, còn có thể hoàn thành nhiệm vụ khác nhau xuyên cảnh.
Tính phổ quát đồng nghĩa với trải chi phí, hai chân còn có cảm giác thân thiện giống người.
Thời cơ cũng quan trọng. Trước tháng 4/2026, robot hình người hai chân thậm chí còn chưa có mô hình điều khiển từ xa phổ quát, không có nguồn dữ liệu thì không huấn luyện được nền tảng.
Cho đến khi NVIDIA Sonic mã nguồn mở, ngành mới có nền tảng để sản xuất dữ liệu quy mô lớn.
Hướng này không còn ở giai đoạn đầu "muốn huấn luyện cũng không có dữ liệu", nhưng cũng chưa chín muồi đến mức con đường hoàn toàn hội tụ, Symbiotic Cognition đánh cược chính là cửa sổ giữa này.
Đường phân thủy công nghệ: Người khác học động học, họ nghiền ngẫm động lực học
Trước hết làm rõ một đường phân thủy: Đại đa số mô hình nền tảng robot hiện nay, thực ra học là động học.
Động học quan tâm từ điểm A đến điểm B, tay di chuyển đến đâu, có nắm bắt được không, cánh tay robot cố định làm vậy không sao, vì nó sẽ không ngã.
Robot hai chân giơ tay với lấy một thứ, trọng tâm cơ thể sẽ đồng thời thay đổi;
Ngồi xổm lấy vật thể, eo phải nghiêng về phía trước, khớp mắt cá chân và chân phải phân bổ lại lực, giữ thăng bằng;
Lại chồng thêm ma sát, va chạm, quán tính và tiếp xúc, mô hình đối mặt đã là một bộ động lực học toàn thân.
Theo Đinh Bằng Tường giới thiệu, một robot hình người hai chân g1 có 29 bậc tự do, phức tạp hơn nhiều so với 7 bậc tự do của cánh tay robot.
Trước đây robot học "quỹ đạo động tác", robot hình người phải học "cơ thể hành động thế nào trong thế giới vật lý".

Từ động học đến động lực học, từ hoàn thành nhiệm vụ đến giữ ổn định, đây mới là đường phân thủy công nghệ thực sự của mô hình robot hai chân.
Điều này có thể giải thích tại sao Symbiotic Cognition đưa mô hình làm đến tầng Joint Target, tức là tầng mục tiêu khớp.
Trong phương án phân tầng, bộ não đầu tiên xuất ra mục tiêu động học, hạ nguồn tiểu não mới giải toán thành động tác khớp;
Symbiotic Cognition bỏ đi khâu trung gian này, để mô hình trực tiếp đối mặt với trạng thái cơ thể hàng chục khớp.
Vấn đề theo đó nảy sinh: Bỏ tiểu não đi, robot còn đứng vững không?

Chỉ dựa vào học mô phỏng, mô hình chỉ học được động tác chuẩn, chưa thấy các trạng thái cơ thể loạng choạng trong quá trình thực hiện, gặp trạng thái lạ có thể trực tiếp ngã.
Nó thiếu khả năng đứng vững từ thất bại.
Cốt lõi của Symbiotic Cognition, là một cơ chế tối ưu hóa hợp tác song lĩnh vực "mô hình hóa hành vi nhiệm vụ—chưng cất tiên nghiệm vận động".
Một đường thông tối ưu kế thừa sao chép hành vi, đảm bảo độ chính xác nhiệm vụ và khả năng khớp động tác; đường kia thông qua DriftDistill, chuyển hóa khả năng ổn định, kháng nhiễu và Failure Recovery mà bộ điều khiển cấp thấp tích lũy, thành tiên nghiệm vận động nội sinh của mô hình thống nhất.
Nó không phải đơn giản cộng dồn hai Loss, mà là hòa nhập hai loại năng lực "hoàn thành nhiệm vụ chính xác" và "kiểm soát cơ thể ổn định" vào cùng một mô hình, để mô hình lớn đồng thời có được trí thông minh nhiệm vụ và trí thông minh cơ thể.
Nếu DriftDistill có thể tiếp tục mở rộng cùng mô hình và lượng dữ liệu, nó cố gắng giải quyết chính là một vấn đề lớn hơn:
Ngoài Scaling nhận thức, robot có thể cùng lúc Scaling cả năng lực điều khiển vận động.
Đinh Bằng Tường gọi mô-đun hội tụ năng lực vận động này là Motion Expert (mô hình chuyên gia vận động), hiện quy mô gần 1B, và thông qua chưng cất không ngừng hấp thu năng lực của các mô hình điều khiển vận động khác nhau.

Tiến thêm một bước nữa, mô hình lớn từ đầu đến cuối còn phải giải quyết lực xuất ra của robot.
Nhiều hệ thống robot ngày nay chủ yếu điều khiển vị trí, nhưng robot thực sự bước vào thế giới thực sau đó, vị trí đúng không đồng nghĩa với nhiệm vụ hoàn thành.
Tay với đến tay nắm ngăn kéo, nhưng không biết dùng bao nhiêu lực, cửa vẫn không mở được; đưa đồ cho người vị trí không vấn đề, lực quá lớn cũng không an toàn.
Con đường công nghệ của Symbiotic Cognition là trước tiên đưa Force Expert làm chuyên gia tiếp xúc an toàn, để nó học tác dụng lực, mềm mại, trở kháng và phản hồi tiếp xúc, sau đó thông qua chưng cất chiến lược dần hòa nhập vào Motion Expert và mô hình từ đầu đến cuối cuối cùng.
Vị trí quyết định robot có thể "đến đó" không, lực quyết định nó có thể thực sự "làm tốt việc" không.
Đây cũng là ý nghĩa của "mô hình thế giới vật lý toàn thân" của Symbiotic: Để mô hình hiểu cơ thể chịu lực, mất cân bằng, tiếp xúc thế nào, sau đó biến những ràng buộc này trực tiếp thành động tác.
Dữ liệu, sự nổi trội, và một lịch trình thời gian tỉnh táo
Mô hình thực sự huấn luyện lên, đầu tiên va phải chính là sự khan hiếm dữ liệu.
Dữ liệu robot tuân thủ toàn cầu tính đến đầu năm 2026 khoảng 50 vạn giờ, không bằng 1/20,000 của mô hình ngôn ngữ lớn.
Điều khó xử là, nhiều dữ liệu thu thập là thao tác đứng yên, robot làm việc tại chỗ trong các ô làm việc, giúp ích hạn chế cho thao tác di chuyển toàn thân.
Blog của Symbiotic Cognition đã công bố khoảng hơn 1 vạn giờ dữ liệu, tự thu thập trong đó mấy nghìn giờ.
Mô hình phối hợp toàn thân thực sự khan hiếm là dữ liệu thao tác di chuyển toàn thân kết hợp chặt từ cuộc sống thực, như đạp xe đạp, lái kart, bơm bóng rổ, v.v.
Giải pháp của họ là TrajBooster: Trích xuất quỹ đạo đầu cuối từ cánh tay robot hoặc robot dạng bánh xe, để robot hình người trong mô phỏng truy bắt quỹ đạo này và giữ thăng bằng, thống nhất động tác từ nguồn khác nhau vào cùng một không gian, tái sử dụng tính đa dạng nhiệm vụ đã định nghĩa sẵn của cánh tay robot, cung cấp dữ liệu chi phí thấp cho tiền huấn luyện.
Nói về năng lực mô hình, Đinh Bằng Tường hầu như không dùng từ "khái quát hóa".
Dùng lời anh nói, "Từ này không có dinh dưỡng gì, giống như nói một người tốt vậy thôi."
Anh muốn là "sự nổi trội": Ở tầng góc khớp, ví dụ cho mô hình huấn luyện dữ liệu đi và nhảy, nó tự kết hợp ra kỹ năng mới chạy trong lúc kiểm tra.
Bởi vì chỉ đến tầng khớp, năng lực động tác cục bộ mới có thể kết hợp ra động tác hoàn toàn mới.

Trên lịch trình thời gian, phán đoán của anh rất tỉnh táo.
Anh suy đoán, dữ liệu khoảng mười vạn giờ vẫn chủ yếu là Demo cấp phòng thí nghiệm, thực sự có ý nghĩa thương mại quy mô lớn, có lẽ phải đợi đến sau triệu giờ.
Hiện tại ngành thậm chí còn chưa hội tụ hình thức dữ liệu phù hợp nhất, các con đường như điện cơ, khung xương ngoài, bắt chuyển động, điều khiển từ xa Pico vẫn đang cạnh tranh.
Theo quan điểm của anh, ba vấn đề khó nhất hiện tại của robot hình người, thứ nhất là cảm biến và điều khiển cuối cùng nên kết hợp thế nào, thứ hai là nên dùng loại dữ liệu gì, thứ ba mới là quy mô dữ liệu bản thân.
Đinh Bằng Tường hy vọng, một ngày nào đó mô hình robot do đội ngũ Trung Quốc thiết kế ra, cũng có thể ngược lại được đồng nghiệp Bắc Mỹ áp dụng rộng rãi.
Chúng tôi không muốn trở thành Follower, chúng tôi hy vọng dẫn dắt sự phát triển của công nghệ.
Trở lại chiếc kart đó.
Khiến nó vào cua toàn tốc, là một nhóm thanh niên chưa tốt nghiệp.
Họ đặt cược, là hướng khó và tiên phong nhất trong trí tuệ thể hiện.
Đánh cược là từ đầu đến cuối cuối cùng sẽ thay thế phân tầng.
Ngành còn xa mới đến lúc có thể chứng minh con đường kết cục đã thông suốt, thậm chí bản thân Đinh Bằng Tường cũng thừa nhận, toàn bộ ngành mô hình cơ bản hai chân đều chưa thực sự hội tụ.
Nhưng tính tiên phong của một đội ngũ khởi nghiệp, đôi khi không nằm ở việc làm một câu trả lời chín muồi nhanh hơn, mà ở việc nó có thể nhìn thấy vấn đề thực sự quan trọng tiếp theo sớm hơn đồng nghiệp, và dám bắt tay giải khi câu trả lời còn chưa rõ ràng.
Bài viết từ tài khoản công chúng WeChat "QbitAI" (ID:QbitAI), tác giả: Kiều Bất Trì





