Thành quả lớn của trí tuệ thể tích, sắp đến rồi!!!
Từ khi Generalist phát hành bộ não thể tích Gen 1.5 có thể học hành động từ 3 đến 12 giây tuần trước~
Vừa rồi, công ty khởi nghiệp thể tích Bắc Mỹ Skild AI lại phát hành mô hình cơ bản robot hoàn toàn mới S1, trực tiếp kéo dài tác vụ học ngữ cảnh của robot lên hơn 10 phút.

Lần này S1 chủ đạo là học trong ngữ cảnh (in-context learning, ICL):
Không cần phải học dữ liệu thao tác mới một cách chuyên biệt ở giai đoạn huấn luyện hậu kỳ, chỉ cần xem một đoạn video người mẫu, là có thể "bắt chước", trực tiếp hoàn thành cả một quy trình thao tác phức tạp chưa từng thấy.
Trong bản demo chính thức, robot đã hoàn thành các tác vụ dài như làm bánh kếp, pha cà phê, thay chậu cây và lắp ráp thiết bị. Và trên các tác vụ chưa từng thấy, đã đạt tỷ lệ thành công lên đến 66%, vượt xa VLA dựa trên gợi ý ngôn ngữ (chỉ có 9%).
Ngoài ra, ngay cả khi đi theo con đường tinh chỉnh hậu kỳ truyền thống, muốn đuổi kịp hiệu quả của S1 chỉ xem một lần demo, ước tính cũng phải đưa vào khoảng 380 lần demo tác vụ.
Rất tuyệt vời!
Có thể nói, đợt công việc gần đây tập trung vào học trong ngữ cảnh này, lại thắp lên hy vọng cho nhiều người về trí tuệ thể tích.
Một người dùng Twitter cho biết, robot đa dụng có thể xuất hiện sau hai năm, chứ không phải bảy năm.

Còn có người dùng nói, từ Rhoda, đến Generalist tuần trước, rồi đến tác vụ 10 phút của Skild S1 bây giờ, khoảnh khắc GPT thực sự của robot dường như đang xuất hiện.

Bởi vì một khi khả năng này thực sự khái quát hóa, sau này phát triển kỹ năng cho robot, có thể thực sự sẽ trở thành giống như viết Prompt cho ChatGPT vậy.

Thật sự có thần kỳ như vậy không? Chúng ta hãy cùng xem.
Từ thời đại BERT, tiến tới thời đại GPT
Muốn hiểu S1 lần này cuối cùng học trong ngữ cảnh như thế nào, chúng ta phải xem trước, robot truyền thống học một kỹ năng mới như thế nào.
Trong pipeline truyền thống, học tập của robot thực ra cũng giống mô hình lớn:
Đầu tiên huấn luyện trước trên dữ liệu khổng lồ, học một số khả năng cơ bản; sau đó đến cảnh cụ thể, lại thu thập dữ liệu cho một tác vụ cụ thể, thông qua huấn luyện hậu kỳ, để robot học kỹ năng chuyên biệt.

Chỉ có điều vấn đề là, robot và mô hình lớn tuy quy trình tương tự, nhưng chi phí dữ liệu lại hoàn toàn không giống nhau.
Dữ liệu huấn luyện trước của mô hình lớn, phần lớn đến từ internet; ngay cả khi đến các cảnh chuyên biệt như lập trình, Agent, rất nhiều dữ liệu huấn luyện hậu kỳ cũng có thể nhanh chóng thu được trực tuyến, thậm chí tự động sinh ra.
Nhưng robot thì khá tệ. Dữ liệu huấn luyện trước phải thu thập trong thế giới thực, dữ liệu huấn luyện hậu kỳ vẫn phải thu thập trong thế giới thực.
Vì vậy, trong blog kỹ thuật, Skild AI đã trực tiếp nói thẳng:
Nếu một mô hình cơ bản robot, mỗi lần học một tác vụ mới vẫn cần dữ liệu thực tế máy mấy chục, mấy trăm giờ, rồi lại huấn luyện hậu kỳ lại, vậy tôi xin hỏi, mô hình "cơ bản" này, cơ bản ở chỗ nào?
Họ thậm chí dẫn nghiên cứu hiện có chỉ ra, nếu dữ liệu cho một tác vụ mới đã đủ nhiều, thì mô hình huấn luyện từ đầu thậm chí còn có thể đuổi kịp mô hình cơ bản đã qua huấn luyện trước rồi mới tinh chỉnh.
Vậy, ý nghĩa của huấn luyện trước thể tích là gì?
Đối với điều này, Skild đưa ra câu trả lời là: học trong ngữ cảnh.
Để có một hệ quy chiếu, Skild lấy lộ trình phát triển của mô hình lớn làm đối chiếu.
BERT thời kỳ đầu đã rất mạnh, nhưng mỗi khi gặp một tác vụ mới, thường vẫn phải chuẩn bị lại dữ liệu, rồi tinh chỉnh lại một lần.
Thứ thực sự thay đổi cuộc chơi, là khả năng học trong ngữ cảnh dần dần xuất hiện sau GPT-3:
Không cần thay đổi trọng số mô hình, chỉ cần đưa vài ví dụ trong Prompt, mô hình có thể tạm thời "học" một tác vụ mới.

Dựa trên điều này, Skild cho rằng, robot hiện tại thực ra vẫn mắc kẹt trong thời đại BERT tương tự, điều họ thực sự muốn là, để robot cũng hoàn thành một lần chuyển đổi mô thức tương tự.
Nghĩa là, giá trị thực sự của huấn luyện trước, không nên chỉ là để huấn luyện hậu kỳ thu thập ít dữ liệu hơn, mà là để robot cuối cùng đạt được khả năng "học trực tiếp từ ngữ cảnh".
Học trong ngữ cảnh
Vậy, S1 lần này cuối cùng học được gì từ ngữ cảnh?
Skild cho rằng, thứ thực sự có thể kiểm tra khả năng học trong ngữ cảnh của robot, thực ra chỉ có hai chiều:
Một là, có thể học được kỹ năng mới hoàn toàn chưa từng thấy khi huấn luyện không; hai là, có thể kết hợp lại các kỹ năng đã có, hoàn thành một tác vụ mới rất dài, rất phức tạp không.
Ví dụ, robot chỉ cần xem một đoạn video lật bánh kếp, là có thể học cách làm bánh kếp——
Ngay cả khi kỹ năng này trước đó chưa từng xuất hiện trong dữ liệu huấn luyện của nó.
Đồng thời, so với video cấp giây mà Gen-1.5 trình diễn tuần trước, S1 lần này trực tiếp kéo học trong ngữ cảnh lên dài nhất 10 phút.
Trong các tác vụ như thay chậu cây, mỗi tác vụ đều cần hoàn thành liên tục mấy chục bước thao tác. Trong các bản demo tác vụ dài hạn này, robot không chỉ cần làm được bắt chước, mà còn cần biết:
Bây giờ tôi đang làm đến bước nào, bước tiếp theo nên làm gì, các kỹ năng kết hợp như thế nào, giữa chừng làm hỏng lại phải tiếp tục ra sao.
Nghĩa là, robot cần thực sự hiểu ý đồ tác vụ - hành động trong video demo, ứng biến linh hoạt, chứ không chỉ đơn giản là sao chép hành vi.
Ngoài ra, trong tác vụ thay chậu cây, từ lúc bắt đầu ghi demo, đến lúc robot tự tay làm, chỉ mất 11 phút, trực tiếp ở mặt hiệu suất, cho huấn luyện hậu kỳ truyền thống bị bỏ xa.
Cuối cùng, trong toàn bộ quá trình, S1 không dùng fine-tuning, cũng không dùng post-training, trọng số mô hình hoàn toàn không đổi, dùng cùng một bộ trọng số, đã hoàn thành tất cả tác vụ trình diễn trong blog.
Cơ bản đã căn chỉnh với bước nhảy vọt của mô hình lớn từ Bert cần tinh chỉnh cảnh cụ thể, đến GPT-3 chỉ cần xem demo là hoàn thành tác vụ OOD.
Chỉ khác biệt duy nhất là, prompt dùng không còn là ngôn ngữ, mà dùng video hành động có thể căn chỉnh tốt hơn với tác vụ downstream.

Thí nghiệm: ICL cuối cùng có phải càng có khả năng mở rộng hơn không?
Trong phần thí nghiệm, Skild đầu tiên so sánh prompt video ICL và prompt ngôn ngữ truyền thống VLA trên các tác vụ đã thấy (trong dữ liệu huấn luyện) và chưa thấy.

Kết quả kiểm tra cho thấy, khi dữ liệu huấn luyện chỉ có 1000 giờ, prompt ngôn ngữ hiệu quả hơn, còn khi quy mô dữ liệu tăng lên, ICL bắt đầu vượt lên.
Đến 100 nghìn giờ, trên các tác vụ đã thấy khi huấn luyện: ICL 96%, prompt ngôn ngữ 89%.
Trong khi trên các tác vụ OOD then chốt thực sự: ICL 66%, prompt ngôn ngữ chỉ có 9%, trực tiếp mở ra khoảng cách hơn 7 lần.
Để kiểm chứng tính khái quát hóa của S1, Skild lại tiến hành kiểm tra trong các điều kiện thí nghiệm khác nhau.

Kết quả cho thấy, mức độ suy giảm hiệu suất của prompt ngôn ngữ VLA, cao nhất đạt 3 lần so với ICL.
Nghĩa là, thứ ICL học được không phải là nhại lại hành động trong cảnh cố định, mà là càng có khả năng theo môi trường hiện tại lập kế hoạch lại cách làm.
Cuối cùng, về mặt One shot learning.
S1 trên tác vụ mới hoàn toàn không làm post-training, chỉ xem một video demo, tỷ lệ thành công đã đạt 66%.

Trong khi đó, VLA truyền thống ước tính phải trải qua huấn luyện hậu kỳ khoảng 380 lần demo, mới có thể đuổi kịp cùng mức độ.
Tất nhiên, tiếp tục chất lên đến 2000 lần demo sau, post-training truyền thống cuối cùng có thể làm được 86%.
Vì vậy kết luận có thể không phải là "sau này robot không cần huấn luyện nữa", mà là:
Trước đây một kỹ năng mới có thể phải dạy mấy trăm lần, bây giờ xem một lần trước, là có thể trực tiếp đạt được sáu bảy mươi phần trăm.
Đây cũng là scaling law ICL mà Skild gọi:
Dữ liệu càng nhiều, mô hình không chỉ biết nhiều kỹ năng hơn, mà càng ngày càng biết "học kỹ năng từ demo".
Skild AI là ai?
Skild thành lập năm 2023, đứng sau là hai người quen cũ trong giới robot CMU: Deepak Pathak và Abhinav Gupta.

Cả hai đều là giáo sư của Viện Nghiên cứu Robot, Đại học Carnegie Mellon, Deepak chủ yếu nghiên cứu học tập robot, học tăng cường và thị giác máy tính, Abhinav là đại thần trong lĩnh vực thị giác máy tính, học tự giám sát.
Ngay từ năm 2022, hai người đã hợp tác WHIRL, để robot thông qua xem video con người thực hiện one-shot imitation, có thể nói tuyến đường S1 này, cũng không phải đột nhiên từ kẽ đá nhảy ra.

Là doanh nghiệp ngôi sao trong giới thể tích Bắc Mỹ, năm 2024 Skild vừa ra khỏi chế độ ẩn mình, đã giành được vòng A 300 triệu đô la, định giá 1,5 tỷ đô la;
Đến tháng 1 năm nay, lại hoàn thành vòng C 1,4 tỷ đô la, định giá trực tiếp lên trên 14 tỷ đô la, SoftBank dẫn đầu, NVIDIA, Bezos, v.v. tiếp tục lên bàn. Hơn hai năm thời gian, định giá gần như tăng gấp 10 lần.
Đối chiếu ngang mà xem, định vị của Skild trong giới thể tích Bắc Mỹ cũng khá đặc biệt.
So với PI có vẻ giống đang làm "robot GPT", Generalist gần đây nhấn mạnh là one-shot learner, và Genesis AI, Sunday gần đây với xu hướng toàn diện, Skild luôn nhấn mạnh một câu: Any robot, any task, one brain.
Nó càng nhấn mạnh tính xuyên embodiment, hy vọng cùng một Skild Brain có thể chạy trên các thân thể khác nhau như cánh tay cơ khí, bốn chân, hình người.
Nói thông tục một chút, chính là muốn trở thành Android của thời đại robot: một tầng thông minh, nhét vào các thân thể khác nhau.
Điều này cũng từ đó quyết định chiến lược dữ liệu của Skild: Tất cả đều phải có.
Skild coi dữ liệu robot là ba chiều hardware proximity, diversity và scalability:
Teleop máy thật gần với phần cứng nhất, nhưng đắt; video người góc nhìn thứ nhất dễ mở rộng quy mô nhất, nhưng lại khác xa với thân thể robot; mô phỏng rẻ có thể sản xuất ồ ạt, nhưng lại có khoảng cách sim-to-real.

Vì vậy họ đối với Robot Teleop, UMI, Egocentric Video, Simulation, về cơ bản áp dụng chiến lược đều dùng.
Mà ICL của S1, thực ra cũng là sự kéo dài tự nhiên của tuyến đường này:

Tháng 9/2025 LocoFormer → Tháng 2/2026 lần đầu In-Domain ICL → Tháng 5 lần đầu lật bánh kếp → Tháng 8 phát hành S1, trực tiếp đẩy học trong ngữ cảnh lên tác vụ dài hạn OOD dài nhất 10 phút.
Vì vậy bây giờ vấn đề thực sự đáng quan tâm, có thể đã không phải là robot còn có thể học thêm nhiều kỹ năng không, mà là:
Chi phí để robot học một kỹ năng mới, có thể thực sự từ "dạy mấy trăm lần", biến thành "bạn làm một lần, nó xem một lần" không.
Nếu scaling law này còn có thể tiếp tục thành lập, vậy cái gọi là GPT moment của robot, có thể thực sự không chỉ là một marketing slogan nữa.
Liên kết tham khảo:[1]https://www.skild.ai/blogs/s1
Bài viết này đến từ tài khoản công chúng WeChat "Lượng Tử Vị", tác giả: henry





