# Bài viết Liên quan Không gian Tiềm ẩn

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Không gian Tiềm ẩn", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

10000 giờ dữ liệu con người, đào tạo ra mô hình hành động thế giới ẩn toàn thân di động đầu tiên trên thế giới

Trong hai năm qua, trọng tâm cạnh tranh trong lĩnh vực robot hình người đã chuyển từ phần cứng sang khả năng mô hình. Công ty trí tuệ thể hiện Zhizai Wujie đã ra mắt **Being-M0.7**, mô hình hành động thế giới ngầm (Latent World-Action Model) toàn thân đầu tiên trên thế giới dành cho thao tác di chuyển của robot hình người. Mô hình này được đào tạo trước trên hơn 10.000 giờ dữ liệu đa phương thức tập trung vào con người, sau đó được điều chỉnh với một lượng nhỏ dữ liệu trình diễn robot thực tế. Being-M0.7 giải quyết ba thách thức chính: chi phí thu thập dữ liệu robot cao, tính toán tốn kém của các mô hình dự đoán pixel và sự thiếu phối hợp giữa thao tác tay và di chuyển. Kiến trúc Vision-Motion Mixture of Transformers (MoT) cho phép mô hình sử dụng chung ba loại dữ liệu: dữ liệu ghép cặp video-chuyển động, video thuần túy và chuỗi chuyển động thuần túy. Nó cũng sử dụng một biểu diễn chuyển động thống nhất giữa người và robot, tập trung vào đầu, bàn tay và bàn chân để thu hẹp khoảng cách hình thái. Bốn bản demo robot thực tế cho thấy khả năng của Being-M0.7 trong các nhiệm vụ đầy thách thức: vớt cá trong bể (tương tác chất lỏng), lấy vật qua gương (suy luận không gian), di chuyển và sắp xếp đồ vật (nhiệm vụ dài), và mang hộp tránh chướng ngại vật (né tránh có tải). Các thử nghiệm so sánh cho thấy hiệu suất vượt trội so với các mô hình cạnh tranh trong một số nhiệm vụ. Phương pháp này tách biệt lập kế hoạch thế giới tần số thấp với điều khiển hành động tần số cao, cho phép robot tạo ra và điều chỉnh hành động phối hợp toàn thân dựa trên quan sát, phản hồi thời gian thực và dự đoán tương lai. Con đường công nghệ từ Being-H (thao tác khéo léo) đến Being-M (di chuyển & thao tác) nhấn mạnh việc học từ dữ liệu hành vi con người quy mô lớn trước khi chuyển giao kiến thức sang robot, cung cấp một khuôn khổ có thể mở rộng để vượt qua vấn đề khan hiếm dữ liệu thể hiện và hướng tới trí tuệ thể hiện tổng quát hơn.

marsbit07/15 01:51

10000 giờ dữ liệu con người, đào tạo ra mô hình hành động thế giới ẩn toàn thân di động đầu tiên trên thế giới

marsbit07/15 01:51

Đột phá quan trọng về AI cộng tác! Stanford và Nvidia cùng nhau loại bỏ hao phí giao tiếp trong AI, tốc độ suy luận tăng mạnh 2.4 lần

Tưởng tượng một nhóm trợ lý AI hợp tác giải một bài toán. Cách làm truyền thống buộc chúng phải liên tục "viết" và "đọc" suy nghĩ dưới dạng văn bản, gây lãng phí thời gian, token và làm thất thoát thông tin – vấn đề được gọi là **"Language Tax" (Thuế ngôn ngữ)**. Mới đây, nghiên cứu hợp tác giữa UIUC, Stanford, NVIDIA và MIT đã đề xuất **RecursiveMAS**, một phương pháp đột phá cho phép các agent AI giao tiếp trực tiếp thông qua **"tư duy"** trong không gian tiềm ẩn (latent space), thay vì phải mã hóa và giải mã thành văn bản. Hệ thống này hoạt động như một vòng lặp đệ quy, nơi các agent chuyển tiếp biểu diễn vector ẩn cho nhau cho đến khi hoàn thành nhiệm vụ, chỉ giải mã thành văn bản ở bước cuối cùng. **Lợi ích chính:** - **Tốc độ:** Tăng tốc suy luận từ **1.2 đến 2.4 lần**, hiệu quả tăng theo số vòng lặp đệ quy. - **Chi phí:** Giảm tiêu thụ token **tới 75.6%**. - **Độ chính xác:** Cải thiện trung bình **8.3%** trên nhiều tác vụ chuẩn (toán học, lập trình, hỏi đáp), do giảm thiểu tổn thất thông tin khi "nén" tư duy thành chữ. - **Hiệu quả huấn luyện:** Chỉ cần huấn luyện một mô-đun kết nối nhẹ **RecursiveLink** (0.31% tham số), trong khi đóng băng trọng số mô hình gốc, giảm đáng kể chi phí tính toán. **Ý nghĩa & Hạn chế:** RecursiveMAS mở ra hướng tiếp cận mới để mở rộng hệ thống đa tác nhân: thay vì tăng số lượng agent, có thể **tăng độ sâu đệ quy**. Tuy nhiên, nghiên cứu vẫn cần được kiểm chứng độc lập, đồng thời đối mặt với thách thức về khả năng giải thích (vì quá trình hợp tác diễn ra trong "hộp đen") và khả năng tương thích giữa các kiến trúc model khác nhau. Tóm lại, đây là một bước tiến quan trọng hướng tới việc loại bỏ "nút thắt ngôn ngữ", giúp sự hợp tác giữa các AI trở nên trực tiếp và hiệu quả hơn, giống như **"thần giao cách cảm"**.

marsbit05/21 00:14

Đột phá quan trọng về AI cộng tác! Stanford và Nvidia cùng nhau loại bỏ hao phí giao tiếp trong AI, tốc độ suy luận tăng mạnh 2.4 lần

marsbit05/21 00:14

活动图片