Đội ngũ NVIDIA để lập trình viên Agent tiếp quản thí nghiệm robot thực, tỷ lệ thành công đạt 99%

marsbitXuất bản vào 2026-06-18Cập nhật gần nhất vào 2026-06-18

Tóm tắt

Nghiên cứu tự động hóa đã vượt ra khỏi môi trường mô phỏng để bước vào thế giới vật lý thực tế. NVIDIA GEAR Lab mới đây giới thiệu dự án ENPIRE - một hệ thống lần đầu tiên cho phép các Agent lập trình (Codex Agent) tự động tiến hành nghiên cứu trực tiếp trên phần cứng robot. Chỉ với mục tiêu chung là giải quyết nhiệm vụ nhanh chóng, giữ robot hoạt động an toàn và không lãng phí tài nguyên tính toán, 8 Agent được triển khai trong một đội robot và tự động vận hành toàn bộ vòng lặp khép kín: tự đặt lại môi trường, tìm kiếm tài liệu, lập ý tưởng và xây dựng cơ sở hạ tầng, đào tạo và triển khai chiến lược, tự xác minh, phân tích nhật ký và cải thiện mã code. Quá trình này lặp lại cho đến khi robot hoàn thành đáng tin cậy các nhiệm vụ khéo léo phức tạp trong thực tế như buộc dây rút, sắp xếp kim vào hộp hay lắp đặt GPU, với tỷ lệ thành công lên tới 99%. Hệ thống ENPIRE được xây dựng dựa trên bốn mô-đun cốt lõi tạo thành vòng phản hồi vật lý có thể lặp lại. Một phát hiện quan trọng là việc đặt lại môi trường thường dễ dàng hơn việc hoàn thành nhiệm vụ chính. Do đó, ENPIRE tập trung vào việc để Agent tự xây dựng quy trình đặt lại môi trường tự động trước. Nghiên cứu cũng chỉ ra "định luật mở rộng vật lý": tăng số lượng robot chạy song song (ví dụ lên 8 robot) giúp tăng tốc độ giải quyết nhiệm vụ đáng kể. Để đo lường hiệu quả, nhóm nghiên cứu đề xuất hai chỉ số mới: Tỷ lệ sử dụng robot trung bình (MRU) và Tỷ lệ sử dụng token trung bình (MTU). Mục tiêu tương lai là hệ thống có thể tự ...

Nghiên cứu tự động hóa, lần này thực sự bước ra khỏi hộp cát mã nguồn, tiến vào thế giới vật lý thực tế.

Gần đây, Jim Fan, người đứng đầu phòng thí nghiệm NVIDIA GEAR, đã giới thiệu một dự án mới nhất có tên ENPIRE. Đây là lần đầu tiên họ thực hiện nghiên cứu tự động hóa trên phần cứng robot.

Họ đặt 8 Agent Codex vào một đội tàu robot, phân bổ sức mạnh tính toán GPU và ngân sách token dồi dào, chỉ đưa ra một mục tiêu đơn giản: giải quyết nhiệm vụ càng nhanh càng tốt, giữ cho robot luôn bận rộn nhưng đảm bảo an toàn, không lãng phí sức mạnh tính toán.

Sau đó, con người về cơ bản rút khỏi can thiệp. Agent tự chủ điều khiển toàn bộ vòng lặp khép kín, bao gồm tự động thiết lập lại cảnh, tìm kiếm tài liệu, hiện thực hóa ý tưởng và xây dựng cơ sở hạ tầng, đào tạo và triển khai chiến lược, tự xác minh, phân tích nhật ký và sửa mã, lặp đi lặp lại, cho đến khi hoàn thành một cách đáng tin cậy các nhiệm vụ khéo léo độ chính xác cao trên phần cứng thực, chẳng hạn như buộc dây rút, sắp xếp hộp đựng chốt cắm, lắp đặt GPU, v.v.

Họ cũng quan sát thấy một "định luật scaling vật lý": tăng số lượng robot song song (ví dụ: từ một ít lên 8 cái) có thể tăng tốc độ giải quyết nhiệm vụ một cách đáng kể.

Hiện tại, một số hệ thống của phòng thí nghiệm này đã đạt được sự lặp lại tự chủ qua đêm mà không có sự can thiệp của con người, nhà nghiên cứu chỉ cần xem báo cáo vào buổi sáng là đủ.

Jim Fan tuyên bố, mục tiêu trong tương lai là để các thành viên trong đội ngũ yên tâm nghỉ phép, thậm chí ngay cả CEO của NVIDIA Jensen Huang cũng không nhận ra phòng thí nghiệm vẫn đang tự chủ vận hành.

Dự án ENPIRE dự kiến sẽ hoàn toàn mã nguồn mở, lúc đó các nhà phát triển thông thường cũng có thể hy vọng xây dựng hệ thống nghiên cứu robot tự chủ tương tự tại nhà.

Địa chỉ dự án: https://research.nvidia.com/labs/gear/enpire/

Kiến trúc hệ thống ENPIRE: Bốn mô-đun tạo thành vòng lặp khép kín

ENPIRE là một hệ thống khung được thiết kế dành riêng cho Agent mã hóa, xây dựng vòng phản hồi vật lý có thể lặp lại thông qua bốn mô-đun lõi: Mô-đun môi trường (EN) chịu trách nhiệm tự động thiết lập lại và xác minh, Mô-đun cải thiện chiến lược (PI) khởi động tối ưu hóa chiến lược, Mô-đun Rollout (R) hỗ trợ đánh giá chiến lược song song trên một hoặc nhiều robot, Mô-đun tiến hóa (E) thì để Agent mã hóa phân tích nhật ký, tra cứu tài liệu, cải thiện cơ sở hạ tầng đào tạo và mã thuật toán để giải quyết các mô hình thất bại.

Hệ thống vòng lặp khép kín này chuyển đổi việc học robot thế giới thực thành một quá trình tối ưu hóa có thể kiểm soát được, do Agent quản lý, nhằm giảm thiểu tối đa sự đầu tư thủ công, đồng thời hỗ trợ thực hiện các thí nghiệm ablation công bằng giữa các công thức đào tạo và biến thể Agent khác nhau.

Với sự hỗ trợ của ENPIRE, các Agent lập trình tiên tiến có thể tự chủ phát triển chiến lược và đạt được tỷ lệ thành công 99% trong các nhiệm vụ thao tác khéo léo thế giới thực đầy thách thức như PushT, xếp chốt cắm vào hộp đựng chốt, sử dụng dao cắt để cắt dây rút, v.v.

Phát hiện then chốt: Thiết lập lại môi trường dễ hơn bản thân việc hoàn thành nhiệm vụ

Một trong những quan sát then chốt là: Đối với nhiều nhiệm vụ robot, việc thiết lập lại môi trường thường dễ dàng hơn chính việc hoàn thành nhiệm vụ.

Do đó, cách làm của ENPIRE là trước tiên để Agent xây dựng môi trường tự động thiết lập lại thông qua Chính-sách-như-Mã (Code-as-Policy). Trong nhiều trường hợp, cái gọi là thiết lập lại thực chất là một nhiệm vụ nhặt-và-đặt, có thể được giải quyết bởi Cap-X.

Sau đó, tác nhân thông minh sẽ viết hàm thưởng dựa trên quy tắc heuristic. Nhóm nghiên cứu sau đó đặt môi trường này vào hộp cát và khởi động Agent tiến hành nghiên cứu tự động hóa xoay quanh điểm số.

Điều này cũng tương đồng với định nghĩa của Karpathy về nghiên cứu tự động hóa: nghiên cứu tự động hóa được nói đến ở đây không phải là đơn giản điều chỉnh một siêu tham số hoặc sửa đổi một đoạn mã nhỏ. Agent sẽ khám phá các mô hình khác nhau từ internet và viết lại mọi phần có thể thúc đẩy hiệu suất, bao gồm thuật toán, mục tiêu đào tạo, thậm chí cả trình tải dữ liệu.

Trong nhiệm vụ xếp chốt cắm, một Agent thậm chí còn tự viết bộ điều khiển an toàn lực tiếp xúc, hiệu quả của nó vượt trội hơn so với việc chỉ đơn thuần điều chỉnh một số tham số học tăng cường.

Chỉ số mới MRU và MTU

Khả năng mở rộng của ENPIRE phụ thuộc vào quy mô đội ngũ Agent và tài nguyên sức mạnh tính toán, chỉ có điều ở đây, tài nguyên thực sự khan hiếm không phải là GPU, mà là thời gian robot.

Khi nhóm nghiên cứu cung cấp cho Agent 8 robot, thay vì 1 robot, thời gian cần thiết để nhiệm vụ xếp chốt đạt được hiệu suất gần hoàn hảo đã giảm từ hơn 1,5 giờ xuống còn khoảng 40 phút. Các Agent này phối hợp thông qua Git: chia sẻ mã, từ bỏ ý tưởng không lý tưởng và tự chủ lựa chọn kết quả chạy tốt nhất của nhau.

Điều này chỉ ra một sự thay đổi lớn hơn: nghiên cứu robot đang trở thành một công việc thiết kế môi trường, tức là xây dựng môi trường mà coding Agent có thể tiến hành nghiên cứu tự động hóa trong đó; công việc thuật toán thì dịch chuyển lên một tầng cao hơn, chuyển hướng sang xây dựng một loại vòng phản hồi mà Agent có thể tự khép kín.

Và vòng lặp này sẽ liên tục tích lũy theo lãi kép: Một kỹ năng mà Agent nắm vững hôm nay, ngày mai sẽ trở thành mô-đun cơ sở để xây dựng và thiết lập lại môi trường nhiệm vụ khó khăn hơn. Năng lực sẽ tự sinh ra năng lực mới.

Trong mô hình này, ràng buộc cứng thực sự là ngân sách tương tác thế giới thực.

Do đó, nhóm nghiên cứu đã đề xuất hai chỉ số:

  • Tỷ lệ sử dụng robot trung bình (Mean Robot Utilization, MRU): Tỷ lệ thời gian robot thực sự chạy thí nghiệm so với tổng thời gian thực tế tiêu thụ.
  • Tỷ lệ sử dụng Token trung bình (Mean Token Utilization, MTU): Đo lường hiệu quả của Agent trong việc chuyển đổi token thành tiến triển nghiên cứu.

Trong thí nghiệm của họ, MRU luôn thấp hơn 50%. Nghĩa là, robot có một nửa thời gian ở trạng thái nhàn rỗi, đang chờ Agent suy nghĩ. Do đó, harness tốt hơn và mô hình nhanh hơn sẽ trực tiếp chuyển hóa thành lợi ích thực tế.

PushT là một điểm chuẩn thao tác robot đã được sử dụng từ lâu. Thông thường, để hoàn thành nhiệm vụ này cần một lượng lớn dữ liệu minh họa của con người, cộng với vài giờ đào tạo sao chép hành vi.

Nhưng họ nhận thấy, Codex, Claude Code và Kimi Code đều sử dụng một bộ phương pháp heuristic dựa trên quy tắc để "giải quyết" nhiệm vụ này trong vòng chưa đầy 2 giờ: không sử dụng mạng nơ-ron, không tiến hành đào tạo và cũng không dựa vào bất kỳ dữ liệu con người nào.

Để nhiều người hơn có thể thử nghiệm nghiên cứu tự động hóa trong thế giới vật lý tại nhà, họ đã phát triển một hệ thống full-stack dựa trên bộ kit SO-101 của @LeRobotHF + NVIDIA Jetson Thor. Hệ thống này có thể hoàn thành nhiệm vụ PushT.

Liên kết tham khảo:

https://x.com/_wenlixiao/status/2066913334994358342

https://x.com/DrJimFan/status/2066921736369766762

Bài viết này từ tài khoản WeChat công chúng "机器之心" (ID: almosthuman2014), tác giả: Dương Văn (杨文)

Câu hỏi Liên quan

QDự án ENPIRE của NVIDIA đã đạt được thành công gì đáng chú ý trong lĩnh vực robot?

ADự án ENPIRE của NVIDIA đã thành công trong việc để các Agent lập trình (Codex Agent) tự động điều khiển một đội robot thực hiện các nhiệm vụ khéo léo trong thế giới thực, như buộc dây rút, sắp xếp kim vào hộp và lắp đặt GPU, với tỷ lệ thành công lên tới 99%.

QHệ thống ENPIRE hoạt động dựa trên những module chính nào?

AHệ thống ENPIRE được xây dựng dựa trên bốn module cốt lõi tạo thành một vòng lặp phản hồi vật lý: Môi trường (EN - Environment), Cải tiến Chiến lược (PI - Policy Improvement), Triển khai (R - Rollout) và Tiến hóa (E - Evolution).

QPhát hiện quan trọng nào về việc thiết lập lại môi trường so với hoàn thành nhiệm vụ được đề cập trong bài viết?

AMột phát hiện quan trọng là đối với nhiều nhiệm vụ robot, việc thiết lập lại (reset) môi trường thường dễ dàng hơn so với việc hoàn thành chính nhiệm vụ đó. Vì vậy, ENPIRE tập trung để Agent đầu tiên xây dựng môi trường tự động reset thông qua 'Code-as-Policy'.

QCác chỉ số MRU và MTU được giới thiệu trong bài nhằm mục đích gì?

AMRU (Mean Robot Utilization - Tỷ lệ sử dụng Robot trung bình) và MTU (Mean Token Utilization - Tỷ lệ sử dụng Token trung bình) là hai chỉ số mới được đề xuất để đo lường hiệu quả trong nghiên cứu tự động hóa. MRU đo thời gian robot thực sự chạy thí nghiệm, trong khi MTU đo hiệu quả chuyển đổi token (từ các Agent) thành tiến độ nghiên cứu. MRU thấp cho thấy robot thường xuyên rảnh rỗi chờ Agent 'suy nghĩ'.

QMục tiêu tương lai của nhóm nghiên cứu NVIDIA GEAR với dự án ENPIRE là gì?

AMục tiêu tương lai của nhóm là xây dựng một hệ thống hoàn toàn tự chủ, nơi các nhà nghiên cứu có thể yên tâm nghỉ phép và ngay cả CEO NVIDIA Jensen Huang cũng không nhận ra phòng thí nghiệm vẫn đang tự vận hành. Họ cũng có kế hoạch mã nguồn mở hoàn toàn dự án để các nhà phát triển có thể tự xây dựng hệ thống tương tự tại nhà.

Nội dung Liên quan

Những người ủng hộ đề xuất nâng cấp BIP-110 cho Bitcoin đã chuẩn bị kế hoạch "dự phòng khẩn cấp" nếu đề xuất bị từ chối: Điều này có thể thay đổi hoàn toàn giá trị của BTC

Trong khi các cuộc thảo luận về đề xuất BIP-110 vẫn tiếp diễn trong mạng lưới Bitcoin, những người ủng hộ nó đã bắt đầu chuẩn bị một kế hoạch dự phòng đáng chú ý. Kế hoạch này có thể được kích hoạt nếu các thợ đào từ chối nâng cấp. Nhà phát triển Bitcoin Chris Guida thông báo đã điều chỉnh mã Proof-of-Work, ban đầu được tạo bởi Luke Dashjr vào năm 2017, cho phiên bản Bitcoin Knots hiện tại. Guida mô tả đây là biện pháp cuối cùng, có thể sử dụng nếu các thợ đào không báo hiệu sẵn sàng cho BIP-110. BIP-110 là một softfork nhằm tạm thời hạn chế lưu trữ dữ liệu tùy ý trong các giao dịch Bitcoin, với các quy tắc nghiêm ngặt hơn về dữ liệu đầu ra, trường OP_RETURN và dữ liệu nhân chứng. Các quy tắc này dự kiến có hiệu lực trong khoảng một năm trước khi tự động hết hạn. Guida tuyên bố: "Tôi nghĩ chúng ta cần giữ tùy chọn này mở trong trường hợp các thợ đào quyết định hợp tác với nhau để phản bội Bitcoin." Nếu mã đề xuất được sử dụng, thuật toán đào Bitcoin hiện tại có thể bị thay đổi. Điều này có thể ngăn các máy đào ASIC hiện tại tạo khối trong chuỗi mới, dẫn đến một cuộc tái cấu trúc lớn trong mạng lưới đào Bitcoin. Tuy nhiên, những người ủng hộ BIP-110 chỉ coi đây là kế hoạch thay thế cho tình huống khẩn cấp. Luke Dashjr, một nhà phát triển khác từ Bitcoin Knots, cũng đóng góp vào việc tạo ra mã này. Dashjr hy vọng sẽ không cần dùng đến nó, nhưng việc có sẵn tùy chọn này có thể hữu ích trong trường hợp khủng hoảng tiềm tàng. Một người ủng hộ khác có biệt danh Mechanic lập luận rằng khả năng thay đổi thuật toán Proof-of-Work có thể có tác dụng răn đe đối với các thợ đào. Theo Mechanic, các quy tắc của Bitcoin nên được thiết lập bởi những người tham gia cung cấp dịch vụ theo các quy tắc đã được các nút vận hành chấp nhận đầy đủ, chứ không phải bởi các thợ đào. Mặc dù các tín hiệu từ thợ đào đang được theo dõi cho quá trình kích hoạt BIP-110, dữ liệu từ trang theo dõi chính thức cho thấy sự ủng hộ vẫn còn hạn chế.

cryptonews.ru2 giờ trước

Những người ủng hộ đề xuất nâng cấp BIP-110 cho Bitcoin đã chuẩn bị kế hoạch "dự phòng khẩn cấp" nếu đề xuất bị từ chối: Điều này có thể thay đổi hoàn toàn giá trị của BTC

cryptonews.ru2 giờ trước

Tại sao giá Bitcoin vẫn vững vàng và không lao dốc dù gần đây có vụ hack lớn? Bí mật nằm ở đây

Trong một cuộc phỏng vấn trên kênh "Wolf of All Streets", các chuyên gia đã thảo luận về lý do giá Bitcoin vẫn ổn định bất chấp vụ tấn công đánh cắp 100 triệu USD vào ví lạnh cá nhân. Các chuyên gia, bao gồm Matt Hougan (Bitwise), Ryan Rasmussen (Bitwise) và Tillman Holloway (Arch Public), cho rằng thị trường đã trưởng thành. Rasmussen chỉ ra rằng phần lớn dòng tiền mới hiện nay đến từ các nhà đầu tư tổ chức thông qua ETF spot hoặc các sàn được cấp phép như Coinbase, nên sự cố liên quan đến ví cá nhân chỉ ảnh hưởng đến một phần rất nhỏ và không gây ra hoảng loạn diện rộng. Hougan nhấn mạnh thị trường trong chu kỳ này có khả năng chống chịu tốt hơn trước tin xấu, nhờ sự tham gia của vốn tổ chức giúp giảm áp lực bán. Holloway mô tả đây là sự "thay đổi lực lượng gác cổng", quyền kiểm soát giá cả đã chuyển từ các thợ đào và sàn giao dịch crypto sang Phố Wall. Các chuyên gia cũng chỉ ra khoảng cách giữa tâm lý bi quan trên mạng xã hội và cách tiếp cận của các định chế tài chính lớn. Các ngân hàng như Morgan Stanley đang áp dụng chiến lược dài hạn và xem các đợt điều chỉnh giá là cơ hội mua vào. Rasmussen cho biết các ngân hàng lớn đang khuyến nghị khách hàng phân bổ từ 1-6% danh mục vào Bitcoin, cho thấy mức độ rủi ro đã giảm khi tài sản này được tích hợp vào hệ thống tài chính truyền thống.

cryptonews.ru2 giờ trước

Tại sao giá Bitcoin vẫn vững vàng và không lao dốc dù gần đây có vụ hack lớn? Bí mật nằm ở đây

cryptonews.ru2 giờ trước

Người sáng lập Aave kịch liệt phản đối những thay đổi dự kiến trên Ethereum: 'Điều này có thể gây thiệt hại đáng kể'

Người sáng lập kiêm CEO của Aave, Stani Kulechov, đã phản đối mạnh mẽ một đề xuất EIP trong cộng đồng Ethereum nhằm giới hạn phần thưởng staking. Đề xuất này đặt ra mức thưởng staking về 0% nếu lượng ETH được staking vượt quá 50% tổng nguồn cung. Kulechov cảnh báo rằng cơ chế này sẽ khiến thu nhập từ staking trở nên không thể dự đoán, làm giảm tính hấp dẫn của ETH như một tài sản đầu tư, đặc biệt đối với các tổ chức vốn ưa chuộng dòng tiền ổn định. Ông nhấn mạnh rằng sự không chắc chắn về lợi nhuận có thể khiến các nhà đầu tư chuyển sang các mạng blockchain khác, gây tổn hại cho hệ sinh thái Ethereum. Hơn nữa, lợi tức staking bằng 0 sẽ làm vô hiệu hóa phần lớn các chiến lược cho vay và tạo thu nhập dựa trên ETH, có thể thu hẹp đáng kể thị trường DeFi trên Ethereum. Kulechov kết luận rằng đề xuất này có thể làm suy yếu vị thế của ETH và hạn chế tiềm năng dài hạn của nó, đồng thời hy vọng nó sẽ không được thông qua để tránh gây ra làn sóng di chuyển sang các nền tảng cạnh tranh.

cryptonews.ru3 giờ trước

Người sáng lập Aave kịch liệt phản đối những thay đổi dự kiến trên Ethereum: 'Điều này có thể gây thiệt hại đáng kể'

cryptonews.ru3 giờ trước

Công ty Pháp Sequans tiếp tục thu hẹp vị thế trên BTC, tái đầu tư vào Internet vạn vật

Công ty sản xuất chip Pháp Sequans Communications (NYSE: SQNS) tiếp tục rút khỏi lĩnh vực Bitcoin, giảm lượng trái phiếu Bitcoin xuống còn 314 BTC trong quý II và thanh toán hết khoản nợ chuyển đổi. Giám đốc điều hành Georges Karam tái tập trung vào phát triển kinh doanh bán dẫn cho Internet of Things (IoT). Tính đến cuối tháng 3, Sequans sở hữu 1.514 BTC trị giá 103,2 triệu USD. Đến ngày 30/6, công ty chỉ còn giữ 314 BTC (~18,4 triệu USD), sau khi bán 1.200 coin trong quý. Việc bán hàng này đem lại lợi nhuận ròng 5,3 triệu USD, một sự thay đổi lớn so với khoản lỗ 11,7 triệu USD trong quý I khi bán trên thị trường đi xuống. Ông Karam cho biết động thái nhằm tối ưu hóa cấu trúc vốn và tập trung vào chiến lược cốt lõi về IoT. Công ty đã hoàn toàn trả hết nợ chuyển đổi và kết thúc quý với 21 triệu USD tiền mặt, không có nợ trên bảng cân đối. Hoạt động kinh doanh chip IoT của Sequans cho thấy dấu hiệu tích cực, với doanh thu sản phẩm tăng hơn 80% so với cùng kỳ năm trước. Thông tin này được các nhà đầu tư đón nhận, đẩy giá cổ phiếu SQNS tăng mạnh trong phiên giao dịch. Sequans từng tích cực đầu tư vào Bitcoin, đạt đỉnh hơn 3.300 coin, nhưng bắt đầu bán từ tháng 11/2025. Công ty nằm trong số nhiều doanh nghiệp như MARA, Riot Platforms... gần đây đã giảm mạnh khoản nắm giữ Bitcoin của họ.

cryptonews.ru4 giờ trước

Công ty Pháp Sequans tiếp tục thu hẹp vị thế trên BTC, tái đầu tư vào Internet vạn vật

cryptonews.ru4 giờ trước

Giao dịch

Giao ngay
活动图片