Robot GPT-3 Shocks Silicon Valley, Zero Lines of Code, Learns in Seconds, Backed by Jensen Huang and Fei-Fei Li

marsbitXuất bản vào 2026-08-21Cập nhật gần nhất vào 2026-08-21

Tóm tắt

Ngày 19/8, công ty Generalist AI tại Thung lũng Silicon đã ra mắt mô hình cơ bản mới GEN-1.5, được ví như "thời khắc GPT-3 của trí tuệ thể hiện". Mô hình này cho phép robot học thao tác vật lý chỉ qua một lần xem demo duy nhất mà không cần viết code hay huấn luyện lại, với tỷ lệ thành công trung bình đạt 59% cho 10 tác vụ. GEN-1.5 gây ấn tượng với khả năng ứng biến, như tự động chuyển từ chiến thuật "quét" sang "xúc và đổ" khi công cụ thay đổi, dù chưa từng được dạy. Những khả năng này xuất hiện một cách tự nhiên từ quá trình tiền huấn luyện quy mô lớn kéo dài 8 tháng trên dữ liệu tương tác vật lý, cho thấy dấu hiệu của Định luật Scaling trong lĩnh vực này. Thời điểm ra mắt trùng với tuần lễ sôi động của ngành robot: Công ty Unitree lên sàn chứng khoán, Hội nghị Robot Thế giới (WRC) và Thế vận hội Robot hình người khai mạc. Các chuyên gia như Jim Fan của NVIDIA chỉ ra rằng dữ liệu huấn luyện phong phú, bao gồm cả hành động lặp lại và khắc phục sai sót của con người, là chìa khóa cho khả năng của GEN-1.5. Dù các demo hiện tại còn đơn giản, đây được xem là bước tiến quan trọng, hứa hẹn giảm chi phí thích ứng tác vụ về gần như bằng không và mở ra khả năng ai cũng có thể lập trình robot trong tương lai.

Ngày 19 tháng 8, Công ty Yushu Technology lên sàn Kechuangban, mở cửa ở mức 1.100 nhân dân tệ/cổ phiếu, vốn hóa thị trường khoảng 444,9 tỷ nhân dân tệ.

Cùng ngày, con gái của CEO NVIDIA Jensen Huang, Huang Minshan, đã bay đến Bắc Kinh tham quan Hội nghị Robot Thế giới WRC.

Và ngay ngày hôm sau, giờ Bắc Kinh vào rạng sáng, công ty robot Thung lũng Silicon Generalist AI đã phát hành mô hình cơ sở thế hệ mới GEN-1.5.

Hai tháng trước, giáo sư Stanford Fei-Fei Li mới đầu tư cá nhân vào vòng gọi vốn 4 tỷ đô la của Generalist AI, cùng với các nhà đầu tư thiên thần khác như đồng sáng lập Xiaomi Lin Bin và nhà sáng lập Zoom Eric Yuan. NVIDIA cũng là cổ đông. Tiền thông minh và người thông minh cùng đổ về một hướng.

GEN-1.5 đã đưa ra lý do cho khoản đầu tư của họ: cho robot xem một đoạn trình diễn hành động từ 3 đến 12 giây, không huấn luyện, không tinh chỉnh, thực hiện ngay lập tức, tỷ lệ thành công trung bình trên 10 nhiệm vụ vận hành là 59%.

Trước đây, để dạy một robot vặn nắp chai, kỹ sư phải lập trình ba tháng. Bây giờ tất cả những gì cần là một đoạn trình diễn ba giây, và không dòng mã nào.

Nhiều nhà nghiên cứu hàng đầu đã so sánh thời khắc này với việc phát hành GPT-3 năm 2020, cho rằng trí tuệ thể hiện (embodied AI) đang đến thời điểm GPT-3 của riêng nó.

Chiến lược chưa từng được dạy xuất hiện từ quá trình tiền huấn luyện

Khả năng gây chấn động nhất của GEN-1.5 đối với các nhà nghiên cứu không phải là bắt chước, mà chính là khả năng ứng biến.

Generalist AI đã làm một thí nghiệm: sử dụng 5 phút dữ liệu trình diễn của con người (chỉ tinh chỉnh với 1 bước gradient), dạy robot dùng chổi quét khối xếp hình vào bát, sau đó thay thế công cụ.

Cho nó một quả chuối, nó dùng chuối như cây chổi, quét ngang các khối vào bát – điều này không lạ, hình dạng và chiến lược tiếp xúc của chuối tương tự chổi.

Cho nó một cái xẻng hót rác, nó từ bỏ chiến lược "quét", dùng tay kia đẩy khối lên xẻng, nhấc xẻng lên, đổ khối vào bát.

"Quét" và "xúc lên đổ" là hai chuỗi tiếp xúc hoàn toàn khác nhau, dữ liệu huấn luyện không hề dạy bộ động tác này.

Generalist AI sử dụng tìm kiếm ngôn ngữ lân cận gần nhất để tra cứu trong khoảng 1,89 triệu cảnh tiền huấn luyện, không tìm thấy cách sử dụng xẻng hót rác tương tự.

Không ai ở bất kỳ giai đoạn nào nói với mô hình rằng nên làm như vậy.

Hành vi ứng biến tương tự xuất hiện lặp đi lặp lại trong các bài kiểm tra: bát bị một tờ giấy che, mô hình tự mở giấy ra rồi đặt khối, đôi khi còn che giấy lại, nhưng dữ liệu huấn luyện không có cảnh này.

Một khối Lego dính vào đầu ngón tay robot, mô hình dùng tay kia gạt nó xuống.

Dữ liệu huấn luyện chỉ trình diễn dùng một tay xoay nắp lon, mô hình trong một số lần thử tự chuyển sang thao tác hai tay, áp dụng chiến lược cầm nắm và xoay hoàn toàn khác.

Một mô hình chỉ được huấn luyện đặt một khối vào một bát, bắt đầu tự phát phân loại nhiều khối theo màu sắc.

Những khả năng này có một nguồn gốc chung: tiền huấn luyện quy mô lớn.

GEN-1.5 đã được tiền huấn luyện liên tục hơn 8 tháng, trải qua ba giai đoạn huấn luyện.

Đường cong tập kiểm định mà Generalist AI công bố cho thấy, "sai số dự đoán hành động tiếp theo" của mô hình tiếp tục giảm, cho đến nay chưa xuất hiện dấu hiệu hội tụ.

Dùng thuật ngữ trong lĩnh vực mô hình ngôn ngữ lớn, đây chính là Định luật Mở rộng (Scaling Law) của trí tuệ thể hiện: khi quy mô dữ liệu tương tác vật lý tăng lên và thời gian huấn luyện kéo dài, khả năng khái quát hóa của mô hình đang tiếp tục tăng cường.

Một phát hiện phản trực giác làm cho manh mối này càng rõ ràng hơn: càng ít bước gradient tinh chỉnh, khả năng ứng biến càng mạnh.

Giải thích của Generalist AI là, tinh chỉnh nhẹ khiến mô hình gần hơn với kho hành vi rộng lớn tích lũy được từ tiền huấn luyện, giữ lại nhiều hơn "kinh nghiệm vật lý" có thể điều khiển.

10 bước gradient chỉ thay đổi 0,15% tham số mô hình.

Generalist AI nói: Điều này đã gần với "nhắc nhở mô hình về một số điều mà nó hầu như đã biết".

GEN-1.5 còn vượt qua hai vực sâu lâu nay làm khó ngành robot.

Ghi lại một đoạn trình diễn trong trình mô phỏng (mặc dù dữ liệu tiền huấn luyện không chứa bất kỳ dữ liệu mô phỏng nào), nhét vào cửa sổ ngữ cảnh, robot thực trực tiếp thực hiện nhiệm vụ, và có thể khái quát hóa sang các tay máy khác nhau và vị trí vật thể mới.

Trong một số bài kiểm tra, một người trực tiếp dùng hai tay của mình trình diễn động tác trước camera robot, sau đó robot dùng tay máy tái hiện nhiệm vụ.

Generalist AI cho biết, tất cả những khả năng này đều không phải là kết quả của thiết kế có chủ ý: không có thay đổi kiến trúc đặc biệt để thúc đẩy học trong ngữ cảnh, không có vòng lặp siêu học tập, không có mục tiêu huấn luyện phụ trợ khuyến khích ứng biến.

Những khả năng này tự xuất hiện từ quá trình tiền huấn luyện dữ liệu vật lý quy mô lớn.

"Chén Thánh của học vận hành"

Các nhóm nghiên cứu khác trước đây cũng đã thể hiện khả năng học trong ngữ cảnh tương tự, nhưng chỉ giới hạn ở một số loại nhiệm vụ, điểm mới của GEN-1.5 nằm ở phạm vi bao phủ; tất cả kết quả đều do Generalist AI tự báo cáo, chưa được xác minh độc lập.

Bản thân nhiệm vụ là thao tác tầm ngắn đơn giản (vặn nắp chai, kéo khóa kéo), vẫn còn khoảng cách lớn so với nhiệm vụ phức tạp tầm dài trong cảnh thực tế.

GPT-3 được phát hành vào tháng 6 năm 2020, từ GPT-3 đến ChatGPT mất hai năm rưỡi (đúng vậy, hai năm rưỡi).

Vị trí của GEN-1.5 hiện nay tương tự như GPT-3 năm 2020: khả năng thô nhưng hướng đi rõ ràng, nhiệm vụ đơn giản nhưng xu hướng Scaling rõ ràng.

Generalist AI đã viết một đoạn đáng suy ngẫm trong blog chính thức:

Sau khi vượt qua một ngưỡng tiền huấn luyện nhất định, chi phí thích ứng một nhiệm vụ mới trở nên không đáng kể.

Việc học trong ngữ cảnh xuất hiện, vài giây dữ liệu, hoặc một bước gradient cộng với một phút trình diễn, đã không còn là huấn luyện đặc thù nhiệm vụ theo nghĩa truyền thống, mà gần hơn với việc nhắc nhở mô hình về một số điều mà nó hầu như đã biết.

Nếu đường cong Scaling của trí tuệ thể hiện thực sự chưa có dấu hiệu hội tụ (Generalist AI nói họ chưa thấy), thì nguồn lực cốt lõi của cuộc cạnh tranh tiếp theo sẽ trở thành ai sở hữu đủ nhiều dữ liệu tương tác vật lý để cung cấp cho cỗ máy này.

Điều này hoàn toàn giống với kịch bản năm 2021 khi mô hình ngôn ngữ lớn bước vào cuộc chiến tranh giành dữ liệu.

Nhìn một lần là học được, điểm ngoặt đằng sau hai con số 59% và 83%

Tháng 6 năm 2020, OpenAI phát hành GPT-3.

Mô hình này đã làm một điều lúc đó chưa ai làm được: không cần huấn luyện lại, chỉ cần cho vài ví dụ trong hộp thoại, nó có thể hoàn thành nhiệm vụ ngôn ngữ mới – cho một nhóm ví dụ "đỏ→táo, vàng→chuối", sau đó hỏi "xanh→?", nó có thể trả lời "dưa hấu".

Khả năng này gọi là in-context learning (học trong ngữ cảnh), là bước ngoặt để mô hình ngôn ngữ lớn từ "công cụ chuyên dụng" trở thành "nền tảng phổ quát".

GEN-1.5 đã chuyển điều tương tự vào thế giới vật lý.

Generalist AI gọi nó là Physical Prompting (Gợi ý vật lý).

Phương pháp thao tác rất trực tiếp: một đoạn trình diễn hành động thực tế (chứa dữ liệu cảm biến và quỹ đạo hành động) được nhét vào cửa sổ bộ nhớ ngữ cảnh 30 giây của mô hình, phần không gian còn lại dùng để tiếp nhận quan sát môi trường thời gian thực.

Mô hình lập tức cố gắng thực hiện, toàn bộ quá trình không có bất kỳ bước huấn luyện nào.

Cần giải thích một khái niệm quan trọng để hiểu GEN-1.5: gradient step (bước gradient).

Theo cách làm truyền thống, dạy robot học nhiệm vụ mới cần hàng chục nghìn bước giảm gradient, mỗi bước là một lần tinh chỉnh tham số bên trong mô hình – quá trình này thường cần nhiều dữ liệu và nhiều sức mạnh tính toán.

Chế độ one-shot (chỉ trình diễn một lần) của GEN-1.5 bỏ qua tất cả các bước gradient, tham số mô hình không hề thay đổi.

Generalist AI đã kiểm tra hiệu suất của GEN-1.5 trên 10 nhiệm vụ vận hành khác nhau: vặn mở nắp lọ thủy tinh, kéo khóa kéo túi bút, lấy tiền từ ví, gấp giấy, xếp cốc, lật điện thoại, dùng chổi quét khối xếp hình, mở bìa sách, xé miếng đệm hút chân không, quét rác.

Kết quả chia làm hai nhóm:

one-shot (xem một lần, zero bước gradient): Tỷ lệ thành công trung bình 10 nhiệm vụ là 59% (độ lệch chuẩn ±10%).

few-shot (ít mẫu, 5 phút dữ liệu, khoảng 50 lần trình diễn, 10 bước gradient): Tỷ lệ thành công trung bình 83% (độ lệch chuẩn ±9%).

Đưa ra con số của GPT-3 năm 2020 trên nhiệm vụ ngôn ngữ để đối chiếu: one-shot khoảng 45%, few-shot (khoảng 100 ví dụ) khoảng 65%.

Cấu trúc của hai nhóm số này rất giống nhau.

Ý nghĩa của nhóm số này có thể hiểu như sau: Trước khi mô hình ngôn ngữ lớn xuất hiện, để AI làm một nhiệm vụ ngôn ngữ mới (ví dụ dịch một định dạng chưa từng thấy), cần thu thập dữ liệu chuyên biệt, huấn luyện một mô hình mới, chu kỳ tính bằng tháng.

Sau GPT-3, việc này trở thành "viết vài ví dụ trong ô nhập liệu", chi phí thời gian từ vài tháng nén xuống vài giây.

GEN-1.5 đã làm điều nén tương tự trong lĩnh vực vận hành vật lý.

Trước đây dạy robot vặn nắp chai, cần kỹ sư lập trình vài tháng hoặc cho hàng chục nghìn dòng dữ liệu huấn luyện điều chỉnh tham số lặp đi lặp lại.

Bây giờ, một đoạn trình diễn từ 3 đến 12 giây là đủ.

Generalist AI viết trong blog chính thức: Điều này thay đổi hai việc: tốc độ robot trở nên hữu ích (từ vài tháng xuống vài giây), và ai có thể sử dụng robot (từ chuyên gia đến bất kỳ ai).

Tuần sôi động của robot: Yushu lên sàn, hội nghị robot và đại hội thể thao cùng khai mạc

Thời điểm phát hành GEN-1.5 rơi vào tuần dày đặc nhất của toàn ngành trí tuệ thể hiện.

Từ ngày 19 tháng 8, Hội nghị Robot Thế giới WRC khai mạc tại Bắc Kinh Yizhuang, hơn 300 doanh nghiệp, hơn 2000 sản phẩm triển lãm, hơn 150 sản phẩm mới ra mắt toàn cầu tập trung xuất hiện.

Ba ngày sau, ngày 22 tháng 8, Đại hội Thể thao Người máy Hình người Thế giới lần thứ hai khai mạc tại "Ruy băng Băng" Nhà thi đấu tốc độ quốc gia – 666 đội mang 2056 robot tham gia 1301 trận đấu ở 51 hạng mục, số lượng đội tăng 138% so với lần đầu.

Đại hội thể thao lần đầu tiên thiết lập 21 hạng mục thi cảnh, yêu cầu người máy hình người hoàn thành nhiệm vụ tầm dài trong môi trường thực tế như nhà máy, khách sạn, dịch vụ gia đình, chủ đề là robot "lên làm thực tế".

Yushu Technology vừa lên sàn, năm 2025 sản lượng xuất xưởng người máy hình người vượt 5500 chiếc, đứng đầu toàn cầu, doanh thu 1,7 tỷ nhân dân tệ, tỷ suất lợi nhuận gộp 60%, DeepSeek cũng tham gia phân phối chiến lược.

Nhưng trong bản cáo bạch của Yushu ẩn chứa một nhóm số tương phản: Tốc độ tăng trưởng doanh thu quý I năm 2026 giảm từ 332,64% cùng kỳ năm trước xuống 68,49%, lợi nhuận sau thuế phi thường niên giảm 52,55%. Lõi của việc tăng trưởng chậm lại là do đầu tư nghiên cứu phát triển tăng mạnh.

Điều Yushu đang đuổi theo, chính là thứ họ chưa có: mô hình lớn trí tuệ thể hiện.

"Xin Lichang Pro" trong một bài phân tích ("Trong bản cáo bạch của Yushu Technology, ẩn giấu sự lo lắng về 'hạn sử dụng' của kỳ tích kỹ thuật") đã viết về tình thế khó khăn cấu trúc mà Yushu đối mặt: Yushu tạo ra thân thể xuất xưởng số một toàn cầu, nhưng "bộ não vắng mặt".

Năm 2026 được gọi là "năm lên sàn lớn" của trí tuệ thể hiện, hơn 20 công ty đã xác định kế hoạch lên sàn, nhưng phần lớn thúc đẩy làn sóng lên sàn là do áp lực vốn.

Một lượng lớn đối thủ cạnh tranh phụ thuộc vào các vòng gọi vốn liên tiếp để duy trì hoạt động, nhịp độ nghiên cứu phát triển bị dắt mũi bởi cửa sổ gọi vốn.

Nguồn ảnh: LatePost "Trò chơi tiền bạc của trí tuệ thể hiện"

Nhà sáng lập Yushu Wang Xingxing công khai phát biểu tại WRC, nút thắt chính hạn chế sự phát triển của người máy hình người là mô hình lớn trí tuệ thể hiện, "dự kiến tương lai nhanh thì hai đến ba năm, chậm thì năm đến mười năm, có hy vọng đạt được thời khắc ChatGPT của robot".

Việc phát hành GEN-1.5 có thể coi là phản hồi thực chứng đầu tiên cho phán đoán này.

Định luật Mở rộng tồn tại trong lĩnh vực trí tuệ thể hiện, tiền huấn luyện quy mô lớn có thể khiến chi phí biên thích ứng nhiệm vụ mới tiến gần bằng không.

Kết luận này có ý nghĩa công nghiệp trực tiếp đối với nhà sản xuất thân thể như Yushu: một khi mô hình phổ quát ở cấp độ não bộ trưởng thành, giá trị của thân thể sẽ phụ thuộc vào tốc độ nó kết nối với bộ não này, chứ không chỉ là thông số phần cứng và quy mô xuất xưởng.

Bối cảnh đội ngũ Generalist AI hoàn toàn phù hợp với tuyến công nghệ này.

Đồng sáng lập Pete Florence và Andy Zeng đến từ đội robot Google DeepMind, Andrew Barry đến từ Boston Dynamics.

Từ trái sang phải: Pete Florence, Andrew Barry, Andy Zeng

Công ty hoàn thành vòng gọi vốn 4 tỷ đô la vào tháng 6 năm 2026, Radical Ventures dẫn đầu, NVIDIA và Bezos Expeditions tham gia đầu tư, định giá sau đầu tư 2 tỷ đô la.

Generalist AI đang đàm phán vòng gọi vốn mới với định giá 3 tỷ đô la.

Các đại gia Thung lũng Silicon, đón thời khắc sôi sục tập thể lâu nay chưa từng có

Lần phát hành này đã gây ra phản ứng mạnh mẽ trong cộng đồng nghiên cứu robot.

Đồng sáng lập Pete Florence viết trên X:

Từ khi bắt đầu nghiên cứu mô hình cơ sở robot, việc học trong ngữ cảnh one-shot rộng rãi luôn là mục tiêu rõ ràng nhất trong lòng tôi.

Bây giờ tôi thấy trí tưởng tượng gần mười năm bước vào thế giới thực.

Florence nhắc đến, anh và Andy Zeng từng thảo luận về một khả năng kiểu "Ctrl-C-Ctrl-V" ở giai đoạn nghiên cứu sinh: nhìn thấy một hành động, robot có thể sao chép – nhưng thực hiện nó cực kỳ khó, vì "thế giới bạn muốn dán, và thế giới bạn sao chép, luôn luôn khác nhau".

Nhà nghiên cứu robot Đại học Carnegie Mellon Chris Paxton gọi GEN-1.5 trên X là "có thể là thời khắc GPT thực sự", và viết:

Chén Thánh của học vận hành, không nghi ngờ gì, chính là học one-shot.

https://x.com/chris_j_paxton/status/2090270734816092334

https://x.com/chris_j_paxton/status/2090210797125611972

Nhà nghiên cứu trí tuệ thể hiện Đại học Northeastern Mỹ Jimmy Yang chuyển tiếp và nói:

Là nhà nghiên cứu AI thể hiện, đây là một thời khắc thực sự đặc biệt đối với lĩnh vực này.

https://x.com/JimmyTYYang1/status/2090202923632366073

Bình luận của Giám đốc Kỹ thuật Robot NVIDIA Jim Fan cung cấp một góc nhìn kỹ thuật sâu sắc.

Ông chỉ ra hai yếu tố then chốt cho khả năng xuất hiện của GEN-1.5:

Một là mô hình hành động lặp lại đối xứng tự nhiên tồn tại trong dữ liệu huấn luyện, ví dụ như lắp ráp đồ đạc lặp lại vặn ốc vít, con ốc thứ hai chính là "mẫu học trong ngữ cảnh" của con thứ nhất;

Hai là hành động phục hồi sau khi con người mắc lỗi trong dữ liệu, đồ vật rơi xuống nhặt lên tiếp tục, đường cong hoàn chỉnh "thất bại-phục hồi-tiếp tục" này khiến mô hình tự nhiên thể hiện khả năng sửa lỗi khi kiểm tra.

Jim Fan còn chỉ ra, phương thức thu thập dữ liệu UMI mà Generalist AI sử dụng (con người trực tiếp đeo kẹp tay robot để thao tác) giữ lại được "trực giác vật lý" của con người, việc chuyển tiếp qua thiết bị VR trong thao tác từ xa truyền thống khiến trực giác này hao hụt nhiều.

https://x.com/DrJimFan/status/2090465981240086992

Tất nhiên, nước lạnh lý tính cũng tồn tại.

Jim Fan viết trong phần bình luận của cùng một tweet:

Trình diễn hiện tại vẫn còn hơi quá đơn giản, chưa thể đưa ra kết luận.

https://x.com/DrJimFan/status/2090469108764823587

Bài viết này đến từ tài khoản WeChat công chúng "Tân Trí Nguyên" (新智元), tác giả: ASI Khải Thị Lục (ASI启示录)

Câu hỏi Liên quan

QGEN-1.5 mô hình mới nhất của Generalist AI đã đạt được bước đột phá gì trong việc huấn luyện robot?

AGEN-1.5 của Generalist AI cho phép robot học và thực hiện tác vụ mới thông qua phương pháp 'Physical Prompting' (gợi ý vật lý). Robot chỉ cần xem một đoạn video minh họa hành động kéo dài 3-12 giây mà không cần lập trình hay tinh chỉnh mô hình (zero-shot hoặc few-shot), sau đó có thể thực hiện ngay lập tức. Trong 10 tác vụ thử nghiệm, tỷ lệ thành công trung bình đạt 59% (zero-shot) và 83% (few-shot). Điều này được so sánh với 'Khoảnh khắc GPT-3' của trí tuệ thể hiện (embodied AI).

QKhả năng 'ứng biến' (improvisation) của GEN-1.5 được thể hiện như thế nào trong các thí nghiệm?

AGEN-1.5 thể hiện khả năng ứng biến đáng kinh ngạc khi xử lý các tình huống không có trong dữ liệu huấn luyện. Ví dụ: Khi được yêu cầu dùng chổi quét khối hạt vào bát nhưng thay thế bằng một cái xẻng rác, nó đã tự động chuyển sang chiến lược khác là dùng tay đẩy khối hạt lên xẻng rồi đổ vào bát. Các ví dụ khác bao gồm tự mở tờ giấy che bát, dùng tay còn lại gỡ khối Lego dính trên ngón tay, hoặc tự động chuyển từ dùng một tay sang hai tay để mở nắp lọ. Những khả năng này nảy sinh từ việc tiền huấn luyện quy mô lớn trên dữ liệu tương tác vật lý.

QViệc phát hành GEN-1.5 diễn ra trong bối cảnh ngành công nghiệp robot toàn cầu như thế nào?

AViệc phát hành GEN-1.5 trùng hợp với một tuần sôi động của ngành robot toàn cầu: Ngày 19/8, công ty robot Trung Quốc Unitree lên sàn chứng khoán; Hội nghị Robot Thế giới (WRC) và Thế vận hội Robot Hình người Thế giới lần thứ 2 cũng được tổ chức tại Bắc Kinh. Bối cảnh này nhấn mạnh sự cạnh tranh và đầu tư mạnh mẽ vào lĩnh vực trí tuệ thể hiện. Nhiều công ty, bao gồm cả Unitree, đang chịu áp lực phát triển hoặc tích hợp 'bộ não' AI thể hiện tiên tiến để bổ sung cho 'cơ thể' robot phần cứng của họ.

QÝ nghĩa của 'Định luật Scaling' (Scaling Law) trong lĩnh vực trí tuệ thể hiện (embodied AI) là gì theo bài viết?

ABài viết chỉ ra rằng GEN-1.5 cho thấy bằng chứng về 'Định luật Scaling' trong trí tuệ thể hiện, tương tự như với các mô hình ngôn ngữ lớn. Điều này có nghĩa là khả năng tổng quát hóa và hiệu suất của mô hình tiếp tục được cải thiện khi quy mô dữ liệu tương tác vật lý và thời gian huấn luyện tăng lên, và đường cong học tập vẫn chưa cho thấy dấu hiệu hội tụ. Hệ quả quan trọng là chi phí biên để thích ứng với một tác vụ mới tiến gần đến 0 sau khi vượt qua một ngưỡng tiền huấn luyện nhất định, biến dữ liệu tương tác vật lý trở thành nguồn tài nguyên cạnh tranh then chốt.

QCác chuyên gia và nhà đầu tư nổi tiếng nào đã tham gia vào Generalist AI và phản ứng của họ về GEN-1.5 ra sao?

AGeneralist AI đã nhận được sự ủng hộ từ nhiều nhà đầu tư và chuyên gia lớn: Giáo sư Stanford Lý Phi Phi đầu tư cá nhân, NVIDIA là cổ đông, và các nhà đầu tư thiên thần bao gồm đồng sáng lập Xiaomi Lâm Bân và người sáng lập Zoom Viên Trình. Công ty đã huy động được 4 tỷ USD vào tháng 6/2026. Sau khi GEN-1.5 ra mắt, các nhà nghiên cứu như Chris Paxton (Đại học Carnegie Mellon) gọi đây là 'Khoảnh khắc GPT thực sự', Jimmy Yang (Đại học Northeastern) coi đây là 'khoảnh khắc thực sự đặc biệt'. Jim Fan, Giám đốc Kỹ thuật Robot tại NVIDIA, phân tích sâu về các yếu tố kỹ thuật dẫn đến khả năng xuất hiện của mô hình, đồng thời lưu ý rằng các minh họa hiện tại vẫn còn khá đơn giản.

Nội dung Liên quan

Các nhà đầu tư Hàn Quốc đã quay trở lại thị trường! Khối lượng giao dịch phá kỷ lục và altcoin này đã chạm đỉnh!

Nhà đầu tư Hàn Quốc đang quay trở lại thị trường tiền điện tử, thúc đẩy bởi đà tăng mạnh gần đây của Bitcoin. Sàn giao dịch lớn nhất nước này, Upbit, ghi nhận khối lượng giao dịch trong 24 giờ tăng 273%, lên 1,84 tỷ USD, mức cao nhất kể từ giữa tháng Ba. XRP là tài sản được giao dịch nhiều nhất trên Upbit, với khối lượng khoảng 418,9 triệu USD, tiếp theo là Bitcoin, USDT và Ethereum. Sàn Bithumb lớn thứ hai cũng chứng kiến khối lượng tăng 132,9%, lên 934,9 triệu USD, với XRP dẫn đầu. Chuyên gia Min Jeong từ Presto Research cho biết thị trường giá xuống kéo dài từ cuối 2025 đến 2026 đã khiến các nhà đầu tư Hàn Quốc rời bỏ thị trường tiền điện tử để tập trung vào cổ phiếu. Tuy nhiên, đà tăng của Bitcoin gần đây đã khơi dậy lại sự quan tâm của họ. Jeong nhận định rằng nếu xu hướng tăng tiếp tục, dòng vốn từ Hàn Quốc đổ vào thị trường tiền điện tử có thể còn lớn hơn nữa, do các nhà đầu tư nước này có xu hướng tìm kiếm lợi nhuận và sẵn sàng dịch chuyển vốn, điều này có thể làm gia tăng thêm đà tăng của thị trường.

cryptonews.ru14 phút trước

Các nhà đầu tư Hàn Quốc đã quay trở lại thị trường! Khối lượng giao dịch phá kỷ lục và altcoin này đã chạm đỉnh!

cryptonews.ru14 phút trước

Flowra Khởi Chạy Phiên Đấu Giá Mở Dòng Lệnh cho Việc Xây Dựng Khối Solana

Solana đang trải qua một đợt cải tổ cơ sở hạ tầng lớn. Flowra, một công ty cơ sở hạ tầng blockchain, đã ra mắt hệ thống xây dựng khối mới có tên Đấu giá Dòng lệnh Mở (OOA). Hệ thống này được thiết kế để tăng tính cạnh tranh trong việc sắp xếp giao dịch và giúp các trình xác thực (validator) nhận được phần giá trị lớn hơn từ MEV (Giá trị Có thể Trích xuất Tối đa). Hiện tại, thị trường sắp xếp giao dịch và MEV của Solana vẫn tập trung cao độ, với nhiều trình xác thực phụ thuộc vào các kênh dòng lệnh đóng. OOA thay đổi điều này bằng cách cho phép các "searcher" đã đăng ký cạnh tranh để đưa giao dịch vào khối thông qua một cuộc đấu giá mở. Flowra cho rằng cách tiếp cận này có thể cải thiện việc khám phá giá và tạo thêm cơ hội thu nhập cho trình xác thực. Kết quả thử nghiệm ban đầu rất khả quan, với một trình xác thực được trang bị Flowra đã tăng 20,6% đơn vị tính toán mỗi khối, đạt 101% mức trung bình mạng lưới, cùng phí khối cao hơn và thời gian hoạt động ổn định 99,999%. Bên cạnh phiên đấu giá, Flowra còn giới thiệu Chính sách Khối Lập trình được, cho phép trình xác thực kiểm soát nhiều hơn các giao dịch được đưa vào khối, hữu ích cho các yêu cầu tuân thủ. Họ cũng hợp tác với Honeypot để tích hợp khả năng sàng lọc rủi ro và tuân thủ ở lớp xây dựng khối này. Mô hình của Flowra lấy cảm hứng từ thị trường xây dựng khối cạnh tranh của Ethereum. Công ty tin rằng với thông lượng giao dịch cao và độ trễ thấp, Solana có thể hỗ trợ một mô hình tương tự. OOA hiện đã sẵn sàng cho các trình xác thực và searcher trong hệ sinh thái Solana.

TheNewsCrypto44 phút trước

Flowra Khởi Chạy Phiên Đấu Giá Mở Dòng Lệnh cho Việc Xây Dựng Khối Solana

TheNewsCrypto44 phút trước

Besu Tiết Lộ Năm Lỗ Hổng Bảo Mật Do CertiK Phát Hiện Đã Được Sửa Trong Bản Cập Nhật Mới Nhất

Khách hàng Ethereum Besu đã tiết lộ chi tiết về năm lỗ hổng bảo mật do công ty an ninh blockchain CertiK phát hiện. Tất cả đều được khắc phục trong phiên bản 26.7.1 phát hành ngày 27/7. Các vấn đề có mức độ nghiêm trọng từ Nhỏ đến Lớn và đã được xử lý trước khi thông tin kỹ thuật được công bố rộng rãi vào ngày 14/8. Besu đã khuyến nghị các nhà vận hành nút nâng cấp lên phiên bản đã vá. Các lỗ hổng liên quan đến xử lý thông báo khối, đệm đề xuất đồng thuận độ cao tương lai, đăng ký WebSocket và tạo bộ lọc JSON-RPC. Trong một số cấu hình nhất định, chúng có thể làm cạn kiệt bộ nhớ hoặc khả năng xử lý luồng của nút, ảnh hưởng đến khả năng sẵn sàng hoặc xử lý đồng thuận. Phiên bản 26.7.1 bổ sung các biện pháp kiểm soát mới, bao gồm giới hạn cấu hình cho bộ lọc JSON-RPC đang hoạt động, thời gian chờ bộ lọc và giới hạn số lượng đăng ký WebSocket tích cực. Các lỗ hổng được phát hiện thông qua nghiên cứu độc lập của CertiK bằng phương pháp thử nghiệm đối kháng Chain Scan. Besu đã công bố bốn thông báo bảo mật chi tiết về các phát hiện và biện pháp khắc phục.

TheNewsCrypto45 phút trước

Besu Tiết Lộ Năm Lỗ Hổng Bảo Mật Do CertiK Phát Hiện Đã Được Sửa Trong Bản Cập Nhật Mới Nhất

TheNewsCrypto45 phút trước

Làn sóng tăng giá mới của ngành bán dẫn, STMicroelectronics, Zhaosheng Wei và các công ty khác tăng giá hàng loạt

Ngành công nghiệp bán dẫn đang đón một chu kỳ tăng giá mới, được thúc đẩy bởi cả yếu tố cung-cầu và chi phí. Bước vào tháng 8, nhiều công ty như STMicroelectronics (STM), Analog Devices, Inc. (ADI) và công ty Trung Quốc Zhuoshengwei đã gửi thông báo điều chỉnh giá tới khách hàng, tập trung vào các lĩnh vực chip analog và chip RF. STM thông báo sẽ tăng giá từ ngày 23/8, đây là lần điều chỉnh thứ ba trong năm 2026, với lý do nhu cầu tăng mạnh liên tục và áp lực chi phí lớn từ logistics, năng lượng, nguyên vật liệu đến dịch vụ sản xuất. ADI cũng sẽ áp dụng mức giá mới cho toàn bộ danh mục sản phẩm từ ngày 13/9, lần tăng thứ hai trong năm, viện dẫn áp lực chi phí và nhu cầu chưa từng có. Zhuoshengwei tăng giá toàn bộ sản phẩm RF từ ngày 1/9, lần đầu trong năm, do chi phí nguyên liệu thô và sản xuất tăng cao, cùng với tình trạng căng thẳng năng lượng đúc và đóng gói. So với đợt tăng giá nửa đầu năm do chip bộ nhớ AI dẫn dắt, làn sóng hiện tại chuyển trọng tâm sang các công nghệ chế tạo tiến trình trưởng thành. Nhu cầu về năng lượng tính toán AI không chỉ chiếm dụng công nghệ tiên tiến mà còn hút căng năng lượng sản xuất wafer 8 inch, đẩy chi phí sản xuất chip analog, công suất và RF lên cao. Các chu kỳ mở rộng sản xuất cho chip analog và công suất thường kéo dài 18-24 tháng, khiến nguồn cung khó theo kịp nhu cầu gia tăng từ công nghiệp và AI trong ngắn hạn, dự báo giá cả sẽ còn duy trì độ cứng trong một thời gian. Tuy nhiên, khả năng chịu đựng chi phí của các nhà sản xuất phía dưới có giới hạn và biến động nhu cầu toàn cầu sẽ là những yếu tố ảnh hưởng đến xu hướng giá trong tương lai.

marsbit1 giờ trước

Làn sóng tăng giá mới của ngành bán dẫn, STMicroelectronics, Zhaosheng Wei và các công ty khác tăng giá hàng loạt

marsbit1 giờ trước

Giao dịch

Giao ngay
活动图片