# Bài viết Liên quan Mô Hình Nền Tảng

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Mô Hình Nền Tảng", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Bài phỏng vấn mới nhất của Lý Phi Phi: Con người cũng không hoàn toàn dựa vào dữ liệu thực tế để học tập

Bài phỏng vấn với giáo sư Lý Phi Phi tập trung vào chủ đề “trí tuệ không gian” và chiến lược của World Labs trong lĩnh vực robot sau khi mua lại SceniX. Cuộc thảo luận làm nổi bật tầm quan trọng của việc tạo ra các thế giới kỹ thuật số hoặc mô phỏng để đào tạo và đánh giá robot, giải quyết thách thức thiếu dữ liệu thực tế. Giáo sư Lý Phi Phi giải thích rằng robot là “viên đá thử vàng” đầu tiên cho trí tuệ không gian. SceniX, dẫn đầu bởi cựu nghiên cứu sinh sau tiến sĩ Lý Quân Chúc, giải quyết vấn đề then chốt: thiếu dữ liệu đào tạo và đánh giá trong robot. Giải pháp của họ là một đường ống “real-to-sim-to-real”, ánh xạ môi trường thực vào thế giới số để tạo dữ liệu có thể mở rộng thay thế cho việc thu thập dữ liệu chậm, đắt đỏ và nguy hiểm ngoài đời thực. Các bên nhấn mạnh sự bổ sung giữa World Labs (mạnh về mô hình tạo sinh như Marble và tái tạo 3D) với SceniX (mạnh về robot, mô phỏng và kết xuất). Hợp tác này nhằm xây dựng cơ sở hạ tầng kỹ thuật số trung lập với phần cứng và mô hình, nơi mọi robot có thể được đào tạo và đánh giá một cách đáng tin cậy. Bài phỏng vấn thảo luận về lợi ích của mô phỏng, bao gồm lý luận phản thực tế, độ tin cậy, hiệu quả và khả năng kiểm soát. Con đường ứng dụng thực tế được đề xuất là từ môi trường có cấu trúc (nhà kho) đến bán cấu trúc, thay vì nhảy ngay vào môi trường phi cấu trúc (như gia đình). Mục tiêu trong hai năm là chứng minh giá trị của nền tảng này thông qua các trường hợp sử dụng thành công ở một số lĩnh vực dọc quan trọng.

marsbit18 giờ trước

Bài phỏng vấn mới nhất của Lý Phi Phi: Con người cũng không hoàn toàn dựa vào dữ liệu thực tế để học tập

marsbit18 giờ trước

Trí tuệ cụ thân vượt qua 'kỳ thi đại học' khó đến điên cuồng, con người 100 điểm, mô hình mạnh nhất 12.8

Trí tuệ thể hóa (Embodied AI) đang đối mặt với một “kỳ thi khó” mang tên RoboDojo – một tiêu chuẩn đánh giá toàn diện mới cho khả năng thao tác của robot, được ví như "đỉnh Everest" trong lĩnh vực này. RoboDojo đánh giá trên cả môi trường mô phỏng và thế giới thực, bao gồm 42 nhiệm vụ mô phỏng và 18 nhiệm vụ trên robot thật, kiểm tra 5 khả năng cốt lõi: Khái quát hóa, Trí nhớ, Thao tác chính xác, Thực thi nhiều bước và Hiểu ngữ nghĩa mở. Kết quả cho thấy khoảng cách lớn: Trong mô phỏng, chiến lược robot mạnh nhất hiện nay (Hy-Embodied-0.5-VLA) chỉ đạt tỷ lệ thành công trung bình 8.80%. Trên robot thật, mô hình tốt nhất (π0.5) chỉ đạt 12.8%. Trong khi đó, con người đạt lần lượt 76.03% và 100%. RoboDojo tiết lộ điểm yếu của các mô hình cơ bản hiện nay: thiếu ổn định, khó hoàn thành toàn bộ nhiệm vụ dài và đặc biệt kém trong các nhiệm vụ ngữ nghĩa mở (tỷ lệ thành công chỉ ~1.67%). Dự án cung cấp cơ sở hạ tầng như XPolicyLab để chuẩn hóa việc đánh giá và một bảng xếp hạng công khai, minh bạch, giúp cộng đồng có thước đo chung để tiến bộ hướng tới robot thao tác đa năng thực sự.

marsbit07/08 11:52

Trí tuệ cụ thân vượt qua 'kỳ thi đại học' khó đến điên cuồng, con người 100 điểm, mô hình mạnh nhất 12.8

marsbit07/08 11:52

Bài viết mới nhất của Lý Phi Phi: Khi video tạo sinh, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

Trong bài viết mới nhất của mình, giáo sư Lý Phi Phi đã phân loại và làm rõ khái niệm "mô hình thế giới" đang bị sử dụng một cách lộn xộn trong lĩnh vực AI hiện nay. Bà đề xuất một cách phân loại chức năng dựa trên vòng lặp POMDP cổ điển (tác nhân → hành động → trạng thái → quan sát → tác nhân), chia các hệ thống được gọi là "mô hình thế giới" thành ba loại chính: 1. **Bộ kết xuất (Renderer):** Đầu ra là các quan sát (pixel). Mục tiêu là độ trung thực về mặt thị giác. Ví dụ: các mô hình tạo video từ văn bản như Sora, hay hệ thống tương tác như Genie. Chúng tạo ra hình ảnh đẹp nhưng không nhất thiết tuân thủ vật lý chính xác. 2. **Bộ mô phỏng (Simulator):** Đầu ra là trạng thái thế giới. Mục tiêu là độ chính xác về cấu trúc hình học, vật lý và động lực học. Chúng phục vụ cả con người (kiến trúc sư, nhà thiết kế) và các chương trình máy tính (robot, xe tự hành) để tính toán và đào tạo. Đây được coi là trung tâm then chốt bị đánh giá thấp. 3. **Bộ lập kế hoạch (Planner):** Đầu ra là các hành động. Cho một quan sát và mục tiêu, nó quyết định tác nhân nên làm gì tiếp theo. Ví dụ: các mô hình VLA (Vision-Language-Action). Đây là lĩnh vực thú vị nhất nhưng cũng non trẻ nhất, với khoảng cách lớn giữa demo trong phòng thí nghiệm và ứng dụng thực tế. Bài viết nhấn mạnh ba loại này không tách biệt mà chia sẻ hiểu biết cơ bản chung về thế giới. Xu hướng quan trọng hiện nay là sự hợp nhất giữa chúng, hướng tới một **mô hình thế giới thống nhất** có thể chuyển đổi linh hoạt giữa kết xuất, mô phỏng và lập kế hoạch tùy theo nhu cầu. Sản phẩm Marble của World Labs là một bước đi theo hướng này, cùng lúc tạo ra cả dữ liệu hình ảnh (Gaussian splatting) và dữ liệu vật lý (collision mesh) từ một mô hình duy nhất. Tóm lại, trong khi mô hình ngôn ngữ cho phép máy móc "nói" về thế giới, thì mô hình thế giới chính là con đường để chúng thực sự hiểu, tưởng tượng, suy luận và tương tác với thế giới vật lý.

marsbit07/05 09:27

Bài viết mới nhất của Lý Phi Phi: Khi video tạo sinh, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

marsbit07/05 09:27

Bài viết mới của Lý Phi Phi: Khi tạo video, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

Tác giả Lý Phi Phi đưa ra một phân loại rõ ràng cho khái niệm "mô hình thế giới" (world model) đang bị sử dụng lộn xộn trong AI hiện nay. Dựa trên vòng lặp POMDP cơ bản (tác nhân → hành động → trạng thái → quan sát), bà chia các hệ thống tự xưng là mô hình thế giới thành ba loại chức năng: 1. **Bộ kết xuất (Renderer)**: Đầu ra là quan sát (pixel), tập trung vào độ trung thực thị giác. Ví dụ: các mô hình tạo video như Sora. Hạn chế: hình ảnh đẹp nhưng có thể không đúng vật lý. 2. **Bộ mô phỏng (Simulator)**: Đầu ra là trạng thái thế giới (mô hình hình học, vật lý, động lực học chính xác). Đây là trung tâm then chốt, có thể phục vụ cả con người (thiết kế, mô phỏng) và máy móc (đào tạo robot, xe tự lái). Ví dụ: NVIDIA Omniverse. 3. **Bộ lập kế hoạch (Planner)**: Đầu ra là hành động. Dựa trên quan sát và mục tiêu, nó quyết định tác nhân nên làm gì tiếp theo. Ví dụ: các mô hình Ngôn ngữ-Thị giác-Hành động (VLA) cho robot. Bài viết nhấn mạnh **bộ mô phỏng là trung tâm bị đánh giá thấp**, vì nó hoạt động ở cấp độ cấu trúc nền tảng (hình học, vật lý), từ đó có thể suy ra đầu ra cho cả bộ kết xuất và bộ lập kế hoạch. Trong khi bộ kết xuất thương mại hóa tốt nhưng có trần vật lý, và bộ lập kế hoạch hứa hẹn nhưng chưa trưởng thành, thì bộ mô phỏng là cầu nối thiết yếu. Xu hướng tương lai là sự hội tụ của ba loại này hướng tới một **mô hình thế giới thống nhất**, có thể chuyển đổi linh hoạt giữa kết xuất, mô phỏng và lập kế hoạch dựa trên cùng một hiểu biết cơ bản về thế giới. Điều này sẽ định hình tương lai của trí thông minh không gian, cho phép máy móc không chỉ nói về thế giới (như mô hình ngôn ngữ) mà thực sự hiểu, tưởng tượng và tương tác với nó.

链捕手07/05 09:15

Bài viết mới của Lý Phi Phi: Khi tạo video, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

链捕手07/05 09:15

Alibaba 'Bán Hàng', ByteDance 'Luyện Công'

Tuần cuối tháng 5, hai sự kiện AI liền kề đã phơi bày hai cách tiếp cận khác biệt của các gã khổng lồ công nghệ Trung Quốc. Alibaba tập trung vào tích hợp và thương mại hóa AI. Họ kết nối ứng dụng Qwen với Taobao, cho phép mua sắm và sử dụng các tính năng AI như thử đồ, so giá. Tổ chức được tái cấu trúc để tập trung vào AI, với động lực rõ ràng từ thị trường vốn. Doanh thu bên ngoài của Alibaba Cloud tăng 40%, cho thấy chiến lược "lắp AI vào quầy thu ngân" đang tạo ra dòng tiền. Tuy nhiên, cách tiếp cận thực dụng này có thể đi kèm rủi ro nếu có sự chênh lệch lớn về năng lực mô hình nền trong tương lai. Ngược lại, ByteDance theo đuổi giới hạn công nghệ thông qua bộ phận Seed. Họ đạt được thành tích đỉnh cao với mô hình tạo video Seedance 2.0 và đầu tư mạnh vào nghiên cứu cơ bản, thu hút nhân tài với các mục tiêu thuần túy học thuật. Ngân sách vốn (capex) của ByteDance được báo cáo là tăng vọt, lên tới 4700 tỷ NDT vào năm 2026, được tài trợ chủ yếu từ lợi nhuận. Lợi thế lớn của họ là không bị áp lực thị trường công khai, cho phép tập trung vào nghiên cứu dài hạn. Bài viết chỉ ra rằng sự khác biệt chiến lược này không chỉ là triết lý, mà chủ yếu bị chi phối bởi việc công ty có niêm yết hay không. Các công ty đại chúng như Alibaba chịu áp lực phải thể hiện kết quả tài chính ngắn hạn, dẫn đến chiến lược "bán AI". Các công ty chưa niêm yết như ByteDance có "sự xa xỉ" để "làm AI" và tập trung vào đột phá công nghệ. Tương lai của con đường nghiên cứu dài hạn tại ByteDance có thể được kiểm chứng nếu công ty này tiến hành IPO.

marsbit06/01 00:10

Alibaba 'Bán Hàng', ByteDance 'Luyện Công'

marsbit06/01 00:10

AI Ngôi sao mạng hàng đầu Karpathy gia nhập Anthropic, nhắm đến điều gì?

Andrej Karpathy, nhà đồng sáng lập OpenAI, giáo sư từng giảng dạy tại Stanford và là người có ảnh hưởng lớn trong cộng đồng AI, đã chính thức gia nhập Anthropic. Anh sẽ tập trung vào nghiên cứu tiền huấn luyện (pretraining) và dẫn dắt một nhóm mới với nhiệm vụ chính là sử dụng Claude để đẩy nhanh việc khám phá các hướng nghiên cứu trong lĩnh vực này. Sự kiện này diễn ra trong bối cảnh Anthropic đang có đà tăng trưởng mạnh, lần đầu tiên vượt OpenAI về tỷ lệ doanh nghiệp sử dụng vào tháng 4. Công ty cũng liên tục mở rộng với các sản phẩm cho doanh nghiệp vừa và nhỏ, cùng các hợp tác như với Quỹ Gates. Việc Karpathy, một biểu tượng về uy tín học thuật và ảnh hưởng cộng đồng, chọn Anthropic thay vì quay lại OpenAI được cho là mang tính biểu tượng cao. Nó phản ánh sự dịch chuyển trong cuộc chiến thu hút nhân tài và định hướng nghiên cứu trong ngành AI. Động thái này cũng nhấn mạnh cam kết của Anthropic trong việc đầu tư vào những đột phá cơ bản ở tầng tiền huấn luyện, một lĩnh vực then chốt nhưng dài hạn, với tầm nhìn sử dụng chính AI hiện tại để giúp phát triển thế hệ AI tiếp theo.

marsbit05/21 08:04

AI Ngôi sao mạng hàng đầu Karpathy gia nhập Anthropic, nhắm đến điều gì?

marsbit05/21 08:04

活动图片