# Bài viết Liên quan Mô phỏng

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Mô phỏng", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Qingyan Jingzhun huy động hàng trăm triệu nhân dân tệ, đội quốc gia sản xuất thiết bị đã đầu tư

Tin tức đầu tư AI: ngày 13/7, Qingyan Jingzhun thông báo đã hoàn thành hai vòng gọi vốn tổng cộng hàng tỷ nhân dân tệ trong vòng một tháng (tháng 6), chính thức kết thúc vòng series B. Các nhà đầu tư bao gồm “lực lượng quốc doanh + nửa giới xe hơi”: B2 do Xingyuan Capital dẫn đầu, FAW Fusheng tham gia; B3 do BAIC Capital dẫn đầu, Yulon Group tham gia. Quỹ công nghiệp quốc gia Sinomach cũng tham gia. Được ươm tạo từ Đại học Thanh Hoa từ năm 2018, công ty đã tích lũy 8 năm kinh nghiệm tại hiện trường công nghiệp, cung cấp các sản phẩm kiểm tra AI, mô phỏng và xác minh cho hầu hết các OEM và nhà sản xuất pin hàng đầu. Đội ngũ lãnh đạo bao gồm CEO Dong Han (Tiến sĩ Đại học Thanh Hoa), CEO mảng trí tuệ thể hiện Cao Kỳ Đồng (nền tảng Stanford, nghiên cứu đăng trên Nature), và CTO Triệu Nhiên (chuyên gia kỳ cựu trong lĩnh vực robot). Qingyan Jingzhun đã nâng cấp chiến lược từ một công ty kiểm tra xe năng lượng mới thành "nền tảng kỹ thuật hóa AI vật lý", đóng vai trò là cơ sở hạ tầng cho việc triển khai trí tuệ thể hiện trong công nghiệp. Họ xây dựng nền tảng dữ liệu vật lý AI thông qua đường ống dữ liệu đa phương thức TsingLoop, thu thập và xử lý dữ liệu từ hơn 2000 điểm cảm biến trong các kịch bản công nghiệp thực tế. Hệ thống này tạo ra một vòng lặp khép kín "thu thập - mô phỏng - xác minh - đánh giá - lặp lại" cho robot, giúp xác thực chiến lược và khả năng thích ứng trong môi trường số trước khi triển khai thực tế. Tầm nhìn cuối cùng là "một nền tảng, một bộ não, hàng trăm ứng dụng theo ngành dọc", sử dụng hệ thống kỹ thuật dữ liệu và mô hình thế giới nhận thức công nghiệp để tích lũy trí thông minh vật lý có thể tái sử dụng trong hàng trăm nhiệm vụ công nghiệp. Sự ủng hộ mạnh mẽ của vốn ngành công nghiệp cho thấy tầm quan trọng của khả năng triển khai thực tế và nền tảng kỹ thuật hóa vững chắc của công ty trong giai đoạn quan trọng khi AI vật lý chuyển từ khái niệm sang ứng dụng thực tế.

marsbit07/13 04:33

Qingyan Jingzhun huy động hàng trăm triệu nhân dân tệ, đội quốc gia sản xuất thiết bị đã đầu tư

marsbit07/13 04:33

Gần 100 người chơi đổ bộ vào lĩnh vực dữ liệu thể sinh: Huy động 4.47 tỷ NDT trong một năm, ai thực sự có thể kiếm tiền bằng cách 'bán dữ liệu'?

Hơn 90 công ty đang hoạt động trong lĩnh vực dữ liệu thể thân (embodied data) để huấn luyện robot, bao gồm 70 công ty thu thập dữ liệu và 27 công ty làm hạ tầng dữ liệu. Ngành này đã thu hút khoảng 4,47 tỷ NDT (44,7 tỷ) vốn đầu tư trong một năm qua. Mười điểm nổi bật của ngành: 1. Có bốn phương pháp thu thập dữ liệu chính: điều khiển robot từ xa, thu thập không cần robot (con người đeo cảm biến), mô phỏng và trích xuất từ video internet. Nhiều công ty kết hợp nhiều phương pháp. 2. Phương pháp điều khiển robot từ xa thu hút nhiều công ty nhất, đặc biệt là các nền tảng dữ liệu nhà nước và công ty robot. 3. Nhà cung cấp dịch vụ dữ liệu độc lập là nhóm lớn nhất (40%), chứng tỏ đây đã là một lĩnh vực riêng biệt. 4. Khoảng 2/3 công ty được thành lập chuyên cho lĩnh vực này ("bản địa"), 1/3 chuyển đổi từ các ngành khác như gán nhãn dữ liệu AI. 5. Công suất thu thập hiện tại ước tính 1,6-1,8 triệu giờ dữ liệu mỗi năm. Mục tiêu ngắn hạn là tăng gấp 15-20 lần. 6. Các cơ sở thu thập dữ liệu đã có mặt tại 20 tỉnh thành, tập trung nhiều nhất ở khu vực Trường Giang. 7. 15 công ty dịch vụ dữ liệu độc lập đã huy động được ~4,47 tỷ NDT, chủ yếu tập trung vào quý 2/2026. Tuy nhiên, con số này nhỏ hơn nhiều so với tổng vốn đầu tư vào lĩnh vực trí tuệ thể thân. 8. Các công ty dịch vụ dữ liệu độc lập phân hóa rõ rệt thành ba nhóm, với một công ty dẫn đầu (Quang Luân) chiếm tới ~70% tổng vốn huy động. 9. Có 69 tổ chức đầu tư tham gia, nhưng không có tổ chức nào dám "đặt cược lớn", cho thấy sự thận trọng. 10. Hơn một nửa số công ty dịch vụ dữ liệu độc lập thành lập chưa đầy một năm, chứng tỏ ngành vẫn còn rất sớm. Chưa có mô hình kinh doanh "bán dữ liệu" thuần túy nào được chứng minh là sinh lời rõ ràng. Tóm lại, lĩnh vực dữ liệu thể thân đã trở thành một tuyến đầu tư độc lập và tạo ra việc làm mới, nhưng vẫn trong giai đoạn phát triển ban đầu với nhiều bất định. Thái độ thận trọng của các nhà đầu tư phản ánh thách thức trong việc chứng minh đây là một mô hình kinh doanh bền vững. Một đến hai năm tới sẽ là giai đoạn then chốt để kiểm chứng điều này.

marsbit07/12 02:33

Gần 100 người chơi đổ bộ vào lĩnh vực dữ liệu thể sinh: Huy động 4.47 tỷ NDT trong một năm, ai thực sự có thể kiếm tiền bằng cách 'bán dữ liệu'?

marsbit07/12 02:33

1600 Dòng Mã “Dựng” Manhattan Dưới Nước, Fable 5 Làm Karpathy Sững Sờ

Fable 5, mô hình AI mới được mở lại sau lệnh cấm xuất khẩu tạm thời của Mỹ, đã gây kinh ngạc với khả năng tạo ra các thế giới 3D phong phú và tương tác chỉ từ các mô tả văn bản. Andrej Karpathy, chuyên gia AI tại Anthropic, đã bày tỏ sự ngạc nhiên trước một video trình diễn 63 thế giới do Peter Gostev từ Arena.ai tạo ra, hầu hết chỉ với một lần tạo (one-shot). Điểm nhấn là một "Manhattan dưới nước" sống động với chi tiết đáng kinh ngạc, được xây dựng chỉ từ 1.600 dòng mã. Các tạo phẩm khác bao gồm thành phố lịch sử như Istanbul, cảnh tượng tự nhiên như gấu bắt cá hồi, thế giới từ các kiệt tác hội họa như "Đêm đầy sao" của Van Gogh có thể đi vào được, và các góc nhìn độc đáo như từ tầm mắt của một con kiến. Gostev nhấn mạnh rằng thách thức không phải là vẻ đẹp đơn lẻ mà là khả năng của mô hình trong việc phối hợp hàng loạt yếu tố một cách nhất quán. Mặc dù vậy, Fable 5 vẫn có điểm yếu trong việc tạo ra trò chơi thực sự hấp dẫn và đôi khi có vẻ "lười biếng", cần được thúc đẩy để phát huy hết khả năng. Karpathy đặt câu hỏi về việc làm thế nào một mô hình chỉ học từ internet lại có thể hiểu và mã hóa các khái niệm phức tạp (như con cá vùng vẫy) thành các thế giới 3D tương tác. Sự tiến bộ này báo hiệu một bước nhảy vọt về chất lượng và mở ra những khả năng mới mà ngay cả các nhà phát triển cũng chưa khám phá hết.

marsbit07/06 09:50

1600 Dòng Mã “Dựng” Manhattan Dưới Nước, Fable 5 Làm Karpathy Sững Sờ

marsbit07/06 09:50

Bài viết mới nhất của Lý Phi Phi: Khi video tạo sinh, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

Trong bài viết mới nhất của mình, giáo sư Lý Phi Phi đã phân loại và làm rõ khái niệm "mô hình thế giới" đang bị sử dụng một cách lộn xộn trong lĩnh vực AI hiện nay. Bà đề xuất một cách phân loại chức năng dựa trên vòng lặp POMDP cổ điển (tác nhân → hành động → trạng thái → quan sát → tác nhân), chia các hệ thống được gọi là "mô hình thế giới" thành ba loại chính: 1. **Bộ kết xuất (Renderer):** Đầu ra là các quan sát (pixel). Mục tiêu là độ trung thực về mặt thị giác. Ví dụ: các mô hình tạo video từ văn bản như Sora, hay hệ thống tương tác như Genie. Chúng tạo ra hình ảnh đẹp nhưng không nhất thiết tuân thủ vật lý chính xác. 2. **Bộ mô phỏng (Simulator):** Đầu ra là trạng thái thế giới. Mục tiêu là độ chính xác về cấu trúc hình học, vật lý và động lực học. Chúng phục vụ cả con người (kiến trúc sư, nhà thiết kế) và các chương trình máy tính (robot, xe tự hành) để tính toán và đào tạo. Đây được coi là trung tâm then chốt bị đánh giá thấp. 3. **Bộ lập kế hoạch (Planner):** Đầu ra là các hành động. Cho một quan sát và mục tiêu, nó quyết định tác nhân nên làm gì tiếp theo. Ví dụ: các mô hình VLA (Vision-Language-Action). Đây là lĩnh vực thú vị nhất nhưng cũng non trẻ nhất, với khoảng cách lớn giữa demo trong phòng thí nghiệm và ứng dụng thực tế. Bài viết nhấn mạnh ba loại này không tách biệt mà chia sẻ hiểu biết cơ bản chung về thế giới. Xu hướng quan trọng hiện nay là sự hợp nhất giữa chúng, hướng tới một **mô hình thế giới thống nhất** có thể chuyển đổi linh hoạt giữa kết xuất, mô phỏng và lập kế hoạch tùy theo nhu cầu. Sản phẩm Marble của World Labs là một bước đi theo hướng này, cùng lúc tạo ra cả dữ liệu hình ảnh (Gaussian splatting) và dữ liệu vật lý (collision mesh) từ một mô hình duy nhất. Tóm lại, trong khi mô hình ngôn ngữ cho phép máy móc "nói" về thế giới, thì mô hình thế giới chính là con đường để chúng thực sự hiểu, tưởng tượng, suy luận và tương tác với thế giới vật lý.

marsbit07/05 09:27

Bài viết mới nhất của Lý Phi Phi: Khi video tạo sinh, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

marsbit07/05 09:27

Bài viết mới của Lý Phi Phi: Khi tạo video, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

Tác giả Lý Phi Phi đưa ra một phân loại rõ ràng cho khái niệm "mô hình thế giới" (world model) đang bị sử dụng lộn xộn trong AI hiện nay. Dựa trên vòng lặp POMDP cơ bản (tác nhân → hành động → trạng thái → quan sát), bà chia các hệ thống tự xưng là mô hình thế giới thành ba loại chức năng: 1. **Bộ kết xuất (Renderer)**: Đầu ra là quan sát (pixel), tập trung vào độ trung thực thị giác. Ví dụ: các mô hình tạo video như Sora. Hạn chế: hình ảnh đẹp nhưng có thể không đúng vật lý. 2. **Bộ mô phỏng (Simulator)**: Đầu ra là trạng thái thế giới (mô hình hình học, vật lý, động lực học chính xác). Đây là trung tâm then chốt, có thể phục vụ cả con người (thiết kế, mô phỏng) và máy móc (đào tạo robot, xe tự lái). Ví dụ: NVIDIA Omniverse. 3. **Bộ lập kế hoạch (Planner)**: Đầu ra là hành động. Dựa trên quan sát và mục tiêu, nó quyết định tác nhân nên làm gì tiếp theo. Ví dụ: các mô hình Ngôn ngữ-Thị giác-Hành động (VLA) cho robot. Bài viết nhấn mạnh **bộ mô phỏng là trung tâm bị đánh giá thấp**, vì nó hoạt động ở cấp độ cấu trúc nền tảng (hình học, vật lý), từ đó có thể suy ra đầu ra cho cả bộ kết xuất và bộ lập kế hoạch. Trong khi bộ kết xuất thương mại hóa tốt nhưng có trần vật lý, và bộ lập kế hoạch hứa hẹn nhưng chưa trưởng thành, thì bộ mô phỏng là cầu nối thiết yếu. Xu hướng tương lai là sự hội tụ của ba loại này hướng tới một **mô hình thế giới thống nhất**, có thể chuyển đổi linh hoạt giữa kết xuất, mô phỏng và lập kế hoạch dựa trên cùng một hiểu biết cơ bản về thế giới. Điều này sẽ định hình tương lai của trí thông minh không gian, cho phép máy móc không chỉ nói về thế giới (như mô hình ngôn ngữ) mà thực sự hiểu, tưởng tượng và tương tác với nó.

链捕手07/05 09:15

Bài viết mới của Lý Phi Phi: Khi tạo video, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

链捕手07/05 09:15

Mô hình thế giới, metaverse, song sinh kỹ thuật số, AI vật lý: Chúng có phải là một?

Trong vài năm qua, nhiều khái niệm như metaverse, Web3.0, nền tảng dữ liệu mô phỏng, song sinh kỹ thuật số (Digital Twin) và AI vật lý (Physical AI) liên tục xuất hiện, khiến nhiều người bối rối. Vậy chúng có phải là một với "Mô hình Thế giới" (World Model) không? Câu trả lời là không hoàn toàn, nhưng tất cả đều hướng đến xu hướng xóa mờ ranh giới giữa thế giới số và vật lý. Mô hình Thế giới giống như "lớp nhận thức" hoặc "hệ điều hành nền tảng", giúp AI hiểu và suy luận về thế giới. Các khái niệm trên có thể được phân loại thành: 1) **Trải nghiệm không gian** (Metaverse), 2) **Quan hệ sản xuất** (Web3.0 với blockchain), và 3) **Năng lực kỹ thuật** (gồm các nền tảng mô phỏng, song sinh kỹ thuật số, AI vật lý và Mô hình Thế giới). **Metaverse** là điểm đến ảo, còn **Mô hình Thế giới** là công cụ tạo ra nội dung cho nó, như một "động cơ" tự sinh thế giới tương tác. **Web3.0** tập trung vào quyền sở hữu và kinh tế số, khác biệt về mặt kỹ thuật với Mô hình Thế giới. **Nền tảng dữ liệu mô phỏng** (simulation platform) là phiên bản 1.0, dựa nhiều vào thiết kế thủ công, trong khi Mô hình Thế giới (phiên bản 2.0) sử dụng AI để tự động tạo ra các kịch bản chân thực và quy mô lớn. **Song sinh kỹ thuật số** là bản sao kỹ thuật số phản ánh hiện trạng, còn **Mô hình Thế giới** tiến xa hơn bằng khả năng "dự đoán tương lai" và mô phỏng các kết quả. **AI vật lý** cần Mô hình Thế giới như một thành phần cốt lõi để hiểu các quy luật vật lý, dự đoán và lên kế hoạch hành động trong thế giới thực. Tóm lại, có thể hình dung mối quan hệ theo các tầng: **Cơ sở hạ tầng** (GPU, cảm biến) -> **Lớp nhận thức** (Mô hình Thế giới) -> **Lớp công cụ ứng dụng** (nền tảng mô phỏng, song sinh kỹ thuật số) -> **Lớp hành động** (AI vật lý) -> **Lớp trải nghiệm** (Metaverse) -> **Lớp quy tắc** (Web3.0). Mô hình Thế giới không thay thế các khái niệm khác, mà có khả năng trở thành "hệ điều hành" nền tảng, cung cấp khả năng hiểu biết và suy luận về thế giới để hỗ trợ cho nhiều ứng dụng và tầm nhìn công nghệ trong tương lai.

marsbit06/28 10:43

Mô hình thế giới, metaverse, song sinh kỹ thuật số, AI vật lý: Chúng có phải là một?

marsbit06/28 10:43

Một cuộc chiến không có tên gọi thống nhất: Bản đồ thế giới mô hình của các "ông lớn" trong nước

Mô hình thế giới (World Model) hiện chưa có tên gọi thống nhất trong ngành, với các tên như mô hình thế giới cơ sở, AI vật lý, hay được tích hợp trong kiến trúc xe tự hành, VLA hoặc hệ thống trí tuệ thể hiện. Mục tiêu chung là để máy móc xây dựng một môi trường động nội bộ có thể suy diễn và phân tích, giảm sự phụ thuộc vào dữ liệu thực tế, từ đó "nén" thế giới thực thành một động cơ dữ liệu có thể tạo, mắc lỗi và thử lại vô hạn. Các gã khổng lồ công nghệ Trung Quốc đang âm thầm biến đây thành một cuộc đua mới. Alibaba tung ra ba hướng tiếp cận riêng biệt cho thế giới ngôn ngữ (Qwen-AgentWorld), thế giới ảo (HappyOyster) và thế giới vật lý (Qwen-RobotWorld). Tencent tập trung vào thế giới 3D có thể chỉnh sửa (HY-World) phục vụ game và xã hội. ByteDance tận dụng dòng video khổng lồ từ TikTok/抖音. Huawei và Baidu không tách riêng khái niệm mà tích hợp nó như nền tảng huấn luyện cho ô tô thông minh và trí tuệ thể hiện. Trong lĩnh vực ô tô, mô hình thế giới trở thành "trường dạy lái" và "phòng thi". NIO, Li Auto, XPeng, Geely và các hãng khác đang phát triển các mô hình để tạo ra và kiểm tra vô số tình huống lái xe phức tạp trong môi trường mô phỏng, nhằm đào tạo và tinh chỉnh hệ thống lái tự động, giảm thiểu nhu cầu thử nghiệm trên đường thực tế. Các nhà cung cấp công nghệ lái xe tự động (ADAS/ADS) như Momenta, Horizon Robotics, Haomo.AI và DeepRoute đang phát triển các "động cơ thế giới" ẩn, tích hợp khả năng mô hình thế giới vào nền tảng mô phỏng và huấn luyện của họ để nhắm mục tiêu tới khả năng tự lái cấp độ cao hơn. Sự cạnh tranh đang chuyển từ việc ai có thể tạo ra mô hình thế giới sang việc mô hình của ai có thể được tích hợp hiệu quả vào các sản phẩm và hệ thống quy mô lớn. Các công ty khởi nghiệp có tốc độ và sự tập trung, nhưng các tập đoàn lớn có lợi thế về dữ liệu, năng lực tính toán và hệ thống triển khai sản phẩm. Mô hình thế giới đang từ một thử nghiệm công nghệ trở thành cơ sở hạ tầng công nghiệp quan trọng cho tương lai của AI, ô tô tự hành và robot.

marsbit06/25 06:55

Một cuộc chiến không có tên gọi thống nhất: Bản đồ thế giới mô hình của các "ông lớn" trong nước

marsbit06/25 06:55

3 tháng, 35 tỷ, các nhà đầu tư tranh giành OpenAI của thế giới vật lý

Một cảnh tượng quen thuộc lại xuất hiện. Công ty Công nghệ Giga Perspective (còn gọi là Cực Giai Thị Giới) mới đây đã công bố hoàn thành vòng gọi vốn B2 trị giá 10 tỷ nhân dân tệ, nâng tổng số vốn huy động được trong 3 tháng lên 35 tỷ nhân dân tệ. Điều này đánh dấu sự tin tưởng mạnh mẽ từ các nhà đầu tư vào lĩnh vực AGI vật lý (Trí tuệ nhân tạo phổ quát trong thế giới vật lý). Công ty do Tiến sĩ Hoàng Quan, một tiến sĩ 9x từ Đại học Thanh Hoa, dẫn dắt. Ông có kinh nghiệm nghiên cứu và công nghiệp phong phú. Đội ngũ lãnh đạo được coi là "đội hình mơ ước" trong lĩnh vực này. Chìa khóa công nghệ của Cực Giai Thị Giới là "Hệ thống Song Kim tự tháp" (Thuật toán và Dữ liệu) xoay quanh mô hình thế giới (World Model). Họ đã phát triển hai hệ thống mô hình cốt lõi: - **Mô hình Hành động Thế giới (World Action Model):** Chuyển đổi hiểu biết của mô hình thế giới thành chiến lược hành động cho robot. Các phiên bản như GigaBrain-0 và GigaBrain-0.5M đã đạt thành tích cao trong các đánh giá toàn cầu. - **Mô hình Sinh thành Thế giới (World Generation Model):** Hiểu, mô phỏng và tạo ra thế giới vật lý để cung cấp dữ liệu và tham số huấn luyện. GigaWorld-1 và DriveDreamer (mô hình thế giới cho xe tự hành) là những ví dụ nổi bật. Công ty tin rằng thời khắc "GPT-3" của AGI vật lý sắp đến. Họ dự kiến phát hành GigaBrain-1 trong quý III/2026, hướng tới các bước đột phá về hiểu biết thị giác nguyên bản, lập kế hoạch cấp cao bằng ngôn ngữ và căn chỉnh quy luật vật lý. Về mặt thương mại hóa, Cực Giai Thị Giới theo đuổi chiến lược song song: - **Thị trường Cá nhân (C-end):** Ra mắt thương hiệu con "Thập Quang SeeLight" và robot hình người đa năng "Thập Quang S1" cho gia đình, đã nhận được hàng trăm đơn đặt hàng thực tế. - **Thị trường Doanh nghiệp (B-end):** Giới thiệu robot đa năng Maker H01 cho sản xuất công nghiệp, hợp tác với các công ty như FAW Mold và Alibaba Cloud. Họ đã ký kết kế hoạch triển khai 1000 robot tại Vô Tích trong 3 năm tới, đánh dấu bước tiến vào giai đoạn sản xuất quy mô lớn. Mô hình thế giới DriveDreamer cho xe tự hành cũng đã hợp tác với hơn 30 OEM và công ty hàng đầu. Tầm nhìn cuối cùng của công ty là thời đại AGI vật lý phục vụ mọi người, bắt đầu từ từng hộ gia đình, thông qua việc nâng cao năng suất vật lý và định hình lại lối sống.

marsbit06/15 01:33

3 tháng, 35 tỷ, các nhà đầu tư tranh giành OpenAI của thế giới vật lý

marsbit06/15 01:33

Robot đã bắt đầu 'ăn' dữ liệu: Từ nhà máy dữ liệu Ấn Độ đến chuỗi sản xuất ngầm của robot hình người trị giá hàng tỷ USD

Ngành công nghiệp robot đang đối mặt với một điểm nghẽn lớn: dữ liệu huấn luyện. Khác với mô hình ngôn ngữ lớn (LLM) có sẵn kho dữ liệu khổng lồ trên internet, robot thể hiện (embodied AI) cần học hỏi từ thế giới vật lý - một "sa mạc dữ liệu". Để lấp đầy khoảng trống này, một chuỗi cung ứng dữ liệu mới đang hình thành nhanh chóng. Trọng tâm là thu thập dữ liệu góc nhìn thứ nhất (Ego Data). Tại các "nhà máy dữ liệu" ở Ấn Độ hay Đông Nam Á, công nhân đeo camera trên đầu hoặc găng tay cảm biến để ghi lại quy trình làm các công việc như sắp xếp quần áo, thu dọn bếp, cầm nắm đồ vật. Những video này, sau khi được xử lý và gắn nhãn, được bán cho các công ty robot như Figure, Tesla để huấn luyện mô hình, giúp robot hiểu được logic không gian và quy tắc tương tác vật lý từ con người. Các loại dữ liệu tạo thành một "kim tự tháp" với giá trị khác nhau. Đáy là dữ liệu internet miễn phí nhưng ít giá trị thực thi. Cao hơn là Ego Data (vài chục USD/giờ), rồi đến dữ liệu với găng tay cảm biến và dữ liệu mô phỏng. Đỉnh kim tự tháp là dữ liệu từ robot thật (teleoperation) - quý giá nhưng đắt đỏ, có thể lên tới hàng trăm hoặc nghìn USD/giờ do chi phí thiết bị và vận hành cao. Thị trường phía sau bao gồm nhiều nhóm: nhà máy dữ liệu chi phí thấp chuyên Ego Data; công ty tập trung vào ánh xạ cử động để dịch hành động người sang robot; nhà cung cấp dịch vụ thu thập dữ liệu từ robot thật; công ty dữ liệu tổng hợp mô phỏng; và các nền tảng hướng tới chuẩn hóa dữ liệu. Các công ty robot có xu hướng "mua ngoài" dữ liệu cơ bản (như Ego Data) để robot hiểu thế giới, nhưng tự xây dựng đội ngũ thu thập dữ liệu riêng cho phần tối ưu hóa khả năng vận hành cụ thể của robot mình và tích lũy dữ liệu từ các tình huống thất bại trong triển khai thực tế - thứ tạo nên lợi thế cạnh tranh. Giống như Scale AI trong lĩnh vực LLM, ngành robot cũng đang chờ đợi sự xuất hiện của những công ty cung cấp hạ tầng dữ liệu toàn diện, không chỉ là dữ liệu thô mà là một vòng lặp khép kín từ thu thập, gắn nhãn, mô phỏng đến đánh giá mô hình. Khi robot dần ổn định về mặt cơ học, cuộc đua sẽ chuyển hướng sang khả năng "cho robot ăn" lượng dữ liệu chất lượng khổng lồ để chúng có thể hoạt động tự chủ trong môi trường phức tạp.

marsbit06/13 03:38

Robot đã bắt đầu 'ăn' dữ liệu: Từ nhà máy dữ liệu Ấn Độ đến chuỗi sản xuất ngầm của robot hình người trị giá hàng tỷ USD

marsbit06/13 03:38

Tuyên Ngôn Về Mô Hình Thế Giới Của Lý Phi Phi

"Thế giới là tất cả những gì đang xảy ra." Một thế kỷ sau khi Wittgenstein viết câu này, Fei-Fei Li trích dẫn nó để mở đầu một tuyên ngôn về "Mô hình Thế giới" (World Models) cho AI. Bài viết chỉ ra một điểm mù quan trọng: AI ngày nay có thể nói về thế giới nhưng không hiểu bản chất vật lý của nó. Giữa sự hỗn loạn về định nghĩa, Li kêu gọi một sự chuyển dịch: để AI thực sự bước vào thế giới vật lý, nó phải vượt ra khỏi vùng an toàn thống kê văn bản và hiểu các quy luật không gian, thời gian nghiêm ngặt. Li đề xuất một bộ phân loại rõ ràng với ba trụ cột cốt lõi cho một Mô hình Thế giới: 1. **Bộ kết xuất (Renderer):** Tạo ra pixel trực quan đẹp mắt (như Sora, GPT), nhưng thiếu hiểu biết về cấu trúc vật lý. 2. **Bộ mô phỏng (Simulator):** Trung tâm của hệ thống - mô phỏng chính xác các định luật vật lý (như khối lượng, va chạm). Đây là lĩnh vực khó nhất, thiếu dữ liệu, nhưng là chìa khóa cho robot và công nghiệp (ví dụ: NVIDIA Omniverse). 3. **Bộ lập kế hoạch (Planner):** Giải quyết việc "làm gì tiếp theo", kết nối nhận thức với hành động trong môi trường phức tạp. Li nhận định, tương lai nằm ở một **Mô hình Cơ sở Thống nhất**, nơi ranh giới giữa kết xuất, mô phỏng và lập kế hoạch trở nên mờ nhạt. Mô hình này có thể chuyển đổi liền mạch giữa "chế độ xem" cho con người và "chế độ trạng thái" cho động lực học vật lý, trở nên tương tác và thích ứng hơn. Cuối cùng, đây không phải là cuộc đua thuần túy về thuật toán hay sức mạnh tính toán, mà là việc **định nghĩa tiêu chuẩn kỹ thuật số cho thế giới vật lý**. Mô hình Thế giới là một bước tiến quan trọng để AI không chỉ nói về thế giới mà còn hiểu, tưởng tượng, suy luận và tương tác với nó. Dù vậy, chặng đường vẫn còn dài; như nhà nghiên cứu Yann LeCun nhận xét, có thể mất 5-10 năm nữa để trí thông minh của máy móc tiếp cận được mức độ của một chú chó.

marsbit06/09 00:39

Tuyên Ngôn Về Mô Hình Thế Giới Của Lý Phi Phi

marsbit06/09 00:39

活动图片