# Bài viết Liên quan Trí thông minh không gian

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Trí thông minh không gian", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Bài phỏng vấn mới nhất của Lý Phi Phi: Con người cũng không hoàn toàn dựa vào dữ liệu thực tế để học tập

Bài phỏng vấn với giáo sư Lý Phi Phi tập trung vào chủ đề “trí tuệ không gian” và chiến lược của World Labs trong lĩnh vực robot sau khi mua lại SceniX. Cuộc thảo luận làm nổi bật tầm quan trọng của việc tạo ra các thế giới kỹ thuật số hoặc mô phỏng để đào tạo và đánh giá robot, giải quyết thách thức thiếu dữ liệu thực tế. Giáo sư Lý Phi Phi giải thích rằng robot là “viên đá thử vàng” đầu tiên cho trí tuệ không gian. SceniX, dẫn đầu bởi cựu nghiên cứu sinh sau tiến sĩ Lý Quân Chúc, giải quyết vấn đề then chốt: thiếu dữ liệu đào tạo và đánh giá trong robot. Giải pháp của họ là một đường ống “real-to-sim-to-real”, ánh xạ môi trường thực vào thế giới số để tạo dữ liệu có thể mở rộng thay thế cho việc thu thập dữ liệu chậm, đắt đỏ và nguy hiểm ngoài đời thực. Các bên nhấn mạnh sự bổ sung giữa World Labs (mạnh về mô hình tạo sinh như Marble và tái tạo 3D) với SceniX (mạnh về robot, mô phỏng và kết xuất). Hợp tác này nhằm xây dựng cơ sở hạ tầng kỹ thuật số trung lập với phần cứng và mô hình, nơi mọi robot có thể được đào tạo và đánh giá một cách đáng tin cậy. Bài phỏng vấn thảo luận về lợi ích của mô phỏng, bao gồm lý luận phản thực tế, độ tin cậy, hiệu quả và khả năng kiểm soát. Con đường ứng dụng thực tế được đề xuất là từ môi trường có cấu trúc (nhà kho) đến bán cấu trúc, thay vì nhảy ngay vào môi trường phi cấu trúc (như gia đình). Mục tiêu trong hai năm là chứng minh giá trị của nền tảng này thông qua các trường hợp sử dụng thành công ở một số lĩnh vực dọc quan trọng.

marsbit15 giờ trước

Bài phỏng vấn mới nhất của Lý Phi Phi: Con người cũng không hoàn toàn dựa vào dữ liệu thực tế để học tập

marsbit15 giờ trước

Bài viết mới nhất của Lý Phi Phi: Khi video tạo sinh, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

Trong bài viết mới nhất của mình, giáo sư Lý Phi Phi đã phân loại và làm rõ khái niệm "mô hình thế giới" đang bị sử dụng một cách lộn xộn trong lĩnh vực AI hiện nay. Bà đề xuất một cách phân loại chức năng dựa trên vòng lặp POMDP cổ điển (tác nhân → hành động → trạng thái → quan sát → tác nhân), chia các hệ thống được gọi là "mô hình thế giới" thành ba loại chính: 1. **Bộ kết xuất (Renderer):** Đầu ra là các quan sát (pixel). Mục tiêu là độ trung thực về mặt thị giác. Ví dụ: các mô hình tạo video từ văn bản như Sora, hay hệ thống tương tác như Genie. Chúng tạo ra hình ảnh đẹp nhưng không nhất thiết tuân thủ vật lý chính xác. 2. **Bộ mô phỏng (Simulator):** Đầu ra là trạng thái thế giới. Mục tiêu là độ chính xác về cấu trúc hình học, vật lý và động lực học. Chúng phục vụ cả con người (kiến trúc sư, nhà thiết kế) và các chương trình máy tính (robot, xe tự hành) để tính toán và đào tạo. Đây được coi là trung tâm then chốt bị đánh giá thấp. 3. **Bộ lập kế hoạch (Planner):** Đầu ra là các hành động. Cho một quan sát và mục tiêu, nó quyết định tác nhân nên làm gì tiếp theo. Ví dụ: các mô hình VLA (Vision-Language-Action). Đây là lĩnh vực thú vị nhất nhưng cũng non trẻ nhất, với khoảng cách lớn giữa demo trong phòng thí nghiệm và ứng dụng thực tế. Bài viết nhấn mạnh ba loại này không tách biệt mà chia sẻ hiểu biết cơ bản chung về thế giới. Xu hướng quan trọng hiện nay là sự hợp nhất giữa chúng, hướng tới một **mô hình thế giới thống nhất** có thể chuyển đổi linh hoạt giữa kết xuất, mô phỏng và lập kế hoạch tùy theo nhu cầu. Sản phẩm Marble của World Labs là một bước đi theo hướng này, cùng lúc tạo ra cả dữ liệu hình ảnh (Gaussian splatting) và dữ liệu vật lý (collision mesh) từ một mô hình duy nhất. Tóm lại, trong khi mô hình ngôn ngữ cho phép máy móc "nói" về thế giới, thì mô hình thế giới chính là con đường để chúng thực sự hiểu, tưởng tượng, suy luận và tương tác với thế giới vật lý.

marsbit07/05 09:27

Bài viết mới nhất của Lý Phi Phi: Khi video tạo sinh, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

marsbit07/05 09:27

Bài viết mới của Lý Phi Phi: Khi tạo video, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

Tác giả Lý Phi Phi đưa ra một phân loại rõ ràng cho khái niệm "mô hình thế giới" (world model) đang bị sử dụng lộn xộn trong AI hiện nay. Dựa trên vòng lặp POMDP cơ bản (tác nhân → hành động → trạng thái → quan sát), bà chia các hệ thống tự xưng là mô hình thế giới thành ba loại chức năng: 1. **Bộ kết xuất (Renderer)**: Đầu ra là quan sát (pixel), tập trung vào độ trung thực thị giác. Ví dụ: các mô hình tạo video như Sora. Hạn chế: hình ảnh đẹp nhưng có thể không đúng vật lý. 2. **Bộ mô phỏng (Simulator)**: Đầu ra là trạng thái thế giới (mô hình hình học, vật lý, động lực học chính xác). Đây là trung tâm then chốt, có thể phục vụ cả con người (thiết kế, mô phỏng) và máy móc (đào tạo robot, xe tự lái). Ví dụ: NVIDIA Omniverse. 3. **Bộ lập kế hoạch (Planner)**: Đầu ra là hành động. Dựa trên quan sát và mục tiêu, nó quyết định tác nhân nên làm gì tiếp theo. Ví dụ: các mô hình Ngôn ngữ-Thị giác-Hành động (VLA) cho robot. Bài viết nhấn mạnh **bộ mô phỏng là trung tâm bị đánh giá thấp**, vì nó hoạt động ở cấp độ cấu trúc nền tảng (hình học, vật lý), từ đó có thể suy ra đầu ra cho cả bộ kết xuất và bộ lập kế hoạch. Trong khi bộ kết xuất thương mại hóa tốt nhưng có trần vật lý, và bộ lập kế hoạch hứa hẹn nhưng chưa trưởng thành, thì bộ mô phỏng là cầu nối thiết yếu. Xu hướng tương lai là sự hội tụ của ba loại này hướng tới một **mô hình thế giới thống nhất**, có thể chuyển đổi linh hoạt giữa kết xuất, mô phỏng và lập kế hoạch dựa trên cùng một hiểu biết cơ bản về thế giới. Điều này sẽ định hình tương lai của trí thông minh không gian, cho phép máy móc không chỉ nói về thế giới (như mô hình ngôn ngữ) mà thực sự hiểu, tưởng tượng và tương tác với nó.

链捕手07/05 09:15

Bài viết mới của Lý Phi Phi: Khi tạo video, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

链捕手07/05 09:15

Tuyên Ngôn Về Mô Hình Thế Giới Của Lý Phi Phi

"Thế giới là tất cả những gì đang xảy ra." Một thế kỷ sau khi Wittgenstein viết câu này, Fei-Fei Li trích dẫn nó để mở đầu một tuyên ngôn về "Mô hình Thế giới" (World Models) cho AI. Bài viết chỉ ra một điểm mù quan trọng: AI ngày nay có thể nói về thế giới nhưng không hiểu bản chất vật lý của nó. Giữa sự hỗn loạn về định nghĩa, Li kêu gọi một sự chuyển dịch: để AI thực sự bước vào thế giới vật lý, nó phải vượt ra khỏi vùng an toàn thống kê văn bản và hiểu các quy luật không gian, thời gian nghiêm ngặt. Li đề xuất một bộ phân loại rõ ràng với ba trụ cột cốt lõi cho một Mô hình Thế giới: 1. **Bộ kết xuất (Renderer):** Tạo ra pixel trực quan đẹp mắt (như Sora, GPT), nhưng thiếu hiểu biết về cấu trúc vật lý. 2. **Bộ mô phỏng (Simulator):** Trung tâm của hệ thống - mô phỏng chính xác các định luật vật lý (như khối lượng, va chạm). Đây là lĩnh vực khó nhất, thiếu dữ liệu, nhưng là chìa khóa cho robot và công nghiệp (ví dụ: NVIDIA Omniverse). 3. **Bộ lập kế hoạch (Planner):** Giải quyết việc "làm gì tiếp theo", kết nối nhận thức với hành động trong môi trường phức tạp. Li nhận định, tương lai nằm ở một **Mô hình Cơ sở Thống nhất**, nơi ranh giới giữa kết xuất, mô phỏng và lập kế hoạch trở nên mờ nhạt. Mô hình này có thể chuyển đổi liền mạch giữa "chế độ xem" cho con người và "chế độ trạng thái" cho động lực học vật lý, trở nên tương tác và thích ứng hơn. Cuối cùng, đây không phải là cuộc đua thuần túy về thuật toán hay sức mạnh tính toán, mà là việc **định nghĩa tiêu chuẩn kỹ thuật số cho thế giới vật lý**. Mô hình Thế giới là một bước tiến quan trọng để AI không chỉ nói về thế giới mà còn hiểu, tưởng tượng, suy luận và tương tác với nó. Dù vậy, chặng đường vẫn còn dài; như nhà nghiên cứu Yann LeCun nhận xét, có thể mất 5-10 năm nữa để trí thông minh của máy móc tiếp cận được mức độ của một chú chó.

marsbit06/09 00:39

Tuyên Ngôn Về Mô Hình Thế Giới Của Lý Phi Phi

marsbit06/09 00:39

Từ một bàn ăn trưa đến vũ trụ vô tận: Fei-Fei Li đặt cược vào chiều kích tiếp theo của AI

**Tóm tắt bài viết:** Giáo sư Li Fei-Fei từ Đại học Stanford và nhà sáng lập World Labs tin rằng **Trí tuệ Không gian (Spatial Intelligence)** chính là biên giới tiếp theo của AI, vượt xa các mô hình ngôn ngữ lớn hiện tại. Cô lập luận rằng ngôn ngữ chỉ là một cách mã hóa thế giới với nhiều mất mát thông tin, trong khi sự hiểu biết và tương tác trong không gian vật lý 3D/4D mới là nền tảng cho trí thông minh, như lịch sử tiến hóa đã chứng minh (thị giác và nhận thức không gian có từ 540 triệu năm trước, so với ngôn ngữ chỉ khoảng 500.000 năm). World Labs đã phát triển mô hình **Marble** để chuyển hóa đầu vào (văn bản, hình ảnh, video) thành các thế giới 3D có thể điều hướng và tương tác hoàn chỉnh. Mặc dù quy mô nhỏ hơn nhiều so với các LLM hàng đầu như GPT-5, Marble đã có các ứng dụng thực tế trong phát triển game, sản xuất phim (giảm 40 lần thời gian), đào tạo robot, thiết kế nội thất và thậm chí trị liệu sức khỏe tâm thần (ví dụ: rối loạn ám ảnh cưỡng chế OCD, chứng sợ độ cao). Li Fei-Fei hình dung một tương lai nơi công nghệ này cho phép chúng ta tạo ra "vũ trụ vô hạn" và sống trong "đa vũ trụ" số. Tuy nhiên, cô nhấn mạnh tầm quan trọng của việc phát triển AI có trách nhiệm, lấy phẩm giá và quyền tự chủ của con người làm trung tâm, giống như cách điện đã thay đổi nền văn minh một cách tích cực. Hành trình phát triển trí tuệ không gian cho AI có thể dài, nhưng nó là bước tiến hóa cần thiết để AI thực sự "hiểu" và "hành động" trong thế giới.

marsbit05/27 00:17

Từ một bàn ăn trưa đến vũ trụ vô tận: Fei-Fei Li đặt cược vào chiều kích tiếp theo của AI

marsbit05/27 00:17

活动图片