# Bài viết Liên quan Mô Hình Thế Giới

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Mô Hình Thế Giới", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

10000 giờ dữ liệu con người, đào tạo ra mô hình hành động thế giới ẩn toàn thân di động đầu tiên trên thế giới

Trong hai năm qua, trọng tâm cạnh tranh trong lĩnh vực robot hình người đã chuyển từ phần cứng sang khả năng mô hình. Công ty trí tuệ thể hiện Zhizai Wujie đã ra mắt **Being-M0.7**, mô hình hành động thế giới ngầm (Latent World-Action Model) toàn thân đầu tiên trên thế giới dành cho thao tác di chuyển của robot hình người. Mô hình này được đào tạo trước trên hơn 10.000 giờ dữ liệu đa phương thức tập trung vào con người, sau đó được điều chỉnh với một lượng nhỏ dữ liệu trình diễn robot thực tế. Being-M0.7 giải quyết ba thách thức chính: chi phí thu thập dữ liệu robot cao, tính toán tốn kém của các mô hình dự đoán pixel và sự thiếu phối hợp giữa thao tác tay và di chuyển. Kiến trúc Vision-Motion Mixture of Transformers (MoT) cho phép mô hình sử dụng chung ba loại dữ liệu: dữ liệu ghép cặp video-chuyển động, video thuần túy và chuỗi chuyển động thuần túy. Nó cũng sử dụng một biểu diễn chuyển động thống nhất giữa người và robot, tập trung vào đầu, bàn tay và bàn chân để thu hẹp khoảng cách hình thái. Bốn bản demo robot thực tế cho thấy khả năng của Being-M0.7 trong các nhiệm vụ đầy thách thức: vớt cá trong bể (tương tác chất lỏng), lấy vật qua gương (suy luận không gian), di chuyển và sắp xếp đồ vật (nhiệm vụ dài), và mang hộp tránh chướng ngại vật (né tránh có tải). Các thử nghiệm so sánh cho thấy hiệu suất vượt trội so với các mô hình cạnh tranh trong một số nhiệm vụ. Phương pháp này tách biệt lập kế hoạch thế giới tần số thấp với điều khiển hành động tần số cao, cho phép robot tạo ra và điều chỉnh hành động phối hợp toàn thân dựa trên quan sát, phản hồi thời gian thực và dự đoán tương lai. Con đường công nghệ từ Being-H (thao tác khéo léo) đến Being-M (di chuyển & thao tác) nhấn mạnh việc học từ dữ liệu hành vi con người quy mô lớn trước khi chuyển giao kiến thức sang robot, cung cấp một khuôn khổ có thể mở rộng để vượt qua vấn đề khan hiếm dữ liệu thể hiện và hướng tới trí tuệ thể hiện tổng quát hơn.

marsbit07/15 01:51

10000 giờ dữ liệu con người, đào tạo ra mô hình hành động thế giới ẩn toàn thân di động đầu tiên trên thế giới

marsbit07/15 01:51

Đã đến lúc "iPhone" của Trí tuệ thể hiện chưa?

Trí tuệ thể hiện có đang ở thời điểm "iPhone" chưa? Tại một hội nghị bàn tròn ở Vũ Hán, các chuyên gia đã thảo luận về tình hình và triển vọng của lĩnh vực này. **Hiện trạng: Còn nhiều thách thức, chưa đến "thời điểm iPhone"** - **Công nghệ còn sơ khai:** Được so sánh với thời kỳ "điện thoại cục gạch". Con đường công nghệ chưa hội tụ, ngoài mô hình VLA vẫn còn nhiều hướng thử nghiệm. - **"Bộ não" còn yếu:** Khả năng vận động ("tiểu não") đã tốt, nhưng khả năng ra quyết định và khái quát hóa ("đại não") chưa đủ cho ứng dụng thương mại quy mô. - **Thiếu dữ liệu trầm trọng:** Cần hàng triệu bộ dữ liệu, nhưng hiện toàn cầu chỉ có khoảng 500.000, chênh lệch 200 lần. - **Bài toán kinh tế chưa có lời giải:** Chi phí robot hình người cộng với mô hình AI hiện vẫn đắt hơn nhiều so với chi phí nhân lực truyền thống. **Ứng dụng và không gian tưởng tượng** - **Thị trường giá trị cảm xúc (hàng tỷ USD):** Biểu diễn, robot đồng hành/chăm sóc. - **Thị trường dịch vụ thương mại (hàng nghìn tỷ USD):** Chào khách, hướng dẫn tham quan, mua sắm. - **Thị trường lao động sản xuất (hàng trăm nghìn tỷ USD):** Làm việc trong nhà máy, việc nhà. - **Ứng dụng có thể đi trước:** Trí tuệ thể hiện không nhất thiết phải là robot hình người. Các ứng dụng như robot giao đồ ăn, hút bụi đã có mặt. Giá trị đồng hành, tình cảm có thể là bước đột phá đầu tiên. **Hệ sinh thái ngành và nhu cầu** - Điểm nghẽn chính nằm ở **dữ liệu và mô hình**. Cần cơ chế để thu thập, chia sẻ và giao dịch dữ liệu quy mô lớn. - Cần phát triển hơn nữa chuỗi cung ứng linh kiện phần cứng then chốt và các mô hình AI (như VLA, World Model) dưới dạng dịch vụ/dễ tiếp cận. - Các yếu tố hạ nguồn như kênh phân phối, bảo hiểm, bảo trì cũng cần được xây dựng. **Sử dụng AI để tạo ra AI** - AI đã giúp tăng hiệu quả trong nghiên cứu, mã hóa, giảng dạy và văn phòng. - Tuy nhiên, cần thận trọng với tính **"lừa dối"** và nguy cơ **"thay thế tư duy"** của AI. Các quyết định và phán đoán cốt lõi vẫn phải do con người nắm giữ. - Các phương pháp như sử dụng mô hình giáo viên, dữ liệu tổng hợp (simulation) và World Model đang được khám phá để huấn luyện AI thể hiện. **Tóm lại:** Thời điểm bùng nổ như iPhone của trí tuệ thể hiện chưa tới. Lĩnh vực này vẫn cần thời gian để giải quyết các thách thức về công nghệ, dữ liệu và kinh tế. Tuy nhiên, các ứng dụng cụ thể, đặc biệt là những ứng dụng mang lại giá trị cảm xúc, có thể dẫn đường và từng bước mở ra tương lai nơi AI bước vào thế giới vật lý.

marsbit07/14 05:15

Đã đến lúc "iPhone" của Trí tuệ thể hiện chưa?

marsbit07/14 05:15

Vừa rồi, mô hình thế giới siêu cao khung hình đầu tiên toàn cầu ra đời, không chứa Nvidia, lao nhanh 50 FPS

Thế giới mô hình thực sự bước vào thời đại thời gian thực. Khi ngành công nghiệp vẫn đang vật lộn với 5-10 FPS, một nhóm các nhà nghiên cứu Trung Quốc đã đưa mô hình thế giới tương tác thời gian thực lên 50 FPS. MoWorld - Flash World Model toàn cầu đầu tiên từ Moxin Tech và Đại học Chiết Giang, cũng là mô hình thế giới tương tác thời gian thực đầu tiên được xây dựng hoàn toàn trên nền tảng NPU nội địa (chip Ascend 910C). Dự án đã xây dựng một vòng khép kín hoàn chỉnh từ đào tạo, chưng cất đến triển khai suy luận trên nền tảng NPU nội địa, giảm chi phí suy luận 70% so với các giải pháp GPU quy mô tương đương. MoWorld đạt được khả năng đào tạo và suy luận video dài 2000 khung hình, hỗ trợ điều khiển camera 6DoF cho trải nghiệm du lịch ảo sống động. Ứng dụng tiềm năng bao gồm giải trí tương tác, trí tuệ thể hiện, sáng tạo phim ảnh và số đôi sinh. Đột phá này chứng minh khả năng của nền tảng điện toán nội địa trong việc hỗ trợ các mô hình thế giới tiên tiến, mở ra cơ hội cạnh tranh và định hình tiêu chuẩn cho thế hệ trí tuệ không gian tiếp theo.

marsbit07/08 04:17

Vừa rồi, mô hình thế giới siêu cao khung hình đầu tiên toàn cầu ra đời, không chứa Nvidia, lao nhanh 50 FPS

marsbit07/08 04:17

Sàn IPO lớn nhất trong ngày của Sở giao dịch Hồng Kông đã diễn ra

Ngày 8/7, Momenta đã lên sàn Hong Kong, trở thành "cổ phiếu AI vật lý đầu tiên" với giá phát hành 295,6 HKD/cổ phiếu, vốn hóa thị trường vượt 70 tỷ HKD. Đây là đợt IPO lớn nhất trên sàn HKEX trong ngày, huy động khoảng 6,8 tỷ HKD (giả định toàn bộ quyền mua thêm được thực hiện). Công ty được thành lập năm 2016 bởi Tào Túc Đông, cựu sinh viên Đại học Thanh Hoa. Momenta tập trung vào AI vật lý, đặc biệt là lĩnh vực tự hành, với chiến lược "một bánh đà, hai chân trụ" kết hợp giữa kinh doanh sản xuất hàng loạt và phát triển công nghệ không người lái quy mô lớn. Hệ thống của họ đã được trang bị trên hơn 1 triệu xe, cung cấp dữ liệu thực tế khổng lồ để đào tạo mô hình thế giới R7 - nền tảng cốt lõi cho AI vật lý của họ. Về mặt thương mại, Momenta dẫn đầu thị trường NOA thành phố của bên thứ ba tại Trung Quốc với thị phần 65%, hợp tác với 24 nhà sản xuất ô tô toàn cầu, trong đó có 9/10 hãng xe hàng đầu thế giới. Doanh thu năm 2025 đạt 2,413 tỷ nhân dân tệ, tăng trưởng mạnh mẽ, chủ yếu nhờ vào thu nhập từ cấp phép công nghệ. Momenta nhận được sự ủng hộ lớn từ các nhà đầu tư. Đợt IPO có sự tham gia của 14 nhà đầu tư hạt giống, bao gồm các quỹ toàn cầu như GIC, Fidelity, BlackRock và các đối tác chiến lược như Mercedes-Benz, BYD. Làn sóng AI vật lý, được dự báo bởi những người như Jensen Huang (NVIDIA), đang mở ra cơ hội định giá lại cho các công ty như Momenta, khi họ tiên phong trong việc kết nối AI với thế giới vật lý thông qua mô hình thế giới và triển khai thương mại rộng rãi.

marsbit07/08 03:13

Sàn IPO lớn nhất trong ngày của Sở giao dịch Hồng Kông đã diễn ra

marsbit07/08 03:13

Star Era huy động 2,5 tỷ USD trong 2 tháng, đội ngũ vốn nhà nước vào sân

Công ty trí tuệ thể thân hàng đầu Trung Quốc XINGDONG ERA đã hoàn thành vòng gọi vốn mới trị giá 1 tỷ nhân dân tệ, nâng tổng số vốn huy động được trong hai tháng lên 2.5 tỷ nhân dân tệ. Vòng này do quỹ vốn nhà nước thuộc Ủy ban Quản lý Tài sản Nhà nước dẫn đầu, với sự tham gia của nhiều tổ chức tài chính và vốn công nghiệp lớn, xây dựng ma trận vốn ba lớp. Xuất thân từ Đại học Thanh Hoa và là công ty trí tuệ thể thân duy nhất do trường này nắm cổ phần, XINGDONG ERA là người tiên phong đề xuất mô hình thế giới (world model) trong ngành. Công ty áp dụng chiến lược phát triển toàn diện "AI Native", tự nghiên cứu toàn bộ chuỗi từ dữ liệu, bộ não AI, điều khiển vận động, bàn tay linh hoạt đến bản thể robot. Bàn tay linh hoạt toàn dẫn động trực tiếp tự nghiên cứu của họ đóng vai trò là cốt lõi để thu thập dữ liệu tương tác vật lý chất lượng cao, cung cấp nền tảng cho việc đào tạo mô hình bộ não mạnh mẽ hơn, tạo thành một vòng lặp phát triển tích cực. Họ sở hữu một trong những bộ dữ liệu thực nghiệm bàn tay linh hoạt lớn nhất ngành. Về mặt thương mại hóa, XINGDONG ERA đã đạt được sự phù hợp sản phẩm-thị trường (PMF) đầu tiên trong ngành tại lĩnh vực hậu cần, với robot triển khai hàng loạt tại các trung tâm phân loại của các tập đoàn như SF Express và China Post, hoạt động 24/7. Họ cũng mở rộng hợp tác trong lĩnh vực sản xuất cao cấp (ví dụ: Samsung, Geely) và dịch vụ thương mại. Khả năng phần cứng cốt lõi của công ty đã được công nhận rộng rãi, với bàn tay linh hoạt và nền tảng robot được các tổ chức nghiên cứu đỉnh cao toàn cầu và 9/10 công ty công nghệ hàng đầu thế giới sử dụng. Năm 2026 được coi là thời điểm then chốt cho ngành, nơi sự khác biệt về năng lực mô hình và khả năng khép kín vòng lặp thương mại sẽ quyết định vị thế cạnh tranh.

marsbit07/06 01:37

Star Era huy động 2,5 tỷ USD trong 2 tháng, đội ngũ vốn nhà nước vào sân

marsbit07/06 01:37

Bài viết mới nhất của Lý Phi Phi: Khi video tạo sinh, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

Trong bài viết mới nhất của mình, giáo sư Lý Phi Phi đã phân loại và làm rõ khái niệm "mô hình thế giới" đang bị sử dụng một cách lộn xộn trong lĩnh vực AI hiện nay. Bà đề xuất một cách phân loại chức năng dựa trên vòng lặp POMDP cổ điển (tác nhân → hành động → trạng thái → quan sát → tác nhân), chia các hệ thống được gọi là "mô hình thế giới" thành ba loại chính: 1. **Bộ kết xuất (Renderer):** Đầu ra là các quan sát (pixel). Mục tiêu là độ trung thực về mặt thị giác. Ví dụ: các mô hình tạo video từ văn bản như Sora, hay hệ thống tương tác như Genie. Chúng tạo ra hình ảnh đẹp nhưng không nhất thiết tuân thủ vật lý chính xác. 2. **Bộ mô phỏng (Simulator):** Đầu ra là trạng thái thế giới. Mục tiêu là độ chính xác về cấu trúc hình học, vật lý và động lực học. Chúng phục vụ cả con người (kiến trúc sư, nhà thiết kế) và các chương trình máy tính (robot, xe tự hành) để tính toán và đào tạo. Đây được coi là trung tâm then chốt bị đánh giá thấp. 3. **Bộ lập kế hoạch (Planner):** Đầu ra là các hành động. Cho một quan sát và mục tiêu, nó quyết định tác nhân nên làm gì tiếp theo. Ví dụ: các mô hình VLA (Vision-Language-Action). Đây là lĩnh vực thú vị nhất nhưng cũng non trẻ nhất, với khoảng cách lớn giữa demo trong phòng thí nghiệm và ứng dụng thực tế. Bài viết nhấn mạnh ba loại này không tách biệt mà chia sẻ hiểu biết cơ bản chung về thế giới. Xu hướng quan trọng hiện nay là sự hợp nhất giữa chúng, hướng tới một **mô hình thế giới thống nhất** có thể chuyển đổi linh hoạt giữa kết xuất, mô phỏng và lập kế hoạch tùy theo nhu cầu. Sản phẩm Marble của World Labs là một bước đi theo hướng này, cùng lúc tạo ra cả dữ liệu hình ảnh (Gaussian splatting) và dữ liệu vật lý (collision mesh) từ một mô hình duy nhất. Tóm lại, trong khi mô hình ngôn ngữ cho phép máy móc "nói" về thế giới, thì mô hình thế giới chính là con đường để chúng thực sự hiểu, tưởng tượng, suy luận và tương tác với thế giới vật lý.

marsbit07/05 09:27

Bài viết mới nhất của Lý Phi Phi: Khi video tạo sinh, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

marsbit07/05 09:27

Bài viết mới của Lý Phi Phi: Khi tạo video, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

Tác giả Lý Phi Phi đưa ra một phân loại rõ ràng cho khái niệm "mô hình thế giới" (world model) đang bị sử dụng lộn xộn trong AI hiện nay. Dựa trên vòng lặp POMDP cơ bản (tác nhân → hành động → trạng thái → quan sát), bà chia các hệ thống tự xưng là mô hình thế giới thành ba loại chức năng: 1. **Bộ kết xuất (Renderer)**: Đầu ra là quan sát (pixel), tập trung vào độ trung thực thị giác. Ví dụ: các mô hình tạo video như Sora. Hạn chế: hình ảnh đẹp nhưng có thể không đúng vật lý. 2. **Bộ mô phỏng (Simulator)**: Đầu ra là trạng thái thế giới (mô hình hình học, vật lý, động lực học chính xác). Đây là trung tâm then chốt, có thể phục vụ cả con người (thiết kế, mô phỏng) và máy móc (đào tạo robot, xe tự lái). Ví dụ: NVIDIA Omniverse. 3. **Bộ lập kế hoạch (Planner)**: Đầu ra là hành động. Dựa trên quan sát và mục tiêu, nó quyết định tác nhân nên làm gì tiếp theo. Ví dụ: các mô hình Ngôn ngữ-Thị giác-Hành động (VLA) cho robot. Bài viết nhấn mạnh **bộ mô phỏng là trung tâm bị đánh giá thấp**, vì nó hoạt động ở cấp độ cấu trúc nền tảng (hình học, vật lý), từ đó có thể suy ra đầu ra cho cả bộ kết xuất và bộ lập kế hoạch. Trong khi bộ kết xuất thương mại hóa tốt nhưng có trần vật lý, và bộ lập kế hoạch hứa hẹn nhưng chưa trưởng thành, thì bộ mô phỏng là cầu nối thiết yếu. Xu hướng tương lai là sự hội tụ của ba loại này hướng tới một **mô hình thế giới thống nhất**, có thể chuyển đổi linh hoạt giữa kết xuất, mô phỏng và lập kế hoạch dựa trên cùng một hiểu biết cơ bản về thế giới. Điều này sẽ định hình tương lai của trí thông minh không gian, cho phép máy móc không chỉ nói về thế giới (như mô hình ngôn ngữ) mà thực sự hiểu, tưởng tượng và tương tác với nó.

链捕手07/05 09:15

Bài viết mới của Lý Phi Phi: Khi tạo video, robot và NVIDIA đều tự xưng là mô hình thế giới, chúng ta cần một phân loại học

链捕手07/05 09:15

Mô hình thế giới, metaverse, song sinh kỹ thuật số, AI vật lý: Chúng có phải là một?

Trong vài năm qua, nhiều khái niệm như metaverse, Web3.0, nền tảng dữ liệu mô phỏng, song sinh kỹ thuật số (Digital Twin) và AI vật lý (Physical AI) liên tục xuất hiện, khiến nhiều người bối rối. Vậy chúng có phải là một với "Mô hình Thế giới" (World Model) không? Câu trả lời là không hoàn toàn, nhưng tất cả đều hướng đến xu hướng xóa mờ ranh giới giữa thế giới số và vật lý. Mô hình Thế giới giống như "lớp nhận thức" hoặc "hệ điều hành nền tảng", giúp AI hiểu và suy luận về thế giới. Các khái niệm trên có thể được phân loại thành: 1) **Trải nghiệm không gian** (Metaverse), 2) **Quan hệ sản xuất** (Web3.0 với blockchain), và 3) **Năng lực kỹ thuật** (gồm các nền tảng mô phỏng, song sinh kỹ thuật số, AI vật lý và Mô hình Thế giới). **Metaverse** là điểm đến ảo, còn **Mô hình Thế giới** là công cụ tạo ra nội dung cho nó, như một "động cơ" tự sinh thế giới tương tác. **Web3.0** tập trung vào quyền sở hữu và kinh tế số, khác biệt về mặt kỹ thuật với Mô hình Thế giới. **Nền tảng dữ liệu mô phỏng** (simulation platform) là phiên bản 1.0, dựa nhiều vào thiết kế thủ công, trong khi Mô hình Thế giới (phiên bản 2.0) sử dụng AI để tự động tạo ra các kịch bản chân thực và quy mô lớn. **Song sinh kỹ thuật số** là bản sao kỹ thuật số phản ánh hiện trạng, còn **Mô hình Thế giới** tiến xa hơn bằng khả năng "dự đoán tương lai" và mô phỏng các kết quả. **AI vật lý** cần Mô hình Thế giới như một thành phần cốt lõi để hiểu các quy luật vật lý, dự đoán và lên kế hoạch hành động trong thế giới thực. Tóm lại, có thể hình dung mối quan hệ theo các tầng: **Cơ sở hạ tầng** (GPU, cảm biến) -> **Lớp nhận thức** (Mô hình Thế giới) -> **Lớp công cụ ứng dụng** (nền tảng mô phỏng, song sinh kỹ thuật số) -> **Lớp hành động** (AI vật lý) -> **Lớp trải nghiệm** (Metaverse) -> **Lớp quy tắc** (Web3.0). Mô hình Thế giới không thay thế các khái niệm khác, mà có khả năng trở thành "hệ điều hành" nền tảng, cung cấp khả năng hiểu biết và suy luận về thế giới để hỗ trợ cho nhiều ứng dụng và tầm nhìn công nghệ trong tương lai.

marsbit06/28 10:43

Mô hình thế giới, metaverse, song sinh kỹ thuật số, AI vật lý: Chúng có phải là một?

marsbit06/28 10:43

Bằng cấp chống cháy nổ đầu tiên trong nước, giải pháp "bộ não" xăng dầu đầu tiên trên toàn cầu, họ dựa vào đâu để đạt được hai 'đầu tiên' này?

Theo thống kê, tổng số tiền huy động được trong lĩnh vực trí tuệ thể sinh (embodied AI) ở Trung Quốc năm nay đã vượt quá 37 tỷ nhân dân tệ. Ngành công nghiệp đang tập trung vào việc triển khai thương mại hóa, với mục tiêu ứng dụng robot vào các môi trường nguy hiểm, nặng nhọc và lặp đi lặp lại. Một trong những rào cản quan trọng nhất để robot hoạt động trong các môi trường dễ cháy nổ như trạm xăng, nhà máy hóa chất là chứng nhận chống cháy nổ. Yêu cầu này đòi hỏi thiết kế phần cứng nghiêm ngặt từ gốc, bao gồm thiết kế mạch an toàn nội tại, vỏ bọc chịu nổ và xử lý tăng cường an toàn cho tất cả các điểm kết nối. Bài viết phân tích các thách thức cụ thể trong các kịch bản ứng dụng: - **Trạm xăng**: Đòi hỏi thao tác tinh vi, liên tục với dung sai chỉ vài milimét để thực hiện chuỗi hành động dài như mở nắp, cầm vòi, đổ xăng, lắp lại. - **Tuần tra trạm**: Yêu cầu khả năng tự hành lâu dài, nhận diện nhiều loại bất thường và phản ứng tức thì. - **Cảng biển**: Cần sự phối hợp đa robot. Để giải quyết những thách thức về chuỗi tác vụ dài và phức tạp, một kiến trúc mới có tên H-GAR (Hierarchical Goal-Aware Reasoning) đã được đề xuất. Thay vì kiến trúc đường ống truyền thống, H-GAR sử dụng "mô hình thế giới" để dự đoán trạng thái cuối cùng của nhiệm vụ, sau đó tổng hợp các khung hình chuyển tiếp trung gian và tinh chỉnh hành động dựa trên ngữ cảnh thị giác và bộ nhớ lịch sử. Cách tiếp cận "căn chỉnh theo trạng thái cuối cùng" này giúp robot lập kế hoạch với tầm nhìn xa, giảm thiểu sai lệch tích lũy và tăng tính ổn định tổng thể. Việc đưa trí tuệ thể sinh vào các ngành đặc thù đòi hỏi chủ nghĩa lâu dài, khả năng phát triển cả phần "não bộ" (thuật toán) lẫn "cơ thể" (phần cứng robot), và sự kết hợp sâu sắc giữa chúng. Những công ty sớm thiết lập được vòng lặp khép kín "não bộ - cơ thể - dữ liệu" sẽ có lợi thế cạnh tranh quan trọng trong hành trình thương mại hóa.

marsbit06/26 03:51

Bằng cấp chống cháy nổ đầu tiên trong nước, giải pháp "bộ não" xăng dầu đầu tiên trên toàn cầu, họ dựa vào đâu để đạt được hai 'đầu tiên' này?

marsbit06/26 03:51

Tiến sĩ 9X lao vào mô hình thế giới, FaceMind huy động hàng chục triệu NDT

Công ty trí tuệ nhân tạo (AI) Trung Quốc FaceMind, do tiến sĩ sinh năm 1995 Lục Hoằng Viễn sáng lập, vừa hoàn thành vòng gọi vốn Pre-A trị giá hàng chục triệu nhân dân tệ. Vòng này có sự tham gia của nhà đầu tư mới là Tinh Liên Capital và sự gia tăng đầu tư từ cổ đông hiện tại 360. FaceMind ban đầu tập trung vào mô hình đa phương thức chạy trên thiết bị, nhưng đã chuyển trọng tâm sang phát triển "mô hình thế giới" (world model) - loại mô hình có khả năng dự đoán sự thay đổi của môi trường, ứng dụng cho AI giao diện người dùng đồ họa (GUI Agent) và trí tuệ thể hiện (embodied AI). Sản phẩm thử nghiệm ban đầu của họ, Diệp Diệp Xã, sử dụng AI tạo bình luận tương tác theo nội dung web, đóng vai trò như một bài kiểm tra cho khả năng hiểu và tương tác với giao diện màn hình. Nhóm nghiên cứu của Lục Hoằng Viễn được đánh giá cao nhờ những đóng góp học thuật sâu về cơ chế nền tảng của mô hình lớn, như nghiên cứu về ảnh hưởng của từ vựng tần suất thấp. Công trình "Adam's Law" của họ thậm chí được Anthropic, công ty AI hàng đầu, tham khảo. Các nhà đầu tư đánh giá cao khả năng nghiên cứu lý thuyết vững chắc kết hợp với tốc độ triển khai kỹ thuật nhanh chóng của đội ngũ. FaceMind tập trung vào kiến trúc mô hình lặp tuần hoàn và hiệu quả tham số, nhằm nâng cao khả năng dự đoán chuỗi dài với quy mô tham số tối ưu. Mô hình 1B tham số của họ được cho là đã đạt hiệu suất ngang bằng với các mô hình mạnh quốc tế cùng loại. Năng lực mô hình thế giới của công ty đang được xác thực trong nhiều môi trường mô phỏng, giao diện và robot thực tế. Công ty kỳ vọng cơ hội sẽ mở rộng cùng với sự phát triển của GUI Agent và trí tuệ thể hiện, nơi khả năng hiểu nhiệm vụ, dự đoán thay đổi và hành động ổn định là then chốt. Khoản đầu tư mới sẽ được dùng để tiếp tục đẩy mạnh nghiên cứu mô hình thế giới và xác thực đa tình huống.

marsbit06/26 01:51

Tiến sĩ 9X lao vào mô hình thế giới, FaceMind huy động hàng chục triệu NDT

marsbit06/26 01:51

活动图片