Khám phá AGI thế giới vật lý với 'Suy luận thị giác', ElorianAI huy động được 55 triệu USD

marsbit发布于2026-04-23更新于2026-04-23

文章摘要

Mặc dù AI mô hình lớn đã vượt trội trong lập trình và toán học, khả năng lập luận thị giác của chúng vẫn chỉ ở mức trẻ 3 tuổi. ElorianAI, do Andrew Dai (cựu Google DeepMind) và Yinfei Yang (chuyên gia AI của Apple) sáng lập, đã huy động 55 triệu USD để phát triển mô hình đa phương thức "suy nghĩ nguyên sinh trong không gian thị giác", nhằm đạt được AGI cho thế giới vật lý. Thay vì chuyển đổi hình ảnh thành văn bản như VLM truyền thống, họ xây dựng kiến trúc mới để AI trực tiếp thao tác và hiểu sâu biểu diễn thị giác, kết hợp dữ liệu tổng hợp chất lượng cao. Mô hình dự kiến ra mắt năm 2026, hứa hẹn ứng dụng trong robot, quản lý thiên tai và kỹ thuật, nơi cần ra quyết định phức tạp trong môi trường vật lý.

Văn | Công xã Alpha

Khả năng của mô hình AI lớn trong một số lĩnh vực đã vượt quá người bình thường, chẳng hạn như lập trình và toán học. Theo tin tức, Anthropic nội bộ gần như đã đạt được 100% lập trình AI, Gemini Deep Think của Google đã giải được 5 trong 6 bài toán tại IMO 2025, đạt trình độ huy chương vàng.

Nhưng về suy luận thị giác, ngay cả Gemini 3 Pro dẫn đầu về trình độ, cũng chỉ đạt mức độ của trẻ 3 tuổi trên Benchmark BabyVision - một bài kiểm tra khả năng suy luận thị giác cơ bản.

Tại sao mô hình lớn mạnh về lập trình và toán học, nhưng lại yếu về suy luận thị giác? Điều này là do "cách suy nghĩ" của nó có hạn chế. Mô hình ngôn ngữ hình ảnh (VLM) cần chuyển đổi đầu vào thị giác thành ngôn ngữ trước, sau đó mới thực hiện suy luận dựa trên văn bản. Tuy nhiên, nhiều nhiệm vụ thị giác hoàn toàn không thể mô tả chính xác bằng văn bản, điều này dẫn đến khả năng suy luận thị giác của mô hình kém.

Andrew Dai, người đã làm việc tại Google DeepMind 14 năm, cùng với chuyên gia AI kỳ cựu của Apple là Yinfei Yang, đã thành lập một công ty tên là Elorian AI. Mục tiêu của họ là nâng cao khả năng suy luận thị giác của mô hình từ "trình độ trẻ em" lên "trình độ người lớn", và cho mô hình có khả năng suy nghĩ nguyên sinh thực sự trong "không gian thị giác", từ đó hướng tới AGI của thế giới vật lý.

Elorian AI đã huy động được 55 triệu USD vốn đầu tư giai đoạn đầu do Striker Venture Partners, Menlo Ventures và Altimeter cùng dẫn đầu, với sự tham gia của 49 Palms và các nhà khoa học AI hàng đầu bao gồm Jeff Dean.

Người tiên phong về mô hình đa phương thức, muốn mô hình thị giác có khả năng suy luận

Là người gốc Hoa, Andrew Dai, cử nhân khoa học máy tính Cambridge, tiến sĩ học máy Edinburgh, đã thực tập tại Google trong thời gian học tiến sĩ và gia nhập Google vào năm 2012, ở lại 14 năm cho đến khi khởi nghiệp.


Nguồn ảnh:Linkedin của Andrew Dai

Không lâu sau khi gia nhập Google, ông cùng với Quoc V. Le đã đồng viết bài báo đầu tiên về huấn luyện trước mô hình ngôn ngữ và vi chỉnh có giám sát 《Semi-supervised Sequence Learning》. Bài báo này đặt nền móng cho sự ra đời của GPT. Một bài báo nền tảng khác của ông là 《Glam: Efficient scaling of language models with mixture-of-experts》, mở đường cho kiến trúc MoE phổ biến hiện nay.

Nguồn ảnh: Google

Trong thời gian ở Google, ông cũng tham gia sâu vào hầu hết các quá trình huấn luyện mô hình lớn, từ Palm đến Gemini1.5 và Gemini2.5. Dưới sự sắp xếp của Jeff Dean, ông bắt đầu phụ trách lãnh đạo mảng dữ liệu của Gemini (bao gồm dữ liệu tổng hợp) vào năm 2023, quy mô đội ngũ sau đó đã mở rộng lên đến hàng trăm người.

Nguồn ảnh:Linkedin của Yinfei Yang

Cùng khởi nghiệp với Andrew Dai là Yinfei Yang, người đã từng làm việc tại Google Research bốn năm, tập trung vào học biểu diễn đa phương thức, sau đó gia nhập Apple, phụ trách nghiên cứu và phát triển mô hình đa phương thức.

Nguồn ảnh:arxiv

Nghiên cứu tiêu biểu của ông 《Scaling up visual and vision-language representation learning with noisy text supervision》 đã thúc đẩy sự phát triển của học biểu diễn đa phương thức.

Đồng sáng lập Elorian AI còn có Seth Neel, từng là AP (Trợ lý Giáo sư) tại Đại học Harvard, cũng là chuyên gia về dữ liệu và AI.

Tại sao phải thảo luận về những bài báo mang tính khai phá mà các nhà đồng sáng lập Elorian AI đã viết? Bởi vì việc họ làm không phải là tối ưu hóa ở tầng kỹ thuật, mà là cập nhật mô hình từ kiến trúc cơ sở, để nâng cấp AI từ hiểu thông minh dựa trên văn bản lên hiểu thông minh dựa trên thị giác.

Tình trạng hiện tại của mô hình AI là, mặc dù thể hiện xuất sắc trong các nhiệm vụ dựa trên văn bản, nhưng ngay cả mô hình đa phương thức lớn tiên tiến nhất, vẫn sẽ vấp ngã trong nhiệm vụ căn chỉnh thị giác (Visual grounding) cơ bản nhất.

Ví dụ, làm thế nào để lắp một linh kiện nào đó khít vào một thiết bị cơ khí, làm cho nó hoạt động chính xác hơn, hiệu quả hơn? Loại nhiệm vụ vật lý không gian này rất đơn giản đối với học sinh tiểu học, nhưng lại rất khó đối với các mô hình đa phương thức lớn hiện có.

Điều này vẫn phải tìm manh mối từ sinh học. Trong não người, thị giác là chất nền cơ sở hỗ trợ nhiều quá trình tư duy. Khả năng sử dụng thị giác và suy luận không gian của con người lâu đời hơn nhiều so với suy luận logic ngôn ngữ.

Ví dụ, dạy người khác đi qua một mê cung, dùng ngôn ngữ mô tả sẽ làm người ta hoa mắt, nhưng vẽ một bản phác thảo lại có thể khiến người ta hiểu ngay.

Lại ví dụ, ngay cả một con chim, dù không có ngôn ngữ, nhưng có thể thông qua thị giác, nhận biết và suy luận đặc điểm địa lý, từ đó thực hiện di cư đường dài toàn cầu. Đây là một tín hiệu mạnh mẽ, cho thấy để thực sự thúc đẩy khả năng suy luận của máy móc, thị giác rất có thể là hướng đi đúng đắn.

Vậy, hãy tưởng tượng, nếu ngay từ lúc đột phá xây dựng mô hình, đã thử khắc bản năng thị giác sinh học này vào gen của AI, xây dựng một mô hình đa phương thức nguyên sinh có thể "đồng thời hiểu và xử lý văn bản, hình ảnh, video và âm thanh", thì có thể cho mô hình có khả năng hiểu thị giác. Andrew Dai và đội ngũ muốn xây dựng một "người cảm thụ đa giác quan" bẩm sinh, dạy máy móc không chỉ "nhìn thấy" thế giới, mà còn "hiểu" thế giới.

Theo Andrew Dai và đội ngũ, nhận thức sâu sắc "thế giới vật lý" thực sự là chìa khóa để đạt được bước nhảy vọt thông minh máy móc thế hệ tiếp theo, và cuối cùng chạm tới "Trí tuệ nhân tạo phổ quát thị giác (Visual AGI)".

VLM với suy luận hậu kỳ không phải là con đường đúng đắn dẫn đến suy luận thị giác

Trước đây không phải không có đội ngũ muốn làm việc này, thực tế đội ngũ Gemini trước đây của Andrew Dai, đã là đội ngũ rất tiên tiến trong lĩnh vực đa phương thức trên toàn cầu. Nhưng mô hình đa phương thức truyền thống, vẫn chủ yếu là VLM (mô hình ngôn ngữ hình ảnh), logic của nó được xây dựng trên cơ sở "hai bước": đầu tiên chuyển đổi đầu vào thị giác thành ngôn ngữ, sau đó mới thực hiện suy luận dựa trên văn bản (đôi khi hỗ trợ gọi công cụ bên ngoài).

Tuy nhiên, suy luận hậu kỳ về bản chất đều có hạn chế, một mặt dễ sinh ra ảo giác mô hình, mặt khác nhiều nhiệm vụ thị giác hoàn toàn không thể mô tả chính xác bằng văn bản.

Ngoài ra, các mô hình tạo sinh thị giác như NanoBanana, có khả năng tạo đa phương thức xuất sắc, nhưng khả năng tạo sinh và khả năng suy luận không ngang bằng nhau, "suy nghĩ" của chúng trước khi tạo sinh, về bản chất vẫn phụ thuộc vào mô hình ngôn ngữ, không phải là khả năng suy luận nguyên sinh.

Nếu muốn phát triển mô hình có thể thấu hiểu sự phức tạp về không gian, cấu trúc và quan hệ trong thế giới thị giác, tất yếu cần đổi mới mang tính đột phá trong công nghệ cơ sở.

Vậy, đổi mới như thế nào? Mấy nhà sáng lập Elorian AI ngâm mình nhiều năm trong lĩnh vực đa phương thức, cách làm của họ là: kết hợp sâu giữa huấn luyện đa phương thức và kiến trúc mới được thiết kế chuyên cho suy luận đa phương thức. Loại bỏ cách làm truyền thống xem hình ảnh là đầu vào tĩnh, chuyển sang huấn luyện mô hình tương tác trực tiếp và thao tác biểu diễn thị giác (Visual representations) để tự phân giải cấu trúc, quan hệ và ràng buộc vật lý trong đó.

Tất nhiên, yếu tố cốt lõi khác là dữ liệu, nó là chìa khóa quyết định hiệu suất và thành bại của các mô hình này.

Andrew Dai表示, họ rất coi trọng chất lượng dữ liệu, tỷ lệ pha trộn dữ liệu, nguồn gốc dữ liệu và sự đa dạng của dữ liệu, đồng thời đã đổi mới ở tầng dữ liệu, tái cấu trúc liên kết suy luận trong không gian thị giác, còn sử dụng sâu rộng dữ liệu tổng hợp trên quy mô lớn.

Những nỗ lực tổng hợp này, sẽ thúc đẩy ra đời hệ thống AI mới có thể vượt qua "nhận thức" thị giác đơn giản, tiến tới "suy luận" thị giác cao cấp.

Hệ thống AI này có thể là mô hình cơ sở suy luận thị giác: tức xây dựng một mô hình có tính phổ dụng cao, nhưng thể hiện cực kỳ xuất sắc trên tập năng lực cụ thể, năng lực cụ thể này chính là suy luận thị giác.

Vì là một mô hình cơ sở phổ dụng, lĩnh vực ứng dụng của nó nên rộng rãi.

Đầu tiên, trong đường đua robot, nó có thể trở thành trung tâm thần kinh cơ sở của hệ thống mạnh mẽ, trao cho nó khả năng tác nghiệp tự chủ trong các môi trường lạ lẫm khác nhau.

Ví dụ, trong đường đua robot, phái một robot xử lý một sự cố an toàn đột xuất trong môi trường nguy hiểm. Điều này đòi hỏi robot đưa ra quyết định nhanh chóng và chính xác trong chớp mắt. Nếu robot thiếu mô hình cơ sở có khả năng suy luận sâu, người ta sẽ không dám để nó bấm nút bừa bãi hoặc vận hành cần gạt. Nhưng nếu nó có khả năng suy luận cực mạnh, nó có thể nghĩ: "Trước khi vận hành bảng điều khiển này, có lẽ tôi nên kéo cần gạt này trước, kích hoạt cơ chế bảo vệ an toàn."

Ngoài ra trong quản lý thiên tai, mô hình có suy luận thị giác có thể thông qua phân tích hình ảnh vệ tinh để giám sát và phòng ngừa cháy rừng; trong lĩnh vực kỹ thuật, nó có thể nhìn chính xác các bản vẽ thị giác phức tạp, sơ đồ nguyên lý hệ thống, ý nghĩa của năng lực này nằm ở chỗ, quy tắc vận hành của thế giới vật lý khác biệt cơ bản với thế giới thuần mã, bạn không thể chỉ dựa vào gõ vài dòng mã thuần túy để thiết kế ra cánh máy bay.

Tuy nhiên, hiện tại mô hình, năng lực của Elorian AI tạm thời vẫn chỉ nằm trên giấy, họ dự kiến sẽ phát hành một mô hình đạt trình độ SOTA trong lĩnh vực suy luận thị giác vào năm 2026, đến lúc đó có thể kiểm tra thành quả của họ có phù hợp với tuyên bố hay không.

Khi AI thực sự có khả năng "suy luận thị giác", nó sẽ thay đổi thế giới vật lý như thế nào?

Để AI hiểu và ảnh hưởng thế giới vật lý thực, công nghệ đã lặp lại nhiều lần.

Từ nhận dạng hình ảnh thời CV truyền thống, đến mô hình tạo sinh hình ảnh/mô hình đa phương thức của AI生成, rồi đến mô hình thế giới, sự hiểu biết về thế giới vật lý luôn được tăng cường.

Mà mô hình cơ sở suy luận thị giác, rất có thể tiến thêm một bước, bởi vì có thể thực hiện suy luận thị giác, AI sẽ hiểu sâu hơn thế giới vật lý, từ đó đạt được trí thông minh máy móc tầng cao hơn.

Hãy tưởng tượng, khi mô hình có khả năng hiểu sâu và thao tác tinh tế "nạp điện" cho ngành trí thông minh thể hiện, cũng như ngành phần cứng AI, sẽ mở rộng đáng kể phạm vi ứng dụng của chúng. Ví dụ, robot có thể tiến hành sản xuất công nghiệp có độ tin cậy cao hơn, hoặc lĩnh vực chăm sóc y tế; phần cứng AI, đặc biệt là thiết bị đeo, trở thành trợ lý cá nhân thông minh hơn.

Tuy nhiên, ở cơ sở của những công nghệ này, vẫn là dữ liệu. Andrew Dai ở trên cũng表示, chất lượng dữ liệu, tỷ lệ pha trộn dữ liệu, nguồn gốc dữ liệu và sự đa dạng của dữ liệu, đều quyết định hiệu suất của mô hình.

Trong lĩnh vực AI vật lý, doanh nghiệp Trung Quốc dù ở tầng mô hình hay tầng dữ liệu, so với mô hình lớn văn bản, đều gần với trình độ dẫn đầu thế giới hơn. Nếu có thể dựa vào lợi thế dữ liệu, ứng dụng场景 phong phú hơn, đẩy nhanh tốc độ lặp, thì dù là trí thông minh thể hiện hay phần cứng AI, dù ứng dụng trong công nghiệp, y tế, hay gia đình, đều có cơ hội lớn hơn để đạt trình độ dẫn đầu, tất nhiên cũng có cơ hội chạy ra doanh nghiệp tầm cỡ thế giới.

热门币种推荐

相关问答

QTại sao các mô hình AI lớn như Gemini 3 Pro chỉ có khả năng lý luận thị giác tương đương trẻ 3 tuổi?

AVì các mô hình ngôn ngữ thị giác (VLM) hiện tại phải chuyển đổi đầu vào hình ảnh thành văn bản trước khi suy luận, nhưng nhiều nhiệm vụ thị giác không thể mô tả chính xác bằng ngôn ngữ, dẫn đến hạn chế trong khả năng lý luận.

QElorian AI được thành lập bởi những ai và mục tiêu của họ là gì?

AĐược đồng sáng lập bởi Andrew Dai (cựu Google DeepMind) và Yinfei Yang (chuyên gia AI của Apple). Mục tiêu là nâng cao khả năng lý luận thị giác của AI từ 'mức trẻ em' lên 'mức người lớn' và hướng tới AGI cho thế giới vật lý.

QElorian AI đã huy động được bao nhiêu vốn và từ những nhà đầu tư nào?

ACông ty đã huy động được 55 triệu USD từ các nhà đầu tư dẫn đầu như Striker Venture Partners, Menlo Ventures, Altimeter, cùng sự tham gia của 49 Palms và các nhà khoa học AI hàng đầu như Jeff Dean.

QCông nghệ của Elorian AI khác biệt thế nào so với mô hình đa phương tiện truyền thống?

AHọ tập trung vào kiến trúc mới cho phép mô hình xử lý và suy luận trực tiếp trong không gian thị giác, thay vì chuyển đổi hình ảnh thành văn bản trước. Điều này giúp giảm ảo giác và xử lý các tác vụ phức tạp như không gian vật lý.

QỨng dụng tiềm năng của mô hình lý luận thị giác trong thế giới thực là gì?

ABao gồm robot tự động xử lý môi trường nguy hiểm, phân tích hình ảnh vệ tinh để quản lý thiên tai, hiểu bản vẽ kỹ thuật phức tạp, và nâng cao khả năng của thiết bị đeo thông minh trong y tế hoặc công nghiệp.

你可能也喜欢

俄罗斯燃料危机趋于缓和:各地区开始取消加油站限购措施

俄罗斯的燃料危机开始缓解:多个地区已开始取消加油站的限购措施。此前,由于乌克兰无人机袭击了莫斯科炼油厂和克拉斯诺达尔边疆区的油库,扰乱了南部地区的供应物流,导致2026年6月底超过20个地区出现汽油和柴油短缺并实施限购。 目前情况已逐步好转。截至7月底,多个地区放宽或取消了限制: - 外贝加尔边疆区自7月30日起完全取消了加油站QR码预订系统。 - 奥伦堡州州长于7月28日宣布全面取消加油站燃油销售限额。 - 萨拉托夫州将个人汽油日限购量从30升提高至40升。 - 萨马拉州则决定维持现有限额(汽油40升、柴油100升)不予收紧,但禁止灌装油桶。 危机高峰期,超过20个地区实施了严格限购,例如萨拉托夫州曾限购30升汽油,奥伦堡州限购40升汽油和80升柴油。官方解释称限购旨在抑制激增了20-30%的恐慌性需求。 分析指出,零售限购的放松反映了销售环节的稳定,但未解决炼油能力受损这一根本问题。据估算,无人机袭击已导致俄罗斯至少17%的炼油产能(相当于每日110万桶)停产。在当前炼油产能持续承压的背景下,部分地区取消限购可能带来风险:如果工厂维修无法在供暖季开始前弥补产量缺口,秋季可能再次出现限购。当前的稳定态势能否持续,将取决于后续是否发生新的袭击浪潮。

cryptonews.ru28分钟前

俄罗斯燃料危机趋于缓和:各地区开始取消加油站限购措施

cryptonews.ru28分钟前

XRP即将迎来五项重要新功能!Ripple代表宣布此消息

Ripple产品部门负责人Jazzzy Cooper宣布,下周将发布XRPLedger 3.3.0版本,引入五项旨在提升XRP在机构金融和代币化资产市场中应用的重要新功能。 新功能包括: 1. **机密MPT(多用途代币)**:通过零知识证明和椭圆曲线密码学,为XRPL上的代币提供内置隐私功能,允许代币余额和交易金额在公开账本中保密,同时授权方(如审计师)可按需验证交易。 2. **批量处理**:支持在单一账本条目中,原子化地执行最多八笔涉及不同账户的交易,所有交易要么全部成功,要么全部不发生。这有助于简化企业金融应用,特别是涉及交付付款和原子对账的场景。 3. **权限委托**:允许机构在不交出私钥完全控制权的情况下,设定有限的交易执行权限。例如,财务部门可保留资产发行密钥,而交易或运营团队可在设定限额内执行特定交易。 4. **赞助费用和储备金**:允许银行、代币发行方或平台为其他用户支付XRP交易费和账户储备金,用户无需在加入网络前购买和管理XRP,同时仍保有账户所有权和私钥,旨在提升企业和消费者应用的用户体验。 5. **动态MPT**:允许代币发行方在代币创建后更新费用、元数据等特定属性,而无需发行新代币并迁移用户。发行方可在创建代币时预先定义未来可更改的属性。 这些更新需经过验证者投票批准后才能在XRPLedger上激活。

cryptonews.ru1小时前

XRP即将迎来五项重要新功能!Ripple代表宣布此消息

cryptonews.ru1小时前

交易

现货

热门文章

如何购买AR

欢迎来到HTX.com!我们已经让购买Arweave(AR)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Arweave(AR)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Arweave(AR)购买完您的Arweave(AR)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Arweave(AR)在HTX的现货市场轻松交易Arweave(AR)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

2.0k人学过发布于 2024.03.29更新于 2026.06.02

如何购买AR

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AR(AR)币价的意见。

活动图片