Exploring Physical World AGI with "Visual Reasoning", ElorianAI Raises $55 Million

marsbitPublicado a 2026-04-23Actualizado a 2026-04-23

Resumen

ElorianAI, co-founded by ex-Google AI expert Andrew Dai and former AI specialist Yinfei Yang, has raised $55 million in early funding to develop next-generation AI systems with advanced visual reasoning capabilities. While current large models excel in text-based tasks like programming and math, they perform poorly in visual reasoning—even top models like Gemini only match a 3-year-old’s ability in basic visual benchmarks. The key limitation lies in the architecture of current vision-language models (VLMs), which first convert visual inputs into text before reasoning, losing critical spatial and structural information. ElorianAI aims to build a native multimodal model that processes and reasons directly in visual space, enabling deeper understanding of physical relationships, constraints, and environments. The company plans to release a state-of-the-art visual reasoning model by 2026, with potential applications in robotics, disaster management, engineering, healthcare, and AI hardware. By using high-quality, diverse, and synthetically generated data, ElorianAI intends to create models that don’t just perceive but truly understand and reason about the physical world—bringing us closer to visual AGI.

By Alpha Community

AI large models have surpassed average humans in certain areas, such as programming and mathematics. Reports indicate that Anthropic has almost achieved 100% AI programming internally, and Google's Gemini Deep Think solved 5 out of 6 problems in IMO 2025, reaching gold medal level.

However, in visual reasoning, even the leading Gemini 3 Pro only reached the level of a 3-year-old child on BabyVision, a benchmark testing basic visual reasoning abilities.

Why are large models strong in programming and mathematics but weak in visual reasoning? This is due to limitations in their "thinking process." Visual Language Models (VLMs) need to first convert visual input into language and then perform text-based reasoning. However, many visual tasks cannot be accurately described in words, resulting in poor visual reasoning capabilities of the models.

Andrew Dai, who worked at Google DeepMind for 14 years, teamed up with Apple's seasoned AI expert Yinfei Yang to establish a company called Elorian AI. Their goal is to elevate the model's visual reasoning ability from "child level" to "adult level," enabling the model to natively "think" within the "visual space" and thereby advance toward AGI in the physical world.

Elorian AI raised $55 million in early-stage funding co-led by Striker Venture Partners, Menlo Ventures, and Altimeter, with participation from 49 Palms and top AI scientists including Jeff Dean.

Pioneers in Multimodal Models Aim to Equip Visual Models with Reasoning Abilities

Andrew Dai, who is of Chinese descent, holds a bachelor's degree in computer science from Cambridge and a PhD in machine learning from Edinburgh. He interned at Google during his PhD and joined the company in 2012, staying for 14 years until starting his own business.


Image Source: Andrew Dai's LinkedIn

Shortly after joining Google, he co-authored the first paper on language model pre-training and supervised fine-tuning, "Semi-supervised Sequence Learning," with Quoc V. Le. This paper laid the foundation for the birth of GPT. Another foundational paper of his is "Glam: Efficient scaling of language models with mixture-of-experts," which paved the way for the now mainstream MoE architecture.

Image Source: Google

During his time at Google, he was deeply involved in almost all large model trainings, from Palm to Gemini 1.5 and Gemini 2.5. Under Jeff Dean's arrangement, he began leading the data division of Gemini (including synthetic data) in 2023, and the team later expanded to hundreds of people.

Image Source: Yinfei Yang's LinkedIn

Co-founding Elorian AI with Andrew Dai is Yinfei Yang, who worked at Google Research for four years, focusing on multimodal representation learning, before joining Apple to lead multimodal model R&D.

Image Source: arxiv

His representative research, "Scaling up visual and vision-language representation learning with noisy text supervision," advanced the development of multimodal representation learning.

Elorian AI's co-founders also include Seth Neel, who was an Assistant Professor at Harvard University and is an expert in data and AI.

Why discuss the groundbreaking papers written by Elorian AI's co-founders? Because their goal is not just engineering optimization but a paradigm shift at the foundational architecture level, upgrading AI from text-based intelligent understanding to vision-based intelligent understanding.

The current state of AI models is that, despite excelling in text-based tasks, even the most advanced frontier multimodal large models still stumble on the most basic visual grounding tasks.

For example, how to fit a part precisely into a mechanical device to make it run more accurately and efficiently? Such spatial physical tasks are simple for elementary school students but challenging for existing multimodal large models.

This brings us back to biology for clues. In the human brain, vision is the underlying substrate supporting many thinking processes. Humans' ability to use visual and spatial reasoning is far more ancient than language-based logical reasoning.

For instance, teaching someone to navigate a maze using language can be confusing, but drawing a sketch makes it instantly understandable.

Even a bird, without language, can recognize and reason about geographical features through vision to achieve global long-distance migration. This is a strong signal that vision is likely the correct direction for truly advancing machine reasoning.

So, imagine if, from the very beginning of model construction, this biological visual instinct is encoded into AI's genes, building a native multimodal model that "simultaneously understands and processes text, images, video, and audio," enabling the model to possess visual understanding capabilities. Andrew Dai and his team aim to build an innate "synesthete," teaching machines not only to "see" the world but also to "understand" it.

To Andrew Dai and his team, a deep understanding of the real "physical world" is the key to achieving the next leap in machine intelligence and ultimately reaching "Visual AGI."

VLMs with Post-Reasoning Are Not the Right Path to Visual Reasoning

There have been teams attempting this before. In fact, Andrew Dai's previous Gemini team was already among the global leaders in the multimodal field. However, traditional multimodal models are still primarily VLMs (Visual Language Models), built on a "two-step" logic: first converting visual input into language, then performing text-based reasoning (sometimes assisted by external tools).

However, post-reasoning inherently has limitations. On one hand, it is prone to model hallucinations; on the other, many visual tasks cannot be precisely described in words.

Additionally, visual generation models like NanoBanana excel in multimodal generation, but generation ability does not equal reasoning ability. The "thinking" before generation still relies on language models, not native reasoning capability.

To develop models that truly understand the spatial, structural, and relational complexities of the visual world, disruptive innovation at the underlying technology level is necessary.

So, how to innovate? Elorian AI's founders, with years of experience in the multimodal field, approach this by deeply integrating multimodal training with a new architecture specifically designed for multimodal reasoning. They abandon the traditional approach of treating images as static input, instead training models to directly interact with and manipulate visual representations to autonomously parse their structure, relationships, and physical constraints.

Of course, another core element is data, which is crucial to the performance and success of these models.

Andrew Dai stated that they place great importance on data quality, data mix ratios, data sources, and data diversity. They have innovated at the data layer, reconstructing the reasoning chain in visual space, and are extensively and deeply using synthetic data.

Combined, these efforts will give rise to new AI systems that move beyond simple visual "perception" to high-level visual "reasoning."

This AI system could be a visual reasoning foundation model: building a highly general but exceptionally proficient model in a specific capability set—visual reasoning.

As a general foundation model, its application areas should be broad.

First, in the robotics field, it could become the underlying neural center of powerful systems,赋予ing them the ability to operate autonomously in various unfamiliar environments.

For example, sending a robot to handle a sudden safety fault in a hazardous environment requires the robot to make quick and accurate instant decisions. If the robot lacks a foundation model with deep reasoning capabilities, people wouldn't dare let it randomly press buttons or operate levers. But if it has strong reasoning能力, it might think: "Before operating this panel, maybe I should pull this lever first to activate the safety mechanism."

Furthermore, in disaster management, models with visual reasoning could analyze satellite images to monitor and prevent forest fires. In engineering, they could accurately understand complex visual blueprints and system diagrams. The significance of this ability lies in the fact that the operating principles of the physical world are fundamentally different from the pure code world. You can't design an airplane wing just by typing a few lines of pure code.

However, Elorian AI's models and capabilities are currently still on paper. They plan to release a model in 2026 that achieves SOTA level in visual reasoning. At that time, we can verify if their results match their claims.

When AI Truly Possesses "Visual Reasoning" Ability, How Will It Change the Physical World?

To enable AI to understand and influence the real physical world, technology has iterated several times.

From image recognition in the traditional CV era, to image generation models/multimodal models in generative AI, to world models, the understanding of the physical world has been continuously enhanced.

Visual reasoning foundation models could take it a step further. Because achieving visual reasoning allows AI to understand the physical world more deeply, thereby achieving a higher level of machine intelligence.

Imagine, when models with deep understanding and fine operation empower the embodied intelligence industry and the AI hardware industry, it will greatly expand their application scope. For example, robots could perform more reliable industrial production or work in medical care; AI hardware, especially wearable devices, could become smarter personal assistants.

However, underlying these technologies is still data. As Andrew Dai mentioned earlier, data quality, data mix ratios, data sources, and data diversity all determine model performance.

In the physical AI field, Chinese companies, whether at the model level or the data level, are closer to world leadership compared to text large models. If they can leverage their advantages of richer data and application scenarios to accelerate iteration speed, then whether in embodied intelligence or AI hardware, whether applied in industry, healthcare, or homes, there is a greater opportunity to reach leading levels and potentially produce world-class enterprises.

Criptos en tendencia

Preguntas relacionadas

QWhat is the main goal of current Vision Language Models (VLMs) according to the article, and what are their limitations?

AThe main goal of VLMs is to process visual input by first converting it into language and then performing text-based reasoning. Their limitation is that many visual tasks cannot be accurately described with text, leading to poor visual reasoning capabilities.

QWho are the founders of Elorian AI and what are their backgrounds?

AThe founders are Andrew Dai, a former Google DeepMind researcher with 14 years of experience, and Yinfei Yang, an AI expert who worked at Google Research and Apple. Andrew Dai contributed to foundational papers in language model pre-training and MoE architecture, while Yinfei Yang focused on multimodal representation learning.

QHow does Elorian AI plan to improve AI's visual reasoning capabilities?

AElorian AI aims to develop a native multimodal model that processes text, images, video, and audio simultaneously. They focus on integrating multimodal training with new architectures designed for visual reasoning, directly interacting with visual representations to parse structures and physical constraints, and using high-quality, diverse synthetic data.

QWhat potential applications are mentioned for AI with advanced visual reasoning skills?

AApplications include robotics for autonomous operations in unfamiliar environments, disaster management through satellite image analysis, engineering by interpreting complex visual diagrams, and enhancing AI hardware like wearable devices for personal assistance.

QWhen does Elorian AI plan to release their model, and what is the expected achievement?

AElorian AI plans to release a model in 2026 that achieves state-of-the-art (SOTA) performance in visual reasoning, aiming to elevate capabilities from 'child-level' to 'adult-level'.

Lecturas Relacionadas

PA Gráfico Explicado | Entiende los Eventos Clave de Web3 en Agosto de 2026 con una Imagen

PA图说: Un resumen de los grandes acontecimientos de Web3 en agosto de 2026 Agosto de 2026 estará repleto de acontecimientos macroeconómicos, avances regulatorios, desbloqueos de tokens y ajustes en proyectos, que definirán las principales tendencias del mercado. 📌 **Macroeconomía y Política:** Se publicarán datos clave como el IPC y el empleo no agrícola de EE.UU. Tendrán lugar la reunión de la FED y el simposio anual de Jackson Hole. En el ámbito regulatorio, el Senado de EE.UU. presentará un nuevo borrador de la *Ley CLARITY*, mientras que la UE ampliará oficialmente la prohibición de criptoactivos a Bielorrusia. 🪙 **Desbloqueo de Tokens:** Habrá desbloqueos concentrados de tokens como ENA, AVAX, CONX, ZRO y KAITO, lo que podría generar volatilidad en el mercado. ⚠️ **Ajustes en Proyectos:** Varios proyectos o servicios, como Exchange Art, Ctrl Wallet, Zapper, NFTfi y Summer.fi, cesarán sus operaciones o realizarán ajustes. Se recomienda a los usuarios gestionar sus activos a tiempo. 💼 **Finanzas Corporativas:** Empresas como SpaceX, Circle y Nvidia publicarán sus resultados del segundo trimestre. La compañía de robótica Yushu Technology iniciará la suscripción para su OPV en la bolsa STAR, y Moonshot AI planea una ronda de financiación Pre-IPO. 🌐 **Eventos:** Se celebrarán conferencias destacadas como Bitcoin Asia 2026 y la Feria Internacional de Big Data 2026. En resumen, las principales líneas del mercado en agosto girarán en torno a las expectativas macroeconómicas, la implementación regulatoria, los desbloqueos de tokens y la reestructuración de la industria.

marsbitHace 36 min(s)

PA Gráfico Explicado | Entiende los Eventos Clave de Web3 en Agosto de 2026 con una Imagen

marsbitHace 36 min(s)

El 'Aguafiestas' más famoso de Wall Street vuelve a apuntar a Nvidia

Un informe reciente reveló que Michael Burry, el famoso gestor de fondos conocido por predecir la crisis de las hipotecas subprime y retratado en "The Big Short", ha tomado posiciones cortas en varias empresas tecnológicas, destacando su apuesta contra Nvidia. Según sus declaraciones en Substack, Burry cuestiona la sostenibilidad del auge de la IA, señalando dos problemas principales: una posible "financiación circular fuera de balance" y una "sobreestimación de la vida útil de depreciación" de los chips de IA por parte de los clientes de Nvidia, como Microsoft, Google y Meta. Esto, argumenta, podría inflar artificialmente la rentabilidad reportada en toda la cadena de suministro. La reacción del mercado fue mixta. Tras los anuncios de Burry, el precio de las acciones de Nvidia experimentó volatilidad, cayendo cerca de un 5% en un día después de un informe sobre posibles avales financieros a clientes, antes de estabilizarse alrededor de los 200 dólares. Las posiciones cortas de Burry, abiertas a 198,09 dólares y aumentadas a 210,28 dólares, mostraban ligeras pérdidas flotantes a finales de julio. El artículo analiza el historial de Burry después de su éxito en 2008, señalando aciertos en crisis estructurales (como la pandemia de 2020) pero también notables errores de tiempo, como sus apuestas fallidas contra Tesla y Palantir en el pasado. Su metodología, basada en el análisis minucioso del flujo de caja libre y los documentos financieros originales, es efectiva para identificar riesgos subyacentes pero no para predecir su momento de materialización. La posición de Burry no es unánime. Otros inversores destacados, como Steve Eisman (otro protagonista de "The Big Short"), se muestran cautelosos pero no apuestan directamente contra Nvidia, citando su fuerte crecimiento de ingresos. Jim Chanos coincide en la preocupación por las prácticas contables, pero enfoca sus ventas en corto hacia empresas de capital privado con alta exposición inmobiliaria, no contra los fabricantes de chips. El artículo concluye que, más allá de si Burry acertará esta vez, el verdadero valor para los inversores reside en el tipo de preguntas críticas que plantea: cómo se pueden maquillar las cifras contables, qué riesgos estructurales se pasan por alto y qué investigar cuando todo el mundo asume que "esta vez es diferente". Replicar sus apuestas específicas es menos relevante que adoptar un enfoque escéptico y fundamentado.

marsbitHace 59 min(s)

El 'Aguafiestas' más famoso de Wall Street vuelve a apuntar a Nvidia

marsbitHace 59 min(s)

Selección Semanal: Terremoto épico en la bolsa, la salida a bolsa de Changxin Technology redefine el panorama del almacenamiento, Saylor apunta a reanclar STRC alrededor del 8 de septiembre

**Resumen del artículo:** PANews presenta una selección semanal de contenido destacado. La IA impulsa nuevos campos de batalla en cripto, como las carteras para agentes de IA, con gigantes como Coinbase posicionándose. La volatilidad extrema sacude los mercados: la bolsa coreana sufre múltiples suspensiones, arrastrada por acciones como SK Hynix, mientras que el mercado de cripto muestra cierta calma en comparación. En macro, destaca la salida a bolsa de ChangXin Technology, alcanzando una capitalización de 3.35 billones tras una década de pérdidas y un trimestre extraordinario. Citi advierte sobre riesgos extremos en materias primas para 2026. La Fed mantiene tasas, pero revela una rara división interna con un sesgo "halcón". Figuras como Tom Lee ven la caída de acciones de IA como una liquidación de apalancamiento, no el fin de la burbuja. Raoul Pal insta a mantener la perspectiva a largo plazo en cripto. La escasez de canales de inversión para minoristas chinos impulsa la búsqueda de alternativas como activos tokenizados. Se exploran oportunidades en protocolos como Fake World Assets (FWA), que combina NFT y loterías, y en mecanismos como las "tarifas prioritarias" de Hyperliquid. El sector RWA crece, pero enfrenta problemas de utilización. En Web3, Ethereum proyecta mejoras masivas para 2030. Lido ejecuta una migración histórica de staking. La "guerra de las stablecoins" se intensifica con nuevos retadores como OUSD frente a USDC. **Información clave:** Alzas en índices bursátiles y acciones de mineros de Bitcoin que se转型 (transicionan) hacia IA. Michael Saylor apunta a realinear STRC alrededor del 8 de septiembre. Empresas cotizadas en EE.UU. poseen el 92.7% de las tenencias corporativas globales de BTC. Financiaciones significativas en startups de IA.

marsbitHace 1 hora(s)

Selección Semanal: Terremoto épico en la bolsa, la salida a bolsa de Changxin Technology redefine el panorama del almacenamiento, Saylor apunta a reanclar STRC alrededor del 8 de septiembre

marsbitHace 1 hora(s)

Cuando el mercado empieza a cuestionar el gasto de capital en IA: análisis completo de los resultados del Q2 de las cinco grandes tecnológicas

A finales de julio de 2026, los gigantes tecnológicos Alphabet (Google), Intel, Microsoft, Meta y Apple presentaron sus resultados del segundo trimestre. La narrativa común fue un fuerte crecimiento en los ingresos y ganancias, impulsado por la demanda de IA, pero una creciente inquietud del mercado sobre los masivos gastos de capital (CapEx) en infraestructura de IA y el momento en que se materializarán los retornos. **Google y Meta** experimentaron fuertes caídas en sus acciones (Google -7%, Meta casi -10%) después de informar aumentos significativos en su guía de gastos de capital para 2026 y un flujo de caja libre que se volvió negativo o casi desapareció. Los inversores castigaron la presión sobre la generación de efectivo a corto plazo. **Intel** mostró su crecimiento de ingresos más fuerte en 15 años, pero sus acciones tuvieron una volatilidad extrema ("montaña rusa") después de que también elevó su perspectiva de gastos de capital, lo que generó preocupaciones sobre la deuda y el flujo de caja libre. En contraste, **Microsoft** fue el claro favorito del mercado. Sus acciones registraron su mejor día en 18 años después de superar las expectativas, alcanzar los $100 mil millones en ingresos anualizados con Azure y, crucialmente, *reducir* su guía de gastos de capital para 2026 prometiendo un flujo de caja libre positivo, lo que calmó los temores de los inversores. **Apple**, a pesar de reportar récords de ingresos y ganancias, vio su valor evaporarse en $300 mil millones en un día debido a una guía de ingresos para el próximo trimestre inferior a lo esperado, citando limitaciones en la cadena de suministro y presión cambiaria. En resumen, los resultados confirmaron la sólida demanda de IA, pero marcaron un punto de inflexión: el mercado ya no premia solo el crecimiento, sino que exige claridad sobre el camino y el ritmo hacia la rentabilidad y el retorno del flujo de caja libre de estas enormes inversiones.

Odaily星球日报Hace 1 hora(s)

Cuando el mercado empieza a cuestionar el gasto de capital en IA: análisis completo de los resultados del Q2 de las cinco grandes tecnológicas

Odaily星球日报Hace 1 hora(s)

Trading

Spot

Artículos destacados

Cómo comprar AR

¡Bienvenido a HTX.com! Hemos hecho que comprar Arweave (AR) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar Arweave (AR) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu Arweave (AR)Después de comprar tu Arweave (AR), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear Arweave (AR)Tradear fácilmente con Arweave (AR) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

717 Vistas totalesPublicado en 2024.12.11Actualizado en 2026.06.02

Cómo comprar AR

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de AR (AR).

活动图片