Explorando la AGI del mundo físico con "razonamiento visual": ElorianAI recauda 55 millones de dólares

marsbitXuất bản vào 2026-04-23Cập nhật gần nhất vào 2026-04-23

Tóm tắt

Aloritmo de Inteligencia Artificial ElorianAI recauda 55 millones de dólares para desarrollar modelos de razonamiento visual avanzado. Fundada por exinvestigadores de Google y Apple, la startup busca superar las limitaciones de los modelos multimodales actuales, que convierten inputs visuales en texto antes de procesarlos, lo que dificulta tareas de razonamiento espacial y físico. El equipo, liderado por Andrew Dai y Yinfei Yang, propone un nuevo paradigma arquitectónico que permite a la IA "pensar" nativamente en espacio visual, sin depender de intermediarios lingüísticos. Su objetivo es alcanzar un nivel de razonamiento visual adulto (frente al actual nivel infantil de modelos como Gemini) y avanzar hacia una AGI capaz de interactuar con el mundo físico. Las aplicaciones potenciales incluyen robótica autónoma en entornos complejos, gestión de desastres mediante análisis de imágenes satelitales o interpretación de planos de ingeniería. ElorianAI planea lanzar su primer modelo de referencia en 2026.

Por | Alpha Comunidad

La capacidad de los grandes modelos de IA ya supera a la de los humanos promedio en ciertos aspectos, como la programación y las matemáticas. Según informes, Anthropic ha logrado casi un 100% de programación con IA internamente, y Gemini Deep Think de Google resolvió 5 de los 6 problemas de la IMO 2025, alcanzando un nivel de medalla de oro.

Sin embargo, en cuanto al razonamiento visual, incluso el avanzado Gemini 3 Pro solo alcanzó el nivel de un niño de 3 años en BabyVision, un benchmark que evalúa capacidades básicas de razonamiento visual.

¿Por qué los grandes modelos son fuertes en programación y matemáticas, pero débiles en razonamiento visual? Esto se debe a las limitaciones en su "forma de pensar". Los modelos de lenguaje visual (VLM) necesitan convertir primero la entrada visual en lenguaje y luego realizar un razonamiento basado en texto. Pero muchas tareas visuales simplemente no pueden describirse con precisión mediante palabras, lo que resulta en una pobre capacidad de razonamiento visual del modelo.

Andrew Dai, quien trabajó 14 años en Google DeepMind, se unió al experto en IA de Apple, Yinfei Yang, para fundar una empresa llamada Elorian AI. Su objetivo es elevar la capacidad de razonamiento visual del modelo de "nivel infantil" a "nivel adulto", dotándolo de la capacidad de pensar de forma nativa en el "espacio visual" y así impulsar hacia la AGI del mundo físico.

Elorian AI ha recaudado 55 millones de dólares en una ronda inicial de financiación copilotada por Striker Venture Partners, Menlo Ventures y Altimeter, con la participación de 49 Palms y destacados científicos de IA, incluido Jeff Dean.

Pioneros en modelos multimodales buscan dotar de capacidad de razonamiento a los modelos visuales

Andrew Dai, de origen chino, es licenciado en Informática por Cambridge y doctor en Aprendizaje Automático por Edimburgo. Realizó prácticas en Google durante su doctorado y se unió a la empresa en 2012, permaneciendo allí durante 14 años hasta emprender.


Fuente de la imagen:Linkedin de Andrew Dai

Poco después de unirse a Google, coescribió con Quoc V. Le el primer artículo sobre el preentrenamiento de modelos de lenguaje y el ajuste fino supervisado, "Semi-supervised Sequence Learning". Este artículo sentó las bases para el nacimiento de GPT. Otro artículo fundamental suyo es "Glam: Efficient scaling of language models with mixture-of-experts", que abrió el camino a la arquitectura MoE, ahora predominante.

Fuente de la imagen: Google

Durante su tiempo en Google, participó profundamente en casi todos los entrenamientos de grandes modelos, desde Palm hasta Gemini 1.5 y Gemini 2.5. Bajo la dirección de Jeff Dean, en 2023 comenzó a liderar el área de datos de Gemini (incluidos los datos sintéticos), equipo que luego creció hasta contar con cientos de personas.

Fuente de la imagen:Linkedin de Yinfei Yang

El cofundador de Elorian AI es Yinfei Yang, quien trabajó durante cuatro años en Google Research, centrándose en el aprendizaje de representaciones multimodales, y luego se unió a Apple, donde dirigió la investigación y desarrollo de modelos multimodales.

Fuente de la imagen:arxiv

Su investigación representativa, "Scaling up visual and vision-language representation learning with noisy text supervision", impulsó el desarrollo del aprendizaje de representaciones multimodales.

El otro cofundador de Elorian AI es Seth Neel, ex profesor asistente (AP) en la Universidad de Harvard y también experto en datos e IA.

¿Por qué es relevante mencionar qué artículos pioneros escribieron los cofundadores de Elorian AI? Porque lo que pretenden hacer no es una optimización a nivel de ingeniería, sino una actualización de paradigma desde la arquitectura subyacente: hacer que la IA evolucione de una comprensión inteligente basada en texto a una basada en lo visual.

La situación actual de los modelos de IA es que, aunque son excelentes en tareas basadas en texto, incluso los modelos multimodales más avanzados tropiezan en las tareas más básicas de grounding visual.

Por ejemplo, ¿cómo encajar una pieza perfectamente en un dispositivo mecánico para que funcione con mayor precisión y eficiencia? Este tipo de tareas espaciales y físicas son simples para un niño de primaria, pero muy difíciles para los modelos multimodales actuales.

La clave sigue estando en la biología. En el cerebro humano, la visión es el sustrato subyacente que sustenta muchos procesos de pensamiento. La capacidad humana para utilizar la visión y el razonamiento espacial es mucho más antigua que el razonamiento lógico-lingüístico.

Por ejemplo, enseñar a alguien a recorrer un laberinto con descripciones verbales puede resultar confuso, pero con un simple dibujo se entiende al instante.

Incluso un pájaro, aunque carece de lenguaje, puede reconocer y razonar sobre características geográficas through la visión para realizar migraciones globales de larga distancia. Esta es una señal poderosa de que la visión es probablemente la dirección correcta para avanzar verdaderamente en la capacidad de razonamiento de las máquinas.

Imaginemos entonces que, si desde el inicio de la construcción del modelo se intenta incorporar este instinto visual biológico en el ADN de la IA, construyendo un modelo multimodal nativo capaz de "comprender y procesar simultáneamente texto, imágenes, video y audio", se podrá dotar al modelo de capacidad de comprensión visual. Andrew Dai y su equipo quieren construir un "sinestésico" innato, enseñando a la máquina no solo a "ver" el mundo, sino a "entenderlo".

Para Andrew Dai y su equipo, la comprensión profunda del "mundo físico" real es la clave para lograr el próximo salto en la inteligencia de las máquinas y alcanzar finalmente la "IA General Visual (Visual AGI)".

Los VLM con razonamiento posterior no son el camino correcto hacia el razonamiento visual

No es que no haya habido equipos que quisieran hacer esto antes. De hecho, el equipo de Gemini en el que estaba Andrew Dai ya era uno de los más avanzados del mundo en multimodalidad. Pero los modelos multimodales tradicionales siguen siendo principalmente VLM (Modelos de Lenguaje Visual), cuya lógica se basa en un enfoque de "dos pasos": primero convertir la entrada visual en lenguaje y luego realizar un razonamiento basado en texto (a veces auxiliándose de herramientas externas).

Sin embargo, el razonamiento posterior tiene limitaciones inherentes: por un lado, es propenso a generar alucinaciones en el modelo, y por otro, muchas tareas visuales simplemente no se pueden describir con precisión mediante texto.

Además, los modelos de generación visual como NanoBanana son excelentes en generación multimodal, pero la capacidad de generación no equivale a la capacidad de razonamiento. Su "pensamiento" previo a la generación depende esencialmente de modelos de lenguaje, no de una capacidad de razonamiento nativa.

Para desarrollar modelos que realmente puedan discernir las complejidades espaciales, estructurales y relacionales del mundo visual, es imperativo realizar innovaciones disruptivas en la tecnología subyacente.

Entonces, ¿cómo innovar? Los fundadores de Elorian AI, con años de experiencia en el campo multimodal, proponen: fusionar profundamente el entrenamiento multimodal con una nueva arquitectura diseñada específicamente para el razonamiento multimodal. Abandonan el enfoque tradicional de tratar las imágenes como entradas estáticas y en su lugar entrenan al modelo para que interactúe y opere directamente con las representaciones visuales, analizando de forma autónoma su estructura, relaciones y restricciones físicas.

Por supuesto, otro elemento central son los datos, cruciales para el rendimiento y el éxito de estos modelos.

Andrew Dai señaló que dan mucha importancia a la calidad de los datos, la proporción de la mezcla de datos, la fuente de los datos y su diversidad, y que han innovado a nivel de la capa de datos, reconstruyendo la cadena de razonamiento en el espacio visual y utilizando datos sintéticos de forma masiva y profunda.

Estos esfuerzos combinados darán lugar a nuevos sistemas de IA que transiten de la simple "percepción" visual a un "razonamiento" visual de alto nivel.

Este sistema de IA podría ser un modelo base de razonamiento visual: es decir, construir un modelo altamente general pero extremadamente competente en un conjunto específico de capacidades, que es el razonamiento visual.

Al ser un modelo base general, su campo de aplicación debería ser amplio.

En primer lugar, en el campo de la robótica, podría convertirse en el sistema nervioso central subyacente de potentes sistemas, dotándolos de capacidad para operar autónomamente en diversos entornos desconocidos.

Por ejemplo, enviar un robot a manejar una falla de seguridad repentina en un entorno peligroso. Esto requiere que el robot tome decisiones instantáneas rápidas y precisas. Si el robot carece de un modelo base con capacidad de razonamiento profundo, no nos atreveríamos a dejar que presione botones o opere palancas a ciegas. Pero si tuviera una capacidad de razonamiento extremadamente fuerte, podría pensar: "Antes de operar este panel, quizás debería jalar primero esta palanca para activar el mecanismo de seguridad".

Además, en la gestión de desastres, un modelo con razonamiento visual podría analizar imágenes satelitales para monitorear y prevenir incendios forestales; en ingeniería, podría comprender con precisión planos visuales complejos y diagramas de sistemas. La importancia de esta capacidad radica en que las reglas de funcionamiento del mundo físico son fundamentalmente diferentes a las del mundo del código puro; no se puede diseñar el ala de un avión simplemente escribiendo unas líneas de código.

Sin embargo, por ahora, el modelo y las capacidades de Elorian AI permanecen solo sobre el papel. Planean lanzar en 2026 un modelo que alcance un nivel SOTA (state-of-the-art) en el campo del razonamiento visual. Entonces podremos comprobar si sus resultados se ajustan a lo anunciado.

Cuando la IA tenga realmente capacidad de "razonamiento visual", ¿cómo cambiará el mundo físico?

Para que la IA comprenda e influya en el mundo físico real, la tecnología ha iterado varias veces.

Desde el reconocimiento de imágenes en la era de la CV tradicional, pasando por los modelos de generación de imágenes/modelos multimodales de la IA generativa, hasta los modelos mundiales (world models), la comprensión del mundo físico no ha dejado de mejorar.

Y es muy probable que los modelos base de razonamiento visual vayan un paso más allá, porque al poder realizar un razonamiento visual, la IA podrá comprender el mundo físico más profundamente, logrando así un nivel superior de inteligencia artificial.

Imaginen que, cuando modelos con una comprensión profunda y una operación precisa alimenten la industria de la inteligencia embodada (embodied AI) y la de hardware de IA, se expandirá enormemente su rango de aplicaciones. Por ejemplo, los robots podrán realizar tareas de producción industrial o de cuidado médico más confiables; el hardware de IA, especialmente los dispositivos wearables, se convertirán en asistentes personales más inteligentes.

No obstante, en la base de estas tecnologías siguen estando los datos. Como mencionó anteriormente Andrew Dai, la calidad de los datos, la proporción de la mezcla, la fuente y la diversidad determinan el rendimiento del modelo.

En el campo de la IA física, las empresas chinas, tanto a nivel de modelos como de datos, están más cerca del liderazgo mundial en comparación con los grandes modelos de texto. Si pueden aprovechar la ventaja de contar con datos y escenarios de aplicación más abundantes para acelerar la velocidad de iteración, entonces, ya sea en inteligencia embodada o hardware de IA, ya sea aplicada en industria, medicina o hogares, tendrán una mayor oportunidad de alcanzar un nivel líder y, por supuesto, de dar lugar a empresas de clase mundial.

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

Q¿Qué es Elorian AI y cuál es su objetivo principal?

AElorian AI es una empresa fundada por Andrew Dai y Yinfei Yang que busca mejorar la capacidad de razonamiento visual de los modelos de IA, elevándola de un nivel 'infantil' a uno 'adulto', y desarrollar modelos que puedan 'pensar' de forma nativa en el espacio visual para avanzar hacia una IA general (AGI) en el mundo físico.

Q¿Por qué los modelos multimodales actuales tienen dificultades con el razonamiento visual?

APorque utilizan un enfoque de dos pasos: primero convierten la entrada visual en lenguaje y luego realizan el razonamiento basado en texto. Muchas tareas visuales no pueden describirse con precisión con palabras, lo que limita su capacidad de razonamiento visual.

Q¿Quiénes son los fundadores de Elorian AI y qué experiencia previa tienen?

ALos fundadores son Andrew Dai, exinvestigador de Google DeepMind durante 14 años y experto en modelos de lenguaje, y Yinfei Yang, exinvestigador de Google y Apple especializado en aprendizaje de representaciones multimodales. También incluye a Seth Neel, ex profesor asistente de Harvard y experto en datos e IA.

Q¿Cómo planea Elorian AI abordar las limitaciones actuales del razonamiento visual en IA?

APlanean fusionar el entrenamiento multimodal con una nueva arquitectura diseñada para el razonamiento multimodal, entrenando modelos para interactuar y manipular representaciones visuales directamente, y utilizando datos sintéticos a gran escala para reconstruir la cadena de razonamiento en el espacio visual.

Q¿Qué aplicaciones prácticas podría tener un modelo con capacidad avanzada de razonamiento visual?

APodría aplicarse en robótica para operar en entornos desconocidos, gestión de desastres mediante análisis de imágenes satelitales, ingeniería para interpretar planos visuales complejos, y en dispositivos portátiles de IA para asistentes personales más inteligentes.

Nội dung Liên quan

Lãnh đạo HIVE: GPU phục vụ AI mang lại doanh thu cao gấp 10 lần mỗi giờ so với các trang trại khai thác tiền điện tử

Lãnh đạo HIVE: GPU cho AI mang lại doanh thu gấp 10 lần mỗi giờ so với trang trại khai thác tiền điện tử Trong một cuộc thảo luận gần đây, Chủ tịch HIVE Frank Holmes đã tiết lộ sự chênh lệch lớn về khả năng sinh lời giữa việc cung cấp sức mạnh tính toán cho trí tuệ nhân tạo (AI) và khai thác Bitcoin. Một cụm 504 GPU Nvidia B200 của HIVE trong cơ sở hạ tầng AI của Bell Canada ở Manitoba tạo ra khoảng 2,90 đô la mỗi giờ trên mỗi GPU. Trong khi đó, các giàn khai thác Bitcoin của công ty chỉ tạo ra khoảng 0,12 đô la mỗi giờ – chênh lệch hơn 20 lần. Đây là cốt lõi trong chiến lược của HIVE: đầu tư phần lớn vào kinh doanh AI có lợi nhuận cao hơn, đồng thời vẫn duy trì hoạt động khai thác Bitcoin đáng kể. Năm tài chính 2026, HIVE đạt tốc độ băm trung bình 22,2 EH/s, chiếm khoảng 3% tổng tốc độ băm mạng Bitcoin và khai thác được 2.885 BTC. Doanh thu tổng thể của HIVE năm 2026 đạt 297,8 triệu đô la, tăng 158%. Bộ phận AI và điện toán hiệu suất cao (HPC) mới, BUZZ HPC, đóng góp 19,5 triệu đô la. HIVE đã chuyển hướng sang AI từ sớm, với khoản đầu tư 70 triệu đô la vào chip Nvidia cách đây ba năm, giúp họ có lợi thế khi cơn sốt AI bùng nổ. Công ty đã nhận được đánh giá "Mua" đầu tiên từ một nhà phân tích, ký thỏa thuận cung cấp điện toán đám mây GPU trị giá khoảng 220 triệu đô la với Bell và startup AI Cohere, cũng như huy động 75 triệu đô la thông qua phát hành trái phiếu. Dự án đầy tham vọng nhất của HIVE là một trung tâm dữ liệu AI công suất 320 MW đang được xây dựng ở Vùng Toronto, dự kiến chứa hơn 100.000 GPU. Khi hoạt động đầy đủ vào nửa cuối năm 2027, cơ sở này dự kiến tạo ra khoảng 360 triệu đô la doanh thu định kỳ hàng năm. HIVE không đơn độc trong xu hướng này. Các công ty khai thác đối thủ như MARA, Hut 8 và Terawulf cũng đang chuyển hướng nguồn lực năng lượng hạn chế sang các hợp đồng AI/HPC sinh lời hơn, trước bối cảnh biên lợi nhuận khai thác Bitcoin giảm và giá mỗi hash giảm. Mục tiêu trước mắt của HIVE là tăng gấp mười lần doanh thu hàng năm từ AI/HPC vào cuối năm tài chính, phụ thuộc vào việc đưa vào vận hành đúng hạn trung tâm dữ liệu Toronto và các hợp đồng dịch vụ đám mây GPU tiếp theo.

cryptonews.ru50 phút trước

Lãnh đạo HIVE: GPU phục vụ AI mang lại doanh thu cao gấp 10 lần mỗi giờ so với các trang trại khai thác tiền điện tử

cryptonews.ru50 phút trước

“Mỗi ngày không có luật lệ là một mất mát về vốn”: Grayscale gửi kiến nghị đến Thượng viện liên quan đến Đạo luật CLARITY

Công ty Grayscale Investments, nền tảng đầu tư tài sản kỹ thuật số lớn nhất thế giới, đã kêu gọi lãnh đạo Thượng viện Mỹ đưa dự luật CLARITY ra bỏ phiếu trước kỳ nghỉ tháng 8 của Quốc hội. Trong thư ngỏ, Grayscale nhấn mạnh thị trường crypto Mỹ đã hoạt động nhiều năm mà không có khung pháp lý toàn diện, phải chịu sự "điều tiết thông qua hành vi cưỡng chế". Dự luật CLARITY được cho là sẽ thiết lập các quy tắc rõ ràng, phân định thẩm quyền giữa CFTC và SEC. Grayscale cảnh báo mỗi ngày không có sự rõ ràng về quy định là một ngày nhân tài, đổi mới và vốn chảy sang các khu vực pháp lý khác như Singapore hay Abu Dhabi. Công ty cho rằng việc thông qua dự luật sẽ thúc đẩy thị trường ETF, ETP crypto và các công cụ đầu tư có quy định khác tại Mỹ. Dự luật đã vượt qua Ủy ban Ngân hàng và các phiên điều trần, hiện chỉ chờ xem xét tại phiên họp toàn Thượng viện. Grayscale thúc giục bỏ phiếu trước kỳ nghỉ tháng 8. Tuy nhiên, dự luật vẫn gặp chỉ trích. Tổng chưởng lý New York Letitia James lo ngại nó có thể làm suy yếu khả năng chống lừa đảo crypto của các bang. Nhiều ngân hàng lớn cũng đề nghị cấm các cơ chế thưởng cho việc nắm giữ stablecoin, lo sợ rủi ro rút tiền gửi hàng loạt.

cryptonews.ru51 phút trước

“Mỗi ngày không có luật lệ là một mất mát về vốn”: Grayscale gửi kiến nghị đến Thượng viện liên quan đến Đạo luật CLARITY

cryptonews.ru51 phút trước

Grayscale nhận định rằng sự xuất hiện của 3.000 kho lưu trữ trực tuyến nắm giữ tài sản trị giá hơn 7 tỷ USD sẽ trở thành bước đột phá tiếp theo trong lĩnh vực tiền điện tử

Grayscale dự đoán rằng kho lưu trữ blockchain (vaults) sẽ là đột phá tiếp theo trong lĩnh vực tiền mã hóa, đi vào xu hướng chính thống. Các kho này gộp vốn của nhà đầu tư vào các chiến lược tạo lợi nhuận, được quản lý bởi các curator chuyên nghiệp, tương tự như CLO truyền thống nhưng vận hành trên blockchain. Điểm khác biệt lớn nằm ở cơ sở hạ tầng: thay vì dựa vào các trung gian, các kho blockchain sử dụng hợp đồng thông minh trên các mạng như Ethereum, Base và Solana để quản lý tài sản và xử lý giao dịch. Điều này mang lại tính minh bạch theo thời gian thực, có khả năng giảm chi phí và tăng tính thanh khoản. Thị trường hiện còn nhỏ, với hơn 3.000 kho nắm giữ tài sản trị giá khoảng 7 tỷ USD, chủ yếu tập trung vào các chiến lược stablecoin. Trong khi đó, thị trường CLO toàn cầu lên tới 1.500 tỷ USD. Trở ngại chính là môi trường pháp lý, đặc biệt tại Mỹ, nơi các quy định về chứng khoán có thể gây ra thách thức nếu các curator có quyền quyết định đáng kể. Sự chấp nhận của các nhà đầu tư tổ chức sẽ phụ thuộc vào việc ngành có thể kết hợp hiệu quả của hợp đồng thông minh với việc đáp ứng các tiêu chuẩn pháp lý và vận hành truyền thống hay không.

cryptonews.ru53 phút trước

Grayscale nhận định rằng sự xuất hiện của 3.000 kho lưu trữ trực tuyến nắm giữ tài sản trị giá hơn 7 tỷ USD sẽ trở thành bước đột phá tiếp theo trong lĩnh vực tiền điện tử

cryptonews.ru53 phút trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua AR

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua Arweave (AR) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua Arweave (AR) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ Arweave (AR) của BạnSau khi mua Arweave (AR), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch Arweave (AR)Giao dịch Arweave (AR) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 696Xuất bản vào 2024.12.11Cập nhật vào 2026.06.02

Làm thế nào để Mua AR

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của AR (AR) được trình bày dưới đây.

活动图片