Artículos Relacionados con Transformer

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Transformer", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

10.000 horas de datos humanos para entrenar el primer modelo de acción global implícita para la manipulación móvil de cuerpo completo del mundo

En los últimos dos años, la competencia en el campo de los robots humanoides se ha centrado cada vez más en las capacidades de los modelos, más allá del hardware. Para superar los desafíos de la escasez de datos costosos de demostración en robots reales, el ruido en la predicción visual pixelada y la falta de coordinación entre la movilidad y la manipulación, la empresa de inteligencia embebida Zhizai Wujie ha presentado **Being-M0.7**. Es el primer modelo de acción-mundo latente (Latent World-Action Model) a nivel mundial diseñado para la operación de manipulación móvil de cuerpo completo en robots humanoides. Entrenado previamente con más de **10,000 horas de datos multimodales centrados en el ser humano** y luego adaptado con una pequeña cantidad de datos de demostración en robots reales, el modelo utiliza una arquitectura **Mixture of Transformers (MoT)** que permite entrenar conjuntamente con datos emparejados (video-movimiento), solo video y solo movimiento, superando así la escasez de datos. Una representación de movimiento unificada y compacta (cabeza, manos, pies) cierra la brecha entre los datos de movimiento humano y el control del robot. Un **"experto en acción"** ligero traduce las predicciones del modelo a comandos de control específicos del robot, desacoplando la planificación de mundo de baja frecuencia del control de acciones de alta frecuencia. Being-M0.7 se ha validado en el robot humanoide Unitree G1 con varias tareas desafiantes: pescar un pez en una pecera (interacción con líquidos), recuperar un objeto usando un espejo (razonamiento espacial indirecto), transferir objetos entre cestas (tarea de larga duración) y transportar una caja esquivando obstáculos (navegación con carga y percepción obstruida). Estos demostraron su capacidad para generar y ajustar acciones coordinadas de cuerpo completo en tiempo real, basándose en la observación, la retroalimentación y la predicción de estados futuros en un espacio latente, en lugar de una costosa generación pixelada. Este enfoque, que sigue la línea validada previamente por el modelo de manipulación diestra **Being-H0.7**, prioriza que el modelo aprenda primero las dinámicas del mundo y el movimiento corporal a partir de vastos datos humanos, antes de adaptarse a un cuerpo robótico específico. Establece un paradigma de fusión multimodal escalable que podría ser clave para el avance hacia una inteligencia embebida más general, donde la comprensión del entorno y la predicción sean la base para una acción autónoma y competente en el mundo físico.

marsbit07/15 01:54

10.000 horas de datos humanos para entrenar el primer modelo de acción global implícita para la manipulación móvil de cuerpo completo del mundo

marsbit07/15 01:54

Transformando el Transformer: los LLM se vuelven más inteligentes con un simple cambio

Una nueva investigación de Mila, la Universidad de Cornell y la Universidad de Montreal propone un cambio radical en la arquitectura de los modelos de lenguaje grandes (LLM): la redistribución asimétrica de parámetros sin aumentar su número total. El estudio señala que la práctica estándar de asignar la misma capacidad (ancho de la red feed-forward) a cada capa del Transformer es ineficiente. Evidencias como el "early exiting" y estudios de interpretabilidad muestran que las capas iniciales procesan información fundamental (sintaxis), mientras que las posteriores a menudo refinan o repiten información. Los investigadores introdujeron los "Modelos de Lenguaje Cónicos" (Tapered Language Models), donde el ancho de la red disminuye progresivamente desde las capas iniciales hacia las finales, manteniendo constante el total de parámetros y operaciones (FLOPs). El mejor resultado se obtuvo con una disminución de tipo coseno, asignando un 50% más de capacidad al inicio y un 50% menos al final. En pruebas con un modelo de 440M de parámetros, esta simple redistribución redujo la perplejidad en 1.84 puntos (de 16.28 a 14.44), una mejora significativa sin costo computacional adicional. El hallazgo se validó en múltiples arquitecturas (Transformer estándar, Hope-attention, Titans) y escalas (hasta 1.3B de parámetros), mostrando mejoras consistentes en tareas de razonamiento y predicción lingüística. La explicación subyacente es que las capas profundas generan activaciones más similares a las entradas existentes, necesitando menos "capacidad de trabajo" nueva. Este trabajo sugiere que optimizar la *forma* de distribución de parámetros es una palanca de mejora infrautilizada y de costo casi cero, aplicable potencialmente a Transformers visuales y modelos multimodales.

marsbit06/29 12:57

Transformando el Transformer: los LLM se vuelven más inteligentes con un simple cambio

marsbit06/29 12:57

Los ocho padres del Transformer, ¿dónde están ahora?

Ocho investigadores de Google Brain revolucionaron la IA en 2017 con el artículo “Attention Is All You Need”, presentando la arquitectura Transformer. Nueve años después, los ocho autores originales han dejado Google, trazando caminos divergentes en la industria. Noam Shazeer, cofundador de Character.AI y clave en el mecanismo de atención, regresó brevemente a Google DeepMind antes de unirse recientemente a OpenAI. Ashish Vaswani, co-diseñador del modelo, fundó Essential AI, aunque hay rumores de que su equipo podría integrarse en Nvidia. Niki Parmar, después de cofundar Adept AI y Essential AI, ahora trabaja en Anthropic. Jakob Uszkoreit, quien propuso la idea central, fundó Inceptive, aplicando la IA al diseño de moléculas de ARN. Llion Jones, tras una larga carrera en Google, cofundó Sakana AI en Tokio, explorando modelos colaborativos inspirados en la naturaleza. Aidan N. Gomez, el más joven del grupo, fundó Cohere, centrada en soluciones empresariales de IA. Łukasz Kaiser, con un trasfondo teórico, es investigador clave en OpenAI, contribuyendo a modelos como GPT-4 y o1. Illia Polosukhin, co-diseñador del Transformer, es cofundador del protocolo blockchain NEAR. A pesar de sus trayectorias distintas —desde biotecnología y blockchain hasta laboratorios de IA—, comparten una creencia: Transformer no es el punto final. Siguen explorando activamente la próxima arquitectura que supere claramente al actual pilar de la IA moderna.

marsbit06/28 05:37

Los ocho padres del Transformer, ¿dónde están ahora?

marsbit06/28 05:37

Nuevo trabajo del equipo de Kaiming He: Eliminando VAE y datos privados, la generación de texto a imagen resulta ser más potente

El equipo de investigación de He Kaiming presenta MiniT2I, un modelo de generación de imagen a partir de texto (text-to-image, T2I) minimalista y directo en el espacio de píxeles, que desafía la complejidad de los enfoques dominantes. El modelo elimina componentes estándar como el VAE para codificación, mecanismos de inyección condicional complejos (AdaLN), funciones de pérdida auxiliares, datos privados y etapas de alineación RL/DPO. Utiliza un objetivo de "flow matching" entrenado directamente sobre píxeles RGB. Con solo 258M de parámetros (versión B/16), supera a modelos de espacio de píxeles mucho más grandes en benchmarks como GenEval (0.87) y DPG-Bench (84.2). Su arquitectura, MM-JiT, simplifica el Transformer estándar: añade dos adaptadores ligeros para las características de texto de T5 (congelado) y elimina la rama AdaLN, confiando en que la imagen ruidosa ya contiene información temporal. Esto reduce parámetros y permite más capas, mejorando el FID a 13.7. El entrenamiento, de bajo costo (~3 días en 8 H100 para el modelo de ablación), se realiza en dos fases con datos completamente públicos: preentrenamiento en CC12M reetiquetado y ajuste fino en ~120K pares de alta calidad. Esto demuestra que un modelo pequeño puede igualar o superar en ciertos aspectos a gigantes como SD3-Medium en escenas imaginativas, aunque muestra limitaciones en renderizado de texto y entidades nombradas debido a los datos públicos. MiniT2I señala un cambio de paradigma hacia la simplificación y eficiencia en la generación de imágenes, haciendo que la tecnología T2I sea más accesible fuera de los laboratorios industriales líderes.

marsbit06/22 10:21

Nuevo trabajo del equipo de Kaiming He: Eliminando VAE y datos privados, la generación de texto a imagen resulta ser más potente

marsbit06/22 10:21

Fuga continua de talentos de IA de Google: ¿Prueba de estrés o preludio de su "obituario"?

El reciente éxodo de talentos clave de IA de Google, como Noam Shazeer (coautor de Transformer), John Jumper (premio Nobel por AlphaFold) y Daniel De Freitas (cofundador de Character.AI), hacia OpenAI y Anthropic, ha generado preocupación en el mercado. Sin embargo, más que un "obituario", esto representa una prueba de estrés para Google en un contexto de feroz competencia por talento previo a posibles OPVs de sus rivales. A pesar de las pérdidas, Google conserva ventajas estructurales decisivas. No es solo una empresa de modelos, sino una plataforma integral de IA con infraestructura (TPU, Google Cloud), productos integrados (Search, YouTube, Android) que llegan a miles de millones de usuarios, y una sólida capacidad de distribución. Además, estratégicamente, se posiciona como proveedor de infraestructura para sus competidores, como lo demuestran las inversiones y acuerdos con Anthropic. El verdadero desafío para Google es su "dilema del innovador": la necesidad de transformar su lucrativo negocio central de Búsqueda de manera ágil mientras compite con startups más ágiles. Aun así, su capacidad para integrar IA en su amplio ecosistema, su profundidad técnica y su enfoque a largo plazo en IA para la ciencia le otorgan una posición única. La carrera de IA es un juego largo, y Google sigue siendo uno de los pocos actores con los recursos y la amplitud para competir en todos sus frentes.

marsbit06/21 08:58

Fuga continua de talentos de IA de Google: ¿Prueba de estrés o preludio de su "obituario"?

marsbit06/21 08:58

Perdiendo a dos leyendas en tres días: ¿Se está resquebrajando el dique de talento de IA de Google?

En solo tres días, Google ha perdido a dos leyendas de la IA. El 18 de junio, Noam Shazeer, coautor del seminal trabajo "Attention is All You Need" y copresponsable de Gemini, anunció su salida para unirse a OpenAI. Dos días después, John Jumper, ganador del Nobel de Química 2024 y líder de AlphaFold, dejó Google DeepMind para incorporarse a Anthropic. Estas partidas no son incidentes aislados, sino parte de una tendencia clara de fuga de talento de Google hacia OpenAI y Anthropic, como lo confirma también la reciente incorporación a Anthropic del exmiembro fundador de OpenAI, Andrej Karpathy. El trasfondo de este éxodo es fundamentalmente una cuestión de misión y enfoque. El modelo de negocio central de Google, basado en la publicidad, impone una lógica orientada a productos y métricas comerciales que, en última instancia, restringe la investigación pura. En contraste, tanto OpenAI (con su misión de AGI) como Anthropic (centrada en la seguridad y la ciencia) ofrecen un entorno de trabajo enfocado únicamente en empujar los límites de las capacidades de los modelos. A esto se suma la fuerte atracción financiera: OpenAI y Anthropic están en camino a una OPI, lo que promete una recompensa económica masiva a través de capital para sus empleados, algo que la ya gigantesca Google difícilmente puede igualar. La fusión de Google Brain y DeepMind en 2023, destinada a consolidar esfuerzos, ha generado en cambio tensiones culturales y ha hecho más evidente la presión por alinear la investigación con los objetivos de los equipos de productos. El resultado es una reorganización estructural del mapa del talento en IA. Google, a pesar de sus vastos recursos en computación y datos, está perdiendo a las personas que definen el futuro del campo. La verdadera ventaja competitiva en IA reside en retener a las mentes más brillantes, y Google está descubriendo que esa es quizás su batalla más difícil.

marsbit06/20 04:07

Perdiendo a dos leyendas en tres días: ¿Se está resquebrajando el dique de talento de IA de Google?

marsbit06/20 04:07

Internet celebra la llegada de Noam, pero la factura de pérdidas de OpenAI suma otra página

El cofundador de OpenAI, Sam Altman, anunció la incorporación de Noam Shazeer, coautor del Transformer, como responsable de investigación de arquitectura. La noticia generó entusiasmo, pero coincide con la divulgación de datos financieros auditados que muestran graves pérdidas: en 2025, OpenAI tuvo ingresos de 13.070 millones de dólares, pero una pérdida operativa de 20.920 millones. El primer trimestre de 2026 consumió 3.700 millones en efectivo, más de la mitad de sus ingresos. La llegada de Shazeer sigue a la salida de varios miembros fundadores clave como Ilya Sutskever y Jan Leike, en un contexto donde los puestos de investigación han caído del 23% al 4.4% de las contrataciones desde 2021, señalando un cambio hacia prioridades de producto. El principal desafío de OpenAI no es técnico, sino financiero. Sus enormes costes incluyen 10.590 millones en alquiler de capacidad de cómputo a Microsoft y 7.500 millones en inferencia. Con 900 millones de usuarios semanales pero solo 50 millones de pagantes, su modelo de negocio es insostenible. Mientras, competidores como Anthropic, con un enfoque en clientes empresariales, están cerca de la rentabilidad. La contratación de Shazeer parece una movida estratégica para fortalecer la narrativa ante una posible OPV y una valoración billonaria, más que una solución a sus problemas de flujo de caja. Con un ritmo de quema de efectivo actual, el tiempo se agota antes de que cualquier avance arquitectónico futuro pueda marcar la diferencia.

marsbit06/19 02:30

Internet celebra la llegada de Noam, pero la factura de pérdidas de OpenAI suma otra página

marsbit06/19 02:30

El exalumno post-00 de Tsinghua, Wang Guan, presenta otra innovación: revolucionando los modelos de preentrenamiento Transformer con 1/900 tokens y 1/432 de potencia computacional

El equipo de Wang Guan, egresado de la Universidad Tsinghua, ha presentado HRM-Text, un nuevo modelo de preentrenamiento que desafía el paradigma tradicional de los grandes modelos de lenguaje. Sustituyendo el Transformer estándar por un Modelo Recurrente Jerárquico (HRM) y utilizando un objetivo de entrenamiento directo en pares instrucción-respuesta, HRM-Text logra un rendimiento comparable a modelos de código abierto de 2B a 7B de parámetros, pero con una fracción mínima de los recursos. Concretamente, el modelo de 1B de parámetros se entrenó con solo 40B de tokens únicos, utilizando aproximadamente 100-900 veces menos tokens y 96-432 veces menos cómputo estimado que los modelos baseline estándar, a un costo cercano a los 1500 USD. Aún así, alcanzó puntuaciones destacadas en benchmarks clave: MMLU (60.7%), ARC-C (81.9%), DROP (82.2%), GSM8K (84.5%) y MATH (56.2%). La arquitectura HRM emplea módulos de actualización lenta (H) y rápida (L), permitiendo múltiples pasos recurrentes por token para aumentar la profundidad computacional sin agregar parámetros. Técnicas como MagicNorm y Warmup Deep Credit Assignment aseguraron la estabilidad del entrenamiento recurrente. Los experimentos muestran que HRM supera en eficiencia y estabilidad a Transformers de tamaño similar bajo un presupuesto computacional fijo. Las ablaciones confirman la contribución clave del objetivo de finalización de tareas y el enmascaramiento PrefixLM. El análisis sugiere que la estructura recurrente confiere una "profundidad efectiva" mayor. Las limitaciones incluyen una cobertura de conocimiento aún limitada por el corpus, la necesidad de mecanismos de tiempo de cómputo adaptativo, y desafíos de ingeniería para implementar PrefixLM en entornos de diálogo. El trabajo futuro explorará desacoplar el núcleo de razonamiento del almacenamiento de conocimientos y validar la escalabilidad a tamaños de modelo mayores.

marsbit05/26 03:19

El exalumno post-00 de Tsinghua, Wang Guan, presenta otra innovación: revolucionando los modelos de preentrenamiento Transformer con 1/900 tokens y 1/432 de potencia computacional

marsbit05/26 03:19

活动图片