Artículos Relacionados con Aprendizaje Profundo

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Aprendizaje Profundo", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Richard Sutton, el padre del aprendizaje por refuerzo, emprende a los 69 años: Construyendo un agente de inteligencia a nivel de cerebro humano de 20 vatios

A los 69 años, el pionero del aprendizaje por refuerzo y ganador del Premio Turing 2024, Richard Sutton, anuncia su nueva empresa Oak Lab, tras dejar Keen Technologies de John Carmack. Junto a su estudiante Khurram Javed, su objetivo es crear un agente de inteligencia artificial con billones de parámetros, capaz de aprender y planificar en tiempo real con un consumo de solo 20 vatios, equivalente al cerebro humano. Sutton, autor fundamental del campo, critica que los enfoques actuales de aprendizaje profundo son ineficientes y requieren una reconstrucción completa. Oak Lab se centra en que la inteligencia surge de la experiencia generada continuamente durante la operación, a diferencia de los modelos actuales entrenados offline. Su arquitectura OaK busca que el agente descubra estructuras abstractas de sus experiencias, convirtiendo secuencias de acciones en habilidades reutilizables. El proyecto propone un aprendizaje en tiempo real con un tamaño de lote de 1, actualizando el modelo con cada nueva experiencia sin almacenar datos históricos, lo que podría reducir drásticamente el consumo energético. Esta visión se alinea con la "Lección Amarga" de Sutton y su tesis de la "Gran Hipótesis del Mundo": los agentes deben aprender en línea, adaptarse y olvidar selectivamente para navegar un mundo en constante cambio. Sutton presentará estas ideas en el foro WAIC en Shanghái, persistiendo en su pregunta central: ¿cómo surge realmente la inteligencia?

marsbit07/14 12:34

Richard Sutton, el padre del aprendizaje por refuerzo, emprende a los 69 años: Construyendo un agente de inteligencia a nivel de cerebro humano de 20 vatios

marsbit07/14 12:34

Transformando el Transformer: los LLM se vuelven más inteligentes con un simple cambio

Una nueva investigación de Mila, la Universidad de Cornell y la Universidad de Montreal propone un cambio radical en la arquitectura de los modelos de lenguaje grandes (LLM): la redistribución asimétrica de parámetros sin aumentar su número total. El estudio señala que la práctica estándar de asignar la misma capacidad (ancho de la red feed-forward) a cada capa del Transformer es ineficiente. Evidencias como el "early exiting" y estudios de interpretabilidad muestran que las capas iniciales procesan información fundamental (sintaxis), mientras que las posteriores a menudo refinan o repiten información. Los investigadores introdujeron los "Modelos de Lenguaje Cónicos" (Tapered Language Models), donde el ancho de la red disminuye progresivamente desde las capas iniciales hacia las finales, manteniendo constante el total de parámetros y operaciones (FLOPs). El mejor resultado se obtuvo con una disminución de tipo coseno, asignando un 50% más de capacidad al inicio y un 50% menos al final. En pruebas con un modelo de 440M de parámetros, esta simple redistribución redujo la perplejidad en 1.84 puntos (de 16.28 a 14.44), una mejora significativa sin costo computacional adicional. El hallazgo se validó en múltiples arquitecturas (Transformer estándar, Hope-attention, Titans) y escalas (hasta 1.3B de parámetros), mostrando mejoras consistentes en tareas de razonamiento y predicción lingüística. La explicación subyacente es que las capas profundas generan activaciones más similares a las entradas existentes, necesitando menos "capacidad de trabajo" nueva. Este trabajo sugiere que optimizar la *forma* de distribución de parámetros es una palanca de mejora infrautilizada y de costo casi cero, aplicable potencialmente a Transformers visuales y modelos multimodales.

marsbit06/29 12:57

Transformando el Transformer: los LLM se vuelven más inteligentes con un simple cambio

marsbit06/29 12:57

Concepto de Modelos del Mundo para Principiantes: Una Historia que va de la Psicología al Campo Principal de la IA

El concepto de "modelo mundial" (World Model) es actualmente una idea candente pero confusa en el campo de la IA. Su objetivo central es dotar a la máquina de un "simulador mental" o "tablero de arena interno" que le permita prever y ensayar posibles escenarios futuros antes de actuar en el mundo real. Esto es crucial para aplicaciones como la conducción autónoma (simular condiciones extremas), la robótica (entrenar en entornos virtuales) o la generación de contenidos. El concepto tiene raíces profundas. El psicólogo Kenneth Craik (1943) propuso que la mente humana construye "modelos a pequeña escala" de la realidad para predecir eventos. En IA, pioneros como Marvin Minsky y, más recientemente, investigadores como David Ha y Jürgen Schmidhuber (2018) con su trabajo "Recurrent World Models", sentaron las bases modernas. Los principales investigadores tienen visiones distintas pero complementarias: * **Yann LeCun** (Meta) critica los modelos de lenguaje grandes y aboga por un modelo mundial que comprenda la física subyacente, a través de arquitecturas como JEPA, que predicen en un espacio de representación abstracto, no en píxeles. * **Fei-Fei Li** (Stanford, World Labs) propone una clasificación basada en el ciclo de acción-observación: **Renderizadores** (generan píxeles, como Sora), **Simuladores** (generan estados 3D/físicos precisos) y **Planificadores** (generan acciones). * **El laboratorio FIB de la Universidad de Tsinghua** simplifica la división en modelos para **entender** el mundo (apoyo a la decisión) y para **predecir** el futuro (generación). Grandes empresas están impulsando el campo con diferentes enfoques: * **OpenAI** con **Sora** lo presenta como un "simulador del mundo" basado en generación de vídeo. * **Google DeepMind** con **Genie 3** crea mundos 3D interactivos en tiempo real a partir de texto. * **NVIDIA** con **Cosmos** ofrece una "plataforma de modelo base mundial" para IA física y simulación. Técnicamente, coexisten tres rutas principales: 1. **"Pintar"**: Modelos generativos de vídeo (Sora, Genie 3). Ventaja: realismo visual. Desventaja: coherencia física débil. 2. **"Calcular mentalmente"**: Predicción en espacio de representación abstracta (JEPA). Ventaja: eficiente, aprende estructura. Desventaja: menos interpretable. 3. **"Construir con bloques"**: Generación de entornos 3D con propiedades físicas explícitas (Omniverse). Ventaja: preciso y editable. Desventaja: costoso, menos generalizable. Un desarrollo reciente es el **World Action Model (WAM)**, que integra la predicción del estado futuro y la generación de acciones en un único sistema, acercándose a una capacidad "unificada de conocimiento y acción" para robots. A nivel industrial, se está formando una estructura en tres capas: **1) Soporte base** (datos, potencia de cálculo, sensores), **2) Plataformas tecnológicas** (genéricas o verticales) y **3) Aplicaciones** (conducción autónoma, robótica, juegos, etc.). La conducción autónoma es actualmente la aplicación más madura. La falta de una definición única no es necesariamente negativa. Refleja una fase temprana y dinámica donde diferentes enfoques (compresión del mundo en píxeles, geometría 3D, reglas de comportamiento) están explorando en paralelo. El objetivo final, sin embargo, es convergente: dotar a las máquinas de un modelo interno del mundo que sea **deducible, repasable y generalizable**, para actuar de forma más segura y eficiente. La unificación conceptual llegará, pero la confusión actual es señal de que el "modelo mundial" se ha convertido en un campo de batalla principal para el futuro de la IA.

marsbit06/29 05:14

Concepto de Modelos del Mundo para Principiantes: Una Historia que va de la Psicología al Campo Principal de la IA

marsbit06/29 05:14

Cómo utilizar los Dynamic Workflows de Claude para realizar investigaciones en profundidad

La investigación técnica, ya sea para humanos o IA, está llena de trampas: información abrumadora y conclusiones borrosas. Claude Code ha lanzado "Dynamic Workflows", una función que supera los modos tradicionales de planificación al permitir que la IA diseñe automáticamente el flujo de trabajo óptimo antes de ejecutar una tarea. Esto se activa con `/deep-research`. El sistema se basa en seis patrones de orquestación de agentes: 1. **Clasificar y Actuar (Classify-And-Act)**: Un agente enruta la tarea al especialista más adecuado. Es preciso y eficiente, pero débil con tareas de límites ambiguos. 2. **División y Fusión (Fan-out & Merge)**: Divide la tarea en partes paralelas y luego fusiona los resultados. Rápido y aislado, pero costoso en tokens y con desafíos en la síntesis. 3. **Verificación Antagónica (Adversarial Verification)**: Múltiples agentes desafían una conclusión desde ángulos de refutación. Mitiga el sesgo de confirmación, pero requiere hechos verificables. 4. **Generar y Filtrar (Generate & Filter)**: Genera múltiples soluciones y filtra las mejores. Fomenta la diversidad, pero depende de la calidad de los criterios de filtrado. 5. **Modo Torneo (Tournament)**: Los agentes compiten en rondas de comparación por pares hasta elegir el mejor. Ofrece alta confiabilidad en juicios relativos. 6. **Modo Bucle (Loop)**: Itera adaptativamente hasta cumplir los criterios de aceptación. Único para tareas de extensión desconocida, pero con riesgo de bucles infinitos. Comparado con un sistema de investigación personalizado previo, Dynamic Workflows añade capas cruciales: desglose inicial de objetivos, evaluación de la credibilidad de las fuentes, eliminación cruzada de conclusiones débiles (no solo fusión) y un informe final orientado a la acción. Esto resuelve problemas clave como la deriva de objetivos, la parada prematura, la contaminación del contexto y el sesgo en las respuestas. En resumen, Dynamic Workflows estructura el proceso de investigación, comprimiendo lo que requería decenas de interacciones en unas pocas, aunque con un costo de tokens mucho mayor. Aunque es poderoso para problemas abiertos, aún tiene limitaciones en la verificación fáctica estricta (más allá de la documentación oficial), el pensamiento profundamente interdisciplinario y novedoso, y la adaptación de la información al nivel del público objetivo. Representa un avance hacia una IA más generalista y adaptable.

marsbit06/09 03:12

Cómo utilizar los Dynamic Workflows de Claude para realizar investigaciones en profundidad

marsbit06/09 03:12

El galardonado con el Premio Turing Sutton presenta un nuevo trabajo: Utilizando una fórmula de 1967, resuelve un gran defecto del aprendizaje por refuerzo en flujo continuo

El ganador del premio Turing Richard Sutton y colaboradores han publicado un nuevo trabajo que aborda un defecto clave del aprendizaje por refuerzo en flujo continuo (streaming RL). Tradicionalmente, el RL profundo colapsa sin búfer de repetición y con tamaño de lote 1, un problema conocido como "barrera de flujo". La investigación anterior StreamX superó esto con trucos de estabilización, pero el nuevo estudio identifica la causa raíz: el tamaño del paso de aprendizaje se define incorrectamente. El equipo propone "Actualizaciones Intencionales" (Intentional Updates), inspiradas en un algoritmo de 1967 (NLMS). En lugar de especificar cuánto mover los parámetros, el método calcula el tamaño del paso para lograr un cambio deseado y consistente en la *salida* de la función (por ejemplo, reducir el error de predicción de valor en un 5%). Esto evita oscilaciones y colapsos. Se presentan tres algoritmos: Intentional TD(λ) para valor, Intentional Q(λ) para control discreto e Intentional Policy Gradient para control continuo. En experimentos con MuJoCo, Atari y MinAtar, los métodos igualan o se acercan al rendimiento de algoritmos estándar como SAC y DQN (que usan búferes grandes), pero con una fracción del coste computacional (hasta ~1/140 de FLOPS por actualización) y mayor robustez, manteniendo el mismo conjunto de hiperparámetros en todas las tareas. El trabajo marca un avance hacia un aprendizaje en línea más estable y eficiente, similar a cómo aprenden los humanos, adecuado para robots y dispositivos con recursos limitados. Un problema pendiente es el posible sesgo en la dirección del gradiente de la política en algunas tareas, que requiere investigación futura.

marsbit05/10 06:41

El galardonado con el Premio Turing Sutton presenta un nuevo trabajo: Utilizando una fórmula de 1967, resuelve un gran defecto del aprendizaje por refuerzo en flujo continuo

marsbit05/10 06:41

活动图片