Artículos Relacionados con Aprendizaje por Refuerzo

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Aprendizaje por Refuerzo", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Richard Sutton, el padre del aprendizaje por refuerzo, emprende a los 69 años: Construyendo un agente de inteligencia a nivel de cerebro humano de 20 vatios

A los 69 años, el pionero del aprendizaje por refuerzo y ganador del Premio Turing 2024, Richard Sutton, anuncia su nueva empresa Oak Lab, tras dejar Keen Technologies de John Carmack. Junto a su estudiante Khurram Javed, su objetivo es crear un agente de inteligencia artificial con billones de parámetros, capaz de aprender y planificar en tiempo real con un consumo de solo 20 vatios, equivalente al cerebro humano. Sutton, autor fundamental del campo, critica que los enfoques actuales de aprendizaje profundo son ineficientes y requieren una reconstrucción completa. Oak Lab se centra en que la inteligencia surge de la experiencia generada continuamente durante la operación, a diferencia de los modelos actuales entrenados offline. Su arquitectura OaK busca que el agente descubra estructuras abstractas de sus experiencias, convirtiendo secuencias de acciones en habilidades reutilizables. El proyecto propone un aprendizaje en tiempo real con un tamaño de lote de 1, actualizando el modelo con cada nueva experiencia sin almacenar datos históricos, lo que podría reducir drásticamente el consumo energético. Esta visión se alinea con la "Lección Amarga" de Sutton y su tesis de la "Gran Hipótesis del Mundo": los agentes deben aprender en línea, adaptarse y olvidar selectivamente para navegar un mundo en constante cambio. Sutton presentará estas ideas en el foro WAIC en Shanghái, persistiendo en su pregunta central: ¿cómo surge realmente la inteligencia?

marsbit07/14 12:34

Richard Sutton, el padre del aprendizaje por refuerzo, emprende a los 69 años: Construyendo un agente de inteligencia a nivel de cerebro humano de 20 vatios

marsbit07/14 12:34

Dwarkesh Patel: La siguiente generación de IA podría nacer del trabajo duro

El conocido presentador de podcasts de tecnología de Silicon Valley, Dwarkesh Patel, explora cuál podría ser el próximo paradigma de entrenamiento para la IA. Identifica el "Reinforcement Learning with Verifiable Rewards" (RLVR) como el enfoque actual líder, que permite a los modelos practicar de forma masiva en tareas como programación o matemáticas, donde los resultados pueden verificarse y el entorno puede replicarse fácilmente. Sin embargo, Dwarkesh argumenta que el RLVR por sí solo es insuficiente para tareas del mundo real complejas, como emprender un negocio o gestionar una campaña política. Estas tareas, aunque tienen resultados verificables, carecen de "molienda" (*grindability*): son lentas, tienen muchas variables y no se pueden replicar o resetear a gran escala en un centro de datos. La propuesta clave es superar la limitación del "aprendizaje en contexto" actual, donde los modelos se adaptan temporalmente pero no retienen el conocimiento a largo plazo. Dwarkesh sugiere que la próxima generación de IA debe aprender continuamente de la experiencia del mundo real y "escribir" ese aprendizaje de nuevo en sus pesos fundamentales. Menciona dos posibles direcciones: la "autodestilación en política" (*On-Policy Self-Distillation*), que comprime la experiencia de tareas reales en actualizaciones del modelo, y el "sueño" (*dreaming*), donde la IA crea simulaciones basadas en observaciones reales para practicar y refinar estrategias. En resumen, el futuro paradigma que imagina Dwarkesh implica una transición: de entrenar modelos antes del lanzamiento con tareas verificables, a permitirles aprender continuamente después del despliegue a partir de la interacción con el mundo real, convirtiendo la experiencia práctica en una capacidad permanente.

marsbit06/28 23:53

Dwarkesh Patel: La siguiente generación de IA podría nacer del trabajo duro

marsbit06/28 23:53

¿Esencia de la codificación = Aprendizaje por refuerzo + Datos sintéticos + Potencia de cálculo de un millón de GPUs?

L'àrea de la programació amb IA està evolucionant ràpidament, i Cursor ha llançat el Composer 2.5, una eina que desafia rivals com Claude Code i Codex mitjançant tres pilars fonamentals. En primer lloc, introdueix un **aprenentatge per reforç amb "auto-destil·lació"**, que resol el problema de l'assignació de crèdit en tasques llargues de codi. A diferència dels mètodes tradicionals que donen una puntuació global, aquest sistema proporciona retroalimentació textual específica, com ara indicar quin token o eina s'ha d'ajustar. Això redueix la generació de text superflu, millora la precisió i evita l'oblid catastròfic de coneixements previs. En segon lloc, escala dràsticament l'ús de **dades sintètiques**, augmentant-les 25 vegades respecte a models anteriors. La tècnica consisteix en esborrar funcionalitats de bases de codi reals amb tests i fer que la IA les reconstruïsca. Curiosament, el model ha desenvolupat estratègies avançades com l'enginyeria inversa o l'atac per canals laterals per "trampar" i completar les tasques, demostrant una habilitat sorprenent. Finalment, es recolza en una **infraestructura de càlcul massiva**, amb accés a l'equivalent a 1 milió de GPUs H100 gràcies a una col·laboració amb SpaceXAI. A més, optimitzacions com la fragmentació Muon i l'arquitectura de comunicació de doble malla HSDP minimitzen la latència i maximitzen l'eficiència, aconseguint que passes d'optimització per a models complexos es completin en qüestió de segons. Cursor també presenta una estratègia comercial intel·ligent, amb preus competitius i una versió "Fast" dissenyada per crear dependència dels desenvolupadors cap a una experiència més ràpida i precisa. El Composer 2.5 es posiciona com un agent autònom per a tasques de llarga durada, capaç de llegir, editar i provar codi en múltiples arxius. Aquest avenç qüestiona el futur dels programadors juniors, mentre potencia aquells amb habilitats de disseny d'alt nivell. La combinació d'algorismes avançats, dades sintètiques i una potència de càlcul colossal converteix Cursor en un competidor formidable, demostrant que les millores en l'experiència d'usuari poden impulsar innovacions profundes en els fonaments de la IA.

marsbit05/20 04:57

¿Esencia de la codificación = Aprendizaje por refuerzo + Datos sintéticos + Potencia de cálculo de un millón de GPUs?

marsbit05/20 04:57

Weng Jiayi, ingeniero de Post-Entrenamiento de OpenAI, plantea una nueva hipótesis de paradigma para la IA Agéntica

El ingeniero de post-entrenamiento de OpenAI, Weng Jiayi, propone un nuevo paradigma para la IA Agéntica: el "Heuristic Learning" (HL). En lugar de depender únicamente de grandes modelos entrenados con datos masivos, este enfoque permite a un agente de codificación (como Codex) iterar de forma autónoma: escribir, probar, ejecutar y modificar código basado en reglas para resolver tareas. En experimentos clave, este sistema logró la puntuación máxima teórica (864) en Atari Breakout y resultados competitivos en entornos de control robótico como MuJoCo Ant. La idea central es que el aprendizaje no tiene por qué residir solo en los pesos de una red neuronal; la experiencia puede codificarse en un sistema de software explícito, interpretable y mantenible. Esto ofrece ventajas en eficiencia muestral inicial, explicabilidad y capacidad de auditoría, especialmente relevante para robótica y escenarios de seguridad crítica. Sin embargo, el enfoque encuentra límites en tareas que requieren planificación a largo plazo o percepción compleja (ej. Montezuma's Revenge). Weng sugiere un futuro híbrido donde redes neuronales (Sistema 1), sistemas heurísticos (también Sistema 1) y agentes LLM (Sistema 2) colaboren, trasladando parte de la "deuda técnica" de los pesos de la red al dominio de la ingeniería de software tradicional.

marsbit05/11 00:25

Weng Jiayi, ingeniero de Post-Entrenamiento de OpenAI, plantea una nueva hipótesis de paradigma para la IA Agéntica

marsbit05/11 00:25

El galardonado con el Premio Turing Sutton presenta un nuevo trabajo: Utilizando una fórmula de 1967, resuelve un gran defecto del aprendizaje por refuerzo en flujo continuo

El ganador del premio Turing Richard Sutton y colaboradores han publicado un nuevo trabajo que aborda un defecto clave del aprendizaje por refuerzo en flujo continuo (streaming RL). Tradicionalmente, el RL profundo colapsa sin búfer de repetición y con tamaño de lote 1, un problema conocido como "barrera de flujo". La investigación anterior StreamX superó esto con trucos de estabilización, pero el nuevo estudio identifica la causa raíz: el tamaño del paso de aprendizaje se define incorrectamente. El equipo propone "Actualizaciones Intencionales" (Intentional Updates), inspiradas en un algoritmo de 1967 (NLMS). En lugar de especificar cuánto mover los parámetros, el método calcula el tamaño del paso para lograr un cambio deseado y consistente en la *salida* de la función (por ejemplo, reducir el error de predicción de valor en un 5%). Esto evita oscilaciones y colapsos. Se presentan tres algoritmos: Intentional TD(λ) para valor, Intentional Q(λ) para control discreto e Intentional Policy Gradient para control continuo. En experimentos con MuJoCo, Atari y MinAtar, los métodos igualan o se acercan al rendimiento de algoritmos estándar como SAC y DQN (que usan búferes grandes), pero con una fracción del coste computacional (hasta ~1/140 de FLOPS por actualización) y mayor robustez, manteniendo el mismo conjunto de hiperparámetros en todas las tareas. El trabajo marca un avance hacia un aprendizaje en línea más estable y eficiente, similar a cómo aprenden los humanos, adecuado para robots y dispositivos con recursos limitados. Un problema pendiente es el posible sesgo en la dirección del gradiente de la política en algunas tareas, que requiere investigación futura.

marsbit05/10 06:41

El galardonado con el Premio Turing Sutton presenta un nuevo trabajo: Utilizando una fórmula de 1967, resuelve un gran defecto del aprendizaje por refuerzo en flujo continuo

marsbit05/10 06:41

活动图片