6 Grandes Cambios de Paradigma de la IA en 2025: Desde el Entrenamiento RLVR y Vibe Coding hasta Nano Banana

marsbit发布于2025-12-22更新于2025-12-22

文章摘要

El 2025 ha presenciado transformaciones clave en IA, lideradas por Andrej Karpathy. Seis cambios de paradigma destacan: 1) **RL (Refuerzo con Recompensas Verificables)**: Reemplaza al RLHF, optimizando modelos mediante recompensas automáticas en matemáticas o programación, permitiendo razonamiento escalable y trayectorias de pensamiento extensas. 2) **Inteligencia "Fantasma" vs. "Animal"**: Los LLMs exhiben capacidades desiguales —geniales en áreas verificables, pero frágiles en otras—, desafiando las métricas tradicionales y la noción de inteligencia biológica. 3) **Cursor como capa de aplicación**: Ejemplifica un nuevo nivel de apps de LLM, orquestando múltiples modelos para dominios específicos, combinando ajuste fino, datos privados e interfaces intuitivas. 4) **Claude Code**: Agente local que integra herramientas y razonamiento en el entorno del usuario, priorizando la privacidad y la utilidad práctica sobre soluciones en la nube. 5) **Vibe Coding**: Programación mediante descripciones en lenguaje natural, democratizando el desarrollo y permitiendo prototipos rápidos y código desechable. 6) **Nano banana**: Interfaz visual multimodal (texto, imágenes, gráficos) que trasciende el chat textual, acercándose a una interacción más humana y eficiente. Estos avances reflejan una evolución hacia modelos más versátiles, accesibles y alineados con necesidades humanas, aunque persisten desafíos de evaluación y consistencia.

Autor: Andrej Karpathy

Compilación: Tim, PANews

2025 ha sido un año de rápido desarrollo y lleno de variables para los grandes modelos de lenguaje, y hemos logrado abundantes resultados. A continuación, los "cambios de paradigma" que, en mi opinión personal, merecen atención y son ligeramente sorprendentes. Estos cambios han alterado el panorama, impresionándome al menos a nivel conceptual.

1. Aprendizaje por Refuerzo basado en Recompensas Verificables (RLVR)

A principios de 2025, la pila de producción de LLM en todos los laboratorios de IA se presentaba más o menos de la siguiente forma:

  • Preentrenamiento (GPT-2/3 de 2020);
  • Ajuste fino supervisado (InstructGPT de 2022);
  • y Aprendizaje por Refuerzo con Retroalimentación Humana (RLHF, 2022).

Durante mucho tiempo, esta fue una pila tecnológica estable y madura para entrenar grandes modelos de lenguaje de nivel productivo. Para 2025, el Aprendizaje por Refuerzo basado en Recompensas Verificables se había convertido en la tecnología central adoptada principalmente. Al permitir que los grandes modelos de lenguaje se entrenen en diversos entornos con recompensas automáticamente verificables (por ejemplo, resolviendo problemas matemáticos o de programación), estos modelos pueden desarrollar espontáneamente estrategias que, para los humanos, se asemejan al "razonamiento". Aprenden a descomponer la resolución de problemas en pasos de cálculo intermedios y dominan múltiples estrategias para resolver problemas mediante la deducción repetitiva (pueden consultarse los casos en el artículo de DeepSeek-R1). En la pila anterior, estas estrategias eran difíciles de implementar porque, para los grandes modelos de lenguaje, la ruta de razonamiento óptima y los mecanismos de retroceso no eran evidentes y tenían que explorar soluciones adecuadas mediante la optimización de recompensas.

A diferencia de la fase de ajuste fino supervisado y la fase de RLHF (ambas relativamente breves y con un ajuste fino que requiere menos cálculo), el RLVR implica un entrenamiento prolongado de optimización sobre funciones de recompensa objetivas y no manipulables. Está demostrado que ejecutar RLVR aporta una mejora significativa de capacidades por unidad de coste, consumiendo gran parte de los recursos computacionales originalmente destinados al preentrenamiento. Por lo tanto, el avance en las capacidades de los LLM en 2025 se manifestó principalmente en que los principales laboratorios de IA absorbieron esta enorme demanda computacional que trajo la nueva tecnología. En general, vimos que los modelos tenían un tamaño aproximadamente similar, pero el tiempo de entrenamiento de refuerzo se prolongó considerablemente. Otra particularidad única de esta nueva tecnología es que obtenemos una nueva dimensión de control (y las correspondientes Leyes de Escalado), controlando la capacidad del modelo en función del cálculo en tiempo de prueba al generar trayectorias de razonamiento más largas, aumentando el "tiempo de reflexión". El modelo o1 de OpenAI (lanzado a finales de 2024) fue la primera demostración de un modelo RLVR, y el lanzamiento de o3 (a principios de 2025) fue un punto de inflexión evidente, permitiendo percibir intuitivamente un salto cualitativo.

2. Inteligencia Fantasma vs. Inteligencia Animal en Sierra

2025 me hizo (y creo que a toda la industria) comenzar a entender, por primera vez de manera más intuitiva, la "forma" de la inteligencia de los grandes modelos de lenguaje. No estamos "evolucionando o criando animales", sino "invocando fantasmas". Toda la pila tecnológica de los LLM (arquitectura neuronal, datos de entrenamiento, algoritmos de entrenamiento, y especialmente los objetivos de optimización) es completamente diferente, por lo que no es sorprendente que obtengamos entidades en el campo de la inteligencia muy distintas a la inteligencia biológica, y no es apropiado examinarlas desde la perspectiva animal. Desde el punto de vista de la información supervisada, las redes neuronales humanas están optimizadas para la supervivencia tribal en entornos selváticos, mientras que las redes neuronales de los LLM están optimizadas para imitar texto humano, obtener recompensas en problemas matemáticos y ganar "me gusta" humanos en arenas. A medida que los dominios verificables proporcionan condiciones para el RLVR, las capacidades de los LLM en estas áreas cercanas "aumentan bruscamente", mostrando en general una característica de rendimiento interesante y en forma de sierra. Pueden ser simultáneamente genios eruditos y estudiantes de primaria perplejos y con dificultades cognitivas, siempre listos para filtrar tus datos bajo un prompt de ingeniería inversa.

Inteligencia humana: azul, Inteligencia IA: rojo. Me gusta esta versión del meme (lo siento, no puedo encontrar la publicación original en Twitter) porque señala que la inteligencia humana también presenta, a su manera característica, ondas en forma de sierra.

Relacionado con esto, en 2025 desarrollé una indiferencia y desconfianza general hacia todo tipo de pruebas de referencia. El problema central es que, por naturaleza, los benchmarks son casi siempre entornos verificables y, por lo tanto, extremadamente susceptibles al RLVR y a formas más débiles de influencia mediante la generación de datos sintéticos. En el típico proceso de "maximización de puntuación", los equipos de LLM inevitablemente construyen entornos de entrenamiento cerca de pequeños espacios incrustados donde están los benchmarks y los cubren con "sierras de capacidad". "Entrenar en el conjunto de prueba" se ha convertido en una nueva normalidad.

¿Y qué si se barren todos los benchmarks y aún no se logra la inteligencia artificial general?

3. Cursor: Un Nuevo Nivel de Aplicación LLM

Lo que más me impresionó de Cursor (además de su rápido ascenso este año) es que reveló de manera convincente un nuevo nivel de "aplicación LLM", ya que la gente comenzó a hablar del "Cursor de XX". Como enfaticé en mi charla de Y Combinator este año, aplicaciones LLM como Cursor se centran en integrar y orquestar llamadas a LLM para dominios verticales específicos:

  • Se encargan de la "ingeniería de contexto";
  • En el backend, orquestan múltiples llamadas a LLM en grafos acíclicos dirigidos cada vez más complejos, equilibrando finamente el rendimiento y el coste; proporcionan una interfaz gráfica específica de la aplicación para el personal en el "bucle humano";
  • y ofrecen un "control deslizante de autonomía".

En 2025, ya se hablaba mucho sobre el espacio de desarrollo alrededor de esta nueva capa de aplicación. ¿Las plataformas de LLM se comerán todas las aplicaciones, o aún queda un vasto espacio para las aplicaciones LLM? Personalmente, especulo que el posicionamiento de las plataformas de LLM se acercará gradualmente a formar "graduados universitarios generalistas", mientras que las aplicaciones LLM se encargarán de organizar a estos "graduados", afinarlos y, al proporcionar datos privados, sensores, actuadores y bucles de retroalimentación, convertirlos en verdaderos "equipos profesionales" listos para el combate en dominios verticales específicos.

4. Claude Code: IA Ejecutándose Localmente

La aparición de Claude Code demostró por primera vez de manera convincente la forma de un agente de LLM, que combina el uso de herramientas y el proceso de razonamiento de manera cíclica y repetitiva para lograr una resolución de problemas complejos más persistente. Además, lo que me impresionó de Claude Code es que se ejecuta en la computadora personal del usuario, integrándose profundamente con su entorno, datos y contexto privados. Creo que OpenAI cometió un error de juicio en esta dirección, ya que centró su I+D de asistentes de código y agentes en el despliegue en la nube, es decir, en entornos containerizados orquestados por ChatGPT, en lugar de en el entorno local (localhost). Aunque los clústeres de agentes ejecutándose en la nube parecen ser la "forma ultimate hacia la AGI", actualmente nos encontramos en una fase de transición con un desarrollo de capacidades desequilibrado y un progreso relativamente lento. Bajo estas condiciones realistas, desplegar agentes directamente en la computadora local, colaborando estrechamente con el desarrollador y su entorno de trabajo específico, es un camino más razonable. Claude Code capturó acertadamente esta prioridad y la encapsuló en una forma de herramienta de línea de comandos简洁, elegante y extremadamente atractiva, remodelando así la forma en que se presenta la IA. Ya no es solo un sitio web al que acceder como Google, sino un pequeño duende o fantasma que "vive" en tu computadora. Esta es una forma nueva y única de interactuar con la IA.

5. Vibe Coding (Programación por Ambiente)

En 2025, la IA cruzó un umbral de capacidad clave que hizo posible construir varios programas sorprendentes simplemente mediante descripciones en inglés, sin que la gente ni siquiera se preocupe por el código subyacente. Curiosamente, una vez creé la palabra "Vibe Coding" en un tweet casual mientras me bañaba, sin imaginar en absoluto que llegaría a lo que es hoy. Bajo el paradigma de la programación por ambiente, programar ya no es un campo estrictamente limitado a profesionales altamente capacitados, sino algo en lo que todos pueden participar. Desde esta perspectiva, es otro ejemplo del fenómeno que describí en mi artículo "Empoderando a las Personas: Cómo los Grandes Modelos de Lenguaje Cambian los Modos de Difusión Tecnológica". En marcado contraste con todas las demás tecnologías hasta la fecha, las personas comunes se benefician más de los LLM en comparación con profesionales, empresas y gobiernos. Pero la programación por ambiente no solo capacita a las personas comunes para acceder a la programación, sino que también capacita a los desarrolladores profesionales para escribir más software que "nunca se habría implementado". Al desarrollar nanochat, usé la programación por ambiente para escribir un tokenizador BPE personalizado y eficiente en Rust, sin depender de bibliotecas existentes o aprender Rust en profundidad. Este año, también prototipé rápidamente múltiples proyectos mediante programación por ambiente, solo para verificar si ciertas ideas eran factibles. Incluso escribí aplicaciones completas de un solo uso solo para localizar un error específico, porque el código de repente se volvió gratuito, efímero, maleable y desechable. La programación por ambiente remodelará la ecología del desarrollo de software y cambiará profundamente los límites de la definición profesional.

6. Nano Banana: La Interfaz Gráfica de los LLM

El Gemini Nano banana de Google fue uno de los cambios de paradigma más disruptivos de 2025. En mi opinión, los grandes modelos de lenguaje son el próximo gran paradigma computacional después de la computación de los años 70 y 80. Por lo tanto, veremos innovaciones similares por las mismas razones fundamentales, análogas a la evolución de la computación personal, los microcontroladores e incluso Internet. Especialmente en la interacción persona-máquina, el modo actual de "diálogo" con los LLM es, en cierto modo, similar a introducir comandos en una terminal de computadora en los 80. El texto es la forma de representación de datos más primitiva para las computadoras (y los LLM), pero no es la forma preferida por los humanos (especialmente para la entrada). De hecho, los humanos detestan leer texto, es lento y laborioso. Por el contrario, los humanos prefieren recibir información a través de dimensiones visuales y espaciales, que es precisamente por lo que nació la interfaz gráfica de usuario en la computación tradicional. Del mismo modo, los grandes modelos de lenguaje deberían comunicarse con nosotros en la forma preferida por los humanos, a través de portadores como imágenes, infografías, diapositivas, pizarras, animaciones, video, aplicaciones web, etc. Las formas tempranas actuales ya se logran mediante "decoraciones de texto visual" como emojis y Markdown (elementos de formato como títulos, negritas, listas, tablas). Pero, ¿quién va a construir realmente la interfaz gráfica para los LLM? Desde esta perspectiva, nano banana es un primer vistazo de este futuro蓝图. Vale la pena señalar que el avance de nano banana no solo radica en la capacidad de generación de imágenes en sí, sino en la capacidad integral formada por la interacción de la generación de texto, la generación de imágenes y el conocimiento mundial en los pesos del modelo.

热门币种推荐

相关问答

Q¿Qué es el Aprendizaje por Refuerzo con Recompensa Verificable (RLVR) y por qué es importante en 2025?

AEl Aprendizaje por Refuerzo con Recompensa Verificable (RLVR) es una técnica de entrenamiento para modelos de lenguaje grande (LLM) que utiliza entornos con recompensas automáticamente verificables, como matemáticas o resolución de problemas de programación. Esto permite que los modelos desarrollen estrategias similares al razonamiento humano, descomponiendo problemas en pasos intermedios. En 2025, se convirtió en una tecnología central porque ofrece mejoras significativas en las capacidades de los modelos con un costo computacional eficiente, aunque consume muchos recursos originalmente destinados al preentrenamiento.

Q¿Qué significa la metáfora de 'Fantasma vs. Inteligencia Animal en Zigzag' en el contexto de la IA?

ALa metáfora compara la inteligencia de los LLM con un 'fantasma' en lugar de un animal, destacando que su arquitectura neural, datos de entrenamiento y objetivos de optimización son fundamentalmente diferentes de la inteligencia biológica. Los LLM están optimizados para imitar texto humano y ganar recompensas en dominios verificables, lo que resulta en un perfil de capacidad 'en zigzag': pueden ser geniales en algunas áreas pero deficientes en otras, y son propensos a filtraciones de datos bajo诱导. Esto contrasta con la inteligencia humana, que también tiene sus propias irregularidades pero está optimizada para la supervivencia tribal.

Q¿Cómo redefine Cursor la capa de aplicaciones de LLM en 2025?

ACursor representa una nueva capa de aplicaciones de LLM al integrar y orquestar invocaciones de LLM para dominios verticales específicos. Se encarga de la 'ingeniería de contexto', organiza múltiples llamadas a LLM en gráficos acíclicos dirigidos, proporciona interfaces gráficas específicas para usuarios humanos y ofrece un 'control deslizante de autonomía'. En 2025, se discute ampliamente si los LLM dominarán todas las aplicaciones o si habrá espacio para aplicaciones especializadas, similar a cómo las universidades producen graduados generalistas que luego son refinados en equipos profesionales.

Q¿Qué hace único a Claude Code en comparación con otros asistentes de IA?

AClaude Code es único porque funciona localmente en la computadora del usuario, integrandose profundamente con su entorno, datos y contexto privados. A diferencia de los asistentes basados en la nube (como los de OpenAI), que se ejecutan en entornos contenedorizados, Claude Code opera en localhost, lo que lo hace más adecuado para la fase actual de desarrollo de IA, donde las capacidades son desiguales. Proporciona una forma nueva y atractiva de interactuar con la IA, como un 'duende' que reside en tu computadora, combinando el uso de herramientas y el razonamiento de manera iterativa.

Q¿Qué es la 'Programación de Ambiente' (Vibe Coding) y cómo impacta en el desarrollo de software?

ALa 'Programación de Ambiente' se refiere a la capacidad de crear programas impresionantes simplemente describiéndolos en inglés, sin necesidad de escribir código manualmente. En 2025, la IA cruzó un umbral clave que permite esto, democratizando la programación para no especialistas y permitiendo a los desarrolladores profesionales crear software que de otra manera no se habría implementado. Hace que el código sea gratuito, efímero, moldeable y desechable, lo que redefine los límites profesionales y transforma el ecosistema del desarrollo de software.

你可能也喜欢

比特币为何未实现预期飙升?数据既有积极面,也有消极面

分析公司Glassnode报告称,比特币在未能站稳66,000美元后回落至约62,600美元。报告指出,现货市场需求疲软以及衍生品市场上投资者的对冲头寸加剧了价格压力,而长期投资者的韧性、网络活动增长以及比特币ETF资金流入的恢复则为市场提供了支撑。 具体来看,比特币未能维持突破66,000美元后的复苏势头。当前价格走势反映出现货市场动能减弱,持续的净卖方压力和低交易量使比特币处于盘整阶段,缺乏显著突破潜力。衍生品市场虽然总持仓量下降,但永续合约资金费率再次上升,且期权投资者保持谨慎。风险偏好指标(如25Delta偏斜度扩大)显示市场对下跌保护的需求增加。 另一方面,比特币现货ETF呈现更积极迹象,过去一周净流入和交易量均有所恢复,表明机构投资者正通过受监管工具重新建仓。区块链数据显示活跃地址数和经资产调整的交易量显著增加,反映出网络使用率和经济活动提升。投资者构成分析表明,长期持有者信心坚定,其持仓比例接近历史低点附近。 然而,市场整体盈利水平持续下降,盈利中的比特币占比接近周期低点,投资者呈现出减少损失、降低风险的行为趋势。 Glassnode总结认为,比特币市场目前处于过渡阶段。长期投资者的稳定持仓、区块链活动增加和ETF需求复苏提供了结构性支撑,但估值压力、现货需求不足以及衍生品市场的防御性头寸,继续限制着市场的风险偏好。

cryptonews.ru18分钟前

比特币为何未实现预期飙升?数据既有积极面,也有消极面

cryptonews.ru18分钟前

亿万富翁雷·达利欧解释他为何更青睐黄金而非比特币

亿万富翁投资者、全球最大对冲基金桥水创始人瑞·达利欧就全球金融体系、经济风险与资产配置发表重要观点。他指出,投资者应在潜在金融危机中转向比特币和黄金等“硬通货”资产,并分享了对加密货币的偏好与担忧。 达利欧曾成功预测2008年全球金融危机,他警告市场正因人工智能形成严重泡沫。高债务水平、收入不平等和地缘政治紧张局势正在威胁经济秩序。 达利欧强调资本不应因通胀贬值,投资组合需多元化以应对危机。他透露个人投资组合中比特币约占1%,建议投资者将5%-15%的资产配置于央行无法无限印发的“硬通货”。 尽管将比特币归类为不可印刷的货币,达利欧认为黄金是比比特币更安全的避险资产。他对比特币持谨慎态度的主要原因包括:政府拥有对比特币征税、限制或控制的权力;央行因隐私与控制担忧不会大量持有比特币;量子计算机等新技术可能威胁加密货币基础设施;以及比特币缺乏隐私性。 达利欧指出,黄金拥有千年历史,是最具形体的金融资产,且不依赖于单一方的责任。他主张不应依赖单一资产抵御金融波动,而需通过股票、债券、房地产、黄金和比特币等多资产类别实现平衡的多元化配置。 *本文不构成投资建议。

cryptonews.ru1小时前

亿万富翁雷·达利欧解释他为何更青睐黄金而非比特币

cryptonews.ru1小时前

XDC Tech整合Bridge稳定币平台,将链上稳定币结算引入自主AI商务

2026年8月3日,XDC Network的美国机构部门XDC Tech宣布与稳定币基础设施平台Bridge(Stripe旗下公司)完成关键集成。此次合作为XDC生态开发者提供了直接接入Bridge合规工具的能力,包括法币与稳定币的兑换通道、虚拟账户及多币种托管服务。 核心应用场景是支付。企业可通过Bridge虚拟账户接收美元、欧元等法币,并近乎实时地在XDC网络上以稳定币结算,从而绕开代理行和多日清算流程。该方案已应用于贸易金融,使进出口商能以USDC等稳定币快速结算发票,并扩展到代币化资产领域。 此次集成是XDC构建“智能体经济”结算层路线图的重要一环,旨在支持自主AI智能体以机器速度进行交易。其关键价值包括: 1. 为自主智能体提供机器速度的结算(XDC交易2秒最终确认); 2. 提供受监管的法币通道,覆盖美、欧及拉美地区; 3. 虚拟账户可作为智能体的原生钱包,使其具备独立的经济身份; 4. 多币种托管支持跨境智能体商务; 5. 赋能智能体驱动的贸易金融与代币化资产交易; 6. 集成即合规,满足KYC、反洗钱等监管要求,确保智能体支付的可审计性。 XDC联合创始人Atul Khekade表示,此次合作是面向智能体经济的更广泛建设的一部分。Bridge产品负责人Mai Leduc Blount则认为,稳定币结算网络需要从第一天就为速度和最终性而构建,XDC正是这样的基础。 该集成已通过XDC和Bridge的开发者门户开放。

cointelegraph2小时前

XDC Tech整合Bridge稳定币平台,将链上稳定币结算引入自主AI商务

cointelegraph2小时前

交易

现货

热门文章

如何购买BANANA

欢迎来到HTX.com!我们已经让购买Banana Gun(BANANA)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Banana Gun(BANANA)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Banana Gun(BANANA)购买完您的Banana Gun(BANANA)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Banana Gun(BANANA)在HTX的现货市场轻松交易Banana Gun(BANANA)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

800人学过发布于 2024.03.29更新于 2026.06.02

如何购买BANANA

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对BANANA(BANANA)币价的意见。

活动图片