Un modelo pequeño de 3B con puntuación de programación comparable a Opus 4.5, un modelo misterioso genera debate, resulta ser chino

marsbitPublicado a 2026-06-18Actualizado a 2026-06-18

Resumen

Un pequeño modelo de 3B parámetros, VibeThinker-3B, desarrollado por el equipo de Sina Weibo, está generando revuelo al alcanzar un rendimiento en tareas de razonamiento verificable (como programación) comparable al de modelos líderes como GPT-5, Claude Opus 4.5 o Gemini 3 Pro, a pesar de su tamaño significativamente menor. Basado en Qwen2.5-Coder-3B, el modelo fue entrenado con un proceso "Spectrum-to-Signal" que incluye fine-tuning supervisado en dos etapas con aprendizaje curricular, aprendizaje por refuerzo aplicado a múltiples dominios (matemáticas, programación, razonamiento STEM) y destilación de conocimiento. También incorpora una estrategia de evaluación de confiabilidad "Claim-Level" (CLR) para mejorar aún más los resultados en benchmarks. Sus puntuaciones sobresalientes incluyen 94.3 en AIME26, 80.2 en LiveCodeBench v6 y una tasa de aprobación del 96.1% en competiciones recientes de LeetCode. Los autores proponen la "hipótesis de compresión paramétrica", sugiriendo que el razonamiento verificable es una capacidad altamente comprimible que puede alcanzar niveles de vanguardia en modelos pequeños cuando las tareas tienen una estructura clara y señales de feedback confiables, desacoplándose parcialmente del conocimiento factual que requiere más parámetros. El objetivo no es reemplazar a los modelos grandes, sino explorar los límites de los modelos pequeños en dominios específicos. El modelo está disponible públicamente, aunque su rendimiento es intencionalmente esp...

En los últimos días, un modelo pequeño de 3B se ha vuelto viral en X porque, en algunas tareas de razonamiento con verificación de dificultad (como la programación), ha entrado en el rango de rendimiento de modelos de vanguardia como Gemini 3 Pro, GPT-5 high, Claude Opus 4.5, GLM-5, Kimi K2.5, y su tamaño es mucho menor que el de estos modelos.

Este modelo se llama VibeThinker-3B, es un modelo denso de razonamiento con 3 mil millones de parámetros, diseñado para explorar hasta qué punto se puede impulsar la capacidad de razonamiento verificable en un modelo pequeño y estricto.

Después del lanzamiento del modelo, muchas personas quedaron impresionadas con sus resultados y expresaron su deseo de probarlo.

Vale la pena señalar que también es un modelo chino, proveniente del equipo de Sina Weibo.

El informe técnico muestra que el modelo está diseñado específicamente para tareas con señales de verificación confiables, incluyendo razonamiento matemático, programación competitiva, razonamiento STEM y ejecución de instrucciones con restricciones claras.

Por lo tanto, tiene un rendimiento sobresaliente en varias pruebas de referencia. Obtuvo una puntuación de 94.3 en la prueba AIME26, 89.3 en HMMT25, 80.2 (Pass@1) en LiveCodeBench v6, y logró una tasa de aprobación del 96.1% en los concursos semanales y quincenales más recientes y no públicos de LeetCode entre el 25 de abril y el 31 de mayo de 2026.

¿Cómo se entrenó este modelo? El informe técnico revela algunos detalles.

Primero, se basa en Qwen2.5-Coder-3B y utiliza un proceso actualizado de Spectrum-to-Signal para el post-entrenamiento. Este proceso reforzó la síntesis de datos, el filtrado de calidad y el aprendizaje curricular en el ajuste fino supervisado (SFT), extendió el aprendizaje por refuerzo al estilo MGPO a múltiples dominios verificables, conservó trayectorias completas de razonamiento de contexto largo y consolidó las capacidades mediante auto-distilación fuera de línea y aprendizaje por refuerzo de instrucciones (Instruct RL).

Flujo de entrenamiento general de VibeThinker-3B

Proceso Spectrum-to-Signal.

Además, VibeThinker-3B introduce la evaluación de confiabilidad a nivel de afirmación (CLR), una estrategia de escalado en tiempo de prueba para razonamiento verificable orientado a respuestas. CLR mejora aún más el rendimiento en pruebas de referencia matemáticas, elevando AIME26 de 94.3 a 97.1, HMMT25 de 89.3 a 95.4, y llevando BruMO25 a 99.2.

Su flujo de entrenamiento específico es el siguiente:

  • SFT en dos etapas basado en currículum. La primera etapa se centra en la cobertura amplia de capacidades como razonamiento matemático, programación, STEM, diálogo general y seguimiento de instrucciones. La segunda etapa se orienta hacia muestras de razonamiento más difíciles y de mayor alcance. La destilación de exploración de diversidad se usa para conservar múltiples rutas de solución efectivas.
  • Aprendizaje por refuerzo de razonamiento en múltiples dominios. VibeThinker-3B reutiliza MGPO. El aprendizaje por refuerzo se aplica secuencialmente a tareas de razonamiento matemático, de programación y STEM. El entrenamiento utiliza una única ventana de contexto largo de 64K para conservar trayectorias completas de razonamiento de largo plazo.
  • Auto-distilación fuera de línea. Se filtran y refinan trayectorias de alta calidad desde los puntos de control de RL matemático, de programación y STEM, formando finalmente un modelo de estudiante unificado. La puntuación de potencial de aprendizaje prioriza aquellas trayectorias correctas que el estudiante aún no imita bien.
  • Instruct RL. La etapa final mejora la controlabilidad ante indicaciones orientadas al usuario. Para datos instructivos sensibles al formato y de tipo abierto, se utilizan verificadores basados en reglas y modelos de recompensa basados en criterios de evaluación.

En una publicación reciente, el reconocido investigador y blogger de IA Sebastian Raschka resumió sistemáticamente los puntos clave revelados en el informe técnico de VibeThinker-3B, incluyendo los siguientes:

Si estás interesado en este contenido, puedes consultar su informe técnico en detalle. Actualmente, el modelo también está disponible para descarga pública.

Título del informe: VibeThinker-3B: Explorando la frontera del razonamiento verificable en modelos de lenguaje pequeños

Enlace al informe: https://arxiv.org/pdf/2606.16140

Enlace de HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B

Sin embargo, el ámbito de aplicación de este modelo tiene limitaciones claras, ya que no sobresale en áreas que requieren conocimiento general.

Los autores también señalan esto claramente y proponen la "hipótesis de compresión paramétrica por cobertura": diferentes capacidades dependen de los parámetros del modelo de maneras radicalmente distintas. El razonamiento verificable se acerca más a una capacidad altamente compresible y paramétricamente densa, cuyo núcleo reside en el razonamiento de múltiples pasos, la satisfacción de restricciones, la autocorrección y la verificación de respuestas. Cuando el espacio de tareas es suficientemente estructurado y las señales de retroalimentación son lo suficientemente confiables, los modelos compactos también pueden poseer capacidades de razonamiento cercanas a la vanguardia. En contraste, el conocimiento de dominio abierto, el diálogo general y la comprensión de escenarios de cola larga dependen más de grandes parámetros para cubrir ampliamente hechos, conceptos y conocimiento del mundo. Esta hipótesis es muy reveladora. VentureBeat escribió en su reportaje: "Revela que existe un desacoplamiento parcial entre la capacidad de razonamiento y el conocimiento fáctico, y que la primera puede comprimirse de manera más eficiente de lo que se pensaba — una perspectiva que tiene implicaciones profundas en cómo la industria ve el diseño de modelos, los costos de implementación y la accesibilidad de funciones avanzadas de IA."

Los autores indican que su objetivo no es crear un modelo pequeño que reemplace a los modelos grandes, sino examinar los límites reales de los modelos pequeños a lo largo de dimensiones de capacidad específicas. Con VibeThinker-3B, esperan mostrar que los modelos pequeños no deben verse meramente como una solución de compromiso para reducir los costos de implementación. En dominios de capacidad con mecanismos claros de retroalimentación y verificación, los modelos de lenguaje pequeños están mostrando una vía de investigación prometedora para lograr un rendimiento de nivel de vanguardia, formando una relación fundamentalmente complementaria con el paradigma tradicional de escalado de parámetros.

Actualmente, el modelo aún enfrenta algunas dudas en la comunidad. Si estás interesado en este modelo, puedes probarlo personalmente.

Enlaces de referencia:

https://x.com/orcus108/status/2066876960073281582

Este artículo es de la cuenta oficial de WeChat "机器之心" (ID: almosthuman2014), autor: Zhang Qian.

Preguntas relacionadas

Q¿Qué es el modelo VibeThinker-3B y por qué ha generado tanto interés?

AVibeThinker-3B es un modelo de lenguaje pequeño de 3.000 millones de parámetros desarrollado por el equipo de Sina Weibo. Ha generado interés porque, a pesar de su tamaño reducido, alcanza un rendimiento en tareas de razonamiento verificable (como programación) comparable al de modelos de última generación mucho más grandes como GPT-5, Claude Opus 4.5 o Gemini 3 Pro.

Q¿En qué tipo de tareas sobresale específicamente el VibeThinker-3B?

AEl VibeThinker-3B está especializado y sobresale en tareas de razonamiento con señales de verificación confiables, como razonamiento matemático, programación competitiva, razonamiento STEM (Ciencia, Tecnología, Ingeniería y Matemáticas) y ejecución de instrucciones con restricciones claras.

Q¿Cuál es la base del modelo y cuál fue su proceso de entrenamiento clave?

AEl modelo se construyó sobre la base de Qwen2.5-Coder-3B. Su proceso de entrenamiento clave fue el 'Spectrum-to-Signal', que incluyó ajuste fino supervisado (SFT) con datos sintéticos y filtrados, aprendizaje por refuerzo aplicado a múltiples dominios, destilación automática fuera de línea y aprendizaje por refuerzo con instrucciones (Instruct RL) para consolidar capacidades.

Q¿Qué hipótesis importante plantea el equipo detrás de VibeThinker-3B sobre las capacidades de los modelos?

APlantean la 'hipótesis de cobertura de compresión de parámetros'. Esta sugiere que la capacidad de razonamiento verificable (lógica, resolución de problemas) está parcialmente disociada del conocimiento fáctico general y es altamente compresible. Por lo tanto, un modelo pequeño y denso puede alcanzar un rendimiento de vanguardia en tareas con retroalimentación clara, mientras que el conocimiento de dominio abierto requiere más parámetros.

Q¿Dónde se puede encontrar más información técnica y acceder al modelo VibeThinker-3B?

AEl informe técnico titulado 'VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models' está disponible en arXiv: https://arxiv.org/pdf/2606.16140. El modelo puede descargarse públicamente desde HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B.

Lecturas Relacionadas

Partidarios de la actualización BIP-110 de Bitcoin preparan un plan de 'último recurso' si no se acepta la propuesta: esto podría cambiar radicalmente el valor de BTC

Mientras continúa el debate en la red de Bitcoin sobre la propuesta BIP-110, sus partidarios han elaborado un plan de contingencia que podría activarse si los mineros bloquean la actualización. El desarrollador Chris Guida ha adaptado un código para cambiar el algoritmo de prueba de trabajo (Proof-of-Work), originalmente creado por Luke Dashjr en 2017, para la versión actual de Bitcoin Knots. Guida describe esto como una medida extrema, útil si los mineros se negaran a señalizar su apoyo al BIP-110. La propuesta BIP-110 es un softfork temporal que busca limitar el almacenamiento de datos arbitrarios en las transacciones de Bitcoin, imponiendo restricciones más estrictas a nuevos outputs de transacción, campos OP_RETURN y datos testigos durante aproximadamente un año. Los defensores del BIP-110, como un usuario llamado Mechanic, argumentan que la mera posibilidad de un cambio en el algoritmo de minería podría disuadir a los mineros de oponerse a la propuesta. Subrayan que las reglas de Bitcoin deben ser establecidas por los usuarios y nodos, no por los mineros. Sin embargo, según la página de seguimiento oficial, el apoyo de los mineros al BIP-110 sigue siendo limitado por ahora. Todos los involucrados enfatizan que este plan para alterar el Proof-of-Work es solo una opción de último recurso en caso de una crisis de gobernanza.

cryptonews.ruHace 2 hora(s)

Partidarios de la actualización BIP-110 de Bitcoin preparan un plan de 'último recurso' si no se acepta la propuesta: esto podría cambiar radicalmente el valor de BTC

cryptonews.ruHace 2 hora(s)

¿Por qué el precio de Bitcoin se mantuvo resistente y no cayó a pesar del gran hackeo reciente? Este es el secreto

En una entrevista en el canal "El Lobo de Todas las Calles", expertos discutieron por qué el precio del bitcoin se mantuvo estable tras un hackeo de 100 millones de dólares en carteras frías individuales. Los analistas Ryan Rasmussen (Bitwise) y Matt Hougan (director de inversiones de Bitwise) destacaron la madurez del mercado, señalando un cambio de inversores individuales a institucionales. La mayoría de los nuevos inversores ahora acceden a través de ETFs o servicios regulados como Coinbase, por lo que las vulnerabilidades en carteras individuales afectan a una parte mínima del mercado y no generan pánico generalizado. Hougan añadió que el mercado actual es más resiliente, con vendedores agotados e inversores institucionales que sostienen los precios, reduciendo el impacto de las malas noticias. Tillman Holloway, CEO de Arch Public, describió este cambio como un "relevo de guardia", donde Wall Street y el capital institucional han tomado el control frente a mineros y exchanges individuales del pasado. Hougan también subrayó la divergencia entre el pesimismo en redes sociales y la visión a largo plazo de gigantes financieros como Morgan Stanley o UBS, que ven las correcciones como oportunidades de compra dentro de ciclos de 4 años. Rasmussen concluyó que gestores de carteras están asignando entre el 1% y el 6% a bitcoin, integrando el activo en índices financieros tradicionales y reduciendo el riesgo percibido.

cryptonews.ruHace 2 hora(s)

¿Por qué el precio de Bitcoin se mantuvo resistente y no cayó a pesar del gran hackeo reciente? Este es el secreto

cryptonews.ruHace 2 hora(s)

El fundador de Aave se opone rotundamente a los cambios planeados en Ethereum: «Podría causar daños significativos»

El fundador y consejero delegado de Aave, Stani Kulechov, se ha opuesto firmemente a una nueva propuesta de Ethereum (EIP) que busca limitar los ingresos por staking. Kulechov advirtió que la medida, que reduciría la rentabilidad al 0% si más del 50% del suministro total de ETH está en staking, podría dañar gravemente el ecosistema de Ethereum y la atractividad de ETH como activo de inversión. Argumentó que esta medida haría impredecible la rentabilidad del staking, haciéndola no rentable para muchos participantes. Señaló que los inversores institucionales, en particular, valoran flujos de caja predecibles, y podrían migrar a redes alternativas que ofrezcan rendimientos más estables, lo que supondría un coste significativo para la adopción de Ethereum. Kulechov también afirmó que una rentabilidad cero haría ineficaces las estrategias de préstamo y generación de ingresos basadas en ETH, reduciendo su uso principalmente a las ventas en corto. Predijo que los inversores podrían pasar a usar stablecoins u otros activos generadores de intereses, lo que reduciría drásticamente los mercados de préstamo y rendimiento en Ethereum. En su evaluación, concluyó que la propuesta debilitaría la viabilidad de ETH como activo y limitaría su potencial a largo plazo. Expresó su esperanza de que la propuesta no sea implementada, ya que de lo contrario muchos participantes podrían trasladar su actividad a otras redes blockchain. Subrayó que Ethereum no debe ser castigado por su crecimiento y que cualquier cambio en sus incentivos económicos debe ser evaluado cuidadosamente por su impacto en DeFi, el staking y la adopción institucional.

cryptonews.ruHace 3 hora(s)

El fundador de Aave se opone rotundamente a los cambios planeados en Ethereum: «Podría causar daños significativos»

cryptonews.ruHace 3 hora(s)

Trading

Spot
活动图片