Un modelo pequeño de 3B con puntuación de programación comparable a Opus 4.5, un modelo misterioso genera debate, resulta ser chino

marsbitPublicado a 2026-06-18Actualizado a 2026-06-18

Resumen

Un pequeño modelo de 3B parámetros, VibeThinker-3B, desarrollado por el equipo de Sina Weibo, está generando revuelo al alcanzar un rendimiento en tareas de razonamiento verificable (como programación) comparable al de modelos líderes como GPT-5, Claude Opus 4.5 o Gemini 3 Pro, a pesar de su tamaño significativamente menor. Basado en Qwen2.5-Coder-3B, el modelo fue entrenado con un proceso "Spectrum-to-Signal" que incluye fine-tuning supervisado en dos etapas con aprendizaje curricular, aprendizaje por refuerzo aplicado a múltiples dominios (matemáticas, programación, razonamiento STEM) y destilación de conocimiento. También incorpora una estrategia de evaluación de confiabilidad "Claim-Level" (CLR) para mejorar aún más los resultados en benchmarks. Sus puntuaciones sobresalientes incluyen 94.3 en AIME26, 80.2 en LiveCodeBench v6 y una tasa de aprobación del 96.1% en competiciones recientes de LeetCode. Los autores proponen la "hipótesis de compresión paramétrica", sugiriendo que el razonamiento verificable es una capacidad altamente comprimible que puede alcanzar niveles de vanguardia en modelos pequeños cuando las tareas tienen una estructura clara y señales de feedback confiables, desacoplándose parcialmente del conocimiento factual que requiere más parámetros. El objetivo no es reemplazar a los modelos grandes, sino explorar los límites de los modelos pequeños en dominios específicos. El modelo está disponible públicamente, aunque su rendimiento es intencionalmente esp...

En los últimos días, un modelo pequeño de 3B se ha vuelto viral en X porque, en algunas tareas de razonamiento con verificación de dificultad (como la programación), ha entrado en el rango de rendimiento de modelos de vanguardia como Gemini 3 Pro, GPT-5 high, Claude Opus 4.5, GLM-5, Kimi K2.5, y su tamaño es mucho menor que el de estos modelos.

Este modelo se llama VibeThinker-3B, es un modelo denso de razonamiento con 3 mil millones de parámetros, diseñado para explorar hasta qué punto se puede impulsar la capacidad de razonamiento verificable en un modelo pequeño y estricto.

Después del lanzamiento del modelo, muchas personas quedaron impresionadas con sus resultados y expresaron su deseo de probarlo.

Vale la pena señalar que también es un modelo chino, proveniente del equipo de Sina Weibo.

El informe técnico muestra que el modelo está diseñado específicamente para tareas con señales de verificación confiables, incluyendo razonamiento matemático, programación competitiva, razonamiento STEM y ejecución de instrucciones con restricciones claras.

Por lo tanto, tiene un rendimiento sobresaliente en varias pruebas de referencia. Obtuvo una puntuación de 94.3 en la prueba AIME26, 89.3 en HMMT25, 80.2 (Pass@1) en LiveCodeBench v6, y logró una tasa de aprobación del 96.1% en los concursos semanales y quincenales más recientes y no públicos de LeetCode entre el 25 de abril y el 31 de mayo de 2026.

¿Cómo se entrenó este modelo? El informe técnico revela algunos detalles.

Primero, se basa en Qwen2.5-Coder-3B y utiliza un proceso actualizado de Spectrum-to-Signal para el post-entrenamiento. Este proceso reforzó la síntesis de datos, el filtrado de calidad y el aprendizaje curricular en el ajuste fino supervisado (SFT), extendió el aprendizaje por refuerzo al estilo MGPO a múltiples dominios verificables, conservó trayectorias completas de razonamiento de contexto largo y consolidó las capacidades mediante auto-distilación fuera de línea y aprendizaje por refuerzo de instrucciones (Instruct RL).

Flujo de entrenamiento general de VibeThinker-3B

Proceso Spectrum-to-Signal.

Además, VibeThinker-3B introduce la evaluación de confiabilidad a nivel de afirmación (CLR), una estrategia de escalado en tiempo de prueba para razonamiento verificable orientado a respuestas. CLR mejora aún más el rendimiento en pruebas de referencia matemáticas, elevando AIME26 de 94.3 a 97.1, HMMT25 de 89.3 a 95.4, y llevando BruMO25 a 99.2.

Su flujo de entrenamiento específico es el siguiente:

  • SFT en dos etapas basado en currículum. La primera etapa se centra en la cobertura amplia de capacidades como razonamiento matemático, programación, STEM, diálogo general y seguimiento de instrucciones. La segunda etapa se orienta hacia muestras de razonamiento más difíciles y de mayor alcance. La destilación de exploración de diversidad se usa para conservar múltiples rutas de solución efectivas.
  • Aprendizaje por refuerzo de razonamiento en múltiples dominios. VibeThinker-3B reutiliza MGPO. El aprendizaje por refuerzo se aplica secuencialmente a tareas de razonamiento matemático, de programación y STEM. El entrenamiento utiliza una única ventana de contexto largo de 64K para conservar trayectorias completas de razonamiento de largo plazo.
  • Auto-distilación fuera de línea. Se filtran y refinan trayectorias de alta calidad desde los puntos de control de RL matemático, de programación y STEM, formando finalmente un modelo de estudiante unificado. La puntuación de potencial de aprendizaje prioriza aquellas trayectorias correctas que el estudiante aún no imita bien.
  • Instruct RL. La etapa final mejora la controlabilidad ante indicaciones orientadas al usuario. Para datos instructivos sensibles al formato y de tipo abierto, se utilizan verificadores basados en reglas y modelos de recompensa basados en criterios de evaluación.

En una publicación reciente, el reconocido investigador y blogger de IA Sebastian Raschka resumió sistemáticamente los puntos clave revelados en el informe técnico de VibeThinker-3B, incluyendo los siguientes:

Si estás interesado en este contenido, puedes consultar su informe técnico en detalle. Actualmente, el modelo también está disponible para descarga pública.

Título del informe: VibeThinker-3B: Explorando la frontera del razonamiento verificable en modelos de lenguaje pequeños

Enlace al informe: https://arxiv.org/pdf/2606.16140

Enlace de HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B

Sin embargo, el ámbito de aplicación de este modelo tiene limitaciones claras, ya que no sobresale en áreas que requieren conocimiento general.

Los autores también señalan esto claramente y proponen la "hipótesis de compresión paramétrica por cobertura": diferentes capacidades dependen de los parámetros del modelo de maneras radicalmente distintas. El razonamiento verificable se acerca más a una capacidad altamente compresible y paramétricamente densa, cuyo núcleo reside en el razonamiento de múltiples pasos, la satisfacción de restricciones, la autocorrección y la verificación de respuestas. Cuando el espacio de tareas es suficientemente estructurado y las señales de retroalimentación son lo suficientemente confiables, los modelos compactos también pueden poseer capacidades de razonamiento cercanas a la vanguardia. En contraste, el conocimiento de dominio abierto, el diálogo general y la comprensión de escenarios de cola larga dependen más de grandes parámetros para cubrir ampliamente hechos, conceptos y conocimiento del mundo. Esta hipótesis es muy reveladora. VentureBeat escribió en su reportaje: "Revela que existe un desacoplamiento parcial entre la capacidad de razonamiento y el conocimiento fáctico, y que la primera puede comprimirse de manera más eficiente de lo que se pensaba — una perspectiva que tiene implicaciones profundas en cómo la industria ve el diseño de modelos, los costos de implementación y la accesibilidad de funciones avanzadas de IA."

Los autores indican que su objetivo no es crear un modelo pequeño que reemplace a los modelos grandes, sino examinar los límites reales de los modelos pequeños a lo largo de dimensiones de capacidad específicas. Con VibeThinker-3B, esperan mostrar que los modelos pequeños no deben verse meramente como una solución de compromiso para reducir los costos de implementación. En dominios de capacidad con mecanismos claros de retroalimentación y verificación, los modelos de lenguaje pequeños están mostrando una vía de investigación prometedora para lograr un rendimiento de nivel de vanguardia, formando una relación fundamentalmente complementaria con el paradigma tradicional de escalado de parámetros.

Actualmente, el modelo aún enfrenta algunas dudas en la comunidad. Si estás interesado en este modelo, puedes probarlo personalmente.

Enlaces de referencia:

https://x.com/orcus108/status/2066876960073281582

Este artículo es de la cuenta oficial de WeChat "机器之心" (ID: almosthuman2014), autor: Zhang Qian.

Preguntas relacionadas

Q¿Qué es el modelo VibeThinker-3B y por qué ha generado tanto interés?

AVibeThinker-3B es un modelo de lenguaje pequeño de 3.000 millones de parámetros desarrollado por el equipo de Sina Weibo. Ha generado interés porque, a pesar de su tamaño reducido, alcanza un rendimiento en tareas de razonamiento verificable (como programación) comparable al de modelos de última generación mucho más grandes como GPT-5, Claude Opus 4.5 o Gemini 3 Pro.

Q¿En qué tipo de tareas sobresale específicamente el VibeThinker-3B?

AEl VibeThinker-3B está especializado y sobresale en tareas de razonamiento con señales de verificación confiables, como razonamiento matemático, programación competitiva, razonamiento STEM (Ciencia, Tecnología, Ingeniería y Matemáticas) y ejecución de instrucciones con restricciones claras.

Q¿Cuál es la base del modelo y cuál fue su proceso de entrenamiento clave?

AEl modelo se construyó sobre la base de Qwen2.5-Coder-3B. Su proceso de entrenamiento clave fue el 'Spectrum-to-Signal', que incluyó ajuste fino supervisado (SFT) con datos sintéticos y filtrados, aprendizaje por refuerzo aplicado a múltiples dominios, destilación automática fuera de línea y aprendizaje por refuerzo con instrucciones (Instruct RL) para consolidar capacidades.

Q¿Qué hipótesis importante plantea el equipo detrás de VibeThinker-3B sobre las capacidades de los modelos?

APlantean la 'hipótesis de cobertura de compresión de parámetros'. Esta sugiere que la capacidad de razonamiento verificable (lógica, resolución de problemas) está parcialmente disociada del conocimiento fáctico general y es altamente compresible. Por lo tanto, un modelo pequeño y denso puede alcanzar un rendimiento de vanguardia en tareas con retroalimentación clara, mientras que el conocimiento de dominio abierto requiere más parámetros.

Q¿Dónde se puede encontrar más información técnica y acceder al modelo VibeThinker-3B?

AEl informe técnico titulado 'VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models' está disponible en arXiv: https://arxiv.org/pdf/2606.16140. El modelo puede descargarse públicamente desde HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B.

Lecturas Relacionadas

35.000 millones de dólares en pérdidas: Leopold Aschenbrenner, estrella de OpenAI, vende su cartera bursátil

El fondo de cobertura Situational Awareness LP, fundado por Leopold Aschenbrenner, ex de OpenAI, vendió toda su cartera de acciones públicas (tanto largas como cortas) en una gran transacción a Citadel de Ken Griffin. Los activos del fondo cayeron a unos 10.000 millones de dólares. Esta venta forzada se debió a llamadas de margen de sus principales corredores (Bank of America, Goldman Sachs, JPMorgan Chase) tras fuertes pérdidas por la caída de acciones de infraestructura de IA (como SK Hynix) y movimientos adversos en posiciones cortas (como Adobe). El fondo, lanzado tras la salida de Aschenbrenner de OpenAI en 2024, había registrado una rentabilidad neta del 439% en el primer semestre de 2026. Su cartera pública incluía acciones como Nebius Group, Sandisk, Micron y CoreWeave, que cayeron más de un 30-35% en julio de 2026. Situational Awareness conserva inversiones privadas, incluida una participación en Anthropic valorada en unos 5.000 millones de dólares, y continuará como estructura de inversión privada. El caso recuerda al colapso de Archegos Capital en 2021, destacando los riesgos sistémicos del apalancamiento oculto y las apuestas concentradas en un sector, esta vez el de infraestructura de IA. La transacción con Citadel se cerró a finales de julio de 2026 tras negociaciones con otros actores como Millennium.

cryptonews.ruHace 8 min(s)

35.000 millones de dólares en pérdidas: Leopold Aschenbrenner, estrella de OpenAI, vende su cartera bursátil

cryptonews.ruHace 8 min(s)

Punto de inflexión del mercado alcista de la IA: Desapalancamiento masivo, exceso de capacidad computacional, ¿por qué este analista macroeconómico es completamente bajista?

El analista Geo Chen de Fidenza Macro explica por qué liquidó todas sus posiciones en semiconductores e infraestructura de IA en junio y ahora tiene una visión bajista completa sobre el mercado. Identifica cuatro factores principales: 1. **Fin del mercado alcista de la IA:** La fase final de la subida fue impulsada por compradores minoristas coreanos que utilizaban ETF apalancados de alto riesgo, creando una burbuja. La posterior liquidación masiva eliminó cientos de miles de millones de dólares del mercado. Además, el auge de los modelos de IA de código abierto chinos (como Kimi K3 y Qwen 3.8) está erosionando la ventaja competitiva y los márgenes de los laboratorios privados como OpenAI y Anthropic, amenazando sus elevadas valoraciones. 2. **Exceso de capacidad de cómputo inminente:** A pesar de la escasez actual, Chen argumenta que el enorme volumen de capacidad de procesamiento comprometida por los grandes proveedores de la nube conducirá a un exceso de oferta en uno o dos años, similar a los ciclos de materias primas. Los índices de gasto en tokens ya han alcanzado su punto máximo y se están reduciendo, mientras que los diferenciales de los bonos de los centros de datos de IA se están ampliando, lo que indica un mayor riesgo crediticio. 3. **Guerra en Irán como fuerza estanflacionaria:** El conflicto se está convirtiendo en un pantano prolongado que interrumpe el suministro global de energía y aumenta los costos, ejerciendo una presión alcista persistente sobre la inflación y el gasto gubernamental. 4. **La credibilidad de la Reserva Federal bajo presión:** Bajo el nuevo presidente Kevin Warsh, la Fed se enfrenta al difícil equilibrio de controlar la inflación en un entorno de shocks de oferta sin desencadenar una recesión. Su aparente reticencia a endurecer la política de inmediato está erosionando su credibilidad, lo que lleva a un fuerte aumento de los rendimientos de los bonos a largo plazo (por encima del 5,2%), lo que supone un nuevo viento en contra para el mercado de valores. En conjunto, Chen cree que estos factores están creando las condiciones para un cambio de ciclo marcado por la estanflación y una corrección significativa del mercado.

marsbitHace 11 min(s)

Punto de inflexión del mercado alcista de la IA: Desapalancamiento masivo, exceso de capacidad computacional, ¿por qué este analista macroeconómico es completamente bajista?

marsbitHace 11 min(s)

Said Al-Marri: Cómo la tokenización abre nuevas oportunidades para los fondos de transporte marítimo

Durante siglos, la propiedad de buques mercantes ha sido un activo de alto capital, accesible principalmente a grandes fondos institucionales. Saïd Al-Marray, CEO de Ethra Invest, propone eliminar estas barreras mediante la tokenización de activos reales (RWA) en blockchain. Esto permite a pequeños inversores participar en el sector marítimo a través de unidades digitales, mejorando la transparencia y eficiencia. Sin embargo, Al-Marray advierte que la tokenización no es una solución mágica para la liquidez ni un atajo regulatorio; la ejecución legal sobre un buque físico aún depende de tribunales marítimos tradicionales y de estructuras legales como las Sociedades de Propósito Específico (SPV). Además, aunque los contratos inteligentes y las stablecoins pueden agilizar pagos y administración, no reemplazan completamente instrumentos como los créditos documentarios, ya que el transporte marítimo requiere verificación física y manejo de contingencias complejas. El mayor desafío actual es la descarbonización de la flota para 2050, que requiere grandes inversiones en combustibles alternativos. Ethra adopta un enfoque conservador, priorizando la protección del capital mediante una evaluación integral de riesgos. En definitiva, la evolución del financiamiento marítimo no se trata solo de adoptar blockchain, sino de movilizar capital de manera pragmática para construir una flota global moderna y sostenible.

cryptonews.ruHace 28 min(s)

Said Al-Marri: Cómo la tokenización abre nuevas oportunidades para los fondos de transporte marítimo

cryptonews.ruHace 28 min(s)

Trading

Spot
活动图片