¡Por fin, se ha liberado el código de la versión de la misma serie del modelo con puntuación perfecta IMO de Xiaohongshu!
El mes pasado, el modelo de gran tamaño desarrollado por Xiaohongshu «dots-note-3.0» estableció un récord histórico: por primera vez, una IA obtuvo una puntuación perfecta certificada oficialmente de 42 puntos en una competición oficial de la Olimpiada Internacional de Matemáticas. Desde entonces, la pregunta más importante para la comunidad era cuándo se liberaría el código del modelo.

Adina Yakup, responsable del ecosistema comunitario e investigación de IA en HuggingFace. Fuente: X Post
Justo hoy, el laboratorio de modelos dots de Xiaohongshu (en adelante, laboratorio dots) anunció la liberación del código de dots3-note preview! También es la primera versión de código abierto de la serie de modelos dots3, que se enfoca en tareas de largo recorrido más cercanas a la realidad y más difíciles de evaluar.
En cuanto a los parámetros, dots3-note preview tiene un total de 280B de parámetros, de los cuales 16B están activados, soporta una ventana de contexto ultra larga de 512K, posee capacidades multimodales de comprensión de texto, visión y voz, y está optimizado para razonamiento complejo, Agent y percepción multimodal.
Entrada API: https://dots.ai/platform/
Huggingface: https://huggingface.co/dots-studio/dots3-note-prev
GitHub:https://github.com/studio-dots-ai/dots3-note-prev
La puntuación perfecta en la IMO validó la capacidad de esta serie de modelos en razonamiento y demostración matemática. Esta liberación del código lleva el desafío a otro tipo de escenario más difícil de estandarizar: planificación de viajes, preparación de bodas, gestión de la apertura de un negocio. Este tipo de tareas no tienen una única respuesta, y el tiempo puede extenderse a varias horas, días o incluso más.
Dots3-note preview centra su esfuerzo en tareas de largo recorrido, lo que también coincide con una de las líneas principales del desarrollo actual de los Agent: se les está empezando a exigir que asuman trabajos cada vez más largos y completos de forma independiente. OpenAI reveló que en mayo de este año, más del 70% de los usuarios hacían que Codex manejara trabajos que a un humano le llevarían más de una hora completar; para junio, el 1% de usuarios activos con mayor uso interno en OpenAI generaban más de 60 horas de agent turns por día.
Sin embargo, cuando las tareas se trasladan a diferentes escenarios, la dificultad pronto se dispara. A diferencia de escenarios como matemáticas, código e ingeniería, donde los Agent ya muestran un rendimiento maduro, los entornos de la vida real son más abiertos y las necesidades más vagas. Dots3-note preview elige situar su "examen" aquí, planteando mayores exigencias a su propia capacidad de planificación, juicio y corrección de errores a largo plazo.
Según los datos de múltiples benchmarks principales, en múltiples tareas de razonamiento y agente, el modelo puede igualar o incluso superar a modelos de gran tamaño con parámetros varias veces mayores que los suyos, y su capacidad visual destaca en su rango de tamaño.

Fuente: blog técnico oficial

Fuente: blog técnico oficial
Anteriormente, Xiaohongshu ya había liberado gradualmente el código del modelo de gran lenguaje dots.llm1, el modelo de análisis de disposición de documentos multilingüe dots.ocr y el modelo de gran visión multimodal dots.vlm1. La última liberación de código completa la pieza del rompecabezas del Agent.
Prueba directa:
¿Puede realmente completar tareas complejas?
La capacidad real del modelo no se puede ver solo mirando las listas. A continuación, veremos a través de varios casos cómo este modelo avanza de forma independiente y entrega resultados cuando se enfrenta a tareas con información dispersa, muchos pasos y un entorno en constante cambio.
Tomar el control de «Slay the Spire II»
Primero, dejemos que dots3-note preview tome el control de una partida de «Slay the Spire II».
La dificultad de este juego radica en que elegir qué ruta, qué carta tomar, si desafiar a los élites, cómo gastar el oro, elegir descansar o mejorar en el campamento, todo afecta la probabilidad de supervivencia decenas de turnos después. La elección óptima local puede fácilmente sembrar problemas para la pelea contra el Jefe más adelante.
El modelo no había sido entrenado específicamente para este juego de antemano, pero fue capaz de aprender los mecanismos de las cartas y enemigos según la retroalimentación del combate, gestionando al mismo tiempo vida, mazo, oro y pociones, sopesando constantemente entre la tienda, el campamento y las peleas contra élites, llegando hasta el piso 33.
Resolver ARC-AGI 3 desde cero
En la tarea de razonamiento de largo recorrido ARC-AGI 3, las reglas son completamente desconocidas, y el modelo necesita observar las imágenes, plantear hipótesis y luego verificarlas mediante operaciones.
Dots3-note preview descubre gradualmente las reglas de sincronización vertical y espejo horizontal de dos bloques, y explora mecanismos como casillas peligrosas, marcadores móviles, interruptores de presión y compuertas.

Cada vez que una hipótesis es errónea, activa el mecanismo de Autocrítica para reevaluar, escribiendo las reglas corregidas en memory.md. Este archivo es similar al cuaderno de notas del modelo, guardando de forma continua la comprensión dinámica del entorno.


Finalmente, el modelo desbloquea los 6 niveles completos mediante 320 pasos de operación.

Resolver un problema de decoración leyendo imágenes
La capacidad de aprendizaje continuo y razonamiento finalmente debe volver a la vida real.
Por ejemplo, este típico problema de decoración: se suben simultáneamente un plano de distribución y capturas de pantalla de los parámetros de dos modelos de nevera, con información adicional: en la pared de la cocina cerca del estudio, ya se ha colocado una encimera de 1.5 metros de largo. Ahora se quiere colocar la nevera en esta pared, ¿cabrá realmente?
La información clave está dispersa en diferentes imágenes y descripciones de texto. El modelo necesita combinar el plano de distribución, las dimensiones de la encimera existente y las especificaciones de las dos neveras, calcular el espacio restante en la pared y dar una conclusión sobre la adaptación. Además, advierte activamente al usuario que verifique nuevamente las medidas en el lugar.
Todo el proceso involucra comprensión visual-espacial, razonamiento complejo y uso de herramientas, y también demuestra la capacidad del modelo para generar respuestas personalizadas basadas en el entorno real personal.

Continuando con el plano de distribución anterior, se le pide al modelo que diseñe varios esquemas de decoración de estilo madera maciza para el estudio.
El modelo conserva la información de dimensiones y luz natural identificada previamente, busca notas relacionadas en Xiaohongshu, organiza cuatro conjuntos de soluciones de estilo madera maciza y genera páginas web, completando de forma continua la lectura de imágenes, cálculo, recuperación y generación de contenido.

Desarrollar una aplicación visionOS de principio a fin
Finalmente, veamos si dots3-note preview puede completar de forma independiente una tarea completa de ingeniería de software de principio a fin: "Referenciando el diseño de Xiaohongshu, desarrollar una aplicación nativa para Apple Vision Pro".
Al recibir la tarea, el modelo no se apresuró a escribir código. Primero comprendió los requisitos del producto y, refiriéndose a 9 imágenes de interfaz, determinó de forma autónoma el plan de desarrollo, incluyendo adoptar la ruta técnica SwiftUI+RealityKit, planificar la organización de ventanas, espacios inmersivos y exhibición de productos 3D, entre otros módulos. Después de definir el plan, continuó preparando materiales como imágenes locales y modelos 3D, para luego completar paso a paso la implementación del código.
Todo el proyecto generó 12 archivos Swift, 1876 líneas de código, implementando interfaces para el flujo de información, página personal, mensajes privados, productos, etc., e integrando modelos 3D USDZ. Posteriormente, el modelo generó automáticamente el proyecto Xcode, llamó a xcodebuild para compilar y realizó la verificación en el visionOS Simulator, mostrando finalmente "BUILD SUCCEEDED".
Desde la comprensión de los requisitos y la selección de tecnología hasta la implementación del código, compilación y verificación, todo este flujo de desarrollo fue finalmente ejecutado de principio a fin.

Viendo el producto final, ya posee un conjunto de interacciones espaciales bastante completas. El flujo de información se puede desplazar, las notas pueden entrar en la página de detalles, la página personal y los mensajes privados se pueden expandir como ventanas independientes.

Los usuarios también pueden ver y cambiar directamente entre diferentes productos 3D en la interfaz de compras.

Sin respuesta estándar,
el modelo debe aprender continuamente y corregirse a sí mismo
Según las pruebas realizadas, la capacidad más destacada de dots3-note preview es explorar, recordar nueva información al mismo tiempo, ajustarse cuando encuentra cambios o errores de juicio, hasta entregar el resultado. ¿Cómo lo hace? La clave está en dos cosas: aprender y recordar información realmente útil, y detectar y corregir oportunamente las desviaciones en su propio juicio.
El primer problema que el laboratorio dots debe resolver es: después de finalizar el entrenamiento, ¿puede el modelo seguir aprendiendo continuamente del entorno y de los usuarios?
Para entrenar esta capacidad, el laboratorio dots construyó miles de entornos novedosos de largo recorrido que no dependen de conocimiento previo, permitiendo que el Agent explore continuamente en escenarios previamente desconocidos, aprendiendo nuevas reglas y conocimientos a través de la interacción con el entorno, para su uso en decisiones posteriores. Además, cuando la longitud de la tarea excede significativamente la ventana de contexto del modelo, este no puede depender siempre de la información ya presente en el contexto. Después del entrenamiento por aprendizaje reforzado, aprenderá gradualmente cómo retener información útil para resolver problemas posteriores. Esta capacidad ya ha sido validada en ARC-AGI 3.
En la siguiente imagen se puede ver que dots3-note preview obtuvo aproximadamente 0.35 puntos en ARC-AGI-3 con un costo de menos de 500 dólares. Aunque la puntuación absoluta es inferior a la de Claude Opus 4.8 (high), la eficiencia de costo es claramente mayor.

Pero entrenar un proceso así presenta otro gran problema: el costo de exploración de tareas de largo recorrido es muy alto, un Agent puede tardar más de diez horas en completar una exploración. Si se continúa utilizando métodos de aprendizaje reforzado sin valor que dependen de recompensas finales, a menudo hay que esperar a que termine toda la trayectoria para obtener una señal de entrenamiento, lo que no solo es ineficiente, sino que también hace difícil determinar a qué paso concreto se atribuye el éxito o fracaso final.
Métodos actor-critic como PPO pueden aliviar este problema, pero el crítico tradicional generalmente estima el valor del estado actual mediante un cálculo hacia adelante de potencia computacional fija. Ante tareas complejas de Agent, el actor puede razonar repetidamente, llamar a herramientas y luego decidir el siguiente paso, algo que el crítico no puede hacer, lo que fácilmente lleva a una evaluación imprecisa del progreso actual.
El laboratorio dots propuso TEMPO (Estimación de Valor Escalada en Tiempo de Prueba con Optimización de Políticas de Macro-pasos), que divide una trayectoria muy larga en múltiples macro-pasos, cada uno de los cuales contiene múltiples rondas de interacción entre el modelo y el entorno. Al finalizar una fase, el modelo cambia temporalmente de actor a crítico, y a través de razonamiento, llamadas a herramientas y escalado en tiempo de prueba, estima cuánta recompensa puede obtener en el futuro desde el estado actual, convirtiendo luego esta evaluación en una señal de entrenamiento para trayectorias aún no finalizadas.
Vale la pena señalar que, durante el entrenamiento de TEMPO, el modelo debe aprender tanto cómo actuar como cómo evaluarse a sí mismo en su desempeño actual. Con esta autoevaluación, el entrenamiento por aprendizaje reforzado puede aplicarse a tareas más largas y optimizar continuamente el comportamiento en trayectorias largas.
Los resultados muestran que la ventaja de TEMPO aparece principalmente cuando la tarea entra en aguas profundas. A medida que aumentan las rondas de interacción, la puntuación de GRPO y del punto de control Base tiende a estancarse, mientras que TEMPO puede seguir mejorando. En cuanto al progreso de superación, los tres también muestran una clara diferencia en la segunda mitad de la tarea.

Y después de introducir el mecanismo de Autocrítica, la capacidad de autoevaluación de dots3-note preview resultó ser más fuerte de lo inicialmente previsto. Incluso si un problema aún no ha sido resuelto por el Agent, puede juzgar cuál de dos estados intermedios superficialmente similares tiene más posibilidades de lograr un avance.
Esta capacidad de autoevaluación no solo se usa en el entrenamiento por aprendizaje reforzado, sino que también se refleja en la fase de razonamiento. En la participación previa en la IMO 2026, la versión de rama de la misma serie de dots3-note preview generaba pruebas mientras las verificaba repetidamente a través de llamadas a herramientas, modificando y optimizando según los resultados de la evaluación, obteniendo finalmente la puntuación perfecta.
En el futuro, el laboratorio dots explorará la autocrítica recursiva (recursive self-critiquing) en "tareas abiertas", permitiendo que el modelo, en ausencia de una recompensa externa clara, pueda juzgar por sí mismo el progreso de la tarea y ajustar la memoria y planificación de acciones posteriores en consecuencia.
La combinación de Xiaohongshu "memoria activa + aprendizaje reforzado de trayectorias ultra largas + autoevaluación intermedia" ofrece una solución concreta para que los Agent de largo recorrido entren en el mundo real.
¿Por qué Xiaohongshu elige "Agent de largo recorrido para la vida real"?
Para Xiaohongshu, una comunidad de intereses y estilos de vida, está naturalmente cerca de este tipo de tareas de la vida real. Muchos de los temas que los usuarios discuten diariamente no solo no tienen una única respuesta, sino que muchas veces ni siquiera los usuarios mismos tienen claro lo que finalmente quieren.
Viajes, bodas, decoración del hogar, estilo personal, etc., tienen intrínsecamente características como preferencias variadas, condiciones que se complementan constantemente e información multimodal densa. Xiaohongshu se ha enfrentado durante mucho tiempo a este tipo de demandas complejas de largo recorrido, por lo que naturalmente las toma como escenario clave de investigación y aplicación para sus Agent.
Los Agent en otras áreas como matemáticas y código ya han permitido a la industria ver que, en entornos con objetivos relativamente claros y resultados verificables, la IA puede descomponer tareas complejas en numerosos pasos y ejecutarlos continuamente durante mucho tiempo. Las condiciones en la vida real son mucho más complicadas, no hay casos de prueba disponibles en todas partes, y los objetivos y restricciones pueden cambiar junto con la tarea. Esta ambigüedad expone más claramente las debilidades de los Agent de largo recorrido.
Los dos conjuntos de benchmarks liberados por el laboratorio dots muestran esta brecha y deficiencia de forma intuitiva.
Uno es VibeSearchBench, que examina "cuando el usuario no expresa claramente su necesidad de una vez, ¿puede el Agent entender lo que realmente quiere?", cubriendo 20 dominios y 200 tareas. La evaluación simula usuarios reales que complementan gradualmente necesidades y condiciones de restricción en diálogos de múltiples turnos, para ver si el modelo puede entender con precisión lo que el usuario desea.
El otro es VibeLifeBench, que enfatiza cambios de tiempo y entorno, examinando "después de que cambian las condiciones externas, ¿puede el Agent seguir el ritmo?", cubre 10 dominios, 20 tareas, cada tarea contiene de 20 a 30 etapas, y establece 1247 verificaciones atómicas, utilizadas para comprobar si el estado puede mantenerse consistente, si las herramientas se ejecutan correctamente y qué se entrega finalmente.
Los resultados muestran que incluso modelos líderes globales como Claude Opus 5 y GPT-5.5 no alcanzaron el nivel de aprobación establecido en estos dos conjuntos de benchmarks.

La izquierda muestra la lista completa de VibeSearchBench, la derecha muestra la lista completa de VibeLifeBench.
Página principal de VibeSearchBench:https://vibebench.github.io/VibeSearchBench.github.io/
Página principal de VibeLifeBench:https://vibebench.github.io/VibeLifeBench_homepage/
Estos resultados indican una cosa: los modelos ya son lo suficientemente fuertes en tareas puntuales de alta dificultad, pero mantener esta capacidad de forma estable durante varias horas o más, sigue siendo un punto donde los Agent no llegan. La exploración y planificación de Xiaohongshu sobre esto acaba de comenzar.
Dots3-note es la versión más ligera de la serie dots3, y la versión preview actualmente liberada aún tiene espacio para optimización en experiencia y detalles. Según revela el laboratorio dots, la versión oficial de dots3-note también será liberada próximamente. En el futuro, la serie dots3 también lanzará jazz y aria, formando tres niveles junto con note, cubriendo necesidades de aplicación con diferente complejidad de tareas, velocidad de respuesta y costo computacional.
Más detalles sobre los métodos de entrenamiento en el blog técnico oficial (chino):https://studio.dots.ai/dots/dots3-zh.html
Este artículo proviene del WeChat Official Account "机器之心" (ID:almosthuman2014), autor: 关注Agent的机器之心, editor: 杜伟、杨文





