Наконец-то, сестринская версия модели Xiaohongshu, набравшей полные баллы на IMO, стала открытой!
В прошлом месяце собственная большая модель Xiaohongshu «dots-note-3.0» установила исторический рекорд: ИИ впервые получил официально подтвержденные полные 42 балла на Международной олимпиаде по математике. С тех пор самым волнующим вопросом сообщества было, когда же модель станет открытой.

Адина Якуп, ответственный руководитель по исследованиям ИИ и экосистеме сообщества в HuggingFace. Источник: X Post
И сегодня лаборатория моделей dots Xiaohongshu (далее – лаборатория dots) объявила об открытии исходного кода dots3-note preview! Это также первая открытая версия в серии моделей dots3, нацеленная на более реалистичные и сложные для оценки длительные задачи.
По параметрам, общее количество параметров dots3-note preview составляет 280B, из которых активными являются 16B, поддерживается сверхдлинное контекстное окно в 512K, модель обладает способностями к мультимодальному пониманию текста, визуальной информации и речи и оптимизирована для сложных рассуждений, агентов и мультимодального восприятия.
API вход: https://dots.ai/platform/
Huggingface: https://huggingface.co/dots-studio/dots3-note-prev
GitHub:https://github.com/studio-dots-ai/dots3-note-prev
Полный балл на IMO подтвердил способности серии моделей к математическим рассуждениям и доказательствам. Это открытие переносит вызов в другую, еще более сложную для стандартизации сферу: планирование путешествий, подготовка к свадьбе, открытие магазина. У таких задач нет единственного ответа, а время их выполнения может растянуться на часы, дни или даже дольше.
Акцент dots3-note preview на длительных задачах также попадает в одну из ключевых линий развития современных агентов: от них начинают требовать независимого выполнения все более длинных и комплексных работ. OpenAI раскрыла, что в мае этого года более 70% пользователей поручали Codex выполнение работ, на которые у человека ушло бы более часа; к июню 1% наиболее активных внутренних пользователей OpenAI генерировали более 60 часов агентских взаимодействий в день.
Однако, когда задачи касаются разных сценариев, их сложность быстро расходится. В отличие от таких областей, как математика, программирование и инженерия, где агенты уже достаточно зрелы, реальная жизненная среда более открыта, а требования более размыты. Выбрав это в качестве своей «экзаменационной площадки», dots3-note предъявляет более высокие требования к собственным способностям к долгосрочному планированию, оценке и исправлению ошибок.
Судя по данным множества основных бенчмарков, во многих задачах на рассуждение и работу агентов модель может сравниться или даже превзойти модели значительно большего размера, а ее визуальные способности выделяются в своем сегменте по размеру.

Источник: официальный технический блог

Источник: официальный технический блог
Ранее Xiaohongshu уже открыла исходный код текстовой большой модели dots.llm1, мультиязычной модели анализа разметки документов dots.ocr и мультимодальной модели визуального понимания dots.vlm1. Последнее открытие дополняет пазл, добавив агента.
Прямое тестирование:
Может ли она действительно выполнять сложные задачи?
Реальные способности модели далеко не ограничиваются рейтингами. Далее на нескольких примерах посмотрим, как эта модель, сталкиваясь с задачами, где информация разрознена, шагов много, а среда постоянно меняется, способна независимо продвигаться и выдавать результаты.
Взять на себя управление «Slay the Spire II»
Сначала дадим dots3-note preview взять на себя управление партией в «Slay the Spire II».
Сложность этой игры в том, что выбор маршрута, карт, решение о борьбе с элитами, трата золота, выбор отдыха или улучшений в лагере – все это влияет на шансы выживания через десятки ходов. Локально оптимальный выбор может заложить проблемы для последующей битвы с боссом.
Модель не была специально обучена для этой игры, но смогла изучать механику карт и врагов на основе обратной связи от боев, одновременно управляя здоровьем, колодой, золотом и зельями, постоянно взвешивая выбор между магазином, лагерем и элитными боями, и дошла до 33 этажа.
С нуля решить ARC-AGI 3
В длительной задаче на рассуждение ARC-AGI 3 правила полностью неизвестны, модели нужно наблюдать за изображением, выдвигать гипотезы, а затем проверять их через действия.
dots3-note preview постепенно обнаружила правила синхронного движения двух блоков вверх-вниз и зеркального отражения слева-направо, а также изучила механизмы опасных клеток, подвижных маркеров, напорных выключателей и ворот.

Каждый раз, когда гипотеза оказывалась ошибочной, она запускала механизм Self-Critiquing для переоценки, записывая исправленные правила в memory.md. Этот файл похож на блокнот модели, постоянно сохраняющий динамическое понимание среды.


В итоге модель прошла все 6 уровней за 320 шагов.

Чтение изображений для решения проблем с ремонтом
Способность к непрерывному обучению и рассуждениям в конечном итоге должна возвращаться к реальной жизни.
Например, вот типичная проблема с ремонтом: одновременно загружаются план квартиры и скриншоты параметров двух холодильников, с дополнительной информацией: у стены кухни, прилегающей к кабинету, уже сделан столешница длиной 1,5 метра, теперь нужно поставить холодильник к этой стене – поместится ли он?
Ключевая информация разбросана по разным изображениям и текстовым описаниям. Модель должна объединить план квартиры, размеры существующей столешницы и спецификации двух холодильников, рассчитать оставшееся пространство на стене и дать вывод о возможности размещения. Она также активно напоминает пользователю о необходимости повторного замера на месте.
Весь процесс включает визуально-пространственное понимание, сложные рассуждения и использование инструментов, а также демонстрирует способность модели генерировать персонализированные ответы на основе реальной среды пользователя.

Используя тот же план квартиры, продолжим просить модель разработать несколько дизайнерских решений для кабинета в стиле массивной древесины.
Модель сохраняет ранее распознанные размеры и информацию об освещении, ищет соответствующие заметки в Xiaohongshu, организует четыре решения в стиле массивной древесины и генерирует веб-страницу, последовательно выполняя чтение изображений, вычисления, поиск и создание контента.

Сквозная разработка приложения для visionOS
Наконец, посмотрим, сможет ли dots3-note preview самостоятельно выполнить полную сквозную задачу по разработке программного обеспечения: «создать нативное приложение для Apple Vision Pro, вдохновившись дизайном Xiaohongshu».
Получив задачу, модель не спешила писать код. Сначала она поняла требования к продукту, изучив 9 изображений интерфейсов, и самостоятельно определила план разработки, включая использование технологий SwiftUI+RealityKit, планирование организации окон, иммерсивного пространства и 3D-демонстрации товаров. После утверждения плана она продолжила подготовку локальных изображений, 3D-моделей и других материалов, а затем поэтапно реализовала код.
Весь проект сгенерировал 12 файлов Swift, 1876 строк кода, реализовал интерфейсы ленты новостей, личной страницы, личных сообщений, товаров и интегрировал USDZ 3D-модели. Затем модель самостоятельно создала проект Xcode, вызвала xcodebuild для компиляции, проверила его в симуляторе visionOS и в итоге показала «BUILD SUCCEEDED».
От понимания требований и выбора технологий до реализации кода, компиляции и проверки – весь этот процесс разработки был успешно пройден от начала до конца.

Судя по конечному продукту, уже существует довольно полноценное пространственное взаимодействие. Ленту новостей можно прокручивать, заметки открываются на отдельной странице, личный профиль и личные сообщения могут разворачиваться в независимых окнах.

Пользователи также могут на странице покупок напрямую просматривать и переключаться между различными 3D-товарами.

Без стандартного ответа,
модель должна постоянно учиться и исправлять себя
Из нескольких примеров тестирования видно, что наиболее выдающаяся способность dots3-note preview заключается в том, чтобы одновременно исследовать и запоминать новую информацию, корректируясь при изменениях или ошибочных суждениях, пока не будет выдан результат. Как она этого достигает? Ключ в двух вещах: обучение и запоминание действительно полезной информации, а также своевременное обнаружение и исправление собственных ошибочных суждений.
Первой проблемой, которую пришлось решать лаборатории dots, был вопрос: может ли модель продолжать учиться у среды и пользователей после завершения обучения.
Чтобы обучить этой способности, лаборатория dots создала тысячи сверхдлинных новых сред, не зависящих от априорных знаний, где агент мог непрерывно исследовать ранее незнакомые сценарии, изучать новые правила и знания через взаимодействие со средой и использовать их для последующих решений. Более того, когда длина задачи значительно превышает контекстное окно модели, она не может постоянно полагаться на информацию, уже имеющуюся в контексте. Благодаря обучению с подкреплением, она постепенно научится тому, как сохранять информацию, полезную для решения последующих проблем. Эта способность была проверена на ARC-AGI 3.
Как видно из графика ниже, dots3-note preview набрала около 0,35 балла на ARC-AGI-3 при стоимости менее 500 долларов. Хотя абсолютный балл ниже, чем у Claude Opus 4.8 (high), эффективность по стоимости заметно выше.

Однако обучение такому процессу сталкивается с другой серьезной проблемой: стоимость исследования длительных задач слишком высока, агенту может потребоваться несколько часов на одно исследование. Если продолжать использовать методы обучения с подкреплением без промежуточных оценок, зависящие от финальной награды, часто приходится ждать завершения всей траектории, чтобы получить обучающий сигнал, что не только неэффективно, но и затрудняет определение, к какому конкретному шагу относится успех или неудача.
Такие методы, как PPO, могут смягчить эту проблему, но традиционный критик обычно оценивает ценность текущего состояния через одно прямое вычисление фиксированной сложности. Столкнувшись со сложными задачами агента, актер может многократно рассуждать, использовать инструменты и решать следующий шаг, а критик на это не способен, что легко приводит к неточной оценке текущего прогресса.
Лаборатория dots предложила TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization), который делит очень длинную траекторию на несколько макро-шагов, каждый из которых содержит несколько раундов взаимодействия модели со средой. После завершения этапа модель временно переключается с актера на критика и через рассуждения, использование инструментов и масштабирование во время тестирования оценивает, сколько вознаграждения можно получить в будущем из текущего состояния, затем превращая эту оценку в обучающий сигнал для еще незавершенной траектории.
Важно отметить, что в процессе обучения TEMPO модель должна учиться как действовать, так и оценивать, насколько хорошо она сейчас справляется. Благодаря такой самооценке, обучение с подкреплением можно применять к более длинным задачам и непрерывно оптимизировать поведение на длинных траекториях.
Результаты показывают, что преимущество TEMPO в основном проявляется после того, как задача входит в глубокую фазу. С увеличением количества раундов взаимодействия баллы GRPO и базовой контрольной точки стремятся к стагнации, в то время как TEMPO продолжает улучшаться. Что касается прогресса прохождения, то три подхода также заметно расходятся во второй половине задачи.

А после внедрения механизма Self-Critiquing способность dots3-note preview к самооценке оказалась сильнее, чем изначально предполагалось. Даже если агент еще не решил какую-то проблему, он может определить, какое из двух внешне похожих промежуточных состояний имеет больше шансов на прорыв.
Такая способность к самооценке, помимо использования в обучении с подкреплением, также проявляется на этапе рассуждений. Во время участия в IMO 2026, родственная версия dots3-note preview генерировала доказательства, одновременно многократно проверяя их с помощью инструментов, и, основываясь на результатах оценки, модифицировала и оптимизировала их, в итоге набрав полный балл.
В будущем лаборатория dots будет исследовать рекурсивную самооценку (recursive self-critiquing) в «открытых задачах», позволяя модели самостоятельно оценивать прогресс задачи при отсутствии четкого внешнего вознаграждения и на основе этого корректировать память и планировать последующие действия.
Комбинация Xiaohongshu «активная память + обучение с подкреплением на сверхдлинных траекториях + промежуточная самооценка» предлагает конкретное решение для внедрения длительных агентов в реальный мир.
Почему Xiaohongshu выбрала «длительных агентов для реальной жизни»?
Для сообщества Xiaohongshu, ориентированного на жизнь и интересы, оно естественным образом близко к таким задачам реальной жизни. Многие вопросы, которые пользователи обсуждают ежедневно, не только не имеют единственного ответа, но часто и сами пользователи не до конца понимают, чего они хотят в итоге.
Путешествия, свадьбы, ремонт, стиль одежды и т.д. сами по себе характеризуются разными предпочтениями, постоянно дополняемыми условиями и высокой плотностью мультимодальной информации. Xiaohongshu долгое время сталкивается именно с такими сложными длительными потребностями, поэтому естественно выбрала их в качестве ключевого направления исследований и применения агентов.
Агенты в таких областях, как математика, программирование и других, уже показали отрасли, что в средах с относительно четкими целями и проверяемыми результатами ИИ может разбивать сложные задачи на множество шагов и выполнять их в течение длительного времени. Условия реальной жизни гораздо сложнее, нет повсеместно доступных тестовых примеров, а цели и ограничения могут меняться вместе с задачей. Эта неопределенность еще более явно обнажает слабые места длительных агентов.
Два набора бенчмарков, открытых лабораторией dots, наглядно демонстрируют этот разрыв и недостатки.
Один из них – VibeSearchBench, который исследует «может ли агент разобраться, чего хочет пользователь, если тот не сразу четко сформулировал потребность». Он охватывает 20 областей и 200 задач. Оценка моделирует реального пользователя, постепенно дополняющего требования и ограничения в многораундовом диалоге, а затем проверяет, может ли модель точно понять, чего хочет пользователь.
Другой – VibeLifeBench, подчеркивающий изменения во времени и среде, исследующий «может ли агент успевать за изменениями после изменения внешних условий». Он охватывает 10 областей, 20 задач, каждая задача включает от 20 до 30 этапов и содержит 1247 атомарных проверок для контроля согласованности состояния, правильности выполнения инструментов и конечного результата.
Результаты показывают, что даже такие ведущие мировые модели, как Claude Opus 5 и GPT-5.5, не достигли установленного проходного уровня в этих двух наборах бенчмарков.

Слева – полный рейтинг VibeSearchBench, справа – полный рейтинг VibeLifeBench.
Домашняя страница VibeSearchBench:https://vibebench.github.io/VibeSearchBench.github.io/
Домашняя страница VibeLifeBench:https://vibebench.github.io/VibeLifeBench_homepage/
Эти результаты говорят об одном: модели уже достаточно сильны в выполнении сложных точечных задач высокой сложности, но устойчиво поддерживать эту способность в течение нескольких часов или дольше остается тем, с чем агенты пока не справляются. Исследования и планирование Xiaohongshu в этой области только начинаются.
dots3-note – самая легкая версия в серии dots3, и в настоящее время открытая версия preview все еще имеет возможности для дальнейшей оптимизации в плане опыта и деталей. По словам лаборатории dots, официальная версия dots3-note также будет открыта в ближайшее время. В будущем серия dots3 также представит jazz и aria, которые вместе с note составят три уровня, охватывающие различные требования к сложности задач, скорости отклика и вычислительным затратам.
Более подробную информацию о методах обучения смотрите в официальном техническом блоге (на китайском):https://studio.dots.ai/dots/dots3-zh.html
Эта статья взята с официального аккаунта WeChat «机器之心» (ID:almosthuman2014), автор: Машина, следящая за агентами, редакторы: Ду Вэй, Ян Вэнь





