Только что Xiaohongshu открыл исходный код dots3-note: представлена серия моделей, набравших полные 42 балла IMO

marsbitОпубликовано 2026-08-14Обновлено 2026-08-14

Введение

Только что Xiaohongshu открыл исходный код модели dots3-note, предварительной версии той же серии, которая получила идеальные 42 балла на Международной математической олимпиаде (IMO). Эта модель с общим количеством параметров 280B, активными параметрами 16B и поддержкой сверхдлинного контекста до 512K токенов оптимизирована для сложных рассуждений, работы агентов и мультимодального восприятия. Модель фокусируется на долгосрочных задачах реального мира, таких как планирование путешествий, организация свадьбы или ведение бизнеса, где нет единственного правильного ответа. Тестирование показало её способности: прохождение 33 уровней в игре «Slay the Spire II» без специального обучения, решение всех 6 головоломок ARC-AGI 3 путём формирования и проверки гипотез, решение практических задач (например, расчёт возможности установки холодильника на кухне на основе плана и характеристик) и даже полная самостоятельная разработка приложения для visionOS на SwiftUI с нуля. Ключевые способности модели включают непрерывное обучение в новых средах, запоминание полезной информации и самоисправление с помощью механизма Self-Critiquing. Для их развития лаборатория dots использовала обучение с подкреплением на тысячах длинных новых сред и предложила метод TEMPO для более эффективной оценки промежуточных прогрессов в долгих задачах. Лаборатория также представила два тестовых набора для оценки подобных агентов: VibeSearchBench (понимание нечётких, уточняемых пользователем запросов) и VibeLifeBenc...

Наконец-то, сестринская версия модели Xiaohongshu, набравшей полные баллы на IMO, стала открытой!

В прошлом месяце собственная большая модель Xiaohongshu «dots-note-3.0» установила исторический рекорд: ИИ впервые получил официально подтвержденные полные 42 балла на Международной олимпиаде по математике. С тех пор самым волнующим вопросом сообщества было, когда же модель станет открытой.

Адина Якуп, ответственный руководитель по исследованиям ИИ и экосистеме сообщества в HuggingFace. Источник: X Post

И сегодня лаборатория моделей dots Xiaohongshu (далее – лаборатория dots) объявила об открытии исходного кода dots3-note preview! Это также первая открытая версия в серии моделей dots3, нацеленная на более реалистичные и сложные для оценки длительные задачи.

По параметрам, общее количество параметров dots3-note preview составляет 280B, из которых активными являются 16B, поддерживается сверхдлинное контекстное окно в 512K, модель обладает способностями к мультимодальному пониманию текста, визуальной информации и речи и оптимизирована для сложных рассуждений, агентов и мультимодального восприятия.

API вход: https://dots.ai/platform/

Huggingface: https://huggingface.co/dots-studio/dots3-note-prev

GitHub:https://github.com/studio-dots-ai/dots3-note-prev

Полный балл на IMO подтвердил способности серии моделей к математическим рассуждениям и доказательствам. Это открытие переносит вызов в другую, еще более сложную для стандартизации сферу: планирование путешествий, подготовка к свадьбе, открытие магазина. У таких задач нет единственного ответа, а время их выполнения может растянуться на часы, дни или даже дольше.

Акцент dots3-note preview на длительных задачах также попадает в одну из ключевых линий развития современных агентов: от них начинают требовать независимого выполнения все более длинных и комплексных работ. OpenAI раскрыла, что в мае этого года более 70% пользователей поручали Codex выполнение работ, на которые у человека ушло бы более часа; к июню 1% наиболее активных внутренних пользователей OpenAI генерировали более 60 часов агентских взаимодействий в день.

Однако, когда задачи касаются разных сценариев, их сложность быстро расходится. В отличие от таких областей, как математика, программирование и инженерия, где агенты уже достаточно зрелы, реальная жизненная среда более открыта, а требования более размыты. Выбрав это в качестве своей «экзаменационной площадки», dots3-note предъявляет более высокие требования к собственным способностям к долгосрочному планированию, оценке и исправлению ошибок.

Судя по данным множества основных бенчмарков, во многих задачах на рассуждение и работу агентов модель может сравниться или даже превзойти модели значительно большего размера, а ее визуальные способности выделяются в своем сегменте по размеру.

Источник: официальный технический блог

Источник: официальный технический блог

Ранее Xiaohongshu уже открыла исходный код текстовой большой модели dots.llm1, мультиязычной модели анализа разметки документов dots.ocr и мультимодальной модели визуального понимания dots.vlm1. Последнее открытие дополняет пазл, добавив агента.

Прямое тестирование:

Может ли она действительно выполнять сложные задачи?

Реальные способности модели далеко не ограничиваются рейтингами. Далее на нескольких примерах посмотрим, как эта модель, сталкиваясь с задачами, где информация разрознена, шагов много, а среда постоянно меняется, способна независимо продвигаться и выдавать результаты.

Взять на себя управление «Slay the Spire II»

Сначала дадим dots3-note preview взять на себя управление партией в «Slay the Spire II».

Сложность этой игры в том, что выбор маршрута, карт, решение о борьбе с элитами, трата золота, выбор отдыха или улучшений в лагере – все это влияет на шансы выживания через десятки ходов. Локально оптимальный выбор может заложить проблемы для последующей битвы с боссом.

Модель не была специально обучена для этой игры, но смогла изучать механику карт и врагов на основе обратной связи от боев, одновременно управляя здоровьем, колодой, золотом и зельями, постоянно взвешивая выбор между магазином, лагерем и элитными боями, и дошла до 33 этажа.

С нуля решить ARC-AGI 3

В длительной задаче на рассуждение ARC-AGI 3 правила полностью неизвестны, модели нужно наблюдать за изображением, выдвигать гипотезы, а затем проверять их через действия.

dots3-note preview постепенно обнаружила правила синхронного движения двух блоков вверх-вниз и зеркального отражения слева-направо, а также изучила механизмы опасных клеток, подвижных маркеров, напорных выключателей и ворот.

Каждый раз, когда гипотеза оказывалась ошибочной, она запускала механизм Self-Critiquing для переоценки, записывая исправленные правила в memory.md. Этот файл похож на блокнот модели, постоянно сохраняющий динамическое понимание среды.

В итоге модель прошла все 6 уровней за 320 шагов.

Чтение изображений для решения проблем с ремонтом

Способность к непрерывному обучению и рассуждениям в конечном итоге должна возвращаться к реальной жизни.

Например, вот типичная проблема с ремонтом: одновременно загружаются план квартиры и скриншоты параметров двух холодильников, с дополнительной информацией: у стены кухни, прилегающей к кабинету, уже сделан столешница длиной 1,5 метра, теперь нужно поставить холодильник к этой стене – поместится ли он?

Ключевая информация разбросана по разным изображениям и текстовым описаниям. Модель должна объединить план квартиры, размеры существующей столешницы и спецификации двух холодильников, рассчитать оставшееся пространство на стене и дать вывод о возможности размещения. Она также активно напоминает пользователю о необходимости повторного замера на месте.

Весь процесс включает визуально-пространственное понимание, сложные рассуждения и использование инструментов, а также демонстрирует способность модели генерировать персонализированные ответы на основе реальной среды пользователя.

Используя тот же план квартиры, продолжим просить модель разработать несколько дизайнерских решений для кабинета в стиле массивной древесины.

Модель сохраняет ранее распознанные размеры и информацию об освещении, ищет соответствующие заметки в Xiaohongshu, организует четыре решения в стиле массивной древесины и генерирует веб-страницу, последовательно выполняя чтение изображений, вычисления, поиск и создание контента.

Сквозная разработка приложения для visionOS

Наконец, посмотрим, сможет ли dots3-note preview самостоятельно выполнить полную сквозную задачу по разработке программного обеспечения: «создать нативное приложение для Apple Vision Pro, вдохновившись дизайном Xiaohongshu».

Получив задачу, модель не спешила писать код. Сначала она поняла требования к продукту, изучив 9 изображений интерфейсов, и самостоятельно определила план разработки, включая использование технологий SwiftUI+RealityKit, планирование организации окон, иммерсивного пространства и 3D-демонстрации товаров. После утверждения плана она продолжила подготовку локальных изображений, 3D-моделей и других материалов, а затем поэтапно реализовала код.

Весь проект сгенерировал 12 файлов Swift, 1876 строк кода, реализовал интерфейсы ленты новостей, личной страницы, личных сообщений, товаров и интегрировал USDZ 3D-модели. Затем модель самостоятельно создала проект Xcode, вызвала xcodebuild для компиляции, проверила его в симуляторе visionOS и в итоге показала «BUILD SUCCEEDED».

От понимания требований и выбора технологий до реализации кода, компиляции и проверки – весь этот процесс разработки был успешно пройден от начала до конца.

Судя по конечному продукту, уже существует довольно полноценное пространственное взаимодействие. Ленту новостей можно прокручивать, заметки открываются на отдельной странице, личный профиль и личные сообщения могут разворачиваться в независимых окнах.

Пользователи также могут на странице покупок напрямую просматривать и переключаться между различными 3D-товарами.

Без стандартного ответа,

модель должна постоянно учиться и исправлять себя

Из нескольких примеров тестирования видно, что наиболее выдающаяся способность dots3-note preview заключается в том, чтобы одновременно исследовать и запоминать новую информацию, корректируясь при изменениях или ошибочных суждениях, пока не будет выдан результат. Как она этого достигает? Ключ в двух вещах: обучение и запоминание действительно полезной информации, а также своевременное обнаружение и исправление собственных ошибочных суждений.

Первой проблемой, которую пришлось решать лаборатории dots, был вопрос: может ли модель продолжать учиться у среды и пользователей после завершения обучения.

Чтобы обучить этой способности, лаборатория dots создала тысячи сверхдлинных новых сред, не зависящих от априорных знаний, где агент мог непрерывно исследовать ранее незнакомые сценарии, изучать новые правила и знания через взаимодействие со средой и использовать их для последующих решений. Более того, когда длина задачи значительно превышает контекстное окно модели, она не может постоянно полагаться на информацию, уже имеющуюся в контексте. Благодаря обучению с подкреплением, она постепенно научится тому, как сохранять информацию, полезную для решения последующих проблем. Эта способность была проверена на ARC-AGI 3.

Как видно из графика ниже, dots3-note preview набрала около 0,35 балла на ARC-AGI-3 при стоимости менее 500 долларов. Хотя абсолютный балл ниже, чем у Claude Opus 4.8 (high), эффективность по стоимости заметно выше.

Однако обучение такому процессу сталкивается с другой серьезной проблемой: стоимость исследования длительных задач слишком высока, агенту может потребоваться несколько часов на одно исследование. Если продолжать использовать методы обучения с подкреплением без промежуточных оценок, зависящие от финальной награды, часто приходится ждать завершения всей траектории, чтобы получить обучающий сигнал, что не только неэффективно, но и затрудняет определение, к какому конкретному шагу относится успех или неудача.

Такие методы, как PPO, могут смягчить эту проблему, но традиционный критик обычно оценивает ценность текущего состояния через одно прямое вычисление фиксированной сложности. Столкнувшись со сложными задачами агента, актер может многократно рассуждать, использовать инструменты и решать следующий шаг, а критик на это не способен, что легко приводит к неточной оценке текущего прогресса.

Лаборатория dots предложила TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization), который делит очень длинную траекторию на несколько макро-шагов, каждый из которых содержит несколько раундов взаимодействия модели со средой. После завершения этапа модель временно переключается с актера на критика и через рассуждения, использование инструментов и масштабирование во время тестирования оценивает, сколько вознаграждения можно получить в будущем из текущего состояния, затем превращая эту оценку в обучающий сигнал для еще незавершенной траектории.

Важно отметить, что в процессе обучения TEMPO модель должна учиться как действовать, так и оценивать, насколько хорошо она сейчас справляется. Благодаря такой самооценке, обучение с подкреплением можно применять к более длинным задачам и непрерывно оптимизировать поведение на длинных траекториях.

Результаты показывают, что преимущество TEMPO в основном проявляется после того, как задача входит в глубокую фазу. С увеличением количества раундов взаимодействия баллы GRPO и базовой контрольной точки стремятся к стагнации, в то время как TEMPO продолжает улучшаться. Что касается прогресса прохождения, то три подхода также заметно расходятся во второй половине задачи.

А после внедрения механизма Self-Critiquing способность dots3-note preview к самооценке оказалась сильнее, чем изначально предполагалось. Даже если агент еще не решил какую-то проблему, он может определить, какое из двух внешне похожих промежуточных состояний имеет больше шансов на прорыв.

Такая способность к самооценке, помимо использования в обучении с подкреплением, также проявляется на этапе рассуждений. Во время участия в IMO 2026, родственная версия dots3-note preview генерировала доказательства, одновременно многократно проверяя их с помощью инструментов, и, основываясь на результатах оценки, модифицировала и оптимизировала их, в итоге набрав полный балл.

В будущем лаборатория dots будет исследовать рекурсивную самооценку (recursive self-critiquing) в «открытых задачах», позволяя модели самостоятельно оценивать прогресс задачи при отсутствии четкого внешнего вознаграждения и на основе этого корректировать память и планировать последующие действия.

Комбинация Xiaohongshu «активная память + обучение с подкреплением на сверхдлинных траекториях + промежуточная самооценка» предлагает конкретное решение для внедрения длительных агентов в реальный мир.

Почему Xiaohongshu выбрала «длительных агентов для реальной жизни»?

Для сообщества Xiaohongshu, ориентированного на жизнь и интересы, оно естественным образом близко к таким задачам реальной жизни. Многие вопросы, которые пользователи обсуждают ежедневно, не только не имеют единственного ответа, но часто и сами пользователи не до конца понимают, чего они хотят в итоге.

Путешествия, свадьбы, ремонт, стиль одежды и т.д. сами по себе характеризуются разными предпочтениями, постоянно дополняемыми условиями и высокой плотностью мультимодальной информации. Xiaohongshu долгое время сталкивается именно с такими сложными длительными потребностями, поэтому естественно выбрала их в качестве ключевого направления исследований и применения агентов.

Агенты в таких областях, как математика, программирование и других, уже показали отрасли, что в средах с относительно четкими целями и проверяемыми результатами ИИ может разбивать сложные задачи на множество шагов и выполнять их в течение длительного времени. Условия реальной жизни гораздо сложнее, нет повсеместно доступных тестовых примеров, а цели и ограничения могут меняться вместе с задачей. Эта неопределенность еще более явно обнажает слабые места длительных агентов.

Два набора бенчмарков, открытых лабораторией dots, наглядно демонстрируют этот разрыв и недостатки.

Один из них – VibeSearchBench, который исследует «может ли агент разобраться, чего хочет пользователь, если тот не сразу четко сформулировал потребность». Он охватывает 20 областей и 200 задач. Оценка моделирует реального пользователя, постепенно дополняющего требования и ограничения в многораундовом диалоге, а затем проверяет, может ли модель точно понять, чего хочет пользователь.

Другой – VibeLifeBench, подчеркивающий изменения во времени и среде, исследующий «может ли агент успевать за изменениями после изменения внешних условий». Он охватывает 10 областей, 20 задач, каждая задача включает от 20 до 30 этапов и содержит 1247 атомарных проверок для контроля согласованности состояния, правильности выполнения инструментов и конечного результата.

Результаты показывают, что даже такие ведущие мировые модели, как Claude Opus 5 и GPT-5.5, не достигли установленного проходного уровня в этих двух наборах бенчмарков.

Слева – полный рейтинг VibeSearchBench, справа – полный рейтинг VibeLifeBench.

Домашняя страница VibeSearchBench:https://vibebench.github.io/VibeSearchBench.github.io/

Домашняя страница VibeLifeBench:https://vibebench.github.io/VibeLifeBench_homepage/

Эти результаты говорят об одном: модели уже достаточно сильны в выполнении сложных точечных задач высокой сложности, но устойчиво поддерживать эту способность в течение нескольких часов или дольше остается тем, с чем агенты пока не справляются. Исследования и планирование Xiaohongshu в этой области только начинаются.

dots3-note – самая легкая версия в серии dots3, и в настоящее время открытая версия preview все еще имеет возможности для дальнейшей оптимизации в плане опыта и деталей. По словам лаборатории dots, официальная версия dots3-note также будет открыта в ближайшее время. В будущем серия dots3 также представит jazz и aria, которые вместе с note составят три уровня, охватывающие различные требования к сложности задач, скорости отклика и вычислительным затратам.

Более подробную информацию о методах обучения смотрите в официальном техническом блоге (на китайском):https://studio.dots.ai/dots/dots3-zh.html

Эта статья взята с официального аккаунта WeChat «机器之心» (ID:almosthuman2014), автор: Машина, следящая за агентами, редакторы: Ду Вэй, Ян Вэнь

Связанные с этим вопросы

QКакой крупный языковой модель только что открыла свои исходные коды компания Xiaohongshu?

AXiaohongshu объявила об открытии исходных кодов модели dots3-note preview. Это первая версия с открытым исходным кодом в серии dots3.

QКакие ключевые возможности имеет модель dots3-note preview с точки зрения архитектуры и задач?

AМодель dots3-note preview имеет 280B параметров (16B активируемых), поддерживает контекстное окно в 512K токенов, обладает мультимодальными способностями (текст, зрение, речь) и оптимизирована для сложных рассуждений, агентских и мультимодальных задач, особенно длинных и нестандартных.

QКакие практические задачи демонстрируют способности модели к длительному планированию и обучению?

AВ статье описываются несколько кейсов: прохождение игры «Башня Убийцы II», решение головоломки ARC-AGI 3 с самостоятельным изучением правил, решение задачи по расстановке мебели на основе плана квартиры и фотографий, а также полная разработка приложения для visionOS, включая проектирование и компиляцию.

QКакой метод обучения (TEMPO) был разработан для обучения модели сложным длительным задачам?

AДля обучения модели длительным задачам с высокой стоимостью исследования, Xiaohongshu разработала метод TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization). Он разбивает длинную траекторию на макро-шаги, позволяя модели в роли критика оценивать промежуточный прогресс и использовать эту оценку для обучения, даже если задача еще не завершена.

QПочему Xiaohongshu фокусируется на разработке агентов для «реальных жизненных задач»?

AXiaohongshu как сообщество, посвященное образу жизни, естественным образом сталкивается с такими сложными, долгосрочными и неоднозначными запросами пользователей, как планирование путешествий, свадеб, ремонта. Эти задачи часто не имеют единственного правильного ответа, их условия меняются, что делает их сложной площадкой для проверки и развития способностей AI-агентов к долгосрочному планированию и адаптации.

Похожее

Помните NFT? Цены новых проектов уже превзошли Bored Ape Yacht Club

NFT, казажется, возвращаются, на этот раз в экосистеме Robinhood. Непосредственным катализатором внимания стал обмен сообщениями в Twitter между генеральным директором Robinhood Владиславом Теневым и известным цифровым художником Beeple. Это спровоцировало всплеск интереса к NFT на блокчейне Robinhood. Цена ведущей коллекции StonkBroker достигла более 13 ETH, что выше, чем у некоторых известных "голубых фишек", таких как BAYC. Также быстро растут проекты, связанные с популярными мем-токенами, например, Cash Cat NFT, чья цена выросла в 5 раз после упоминания Теневым. В статье выделяются три основные категории проектов NFT на Robinhood: 1. NFT, связанные с успешными мем-токенами (например, Cash Cat). 2. Экосистемные проекты вокруг StonkBroker, такие как Chain Mancers и Yardkeepers, которые сочетают токены и NFT с обещанием функциональности и распределения доходов. 3. "Перезапуски" от известных создателей или старых проектов из других блокчейнов (например, Spritehood от соучредителя Pudgy Penguins). Автор отмечает, что, несмотря на рост интереса, ликвидность NFT по-прежнему значительно ниже, чем у мем-токенов, что затрудняет крупные сделки. Для устойчивого возрождения NFT на Robinhood необходимо появление большего числа знаковых проектов, выходящих за рамки популярной сейчас модели "токен + NFT".

marsbit42 мин. назад

Помните NFT? Цены новых проектов уже превзошли Bored Ape Yacht Club

marsbit42 мин. назад

7 миллиардов годовых не удержали: Юй Цзяхуэй уходит из Meta, чтобы заняться собственным бизнесом

Сообщается, что исследователь ИИ Цзяхуэй Юй покинул Meta всего через год после присоединения, несмотря на слухи о пакете вознаграждения в размере до 100 миллионов долларов. Он объявил об уходе, чтобы основать собственную компанию, сосредоточившись на нераскрытой проблеме, которая, по его мнению, «чрезвычайно важна для будущего человечества». За год в Meta Юй был одним из основателей ключевой группы исследований моделей TBD Lab в рамках подразделения Superintelligence Labs (MSL). Под его руководством команда выпустила несколько мультимодальных моделей серии Muse, включая Muse Spark, Voice Mode, Muse Image и Muse Video. Его уход вызвал дискуссии о стратегии Meta по привлечению талантов с помощью высоких компенсаций. Платформа alphaXiv сообщает, что более 200 известных исследователей покинули Meta, что ставит вопрос об эффективности такого подхода. Мотивы Юя для начала собственного дела остаются нераскрытыми, и дальнейшие детали появятся по мере развития его нового проекта.

marsbit51 мин. назад

7 миллиардов годовых не удержали: Юй Цзяхуэй уходит из Meta, чтобы заняться собственным бизнесом

marsbit51 мин. назад

Разбор отчета Gemini: Кредитные карты стали основной статьей, объем транзакций резко упал

Криптобиржа Gemini опубликовала отчет за второй квартал 2026 года. Несмотря на рост общей выручки на 37% в годовом исчислении до 45,5 млн долларов, объем спотовых торгов на платформе упал на 66%. Основной причиной роста выручки стал сдвиг в структуре доходов: доход от кредитных карт впервые превысил доход от торговой платформы, составив 16,2 млн против 12,5 млн долларов. Годовой рост доходов от карт составил 231%, в то время как доход от торгов сократился на 38%. Активность пользователей также изменилась: выросло число ежемесячных активных пользователей, но показатель включает всех, кто генерирует доход, в том числе через неторговые продукты, такие как кредитные карты. Это показывает, что выручка платформы больше не зависит исключительно от торговых объемов. Однако рост доходов от кредитных карт не эквивалентен росту прибыли. Компания создала крупные резервы на покрытие убытков по кредитам (16,1 млн долларов), частично связанные с мошенническими счетами. Доля просроченной задолженности свыше 30 дней выросла с 3,8% до 9,4%, что указывает на возрастающие риски в этом новом ключевом бизнесе. Вывод: Gemini диверсифицирует источники дохода, снижая зависимость от волатильности крипторынка, но при этом сталкивается с новыми проблемами управления кредитными рисками.

marsbit52 мин. назад

Разбор отчета Gemini: Кредитные карты стали основной статьей, объем транзакций резко упал

marsbit52 мин. назад

Торговля

Спот
活动图片