3B-модель поставила рекорд в программировании наравне с Opus 4.5: китайская модель вызвала горячие споры

marsbitОпубликовано 2026-06-18Обновлено 2026-06-18

Введение

В последние дни небольшая модель VibeThinker-3B (3 миллиарда параметров) привлекла большое внимание, продемонстрировав результаты, сопоставимые с передовыми крупными моделями, такими как GPT-5 high и Claude Opus 4.5, в задачах верифицируемого рассуждения — программировании, математике и STEM. Разработанная командой Weibo (Sina), она основана на Qwen2.5-Coder-3B и использует усовершенствованный конвейер Spectrum-to-Signal, включая обучение с подкреплением (RL) и дистилляцию. Модель показала выдающиеся результаты: 94.3 балла на AIME26, 89.3 на HMMT25, 80.2 на LiveCodeBench v6 и 96.1% успеха в свежих соревнованиях LeetCode. Метод Claim-Level Reliability (CLR) ещё повысил её точность. Важным выводом работы является «гипотеза параметрического сжатия»: возможности верифицируемого рассуждения (логика, проверка) могут быть эффективно сжаты в компактной модели, в отличие от общих знаний, требующих больших параметров. Это указывает на частичное разделение рассуждений и фактологических знаний. Цель авторов — не замена больших моделей, а исследование предела малых моделей в специфических областях с чёткими правилами и обратной связью. Модель доступна для загрузки, но её эффективность ограничена задачами с надёжной проверкой, а не общими диалогами.

В последние дни небольшая модель на 3B стала хитом в X, потому что на некоторых сложных, но проверяемых задачах на рассуждение (например, программирование) она вошла в диапазон производительности передовых моделей, таких как Gemini 3 Pro, GPT-5 high, Claude Opus 4.5, GLM-5, Kimi K2.5, при этом её размер значительно меньше, чем у этих моделей.

Эта модель называется VibeThinker-3B. Это плотная модель для рассуждений с 3 миллиардами параметров, цель которой — исследовать, насколько можно продвинуть проверяемую способность к рассуждению при строго ограниченном небольшом размере модели.

После публикации модели многие были поражены её результатами и выразили желание попробовать её в деле.

Стоит отметить, что это также отечественная модель от команды Weibo (Сина Вэйбо).

Технический отчёт показывает, что модель специально разработана для задач с надёжными сигналами верификации, включая математические рассуждения, спортивное программирование, STEM-рассуждения, а также выполнение инструкций с чёткими ограничениями.

Поэтому она показывает выдающиеся результаты по всем контрольным тестам. В тесте AIME26 она набрала 94,3 балла, в тесте HMMT25 — 89,3 балла, в тесте LiveCodeBench v6 — 80,2 балла (Pass@1), а в самых свежих непубличных еженедельных и двухнедельных соревнованиях LeetCode с 25 апреля по 31 мая 2026 года достигла процента успешных решений 96,1%.

Как обучалась эта модель? Технический отчёт раскрывает некоторые детали.

Во-первых, она построена на основе Qwen2.5-Coder-3B и проходит последующее обучение по усовершенствованному процессу Spectrum-to-Signal. Этот процесс усиливает синтез данных, фильтрацию качества и поурочное обучение при контролируемом тонком обучении (SFT), расширяет обучение с подкреплением в стиле MGPO на несколько проверяемых областей, сохраняет полные траектории рассуждений в длинном контексте и укрепляет все способности с помощью авто-дистилляции вне сети и обучения с подкреплением на инструкциях (Instruct RL).

Общий процесс обучения VibeThinker-3B.

Процесс Spectrum-to-Signal.

Кроме того, VibeThinker-3B внедряет оценку надёжности на уровне утверждений (Claim-Level Reliability, CLR) — это стратегия масштабирования во время тестирования, ориентированная на проверяемые рассуждения с ответами. CLR дополнительно повышает производительность на математических тестах, увеличивая результат AIME26 с 94,3 до 97,1, HMMT25 с 89,3 до 95,4 и поднимая BruMO25 до 99,2.

Конкретный процесс обучения выглядит следующим образом:

  • Двухэтапное SFT на основе учебного плана. Первый этап сосредоточен на широком охвате способностей, включая математику, программирование, STEM-рассуждения, общий диалог и следование инструкциям. Второй этап переходит к более сложным и широким по охвату выборкам для рассуждений. Дистилляция с исследованием разнообразия используется для сохранения нескольких эффективных путей решения.
  • Обучение с подкреплением для рассуждений в нескольких областях. VibeThinker-3B повторно использует MGPO. Обучение с подкреплением последовательно применяется к математическим, программистским и STEM-задачам на рассуждение. Для обучения используется одно окно длинного контекста на 64K токенов, чтобы сохранить полные траектории длинных рассуждений.
  • Авто-дистилляция вне сети. Высококачественные траектории отбираются и очищаются из контрольных точек обучения с подкреплением по математике, программированию и STEM, в конечном итоге формируя единую студенческую модель. Оценка потенциала обучения используется для приоритизации тех траекторий, которые правильны, но ещё не были хорошо усвоены студенческой моделью.
  • Instruct RL. Финальный этап повышает управляемость для пользовательских промптов. Для учебных данных, чувствительных к формату и открытых, используются основанные на правилах валидаторы и модели вознаграждения на основе критериев оценки.

В недавнем посте известный исследователь ИИ и блогер Себастьян Рашка систематически обобщил ключевые моменты, раскрытые в техническом отчёте VibeThinker-3B, включая следующие:

Если вас заинтересовало это содержание, вы можете подробно изучить их технический отчёт. В настоящее время модель также доступна для публичного скачивания.

Название отчёта: VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

Ссылка на отчёт: https://arxiv.org/pdf/2606.16140

Ссылка на HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B

Однако область применения этой модели чётко ограничена, поскольку в областях, требующих общих знаний, она не показывает выдающихся результатов.

Разработчики также чётко указали на это и выдвинули «гипотезу сжатия параметров для покрытия»: разные способности по-разному зависят от параметров модели. Проверяемое рассуждение ближе к высокосжимаемой, параметрически плотной способности, ядро которой заключается в многошаговом рассуждении, удовлетворении ограничений, самокоррекции и проверке ответов. Когда пространство задач имеет достаточно чёткую структуру и сигналы обратной связи достаточно надёжны, компактная модель также может обладать способностью к рассуждениям, близкой к передовому уровню. В отличие от этого, знания в открытой области, общий диалог и понимание длинных хвостов сценариев в большей степени зависят от масштаба параметров для широкого покрытия фактов, концепций и знаний о мире. Эта гипотеза очень вдохновляет. VentureBeat в своём репортаже написали: «Она раскрывает частичное разделение между способностью к рассуждению и фактическими знаниями, и первая может быть сжата более эффективно, чем предполагалось ранее — это понимание имеет далеко идущие последствия для того, как индустрия рассматривает дизайн моделей, стоимость развёртывания и доступность продвинутых функций искусственного интеллекта.»

Авторы заявляют, что их цель — не создать небольшую модель как замену крупным моделям, а изучить истинные границы небольших моделей вдоль определённых измерений способностей. С помощью VibeThinker-3B они хотят показать, что небольшие модели не должны рассматриваться лишь как компромисс для снижения стоимости развёртывания. В областях способностей с чёткими механизмами обратной связи и проверки небольшие языковые модели открывают перспективный исследовательский путь, потенциально позволяющий достичь передового уровня производительности и создать фундаментально дополняющие отношения с традиционной парадигмой масштабирования по параметрам.

В настоящее время в сообществе к этой модели всё ещё есть некоторые сомнения. Если вам интересна эта модель,不妨 попробуйте её сами.

Ссылки:

https://x.com/orcus108/status/2066876960073281582

Эта статья взята с официального аккаунта WeChat «Машинный разум» (ID: almosthuman2014), автор: Чжан Цянь.

Связанные с этим вопросы

QЧто такое VibeThinker-3B и почему он привлёк к себе внимание?

AVibeThinker-3B — это небольшая языковая модель с 3 миллиардами параметров, разработанная командой Weibo (Sina Weibo). Она привлекла внимание, потому что в таких поддающихся проверке рассуждениях, как программирование, показала результаты, сравнимые с крупными передовыми моделями, такими как GPT-5 high и Claude Opus 4.5, при значительно меньшем размере.

QКаковы ключевые характеристики производительности модели VibeThinker-3B?

AМодель показывает выдающиеся результаты в проверяемых задачах: 94.3 балла на AIME26, 89.3 на HMMT25, 80.2 балла (Pass@1) на LiveCodeBench v6 и 96.1% проходимость на недавних непубличных соревнованиях LeetCode (апрель-май 2026). Использование стратегии CLR (Claim-Level Reliability) дополнительно повышает её показатели.

QКак тренировали модель VibeThinker-3B?

AМодель основана на Qwen2.5-Coder-3B. Её обучение включает: 1) Двухэтапный SFT по учебному плану с акцентом на математику, программирование, STEM и общий диалог. 2) Обучение с подкреплением (RL) в нескольких областях рассуждений. 3) Оффлайн само-дистилляцию для объединения знаний. 4) Instruct RL для улучшения управляемости при взаимодействии с пользователем. Используется процесс Spectrum-to-Signal.

QВ чём заключается «гипотеза параметрического сжатия и покрытия», предложенная авторами?

AАвторы предполагают, что разные способности по-разному зависят от параметров модели. Проверяемое рассуждение (логика, решение задач) — это «сжимаемая», параметрически-плотная способность, которая может быть эффективно реализована в компактной модели при наличии чёткой структуры задачи и надёжной обратной связи. В то время как общие знания и понимание мира требуют больших параметров для широкого покрытия фактов. Это означает частичное разделение логического мышления и фактологических знаний.

QКаковы ограничения модели VibeThinker-3B и где она неэффективна?

AVibeThinker-3B специализируется на задачах с чёткими правилами и возможностью проверки (математика, программирование, STEM). В областях, требующих обширных общих знаний, понимания открытого мира или работы с длинными хвостами редких сценариев, её производительность значительно ниже, чем у крупных моделей. Она не предназначена для замены больших моделей в общих диалогах или решениях неструктурированных задач.

Похожее

$35 млрд убытка: звезда OpenAI Леопольд Ашенбреннер продал свой биржевой портфель

Хедж-фонд Situational Awareness, основанный бывшим сотрудником OpenAI Леопольдом Ашенбреннером, вынужденно продал весь свой публичный акционный портфель одной сделкой фонду Citadel. Причиной стали значительные убытки в размере около $35 млрд из-за падения акций компаний, связанных с инфраструктурой ИИ, и неудачных коротких позиций. Прайм-брокеры потребовали дополнительного обеспечения по маржинальным требованиям, что спровоцировало распродажу. Фонд, показывавший ранее рекордную доходность, сократил активы примерно до $10 млрд, сохранив только частные инвестиции, включая долю в Anthropic. Ситуация напоминает крах фонда Archegos и высвечивает риски концентрированных ставок с использованием маржинального плеча в высоковолатильном секторе.

cryptonews.ru10 мин. назад

$35 млрд убытка: звезда OpenAI Леопольд Ашенбреннер продал свой биржевой портфель

cryptonews.ru10 мин. назад

Точка перелома на бычьем рынке ИИ: маржинальные ликвидации, избыток вычислительных мощностей. Почему этот макроаналитик настроен полностью негативно

Автор аналитической фирмы Fidenza Macro, Джо Чен, объясняет причины своего решения полностью выйти из позиций в AI-полупроводниках и инфраструктуре в июне и излагает пессимистичный взгляд на будущее AI-бума. Он выделяет несколько ключевых факторов: 1. **Кризис кредитного плеча:** Параболический рост был во многом подпитан "некачественными" деньгами — в частности, южнокорейскими розничными инвесторами, агрессивно использовавшими левериджные ETF. Массовые ликвидации этих позиций (пострадал каждый 30-й взрослый в Корее) истощили сотни миллиардов долларов, создав серьезный технический надрыв на рынке. 2. **Угроза со стороны открытых моделей и Китая:** Появление мощных открытых моделей от китайских компаний, таких как Kimi K3 от Moonshot AI и Qwen 3.8 от Alibaba, начинает подрывать бизнес-модель закрытых гигантов вроде OpenAI и Anthropic. Это ведет к потенциальной коммодитизации ИИ-сервисов и снижению маржи, что ставит под вопрос выполнение их масштабных обязательств по аренде вычислительных мощностей. 3. **Перелом от дефицита к избытку вычислительных мощностей:** Аналитик указывает, что пик дефицита чипов часто совпадает с вершиной цикла. Огромные обязательства по капитальным расходам на AI-инфраструктуру со стороны крупных облачных провайдеров могут в течение 1-2 лет привести к избытку предложения. Признаки стресса уже видны в widening кредитных спредах облигаций AI-дата-центров. 4. **Макроэкономические риски:** Внешние факторы — затяжная война в Иране (источник длительной стагфляции) и действия ФРС под руководством Кевина Восша — создают дополнительное давление. ФРС, пытаясь реформироваться в условиях кризиса, теряет доверие рынка, что видно по росту доходности долгосрочных гособлигаций США выше 5.2%. Чен приходит к выводу, что комбинация этих факторов — исчерпание кредитного импульса, структурные изменения в отрасли ИИ и неблагоприятный макроклимат — сигнализирует о завершении бычьего рынка и предвещает сложный период для AI-активов.

marsbit14 мин. назад

Точка перелома на бычьем рынке ИИ: маржинальные ликвидации, избыток вычислительных мощностей. Почему этот макроаналитик настроен полностью негативно

marsbit14 мин. назад

Aave рассматривает закрытие 6 рынков V3 на блокчейнах, вывод 50 низкоиспользуемых резервов

Предложение по управлению Aave предусматривает закрытие V3 рынков протокола на шести блокчейнах (Sonic, Scroll, zkSync, Metis, Soneium и Aptos) и вывод 50 низкоиспользуемых резервов токенов. Это затронет активы на сумму 98,1 млн долларов и долг на 15,6 млн долларов. Поставщик услуг по оценке рисков LlamaRisk рекомендовал данные меры в рамках новой структуры управления рисками Aave, указывая на низкую ликвидность и доходность на этих сетях. Например, рынок на Aptos предлагается закрыть всего через 11 месяцев после запуска из-за падения ликвидности на 94% и квартальной выручки ниже 1000 долларов. Основатель Aave Стани Кулечов пояснил, что это не отказ от мультичейн-стратегии, а её пересмотр с фокусом на эффективных развертываниях для снижения экономических и технических рисков.

cointelegraph15 мин. назад

Aave рассматривает закрытие 6 рынков V3 на блокчейнах, вывод 50 низкоиспользуемых резервов

cointelegraph15 мин. назад

По данным аналитиков платформы для анализа блокчейна CryptoQuant, в биткоине наблюдается значительный бычий сигнал! Вот подробности

По данным аналитика CryptoQuant Акселя Адлера-младшего, доля краткосрочных инвесторов в реализованной капитализации биткоина упала до 23,5%, достигнув одного из самых низких уровней за всю историю криптовалюты. В то же время доля долгосрочных инвесторов выросла до 52,5%, приблизившись к историческому пику. Это указывает на переход биткоина от краткосрочных спекулянтов к долгосрочным держателям («сильным рукам») и снижение спекулятивной активности на рынке. Однако аналитик предупреждает, что такая концентрация предложения сама по себе не гарантирует роста цен. Ситуация схожа с минимумом медвежьего рынка 2022-2023 годов: для разворота тренда необходим значительный приток нового капитала и восстановление спроса. Без этого низкая торговая активность может сохраниться, а цены оставаться под давлением.

cryptonews.ru21 мин. назад

По данным аналитиков платформы для анализа блокчейна CryptoQuant, в биткоине наблюдается значительный бычий сигнал! Вот подробности

cryptonews.ru21 мин. назад

Саид Аль-Марри: Как токенизация открывает новые возможности для фондов морских перевозок

Саид Бин Салех Аль-Марри, глава Ethra Invest, видит в токенизации реальных активов (RWA) способ демократизировать инвестиции в капиталоемкий сектор морских перевозок. Токенизация позволяет дробить доли в судах, делая рынок доступным для мелких инвесторов, повышая прозрачность и эффективность учета. Однако Аль-Марри подчеркивает, что это не обход регулирования и не гарантия ликвидности: вторичный рынок требует реалистичной оценки активов, а операционное управление судном остается за профессионалами. Правовое обеспечение по-прежнему зависит от традиционной морской юриспруденции, а не только от смарт-контрактов. В торговой документации ключевым вызовом является не технология, а достижение глобального юридического признания цифровых стандартов. Ethra выступает за гибридные модели, сочетающие цифровые инструменты с поддержкой регулируемых институтов. Что касается декарбонизации флота к 2050 году, Аль-Марри призывает к прагматичному и консервативному подходу в финансировании перехода на экологичные виды топлива, чтобы защитить капитал инвесторов. Таким образом, эволюция морского финансирования заключается не просто в использовании блокчейна, а в мобилизации капитала для создания современного и устойчивого глобального флота.

cryptonews.ru29 мин. назад

Саид Аль-Марри: Как токенизация открывает новые возможности для фондов морских перевозок

cryptonews.ru29 мин. назад

Торговля

Спот
活动图片