3B-модель поставила рекорд в программировании наравне с Opus 4.5: китайская модель вызвала горячие споры

marsbitОпубликовано 2026-06-18Обновлено 2026-06-18

Введение

В последние дни небольшая модель VibeThinker-3B (3 миллиарда параметров) привлекла большое внимание, продемонстрировав результаты, сопоставимые с передовыми крупными моделями, такими как GPT-5 high и Claude Opus 4.5, в задачах верифицируемого рассуждения — программировании, математике и STEM. Разработанная командой Weibo (Sina), она основана на Qwen2.5-Coder-3B и использует усовершенствованный конвейер Spectrum-to-Signal, включая обучение с подкреплением (RL) и дистилляцию. Модель показала выдающиеся результаты: 94.3 балла на AIME26, 89.3 на HMMT25, 80.2 на LiveCodeBench v6 и 96.1% успеха в свежих соревнованиях LeetCode. Метод Claim-Level Reliability (CLR) ещё повысил её точность. Важным выводом работы является «гипотеза параметрического сжатия»: возможности верифицируемого рассуждения (логика, проверка) могут быть эффективно сжаты в компактной модели, в отличие от общих знаний, требующих больших параметров. Это указывает на частичное разделение рассуждений и фактологических знаний. Цель авторов — не замена больших моделей, а исследование предела малых моделей в специфических областях с чёткими правилами и обратной связью. Модель доступна для загрузки, но её эффективность ограничена задачами с надёжной проверкой, а не общими диалогами.

В последние дни небольшая модель на 3B стала хитом в X, потому что на некоторых сложных, но проверяемых задачах на рассуждение (например, программирование) она вошла в диапазон производительности передовых моделей, таких как Gemini 3 Pro, GPT-5 high, Claude Opus 4.5, GLM-5, Kimi K2.5, при этом её размер значительно меньше, чем у этих моделей.

Эта модель называется VibeThinker-3B. Это плотная модель для рассуждений с 3 миллиардами параметров, цель которой — исследовать, насколько можно продвинуть проверяемую способность к рассуждению при строго ограниченном небольшом размере модели.

После публикации модели многие были поражены её результатами и выразили желание попробовать её в деле.

Стоит отметить, что это также отечественная модель от команды Weibo (Сина Вэйбо).

Технический отчёт показывает, что модель специально разработана для задач с надёжными сигналами верификации, включая математические рассуждения, спортивное программирование, STEM-рассуждения, а также выполнение инструкций с чёткими ограничениями.

Поэтому она показывает выдающиеся результаты по всем контрольным тестам. В тесте AIME26 она набрала 94,3 балла, в тесте HMMT25 — 89,3 балла, в тесте LiveCodeBench v6 — 80,2 балла (Pass@1), а в самых свежих непубличных еженедельных и двухнедельных соревнованиях LeetCode с 25 апреля по 31 мая 2026 года достигла процента успешных решений 96,1%.

Как обучалась эта модель? Технический отчёт раскрывает некоторые детали.

Во-первых, она построена на основе Qwen2.5-Coder-3B и проходит последующее обучение по усовершенствованному процессу Spectrum-to-Signal. Этот процесс усиливает синтез данных, фильтрацию качества и поурочное обучение при контролируемом тонком обучении (SFT), расширяет обучение с подкреплением в стиле MGPO на несколько проверяемых областей, сохраняет полные траектории рассуждений в длинном контексте и укрепляет все способности с помощью авто-дистилляции вне сети и обучения с подкреплением на инструкциях (Instruct RL).

Общий процесс обучения VibeThinker-3B.

Процесс Spectrum-to-Signal.

Кроме того, VibeThinker-3B внедряет оценку надёжности на уровне утверждений (Claim-Level Reliability, CLR) — это стратегия масштабирования во время тестирования, ориентированная на проверяемые рассуждения с ответами. CLR дополнительно повышает производительность на математических тестах, увеличивая результат AIME26 с 94,3 до 97,1, HMMT25 с 89,3 до 95,4 и поднимая BruMO25 до 99,2.

Конкретный процесс обучения выглядит следующим образом:

  • Двухэтапное SFT на основе учебного плана. Первый этап сосредоточен на широком охвате способностей, включая математику, программирование, STEM-рассуждения, общий диалог и следование инструкциям. Второй этап переходит к более сложным и широким по охвату выборкам для рассуждений. Дистилляция с исследованием разнообразия используется для сохранения нескольких эффективных путей решения.
  • Обучение с подкреплением для рассуждений в нескольких областях. VibeThinker-3B повторно использует MGPO. Обучение с подкреплением последовательно применяется к математическим, программистским и STEM-задачам на рассуждение. Для обучения используется одно окно длинного контекста на 64K токенов, чтобы сохранить полные траектории длинных рассуждений.
  • Авто-дистилляция вне сети. Высококачественные траектории отбираются и очищаются из контрольных точек обучения с подкреплением по математике, программированию и STEM, в конечном итоге формируя единую студенческую модель. Оценка потенциала обучения используется для приоритизации тех траекторий, которые правильны, но ещё не были хорошо усвоены студенческой моделью.
  • Instruct RL. Финальный этап повышает управляемость для пользовательских промптов. Для учебных данных, чувствительных к формату и открытых, используются основанные на правилах валидаторы и модели вознаграждения на основе критериев оценки.

В недавнем посте известный исследователь ИИ и блогер Себастьян Рашка систематически обобщил ключевые моменты, раскрытые в техническом отчёте VibeThinker-3B, включая следующие:

Если вас заинтересовало это содержание, вы можете подробно изучить их технический отчёт. В настоящее время модель также доступна для публичного скачивания.

Название отчёта: VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

Ссылка на отчёт: https://arxiv.org/pdf/2606.16140

Ссылка на HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B

Однако область применения этой модели чётко ограничена, поскольку в областях, требующих общих знаний, она не показывает выдающихся результатов.

Разработчики также чётко указали на это и выдвинули «гипотезу сжатия параметров для покрытия»: разные способности по-разному зависят от параметров модели. Проверяемое рассуждение ближе к высокосжимаемой, параметрически плотной способности, ядро которой заключается в многошаговом рассуждении, удовлетворении ограничений, самокоррекции и проверке ответов. Когда пространство задач имеет достаточно чёткую структуру и сигналы обратной связи достаточно надёжны, компактная модель также может обладать способностью к рассуждениям, близкой к передовому уровню. В отличие от этого, знания в открытой области, общий диалог и понимание длинных хвостов сценариев в большей степени зависят от масштаба параметров для широкого покрытия фактов, концепций и знаний о мире. Эта гипотеза очень вдохновляет. VentureBeat в своём репортаже написали: «Она раскрывает частичное разделение между способностью к рассуждению и фактическими знаниями, и первая может быть сжата более эффективно, чем предполагалось ранее — это понимание имеет далеко идущие последствия для того, как индустрия рассматривает дизайн моделей, стоимость развёртывания и доступность продвинутых функций искусственного интеллекта.»

Авторы заявляют, что их цель — не создать небольшую модель как замену крупным моделям, а изучить истинные границы небольших моделей вдоль определённых измерений способностей. С помощью VibeThinker-3B они хотят показать, что небольшие модели не должны рассматриваться лишь как компромисс для снижения стоимости развёртывания. В областях способностей с чёткими механизмами обратной связи и проверки небольшие языковые модели открывают перспективный исследовательский путь, потенциально позволяющий достичь передового уровня производительности и создать фундаментально дополняющие отношения с традиционной парадигмой масштабирования по параметрам.

В настоящее время в сообществе к этой модели всё ещё есть некоторые сомнения. Если вам интересна эта модель,不妨 попробуйте её сами.

Ссылки:

https://x.com/orcus108/status/2066876960073281582

Эта статья взята с официального аккаунта WeChat «Машинный разум» (ID: almosthuman2014), автор: Чжан Цянь.

Связанные с этим вопросы

QЧто такое VibeThinker-3B и почему он привлёк к себе внимание?

AVibeThinker-3B — это небольшая языковая модель с 3 миллиардами параметров, разработанная командой Weibo (Sina Weibo). Она привлекла внимание, потому что в таких поддающихся проверке рассуждениях, как программирование, показала результаты, сравнимые с крупными передовыми моделями, такими как GPT-5 high и Claude Opus 4.5, при значительно меньшем размере.

QКаковы ключевые характеристики производительности модели VibeThinker-3B?

AМодель показывает выдающиеся результаты в проверяемых задачах: 94.3 балла на AIME26, 89.3 на HMMT25, 80.2 балла (Pass@1) на LiveCodeBench v6 и 96.1% проходимость на недавних непубличных соревнованиях LeetCode (апрель-май 2026). Использование стратегии CLR (Claim-Level Reliability) дополнительно повышает её показатели.

QКак тренировали модель VibeThinker-3B?

AМодель основана на Qwen2.5-Coder-3B. Её обучение включает: 1) Двухэтапный SFT по учебному плану с акцентом на математику, программирование, STEM и общий диалог. 2) Обучение с подкреплением (RL) в нескольких областях рассуждений. 3) Оффлайн само-дистилляцию для объединения знаний. 4) Instruct RL для улучшения управляемости при взаимодействии с пользователем. Используется процесс Spectrum-to-Signal.

QВ чём заключается «гипотеза параметрического сжатия и покрытия», предложенная авторами?

AАвторы предполагают, что разные способности по-разному зависят от параметров модели. Проверяемое рассуждение (логика, решение задач) — это «сжимаемая», параметрически-плотная способность, которая может быть эффективно реализована в компактной модели при наличии чёткой структуры задачи и надёжной обратной связи. В то время как общие знания и понимание мира требуют больших параметров для широкого покрытия фактов. Это означает частичное разделение логического мышления и фактологических знаний.

QКаковы ограничения модели VibeThinker-3B и где она неэффективна?

AVibeThinker-3B специализируется на задачах с чёткими правилами и возможностью проверки (математика, программирование, STEM). В областях, требующих обширных общих знаний, понимания открытого мира или работы с длинными хвостами редких сценариев, её производительность значительно ниже, чем у крупных моделей. Она не предназначена для замены больших моделей в общих диалогах или решениях неструктурированных задач.

Похожее

MiCA готовится регулировать DeFi-хранилища, но это будет непросто

MiCA оставил криптокредитование за рамками первоначального свода правил, но сейчас в Брюсселе рассматривается вопрос о его включении. 20 мая 2026 года Европейская комиссия запросила мнение заинтересованных сторон по темам, исключённым из первоначальных рамок MiCA, таким как децентрализованные финансы (DeFi) и криптокредитование. Ключевой вопрос — правовой статус кредитных «хранилищ» (vaults), которые направляют миллиарды долларов в ончейн-кредитные рынки, не будучи похожими на традиционное кредитование. В настоящее время их статус определяется необязательными интерпретациями, что они не подпадают под MiCA и правила фондов ЕС. Структура, например, протокола Morpho, где функции разделены между куратором, аллокатором и сентинелем, не соответствует ни одной существующей регуляторной модели, что затрудняет идентификацию «поставщика» регулируемой услуги. Эксперты указывают на сложности регулирования. Джонатан Галеа предупреждает, что категория «DeFi-кредитование» может объединить структуры с совершенно разными функциями. Юрий Брисов предлагает фокус на структуре хранилища и контроле над ним, а не на степени децентрализации, которая является спектром. Майкл Егоров, основатель Curve Finance, настаивает, что DeFi-кредитование требует отдельного подхода и правил, отличных от традиционного финансирования. Консультации Комиссии завершаются 30 сентября, и их итог определит, останутся ли кредитные хранилища вне MiCA или попадут под новые правила. Задача для Брюсселя — не просто решить, регулировать ли DeFi-кредитование, а как создать правила, различающие очень разные формы ончейн-кредитования и лиц, которые ими управляют.

cointelegraph27 мин. назад

MiCA готовится регулировать DeFi-хранилища, но это будет непросто

cointelegraph27 мин. назад

Компания Coinbase, подвергшаяся критике за продажу Ethereum, ответила на критику!

Основатель Coinbase Джесси Поллак ответил на критику компании за продажу Ethereum ($ETH), подчеркнув ее значительный вклад в экосистему. Он заявил, что Coinbase является одним из крупнейших институциональных держателей ETH и крупным клиентом сети через свой L2-решение Base, которое познакомило миллионы пользователей с Ethereum. Поллак отметил, что компания годами хранила около 150 000 ETH и внесла вклад в развитие EVM и дорожной карты Ethereum. Член сообщества Ethereum chaskin.eth поддержал эту позицию, указав на вклад Coinbase в такие проекты, как Base, USDC, EIP-4844 и смарт-кошельки. Поллак призвал прекратить постоянную критику протокола и использующих его компаний, предупредив, что враждебность может оттолкнуть крупных институциональных пользователей и навредить экосистеме. Он уверен, что для роста Ethereum нужно поддерживать, а не исключать компании, развивающие продукты на его основе.

cryptonews.ru1 ч. назад

Компания Coinbase, подвергшаяся критике за продажу Ethereum, ответила на критику!

cryptonews.ru1 ч. назад

Grayscale Research: Почему не стоит игнорировать Zcash в эпоху ИИ и финансовой приватности?

В эпоху развития ИИ и цифрового мониторинга, финансовая конфиденциальность становится все более важной. Grayscale Research отмечает растущий интерес к этой теме и представляет Zcash как децентрализованную цифровую валюту с механизмами приватности на основе технологии доказательств с нулевым разглашением (zk-SNARKs). В отличие от прозрачного Bitcoin, Zcash предлагает «защищенные транзакции», скрывающие отправителя, получателя и сумму, а также поддерживает выборочное раскрытие данных. Статья подчеркивает, что приватность — это не нишевая функция, а основополагающее свойство денег. Несмотря на техническую зрелость Zcash (прошедшего через ключевые обновления, такие как Sapling и Orchard) и высокий процент приватных транзакций в сети, его рыночная капитализация составляет всего 0.6% от сектора цифровых валют. Это указывает на то, что рынок недооценивает потенциальную стоимость приватности. В качестве рисков отмечаются регуляторные вызовы, устаревшие пулы средств, связанные с доверительной настройкой, и сложность выполнения технической дорожной карты. Вывод заключается в том, что Zcash представляет собой недооцененную возможность, так как текущая цена не учитывает вероятность роста значимости финансовой приватности в будущем.

marsbit2 ч. назад

Grayscale Research: Почему не стоит игнорировать Zcash в эпоху ИИ и финансовой приватности?

marsbit2 ч. назад

OriginX соберет лидеров биткоин-сообщества из 22 стран и более 70 партнеров в Сеуле на ORIGIN SEOUL 2026

Компания OriginX, базирующаяся в Сеуле, проведет конференцию ORIGIN SEOUL 2026 1 и 2 сентября в конференц-центре SKY31 башни Lotte World Tower. Мероприятие соберет лидеров биткойн-индустрии из 22 стран и более 70 партнеров, включая компании, СМИ и арт-сообщества. Конференция построена на основе постоянной инфраструктуры Bitcoin House ORIGIN — крупнейшего в Южной Корее коворкинга, посвященного Биткойну. Программа разделена на два дня: 1 сентября (Индустриальный день) будет посвящен институциональным аспектам, таким как инвестиции, ETF, стейблкоины и майнинг. 2 сентября (Публичный день) сосредоточится на анализе рынка, самостоятельном хранении активов и развитии сообществ. Спикеры включают Джеймса Чека, Теруко Нэрики, Кевина Лоаэка и Стефана Ливеру. В рамках ORIGIN SEOUL также запланировано 14 побочных мероприятий по всему Сеулу, включая воркшопы, встречи и благотворительный забег. Конференция связана с событием Bitcoin Asia в Гонконге, формируя «Биткойн-неделю в Азии». Основатель OriginX Райан Ли подчеркивает, что цель мероприятия — не только собрать людей ради Биткойна, но и познакомить их с Сеулом и местным сообществом.

TheNewsCrypto2 ч. назад

OriginX соберет лидеров биткоин-сообщества из 22 стран и более 70 партнеров в Сеуле на ORIGIN SEOUL 2026

TheNewsCrypto2 ч. назад

С переходом ИИ-агентов к реальным тратам для XRP может начаться новый этап

С переходом ИИ-агентов от покупки цифровых ресурсов к выполнению реальных коммерческих задач для XRP может начаться новый этап, как отмечает Чандлер Фанг, соучредитель стартапа t54. Агенты уже провели более миллиона транзакций через XRP Ledger (XRPL) без участия человека. Следующий шаг — интеграция в более широкую коммерческую деятельность, включая автоматизированные закупки и платежи. Ripple выпустила XRPL AI Starter Kit, поддерживающий платежи в XRP и Ripple USD (RLUSD) за API, вычисления и другие услуги. Программа Mastercard «Agent Pay for Machines» расширяет это на счета и транзакции, которые компании хотят автоматизировать. Для внедрения потребуются криптокошельки и инструменты контроля расходов, а торговцам — адаптировать интерфейсы для автономных систем. Использование XRP будет зависеть от потребностей расчётов: для частых мелких платежей, более крупных транзакций или агрегированных обязательств. XRP и RLUSD выполняют взаимодополняющие функции в XRPL. В долгосрочной перспективе внедрение может стать «незаметным»: агенты будут встроены в казначейские и логистические системы, а пользователям не нужно будет напрямую взаимодействовать с XRPL. Ключевыми показателями успеха станут не объёмы транзакций, а повторяющаяся активность, доход продавцов и эффективное урегулирование споров.

cryptonews.ru3 ч. назад

С переходом ИИ-агентов к реальным тратам для XRP может начаться новый этап

cryptonews.ru3 ч. назад

Торговля

Спот
活动图片