3B-модель поставила рекорд в программировании наравне с Opus 4.5: китайская модель вызвала горячие споры

marsbitОпубликовано 2026-06-18Обновлено 2026-06-18

Введение

В последние дни небольшая модель VibeThinker-3B (3 миллиарда параметров) привлекла большое внимание, продемонстрировав результаты, сопоставимые с передовыми крупными моделями, такими как GPT-5 high и Claude Opus 4.5, в задачах верифицируемого рассуждения — программировании, математике и STEM. Разработанная командой Weibo (Sina), она основана на Qwen2.5-Coder-3B и использует усовершенствованный конвейер Spectrum-to-Signal, включая обучение с подкреплением (RL) и дистилляцию. Модель показала выдающиеся результаты: 94.3 балла на AIME26, 89.3 на HMMT25, 80.2 на LiveCodeBench v6 и 96.1% успеха в свежих соревнованиях LeetCode. Метод Claim-Level Reliability (CLR) ещё повысил её точность. Важным выводом работы является «гипотеза параметрического сжатия»: возможности верифицируемого рассуждения (логика, проверка) могут быть эффективно сжаты в компактной модели, в отличие от общих знаний, требующих больших параметров. Это указывает на частичное разделение рассуждений и фактологических знаний. Цель авторов — не замена больших моделей, а исследование предела малых моделей в специфических областях с чёткими правилами и обратной связью. Модель доступна для загрузки, но её эффективность ограничена задачами с надёжной проверкой, а не общими диалогами.

В последние дни небольшая модель на 3B стала хитом в X, потому что на некоторых сложных, но проверяемых задачах на рассуждение (например, программирование) она вошла в диапазон производительности передовых моделей, таких как Gemini 3 Pro, GPT-5 high, Claude Opus 4.5, GLM-5, Kimi K2.5, при этом её размер значительно меньше, чем у этих моделей.

Эта модель называется VibeThinker-3B. Это плотная модель для рассуждений с 3 миллиардами параметров, цель которой — исследовать, насколько можно продвинуть проверяемую способность к рассуждению при строго ограниченном небольшом размере модели.

После публикации модели многие были поражены её результатами и выразили желание попробовать её в деле.

Стоит отметить, что это также отечественная модель от команды Weibo (Сина Вэйбо).

Технический отчёт показывает, что модель специально разработана для задач с надёжными сигналами верификации, включая математические рассуждения, спортивное программирование, STEM-рассуждения, а также выполнение инструкций с чёткими ограничениями.

Поэтому она показывает выдающиеся результаты по всем контрольным тестам. В тесте AIME26 она набрала 94,3 балла, в тесте HMMT25 — 89,3 балла, в тесте LiveCodeBench v6 — 80,2 балла (Pass@1), а в самых свежих непубличных еженедельных и двухнедельных соревнованиях LeetCode с 25 апреля по 31 мая 2026 года достигла процента успешных решений 96,1%.

Как обучалась эта модель? Технический отчёт раскрывает некоторые детали.

Во-первых, она построена на основе Qwen2.5-Coder-3B и проходит последующее обучение по усовершенствованному процессу Spectrum-to-Signal. Этот процесс усиливает синтез данных, фильтрацию качества и поурочное обучение при контролируемом тонком обучении (SFT), расширяет обучение с подкреплением в стиле MGPO на несколько проверяемых областей, сохраняет полные траектории рассуждений в длинном контексте и укрепляет все способности с помощью авто-дистилляции вне сети и обучения с подкреплением на инструкциях (Instruct RL).

Общий процесс обучения VibeThinker-3B.

Процесс Spectrum-to-Signal.

Кроме того, VibeThinker-3B внедряет оценку надёжности на уровне утверждений (Claim-Level Reliability, CLR) — это стратегия масштабирования во время тестирования, ориентированная на проверяемые рассуждения с ответами. CLR дополнительно повышает производительность на математических тестах, увеличивая результат AIME26 с 94,3 до 97,1, HMMT25 с 89,3 до 95,4 и поднимая BruMO25 до 99,2.

Конкретный процесс обучения выглядит следующим образом:

  • Двухэтапное SFT на основе учебного плана. Первый этап сосредоточен на широком охвате способностей, включая математику, программирование, STEM-рассуждения, общий диалог и следование инструкциям. Второй этап переходит к более сложным и широким по охвату выборкам для рассуждений. Дистилляция с исследованием разнообразия используется для сохранения нескольких эффективных путей решения.
  • Обучение с подкреплением для рассуждений в нескольких областях. VibeThinker-3B повторно использует MGPO. Обучение с подкреплением последовательно применяется к математическим, программистским и STEM-задачам на рассуждение. Для обучения используется одно окно длинного контекста на 64K токенов, чтобы сохранить полные траектории длинных рассуждений.
  • Авто-дистилляция вне сети. Высококачественные траектории отбираются и очищаются из контрольных точек обучения с подкреплением по математике, программированию и STEM, в конечном итоге формируя единую студенческую модель. Оценка потенциала обучения используется для приоритизации тех траекторий, которые правильны, но ещё не были хорошо усвоены студенческой моделью.
  • Instruct RL. Финальный этап повышает управляемость для пользовательских промптов. Для учебных данных, чувствительных к формату и открытых, используются основанные на правилах валидаторы и модели вознаграждения на основе критериев оценки.

В недавнем посте известный исследователь ИИ и блогер Себастьян Рашка систематически обобщил ключевые моменты, раскрытые в техническом отчёте VibeThinker-3B, включая следующие:

Если вас заинтересовало это содержание, вы можете подробно изучить их технический отчёт. В настоящее время модель также доступна для публичного скачивания.

Название отчёта: VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

Ссылка на отчёт: https://arxiv.org/pdf/2606.16140

Ссылка на HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B

Однако область применения этой модели чётко ограничена, поскольку в областях, требующих общих знаний, она не показывает выдающихся результатов.

Разработчики также чётко указали на это и выдвинули «гипотезу сжатия параметров для покрытия»: разные способности по-разному зависят от параметров модели. Проверяемое рассуждение ближе к высокосжимаемой, параметрически плотной способности, ядро которой заключается в многошаговом рассуждении, удовлетворении ограничений, самокоррекции и проверке ответов. Когда пространство задач имеет достаточно чёткую структуру и сигналы обратной связи достаточно надёжны, компактная модель также может обладать способностью к рассуждениям, близкой к передовому уровню. В отличие от этого, знания в открытой области, общий диалог и понимание длинных хвостов сценариев в большей степени зависят от масштаба параметров для широкого покрытия фактов, концепций и знаний о мире. Эта гипотеза очень вдохновляет. VentureBeat в своём репортаже написали: «Она раскрывает частичное разделение между способностью к рассуждению и фактическими знаниями, и первая может быть сжата более эффективно, чем предполагалось ранее — это понимание имеет далеко идущие последствия для того, как индустрия рассматривает дизайн моделей, стоимость развёртывания и доступность продвинутых функций искусственного интеллекта.»

Авторы заявляют, что их цель — не создать небольшую модель как замену крупным моделям, а изучить истинные границы небольших моделей вдоль определённых измерений способностей. С помощью VibeThinker-3B они хотят показать, что небольшие модели не должны рассматриваться лишь как компромисс для снижения стоимости развёртывания. В областях способностей с чёткими механизмами обратной связи и проверки небольшие языковые модели открывают перспективный исследовательский путь, потенциально позволяющий достичь передового уровня производительности и создать фундаментально дополняющие отношения с традиционной парадигмой масштабирования по параметрам.

В настоящее время в сообществе к этой модели всё ещё есть некоторые сомнения. Если вам интересна эта модель,不妨 попробуйте её сами.

Ссылки:

https://x.com/orcus108/status/2066876960073281582

Эта статья взята с официального аккаунта WeChat «Машинный разум» (ID: almosthuman2014), автор: Чжан Цянь.

Связанные с этим вопросы

QЧто такое VibeThinker-3B и почему он привлёк к себе внимание?

AVibeThinker-3B — это небольшая языковая модель с 3 миллиардами параметров, разработанная командой Weibo (Sina Weibo). Она привлекла внимание, потому что в таких поддающихся проверке рассуждениях, как программирование, показала результаты, сравнимые с крупными передовыми моделями, такими как GPT-5 high и Claude Opus 4.5, при значительно меньшем размере.

QКаковы ключевые характеристики производительности модели VibeThinker-3B?

AМодель показывает выдающиеся результаты в проверяемых задачах: 94.3 балла на AIME26, 89.3 на HMMT25, 80.2 балла (Pass@1) на LiveCodeBench v6 и 96.1% проходимость на недавних непубличных соревнованиях LeetCode (апрель-май 2026). Использование стратегии CLR (Claim-Level Reliability) дополнительно повышает её показатели.

QКак тренировали модель VibeThinker-3B?

AМодель основана на Qwen2.5-Coder-3B. Её обучение включает: 1) Двухэтапный SFT по учебному плану с акцентом на математику, программирование, STEM и общий диалог. 2) Обучение с подкреплением (RL) в нескольких областях рассуждений. 3) Оффлайн само-дистилляцию для объединения знаний. 4) Instruct RL для улучшения управляемости при взаимодействии с пользователем. Используется процесс Spectrum-to-Signal.

QВ чём заключается «гипотеза параметрического сжатия и покрытия», предложенная авторами?

AАвторы предполагают, что разные способности по-разному зависят от параметров модели. Проверяемое рассуждение (логика, решение задач) — это «сжимаемая», параметрически-плотная способность, которая может быть эффективно реализована в компактной модели при наличии чёткой структуры задачи и надёжной обратной связи. В то время как общие знания и понимание мира требуют больших параметров для широкого покрытия фактов. Это означает частичное разделение логического мышления и фактологических знаний.

QКаковы ограничения модели VibeThinker-3B и где она неэффективна?

AVibeThinker-3B специализируется на задачах с чёткими правилами и возможностью проверки (математика, программирование, STEM). В областях, требующих обширных общих знаний, понимания открытого мира или работы с длинными хвостами редких сценариев, её производительность значительно ниже, чем у крупных моделей. Она не предназначена для замены больших моделей в общих диалогах или решениях неструктурированных задач.

Похожее

9,42 миллиона частных инвесторов бросились покупать акции Changxin Technology, кто же выиграл в лотерее?

Результаты размещения акций Changxin Technology привлекли огромное внимание инвесторов. Всего в онлайн-подписке для частных инвесторов участвовало около 9,4288 миллиона человек, было подано 816,92 миллиарда заявок на акции, сгенерировано примерно 7,7 миллиона выигрышных лотерейных номеров, а итоговая ставка онлайн-подписки составила около 0,4714%, что является рекордно высоким показателем для новых акций на рынке STAR. Из-за высокого спроса компания активировала механизм обратного перевода, увеличив количество акций, размещаемых онлайн, до 3,851 миллиарда. Среди институциональных инвесторов 285 организаций, управляющих 10907 счетами, подали заявки на сумму около 12,38 триллиона акций, получив в итоге 2,173 миллиарда акций при коэффициенте распределения около 0,1756%. Taikang Asset Management стал институциональным инвестором, получившим наибольшее распределение. Среди публичных фондов лидерами по объему размещения стали E Fund, Southern Fund и ICBC Credit Suisse. Основатель ведущей китайской компании в области больших моделей DeepSeek, Лян Вэньфэн, через свои хедж-фонды Ningbo幻方量化 и Zhejiang九章资产 получил самое большое распределение среди частных фондов — акций на общую сумму примерно 1,75 миллиарда юаней. Ожидается, что Changxin Technology официально выйдет на биржу 27 июля. По оценкам рынка, её стоимость после IPO может превысить 1 триллион юаней, а некоторые аналитики дают прогноз до 2-3 триллионов юаней. Однако недавняя коррекция на глобальном технологическом рынке может оказать определенное влияние на цену акций компании после листинга.

marsbit13 мин. назад

9,42 миллиона частных инвесторов бросились покупать акции Changxin Technology, кто же выиграл в лотерее?

marsbit13 мин. назад

Криптовалюта USCR стабилизируется на отметке $0,0022: Сможет ли мемкоин отыграть потери второго квартала?

Криптовалюта USCR, мемкоин, отслеживающий тему официальных крипторезервов США, пытается восстановиться после падения до двухмесячного минимума в $0.0022. В мае цена выросла на 65%, но в июне упала на 37%. Сейчас наблюдается потенциальный отскок, и если быкам удастся закрепиться выше ключевых скользящих средних, возможен рост до $0.0028 (уровень Фибоначчи) и далее до майского пика в $0.0036, что означает потенциал роста на 30-60%. Динамика USCR тесно связана с новостями о создании стратегического резерва биткойна в США. Майский рост совпал с увеличением вероятности этого события и внесением соответствующего законопроекта. Однако его рассмотрение застопорилось, а шансы на создание резерва к 2027 году, по данным Polymarket, упали до 18%, что давит на настроения. Несмотря на неопределённость, база держателей USCR остаётся значительной: 48 тысяч, сократившись лишь на 4 тысячи с начала 2026 года. Восстановление цены будет зависеть от позитивных новостей по законопроекту о биткойн-резерве.

ambcrypto33 мин. назад

Криптовалюта USCR стабилизируется на отметке $0,0022: Сможет ли мемкоин отыграть потери второго квартала?

ambcrypto33 мин. назад

«Богиня благотворительности» с 3 млн подписчиков целиком создана ИИ, поддельный детский дом, международный «фальшивый фонд» рухнул за одну ночь

**Шокирующий разоблачение: Астролябка «благотворительности» с 300 000 подписчиков оказалась масштабной аферой на основе ИИ** Австралийская инфлюенсерша Лили Джей, имевшая почти 3 миллиона подписчиков в Instagram, создала тщательно продуманную мошенническую схему под прикрытием своего «Фонда Лили Джей». Используя искусственный интеллект, она и ее команда генерировали фальшивые изображения и видео, изображающие строительство мечетей, раздачу хлеба в Газе и даже открытие детского дома в Уганде для привлечения пожертвований от преимущественно мусульманской аудитории. Расследование ABC News Verify выявило многочисленные подделки: видео с «открытием» детского дома полностью сгенерировано ИИ (включая детей, саму Лили и фонды), «награда» за гуманитарную деятельность оказалась фальшивкой с цифровым водяным знаком ИИ, а заявленные благотворительные проекты в Уганде и Газе не существуют. Фонд не зарегистрирован как официальная благотворительная организация, что позволяло избегать финансовой отчетности. После запросов ABC сайт фонда стал скрывать кнопки для пожертвований и предупреждения о своем неблаготворительном статусе для посетителей из Австралии, но оставил их для иностранных пользователей. Эксперты предупреждают, что эта афера — тревожный прецедент, демонстрирующий, как ИИ может эксплуатировать человеческое доверие и желание творить добро, создавая убедительные, но полностью вымышленные нарративы.

marsbit52 мин. назад

«Богиня благотворительности» с 3 млн подписчиков целиком создана ИИ, поддельный детский дом, международный «фальшивый фонд» рухнул за одну ночь

marsbit52 мин. назад

L2 «рекалибровка»: когда L1 становится собственным ролл-апом, каков финал Ethereum?

«L2 перекалибровка»: когда L1 становится собственным роллапом, каков финал Ethereum? Первоначально, роллапы (L2) рассматривались как основной путь масштабирования Ethereum, обеспечивая дешёвое и быстрое исполнение транзакций. Однако, с развитием самого L1 (повышение лимита газа, внедрение безсостоятельности и zkEVM) и объединением задач масштабирования, традиционное разделение между L1 как безопасным, но медленным «слоем урегулирования» и L2 как дешёвым «слоем исполнения» меняется. Вопрос теперь не только в увеличении пространства блоков, а в перераспределении ролей в системе с множеством исполняющих сред. Будущая роль L2 смещается от простого предоставления дешёвого газа к обеспечению уникальных функций, таких как оптимизация для конкретных приложений, приватность и гибкие модели управления. Таким образом, L2 станет скорее спектром исполняющих сред с разной степенью наследования безопасности Ethereum, чем единым техническим классом. Ключевой задачей становится решение фрагментации. Разделённая ликвидность и состояние пользователя ухудшают опыт. Усилия концентрируются на улучшении взаимодействия (интероперабельности) через системы на основе намерений (intents) и нативные протоколы, такие как Ethereum Interoperability Layer (EIL), чтобы Ethereum вновь «ощущался как единая цепь». Сокращение времени до финальности транзакций L1 также имеет решающее значение для доверия между цепями. Ещё более радикальная идея — с появлением систем доказательств (zkEVM) внутри L1 сама Ethereum может стать своего рода «собственным роллапом», где высокопроизводительные узлы исполняют транзакции, а валидаторы проверяют криптографические доказательства. Это размывает классические границы между слоями и открывает путь к архитектуре, где множество исполняющих доменов (специализированных L2) сосуществуют, разделяя общую безопасность, ликвидность и систему урегулирования Ethereum. В итоге, будущее Ethereum видится не как победа L1 над L2 или наоборот, а как экосистема взаимосвязанных исполняющих сред, которые, будучи «разобранными» для масштабирования, вновь объединяются в единое, безопасное и удобное для пользователя целое.

marsbit55 мин. назад

L2 «рекалибровка»: когда L1 становится собственным ролл-апом, каков финал Ethereum?

marsbit55 мин. назад

Grayscale подает первую заявку на спотовый ETF Worldcoin в SEC под тикером GWLD

Компания Grayscale Investments подала заявку в Комиссию по ценным бумагам и биржам США (SEC) на запуск биржевого фонда (ETF), ориентированного на криптовалюту Worldcoin (WLD), под тикером GWLD. Заявка подана в момент, когда WLD торгуется на исторически низких уровнях, но новость вызвала рост его цены более чем на 8%. В документах подчеркиваются потенциальные риски для инвесторов, включая высокую концентрацию токенов (около 90% предложения в руках 100 крупнейших кошельков) и плановую разблокировку токенов командами проекта до 2028 года, что может оказывать давление на курс. Также отмечены регуляторные вопросы, связанные с биометрическим сбором данных через сканирование сетчатки глаза в проекте Worldcoin. Несмотря на то, что запуск ETF на бирже запланирован только на конец 2026 года, Grayscale активно расширяет линейку регулируемых криптовалютных продуктов, стремясь укрепить свои позиции на зарождающемся рынке ETF.

TheNewsCrypto1 ч. назад

Grayscale подает первую заявку на спотовый ETF Worldcoin в SEC под тикером GWLD

TheNewsCrypto1 ч. назад

Торговля

Спот
活动图片