# Сопутствующие статьи по теме Бенчмарк

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Бенчмарк", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

За оценками ИИ скрывается китайский «составитель тестов»

За кулисами результатов ведущих ИИ-моделей, таких как GPT и Gemini, часто стоит один и тот же «составитель заданий» — китайский исследователь Чэнь Вэньху. Будучи доцентом Университета Ватерлоо и основателем лаборатории TIGERLab, он разработал ключевые оценочные эталоны MMLU-Pro, MMMU и MMMU-Pro, которые стали общим языком для сравнения способностей моделей. Чэнь Вэньху сосредоточился на создании более сложных и устойчивых тестов, когда предыдущие эталоны, такие как MMLU, перестали эффективно различать передовые модели, достигшие почти идеальных результатов. MMLU-Pro, с его 12032 вопросами, расширенными вариантами ответов и акцентом на рассуждения, снизил точность моделей на 16–33% и уменьшил зависимость от угадывания. MMMU и MMMU-Pro, в свою очередь, оценивают мультимодальное понимание, требуя от моделей анализа изображений, таблиц, схем и текста в контексте профессиональных знаний, что выявило значительные ограничения даже у самых мощных моделей. Исследования Чэнь Вэньху в области сложных вопросно-ответных систем и его опыт работы в Google DeepMind над Gemini позволили ему глубоко понять слабые места в оценке ИИ. Его лаборатория также занимается разработкой моделей, таких как UniVideo и Vamba, что помогает создавать более точные и релевантные тесты. Сегодня, работая в лаборатории суперинтеллекта Meta, Чэнь Вэньху продолжает влиять на развитие ИИ через улучшение данных для предобучения и систем оценки, оставаясь ключевой, но менее заметной фигурой в этой быстроразвивающейся области.

marsbit06/20 03:52

За оценками ИИ скрывается китайский «составитель тестов»

marsbit06/20 03:52

За кулисами оценок ИИ стоит китайский «составитель заданий»

За заголовками AI-бенчмарков, таких как MMLU-Pro, MMMU и MMMU-Pro, стоит имя китайского исследователя Вэньху Чэня, доцента Университета Ватерлоо и основателя TIGER Lab. Его работа фокусируется на создании точных и сложных тестов для оценки способностей языковых и мультимодальных моделей. Когда старый стандарт MMLU перестал эффективно различать передовые модели, Чэнь и его команда разработали MMLU-Pro. Этот новый бенчмарк, содержащий более 12 000 вопросов, сделал задачи сложнее и стабильнее, что позволило снова выявить разницу между моделями, которые на старом тесте показывали почти идеальные результаты. В области мультимодального ИИ команда Чэня создала бенчмарк MMMU, который проверяет способность моделей понимать и рассуждать на основе комбинации текста, изображений, схем и других визуальных данных из профессиональных областей. Даже самые мощные модели изначально показывали на нём низкую точность, что выявило значительный пробел в их реальных способностях. Последующее обновление, MMMU-Pro, ещё больше усложнило задачу, предотвращая попытки моделей игнорировать визуальную информацию. Исследовательский интерес Чэня к сложным вопросам, требующим рассуждений и синтеза информации из разных источников, сформировался ещё во время его работы в Калифорнийском университете и позже в Google DeepMind над проектом Gemini. Этот практический опыт в разработке моделей помогает ему создавать более эффективные и «защищённые от обмана» тесты. Помимо оценки, его лаборатория также занимается исследованиями в области создания моделей, например, для работы с видео. В настоящее время Чэнь работает в лаборатории суперинтеллекта Meta, продолжая исследования в области данных и оценки для мультимодального ИИ. Его история является примером того, как китайские специалисты вносят ключевой вклад в развитие ИИ на фундаментальном уровне, часто оставаясь за кадром публичных обсуждений.

marsbit06/19 09:19

За кулисами оценок ИИ стоит китайский «составитель заданий»

marsbit06/19 09:19

3B-модель поставила рекорд в программировании наравне с Opus 4.5: китайская модель вызвала горячие споры

В последние дни небольшая модель VibeThinker-3B (3 миллиарда параметров) привлекла большое внимание, продемонстрировав результаты, сопоставимые с передовыми крупными моделями, такими как GPT-5 high и Claude Opus 4.5, в задачах верифицируемого рассуждения — программировании, математике и STEM. Разработанная командой Weibo (Sina), она основана на Qwen2.5-Coder-3B и использует усовершенствованный конвейер Spectrum-to-Signal, включая обучение с подкреплением (RL) и дистилляцию. Модель показала выдающиеся результаты: 94.3 балла на AIME26, 89.3 на HMMT25, 80.2 на LiveCodeBench v6 и 96.1% успеха в свежих соревнованиях LeetCode. Метод Claim-Level Reliability (CLR) ещё повысил её точность. Важным выводом работы является «гипотеза параметрического сжатия»: возможности верифицируемого рассуждения (логика, проверка) могут быть эффективно сжаты в компактной модели, в отличие от общих знаний, требующих больших параметров. Это указывает на частичное разделение рассуждений и фактологических знаний. Цель авторов — не замена больших моделей, а исследование предела малых моделей в специфических областях с чёткими правилами и обратной связью. Модель доступна для загрузки, но её эффективность ограничена задачами с надёжной проверкой, а не общими диалогами.

marsbit06/18 00:24

3B-модель поставила рекорд в программировании наравне с Opus 4.5: китайская модель вызвала горячие споры

marsbit06/18 00:24

Anthropic предупреждает о рекурсивном ИИ: новая компания Тянь Юаньдуна только что сделала «первый шаг»

Недавно Anthropic опубликовала статью «Когда ИИ создаёт себя», вызвавшую широкое обсуждение. В ней раскрываются впечатляющие данные: к маю 2026 года более 80% кода в их репозитории написан Claude, а объёмы кода, сливаемого инженерами ежедневно, выросли в 8 раз по сравнению с 2024 годом. Claude также ускорил один обучающий код примерно в 52 раза, в то время как опытному исследователю потребовалось бы 4-8 часов для ускорения в 4 раза. Anthropic указывает на цель — «рекурсивное самоулучшение», когда ИИ автономно проектирует, строит и обучает свои последующие версии. Теперь компания Recursive Superintelligence, соучредителем которой является Тянь Юаньдун, сделала «первый шаг» к автоматизации исследований ИИ. Они создали открытую систему автоматического открытия знаний и достигли лучших результатов (SOTA) в трёх бенчмарках, позволив ИИ проводить эксперименты. Их система автоматизирует традиционный цикл исследований «идея — код — эксперимент — анализ» и работает в трёх различных областях: 1. **Тренировка небольшой модели с фиксированным бюджетом вычислений (NanoChat Autoresearch):** Система улучшила результат, сократив валидационный BPB с 0.9372 до 0.9109, что эквивалентно достижению того же качества обучения за в 1.3 раза меньше времени. 2. **Скоростное обучение модели (NanoGPT Speedrun):** На 8 GPU H100 система сократила время обучения модели GPT до целевого уровня потерь с 79.7 секунд до 77.5 секунд, внедрив такие улучшения, как вычисления внимания в FP8, затухающий шум в оптимизаторе и более эффективное ядро MLP. 3. **Оптимизация GPU ядер (SOL-ExecBench):** В этом специализированном бенчмарке NVIDIA, содержащем 235 задач, система повысила общий балл с 0.699 до 0.754, приблизившись к теоретическому аппаратному пределу на 18%. Recursive подчёркивает, что это лишь «первый шаг». Их система наиболее эффективна в задачах с чёткими метриками и быстрой обратной связью, а предотвращение «взлома награды» остаётся ключевой проблемой. Тем не менее, их работа представляет собой конкретную реализацию новой парадигмы — рекурсивного ИИ, способного ускорять собственный прогресс. Это происходит на фоне предупреждений Anthropic о необходимости координации и потенциальных пауз в разработке перед лицом быстрого рекурсивного самоулучшения.

marsbit06/12 04:13

Anthropic предупреждает о рекурсивном ИИ: новая компания Тянь Юаньдуна только что сделала «первый шаг»

marsbit06/12 04:13

«Мне не нужна лучшая модель»: панорама сообщества ИИ в горячем треде на Reddit

Автор: пятница, Deep Tide TechFlow Anthropic выпустила Claude Fable 5, свою первую общедоступную модель класса Mythos. Она показала рекордные 80.3% на бенчмарке SWE-Bench Pro, значительно опередив предыдущие флагманы. Однако реакция пользователей на Reddit оказалась прохладной. В популярном посте на r/artificial пользователь заявил: «Claude Fable дал мне понять, что мне не нужна лучшая модель». Многие согласились, отмечая, что с Opus 4.5 или 4.8 их рабочие потребности уже полностью удовлетворены, а переход на более дорогую модель (Fable 5 стоит почти в два раза дороже) не дает ощутимой пользы. Некоторые считают, что развитие публичных ИИ-моделей достигло плато. Главной претензией к Fable 5 стали излишне строгие «защитные ограждения» (safety classifiers). Пользователи жалуются, что модель часто отказывается выполнять задачи, связанные даже с безопасностью кода, перенаправляя их на Opus. Для платящих клиентов это особенно неприятно. Однако есть и противоположное мнение. Пользователи, работающие с исключительно сложными задачами (например, симуляции в физике высоких энергий с тысячами строк кода), отмечают кардинальную разницу в качестве и называют Fable 5 прорывом. Обсуждение подняло вопрос о будущем публичного ИИ: станут ли модели, доступные обычным людям, еще мощнее, или элитные версии (как Mythos 5 для госструктур) навсегда останутся в закрытом доступе? Пока что Fable 5 демонстрирует разрыв между бенчмарками и повседневным опытом. Ее успех будет зависеть от настройки баланса между безопасностью и полезностью, а также от готовности тяжелых пользователей платить за экстремальные возможности.

marsbit06/12 02:53

«Мне не нужна лучшая модель»: панорама сообщества ИИ в горячем треде на Reddit

marsbit06/12 02:53

До AGI остался последний шаг

В июне 2026 года Anthropic представила мощную модель Fable 5, доступную широкой публике, и ее еще более продвинутую версию Mythos 5, доступную только избранным организациям. Fable 5 демонстрирует исключительные возможности в области автоматизированного программирования, самостоятельно выполняя сложные многоэтапные задачи, такие как миграция огромных кодовых баз, что указывает на достижение уровня AGI в цифровой экономике. Модель классифицируется как "Уровень 3" (интеллектуальный агент) по шкале OpenAI и быстро движется к "Уровню 4" (новатор). Однако внутренняя версия Mythos 5 показала опасные возможности, включая потенциальное содействие в создании биологического или химического оружия и генерацию эксплойтов для кибератак. Для предотвращения злоупотреблений Anthropic внедрила в Fable 5 систему классификации для фильтрации опасных запросов и обязательное 30-дневное хранение данных. Несмотря на высокую стоимость использования, ожидается, что спрос со стороны корпоративных клиентов, особенно в сфере кибербезопасности, останется высоким. Это знаменует переход рынка ИИ в зрелую фазу, где передовые технологии становятся стратегическим активом для бизнеса и обороны, потенциально приводя к росту "компаний одного человека" и трансформации рынка труда.

marsbit06/11 05:12

До AGI остался последний шаг

marsbit06/11 05:12

Только что выпущен Claude Mythos 5 — 50 миллионов строк кода за один день

Anthropic представила свои самые мощные на сегодняшний день модели Claude Fable 5 и Claude Mythos 5. Fable 5, доступная широкой публике, обладает функциями безопасности, которые автоматически переключают её на более старую модель Claude Opus 4.8 при обнаружении рискованных запросов, например, связанных с кибербезопасностью. Более мощная Mythos 5 без подобных ограничений доступна лишь избранным доверенным пользователям. Технически модели демонстрируют прорывные возможности. Fable 5 за один день выполнила миграцию кодовой базы объёмом 50 миллионов строк на Ruby, что обычно занимает у команды инженеров два месяца. В тестах на решение сложных задач программирования (SWE-bench Pro) она набрала 80.3%, опередив конкурентов. Модель также показала превосходство в обработке визуальной информации, самостоятельно пройдя видеоигру «Pokémon», и в задачах, требующих длительного контекста и памяти, например, в карточной игре «Slay the Spire». В сфере научных исследований Mythos 5, по данным Anthropic, способна автономно выполнять рабочий процесс биолога, проектировать молекулы и выдвигать научные гипотезы. Разработанные ею белковые соединения уже используются в реальных фармакологических исследованиях. Профессор Итан Моллик, протестировавший Fable 5, отмечает смену парадигмы взаимодействия: теперь человек выступает скорее как «заказчик» или «спонсор», выдавая сложные, многоэтапные задачи, которые модель выполняет автономно в течение многих часов, практически без вмешательства человека. Стоимость API для новых моделей установлена на уровне $10 за 1 млн входных и $50 за 1 млн выходных токенов. Anthropic также вводит политику хранения данных всех запросов к моделям уровня Mythos в течение 30 дней в целях безопасности.

marsbit06/10 00:25

Только что выпущен Claude Mythos 5 — 50 миллионов строк кода за один день

marsbit06/10 00:25

От Hunyuan к AI WeChat: медленный темп Tencent достигает точки доставки

В июне 2026 года WeChat AI начал закрытое тестирование, интегрируя возможности искусственного интеллекта в экосистему мини-программ WeChat. Пользователи смогут с помощью естественного языка вызывать и управлять мини-программами. Платформа предлагает два режима интеграции: автоматический (чтение исходного кода без дополнительной разработки) и ручной (создание пользовательских навыков). Этот шаг стал следующим этапом в стратегии Tencent по внедрению ИИ после разработки базовой модели Hunyuan и запуска автономного приложения Yuanbao. Модель Hunyuan, занимающая лидирующие позиции в Китае по практическим возможностям (особенно в понимании и выполнении задач — Agent), обеспечивает необходимую стабильность и надежность для операций внутри WeChat. Рост Yuanbao, чей месячный аудиториум превысил 100 млн пользователей во время празднования Лунного Нового года в 2026 году, в основном был обусловлен маркетинговыми активностями. Однако его ежедневная аудитория в обычные дни составляет около 9 млн, что указывает на проблему удержания пользователей. Интеграция ИИ непосредственно в супер-приложение WeChat призвана решить эту проблему за счет привязки к конкретным сценариям использования. Ключевой вызов для WeChat AI заключается в балансировании между эффективным централизованным управлением услугами ИИ и защитой интересов разработчиков мини-программ. Существует опасение, что прямое выполнение ИИ транзакций (например, заказ кофе) может «обойти» интерфейсы разработчиков, лишив их возможности взаимодействия с пользователем, показа рекламы и сбора данных. Генеральный директор Tencent Ма Хуатэн признал эту дилемму, подчеркнув необходимость нахождения компромисса. Таким образом, Tencent выстроил согласованную стратегию: Hunyuan как стабильная база, Yuanbao как полигон для проверки гипотез на пользователях и WeChat AI как финальная точка интеграции. Успех будет зависеть от решения вопросов доверия разработчиков к автоматическому режиму, выстраивания справедливых правил распределения трафика и обеспечения высокой точности операций ИИ для завоевания доверия пользователей.

marsbit06/08 10:25

От Hunyuan к AI WeChat: медленный темп Tencent достигает точки доставки

marsbit06/08 10:25

Оценка превысила 200 миллиардов, Kimi привлёк ещё 13,6 миллиардов юаней, IPO в Гонконге ускоряется

Компания Moonshot AI (Kimi), пекинский единорог в области больших языковых моделей, ведет переговоры о новом раунде финансирования размером до 20 млрд долларов (около 136 млрд юаней). Целевая оценка компании может достичь 300 млрд долларов (около 2,035 трлн юаней). В случае успеха это будет третье финансирование за последние полгода, а оценка вырастет примерно в 6 раз по сравнению с показателем декабря прошлого года (43 млрд долларов). В мае компания уже привлекла около 20 млрд долларов, достигнув оценки свыше 200 млрд долларов. Всего Moonshot AI, основанная в 2023 году, привлекла более 376 млрд юаней за 6 раундов, что является рекордом среди китайских стартапов в сфере ИИ. Основной продукт — интеллектуальный помощник Kimi. В апреле был выпущен и открыт в open-source флагманский модель Kimi K2.6, показавший конкурентоспособные результаты в тестах против мировых аналогов. В июне началось закрытое бета-тестирование Kimi Work — агента для автоматизации рабочих задач на локальном компьютере. По данным на апрель, годовой регулярный доход (ARR) компании превысил 2 млрд долларов. Также сообщается о подготовке к IPO в Гонконге. На фоне активного финансирования и подготовки к выходу на биржу таких глобальных игроков, как OpenAI и Anthropic, ведущие китайские компании в сфере больших моделей также ускоряют процессы привлечения капитала и IPO, что становится ключевым фактором конкуренции в отрасли.

marsbit06/08 07:46

Оценка превысила 200 миллиардов, Kimi привлёк ещё 13,6 миллиардов юаней, IPO в Гонконге ускоряется

marsbit06/08 07:46

Только что, китайский ИИ ворвался в мировую двойку в программировании, впереди остался только Claude

Сегодня обновление рейтинга Code Arena показало, что китайская модель Qwen3.7-Max от Alibaba набрала 1541 балл и вошла в первую пятерку мировых моделей для программирования, став единственной не-Claude моделью в топ-листе. Она превзошла такие модели, как GPT-5.5 и Gemini 3.5 Flash. В практическом тесте на создание 3D-игры в гонки Qwen3.7-Max продемонстрировала исключительное качество кода и внимание к деталям, выполнив дополнительные требования, такие как создание стартового экрана и добавление звуковых эффектов, с чем другие модели не справились. Это подтвердило её высокие практические способности, помимо результатов в синтетических тестах. Высокая производительность Qwen3.7-Max объясняется её позиционированием как базовой модели (Agent基座模型) для длительного автономного выполнения задач. Внутренние тесты показали, что она способна непрерывно работать до 35 часов, выполняя более 1150 вызовов инструментов без деградации контекста или зацикливания. Два ключевых усовершенствования в обучении способствовали этому прорыву: 1) Расширение окружения (Environment Extension) для развития универсальных стратегий решения задач, и 2) Методология обучения длительному автономному выполнению (Long-range Autonomy), основанная на «динамической накопительной игре на выживание». Появление Qwen3.7-Max в верхней части рейтинга Code Arena, где долгое время доминировали модели Claude, знаменует собой изменение в глобальной конкурентной среде моделей для программирования, представляя Китай как серьёзного участника, способного задавать новые стандарты.

marsbit05/27 00:18

Только что, китайский ИИ ворвался в мировую двойку в программировании, впереди остался только Claude

marsbit05/27 00:18

活动图片