За кулисами оценок ИИ стоит китайский «составитель заданий»

marsbitОпубликовано 2026-06-19Обновлено 2026-06-19

Введение

За заголовками AI-бенчмарков, таких как MMLU-Pro, MMMU и MMMU-Pro, стоит имя китайского исследователя Вэньху Чэня, доцента Университета Ватерлоо и основателя TIGER Lab. Его работа фокусируется на создании точных и сложных тестов для оценки способностей языковых и мультимодальных моделей. Когда старый стандарт MMLU перестал эффективно различать передовые модели, Чэнь и его команда разработали MMLU-Pro. Этот новый бенчмарк, содержащий более 12 000 вопросов, сделал задачи сложнее и стабильнее, что позволило снова выявить разницу между моделями, которые на старом тесте показывали почти идеальные результаты. В области мультимодального ИИ команда Чэня создала бенчмарк MMMU, который проверяет способность моделей понимать и рассуждать на основе комбинации текста, изображений, схем и других визуальных данных из профессиональных областей. Даже самые мощные модели изначально показывали на нём низкую точность, что выявило значительный пробел в их реальных способностях. Последующее обновление, MMMU-Pro, ещё больше усложнило задачу, предотвращая попытки моделей игнорировать визуальную информацию. Исследовательский интерес Чэня к сложным вопросам, требующим рассуждений и синтеза информации из разных источников, сформировался ещё во время его работы в Калифорнийском университете и позже в Google DeepMind над проектом Gemini. Этот практический опыт в разработке моделей помогает ему создавать более эффективные и «защищённые от обмана» тесты. Помимо оценки, его лаборатория также занимается и...

Автор | Алфавит ИИ

Каждый раз, когда выпускается передовая модель, сообщество ИИ пристально следит за несколькими знакомыми табелями успеваемости.

MMLU-Pro, MMMU, MMMU-Pro... Эти названия могут быть незнакомы обычным пользователям, но для компаний-разработчиков моделей и исследователей они уже стали почти "стандартными предметами". GPT, Claude, Gemini, Llama, Qwen, DeepSeek постоянно сдают "экзамены" по этим бенчмаркам.

"Коня узнают по зубам" — часто именно эти баллы служат доказательством того, насколько хороша модель.

Многие графики сравнения производительности на презентациях моделей не обходятся без них; некоторые рейтинги на HuggingFace также построены на этих системах оценки. Можно даже сказать, что сегодня отрасль ИИ, обсуждая возможности моделей, использует уже общий язык, определённый этими бенчмарками.

Но что интересно, почти все следят за баллами, однако мало кто знает, кто составляет задания. А за MMLU-Pro, MMMU и MMMU-Pro стоит одно и то же имя — Вэньху Чэнь (Chen Wenhu).

Он — доцент факультета компьютерных наук Университета Ватерлоо в Канаде, его статьи в Google Scholar цитировались более 30 000 раз.

Он также основатель "TIGERLab", полное английское название которой — Text and Image GEnerative Research Lab. Поскольку в названии есть иероглиф «虎» (тигр), Чэнь Вэньху дал ей очень запоминающееся китайское название — «Банда Тигровой Головы».

После того, как старый экзамен перестал работать

Первоначально больше людей обратили внимание на Чэнь Вэньху из-за MMLU-Pro.

MMLU когда-то была одним из наиболее часто используемых бенчмарков для оценки способностей больших языковых моделей. Она похожа на комплексный экзамен, охватывающий различные дисциплины, и используется для измерения способности модели к пониманию знаний и рассуждениям.

На ранних этапах этот экзамен был очень полезен. Разница между моделями была заметна по баллам, и отрасль также могла с его помощью наблюдать, действительно ли большие языковые модели прогрессируют.

Но проблема вскоре возникла.

По мере постоянного роста способностей моделей MMLU постепенно стала "недостаточно сложной". Баллы передовых моделей становились всё выше, а разрыв между ними — всё меньше.

После выпуска OpenAI o3 эта проблема стала ещё более очевидной. Точность o3 на MMLU уже приближалась к 100%, и другие передовые модели также один за другим стали показывать результаты, близкие к максимальным.

Звучит как хорошая новость, но для оценки это, наоборот, означает проблемы.

Если на экзамене все могут получить баллы, близкие к максимальным, становится трудно определить, кто сильнее и в чём именно. Он всё ещё может доказывать, что модель обладает определёнными способностями, но уже не подходит для измерения нового прогресса.

Отрасли ИИ нужен был более сложный и менее "обманываемый" экзамен.

В 2024 году Чэнь Вэньху и его команда представили MMLU-Pro.

MMLU-Pro не просто расширила базу вопросов, а полностью переработала этот экзамен.

Он содержит 12032 вопроса, охватывающих 14 областей: математику, физику, химию, право, инженерию, психологию, здравоохранение и другие. По сравнению с оригинальной MMLU, количество вариантов ответа увеличено с 4 до 10, чтобы снизить вероятность угадывания; одновременно добавлено больше вопросов, требующих рассуждений, а относительно простые, двусмысленные или недостаточно дифференцирующие вопросы из исходной базы данных удалены.

Эффект был прямым.

Результаты исследования показали, что точность моделей на MMLU-Pro по сравнению с оригинальной MMLU снизилась на 16–33%. Когда одну и ту же модель тестировали с 24 различными стилями промптов, разброс результатов также уменьшился с 4–5% у оригинальной MMLU до примерно 2%.

То есть этот новый экзамен не только сложнее, но и стабильнее.

Он снова позволил увидеть разрыв между моделями, которые на старом экзамене выглядели одинаково выдающимися. Стало легче определить, действительно ли модель умеет рассуждать или просто лучше справляется со старыми заданиями.

Полезные бенчмарки

MMLU-Pro быстро была взята на вооружение отраслью.

Впоследствии MMLU-Pro вошла в трек наборов данных и бенчмарков NeurIPS2024 и также была интегрирована в фреймворк оценки языковых моделей lm-evaluation-harness от EleutherAI. Для сообщества open-source моделей это означало, что она перестала быть просто набором данных в статье и вошла в стандартный инструментарий для оценки.

Многие модели при выпуске начали сообщать баллы по MMLU-Pro. Некоторые рейтинги на HuggingFace также включили её в свою систему оценки.

Если MMLU-Pro решала проблему "неэффективности старого экзамена" в оценке языковых моделей, то MMMU вывела Чэнь Вэньху и TIGERLab в центр оценки мультимодальности.

Проблема мультимодальных моделей ещё сложнее.

Языковые модели обрабатывают в основном текст. Мультимодальные же модели должны одновременно обрабатывать информацию в разных форматах: изображения, диаграммы, схемы, карты, таблицы, нотные записи, химические структуры и т.д. Им нужно не только понять условие задачи, но и действительно распознать содержание на изображении, а затем совместить визуальную информацию, текстовую информацию и предметные знания для рассуждения.

Бенчмарк MMMU содержит 11,5 тысяч мультимодальных вопросов, взятых из университетских экзаменов, тестов и учебников, охватывая шесть широких областей: искусство и дизайн, бизнес, естественные науки, здоровье и медицина, гуманитарные и социальные науки, технологии и инженерия, с дальнейшим разделением на 30 дисциплин и 183 подраздела.

Эти вопросы не просто спрашивают модель "что на картинке". Они требуют от модели, как от студента на профессиональном экзамене, сочетать информацию с изображения и предметные знания.

При выпуске MMMU исследовательская группа протестировала 14 открытых мультимодальных моделей, а также представительные проприетарные модели, такие как GPT-4V и GeminiUltra. Даже самые сильные на тот момент проприетарные модели, GPT-4V и GeminiUltra, достигли точности всего 56% и 59% соответственно.

Эти цифры показывают, что, хотя мультимодальные модели, казалось бы, быстро прогрессируют, в задачах, действительно требующих профессионального понимания и рассуждений, у них по-прежнему остаётся огромное пространство для роста.

Позже команда Чэнь Вэньху выпустила MMMU-Pro, чтобы ещё больше перекрыть модели возможность обойти визуальную информацию. Она отфильтровывает вопросы, на которые можно ответить, используя только текстовую модель, расширяет варианты ответов и вводит режим "vision-only", где вопрос встроен в само изображение, требуя от модели одновременно выполнять визуальное считывание и текстовое понимание.

Проще говоря, не дать модели "угадать ответ, прочитав только текст".

Подобная работа может показаться несколько рутинной, но она критически важна. Потому что в будущем мультимодальные модели будут внедряться в такие области, как здравоохранение, образование, научные исследования, дизайн, инженерия, и просто описывать картинки будет недостаточно. Они должны уметь оценивать, рассуждать, объяснять, а также находить действительно полезную информацию в сложных визуальных данных.

Человек за "экзаменами"

Работа Чэнь Вэньху над MMLU-Pro и MMMU проистекает из его давних исследовательских интересов.

Его исследовательские интересы всегда были связаны с пониманием сложной информации, вопросами на знания и рассуждениями.

Он окончил бакалавриат Хуачжунского университета науки и технологий, затем получил степень магистра в Рейнско-Вестфальском техническом университете Ахена в Германии, а после — докторскую степень по компьютерным наукам в Калифорнийском университете в Санта-Барбаре. Во время докторантуры он уже начал исследования в области сложных вопросно-ответных систем, рассуждений на основе таблиц, поиска доказательств из знаний и т.д.

У таких задач есть общая черта: ответ часто не содержится в одном единственном тексте.

Он может скрываться в таблице, может требовать совмещения текста и изображения, а может требовать от модели сначала извлечь информацию, затем интегрировать, вычислить и сделать вывод. Модель не должна уметь только пересказывать известные знания.

Проекты, в которых участвовал Чэнь Вэньху, такие как HybridQA, TabFact, ProgramofThoughts, MAmmoTH, связаны именно с этой линией.

Это также объясняет, почему он так чувствителен к уязвимостям в оценке моделей.

Хороший бенчмарк — это не просто увеличение сложности вопросов, а предвидение того, где модель легче всего может "угадать ответ" или "казаться знающей".

Модель могла запомнить базу вопросов, может угадать ответ по вариантам, может использовать текст в обход визуальной информации... Хорошая оценка должна закрыть эти лазейки.

После защиты докторской диссертации Чэнь Вэньху поступил в Google Research, а затем с 2021 по 2025 год участвовал в работе Google DeepMind над мультимодальной моделью Gemini и её оценкой. Этот опыт также очень важен. Длительное погружение в разработку передовых моделей позволило ему лучше понять, как растут способности моделей, и легче увидеть возможные смещения и слепые зоны в оценке.

Осенью 2022 года Чэнь Вэньху присоединился к факультету компьютерных наук Университета Ватерлоо в качестве доцента. В том же году он был включён в программу Canada CIFAR AI Chair. Позже он основал "TIGERLab" (то есть «Банду Тигровой Головы»), продолжив исследования в области базовых моделей, мультимодальных способностей и бенчмарков.

Банда Тигровой Головы занимается не только бенчмарками, но и исследованиями моделей и систем.

В области видео UniVideo пытается объединить понимание, генерацию и редактирование видео в одной архитектуре, чтобы модель не только генерировала кадры, но и понимала содержание, реагировала на инструкции и выполняла изменения. Vamba нацелена на понимание длинных видео, решая проблемы с памятью, вычислениями и эффективностью обучения, возникающие при работе с видео длительностью около часа. Совместный с командой генеративного ИИ Meta проект MoCha сосредоточен на генерации говорящих виртуальных персонажей, создавая высококачественные видеоролики с людьми на основе голоса и текстового описания.

Составитель заданий, который никогда сам не решает задач, не может составить хорошие задания. Самостоятельная работа над моделями, в свою очередь, делает их более подходящими для оценки.

Потому что действительно хорошая оценка часто возникает из понимания границ возможностей модели. Только зная, как создаются модели, с какими проблемами они сталкиваются в реальных задачах, легче разработать задания, которые могут выявить различия и подчеркнуть проблемы.

В настоящее время Чэнь Вэньху перешёл в Super Intelligence Lab компании Meta, где его работа продолжает быть сосредоточена на данных и оценке для мультимодального предобучения, обслуживая базовые модели Meta.

В отрасли ИИ нет недостатка в заметных фигурах. В мире ИИ внимание обычно приковано к предпринимателям, звёздным исследователям и руководителям компаний, разрабатывающих большие модели. Выпуск новых продуктов, новости о финансировании, open-source модели и кадровые перестановки чаще всего привлекают внимание извне, и эти имена легче всего попадают в поле зрения общественности.

Но сегодня участие китайских талантов в области ИИ уже далеко выходит за рамки этих самых заметных позиций.

Трендовые криптовалюты

Связанные с этим вопросы

QКто является создателем популярных бенчмарков для оценки ИИ, таких как MMLU-Pro и MMMU?

AСоздателем этих бенчмарков является китайский исследователь Вэньху Чэнь (Чэнь Вэньху), доцент факультета компьютерных наук Университета Ватерлоо в Канаде, основатель лаборатории TIGERLab (также известной как «Банда Тигра»).

QКакую основную проблему решает бенчмарк MMLU-Pro по сравнению с оригинальным MMLU?

AMMLU-Pro решает проблему «неэффективности старого теста»: когда современные передовые модели (например, o3 от OpenAI) стали достигать почти 100% точности на оригинальном MMLU, что сделало его непригодным для различения их реальных способностей. MMLU-Pro усложнил вопросы, увеличил количество вариантов ответов, добавил больше задач на рассуждение и устранил простые или неоднозначные вопросы, что позволило заново разделить модели по уровню.

QКак бенчмарк MMMU проверяет возможности мультимодальных моделей?

AMMMU проверяет способности мультимодальных моделей понимать и рассуждать на основе комбинации текстовой информации и разнообразных визуальных данных (изображения, диаграммы, схемы, карты, таблицы, нотные записи, химические структуры и т.д.). Задачи взяты из университетских экзаменов и учебных материалов по различным научным и профессиональным дисциплинам, требуя от модели интеграции знаний, визуального восприятия и логических рассуждений для ответа.

QКакой научный и профессиональный опыт Чэнь Вэньху способствовал его работе над созданием бенчмарков?

AОпыт Чэнь Вэньху включает исследования в области сложного понимания информации, вопросно-ответных систем и рассуждений (например, HybridQA, TabFact) ещё во время докторантуры. Позже он работал в Google Research и Google DeepMind над моделью Gemini и её оценкой, что дало ему глубокое понимание разработки передовых моделей и потенциальных уязвимостей в их оценке. Этот опыт позволяет ему проектировать бенчмарки, которые лучше выявляют истинные способности и слабые места моделей.

QПомимо разработки бенчмарков, чем ещё занимается лаборатория TIGERLab под руководством Чэнь Вэньху?

AПомимо бенчмарков, лаборатория TIGERLab (или «Банда Тигра») под руководством Чэнь Вэньху также активно занимается исследованиями и разработкой моделей и систем, особенно в области видео. Примеры проектов включают UniVideo (единая структура для понимания, генерации и редактирования видео), Vamba (понимание длинных видео) и MoCha (совместно с Meta) — генерация говорящих виртуальных персонажей. Этот практический опыт разработки моделей помогает команде создавать более качественные и релевантные оценочные бенчмарки.

Похожее

Взлом 515 миллионов NIGHT в сети Midnight обвалил токен на 32% – Удержит ли $0,015?

В 2026 году крипторынок столкнулся с ростом хакерских атак. В июле было похищено более $59 млн, а общая сумма убытков с начала года достигла $1 млрд. Среди последних инцидентов — эксплуатация кросс-чейн моста сети Midnight, в результате которой из контракта, содержащего 515 миллионов токенов NIGHT, были выведены все средства. Атакующий продал около 290 миллионов NIGHT через DEX на Cardano, что привело к падению цены токена на 32% до исторического минимума в $0.015. После незначительного восстановления до $0.019 токен остается под сильным давлением продаж. Рыночная капитализация NIGHT упала на 27%, в то время как объем торгов вырос на 829%. Индикатор RSI вошел в зону перепроданности (уровень 17), что свидетельствует о доминировании медвежьего настроения. Основа Midnight заявила, что сама сеть осталась безопасной, а инцидент был изолирован в рамках кросс-чейн операций. Прогнозируется, что при сохранении негативных настроений токен может удерживаться ниже $0.02 с поддержкой на уровне $0.015.

ambcrypto4 мин. назад

Взлом 515 миллионов NIGHT в сети Midnight обвалил токен на 32% – Удержит ли $0,015?

ambcrypto4 мин. назад

Флагман в мире крипто-акций | Резервы наличных в Strategy выросли до 3,23 миллиарда долларов, покупки BTC приостановлены; Vanguard и другие управляющие активы увеличили свои доли в Strategy (21 июля)

Обзор рынка: Риски и возможности на фоне повышенной волатильности Рынки акций, включая корейские, американские и китайские (A-shares), переживают период высокой волатильности из-за ожиданий дальнейшего повышения процентных ставок ФРС, геополитической напряженности (ситуация вокруг США и Ирана) и процесса "очистки" от избыточного кредитного плеча. Инвесторам рекомендуется соблюдать осторожность и избегать использования маржинального кредитования. На американском рынке растут короткие позиции против акций, связанных с искусственным интеллектом (ИИ), достигнув максимумов с 2010 года, что отражает опасения по поводу "пузыря ИИ". Технологические акции, особенно полупроводниковые, значительно снизились. В секторе криптоактивов: * Ключевая компания, держащая биткоин в казначействе, **Strategy (MSTR)**, увеличила свои денежные резервы до 32,3 млрд долларов и приостановила покупки BTC. При этом крупные институциональные инвесторы, такие как Vanguard Group и Capital Group, наращивают свои доли в акциях Strategy. * Глобальные публичные компании (исключая майнинговые) на прошлой неделе приобрели биткоинов на сумму всего 1,33 млн долларов, что на 98,4% меньше неделей ранее. Их совокупные холдинги BTC составляют около 1,14 млн монет. * Другие компании, такие как Bitcoin Japan Corporation и ORANGE JUICE, привлекают финансирование для включения биткоина в свои казначейские активы. * Компания **BitMine**, фокусирующаяся на Ethereum, увеличила свои холдинги ETH до 5,78 млн монет (около 4,8% от предложения) и сообщила о совокупных активах (крипто, деньги, ценные бумаги) в 11,5 млрд долларов. Вывод: Фондовые рынки находятся в режиме коррекции и снижения кредитного плеча. В криптосекторе наблюдается осторожность среди компаний-держателей биткоина, в то время как институциональный интерес к ним как к активам растет. Компании, ориентированные на Ethereum, продолжают накапливать актив.

marsbit10 мин. назад

Флагман в мире крипто-акций | Резервы наличных в Strategy выросли до 3,23 миллиарда долларов, покупки BTC приостановлены; Vanguard и другие управляющие активы увеличили свои доли в Strategy (21 июля)

marsbit10 мин. назад

Прозрачность резервов, создаваемая посредством непрерывной работы: Matrixdock отмечает два года независимой верификации

Matrixdock завершил свой четвертый последовательный полугодовой независимый аудит резервов, проведенный Bureau Veritas. Впервые аудит охватил не только токенизированный золотой продукт (XAUm), но и токенизированный серебряный продукт (XAGm), что отражает стремление компании создавать резервные активы, вызывающие доверие у институциональных партнеров. За два года непрерывных проверок одним и тем же независимым аудитором был установлен последовательный процесс верификации. В ходе июльского аудита на трех объектах институциональных хранилищ было физически проверено 574 слитка золота и серебра от аффинажных предприятий, аккредитованных LBMA. Проверка подтвердила соответствие резервов количеству токенов в обращении: 508 золотых слитков (около $66,09 млн) и 66 серебряных слитков (около $4,04 млн). Прозрачность резервов в Matrixdock обеспечивается несколькими уровнями: помимо полугодовых аудитов, держатели могут проверять ежемесячные отчеты, ончейн-подтверждение резервов и инструмент Gold Allocation Lookup для прямой проверки обеспечения. Такой подход создает постоянную, а не периодическую проверку. Непрерывная верификация обеспечения — это основа для использования токенизированных резервных активов в качестве надежного залога, в казначейском управлении и расчетах в рамках ончейн-финансов. Регулярные аудиты отражают долгосрочные обязательства Matrixdock по созданию надежного Резервного Слоя для финансовых операций в блокчейне.

TheNewsCrypto37 мин. назад

Прозрачность резервов, создаваемая посредством непрерывной работы: Matrixdock отмечает два года независимой верификации

TheNewsCrypto37 мин. назад

Интерпретация Bernstein: Могут ли долгосрочные заказы на 142 миллиарда долларов смягчить цикл памяти?

Бернштейн анализирует долгосрочные соглашения о закупках (LTA) в индустрии памяти. Micron и SanDisk заключили новые соглашения с гарантиями минимальных цен и финансовыми обязательствами, совокупно оцениваемыми примерно в 1420 млрд долларов, чтобы создать базовый уровень доходов. Однако отчет показывает, что эти гарантии (около 33 млрд долларов) составляют лишь около 0,6% от расчетного объема доходов в 5,2 трлн долларов, нуждающихся в защите в течение следующих 3-5 лет. Это означает, что LTA смягчают, но не устраняют цикличность. Гарантии усложняют отказ крупных клиентов, таких как американские облачные провайдеры, особенно при умеренных падениях цен. Однако в случае глубокого спада экономические расчеты могут привести к расторжению контрактов. Кроме того, значительная часть спроса (30-50%), включая потребительский сегмент и некоторых китайских клиентов, вряд ли будет охвачена LTA, что сохранит волатильность. Хотя спрос на ИИ (HBM, DRAM) поддерживает оценку компаний и увеличивает ценность LTA в период высокой конъюнктуры, соглашения не фиксируют пиковую прибыль. Их реальная проверка наступит во время следующего спада, когда будет видно, будут ли соблюдаться обязательства и окажется ли финансовая защита достаточной. LTA — это буфер, а не конец отраслевого цикла.

marsbit1 ч. назад

Интерпретация Bernstein: Могут ли долгосрочные заказы на 142 миллиарда долларов смягчить цикл памяти?

marsbit1 ч. назад

Крупнейшая выставка торговли и инвестиций в Индии проходит в Мумбаи

Индийская торговая и инвестиционная сфера стремительно развивается, расширяясь за пределы крупных городов благодаря росту финансовой грамотности и цифровых платформ. Чтобы удовлетворить спрос на качественное образование и экспертные знания, ключевую роль играют отраслевые мероприятия. Money Expo India 2026, 5-я выставка, пройдет 29–30 августа 2026 года в Конгресс-центре Jio World в Мумбаи. Мероприятие соберет ведущие онлайн-торговые и финтех-компании, инвестиционные платформы и поставщиков финансовых услуг. В программе — экспертные конференции, демонстрации продуктов и возможности для нетворкинга. Как отмечает коммерческий директор HQMENA Нияз, выставка призвана объединить растущее сообщество инвесторов с глобальными брендами, экспертами и новыми технологиями. Участники, такие как HDFC Securities, Alphabots и Tradomate, высоко оценили качество аудитории, уровень организации и энергетику мероприятия. Money Expo India способствует развитию финансовой экосистемы страны, объединяя инновации, образование и отраслевое сотрудничество. Это одна из ведущих финансовых выставок Индии, создающая платформу для взаимодействия брокеров, финтех-компаний, инвесторов и отраслевых лидеров.

TheNewsCrypto1 ч. назад

Крупнейшая выставка торговли и инвестиций в Индии проходит в Мумбаи

TheNewsCrypto1 ч. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片