За оценками ИИ скрывается китайский «составитель тестов»

marsbitОпубликовано 2026-06-20Обновлено 2026-06-20

Введение

За кулисами результатов ведущих ИИ-моделей, таких как GPT и Gemini, часто стоит один и тот же «составитель заданий» — китайский исследователь Чэнь Вэньху. Будучи доцентом Университета Ватерлоо и основателем лаборатории TIGERLab, он разработал ключевые оценочные эталоны MMLU-Pro, MMMU и MMMU-Pro, которые стали общим языком для сравнения способностей моделей. Чэнь Вэньху сосредоточился на создании более сложных и устойчивых тестов, когда предыдущие эталоны, такие как MMLU, перестали эффективно различать передовые модели, достигшие почти идеальных результатов. MMLU-Pro, с его 12032 вопросами, расширенными вариантами ответов и акцентом на рассуждения, снизил точность моделей на 16–33% и уменьшил зависимость от угадывания. MMMU и MMMU-Pro, в свою очередь, оценивают мультимодальное понимание, требуя от моделей анализа изображений, таблиц, схем и текста в контексте профессиональных знаний, что выявило значительные ограничения даже у самых мощных моделей. Исследования Чэнь Вэньху в области сложных вопросно-ответных систем и его опыт работы в Google DeepMind над Gemini позволили ему глубоко понять слабые места в оценке ИИ. Его лаборатория также занимается разработкой моделей, таких как UniVideo и Vamba, что помогает создавать более точные и релевантные тесты. Сегодня, работая в лаборатории суперинтеллекта Meta, Чэнь Вэньху продолжает влиять на развитие ИИ через улучшение данных для предобучения и систем оценки, оставаясь ключевой, но менее заметной фигурой в этой быстроразвивающейся...

Каждый раз, когда выходит новая передовая модель, индустрия ИИ пристально следит за несколькими знакомыми отчётами об оценках.

MMLU-Pro, MMMU, MMMU-Pro... Эти названия могут быть незнакомы обычным пользователям, но для компаний, разрабатывающих модели, и исследователей они уже стали практически «стандартными дисциплинами». GPT, Claude, Gemini, Llama, Qwen, DeepSeek постоянно сдают «экзамены» по этим бенчмаркам.

«Проверка — лучшее испытание». Часто именно эти баллы доказывают, насколько хороша модель.

На многих презентациях моделей графики сравнения производительности не обходятся без них; некоторые рейтинги на HuggingFace также построены на этих системах оценки. Можно даже сказать, что сегодня, обсуждая возможности моделей ИИ, индустрия использует общий язык, определённый именно этими бенчмарками.

Но интересно то, что почти все следят за баллами, но мало кто знает, кто составляет эти «задания». А за MMLU-Pro, MMMU и MMMU-Pro стоит одно и то же имя — Вэньху Чэнь (陈文虎).

Он — доцент кафедры компьютерных наук Университета Ватерлоо в Канаде, и в Google Scholar его статьи процитированы более 30 000 раз.

Он также основатель «Лаборатории Тигра (TIGERLab)», чьё полное английское название — Text and Image GEnerative Research Lab. Поскольку в названии есть иероглиф «虎» (тигр), Чэнь Вэньху дал ей очень узнаваемое китайское название — «Банда Тигровой Головы» (虎头帮).

01

После того, как старые тесты перестали работать

Сначала Чэнь Вэньху привлёк внимание многих благодаря MMLU-Pro.

MMLU ранее была одним из наиболее часто используемых бенчмарков для оценки способностей больших языковых моделей. Она похожа на комплексный экзамен, охватывающий различные дисциплины, и используется для измерения способности модели понимать знания и выполнять задачи на логический вывод.

На раннем этапе этот «тест» был очень полезен. Баллы позволяли выявить разрыв между моделями, и индустрия могла с его помощью наблюдать, действительно ли большие языковые модели прогрессируют.

Но проблема быстро возникла.

По мере того, как способности моделей продолжали расти, MMLU постепенно стала «слишком лёгкой». Баллы передовых моделей становились всё выше, а разрыв между ними — всё меньше.

После того, как OpenAI выпустила o3, эта проблема стала ещё более очевидной. Точность o3 на MMLU уже приближалась к 100%, и другие передовые модели также одна за другой показывали результаты, близкие к максимальным.

Звучит как хорошая новость, но для оценки это означает неприятности.

Если все могут сдать экзамен почти на максимум, становится трудно определить, кто сильнее и в чём именно. Он по-прежнему может доказать, что модель уже обладает определёнными способностями, но больше не подходит для измерения нового прогресса.

Индустрии ИИ нужен был более сложный и менее «обманываемый» тест.

В 2024 году Чэнь Вэньху и его команда представили MMLU-Pro.

MMLU-Pro — это не просто расширение базы вопросов, а переработка самого теста.

Он содержит 12032 вопроса, охватывающих 14 областей, включая математику, физику, химию, право, инженерию, психологию, здравоохранение. По сравнению с оригинальной MMLU, количество вариантов ответов увеличено с 4 до 10, чтобы снизить вероятность угадывания моделью; также добавлено больше вопросов, требующих логического вывода, и удалены относительно простые, неоднозначные или недостаточно различимые вопросы из оригинальной базы.

Эффект был прямым.

Результаты исследования показали, что точность моделей на MMLU-Pro снизилась на 16% до 33% по сравнению с оригинальной MMLU. Разброс оценок одной и той же модели при тестировании с 24 различными стилями промптов также снизился с 4-5% в оригинальной MMLU до примерно 2%.

Другими словами, этот новый тест не только сложнее, но и стабильнее.

Он снова позволил развести модели, которые на старом тесте выглядели одинаково отлично. Стало легче определить, действительно ли модель умеет рассуждать или просто лучше справляется со старыми вопросами.

02

Полезные бенчмарки для оценки

Индустрия быстро начала использовать MMLU-Pro.

MMLU-Pro затем вошёл в трек «Наборы данных и бенчмарки» конференции NeurIPS 2024 и также был интегрирован в фреймворк оценки языковых моделей lm-evaluation-harness от EleutherAI. Для сообщества open-source моделей это означало, что он перестал быть просто набором данных в исследовательской статье, а вошёл в стандартную цепочку инструментов оценки.

Многие модели начали отчитываться о баллах MMLU-Pro при выпуске. Некоторые рейтинги на HuggingFace также включили его в свою систему оценки.

Если MMLU-Pro решает проблему «неэффективности старого теста» при оценке языковых моделей, то MMMU вывел Чэнь Вэньху и TIGERLab в центр оценки мультимодальности.

Проблема мультимодальных моделей сложнее.

Языковая модель отвечает на вопросы, в основном обрабатывая текст. Мультимодальная модель должна одновременно обрабатывать информацию в различных формах: изображения, диаграммы, схемы, карты, таблицы, нотные записи, химические структуры и т.д. Ей нужно не просто понять формулировку вопроса, но и действительно разобраться в содержании изображения, а затем объединить визуальную информацию, текстовую информацию и предметные знания для логического вывода.

Бенчмарк MMMU содержит 11,5 тысяч мультимодальных вопросов, взятых из университетских экзаменов, тестов и учебников. Он охватывает шесть основных областей: искусство и дизайн, бизнес, естественные науки, здоровье и медицина, гуманитарные и социальные науки, технологии и инженерия, с дальнейшим разделением на 30 дисциплин и 183 подраздела.

Эти вопросы не просто спрашивают модель «что на картинке» — они требуют от модели, подобно студенту на профессиональном экзамене, объединить информацию с изображения и предметные знания.

При выпуске MMMU исследовательская группа протестировала 14 открытых мультимодальных моделей, а также представительные проприетарные модели, такие как GPT-4V и Gemini Ultra. Даже самые мощные на тот момент проприетарные модели, GPT-4V и Gemini Ultra, достигли точности всего 56% и 59% соответственно.

Эти цифры показывают, что хотя мультимодальные модели, казалось бы, быстро прогрессируют, в задачах, требующих настоящего профессионального понимания и логического вывода, у них всё ещё есть огромный потенциал для роста.

Позже команда Чэнь Вэньху выпустила MMMU-Pro, чтобы ещё больше ограничить возможность моделей обходить визуальную информацию. Она отфильтровывает вопросы, на которые можно ответить, используя только языковую модель, расширяет варианты ответов и вводит настройку «vision-only», встраивая вопрос в само изображение, требуя от модели одновременно выполнять визуальное считывание и текстовое понимание.

Проще говоря, это не позволяет модели «угадывать ответ, просто читая текст».

Такая работа может показаться довольно кропотливой, но она очень важна. Потому что в будущем мультимодальные модели будут внедряться в такие сценарии, как здравоохранение, образование, научные исследования, дизайн, инженерия, и просто описывать картинки недостаточно. Они должны уметь судить, рассуждать, объяснять, а также находить действительно полезную информацию в сложных визуальных данных.

03

Человек за «экзаменационными тестами»

Работа Чэнь Вэньху над MMLU-Pro и MMMU вытекает из его давнего направления исследований.

Его исследовательские интересы изначально связаны с пониманием сложной информации, вопросами, основанными на знаниях, и логическим выводом.

Он окончил бакалавриат Хуачжунского университета науки и технологий, затем получил степень магистра в Рейнско-Вестфальском техническом университете Ахена в Германии, а позже — докторскую степень по компьютерным наукам в Калифорнийском университете в Санта-Барбаре. Во время докторантуры он уже начал исследования в области сложных вопросно-ответных систем, табличных выводов, определения источников знаний и других направлений.

У таких задач есть общая черта: ответ часто не содержится в одном тексте.

Он может быть скрыт в таблице, может требовать объединения текста и изображения, или же модель может сначала получить информацию, а затем интегрировать, вычислить и сделать вывод. Модель не может просто пересказывать известные знания.

Проекты, в которых участвовал Чэнь Вэньху, такие как HybridQA, TabFact, ProgramofThoughts, MAmmoTH, связаны с этой линией.

Это также объясняет, почему он так чувствителен к уязвимостям в оценке моделей.

Хороший бенчмарк — это не просто увеличение сложности вопросов, а прогнозирование того, где модель с наибольшей вероятностью «угадает ответ» или «будет казаться знающей».

Модель может запомнить базу вопросов, может угадывать ответ по вариантам, может использовать текст, чтобы обойти визуальную информацию... Хорошая оценка должна закрыть эти лазейки.

После защиты докторской диссертации Чэнь Вэньху присоединился к Google Research, а затем с 2021 по 2025 год участвовал в разработке мультимодальной модели Gemini и оценке в Google DeepMind. Этот опыт также очень важен. Длительное участие в разработке передовых моделей позволило ему лучше понять, как растут способности моделей, и легче увидеть возможные смещения и слепые зоны в оценке.

Осенью 2022 года Чэнь Вэньху присоединился к факультету компьютерных наук Университета Ватерлоо в качестве доцента. В том же году он был избран членом программы Canada CIFAR AI Chair. После этого он основал «Лабораторию Тигра» (TIGERLab, «Банду Тигровой Головы»), продолжив исследования в области базовых моделей, мультимодальных способностей и бенчмарков оценки.

«Банда Тигровой Головы» занимается не только бенчмарками оценки, но и исследованиями моделей и систем.

В направлении видео, UniVideo пытается объединить понимание, генерацию и редактирование видео в одной структуре, чтобы модель не просто генерировала видеоряд, но и понимала содержание, реагировала на инструкции и выполняла изменения. Vamba ориентирована на понимание длинных видео, решая проблемы с памятью, вычислениями и эффективностью обучения, возникающие при работе с видео продолжительностью около часа. Совместный с командой Meta Generative AI проект MoCha сосредоточен на генерации говорящих виртуальных персонажей, создавая высококачественные видеоролики с персонажами на основе голоса и текстового описания.

Составитель тестов, который никогда не решает задачи, не может составить хороший тест. Самостоятельная разработка моделей, в свою очередь, делает их более подходящими для оценки.

Потому что по-настоящему хорошая оценка часто исходит из понимания границ возможностей модели. Только зная, как создаются модели, зная, с какими проблемами они сталкиваются в реальных задачах, легче разработать тесты, которые выявят различия и обнажат проблемы.

В настоящее время Чэнь Вэньху присоединился к лаборатории суперинтеллекта Meta, где продолжает сосредотачиваться на данных для мультимодального предобучения и оценке, работая над базовыми моделями Meta.

В индустрии ИИ нет недостатка в людях, которых видят. В сфере ИИ внимание обычно сосредоточено на предпринимателях, ведущих исследователях и руководителях крупных компаний, разрабатывающих модели. Выпуск новых продуктов, новости о финансировании, open-source модели и изменения в командах чаще всего привлекают внимание извне, и эти имена легче попадают в поле зрения общественности.

Но сегодня участие китайских талантов в области ИИ выходит далеко за рамки этих самых заметных позиций.

Эта статья из официального аккаунта WeChat «字母AI», автор: Сяо Цзинья

Трендовые криптовалюты

Связанные с этим вопросы

QКто стоит за созданием популярных бенчмарков MMLU-Pro, MMMU и MMMU-Pro для оценки ИИ-моделей?

AИх создал Чэнь Вэньху (陈文虎), доцент факультета компьютерных наук Университета Ватерлоо (Канада) и основатель лаборатории TIGERLab («Банда Тигра»).

QПочему MMLU-Pro был создан, и чем он отличается от оригинального MMLU?

AMMLU-Pro был создан, потому что передовые модели (например, o3 от OpenAI) стали набирать почти 100% в оригинальном MMLU, что сделало его неспособным различать их возможности. MMLU-Pro сложнее: содержит 12032 вопроса, увеличивает варианты ответов с 4 до 10, добавляет больше задач на рассуждение и удаляет простые или неоднозначные вопросы, что снижает точность моделей на 16-33% и делает оценку стабильнее.

QКакую проблему решает бенчмарк MMMU в оценке мультимодальных ИИ-моделей?

AMMMU оценивает способность мультимодальных моделей не просто описывать изображения, а понимать и рассуждать на основе комплексной информации, сочетающей изображения, схемы, таблицы, ноты и т.д., со знаниями из конкретных предметных областей (искусство, бизнес, наука и др.). Даже сильнейшие модели, такие как GPT-4V и Gemini Ultra, изначально показывали точность лишь около 56-59%, выявляя значительные пробелы в их способностях.

QКаков исследовательский бэкграунд Чэнь Вэньху и как он повлиял на его работу над бенчмарками?

AЧэнь Вэньху специализируется на понимании сложной информации, вопросно-ответных системах и рассуждениях. Он получил PhD в UCSB, работал в Google Research и DeepMind над Gemini. Этот опыт в разработке передовых моделей позволяет ему видеть их слабые места и «лазейки» в оценках (например, угадывание ответов или обход визуальной информации), что помогает создавать более надёжные и сложные бенчмарки, такие как MMLU-Pro и MMMU-Pro.

QЧем, помимо создания бенчмарков, занимается лаборатория TIGERLab (虎头帮) под руководством Чэнь Вэньху?

AПомимо бенчмарков, лаборатория TIGERLab занимается исследованиями в области моделей и систем. Например, UniVideo (унифицированная работа с видео), Vamba (понимание длинных видео) и MoCha (совместно с Meta, генерация говорящих виртуальных персонажей). Этот практический опыт в создании моделей помогает лаборатории лучше понимать их границы возможностей и, как следствие, разрабатывать более эффективные методы оценки.

Похожее

База утверждает, что «акции с обеспечением 1:1 гораздо лучше масштабируются», на фоне соперничества с Robinhood

Создатель Base Джесси Поллак признал преимущество Robinhood Chain в выпуске токенизированных акций в среде EVM, но выразил уверенность, что подход Base окажется более эффективным. Поллак заявил, что Base вскоре запустит токенизированные акции с обеспечением 1:1 при поддержке Coinbase, в отличие от производных продуктов Robinhood, что, по его мнению, обеспечит лучшее масштабирование, доверие и признание институциональными инвесторами. Несмотря на то, что Robinhood Chain, как новый Ethereum Layer 2, всего за три недели достиг сравнимых с Base показателей по количеству активных пользователей (около 1 млн в неделю) и даже обогнал по объему торгов на DEX и выручке, Поллак преуменьшает эту угрозу. Аналитики отмечают, что Robinhood, как брокер с 27 млн фондируемых счетов, имеет уникальное преимущество для распространения ончейн-решений. Таким образом, на рынке токенизированных активов формируется соперничество между моделью с полным обеспечением (Base) и моделью, основанной на деривативах и мощной дистрибуции (Robinhood Chain).

ambcrypto4 мин. назад

База утверждает, что «акции с обеспечением 1:1 гораздо лучше масштабируются», на фоне соперничества с Robinhood

ambcrypto4 мин. назад

Прогноз цены TON/GRAM – запуск кошелька Gram в Telegram поднял токен: Продолжится ли ралли?

Соучредитель Telegram Павел Дуров объявил о скором внедрении собственного некастодиального кошелька Gram во все приложения мессенджера. Это решение, которое Дуров назвал крупнейшим в истории развертыванием некастодиального криптокошелька, позволит более чем миллиарду пользователей Telegram проводить мгновенные криптовалютные транзакции без комиссий. Анонс сопровождается переименованием нативного токена TON в Gram, чтобы четче разделить блокчейн The Open Network и потребительскую цифровую валюту внутри экосистемы Telegram. Внедрение кошелька может значительно упростить использование криптовалют для широкой аудитории. На фоне этой новости цена TON/GRAM выросла более чем на 7%, достигнув примерно $1,53. Несмотря на восстановление от уровня поддержки $1,40, токен по-прежнему торгуется значительно ниже своего пика в $2,80, достигнутого в мае. Ближайшее сопротивление находится около $1,60. Успешный прорыв выше этого уровня может открыть путь к $1,80, в то время как потеря текущих позиций может привести к повторному тестированию поддержки $1,40.

ambcrypto29 мин. назад

Прогноз цены TON/GRAM – запуск кошелька Gram в Telegram поднял токен: Продолжится ли ралли?

ambcrypto29 мин. назад

Как 40,8 млн ETH, размещенных в стейкинге, могут усилить преимущество Ethereum над Bitcoin

Два ключевых фактора указывают на то, что превосходство Ethereum (ETH) над Bitcoin (BTC), вероятно, только начинается. Во-первых, крупные инвесторы (киты) активно накапливают ETH и немедленно блокируют 100% купленных средств через стейкинг, демонстрируя долгосрочную уверенность и сокращая ликвидное предложение. Общий объем ETH в стейкинге достиг рекордных 40,8 млн (33,5% от общего предложения), при этом очередь на вход валидаторов выросла, а на выход — нулевая. Во-вторых, активность в децентрализованных финансах (DeFi) Ethereum также растет: количество крупных транзакций WETH достигло максимума с мая 2021 года, а общая заблокированная стоимость (TVL) увеличилась на более чем $5 млрд менее чем за десять дней. Эти факторы — сжатие предложения из-за стейкинга и рост ликвидности в DeFi — начинают отражаться на динамике курса. ETH/BTC пробил уровень сопротивления 0.025 и приближается к ключевой зоне 0.03, показывая самый сильный недельный закрытие за одиннадцать недель, что создает предпосылки для дальнейшего роста ETH относительно BTC.

ambcrypto1 ч. назад

Как 40,8 млн ETH, размещенных в стейкинге, могут усилить преимущество Ethereum над Bitcoin

ambcrypto1 ч. назад

Точка бури на мировых фондовых рынках: делеверидж на южнокорейском рынке в основном завершен

Недавняя резкая волатильность на южнокорейском рынке, с пика 9385.6 пунктов индекса KOSPI 19 июня, привела к коррекции до 32%. Будучи центром глобального тренда ИИ, эта коррекция стала ключевым триггером для глобальных технологических акций. Основной причиной стало влияние высококонцентрированной структуры маржинального финансирования, а не фундаментальные изменения. Сейчас процесс вынужденного сокращения левериджа подходит к концу. Сокращение левериджных ETF достигло примерно 75%, их объем упал с пика около $500 млрд до $260 млрд. Регулятор ввел строгие меры с августа, чтобы ограничить приток новых средств. Хедж-фонды сократили леверидж более чем на 50%, снизив соотношение чистых длинных позиций с пиковых уровней. В то же время, финансирование розничных инвесторов (около $21 млрд, или 0.5% от капитализации рынка) не является основным системным риском. Таким образом, наиболее интенсивная фаза «цепной реакции продаж», вызванная высокой долей заемных средств, в основном завершена. Рынок переходит от падения, движимого ликвидностью, к ценообразованию, основанному на фундаментальных показателях. Пока фундаментальные показатели ИИ (спрос на вычислительные мощности, развитие моделей) не претерпели изменений, текущая коррекция больше похожа на очистку перегретых позиций, а не на конец тренда ИИ. Ключевой вопрос — оставаться в правильном направлении технологической революции, где волатильность является скорее издержкой, чем риском.

链捕手1 ч. назад

Точка бури на мировых фондовых рынках: делеверидж на южнокорейском рынке в основном завершен

链捕手1 ч. назад

92,9% криптовалютных токенов, запущенных с 2024 года, торгуются ниже цены генерации токена: CryptoRank

Согласно данным аналитической платформы CryptoRank, подавляющее большинство криптопроектов, запущенных с 2024 года, не смогли удержаться на уровне первоначальной цены. Исследование, охватившее 113 токенов с рыночной капитализацией свыше 100 миллионов долларов, показало, что лишь 8 из них (около 7,1%) торгуются выше цены, установленной на момент генерации токена (TGE). Остальные 105 проектов, или 92,9%, упали в цене, а медианная доходность по всей выборке составила -95,7%. Среди немногих успешных исключений лидирует Hyperliquid (HYPE) с ростом в 1519% от цены TGE, за ним следуют Ondo Finance (ONDO), EverValue Coin (EVA) и Midnight Network (NIGHT). Эти результаты указывают на то, что инвесторы стали гораздо более избирательными. Капитал концентрируется вокруг проектов, демонстрирующих реальное внедрение продукта и рост экосистемы, в то время как многие новые токены сталкиваются с проблемами из-за высоких оценок, малого первоначального объёма предложения и предстоящих крупных разблокировок токенов. В будущем это может заставить проекты уделять больше внимания устойчивым моделям распределения токенов и долгосрочному развитию, а не агрессивным начальным оценкам.

ambcrypto1 ч. назад

92,9% криптовалютных токенов, запущенных с 2024 года, торгуются ниже цены генерации токена: CryptoRank

ambcrypto1 ч. назад

Торговля

Спот

Популярные статьи

Как купить EDGE

Добро пожаловать на HTX.com! Мы сделали приобретение edgeX (EDGE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки edgeX (EDGE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение edgeX (EDGE)После приобретения вами edgeX (EDGE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля edgeX (EDGE)С легкостью торгуйте edgeX (EDGE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

844 просмотров всегоОпубликовано 2026.03.31Обновлено 2026.06.02

Как купить EDGE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на EDGE (EDGE) представлены ниже.

活动图片