Попросите большую модель поставить "оценку качества" изображению, и она часто ошибается.
Чистая фотография и её "ухудшенная версия", в которую незаметно добавили шум, сжали, сделав её чуть размытой, для человеческого глаза различаются по качеству как небо и земля — но в "глазах" многомодальной большой модели (MLLM) эти два изображения выглядят почти одинаково.
Поэтому её оценка часто оказывается основанной "на ощущениях", а не на "доказательствах".

Теперь исследовательская группа из Северо-Западного политехнического университета и Гонконгского университета науки и технологий предложила новую структуру — IQA-T1, впервые научив многомодальную большую модель при оценке качества изображений действовать как профессиональный инспектор:
Не полагаться только на "первое впечатление", а активно использовать набор профессиональных аналитических инструментов, генерирующих такие структурированные "визуальные доказательства", как карта остаточного шума, распределение градиентов, спектр Фурье и т.д., а затем шаг за шагом принимать решение на основе этих доказательств.
От "оценки по ощущениям" к "принятию решений на основе доказательств" — на 7 эталонах оценки качества изображений IQA-T1 показал наилучший общий результат (SOTA), средние значения PLCC/SRCC достигли 0.795/0.784, при этом процесс оценки объясним и отслеживаем.
Статья и код уже опубликованы в открытом доступе.

△ Существующие оценки MLLM либо являются "чисто текстовыми рассуждениями" (легко поддаются влиянию семантических предубеждений), либо "рассуждениями на основе обрезанных областей" (набор необъяснённых фрагментов изображений); IQA-T1 же использует новую парадигму "генерации визуальных доказательств с помощью инструментов".
Почему большие модели ставят оценки качества "по ощущениям"?
Цель оценки качества изображений (Image Quality Assessment, IQA) — сделать так, чтобы оценка, выставленная машиной, максимально соответствовала субъективному восприятию человека. Она является "судьёй" для таких задач, как восстановление, улучшение, сжатие изображений и других визуальных задач, напрямую определяя, насколько хорошо и стабильно визуальные системы работают в реальных открытых условиях.
С появлением многомодальных больших моделей всё больше работ начинает использовать их "способность к рассуждению" для IQA, надеясь не только дать оценку, но и объяснить, "почему именно такая оценка". Звучит заманчиво, но исследовательская группа указала на общий фундаментальный недостаток:
Существующие оценки MLLM полагаются на внутренние визуальные представления с семантическими предубеждениями, а не на проверяемые доказательства базовых ухудшений.
Проще говоря: визуальные кодировщики больших моделей от природы хорошо понимают высокоуровневую семантику ("это кот", "это пляж"), но крайне нечувствительны к таким базовым искажениям, как шум, размытие, артефакты сжатия.
В статье приводится очень наглядный пример: дано исходное изображение

и его ухудшенная версия с шумом

. Человек поставит им сильно различающиеся оценки, но их визуальные представления в большой модели почти идентичны —

представление почти не изменилось, но качество явно различается. Это так называемое семантическое предубеждение (Semantic Bias): у модели просто нет достаточной информации, чтобы воспринять искажение, и она вынуждена "гадать".
Существующие методы пытались поставить два "заплатки", но обе не по делу:
- Чисто текстовые рассуждения (например, Q-Insight, VisualQuality-R1): генерируют структурированное описание качества, а затем ставят оценку, но весь процесс рассуждений всё равно основан на семантических априорных знаниях, "додуманных" самой моделью, без проверяемых визуальных привязок;
- Рассуждения на основе обрезанных областей (например, Zoom-IQA, Q-Probe): увеличивают и вырезают области изображения, где могут быть проблемы, и передают их модели. Но эти области по сути остаются набором фрагментов изображений без структурированного объяснения, и модель, увидев их, не может сказать, "это шум, размытие или артефакт?".
Кратко: они не предоставляют "доказательств" для процесса рассуждений.
Основная идея: дать большой модели "набор инструментов для инспекции"
Решение IQA-T1 можно сравнить с эволюцией диагностики у врача:
Прежние модели были похожи на врачей традиционной китайской медицины, которые ставят диагноз только на основе опыта "осмотра, выслушивания, опроса и ощупывания"; а IQA-T1 подобен современному врачу, который научился активно назначать КТ, анализы крови, рентген — сначала получить объективные результаты обследования (доказательства), а затем на их основе поставить диагноз.
Конкретно, команда подготовила для модели библиотеку инструментов восприятия. В процессе рассуждений модель самостоятельно решает, какие из этих инструментов вызывать. Каждый инструмент специально "проявляет" определённый тип ухудшения качества, превращая невидимые невооружённым глазом (и стандартным представлением больших моделей) проблемы в структурированные карты доказательств:
- Карта остаточного шума (NoiseResidualMap): вычитание из исходного изображения его версии с удалённым шумом, чтобы "выделить" отдельно шум сенсора, шум сжатия;
- Амплитудный спектр Фурье (FourierMagnitudeSpectrum): выявляет периодические артефакты в частотной области;
- Карта когерентности ориентации градиентов (GradientOrientationCoherenceMap): выявляет структурную неоднородность, вызванную размытием, чрезмерным сглаживанием;
......
Эти карты доказательств постепенно встраиваются в цепочку рассуждений, становясь "материальными доказательствами" для каждого шага принятия решения. Таким образом, IQA превращается из задачи рассуждений, основанных только на семантических догадках, в доказательное рассуждение, подкреплённое фактами.
Дизайн библиотеки инструментов также тщательно продуман. Команда выделила 7 ключевых атрибутов восприятия в IQA — структура, резкость, шум, артефакты, яркость, цвет, естественность, и на их основе разработала 15 типов визуальных доказательств. Все инструменты также соответствуют трём инженерным ограничениям: унифицированный интерфейс вызова, умеренная субдискретизация вывода (экономия токенов), полная детерминированность результата (гарантия полной идентичности доказательств, видимых на этапах построения данных, SFT и RL).
От "умения пользоваться инструментами" к "умению выбирать момент": двухэтапное обучение
Чтобы модель действительно овладела этим навыком, необходимы две способности: знать, как использовать инструменты, и знать, когда их использовать. IQA-T1 решает это с помощью двухэтапного конвейера обучения.

△
Первый этап: контролируемая тонкая настройка (SFT) — сначала научиться "как использовать"
Проводится контролируемая тонкая настройка на самостоятельно созданном наборе данных Q-Tool, чтобы модель освоила три вещи: следование структурированному шаблону рассуждений, использование стандартного синтаксиса вызова инструментов, связывание визуальных доказательств с оценкой качества. Обратите внимание, модель не должна сама генерировать карты доказательств (их детерминированно создают инструменты), во время обучения токенам, соответствующим картам доказательств, применялось маскирование потерь.
Второй этап: обучение с подкреплением (RL) — затем научиться "когда использовать"
SFT научило "как использовать", но не оптимизировало "стратегию вызова". Поэтому команда использовала GRPO для обучения с подкреплением, специально оттачивая способность модели адаптивно выбирать стратегию вызова инструментов. Функция вознаграждения состоит из четырёх тщательно скомбинированных частей:
- Форматное вознаграждение

: соответствует ли вывод стандартной структуре (содержащей метки вызовов инструментов и итоговую оценку);
- Оценочное вознаграждение

: чем ближе прогнозируемая оценка к истинному значению, тем выше вознаграждение (экспоненциальное затухание);
- Вознаграждение за использование инструментов

: поощрение вызова "оптимального" количества инструментов — слишком мало — нет доказательств, слишком много — наказание за избыточность;
- Наказание за повторение

: если один и тот же инструмент вызывается повторно для "создания видимости", сразу снижается оценка.
Четыре части суммируются с весами (оценочное вознаграждение имеет наибольший вес — 5), в итоге модель учится использовать как можно меньше, но нужных инструментов, чтобы получить достаточно доказательств.
Набор данных Q-Tool: первый набор данных IQA для "доказательных рассуждений"
Среди существующих наборов данных IQA нет ни одного, поддерживающего "визуальные доказательные рассуждения". Команда просто создала его сама — Q-Tool, содержащий 11 тысяч высококачественных многомодальных цепочек рассуждений, каждая из которых связывает визуальные доказательства, сгенерированные инструментами, и текстовый анализ, согласованный с человеческим восприятием.

△
Он строится с помощью трёхэтапного конвейера:
- Построение библиотеки инструментов:
набор инструментов с 7 атрибутами / 15 доказательствами, упомянутый ранее;
- Синтез цепочек доказательных рассуждений:
сначала эксперты-люди пишут шаблон рассуждений (разбивая оценку качества изображения на этапы "анализ структуры → анализ шума → оценка цвета..." и определяя отображение атрибутов на инструменты), затем GPT-4o генерирует полную цепочку рассуждений в рамках шаблона, избегая "галлюцинаций" модели;
- Верификация цепочек рассуждений:
каждая цепочка проверяется по трём направлениям: правильно ли использован инструмент, действительно ли ссылаются на доказательства, поддерживается ли вывод доказательствами. Неподходящие удаляются, пограничные случаи дорабатываются вручную.
Результаты экспериментов: общий SOTA на 7 эталонах
Команда обучала на KonIQ и оценивала способность к обобщению вне распределения на 7 эталонах, охватывающих реальные искажения, синтетические искажения, алгоритмическую деградацию, контент, созданный ИИ. Соперниками были традиционные ручные методы, методы глубокого обучения, а также новейшие методы MLLM.
В результате IQA-T1 занял первое место по среднему значению PLCC 0.795/SRCC 0.784 на 7 наборах данных:
По сравнению с методами MLLM, которые только оценивают, но не объясняют (например, Q-Align, DeQA), IQA-T1 сохраняет высокую точность и одновременно даёт объяснимые, подтверждённые доказательствами цепочки рассуждений;
По сравнению с методами, также использующими рассуждения (например, Q-Insight, VisualQuality-R1, Zoom-IQA), он установил новые рекорды на двух сложных наборах данных — синтетические искажения (CSIQ) и алгоритмическая деградация (PIPAL), а также остаётся очень конкурентоспособным на реальных изображениях и контенте, созданном ИИ.
Один наглядный пример лучше всего иллюстрирует проблему:

△
Ещё интереснее анализ влияния "как вызывать инструменты":

То есть не всегда лучше использовать больше инструментов — нерелевантные инструменты могут вносить избыточные визуальные токены и создавать помехи. Динамический вызов в IQA-T1 в среднем использует только 2.34 инструмента на изображение, но даёт лучший результат, экономя время и видеопамять. Это показывает, что модель действительно "рассуждает на основе доказательств", а не просто "подгоняет оценку".

△
Кроме того, при замене структуры на разные базовые модели, такие как Qwen3-VL-2B, InternVL3.5-4B, тенденция производительности остаётся стабильной — что доказывает, что "доказательное рассуждение с использованием инструментов для визуализации" является универсальным механизмом, а не особенностью конкретной модели.
Команда
Эта работа выполнена совместно Северо-Западным политехническим университетом и Гонконгским университетом науки и технологий. Первыми авторами статьи являются Jinjian Wu из Северо-Западного политехнического университета и Jiaqi Tang из Гонконгского университета науки и технологий (общие первые авторы), контактными авторами являются профессор Wei Wei из Северо-Западного политехнического университета и профессор Qifeng Chen из Гонконгского университета науки и технологий.
Команда надеется, что эта работа вдохновит на дальнейшие исследования: внедрение структурированных визуальных доказательств в многомодальные системы рассуждений, чтобы сделать "восприятие" больших моделей более надёжным и объяснимым.
Статья: https://arxiv.org/abs/2607.12375v1
Код: https://github.com/zibuyu-02/IQA-T1
Модель: https://huggingface.co/zibuyu-02/IQA-T1
Данные: https://huggingface.co/datasets/zibuyu-02/Q-Tool
Демо: https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1
Эта статья взята из официального аккаунта WeChat "Quantum Bit", автор: команда IQA-T1





