Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

marsbitОпубликовано 2026-07-20Обновлено 2026-07-20

Введение

Мультимодальные большие языковые модели (MLLM) часто неточно оценивают качество изображений из-за «семантического смещения» — они фокусируются на высокоуровневом содержании, а не на визуальных дефектах. Чтобы решить эту проблему, исследователи из Северо-Западного политехнического университета и Гонконгского университета науки и технологий представили IQA-T1 — новую архитектуру, которая заставляет MLLM оценивать качество на основе визуальных доказательств. Ключевая идея — предоставить модели набор специализированных инструментов для анализа. Во время работы модель самостоятельно решает, какие инструменты использовать для генерации структурированных «доказательств»: карты остаточного шума, спектры Фурье, карты согласованности градиентов и другие. Эти визуальные доказательства последовательно интегрируются в цепочку рассуждений, что делает оценку объективной и объяснимой. Обучение проходит в два этапа: контролируемая тонкая настройка (SFT) учит модель использовать инструменты и связывать доказательства с оценкой, а обучение с подкреплением (RL) оптимизирует стратегию их вызова, поощряя эффективность и избегая избыточности. Для обучения создан новый набор данных Q-Tool, содержащий 11k мультимодальных цепочек рассуждений с доказательствами. В тестах на 7 наборах данных IQA-T1 показала наилучший средний результат (PLCC 0.795 / SRCC 0.784), превзойдя современные методы. Модель не только точнее оценивает качество, особенно на синтетических и алгоритмических искажениях, но и предос...

Попросите большую модель поставить "оценку качества" изображению, и она часто ошибается.

Чистая фотография и её "ухудшенная версия", в которую незаметно добавили шум, сжали, сделав её чуть размытой, для человеческого глаза различаются по качеству как небо и земля — но в "глазах" многомодальной большой модели (MLLM) эти два изображения выглядят почти одинаково.

Поэтому её оценка часто оказывается основанной "на ощущениях", а не на "доказательствах".

Теперь исследовательская группа из Северо-Западного политехнического университета и Гонконгского университета науки и технологий предложила новую структуру — IQA-T1, впервые научив многомодальную большую модель при оценке качества изображений действовать как профессиональный инспектор:

Не полагаться только на "первое впечатление", а активно использовать набор профессиональных аналитических инструментов, генерирующих такие структурированные "визуальные доказательства", как карта остаточного шума, распределение градиентов, спектр Фурье и т.д., а затем шаг за шагом принимать решение на основе этих доказательств.

От "оценки по ощущениям" к "принятию решений на основе доказательств" — на 7 эталонах оценки качества изображений IQA-T1 показал наилучший общий результат (SOTA), средние значения PLCC/SRCC достигли 0.795/0.784, при этом процесс оценки объясним и отслеживаем.

Статья и код уже опубликованы в открытом доступе.

Существующие оценки MLLM либо являются "чисто текстовыми рассуждениями" (легко поддаются влиянию семантических предубеждений), либо "рассуждениями на основе обрезанных областей" (набор необъяснённых фрагментов изображений); IQA-T1 же использует новую парадигму "генерации визуальных доказательств с помощью инструментов".

Почему большие модели ставят оценки качества "по ощущениям"?

Цель оценки качества изображений (Image Quality Assessment, IQA) — сделать так, чтобы оценка, выставленная машиной, максимально соответствовала субъективному восприятию человека. Она является "судьёй" для таких задач, как восстановление, улучшение, сжатие изображений и других визуальных задач, напрямую определяя, насколько хорошо и стабильно визуальные системы работают в реальных открытых условиях.

С появлением многомодальных больших моделей всё больше работ начинает использовать их "способность к рассуждению" для IQA, надеясь не только дать оценку, но и объяснить, "почему именно такая оценка". Звучит заманчиво, но исследовательская группа указала на общий фундаментальный недостаток:

Существующие оценки MLLM полагаются на внутренние визуальные представления с семантическими предубеждениями, а не на проверяемые доказательства базовых ухудшений.

Проще говоря: визуальные кодировщики больших моделей от природы хорошо понимают высокоуровневую семантику ("это кот", "это пляж"), но крайне нечувствительны к таким базовым искажениям, как шум, размытие, артефакты сжатия.

В статье приводится очень наглядный пример: дано исходное изображение

и его ухудшенная версия с шумом

. Человек поставит им сильно различающиеся оценки, но их визуальные представления в большой модели почти идентичны —

представление почти не изменилось, но качество явно различается. Это так называемое семантическое предубеждение (Semantic Bias): у модели просто нет достаточной информации, чтобы воспринять искажение, и она вынуждена "гадать".

Существующие методы пытались поставить два "заплатки", но обе не по делу:

  • Чисто текстовые рассуждения (например, Q-Insight, VisualQuality-R1): генерируют структурированное описание качества, а затем ставят оценку, но весь процесс рассуждений всё равно основан на семантических априорных знаниях, "додуманных" самой моделью, без проверяемых визуальных привязок;
  • Рассуждения на основе обрезанных областей (например, Zoom-IQA, Q-Probe): увеличивают и вырезают области изображения, где могут быть проблемы, и передают их модели. Но эти области по сути остаются набором фрагментов изображений без структурированного объяснения, и модель, увидев их, не может сказать, "это шум, размытие или артефакт?".

Кратко: они не предоставляют "доказательств" для процесса рассуждений.

Основная идея: дать большой модели "набор инструментов для инспекции"

Решение IQA-T1 можно сравнить с эволюцией диагностики у врача:

Прежние модели были похожи на врачей традиционной китайской медицины, которые ставят диагноз только на основе опыта "осмотра, выслушивания, опроса и ощупывания"; а IQA-T1 подобен современному врачу, который научился активно назначать КТ, анализы крови, рентген — сначала получить объективные результаты обследования (доказательства), а затем на их основе поставить диагноз.

Конкретно, команда подготовила для модели библиотеку инструментов восприятия. В процессе рассуждений модель самостоятельно решает, какие из этих инструментов вызывать. Каждый инструмент специально "проявляет" определённый тип ухудшения качества, превращая невидимые невооружённым глазом (и стандартным представлением больших моделей) проблемы в структурированные карты доказательств:

  • Карта остаточного шума (NoiseResidualMap): вычитание из исходного изображения его версии с удалённым шумом, чтобы "выделить" отдельно шум сенсора, шум сжатия;
  • Амплитудный спектр Фурье (FourierMagnitudeSpectrum): выявляет периодические артефакты в частотной области;
  • Карта когерентности ориентации градиентов (GradientOrientationCoherenceMap): выявляет структурную неоднородность, вызванную размытием, чрезмерным сглаживанием;

......

Эти карты доказательств постепенно встраиваются в цепочку рассуждений, становясь "материальными доказательствами" для каждого шага принятия решения. Таким образом, IQA превращается из задачи рассуждений, основанных только на семантических догадках, в доказательное рассуждение, подкреплённое фактами.

Дизайн библиотеки инструментов также тщательно продуман. Команда выделила 7 ключевых атрибутов восприятия в IQA — структура, резкость, шум, артефакты, яркость, цвет, естественность, и на их основе разработала 15 типов визуальных доказательств. Все инструменты также соответствуют трём инженерным ограничениям: унифицированный интерфейс вызова, умеренная субдискретизация вывода (экономия токенов), полная детерминированность результата (гарантия полной идентичности доказательств, видимых на этапах построения данных, SFT и RL).

От "умения пользоваться инструментами" к "умению выбирать момент": двухэтапное обучение

Чтобы модель действительно овладела этим навыком, необходимы две способности: знать, как использовать инструменты, и знать, когда их использовать. IQA-T1 решает это с помощью двухэтапного конвейера обучения.

Первый этап: контролируемая тонкая настройка (SFT) — сначала научиться "как использовать"

Проводится контролируемая тонкая настройка на самостоятельно созданном наборе данных Q-Tool, чтобы модель освоила три вещи: следование структурированному шаблону рассуждений, использование стандартного синтаксиса вызова инструментов, связывание визуальных доказательств с оценкой качества. Обратите внимание, модель не должна сама генерировать карты доказательств (их детерминированно создают инструменты), во время обучения токенам, соответствующим картам доказательств, применялось маскирование потерь.

Второй этап: обучение с подкреплением (RL) — затем научиться "когда использовать"

SFT научило "как использовать", но не оптимизировало "стратегию вызова". Поэтому команда использовала GRPO для обучения с подкреплением, специально оттачивая способность модели адаптивно выбирать стратегию вызова инструментов. Функция вознаграждения состоит из четырёх тщательно скомбинированных частей:

  • Форматное вознаграждение

: соответствует ли вывод стандартной структуре (содержащей метки вызовов инструментов и итоговую оценку);

  • Оценочное вознаграждение

: чем ближе прогнозируемая оценка к истинному значению, тем выше вознаграждение (экспоненциальное затухание);

  • Вознаграждение за использование инструментов

: поощрение вызова "оптимального" количества инструментов — слишком мало — нет доказательств, слишком много — наказание за избыточность;

  • Наказание за повторение

: если один и тот же инструмент вызывается повторно для "создания видимости", сразу снижается оценка.

Четыре части суммируются с весами (оценочное вознаграждение имеет наибольший вес — 5), в итоге модель учится использовать как можно меньше, но нужных инструментов, чтобы получить достаточно доказательств.

Набор данных Q-Tool: первый набор данных IQA для "доказательных рассуждений"

Среди существующих наборов данных IQA нет ни одного, поддерживающего "визуальные доказательные рассуждения". Команда просто создала его сама — Q-Tool, содержащий 11 тысяч высококачественных многомодальных цепочек рассуждений, каждая из которых связывает визуальные доказательства, сгенерированные инструментами, и текстовый анализ, согласованный с человеческим восприятием.

Он строится с помощью трёхэтапного конвейера:

  • Построение библиотеки инструментов:

набор инструментов с 7 атрибутами / 15 доказательствами, упомянутый ранее;

  • Синтез цепочек доказательных рассуждений:

сначала эксперты-люди пишут шаблон рассуждений (разбивая оценку качества изображения на этапы "анализ структуры → анализ шума → оценка цвета..." и определяя отображение атрибутов на инструменты), затем GPT-4o генерирует полную цепочку рассуждений в рамках шаблона, избегая "галлюцинаций" модели;

  • Верификация цепочек рассуждений:

каждая цепочка проверяется по трём направлениям: правильно ли использован инструмент, действительно ли ссылаются на доказательства, поддерживается ли вывод доказательствами. Неподходящие удаляются, пограничные случаи дорабатываются вручную.

Результаты экспериментов: общий SOTA на 7 эталонах

Команда обучала на KonIQ и оценивала способность к обобщению вне распределения на 7 эталонах, охватывающих реальные искажения, синтетические искажения, алгоритмическую деградацию, контент, созданный ИИ. Соперниками были традиционные ручные методы, методы глубокого обучения, а также новейшие методы MLLM.

В результате IQA-T1 занял первое место по среднему значению PLCC 0.795/SRCC 0.784 на 7 наборах данных:

По сравнению с методами MLLM, которые только оценивают, но не объясняют (например, Q-Align, DeQA), IQA-T1 сохраняет высокую точность и одновременно даёт объяснимые, подтверждённые доказательствами цепочки рассуждений;

По сравнению с методами, также использующими рассуждения (например, Q-Insight, VisualQuality-R1, Zoom-IQA), он установил новые рекорды на двух сложных наборах данных — синтетические искажения (CSIQ) и алгоритмическая деградация (PIPAL), а также остаётся очень конкурентоспособным на реальных изображениях и контенте, созданном ИИ.

Один наглядный пример лучше всего иллюстрирует проблему:

Ещё интереснее анализ влияния "как вызывать инструменты":

То есть не всегда лучше использовать больше инструментов — нерелевантные инструменты могут вносить избыточные визуальные токены и создавать помехи. Динамический вызов в IQA-T1 в среднем использует только 2.34 инструмента на изображение, но даёт лучший результат, экономя время и видеопамять. Это показывает, что модель действительно "рассуждает на основе доказательств", а не просто "подгоняет оценку".

Кроме того, при замене структуры на разные базовые модели, такие как Qwen3-VL-2B, InternVL3.5-4B, тенденция производительности остаётся стабильной — что доказывает, что "доказательное рассуждение с использованием инструментов для визуализации" является универсальным механизмом, а не особенностью конкретной модели.

Команда

Эта работа выполнена совместно Северо-Западным политехническим университетом и Гонконгским университетом науки и технологий. Первыми авторами статьи являются Jinjian Wu из Северо-Западного политехнического университета и Jiaqi Tang из Гонконгского университета науки и технологий (общие первые авторы), контактными авторами являются профессор Wei Wei из Северо-Западного политехнического университета и профессор Qifeng Chen из Гонконгского университета науки и технологий.

Команда надеется, что эта работа вдохновит на дальнейшие исследования: внедрение структурированных визуальных доказательств в многомодальные системы рассуждений, чтобы сделать "восприятие" больших моделей более надёжным и объяснимым.

Статья: https://arxiv.org/abs/2607.12375v1

Код: https://github.com/zibuyu-02/IQA-T1

Модель: https://huggingface.co/zibuyu-02/IQA-T1

Данные: https://huggingface.co/datasets/zibuyu-02/Q-Tool

Демо: https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1

Эта статья взята из официального аккаунта WeChat "Quantum Bit", автор: команда IQA-T1

Связанные с этим вопросы

QКакова основная проблема существующих многомодальных больших моделей (MLLM) при оценке качества изображений?

AСуществующие MLLM полагаются на внутренние визуальные представления с семантической предвзятостью, а не на проверяемые доказательства деградации изображений. Они хорошо понимают высокоуровневую семантику (например, объекты), но нечувствительны к низкоуровневым искажениям, таким как шум, размытие или артефакты сжатия.

QКакой новый фреймворк предложили исследователи для решения проблемы оценки качества изображений и в чем его ключевая инновация?

AИсследователи предложили фреймворк IQA-T1. Его ключевая инновация заключается в том, чтобы заставить MLLM активно использовать набор специализированных инструментов анализа для создания структурированных "визуальных доказательств" (например, карты шумовых остатков, спектры Фурье), а затем делать выводы на основе этих доказательств, а не полагаться на интуицию.

QКакие два основных этапа обучения использует IQA-T1 и какую цель преследует каждый из них?

AIQA-T1 использует двухэтапное обучение. 1) Контролируемая тонкая настройка (SFT): учит модель *как использовать* инструменты, следовать структурированным шаблонам рассуждений и связывать визуальные доказательства с оценкой качества. 2) Обучение с подкреплением (RL): оптимизирует *стратегию вызова* инструментов, чтобы модель научилась адаптивно выбирать правильные инструменты в нужное время, избегая избыточных вызовов.

QЧто такое набор данных Q-Tool и почему он был создан?

AQ-Tool — это первый в своем роде набор данных для оценки качества изображений, ориентированный на "рассуждения с доказательствами". Он содержит 11 тысяч высококачественных мультимодальных цепочек рассуждений, каждая из которых связывает визуальные доказательства, сгенерированные инструментами, с текстовым анализом, выровненным по мнению человека. Он был создан потому, что существующие наборы данных IQA не поддерживают парадигму рассуждений на основе визуальных доказательств.

QКаких результатов достиг IQA-T1 в экспериментах и что показало исследование об эффективном использовании инструментов?

AIQA-T1 достиг наилучших общих результатов (SOTA) на 7 эталонных тестах IQA со средними показателями PLCC 0.795 и SRCC 0.784. Исследование показало, что инструменты не следует использовать все подряд — их избыток вредит производительности. IQA-T1 динамически вызывает в среднем всего 2.34 инструмента на изображение, что демонстрирует эффективную, основанную на доказательствах стратегию, а не просто подгонку под оценку.

Похожее

Как распознать криптомошенничество или rug pull?

Представьте, что вы нашли многообещающий новый токен с тысячами держателей, растущей ценой и активным сообществом. Все выглядит легитимно, пока ликвидность внезапно не исчезает. Так начинается «скам» (rug pull). Разработчики сначала создают видимость надежности через заблокированную ликвидность и отказ от прав на контракт. Затем они раскручивают токен в соцсетях и нагнетают ажиотаж. Чем сильнее сообщество, тем легче привлечь новый капитал. Весь процесс от раскрутки до вывода средств часто занимает 48-72 часа. «Жесткие» скамы мгновенно выводят ликвидность, а «мягкие» постепенно снижают стоимость через продажи инсайдеров или отказ от развития проекта. Ключевые признаки скама: 1. **Высокая концентрация токенов:** если 5-10 кошельков контролируют более 30% предложения. 2. **Подозрительный смарт-контракт:** неверифицированный код, скрытые функции (например, для дополнительной эмиссии), возможность обновления контракта разработчиком. 3. **Рыночное поведение:** быстрый рост цены на основе рекламы от инфлюенсеров, низкий органический объем торгов, снижение числа новых держателей перед крупными переводами с кошельков разработчиков. Основные виды мошеннических схем: * **Ловушки (Honeypots):** Позволяют покупать, но блокируют или ограничивают продажу (98 442 случая). * **Скрытая эмиссия (Hidden mint):** Позволяет разработчикам напечатать новые токены после запуска, размывая доли держателей (60 985 случаев). * **Фальшивый отказ от прав (Fake ownership renunciation):** Заявления о децентрализации ложны, контроль сохранен (48 974 случая). Вывод: чтобы избежать скама, важно анализировать не только цену, но и сходимость нескольких факторов: структуру владения токенами, код смарт-контракта и модели торговли. Прозрачные условия вестинга, верифицированный код и независимый аудит значительно снижают риски.

ambcrypto48 мин. назад

Как распознать криптомошенничество или rug pull?

ambcrypto48 мин. назад

Открытый интерес по XRP достигает $2,6 млрд на фоне роста спроса на деривативы

Открытый интерес по фьючерсам XRP достиг 2,6 млрд долларов, что означает рост более чем на 10% за 24 часа, согласно данным CoinGlass. Это ставит XRP на четвертое место среди крупнейших криптоактивов по данному показателю. Рост открытого интереса свидетельствует об увеличении активности на деривативном рынке, но не указывает однозначно на бычьи или медвежьи настроения, а также не подтверждает рост спроса на спотовом рынке. Активность может быть вызвана долгосрочными или короткими позициями, хеджированием или спекуляциями. Ключевым вопросом является то, поддержит ли этот рост открытого интереса более сильное движение цены или создаст дополнительные риски волатильности. Для подтверждения устойчивости тренда необходимы сопутствующие сигналы, такие как рост объемов спотовой торговли и устойчивость ключевых ценовых уровней. В противном случае высокий уровень открытого интереса может привести к усилению давления при ликвидации позиций.

bitcoinist2 ч. назад

Открытый интерес по XRP достигает $2,6 млрд на фоне роста спроса на деривативы

bitcoinist2 ч. назад

Прогноз цены Биткоина на 2030 год: вот что нужно знать о следующем бычьем рынке

Недавний анализ AMBCrypto указывает на трудности майнеров Bitcoin (BTC), что соответствует условиям исторических медвежьих рынков. Снижение цены BTC наблюдается после падения 10 октября 2025 года, и точное дно рынка пока не определено. Ключевым фактором для разворота тренда станут чистые притоки стейблкоинов на биржи, которые выступают "топливом" для бычьего рынка. В настоящее время этот показатель отрицателен. Основатель Alphractal, Жоао Ведсон, на основе анализа исторических паттернов предполагает, что дно цикла в районе $41,5–45 тыс. может быть достигнуто в первой половине октября 2026 года. Что касается прогноза цены Bitcoin к 2030 году, технический анализ с использованием уровней Фибоначчи предлагает возможный сценарий. После потенциальной коррекции до области около $39,1 тыс. (близко к целевой зоне Ведсона) возможно возобновление долгосрочного восходящего тренда. Этот тренд может преодолеть уровень расширения Фибоначчи 61.8% на отметке $152,3 тыс. Итоговый пик следующего цикла, согласно такому анализу, может достигнуть $200–220 тыс. к 2030 году, после чего Bitcoin, вероятно, снова вступит в медвежью фазу. Отмечается, что текущий рыночный цикл может оказаться длиннее предыдущих. **Краткий итог:** * По фрактальному анализу, дно рынка Bitcoin возможно в октябре 2026 года. * Для роста к целям в $200+ тыс. к 2030 году необходимы значительные притоки стейблкоинов на биржи.

ambcrypto2 ч. назад

Прогноз цены Биткоина на 2030 год: вот что нужно знать о следующем бычьем рынке

ambcrypto2 ч. назад

Рыночный пульс BTC: 30-я неделя

После восстановления с уровня ниже 58 000 долларов и тестирования 65 000 долларов, биткоин перешёл в фазу консолидации около 64 500 долларов. Восходящий импульс ослаб, объёмы спот-торгов остаются низкими. Волатильность снизилась, что указывает на уменьшение премии за риск на деривативных рынках. Спекулятивный аппетит постепенно возвращается: открытый интерес на фьючерсах и опционах вырос, поток на перпетуальных контрактах сместился к чистым покупкам, а спрос на защиту от падения ослаб. Восстановление происходит осторожно, без агрессивного использования кредитного плеча. Активность в блокчейне стабилизируется. Институциональное давление на продажу ослабевает, о чём свидетельствуют улучшившиеся потоки спот-ETF в США и приближение средних цен покупки ETF к точке безубыточности. Рынок выглядит более сбалансированным: долгосрочные инвесторы обеспечивают поддержку, а спекулятивная активность остаётся сдержанной. Тем не менее, растущая доля краткосрочного капитала, чувствительного к цене, повышает вероятность резких всплесков волатильности, делая рынок устойчивым, но более восприимчивым к сдвигам в импульсе и давлению со стороны продавцов.

insights.glassnode4 ч. назад

Рыночный пульс BTC: 30-я неделя

insights.glassnode4 ч. назад

Спрос на спотовом рынке биткойна ослабевает, несмотря на приток средств в ETF, так как новый капитал не решается зайти

Несмотря на положительный приток средств в биткоин-ETF с 14 июля, этого оказалось недостаточно для уверенного преодоления ключевой зоны сопротивления в районе $65 тыс. Аналитики отмечают, что спрос на спотовом рынке BTC ослабевает, а метрика новых инвесторов остаётся около годовых минимумов, сигнализируя об отсутствии значительного притока свежего капитала. Хотя активное закрытие коротких позиций на деривативном рынке и снижение давления на продажу со стороны краткосрочных держателей помогли стабилизировать цену, показатель средней прибыльности краткосрочных инвесторов (STH SOPR) остаётся ниже 1.0. Это означает, что рынок ещё не перешёл в устойчивое бычье состояние, а текущая ситуация скорее указывает на паузу и консолидацию, чем на начало полномасштабного разворота вверх.

ambcrypto5 ч. назад

Спрос на спотовом рынке биткойна ослабевает, несмотря на приток средств в ETF, так как новый капитал не решается зайти

ambcrypto5 ч. назад

Торговля

Спот
活动图片