Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

marsbitОпубликовано 2026-07-20Обновлено 2026-07-20

Введение

Мультимодальные большие языковые модели (MLLM) часто неточно оценивают качество изображений из-за «семантического смещения» — они фокусируются на высокоуровневом содержании, а не на визуальных дефектах. Чтобы решить эту проблему, исследователи из Северо-Западного политехнического университета и Гонконгского университета науки и технологий представили IQA-T1 — новую архитектуру, которая заставляет MLLM оценивать качество на основе визуальных доказательств. Ключевая идея — предоставить модели набор специализированных инструментов для анализа. Во время работы модель самостоятельно решает, какие инструменты использовать для генерации структурированных «доказательств»: карты остаточного шума, спектры Фурье, карты согласованности градиентов и другие. Эти визуальные доказательства последовательно интегрируются в цепочку рассуждений, что делает оценку объективной и объяснимой. Обучение проходит в два этапа: контролируемая тонкая настройка (SFT) учит модель использовать инструменты и связывать доказательства с оценкой, а обучение с подкреплением (RL) оптимизирует стратегию их вызова, поощряя эффективность и избегая избыточности. Для обучения создан новый набор данных Q-Tool, содержащий 11k мультимодальных цепочек рассуждений с доказательствами. В тестах на 7 наборах данных IQA-T1 показала наилучший средний результат (PLCC 0.795 / SRCC 0.784), превзойдя современные методы. Модель не только точнее оценивает качество, особенно на синтетических и алгоритмических искажениях, но и предос...

Попросите большую модель поставить "оценку качества" изображению, и она часто ошибается.

Чистая фотография и её "ухудшенная версия", в которую незаметно добавили шум, сжали, сделав её чуть размытой, для человеческого глаза различаются по качеству как небо и земля — но в "глазах" многомодальной большой модели (MLLM) эти два изображения выглядят почти одинаково.

Поэтому её оценка часто оказывается основанной "на ощущениях", а не на "доказательствах".

Теперь исследовательская группа из Северо-Западного политехнического университета и Гонконгского университета науки и технологий предложила новую структуру — IQA-T1, впервые научив многомодальную большую модель при оценке качества изображений действовать как профессиональный инспектор:

Не полагаться только на "первое впечатление", а активно использовать набор профессиональных аналитических инструментов, генерирующих такие структурированные "визуальные доказательства", как карта остаточного шума, распределение градиентов, спектр Фурье и т.д., а затем шаг за шагом принимать решение на основе этих доказательств.

От "оценки по ощущениям" к "принятию решений на основе доказательств" — на 7 эталонах оценки качества изображений IQA-T1 показал наилучший общий результат (SOTA), средние значения PLCC/SRCC достигли 0.795/0.784, при этом процесс оценки объясним и отслеживаем.

Статья и код уже опубликованы в открытом доступе.

Существующие оценки MLLM либо являются "чисто текстовыми рассуждениями" (легко поддаются влиянию семантических предубеждений), либо "рассуждениями на основе обрезанных областей" (набор необъяснённых фрагментов изображений); IQA-T1 же использует новую парадигму "генерации визуальных доказательств с помощью инструментов".

Почему большие модели ставят оценки качества "по ощущениям"?

Цель оценки качества изображений (Image Quality Assessment, IQA) — сделать так, чтобы оценка, выставленная машиной, максимально соответствовала субъективному восприятию человека. Она является "судьёй" для таких задач, как восстановление, улучшение, сжатие изображений и других визуальных задач, напрямую определяя, насколько хорошо и стабильно визуальные системы работают в реальных открытых условиях.

С появлением многомодальных больших моделей всё больше работ начинает использовать их "способность к рассуждению" для IQA, надеясь не только дать оценку, но и объяснить, "почему именно такая оценка". Звучит заманчиво, но исследовательская группа указала на общий фундаментальный недостаток:

Существующие оценки MLLM полагаются на внутренние визуальные представления с семантическими предубеждениями, а не на проверяемые доказательства базовых ухудшений.

Проще говоря: визуальные кодировщики больших моделей от природы хорошо понимают высокоуровневую семантику ("это кот", "это пляж"), но крайне нечувствительны к таким базовым искажениям, как шум, размытие, артефакты сжатия.

В статье приводится очень наглядный пример: дано исходное изображение

и его ухудшенная версия с шумом

. Человек поставит им сильно различающиеся оценки, но их визуальные представления в большой модели почти идентичны —

представление почти не изменилось, но качество явно различается. Это так называемое семантическое предубеждение (Semantic Bias): у модели просто нет достаточной информации, чтобы воспринять искажение, и она вынуждена "гадать".

Существующие методы пытались поставить два "заплатки", но обе не по делу:

  • Чисто текстовые рассуждения (например, Q-Insight, VisualQuality-R1): генерируют структурированное описание качества, а затем ставят оценку, но весь процесс рассуждений всё равно основан на семантических априорных знаниях, "додуманных" самой моделью, без проверяемых визуальных привязок;
  • Рассуждения на основе обрезанных областей (например, Zoom-IQA, Q-Probe): увеличивают и вырезают области изображения, где могут быть проблемы, и передают их модели. Но эти области по сути остаются набором фрагментов изображений без структурированного объяснения, и модель, увидев их, не может сказать, "это шум, размытие или артефакт?".

Кратко: они не предоставляют "доказательств" для процесса рассуждений.

Основная идея: дать большой модели "набор инструментов для инспекции"

Решение IQA-T1 можно сравнить с эволюцией диагностики у врача:

Прежние модели были похожи на врачей традиционной китайской медицины, которые ставят диагноз только на основе опыта "осмотра, выслушивания, опроса и ощупывания"; а IQA-T1 подобен современному врачу, который научился активно назначать КТ, анализы крови, рентген — сначала получить объективные результаты обследования (доказательства), а затем на их основе поставить диагноз.

Конкретно, команда подготовила для модели библиотеку инструментов восприятия. В процессе рассуждений модель самостоятельно решает, какие из этих инструментов вызывать. Каждый инструмент специально "проявляет" определённый тип ухудшения качества, превращая невидимые невооружённым глазом (и стандартным представлением больших моделей) проблемы в структурированные карты доказательств:

  • Карта остаточного шума (NoiseResidualMap): вычитание из исходного изображения его версии с удалённым шумом, чтобы "выделить" отдельно шум сенсора, шум сжатия;
  • Амплитудный спектр Фурье (FourierMagnitudeSpectrum): выявляет периодические артефакты в частотной области;
  • Карта когерентности ориентации градиентов (GradientOrientationCoherenceMap): выявляет структурную неоднородность, вызванную размытием, чрезмерным сглаживанием;

......

Эти карты доказательств постепенно встраиваются в цепочку рассуждений, становясь "материальными доказательствами" для каждого шага принятия решения. Таким образом, IQA превращается из задачи рассуждений, основанных только на семантических догадках, в доказательное рассуждение, подкреплённое фактами.

Дизайн библиотеки инструментов также тщательно продуман. Команда выделила 7 ключевых атрибутов восприятия в IQA — структура, резкость, шум, артефакты, яркость, цвет, естественность, и на их основе разработала 15 типов визуальных доказательств. Все инструменты также соответствуют трём инженерным ограничениям: унифицированный интерфейс вызова, умеренная субдискретизация вывода (экономия токенов), полная детерминированность результата (гарантия полной идентичности доказательств, видимых на этапах построения данных, SFT и RL).

От "умения пользоваться инструментами" к "умению выбирать момент": двухэтапное обучение

Чтобы модель действительно овладела этим навыком, необходимы две способности: знать, как использовать инструменты, и знать, когда их использовать. IQA-T1 решает это с помощью двухэтапного конвейера обучения.

Первый этап: контролируемая тонкая настройка (SFT) — сначала научиться "как использовать"

Проводится контролируемая тонкая настройка на самостоятельно созданном наборе данных Q-Tool, чтобы модель освоила три вещи: следование структурированному шаблону рассуждений, использование стандартного синтаксиса вызова инструментов, связывание визуальных доказательств с оценкой качества. Обратите внимание, модель не должна сама генерировать карты доказательств (их детерминированно создают инструменты), во время обучения токенам, соответствующим картам доказательств, применялось маскирование потерь.

Второй этап: обучение с подкреплением (RL) — затем научиться "когда использовать"

SFT научило "как использовать", но не оптимизировало "стратегию вызова". Поэтому команда использовала GRPO для обучения с подкреплением, специально оттачивая способность модели адаптивно выбирать стратегию вызова инструментов. Функция вознаграждения состоит из четырёх тщательно скомбинированных частей:

  • Форматное вознаграждение

: соответствует ли вывод стандартной структуре (содержащей метки вызовов инструментов и итоговую оценку);

  • Оценочное вознаграждение

: чем ближе прогнозируемая оценка к истинному значению, тем выше вознаграждение (экспоненциальное затухание);

  • Вознаграждение за использование инструментов

: поощрение вызова "оптимального" количества инструментов — слишком мало — нет доказательств, слишком много — наказание за избыточность;

  • Наказание за повторение

: если один и тот же инструмент вызывается повторно для "создания видимости", сразу снижается оценка.

Четыре части суммируются с весами (оценочное вознаграждение имеет наибольший вес — 5), в итоге модель учится использовать как можно меньше, но нужных инструментов, чтобы получить достаточно доказательств.

Набор данных Q-Tool: первый набор данных IQA для "доказательных рассуждений"

Среди существующих наборов данных IQA нет ни одного, поддерживающего "визуальные доказательные рассуждения". Команда просто создала его сама — Q-Tool, содержащий 11 тысяч высококачественных многомодальных цепочек рассуждений, каждая из которых связывает визуальные доказательства, сгенерированные инструментами, и текстовый анализ, согласованный с человеческим восприятием.

Он строится с помощью трёхэтапного конвейера:

  • Построение библиотеки инструментов:

набор инструментов с 7 атрибутами / 15 доказательствами, упомянутый ранее;

  • Синтез цепочек доказательных рассуждений:

сначала эксперты-люди пишут шаблон рассуждений (разбивая оценку качества изображения на этапы "анализ структуры → анализ шума → оценка цвета..." и определяя отображение атрибутов на инструменты), затем GPT-4o генерирует полную цепочку рассуждений в рамках шаблона, избегая "галлюцинаций" модели;

  • Верификация цепочек рассуждений:

каждая цепочка проверяется по трём направлениям: правильно ли использован инструмент, действительно ли ссылаются на доказательства, поддерживается ли вывод доказательствами. Неподходящие удаляются, пограничные случаи дорабатываются вручную.

Результаты экспериментов: общий SOTA на 7 эталонах

Команда обучала на KonIQ и оценивала способность к обобщению вне распределения на 7 эталонах, охватывающих реальные искажения, синтетические искажения, алгоритмическую деградацию, контент, созданный ИИ. Соперниками были традиционные ручные методы, методы глубокого обучения, а также новейшие методы MLLM.

В результате IQA-T1 занял первое место по среднему значению PLCC 0.795/SRCC 0.784 на 7 наборах данных:

По сравнению с методами MLLM, которые только оценивают, но не объясняют (например, Q-Align, DeQA), IQA-T1 сохраняет высокую точность и одновременно даёт объяснимые, подтверждённые доказательствами цепочки рассуждений;

По сравнению с методами, также использующими рассуждения (например, Q-Insight, VisualQuality-R1, Zoom-IQA), он установил новые рекорды на двух сложных наборах данных — синтетические искажения (CSIQ) и алгоритмическая деградация (PIPAL), а также остаётся очень конкурентоспособным на реальных изображениях и контенте, созданном ИИ.

Один наглядный пример лучше всего иллюстрирует проблему:

Ещё интереснее анализ влияния "как вызывать инструменты":

То есть не всегда лучше использовать больше инструментов — нерелевантные инструменты могут вносить избыточные визуальные токены и создавать помехи. Динамический вызов в IQA-T1 в среднем использует только 2.34 инструмента на изображение, но даёт лучший результат, экономя время и видеопамять. Это показывает, что модель действительно "рассуждает на основе доказательств", а не просто "подгоняет оценку".

Кроме того, при замене структуры на разные базовые модели, такие как Qwen3-VL-2B, InternVL3.5-4B, тенденция производительности остаётся стабильной — что доказывает, что "доказательное рассуждение с использованием инструментов для визуализации" является универсальным механизмом, а не особенностью конкретной модели.

Команда

Эта работа выполнена совместно Северо-Западным политехническим университетом и Гонконгским университетом науки и технологий. Первыми авторами статьи являются Jinjian Wu из Северо-Западного политехнического университета и Jiaqi Tang из Гонконгского университета науки и технологий (общие первые авторы), контактными авторами являются профессор Wei Wei из Северо-Западного политехнического университета и профессор Qifeng Chen из Гонконгского университета науки и технологий.

Команда надеется, что эта работа вдохновит на дальнейшие исследования: внедрение структурированных визуальных доказательств в многомодальные системы рассуждений, чтобы сделать "восприятие" больших моделей более надёжным и объяснимым.

Статья: https://arxiv.org/abs/2607.12375v1

Код: https://github.com/zibuyu-02/IQA-T1

Модель: https://huggingface.co/zibuyu-02/IQA-T1

Данные: https://huggingface.co/datasets/zibuyu-02/Q-Tool

Демо: https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1

Эта статья взята из официального аккаунта WeChat "Quantum Bit", автор: команда IQA-T1

Связанные с этим вопросы

QКакова основная проблема существующих многомодальных больших моделей (MLLM) при оценке качества изображений?

AСуществующие MLLM полагаются на внутренние визуальные представления с семантической предвзятостью, а не на проверяемые доказательства деградации изображений. Они хорошо понимают высокоуровневую семантику (например, объекты), но нечувствительны к низкоуровневым искажениям, таким как шум, размытие или артефакты сжатия.

QКакой новый фреймворк предложили исследователи для решения проблемы оценки качества изображений и в чем его ключевая инновация?

AИсследователи предложили фреймворк IQA-T1. Его ключевая инновация заключается в том, чтобы заставить MLLM активно использовать набор специализированных инструментов анализа для создания структурированных "визуальных доказательств" (например, карты шумовых остатков, спектры Фурье), а затем делать выводы на основе этих доказательств, а не полагаться на интуицию.

QКакие два основных этапа обучения использует IQA-T1 и какую цель преследует каждый из них?

AIQA-T1 использует двухэтапное обучение. 1) Контролируемая тонкая настройка (SFT): учит модель *как использовать* инструменты, следовать структурированным шаблонам рассуждений и связывать визуальные доказательства с оценкой качества. 2) Обучение с подкреплением (RL): оптимизирует *стратегию вызова* инструментов, чтобы модель научилась адаптивно выбирать правильные инструменты в нужное время, избегая избыточных вызовов.

QЧто такое набор данных Q-Tool и почему он был создан?

AQ-Tool — это первый в своем роде набор данных для оценки качества изображений, ориентированный на "рассуждения с доказательствами". Он содержит 11 тысяч высококачественных мультимодальных цепочек рассуждений, каждая из которых связывает визуальные доказательства, сгенерированные инструментами, с текстовым анализом, выровненным по мнению человека. Он был создан потому, что существующие наборы данных IQA не поддерживают парадигму рассуждений на основе визуальных доказательств.

QКаких результатов достиг IQA-T1 в экспериментах и что показало исследование об эффективном использовании инструментов?

AIQA-T1 достиг наилучших общих результатов (SOTA) на 7 эталонных тестах IQA со средними показателями PLCC 0.795 и SRCC 0.784. Исследование показало, что инструменты не следует использовать все подряд — их избыток вредит производительности. IQA-T1 динамически вызывает в среднем всего 2.34 инструмента на изображение, что демонстрирует эффективную, основанную на доказательствах стратегию, а не просто подгонку под оценку.

Похожее

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

Источник: интервью Рэя Далио, основателя Bridgewater Associates, для подкаста "The Diary Of A CEO". Далио, предсказавший кризис 2008 года, обсуждает "большой цикл" — концепцию, охватывающую долговые проблемы, растущее неравенство и геополитические сдвиги. Он указывает, что текущий ажиотаж вокруг ИИ демонстрирует классические признаки пузыря, который может лопнуть из-за высокой долговой нагрузки, роста процентных ставок и чрезмерной эмиссии акций, что способно привести к рецессии. Для защиты личного капитала в неопределенные времена Далио советует диверсификацию: вместо хранения наличных инвестировать в акции, золото, облигации. Сам он держит около 1% портфеля в биткоине, считая его "твердыми деньгами", но предпочитает физическое золото из-за его статуса резервного актива и независимости от технологических рисков. Говоря о влиянии ИИ, Далио отмечает, что технология заменяет не только физический труд, но и элементы мышления, что увеличит разрыв между капиталом и трудом. Ключевыми останутся человеческие качества — эмоции и интуиция, а успеха добьются те, кто научится работать в партнерстве с ИИ. На геополитической арене, по его мнению, мир движется к регионализации с центрами в виде США и Китая. Вовлечение США в конфликты, подобные иранскому, обнажает снижение их абсолютного влияния. Внутренние вызовы, такие как дебаты о налогах на богатство, риск капитального бегства и низкая производительность, также ставят под вопрос стабильность традиционных держав в текущей фазе цикла.

marsbit45 мин. назад

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

marsbit45 мин. назад

7.2 трлн вон за один день: иностранные инвесторы установили рекорд чистых покупок в пятницу! Уолл-Стрит: встречный ветер в плане ликвидности на южнокорейском рынке уже утих

Капиталы возвращаются на южнокорейский рынок акций. 31 июля иностранные инвесторы осуществили чистые покупки акций KOSPI на рекордные 7,2 трлн вон за один день, что стало самым высоким показателем в истории. По данным Citigroup, эта цифра знаменует собой кардинальный разворот после месяцев масштабного оттока средств нерезидентов. В июле чистые продажи иностранными инвесторами значительно сократились до 9,8 трлн вон по сравнению с 48,4 трлн и 44,5 трлн вон в июне и мае соответственно. Одновременно внутренние пенсионные и инвестиционные фонды в июле вернулись к чистым покупкам на 1,0 трлн вон. Дополнительным фактором снижения волатильности стали новые правила Комиссии по финансовым услугам (FSC), ужесточившие с 31 июля доступ розничных инвесторов к ETF с плечом на отдельные акции. После введения норм торговый оборот таких инструментов упал примерно вдвое. Citigroup сохраняет целевую точку для KOSPI на уровне 10000 пунктов, отмечая ослабление давления со стороны движения капиталов. Аналитики видят поддержку рынку в устойчивости фундаментальных показателей сектора чипов памяти, низких оценках KOSPI, сильной экономике и благоприятной политике властей, включая возможные меры по поддержке ликвидности.

marsbit46 мин. назад

7.2 трлн вон за один день: иностранные инвесторы установили рекорд чистых покупок в пятницу! Уолл-Стрит: встречный ветер в плане ликвидности на южнокорейском рынке уже утих

marsbit46 мин. назад

Как стать человеком, которого искусственный интеллект никогда не сможет заменить

В статье рассматривается вопрос о том, как остаться незаменимым в эпоху искусственного интеллекта. Автор утверждает, что вместо страха перед ИИ следует сосредоточиться на развитии качеств, которые машины не смогут заменить. Он критикует «зарплатное рабство» — зависимость от работы, не приносящей удовлетворения, и предлагает путь к финансовой независимости через создание собственного дела. Ключ к успеху — развитие пяти элементов: самостоятельности (агентности), вкуса, умения убеждать, упорства и способности к итерациям. Главное — не просто создавать что-либо (сегодня это может каждый), а создавать что-то ценное, востребованное и уметь это продвигать. Автор считает, что наиболее важным навыком будущего является создание контента (медиа), а не просто написание кода, поскольку ценность контента субъективна и требует уникального человеческого вкуса и суждения. ИИ может помочь в производстве, но не заменит оригинальность мысли и связь с аудиторией. В качестве практического шага предлагается упражнение: за 15 минут ответить на вопросы, чтобы обнаружить свои уникальные знания, опыт и точку зрения, которые станут основой для личного бренда и дела жизни. Первый шаг — немедленно опубликовать свою основную идею, чтобы получить обратную связь от реального мира и начать процесс роста. Цель — стать «непригодным для найма», построив жизнь вокруг собственного творчества и экспертизы.

marsbit2 ч. назад

Как стать человеком, которого искусственный интеллект никогда не сможет заменить

marsbit2 ч. назад

Благодаря броскам кубиков ключи от биткоинов хранятся в автономном режиме, но не все будут этим заниматься

Статья посвящена практике генерации сид-фраз для биткоин-кошельков с помощью бросков кубиков в свете уязвимости, обнаруженной в аппаратных кошельках Coldcard. Подчеркивается, что физический бросок кубика (дающий около 2.6 бит энтропии за бросок) создает высококачественную случайность, поскольку предсказать результат практически невозможно из-за множества переменных. Для создания стандартной сид-фразы из 12 слов (128 бит энтропии) требуется около 50 бросков, а для повышенной безопасности рекомендуется 99 и более. В связи с инцидентом Coldcard, когда неисправный генератор случайных чисел в прошивке (2021-2026 гг.) мог создавать предсказуемые ключи, выяснилось, что сид-фразы, сгенерированные вручную через кубики, были защищены от этой уязвимости. Однако исследование показало, что другие функции устройства (создание бумажных кошельков, ключей для мультиподписи, паролей и т.д.) по-прежнему использовали скомпрометированный генератор, подвергая риску владельцев даже с безопасной основной сид-фразой. Автор отмечает, что, хотя метод с кубиками криптографически надежен, он непрактичен для массового использования из-за трудоемкости, высокой вероятности ошибок при вводе и необходимости строгой дисциплины для сохранения секретности процесса. Делается вывод, что будущее безопасности лежит в создании надежных аппаратных генераторов случайных чисел и понятных интерфейсов, а ручные методы остаются нишевым инструментом для опытных пользователей. Владельцам Coldcard рекомендуется обновить прошивку и проверить/заменить все ключи, сгенерированные уязвимыми функциями.

cryptonews.ru6 ч. назад

Благодаря броскам кубиков ключи от биткоинов хранятся в автономном режиме, но не все будут этим заниматься

cryptonews.ru6 ч. назад

Торговля

Спот
活动图片