Apple заново изобретает сжатие изображений с помощью ИИ: такое же качество, но файл в три раза меньше

marsbitОпубликовано 2026-05-30Обновлено 2026-05-30

Введение

В феврале 2025 года группа JPEG утвердила новый международный стандарт JPEG AI — первый полностью обучаемый кодек для сжатия изображений. Однако даже он не решает ключевую проблему — оптимизацию под человеческое восприятие (перцептивное сжатие), а фокусируется на математических метриках, таких как PSNR. Компания Apple представила ответ на этот вызов — кодек PICO (Perceptual Image Codec). Его цель — не улучшение численных показателей, а прямое улучшение визуального качества для человеческого глаза. Команда решила три основные проблемы: 1. **Скорость энтропийного кодирования:** Вместо медленного авторегрессивного подхода PICO использует «одношаговую контекстную модель» для параллельных вычислений, сохраняя точность без потери скорости. 2. **Артефакты и «галлюцинации» ИИ:** При перцептивном обучении с использованием GAN часто искажаются критически важные детали, например, текст. PICO вводит специальную функцию потерь TextFidelityLoss, которая строго сохраняет точность в текстовых областях, снижая ошибки наполовину. 3. **Границы между фрагментами изображения (тайлами):** Для работы на мобильных чипах изображение обрабатывается частями. PICO применяет TilingArtifactLoss, чтобы устранить видимые цветовые различия на стыках этих фрагментов. Результаты масштабного слепого тестирования (74 925 сравнений) показали, что при одинаковом визуальном качестве PICO создаёт файлы в 2–3 раза меньше (на 30–43%), чем современные стандарты (AV1, VVC, JPEG AI). На iPhone 17 Pro Max кодировани...

Насколько маленьким можно сжать изображение?

В феврале 2025 года Объединенная группа экспертов по фотографии (JPEG) объявила о событии, которое было скромно отпраздновано в отрасли: официальный выпуск JPEG AI, первого международного стандарта для сквозного обучаемого кодирования изображений, который разрабатывался годами и возлагал на него большие надежды.

Новость распространилась, и многие исследователи делились ей в социальных сетях с комментариями вроде «ИИ, наконец, попал в стандарты».

Стандарт JPEG появился в 1992 году и уже более тридцати лет является одним из фундаментальных языков цифровых изображений для человечества. Теперь искусственный интеллект начинает переписывать грамматику этого языка.

Однако за празднованиями скрывается тонкая реальность: даже JPEG AI все еще находится на значительном расстоянии от подлинного «перцепционного сжатия».

Инженеры знают, что традиционный показатель качества сжатия, пиковое отношение сигнала к шуму (PSNR), на самом деле слабо коррелирует с тем, насколько «хорошо» изображение выглядит для человеческого глаза. Изображение может получить высокий балл по PSNR, но человеку покажется скучным и невыразительным; другое изображение с более низким PSNR человек может воспринять как детализированное и реалистичное. Оптимизация математических показателей и оптимизация восприятия человеческим глазом — это две совершенно разные задачи.

Десятилетиями, от JPEG до VVC и теперь до JPEG AI, логика проектирования почти всех кодеков продолжала вращаться в рамках математических показателей. Перцепционное сжатие (оптимизация непосредственно под впечатления человеческого глаза) всегда казалось далекой целью академических статей, а не инженерной реальностью, которую можно поместить в телефон.

Именно в этот момент команда инженеров Apple тихо опубликовала статью со своим ответом, под кодовым названием: PICO.

Название статьи: What Matters in Practical Learned Image Compression

Адрес статьи: https://arxiv.org/pdf/2605.05148

Почему «выглядеть лучше» намного сложнее, чем «получить более высокие цифры»?

Чтобы понять PICO, сначала нужно понять, что на самом деле делает сжатие изображений.

Сохранение фотографии в файл по сути является задачей выбора: «что забыть, а что запомнить». При ограниченном объеме памяти необходимо отбросить часть информации, сделав это так, чтобы зритель этого как можно меньше заметил. Разные кодеки следуют разным «правилам отбрасывания».

Традиционные кодеки, такие как JPEG, AV1, VVC, — это системы правил, спроектированные инженерами вручную. Они разделяют изображение на блоки, выполняют преобразования, квантование, энтропийное кодирование — каждый шаг основан на десятилетиях накопленного человеческого опыта. Такие системы могут показывать отличные результаты по математическим показателям вроде PSNR, но по своей сути они ориентированы на «уменьшение ошибки пикселей», а не на «уменьшение дискомфорта для человеческого глаза».

Проблема в том, что человеческий глаз — не измеритель ошибок пикселей. Его чувствительность к текстурам, тексту, деталям гораздо сложнее, чем любая математическая формула. Если сильно сжать фотографию городского пейзажа, PSNR может остаться приличным, но вы увидите размытые края зданий, искаженные буквы на вывесках — именно то, что человеческий глаз замечает в первую очередь.

Появление обучаемых кодеков теоретически открыло новые возможности: нейронные сети можно обучать сквозным образом непосредственно на человеческое восприятие, а не на математические формулы. Но до PICO существующие перцепционные обучаемые кодеки либо были слишком медленными для практического применения, либо не имели кросс-платформенной совместимости, либо не могли гибко контролировать битрейт, и их просто невозможно было внедрить в потребительское устройство.

Три ключевые проблемы, три решения

Аббревиатура PICO расшифровывается как Perceptual Image Codec (Перцепционный видеокодек). Это название прямо указывает на его цель: удовлетворить человеческий глаз.

Исследовательская группа систематически изучила миллионы конфигураций моделей и представила несколько ключевых технологических инноваций.

Первая проблема: медленное энтропийное кодирование. Что делать?

В сжатии изображений есть сложная задача: чтобы сжать сильнее, кодеку нужна «энтропийная модель» для точной оценки количества информации в каждом пикселе. Самый точный метод называется авторегрессионным кодированием: для сжатия каждого пикселя нужно сначала посмотреть на уже сжатые окружающие пиксели и последовательно предсказать следующий. Это как если бы повар, добавляя каждый ингредиент, каждый раз оглядывался на состояние сковороды, прежде чем решить, что делать дальше. Точный, но очень медленный.

Решение PICO — это «Модель контекста за один проход» (One-shot Context Model): самый критический параметр масштаба в энтропийном кодировании выносится отдельно и вычисляется полностью за один прямой проход, без необходимости ожидания; остальные параметры могут вычисляться параллельно. Это сохраняет точность авторегрессии, но обходит узкое место в скорости. Результат: без этого модуля производительность модели падает на 10,28%; с ним скорость практически не страдает.

Вторая проблема: перцепционное обучение вызывает галлюцинации. Что делать?

Изображения, сгенерированные с помощью GAN (Generative Adversarial Networks — порождающих состязательных сетей), часто «выглядят реалистично», но эта реалистичность может быть вымышленной — пряди волос превращаются в несуществующие узоры, на гладкой поверхности появляются ложные текстуры. Что еще хуже, человеческий глаз чрезвычайно чувствителен к тексту: малейшее искажение буквы сразу же заметно.

PICO специально для текста разработал TextFidelityLoss (Функцию потерь верности тексту): используя готовый детектор текста, он автоматически находит текстовые области на изображении и в этих областях применяет строгие ограничения по точности пикселей, одновременно подавляя «творчество» GAN в текстовых областях. Эксперименты показывают, что с добавлением этой функции потерь абсолютная ошибка в текстовых областях снизилась ровно наполовину.

Третья проблема: блочная обработка изображений оставляет видимые границы. Что делать?

Для быстрой работы на мобильных чипах PICO делит изображение на тайлы размером 504×504 пикселей, обрабатывает их по отдельности, а затем объединяет обратно. Но GAN при обучении склонен игнорировать низкочастотные цвета, что часто приводит к видимым цветовым различиям между соседними тайлами, похожим на ощущение «плохо склеенных» кусков в фоторедакторе. Исследовательская группа специально ввела TilingArtifactLoss (Функцию потерь из-за артефактов тайлинга) — многоразрешенную L1-функцию потерь, которая заставляет модель сохранять цветовую согласованность на нескольких пространственных частотах. Эта мера также снизила ошибку на границах тайлов более чем наполовину.

Результаты эксперимента

Команда Apple не ограничилась показателями стандартных бенчмарков. Они поручили сторонней платформе Mabyduck организовать масштабное субъективное тестирование людьми.

Тестирование проводилось методом слепого попарного сравнения: 610 отобранных участников (прошедших проверку на дальтонизм и тест на различение артефактов сжатия) попарно сравнивали результаты восстановления одного и того же изображения разными кодеками, итоговая оценка сводилась в Bayesian ELO. Всего было собрано 74 925 результатов попарного сравнения.

Конечные цифры говорят сами за себя: При одинаковом визуальном качестве размер файла PICO составляет лишь от одной трети до половины размера файлов AV1, AV2, VVC, ECM и JPEG AI — другими словами, для хранения того же изображения ему требуется лишь 30%-43% бит по сравнению с этими стандартами. По сравнению с самыми сильными существующими обучаемыми перцепционными кодеками (HiFiC, MRIC и др.) PICO также экономит 20%-40% размера файла.

Что касается скорости, то на iPhone 17 Pro Max кодирование 12-мегапиксельной фотографии в PICO занимает всего 230 миллисекунд, а декодирование — 150 миллисекунд. Большинство же топовых ML-кодеков работают медленнее даже на серверных видеокартах NVIDIA V100.

Стоит отметить, что в статье отдельно зафиксирован «контрпример»: по традиционному показателю PSNR PICO показывает средние результаты, даже уступая DCVC-RT и VVC. Это как раз подтверждает базовое предположение команды: оптимизация перцепционного качества и оптимизация математических показателей — это по сути два разных направления, и совместить одно с другим невозможно.

Веха эпохи, а не финишная черта

У PICO, конечно, есть свои ограничения. В статье прямо говорится, что для высокоструктурированных синтетических изображений, таких как мультфильмы или схемы, эффективность сжатия у PICO ниже, чем у традиционных кодеков, потому что такой контент по своей природе лучше подходит для моделирования на основе правил, а не для перцепционной генерации.

Но эти ограничения не затмевают значимости данной работы.

Последние тридцать лет технический прогресс в сжатии изображений происходил почти исключительно на пути «сделать цифры лучше». От JPEG к HEVC и далее к VVC инженеры поколение за поколением оптимизировали показатели вроде PSNR, SSIM. А восприятие человеческим глазом всегда оставалось обходимой «трудной проблемой».

PICO — это первая попытка системно разобрать эту проблему: от поиска архитектуры и проектирования функций потерь до масштабного субъективного тестирования людьми, и в итоге — до кодеков, способных работать в реальном времени на смартфоне.

Когда в следующий раз вы будете делиться фотографией с устройства Apple, возможно, вы не почувствуете разницы. Но, возможно, в тихом процессе сжатия алгоритм, созданный специально для восприятия человеческим глазом, будет решать, какую информацию стоит сохранить, а какую можно незаметно забыть.

Команда: от WaveOne до Apple

Автором-корреспондентом этой статьи является Орен Риппель, исследователь Apple, давно известный в области сжатия.

Впервые его имя громко зазвучало в 2017 году. Тогда он работал в стартапе WaveOne и опубликовал статью под названием «Адаптивное сжатие изображений в реальном времени», в которой нейронная сеть превзошла все основные кодеки того времени, сохраняя при этом скорость работы в реальном времени. Эта статья вызвала немалый резонанс в научном сообществе и закрепила позицию Риппеля в области обучения сжатию.

Впоследствии та же основная команда в WaveOne продолжила углубленную работу и выпустила ELF-VC для сжатия видео, добившись экономии битрейта на 44% по сравнению с H.264 на наборе тестов UVG, при этом скорость работы была в пять раз выше, чем у аналогичных ML-кодеков.

Позже эта команда из WaveOne в полном составе перешла в Apple. И PICO — это их первый системный ответ на задачу перцепционного сжатия изображений, подкрепленный вычислительными мощностями и ресурсами платформы Apple.

Эта статья взята из WeChat Official Account «Машина почти разумна» (ID:almosthuman2014), автор: Сжатие — это интеллект

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое JPEG AI и почему его выпуск считается значимым событием?

AJPEG AI — это первый международный стандарт сквозного обучения для кодирования изображений, разработанный Объединенной группой экспертов по фотографии (JPEG). Его выпуск в феврале 2025 года считается значимым, потому что он представляет собой внедрение искусственного интеллекта в базовый стандарт, который десятилетиями использовался для цифровых изображений, открывая новую эру в сжатии данных.

QКакие основные проблемы существующих кодеков стремится решить PICO (Perceptual Image Codec) от Apple?

APICO стремится решить три ключевые проблемы: 1) Медленная скорость энтропийного кодирования — решена с помощью «модели одношагового контекста». 2) Артефакты и «галлюцинации» (например, искажение текста) при обучении с использованием GAN — решены с помощью функции потерь TextFidelityLoss. 3) Видимые границы между обработанными фрагментами изображения — решены с помощью функции потерь TilingArtifactLoss.

QКаковы основные результаты субъективных тестов PICO по сравнению с другими кодекми?

AПо результатам масштабных субъективных тестов, проведенных на платформе Mabyduck, при одинаковом визуальном качестве PICO создает файлы, которые в 2-3 раза меньше по сравнению с AV1, AV2, VVC, ECM и JPEG AI (требует только 30%-43% бит). По сравнению с другими передовыми обучаемыми перцептивными кодеками (такими как HiFiC и MRIC), PICO экономит 20%-40% размера файла.

QНасколько быстр PICO на устройстве iPhone 17 Pro Max?

AНа устройстве iPhone 17 Pro Max кодек PICO кодирует 12-мегапиксельное фото за 230 миллисекунд, а декодирует — за 150 миллисекунд. Это делает его достаточно быстрым для практического использования на мобильных устройствах, превосходя по скорости многие топовые ML-кодеки, работающие даже на серверных видеокартах.

QКакова основная цель кодера PICO и в чем его ключевое отличие от традиционных подходов?

AОсновная цель кодера PICO — оптимизация сжатия изображений для восприятия человеческим глазом, а не для достижения высоких математических показателей (таких как PSNR). Ключевое отличие в том, что он напрямую обучается минимизировать заметные для человека искажения, в то время как традиционные кодеки в первую очередь минимизируют ошибку между пикселями, что не всегда соответствует субъективному качеству.

Похожее

Банк Японии сигнализирует о повышении процентных ставок, несмотря на сохранение их на уровне 1%

Банк Японии 31 июля оставил ключевую процентную ставку на уровне 1%, как и ожидалось. Единственный член правления, Хадзиме Таката, проголосовал за повышение до 1,25%. Несмотря на сохранение ставки, центробанк сохранил жесткую риторику, предупредив об ускорении базовой инфляции выше целевого уровня 2% во второй половине финансового года. Прогноз инфляции на 2026 финансовый год был несколько снижен, но в Банке Японии выразили уверенность в ее долгосрочном росте из-за слабой иены, корпоративной ценовой политики и последствий энергетического шока. Перед решением по ставкам Банк Японии провел валютную интервенцию, впервые за три месяца поддержав иену, которая опустилась до 40-летнего минимума к доллару. Слабость иены вызвана разницей в ставках с США, высокой стоимостью топлива и ожиданиями дальнейшего ужесточения политики. Цена 10-летних облигаций свидетельствует, что рынки ждут новых шагов по нормализации. Задача главы Банка Японии Уэды — балансировать между правительством, не желающим ужесточения, и рынками, которые на него рассчитывают.

cryptonews.ru6 мин. назад

Банк Японии сигнализирует о повышении процентных ставок, несмотря на сохранение их на уровне 1%

cryptonews.ru6 мин. назад

Выяснилось, что 92,7% институциональных резервов биткоинов (BTC) находятся в распоряжении компаний, базирующихся в США

По данным аналитической платформы Unfolded, на публичные компании, котирующиеся на американских биржах, приходится абсолютное большинство — 92,7% — мировых биткоин-резервов, находящихся в распоряжении институциональных инвесторов. Их общий объём владения криптовалютой достиг 1,24 миллиона BTC. За последний год эти компании увеличили свои портфели на 510 000 BTC. Примечательно, что этот объём покупок более чем в три раза превысил количество новых биткоинов, произведённых майнерами за тот же период. Это свидетельствует о растущем влиянии институционального спроса на рынок. Тренд на включение биткоина в корпоративные балансы, начатый компанией MicroStrategy, продолжили многие предприятия из энергетического, технологического и финансового секторов, рассматривающие криптовалюту как долгосрочный резервный актив. Аналитики отмечают, что столь интенсивное поглощение биткоина институциями может сократить его ликвидное предложение и оказать значительное влияние на динамику цен, особенно после будущего халвинга, когда эмиссия новых монет сократится.

cryptonews.ru6 мин. назад

Выяснилось, что 92,7% институциональных резервов биткоинов (BTC) находятся в распоряжении компаний, базирующихся в США

cryptonews.ru6 мин. назад

Reddit утроил прибыль до 253 миллионов долларов, но отметил нестабильность поисковых запросов

Компания Reddit во втором квартале 2026 года утроила чистую прибыль до 253 млн долларов по сравнению с аналогичным периодом прошлого года. Выручка выросла на 61%, достигнув 805 млн долларов, что восьмой квартал подряд демонстрирует рост более 60%. Рекламные доходы увеличились на 64% до 762 млн долларов. Еженедельная аудитория впервые превысила 500 млн уникальных пользователей. Однако руководство компании отметило нестабильность и непредсказуемость трафика из поисковых систем в конце квартала. Это является слабым местом для платформы, стремящейся превратить свою аудиторию в ежедневных пользователей. Генеральный директор Стивен Хаффман заявил, что «обзоры ИИ пока не оказали аналогичного положительного влияния» на поисковый трафик по сравнению с традиционными ссылками. Также Reddit запустил программу выкупа акций на 235 млн долларов и прогнозирует выручку в третьем квартале в диапазоне от 860 до 870 млн долларов.

cryptonews.ru8 мин. назад

Reddit утроил прибыль до 253 миллионов долларов, но отметил нестабильность поисковых запросов

cryptonews.ru8 мин. назад

Мнение: Почему такие ETF с плечом, как 7709, по своей сути являются продуктами с отрицательной математической ожидаемой доходностью?

Многие инвесторы воспринимают ETF с кредитным плечом 7709 как простой инструмент с удвоенной доходностью акций SK Hynix: если акции растут на 1%, ETF должен вырасти на 2%. Однако механизм ежедневной ребалансировки, необходимый для поддержания постоянного плеча, приводит к систематическим издержкам. По своей сути, 7709 – это стратегия, которая механически покупает после роста и продает после падения, постоянно отставая от рынка. Каждая ребалансировка представляет собой запоздалую реакцию: фонд увеличивает позиции после роста цены и сокращает их после падения, покупая дороже и продавая дешевле. Это создает "запаздывающие убытки". В условиях тренда редкая ребалансировка (раз в день) приводит к недополучению прибыли, так как заработанные средства реинвестируются слишком поздно. В условиях высокой волатильности и бокового движения частые подстройки вызывают значительные потери от волатильности (volatility decay), поскольку фонд вынужден постоянно покупать на пиках и продавать на дне. По своей динамике продукт напоминает дельта-хеджирование продавца опционов (short gamma), который также покупает при росте и продает при падении. Однако, в отличие от продавца опционов, получающего премию (IV и тета-время) за принятие этого риска, инвесторы 7709 не получают никакой компенсации. Напротив, они несут дополнительные расходы: затраты на финансирование (swap), комиссии за управление, издержки на деривативы и транзакционные издержки. Таким образом, 7709 – это продукт со структурно отрицательным математическим ожиданием (negative EV). Для получения прибыли инвестору необходимо не только верно предсказать направление движения базового актива, но и чтобы этот рост был достаточно сильным, устойчивым и плавным, чтобы перекрыть постоянные издержки и потери от пути. Утверждение, что такой ETF "не может быть ликвидирован как фьючерсы", вводит в заблуждение: хотя явного момента маржин-колла нет, стоимость активов фонда может неуклонно снижаться, приближаясь к нулю из-за комбинации волатильности и сборов. Для опытных инвесторов использование perpetual-контрактов (при наличии ликвидности) может быть более эффективным, так как предоставляет прямой контроль над плечом, моментом ребалансировки и управлением рисками.

marsbit11 мин. назад

Мнение: Почему такие ETF с плечом, как 7709, по своей сути являются продуктами с отрицательной математической ожидаемой доходностью?

marsbit11 мин. назад

Coinbase получила рекордную долю крипторынка, но не смогла избежать убытков

Криптобиржа Coinbase, несмотря на захват рекордной доли мирового крипторынка (10.3% во II квартале 2026 г.), сообщила о чистых убытках в $359 млн. Выручка упала на 19% в годовом выражении, а ключевые показатели — доходы от транзакций ($599 млн), подписок и сервисов ($555 млн) — не достигли прогнозов аналитиков. Основные причины — слабая торговая активность клиентов, снижение общих спотовых объемов на 25% и низкая волатильность рынка. Рост доли рынка произошел на фоне общего спада в индустрии. Для снижения зависимости от спотовой торговли Coinbase активно развивает новые направления: деривативы (после покупки Deribit), стейблкоины, токенизированные активы и платежные сервисы. Однако текущая диверсификация пока не может полностью компенсировать падение доходов от основного бизнеса. Дальнейшие результаты компании будут зависеть от скорости, с которой новые продукты смогут перевесить традиционную торговлю в структуре выручки.

cryptonews.ru23 мин. назад

Coinbase получила рекордную долю крипторынка, но не смогла избежать убытков

cryptonews.ru23 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片