Apple заново изобретает сжатие изображений с помощью ИИ: такое же качество, но файл в три раза меньше
В феврале 2025 года группа JPEG утвердила новый международный стандарт JPEG AI — первый полностью обучаемый кодек для сжатия изображений. Однако даже он не решает ключевую проблему — оптимизацию под человеческое восприятие (перцептивное сжатие), а фокусируется на математических метриках, таких как PSNR.
Компания Apple представила ответ на этот вызов — кодек PICO (Perceptual Image Codec). Его цель — не улучшение численных показателей, а прямое улучшение визуального качества для человеческого глаза.
Команда решила три основные проблемы:
1. **Скорость энтропийного кодирования:** Вместо медленного авторегрессивного подхода PICO использует «одношаговую контекстную модель» для параллельных вычислений, сохраняя точность без потери скорости.
2. **Артефакты и «галлюцинации» ИИ:** При перцептивном обучении с использованием GAN часто искажаются критически важные детали, например, текст. PICO вводит специальную функцию потерь TextFidelityLoss, которая строго сохраняет точность в текстовых областях, снижая ошибки наполовину.
3. **Границы между фрагментами изображения (тайлами):** Для работы на мобильных чипах изображение обрабатывается частями. PICO применяет TilingArtifactLoss, чтобы устранить видимые цветовые различия на стыках этих фрагментов.
Результаты масштабного слепого тестирования (74 925 сравнений) показали, что при одинаковом визуальном качестве PICO создаёт файлы в 2–3 раза меньше (на 30–43%), чем современные стандарты (AV1, VVC, JPEG AI). На iPhone 17 Pro Max кодирование 12-мегапиксельного фото занимает 230 мс, декодирование — 150 мс. При этом PICO намеренно жертвует высокими баллами в PSNR, что подтверждает его ориентацию на восприятие, а не на математику.
Хотя для синтетических изображений (мультфильмы, схемы) традиционные кодеки остаются эффективнее, PICO знаменует поворотный момент — первое системное решение для перцептивного сжатия, реализуемое на мобильном устройстве в реальном времени.
marsbit05/30 02:48