Новая работа команды Хэ Каймина: после удаления VAE и приватных данных генерация текста в изображениях стала ещё лучше
Новая работа команды Хэ Каймина, MiniT2I, представляет собой минималистскую базовую модель для генерации изображений по тексту, которая бросает вызов существующим сложным подходам. В отличие от популярных моделей, таких как Stable Diffusion, MiniT2I отказывается от использования VAE, сложных механизмов введения условий (AdaLN), вспомогательных функций потерь, приватных данных и этапов выравнивания RL/DPO.
Модель работает непосредственно в пространстве пикселей, используя потоковое согласование. Архитектура MM-JiT основана на чистом Transformer с двумя адаптерами для текста и без AdaLN. Обучение проводится в два этапа на полностью открытых данных: предварительное обучение на LLaVA-recaptioned CC12M и тонкая настройка на наборе высококачественных пар изображение-текст.
Несмотря на небольшой размер (например, версия B/16 с 258 млн параметров), MiniT2I показывает конкурентоспособные результаты на бенчмарках GenEval (0.87) и DPG-Bench (84.2), превосходя более крупные модели. Модель L/16 (912 млн параметров) демонстрирует хорошее качество в стилях, композиции и воображении, приближаясь к SD3-Medium.
Работа также честно указывает на текущие ограничения: артефакты на границах патчей, побочные эффекты CFG в пиксельном пространстве, потолок разрешения и отставание в рендеринге текста из-за использования только открытых данных. MiniT2I доказывает, что создание мощных тексто-графических моделей может быть более простым, эффективным и доступным, отмечая возможный переход от парадигмы «нагромождения» к парадигме «очищения».
marsbit06/22 10:18