# Сопутствующие статьи по теме Диффузия

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Диффузия", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Только что, классический шедевр DeepMind снова стал культовым. Объявлены награды ICML 2026

Официально объявлены награды ICML 2026. Две статьи о диффузионных моделях получили высшую награду за выдающуюся статью, и многие авторы — китайцы. В общей сложности 9 работ были номинированы на премию за выдающуюся статью, включая 3 победителя и 6 почетных упоминаний. Премия за проверку временем была присуждена классической работе DeepMind «Асинхронные методы глубокого обучения с подкреплением». Обе статьи-победители в области диффузионных моделей сигнализируют о переходе исследований от «доказательства концепции» к «глубокой» фазе, требуя более тщательного анализа и улучшения инфраструктуры. Награда за лучшую позиционную статью была присуждена работе «Позиция: сообщество по согласованию невольно создает инструментарий цензора», что отражает внутреннюю рефлексию в исследованиях безопасности ИИ. Почетные упоминания охватывают такие темы, как возникновение честности в RLHF, атрибуция движения в генерации видео, запоминание в языковых моделях, согласованность диффузионных моделей и строгое доказательство феномена «гроккинга». Список наград ICML 2026 указывает на то, что исследования ИИ переходят от фазы «быстрого расширения» к фазе «глубокой очистки» и консолидации.

marsbit07/06 02:39

Только что, классический шедевр DeepMind снова стал культовым. Объявлены награды ICML 2026

marsbit07/06 02:39

Новая работа команды Хэ Каймина: после удаления VAE и приватных данных генерация текста в изображениях стала ещё лучше

Новая работа команды Хэ Каймина, MiniT2I, представляет собой минималистскую базовую модель для генерации изображений по тексту, которая бросает вызов существующим сложным подходам. В отличие от популярных моделей, таких как Stable Diffusion, MiniT2I отказывается от использования VAE, сложных механизмов введения условий (AdaLN), вспомогательных функций потерь, приватных данных и этапов выравнивания RL/DPO. Модель работает непосредственно в пространстве пикселей, используя потоковое согласование. Архитектура MM-JiT основана на чистом Transformer с двумя адаптерами для текста и без AdaLN. Обучение проводится в два этапа на полностью открытых данных: предварительное обучение на LLaVA-recaptioned CC12M и тонкая настройка на наборе высококачественных пар изображение-текст. Несмотря на небольшой размер (например, версия B/16 с 258 млн параметров), MiniT2I показывает конкурентоспособные результаты на бенчмарках GenEval (0.87) и DPG-Bench (84.2), превосходя более крупные модели. Модель L/16 (912 млн параметров) демонстрирует хорошее качество в стилях, композиции и воображении, приближаясь к SD3-Medium. Работа также честно указывает на текущие ограничения: артефакты на границах патчей, побочные эффекты CFG в пиксельном пространстве, потолок разрешения и отставание в рендеринге текста из-за использования только открытых данных. MiniT2I доказывает, что создание мощных тексто-графических моделей может быть более простым, эффективным и доступным, отмечая возможный переход от парадигмы «нагромождения» к парадигме «очищения».

marsbit06/22 10:18

Новая работа команды Хэ Каймина: после удаления VAE и приватных данных генерация текста в изображениях стала ещё лучше

marsbit06/22 10:18

活动图片