何恺明团队新作:删掉VAE和私有数据后,文生图竟然更强了
何恺明团队发布极简文生图模型MiniT2I,挑战当前依赖复杂组件的行业范式。该模型摒弃了VAE编解码器、AdaLN条件注入、私有数据和强化学习对齐等常见设计,直接在像素空间使用流匹配目标进行训练。其采用改进的MM-JiT架构,用轻量文本适配器取代复杂的条件注入机制,使模型结构更简洁高效。
训练数据全程使用公开集,采用预训练加微调的两阶段模式。仅258M参数的B/16版本在多个基准测试中超越了参数量大数倍的同类模型,展现出极高的性价比。扩展后的L/16版本在风格、构图等方面已接近更大规模的先进模型。
研究证明了文生图模型可通过架构和训练流程的简化实现强大性能,可能推动该领域从“堆料”向“提纯”的范式转换。团队也指出了像素空间模型在patch边界伪影、高分辨率扩展和数据瓶颈等方面的当前局限。
marsbit06/22 10:17