Nghiên cứu mới của nhóm Hà Khải Minh: Sau khi xóa VAE và dữ liệu riêng tư, việc tạo ảnh từ văn bản lại còn mạnh hơn
Nhóm của He Kaiming đã giới thiệu MiniT2I, một mô hình tạo ảnh từ văn bản cực kỳ đơn giản, hoạt động trực tiếp trên không gian pixel mà không cần bộ mã hóa-giải mã VAE. Mô hình này sử dụng kiến trúc Transformer thuần túy (MM-JiT) với hai bộ chuyển đổi văn bản để tích hợp điều kiện, loại bỏ cơ chế tiêm điều kiện AdaLN phức tạp. Nó được huấn luyện theo hai giai đoạn hoàn toàn bằng dữ liệu công khai, với chi phí thấp (3 ngày trên 8 GPU H100). Phiên bản 258M tham số đạt điểm cao trong các bài đánh giá GenEval và DPG-Bench, vượt trội so với các mô hình pixel cùng loại có kích thước lớn hơn nhiều lần. Mặc dù vẫn tồn tại một số hạn chế như hiện tượng rạn nứt ở biên các patch pixel, tác dụng phụ của CFG và khả năng hiển thị văn bản chưa tối ưu, MiniT2I chứng minh rằng việc tạo ảnh từ văn bản chất lượng cao có thể đạt được với kiến trúc tối giản, dữ liệu mở và nguồn lực tính toán học thuật, mở ra hướng tiếp cận "tinh gọn" thay vì "chồng chất phức tạp" trong lĩnh vực này.
marsbit06/22 10:19