Mô hình sinh đã có thể huấn luyện end-to-end? Cốt lõi chỉ là một vòng lặp for
Mô hình tạo sinh (generative models) từ lâu đã phụ thuộc vào các phương pháp đào tạo nhiều giai đoạn (như diffusion, autoregressive), dẫn đến "exposure bias" - sự khác biệt giữa cách huấn luyện và suy luận. Bài báo "Explorative Modeling" (XM) từ UIUC và Harvard đề xuất một giải pháp đơn giản nhưng mạnh mẽ: thay vì tách quá trình tạo mẫu, hãy tách vòng lặp huấn luyện.
Trong mỗi bước huấn luyện, mô hình tạo ra K ứng viên, sau đó chỉ chọn ứng viên gần nhất với dữ liệu thực để cập nhật gradient. Vòng lặp `for` đơn giản này giải quyết vấn đề "mode blurring" - xu hướng của hàm mất mát tái tạo đẩy đầu ra về trung bình của các mode hợp lệ, tạo ra kết quả mờ nhạt. Bằng cách khám phá nhiều ứng viên, mô hình học cách bao phủ nhiều mode khác nhau trong phân phối dữ liệu.
Khả năng này được gọi là "biểu đạt tạo sinh" (generative expressivity). Thí nghiệm cho thấy "khám phá" (exploration) trở thành một trục mở rộng quy mô hiệu quả thứ ba, bên cạnh quy mô dữ liệu và tham số. Khi quy mô tăng, lợi ích từ việc khám phá càng lớn, cải thiện hiệu suất FLOP, mẫu và tham số. XM đạt được kết quả tạo ảnh trên ImageNet (FID 1.43 không guidance) ngang bằng các mô hình hàng đầu.
Quan trọng hơn, XM cho phép huấn luyện mô hình tạo sinh "end-to-end" thực sự. Trong thí nghiệm điều khiển robot, Explorative Policy chỉ cần một lượt truyền thẳng mạng, đạt hiệu suất tương đương Diffusion Policy cần hàng trăm bước suy luận. Điều này chuyển chi phí tính toán từ giai đoạn suy luận sang giai đoạn huấn luyện, mở ra khả năng cho các mô hình tạo sinh nhanh và hiệu quả hơn.
Công trình dựa trên lý thuyết "Mode Forcing" trước đó của nhóm tác giả. Hạn chế hiện tại bao gồm chi phí tính toán cho "Forward XM" trên phân phối nhiều mode và thách thức với mô hình ngôn ngữ tự hồi quy thuần túy.
marsbit46 phút trước