Thiết kế huyền thoại của Transformer bị đả kích, ba bài báo tại hội nghị COLM chất vấn
Nhiều công nghệ cốt lõi của Transformer đang bị đặt dấu hỏi tại hội nghị COLM 2026, khi ba bài báo nghiên cứu cùng lúc chỉ ra những lựa chọn thiết kế vốn được xem là "mặc định" trong kiến trúc này thực chất có nhiều điểm yếu tiềm ẩn.
Bài báo đầu tiên, "Cracks in the Foundation" (Ai2), phân tích 4 lựa chọn kiến trúc thường thấy: chuẩn hóa QK (QK Normalization), GQA, cơ chế chú ý cửa sổ trượt (SWA) và độ dài ngữ cảnh tiền huấn luyện. Nghiên cứu huấn luyện 26 mô hình 7B-8B tham số với các tổ hợp cài đặt khác nhau, gọi là OlmPool. Kết quả trên bộ đánh giá HELMET 32K cho thấy điểm số chênh lệch tới 47% giữa tổ hợp tốt nhất và tệ nhất. Việc kết hợp các tùy chọn như GQA và SWA gây tác hại lớn hơn nhiều so với ảnh hưởng riêng lẻ. Đặc biệt, chuẩn hóa QK – vốn dùng để ổn định huấn luyện – có thể làm giảm đáng kể hiệu năng xử lý ngữ cảnh dài tùy vào mô hình nền.
Bài báo thứ hai, "Lost in Backpropagation" (Đại học Cornell), tập trung vào lớp chiếu đầu ra (output projection layer). Lớp này chuyển trạng thái ẩn (kích thước ~ vài nghìn) thành logits (kích thước ~ hàng chục nghìn token từ vựng). Nghiên cứu phát hiện sự chênh lệch kích thước này gây thất thoát nghiêm trọng tín hiệu gradient trong lan truyền ngược: 95-99% phạm vi gradient bị mất đi khi đi qua lớp này, phần còn lại có hướng sai lệch đáng kể. Điều này có nghĩa tín hiệu huấn luyện quan trọng bị suy giảm nghiêm trọng ở bước cuối cùng.
Bài báo thứ ba, "When Fewer Layers Break More Chains" (Đại học Tübingen), cảnh báo về kỹ thuật cắt tỉa lớp (layer pruning) để nén mô hình. Trong khi phương pháp này ít ảnh hưởng đến điểm số trên các nhiệm vụ kiểm tra kiến thức thông thường, nó lại phá vỡ nghiêm trọng khả năng suy luận chuỗi dài (long-chain reasoning) của mô hình. Trên các bài toán khó như AIME24, việc cắt tỉa chỉ một lớp đã khiến độ chính xác sụt giảm mạnh, và khả năng "mở rộng khi suy luận" (test-time scaling) – cho mô hình nhiều thời gian/ token suy nghĩ hơn – gần như không còn tác dụng. Việc tinh chỉnh (fine-tuning) sau cắt tỉa cũng khó khôi phục lại hoàn toàn khả năng này.
Cả ba nghiên cứu, dù xem xét các khía cạnh khác nhau (ngữ cảnh dài, gradient huấn luyện, suy luận), đều cùng chỉ ra một xu hướng: nhiều thiết kế "chuẩn mực" và ít bị chất vấn trong kiến trúc Transformer thực tế có thể tồn tại những nhược điểm đáng kể, đòi hỏi sự xem xét và đánh giá lại kỹ lưỡng.
marsbit08/17 10:31