# Bài viết Liên quan Định Luật Mở Rộng Quy Mô

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Định Luật Mở Rộng Quy Mô", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

OpenAI sụp đổ, nghiên cứu gốc về Scaling Law lộ bug, nghìn tỷ FLOPs hao phí vô ích

OpenAI nghiên cứu viên Diogo Almeida tiết lộ một lỗi cơ bản trong bài báo gốc về Scaling Law năm 2020. Lỗi này đến từ việc huấn luyện tất cả mô hình với số lượng token dữ liệu cố định (khoảng 130B token) và sử dụng lịch trình suy giảm tốc độ học (Cosine Decay), khiến các mô hình lớn bị "thiếu dinh dưỡng" và tạo ảo tưởng rằng việc tăng dữ liệu không còn hiệu quả. Kết quả là ngành AI toàn cầu đã bị dẫn lối sai, ưu tiên tăng tham số một cách cực đoan (như GPT-3) thay vì cân bằng với dữ liệu, dẫn đến lãng phí hàng nghìn tỷ phép tính. Năm 2022, DeepMind với Chinchilla đã sửa sai, chứng minh rằng mô hình và dữ liệu cần được mở rộng cân đối (khoảng 20 token/1 tham số). Tuy nhiên, ngay cả nghiên cứu Chinchilla cũng được phát hiện có lỗi tối ưu hóa. Hơn nữa, Scaling Law hiện tại chủ yếu dựa trên tiếng Anh - một ngôn ngữ kém hiệu quả về mặt hình thái. Thí nghiệm cho thấy mô hình tiếng Pháp đạt hiệu quả cao hơn 50-100 lần so với tiếng Anh ở một số nhiệm vụ, cho thấy định luật hiện nay có thể chỉ phản ánh đặc tính của một ngôn ngữ cụ thể chứ không phải quy luật phổ quát của trí tuệ nhân tạo. Sự sai lệch này đã khiến cả ngành công nghiệp đi chệch hướng trong nhiều năm, lãng phí lượng lớn tài nguyên tính toán và có thể làm chậm tiến trình phát triển AI hiệu quả.

marsbit07/06 00:00

OpenAI sụp đổ, nghiên cứu gốc về Scaling Law lộ bug, nghìn tỷ FLOPs hao phí vô ích

marsbit07/06 00:00

Ba năm trì hoãn, bài viết mới nhất của cựu sinh viên Bắc Đại Weng Lilian gây bão mạng

Sau ba năm trì hoãn, Lilian Weng, cựu Phó chủ tịch OpenAI và là cựu sinh viên Đại học Bắc Kinh, đã đăng một bài blog dài về Scaling Laws (Định luật Mở rộng Quy mô) - quy tắc toán học định hình sự phát triển của AI hiện đại. Bài viết chỉ ra rằng, mặc dù các định luật này cung cấp nền tảng để dự đoán hiệu suất mô hình khi mở rộng quy mô tính toán, dữ liệu và tham số, nhưng chúng lại rất mong manh và chứa đầy các vấn đề tinh vi. Một điểm quan trọng là sự mâu thuẫn trong các khuyến nghị từ OpenAI (2020) và DeepMind (2022) về cách phân bổ ngân sách tính toán tối ưu giữa quy mô mô hình và dữ liệu. Sự khác biệt này, hóa ra, bắt nguồn từ cách đếm tham số (có bao gồm embedding layer hay không) và quy mô thí nghiệm hạn chế. Hơn nữa, ngay cả công thức nổi tiếng của DeepMind (Chinchilla) - từng được coi là chuẩn mực trong ngành - cũng được phát hiện có lỗi phương pháp luận vào năm 2024, như việc sử dụng hàm mất mát trung bình khiến bộ tối ưu hóa dừng sớm. Bài viết cảnh báo việc ngoại suy các định luật được khớp từ mô hình nhỏ lên mô hình nghìn tỷ tham số là rất rủi ro. Thách thức cơ bản hơn là nguồn dữ liệu văn bản chất lượng cao đang cạn kiệt, làm suy yếu giả định dữ liệu vô hạn của các định luật cổ điển. Các nghiên cứu mới đang cố gắng tích hợp yếu tố lặp lại dữ liệu vào công thức, cho thấy hiệu suất giảm dần và mô hình lớn nhạy cảm hơn với việc huấn luyện lặp. Điều này giải thích tại sao ngành công nghiệp đang chuyển hướng sang các hướng tiếp cận như học tăng cường, tính toán tại thời điểm suy luận và dữ liệu tổng hợp để vượt qua "bức tường dữ liệu". Tóm lại, bài viết nhấn mạnh rằng con đường phát triển AI trong tương lai sẽ không chỉ đơn thuần là "mở rộng quy mô" mà còn đòi hỏi sự hiểu biết tinh tế và xử lý cẩn thận các chi tiết của những định luật cơ bản này.

marsbit06/26 04:55

Ba năm trì hoãn, bài viết mới nhất của cựu sinh viên Bắc Đại Weng Lilian gây bão mạng

marsbit06/26 04:55

活动图片