# Bài viết Liên quan Lượng tử hóa

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Lượng tử hóa", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Ảnh viral trên Reddit: Chỉ 2 năm nữa, laptop của bạn có thể chạy được Fable 5

Cộng đồng r/LocalLLaMA trên Reddit mới đây lan truyền một biểu đồ dự đoán: nếu xu hướng hiện tại tiếp diễn, các mô hình AI có năng lực ngang ngửa “Fable 5” (tức cấp độ Mythos) dự kiến có thể chạy ổn định trên phần cứng máy tính cá nhân cao cấp trong khoảng 2 năm tới, cụ thể là vào tháng 7/2028. Phân tích lịch sử cho thấy, khoảng thời gian từ khi một mô hình tiên tiến ra mắt trên đám mây đến khi năng lực tương đương xuất hiện trên phần cứng tiêu dùng đang ổn định ở mức trung bình khoảng 24,8 tháng: GPT-3 (37 tháng), GPT-3.5 (17 tháng), GPT-4 (~24 tháng), Claude 3.5 Sonnet/GPT-4o (21 tháng). Xu hướng này được củng cố bởi sự tiến bộ trong kiến trúc mô hình (như MoE), kỹ thuật lượng tử hóa (Q4/Q8), và các công thức huấn luyện tốt hơn. Ví dụ gần đây, Gemma 4 31B (ra mắt tháng 4/2026), một mô hình mã nguồn mở, đã đạt năng lực ngang bằng Claude 3.5 Sonnet (ra mắt tháng 6/2024) chỉ sau 21 tháng. Điều này cho thấy khoảng cách giữa khả năng đám mây độc quyền và khả năng chạy cục bộ đang thu hẹp nhanh chóng. Viễn cảnh này mang ý nghĩa lớn: AI mạnh nhất sẽ không còn bị giới hạn bởi đám mây, thuê bao hay kiểm soát truy cập. Thay vào đó, nó hứa hẹn sự “dân chủ hóa” thực sự, mở ra các ứng dụng cục bộ về Agent, tính toán bảo mật và quy trình làm việc ngoại tuyến. Dù các công ty và quy định có thể kiểm soát ai được dùng AI mạnh nhất ngày hôm nay, họ khó có thể ngăn xu hướng năng lực này xuất hiện trên máy tính cá nhân của mọi người trong tương lai gần.

marsbit07/07 07:32

Ảnh viral trên Reddit: Chỉ 2 năm nữa, laptop của bạn có thể chạy được Fable 5

marsbit07/07 07:32

Chạy MoE trên điện thoại? Meta đề xuất MobileMoE, iPhone 16 Pro tăng tốc đến 3.8 lần

Trong những năm gần đây, Mô hình Chuyên gia Hỗn hợp (MoE) đã được sử dụng rộng rãi cho các mô hình lớn trên đám mây. Tuy nhiên, trên điện thoại, Kiến trúc Ngôn ngữ Lớn (LLM) vẫn chủ yếu sử dụng kiến trúc dày đặc. Meta đã đề xuất MobileMoE, lần đầu tiên triển khai suy luận MoE hiệu quả trên điện thoại thông minh thương mại. Kết quả cho thấy, trên 14 bài kiểm tra cơ bản, MobileMoE-S/M đạt độ chính xác trung bình tương đương hoặc cao hơn với chỉ 1/2 đến 1/4 lượng tính toán suy luận so với mô hình dày đặc cơ sở, trong khi sử dụng bộ nhớ tương tự. Trong thử nghiệm thực tế, MobileMoE-S trên iPhone 16 Pro (backend GPU/MLX) tăng tốc độ đáng kể, tăng tốc lên đến 3.8 lần trong giai đoạn đầu vào. MobileMoE là một loại mô hình ngôn ngữ MoE được thiết kế cho triển khai trên thiết bị đầu cuối, thay thế các lớp feed-forward dày đặc bằng các lớp MoE trong kiến trúc Transformer decoder-only. Quy trình đào tạo bao gồm bốn giai đoạn: tiền đào tạo, đào tạo trung gian, tinh chỉnh có giám sát và đào tạo nhận thức lượng tử hóa. Các thí nghiệm cho thấy cấu hình tối ưu sử dụng 8 chuyên gia (E=8), độ hạt chuyên gia 8 (g=8), với một chuyên gia được chia sẻ. MobileMoE thiết lập một biên giới Pareto mới cho LLM trên thiết bị đầu cuối, cân bằng tốt hơn giữa độ chính xác và chi phí suy luận. Sau khi lượng tử hóa INT4, mô hình vẫn duy trì tính cạnh tranh. Khi triển khai trên Samsung Galaxy S25 và iPhone 16 Pro, MobileMoE-S cho thấy tốc độ nhanh hơn đáng kể và mức sử dụng bộ nhớ thấp hơn so với các mô hình so sánh. Hướng phát triển trong tương lai bao gồm củng cố quá trình hậu đào tạo, mở rộng đa phương thức và tối ưu hóa việc triển khai trên NPU di động để tiếp tục cải thiện hiệu quả.

marsbit06/01 06:11

Chạy MoE trên điện thoại? Meta đề xuất MobileMoE, iPhone 16 Pro tăng tốc đến 3.8 lần

marsbit06/01 06:11

Nghiên cứu mới của AMD đảo lộn nhận thức: FP4 huấn luyện không ổn định, nguyên nhân không phải do tính ngẫu nhiên không đủ

Bài viết nghiên cứu mới của AMD và Đại học Bang Pennsylvania lật ngược nhận thức trước đây về việc huấn luyện mô hình lớn bằng định dạng FP4. Trái với suy nghĩ phổ biến rằng sự bất ổn đến từ tính ngẫu nhiên không đủ, nghiên cứu xác định nguyên nhân chính là lỗi cấu trúc từ việc thu nhỏ tỷ lệ (micro-scaling) tích lũy và khuếch đại dọc theo đường truyền gradient trọng số (Wgrad) nhạy cảm. Các thí nghiệm kiểm soát trên phần cứng AMD Instinct MI355X với định dạng MXFP4 cho thấy: khi thay thế phép tính Wgrad từ FP8 sang MXFP4, chất lượng hội tụ suy giảm đáng kể. Các chiến lược thêm tính ngẫu nhiên như làm tròn ngẫu nhiên hoặc phép xoay Hadamard ngẫu nhiên thậm chí còn gây ra phân kỳ. Ngược lại, phép xoay Hadamard xác định đã ổn định quá trình huấn luyện bằng cách áp dụng cùng một phép biến đổi mỗi bước, giữ cho mẫu lỗi nhất quán và tránh tích lũy. Với giải pháp này, nghiên cứu đã hoàn thành việc tiền huấn luyện đầy đủ cho Llama 3.1-8B trên C4, đạt được tốc độ huấn luyện nhanh hơn 9-10% so với đường cơ sở FP8, với chi phí token chỉ tăng thêm 8-9%. Đây là minh chứng đầu tiên về việc huấn luyện mô hình lớn hoàn chỉnh bằng FP4 trên phần cứng nguyên bản. Nghiên cứu có ý nghĩa quan trọng: (1) Cung cấp chẩn đoán nguyên nhân rõ ràng, hướng dẫn tập trung vào lỗi cấu trúc thay vì tính ngẫu nhiên; (2) Mở rộng phạm vi sử dụng FP4 từ suy luận sang huấn luyện, tiềm năng tăng gấp đôi hiệu suất phần cứng hiện có; (3) Dựa trên tiêu chuẩn mở OCP Microscaling, đảm bảo khả năng di chuyển giữa các nền tảng phần cứng khác nhau.

marsbit05/27 06:21

Nghiên cứu mới của AMD đảo lộn nhận thức: FP4 huấn luyện không ổn định, nguyên nhân không phải do tính ngẫu nhiên không đủ

marsbit05/27 06:21

活动图片