DeepSeek Công Nghệ Mới Được Chuyển Sang Chip Apple, Mô Hình Lớn Chạy Cục Bộ Trên Mac Tăng Tốc 60%
Dự án mã nguồn mở mlx-dspark đã thành công trong việc triển khai công nghệ suy đoán DSpark của DeepSeek cho chip Apple, giúp tăng tốc đáng kể việc chạy mô hình ngôn ngữ lớn (LLM) cục bộ trên máy Mac. Cụ thể, trên máy Mac sử dụng chip M4 Pro, tốc độ sinh văn bản của mô hình Gemma-4 12B tăng khoảng 1.6 lần (từ 18.4 lên ~30 token/giây) và Qwen3-4B tăng khoảng 1.4 lần (từ 52.9 lên ~73 token/giây). Điểm đáng chú ý là phiên bản này đảm bảo đầu ra hoàn toàn giống hệt mô hình gốc, cả ở chế độ giải mã tham lam và lấy mẫu nhiệt độ.
Dự án do kỹ sư Abdur Rahim phát triển, tối ưu hóa quy trình kiểm tra ứng viên token trong framework MLX và lượng tử hóa mô hình thảo (draft model) xuống 4-bit. Không dừng lại ở DSpark, mlx-dspark còn tích hợp giải pháp suy đoán DFlash từ z-lab, cho phép linh hoạt chuyển đổi giữa hai phương pháp: DFlash phù hợp cho các tác vụ mã hóa và toán học với tốc độ tăng ~2.1 lần, trong khi DSpark hiệu quả hơn trong các cuộc trò chuyện mở. Điều này cho phép người dùng chạy cả hai loại tác vụ trong cùng một gói phần mềm.
marsbit07/03 12:24