DeepSeek Công Nghệ Mới Được Chuyển Sang Chip Apple, Mô Hình Lớn Chạy Cục Bộ Trên Mac Tăng Tốc 60%

marsbitXuất bản vào 2026-07-03Cập nhật gần nhất vào 2026-07-03

Tóm tắt

Dự án mã nguồn mở mlx-dspark đã thành công trong việc triển khai công nghệ suy đoán DSpark của DeepSeek cho chip Apple, giúp tăng tốc đáng kể việc chạy mô hình ngôn ngữ lớn (LLM) cục bộ trên máy Mac. Cụ thể, trên máy Mac sử dụng chip M4 Pro, tốc độ sinh văn bản của mô hình Gemma-4 12B tăng khoảng 1.6 lần (từ 18.4 lên ~30 token/giây) và Qwen3-4B tăng khoảng 1.4 lần (từ 52.9 lên ~73 token/giây). Điểm đáng chú ý là phiên bản này đảm bảo đầu ra hoàn toàn giống hệt mô hình gốc, cả ở chế độ giải mã tham lam và lấy mẫu nhiệt độ. Dự án do kỹ sư Abdur Rahim phát triển, tối ưu hóa quy trình kiểm tra ứng viên token trong framework MLX và lượng tử hóa mô hình thảo (draft model) xuống 4-bit. Không dừng lại ở DSpark, mlx-dspark còn tích hợp giải pháp suy đoán DFlash từ z-lab, cho phép linh hoạt chuyển đổi giữa hai phương pháp: DFlash phù hợp cho các tác vụ mã hóa và toán học với tốc độ tăng ~2.1 lần, trong khi DSpark hiệu quả hơn trong các cuộc trò chuyện mở. Điều này cho phép người dùng chạy cả hai loại tác vụ trong cùng một gói phần mềm.

Keresi gửi từ Ốc Phi TựQbitAI | Công chúng hào QbitAI

DSpark vừa mới được mở nguồn một tuần, đã được chuyển sang máy tính Apple.

Phiên bản chuyển đổi có tên là mlx-dspark, chạy hai mô hình là Gemma-4 12B và Qwen3-4B.

Sau khi cài đặt, tốc độ tạo của hai mô hình này trên Mac lần lượt tăng 1.6 lần và 1.4 lần.

Khó hơn nữa, nó đã làm được một điều mà hầu hết các phiên bản chuyển đổi không làm được - đầu ra giống hệt từng byte so với mô hình gốc, không sai một chữ.

Tức là, tốc độ đã được cải thiện, chất lượng không hề giảm.

Người thực hiện là Abdur Rahim, một kỹ sư làm các dự án mã nguồn mở trong thời gian rảnh, phiên bản gốc Mac đầu tiên của DSpark kể từ khi được mở nguồn đều do một mình anh ta thực hiện.

Chạy mô hình lớn trên máy tính Apple, tăng tốc 60%

Đối với DSpark do DeepSeek mở nguồn vào ngày 27 tháng 6, số liệu chính thức cho thấy có thể tăng tốc từ 60% đến 85% trong kịch bản máy chủ.

Tuy nhiên, công nghệ này lúc đó chỉ có phiên bản triển khai cho GPU trong trung tâm dữ liệu, không có phiên bản tương thích cho chip Apple.

mlx-dspark là phiên bản gốc đầu tiên dành cho chip Apple của công nghệ này.

Tư tưởng của DSpark là bố trí một mô hình nhỏ hơn để hỗ trợ mô hình mục tiêu, mô hình nhỏ này trước tiên đưa ra một lúc vài từ ứng viên, sau đó mô hình mục tiêu kiểm tra một lượt, từ nào đúng thì nhận, từ nào sai thì trả lại để đoán lại.

Chi phí của bước này trên trung tâm dữ liệu và máy tính Apple là khác nhau.

Trên GPU của trung tâm dữ liệu, việc kiểm tra một loạt từ ứng viên giống như thuê xe cả chuyến, giá cố định dù có bao nhiêu người, quá trình giải mã vốn đã là nút cổ chai về bộ nhớ, kiểm tra thêm vài từ hầu như không tốn thêm thời gian.

Chip Apple giống như taxi tính theo đồng hồ, càng kiểm tra nhiều từ ứng viên thì đồng hồ càng nhảy nhanh.

Rahim đã thực tế kiểm tra, Gemma-4 12B mỗi khi kiểm tra thêm một token, phải mất thêm khoảng 14 mili giây. Anh ta đã tính toán chi phí này thành một mô hình chi phí, kết luận rằng, giới hạn tốc độ trên chip Apple là khoảng 2.2 lần.

Tóm lại, Rahim đã chuyển mô hình nhỏ hỗ trợ này từ checkpoint của HuggingFace, lần lượt bố trí cho hai mô hình mục tiêu Gemma-4 12B và Qwen3-4B sử dụng.

Anh ta còn xây dựng lại quy trình kiểm tra trong khung MLX, lượng tử hóa trọng số thành 4-bit.

Kết quả là, trên M4 Pro, so với công cụ MLX chính thức của Apple, tốc độ tạo của Gemma-4 12B tăng từ 18.4tok/s lên khoảng 30tok/s, gấp khoảng 1.6 lần; Qwen3-4B tăng từ 52.9tok/s lên khoảng 73tok/s, gấp khoảng 1.4 lần.

Ngoài ra, trong mlx-dspark, Rahim còn làm một việc mà hầu hết các công việc chuyển đổi không làm.

Phiên bản chuyển đổi cũng có thể phục hồi độ chính xác cao

Hầu hết các phiên bản chuyển mô hình lớn về chạy cục bộ chỉ hỗ trợ giải mã tham lam, tức là mỗi bước đều chọn từ có xác suất cao nhất.

Rahim trong mlx-dspark đã triển khai phương pháp lấy mẫu nhiệt độ được mô tả trong bài báo DSpark gốc, mô hình nháp đưa ra từ ứng viên, xác suất chấp nhận là min(1, p/q), phần không vượt qua được lấy mẫu lại từ phần dư.

Anh ta tự mình kiểm tra, đầu ra chạy qua quy trình này bằng chính xác với phân bố mà mô hình mục tiêu sẽ đưa ra ở cùng nhiệt độ, không phải là phiên bản xấp xỉ giảm chất lượng.

Hầu hết các phương pháp giải mã đầu cơ chỉ làm phiên bản tham lam, vì việc kiểm tra tính chính xác của chế độ tham lam rất đơn giản, chỉ cần so sánh từng chữ.

Bước Rahim làm thêm là tự mình kiểm tra lại phân bố đầu ra chạy ở chế độ lấy mẫu, xác nhận không bị biến dạng.

Mô hình mục tiêu chịu trách nhiệm kiểm tra nên sử dụng độ chính xác nào, là một lỗi anh ta tự mình thử nghiệm ra.

Nếu mô hình nhỏ được bố trí với mô hình mục tiêu cơ bản chưa qua tinh chỉnh hướng dẫn, từ ứng viên đưa ra chỉ có 47% vượt qua kiểm tra; đổi sang phiên bản tinh chỉnh hướng dẫn tương ứng, tỷ lệ này tăng lên 82%.

Anh ta cũng đã thử đổi mô hình mục tiêu sang độ chính xác bf16, chi phí kiểm tra tăng nhiều hơn so với tỷ lệ vượt qua, trái lại còn chậm hơn, vì vậy để mô hình mục tiêu mặc định ở 8-bit là có lợi nhất.

Mô hình nhỏ chịu trách nhiệm chạy trước đưa ra từ ứng viên, sử dụng một độ chính xác khác.

Bản thân mô hình nháp đã được anh ta nén, sau khi lượng tử hóa 4-bit chỉ còn 1.8GB, cài vào bộ nhớ hoàn toàn không có áp lực, chạy vẫn không mất dữ liệu.

Kết quả là, DSpark không chỉ thực hiện tăng tốc, mà còn thực sự tái hiện được mức tăng tỷ lệ chấp nhận từ 16% đến 18% được đề cập trong bài báo, trên thiết bị đầu cuối.

DFlash cũng được kết nối, nhiệm vụ mã nguồn nhanh hơn

Sau khi bài tweet được đăng, phần bình luận có một bình luận, một trong những tác giả của bài báo DFlash Jian Chen hỏi, có thể thử mô hình của nhóm họ không.

DFlash là một phương án giải mã đầu cơ khác được đề xuất trong bài báo do z-lab công bố vào tháng 5 năm nay, trưởng nhóm tác giả Zhijian Liu, trợ lý giáo sư UCSD, đồng thời là nhà khoa học nghiên cứu của NVIDIA.

Tư tưởng của DFlash không giống với DSpark, nó sử dụng một lần "khuyếch tán khối" song song để khử nhiễu cả một khối 16 token, chứ không phải như DSpark từng bước đoán với quan hệ phụ thuộc.

Rahim nhanh chóng hành động.

Anh ta sử dụng kịch bản chuyển đổi do Jian tự viết, kết nối gemma4-12B-it-DFlash do z-lab phát hành với mô hình mục tiêu Gemma-4 của mlx-vlm, trên cùng một máy Mac, chạy một vòng so sánh trực tiếp với DSpark mà anh ta vừa kiểm tra xong.

Trong nhiệm vụ mã nguồn và toán học, độ dài chấp nhận của DFlash giải mã cả khối có thể đạt 5.95 đến 6.20, tốc độ khoảng 36tok/s, đạt khoảng 2.1 lần, vượt qua DSpark.

Tuy nhiên, DFlash một lần phải đưa ra cả một khối 16 token, nhưng mô hình mục tiêu chưa chắc đã công nhận toàn bộ, thực tế chỉ một phần trong đó vượt qua kiểm tra, trong ngành gọi đây là "độ dài chấp nhận", không phải lúc nào cũng có thể lấp đầy cả 16.

Vì vậy, trong các tình huống trò chuyện mở nội dung khó dự đoán, độ dài chấp nhận không tăng lên, khối không được lấp đầy, ưu thế của DFlash không phát huy được.

Markov head của DSpark chính là để đối phó với cùng một vấn đề này, song song đưa ra cả một khối từ, càng về sau các vị trí được tính toán độc lập, dễ không phù hợp với nhau, Markov head thêm một lớp quan hệ phụ thuộc giữa các vị trí này, chuyên sửa chữa vấn đề này.

Kết quả là, trong tình huống trò chuyện, DSpark trái lại nhanh hơn DFlash.

Và sau đó, mlx-dspark v0.0.3 được cập nhật, chính thức kết nối DFlash gốc của z-lab vào gói, còn thêm một tham số, có thể điều chỉnh thủ công độ dài khối hiệu quả của DFlash ngắn hơn, tình huống trò chuyện sử dụng khối ngắn, tình huống mã nguồn và toán học vẫn sử dụng khối đầy 16.

Sau đó, cùng một máy Mac, cùng một gói, có thể đồng thời hoàn thành nhiệm vụ trò chuyện và mã nguồn, toán học, không cần phải di chuyển qua lại giữa hai dự án DSpark và DFlash nữa.

Rahim nói trong bài tweet, phương pháp tương tự, sử dụng trên mô hình nháp Qwen3-8B và 14B lớn hơn cũng có thể chạy thông.

Tài liệu tham khảo:[1]https://x.com/_ARahim_/status/2072021710602432577[2]https://github.com/ARahim3/mlx-dspark

Bài viết này từ công chúng hào "QbitAI", tác giả: Quan tâm khoa học công nghệ tiên phong

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

Qmlx-dspark là gì và nó đạt được những kết quả nào khi chạy trên máy Mac?

Amlx-dspark là phiên bản chuyển đổi đầu tiên của công nghệ DSpark cho chip Apple. Khi chạy trên Mac, nó giúp tăng tốc độ tạo văn bản của mô hình Gemma-4 12B lên khoảng 1,6 lần (từ 18,4 tok/s lên ~30 tok/s) và mô hình Qwen3-4B lên khoảng 1,4 lần (từ 52,9 tok/s lên ~73 tok/s) trên chip M4 Pro, đồng thời vẫn đảm bảo kết quả đầu ra giống hệt mô hình gốc.

QPhương pháp 'suy đoán giải mã' (speculative decoding) mà DSpark sử dụng hoạt động như thế nào?

ADSpark sử dụng phương pháp 'suy đoán giải mã': đầu tiên, một mô hình nhỏ hơn (mô hình thảo) sẽ dự đoán một số từ ứng viên (tokens). Sau đó, mô hình mục tiêu chính sẽ kiểm tra và xác nhận hàng loạt các từ này cùng lúc. Những từ đúng được chấp nhận, những từ sai bị loại bỏ và mô hình thảo sẽ dự đoán lại. Cách này tiết kiệm thời gian so với việc mô hình chính tự sinh từng từ một.

QTại sao việc triển khai mlx-dspark của Abdur Rahim được coi là có độ chính xác cao?

Amlx-dspark được đánh giá cao về độ chính xác vì hai lý do chính: 1) Nó triển khai đầy đủ phương pháp lấy mẫu theo nhiệt độ (temperature sampling) như trong bài báo gốc, không chỉ là giải mã tham lam, đảm bảo phân phối đầu ra chính xác. 2) Đầu ra của nó khớp từng byte với mô hình gốc, không có sự khác biệt nào, điều mà nhiều bản chuyển đổi khác không đạt được.

QDFlash khác với DSpark như thế nào và hiệu quả ra sao trong các tình huống khác nhau?

ADFlash khác DSpark ở cơ chế: nó tạo ra một khối 16 token song song trong một lần 'khử nhiễu khối', thay vì dự đoán từng token có phụ thuộc như DSpark. Trong các nhiệm vụ mã hóa và toán học có cấu trúc, DFlash nhanh hơn (đạt tốc độ ~36 tok/s, ~2,1x). Tuy nhiên, trong hội thoại mở (chat), việc dự đoán cả khối token khó khăn hơn nên tỷ lệ chấp nhận thấp, khiến DSpark lại trở nên hiệu quả hơn.

QAbdur Rahim đã tối ưu hóa các mô hình như thế nào về mặt lượng tử hóa và độ chính xác để đạt hiệu suất tốt nhất?

AAbdur Rahim đã tối ưu hóa bằng cách: 1) Lượng tử hóa trọng số của mô hình mục tiêu xuống 8-bit để cân bằng giữa tốc độ và độ chính xác khi xác minh. 2) Lượng tử hóa mô hình thảo (draft model) xuống 4-bit, giảm kích thước chỉ còn 1,8GB để chạy nhanh và tiết kiệm bộ nhớ mà vẫn không mất mát chất lượng. 3) Sử dụng phiên bản mô hình mục tiêu đã được tinh chỉnh hướng dẫn để tỷ lệ chấp nhận token dự đoán cao hơn (82% so với 47% của bản cơ bản).

Nội dung Liên quan

Phantom chấm dứt hỗ trợ Sui khi mạng lưới đang gặp khó khăn trong việc phục hồi vị thế

Ví Phantom sẽ ngừng hỗ trợ blockchain Sui vào ngày 24/9, yêu cầu người dùng chuyển tài sản $SUI trước thời hạn. Người dùng có hai lựa chọn: chuyển đổi $SUI sang wrapped $SUI trên Solana thông qua Phantom (miễn phí đến hạn) hoặc sử dụng cụm từ khôi phục để truy cập cùng tài sản trên ví khác hỗ trợ Sui, như ví Slush được đề xuất. Thông báo này diễn ra trong bối cảnh Sui suy giảm mạnh: tổng giá trị locked (TVL) trong DeFi giảm từ khoảng 2 tỷ USD đầu năm 2026 xuống dưới 1 tỷ USD, và giá $SUI hiện khoảng 0,83 USD, thấp hơn nhiều so với mức đỉnh 5,36 USD hồi tháng 1/2025. Việc Phantom hủy hỗ trợ cũng diễn ra sau khi họ công bố ngừng hỗ trợ mạng Monad vào cuối tháng 8, cho thấy xu hướng thu hẹp danh mục blockchain đa mạng của ví này. Dù được khởi động với nhiều kỳ vọng vào đầu năm 2025, sự hợp tác giữa Phantom và Sui đã kết thúc sớm. Cả hai bên mô tả đây là quyết định chung và có thể tìm kiếm cơ hội hợp tác khác trong tương lai. Sự kiện này làm nổi bật thách thức về sự phân mảnh trong hệ sinh thái blockchain và việc thu hút, giữ chân người dùng.

cryptonews.ru12 phút trước

Phantom chấm dứt hỗ trợ Sui khi mạng lưới đang gặp khó khăn trong việc phục hồi vị thế

cryptonews.ru12 phút trước

Đồng tiền mã hóa Gram giảm giá sau các báo cáo về cáo buộc chống lại Pavel Durov

Tiền mã hóa Gram đã giảm giá sau khi có thông tin về cáo buộc của Cơ quan An ninh Liên bang Nga (FSB) nhằm vào nhà sáng lập Telegram Pavel Durov, với tội danh hỗ trợ khủng bố. Tính đến 12:06 giờ Moscow, giá token GRAM giảm 2,29%, xuống còn 1,42 USD (khoảng 111,75 RUB). GRAM ban đầu được thiết kế làm token cho dự án blockchain TON của Telegram. Tuy nhiên, sau các khiếu nại từ Ủy ban Chứng khoán và Giao dịch Hoa Kỳ (SEC) và áp lực pháp lý, việc phát hành Gram ban đầu đã bị dừng lại. Sự phát triển sau đó chuyển hướng sang The Open Network và token Toncoin. Mặc dù vậy, tên Gram và Toncoin vẫn thường được nhắc đến cùng nhau, khiến nhà đầu tư cần phân biệt rõ ràng. Nguyên nhân chính khiến dự án Gram bị đình chỉ là do các vấn đề pháp lý liên quan đến việc phát hành và bán token. Biến động giá của các tài sản như GRAM không chỉ phụ thuộc vào thị trường chung mà còn chịu ảnh hưởng bởi các sự kiện pháp lý và tin tức xoay quanh Telegram, Pavel Durov và hệ sinh thái TON. Phản ứng của thị trường lần này cho thấy mối liên hệ giữa token và người sáng lập. Tin tức về cáo buộc đã khiến GRAM mất giá khoảng 2%, phản ánh sự nhạy cảm của tài sản này với các yếu tố tin tức. Về mặt pháp lý, luật sư Alexander Benkhin cho rằng Pavel Durov có thể hợp tác với FSB để giảm thiểu rủi ro tại Nga. Ông Durov cũng được bảo vệ bởi quyền công dân Pháp và Các Tiểu vương quốc Ả Rập Thống nhất - những quốc gia không dẫn độ công dân của mình. Bối cảnh chính trị cũng gia tăng sức ép, khi một nghị sĩ Nga cảnh báo Telegram có nguy cơ bị coi là nguồn tài trợ khủng bố tại Nga, với cáo buộc rằng nền tảng này đã bị lợi dụng cho các hoạt động tuyển mộ và khủng bố.

cryptonews.ru14 phút trước

Đồng tiền mã hóa Gram giảm giá sau các báo cáo về cáo buộc chống lại Pavel Durov

cryptonews.ru14 phút trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua ONE

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua Harmony (ONE) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua Harmony (ONE) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ Harmony (ONE) của BạnSau khi mua Harmony (ONE), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch Harmony (ONE)Giao dịch Harmony (ONE) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 887Xuất bản vào 2024.12.12Cập nhật vào 2026.06.02

Làm thế nào để Mua ONE

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của ONE (ONE) được trình bày dưới đây.

活动图片