Bị giới hạn về năng lực tính toán, DeepSeek-V4 dựa vào đâu để mã nguồn mở?
Vào ngày 24/4, DeepSeek chính thức ra mắt và mở nguồn mô hình DeepSeek-V4 với khả năng xử lý ngữ cảnh siêu dài lên đến 1 triệu token. Mặc dù bị giới hạn về năng lực tính toán cao cấp, DeepSeek vẫn đạt được hiệu suất ấn tượng thông qua tối ưu hóa kiến trúc, bao gồm cơ chế chú ý nén DSA và mô hình MoE với chỉ 13B tham số kích hoạt trên phiên bản Flash.
Phiên bản Pro với 1.6T tham số tổng nhưng chỉ kích hoạt 49B, thể hiện năng lực vượt trội trong lập trình và suy luận, sánh ngang các mô hình đóng hàng đầu. Trong khi đó, phiên bản Flash tối ưu chi phí, phù hợp với các doanh nghiệp vừa và nhỏ. DeepSeek cũng hợp tác chặt chẽ với các nhà sản xuất chip Trung Quốc như Huawei và Cambricon để tối ưu hóa hiệu năng trên phần cứng nội địa.
Dù đối mặt với thách thức về nhân sự và cạnh tranh thị trường, DeepSeek vẫn khẳng định được năng lực kỹ thuật và chiến lược phát triển bền vững, hướng đến một hệ sinh thái AI thực tế và tiết kiệm tài nguyên tính toán.
marsbit04/26 00:30