Vào chiều ngày 31 tháng 7, Công nghệ Kỹ thuật Phoenix Net tra cứu trang web chính thức của DeepSeek và phát hiện ra rằng, phiên bản API chính thức của DeepSeek-V4-Flash đã được đưa lên mạng để thử nghiệm công khai. Khác với logic phân tầng "Pro mạnh, Flash yếu" trước đây, lần cập nhật này đã giải phóng một tín hiệu đáng chú ý - hiệu suất của phiên bản chính thức Flash trong nhiều bài kiểm tra chuẩn Agent đã tiến gần hoặc thậm chí vượt qua mức của phiên bản xem trước V4-Pro ba tháng trước.

Nhật ký cập nhật chính thức cho thấy, phiên bản chính thức V4-Flash đạt 82.7 điểm trên Terminal Bench 2.1, NL2Repo 54.2 điểm, Cybergym 76.7 điểm, Toolathlon verified 70.3 điểm. Trong khi đó, phiên bản xem trước V4-Pro đạt 67.9 điểm trên Terminal Bench 2.0.

Cần phải giải thích rằng, Terminal Bench 2.0 và 2.1 không phải là cùng một phiên bản bộ kiểm tra, việc so sánh trực tiếp không hoàn toàn công bằng. Nhưng một phiên bản nhẹ với chỉ 13 tỷ tham số kích hoạt, lại chạy ra điểm số như vậy về khả năng Agent, đang cho thấy rằng không gian tối ưu hóa trong giai đoạn huấn luyện sau (post-training) có thể có hiệu ứng đòn bẩy mạnh hơn so với việc chỉ đơn thuần chất đống tham số.
Ngoài ra, DeepSeek cũng đặc biệt nói rõ rằng thử nghiệm công khai hiện tại chỉ giới hạn ở API, App và phiên bản web tạm thời chưa thể trải nghiệm các khả năng mới nhất. Phiên bản chính thức DeepSeek-V4-Pro sẽ được phát hành sớm nhất có thể.
“Chỉ tiến hành huấn luyện sau (post-training) lại”
Phía chính thức DeepSeek cho biết trong nhật ký cập nhật, "Cấu trúc mô hình, kích thước của DeepSeek-V4-Flash-0731 vẫn giữ nguyên như DeepSeek-V4-Flash-preview, chỉ tiến hành lại việc huấn luyện sau (post-training)."
Theo báo cáo kỹ thuật chính thức của DeepSeek, V4-Flash có tổng số tham số 284 tỷ, tham số kích hoạt 13 tỷ; V4-Pro có tổng số tham số 1.6 nghìn tỷ, tham số kích hoạt 49 tỷ. Hai bên chênh lệch về quy mô mô hình một bậc. Nếu Flash có thể thông qua huấn luyện sau để đưa khả năng Agent lên gần mức của Pro, điều đó có nghĩa là đối với các nhiệm vụ cụ thể, quy mô mô hình không phải là yếu tố quyết định - trọng số của phương pháp huấn luyện và chất lượng dữ liệu đang gia tăng.
Phía chính thức cũng đặc biệt ghi chú rằng, trong các bài kiểm tra chuẩn công khai lần này, nhiệm vụ Code Agent đã sử dụng chế độ tối giản (极简模式) của DeepSeek Harness làm framework để kiểm tra, mức max, topp=0.95, temperature=1.0. Chi tiết này ám chỉ, DeepSeek có thể đã tối ưu hóa có mục tiêu ở cấp độ framework Agent, chứ không chỉ là sự cải thiện của bản thân mô hình.
Đây cũng là lần đầu tiên Harness tự nghiên cứu chính thức của DeepSeek xuất hiện với tên gọi chính thức. Trước đó, Liang Wenfeng từng so sánh con đường thực hiện AGI với việc leo cầu thang: mô hình ngôn ngữ là bậc đầu tiên, năm ngoái giải quyết CoT (Chuỗi suy nghĩ), bậc thang năm nay là Agent, và vấn đề phải giải quyết sau Agent là học tập liên tục (Continuous Learning) - để mô hình tích lũy kinh nghiệm lâu dài như con người, chứ không phải mỗi lần đều phải được đưa vào ngữ cảnh đầy đủ mới có thể làm việc. Sau đó nữa, mới là "Điểm kỳ dị" (Singularity) lặp lại tự thân và trí tuệ thể hiện (Embodied Intelligence). "
"AI hiện nay không thiếu gu thẩm mỹ và trực giác, nó thiếu khả năng học tập liên tục" ông nói, "Nhà đầu tư nhìn vào Agent, chúng tôi nhìn vào cách giải quyết việc học."
Học tập liên tục nghe có vẻ là đề tài cấp độ mô hình, nhưng điểm rơi kỹ thuật của nó lại chính xác nằm ở Harness. Đội ngũ Agent Harness của DeepSeek được thành lập vào tháng 3 năm nay, người chỉ huy là Cui Tianyi, sinh năm 90, xuất thân từ khoa máy tính Đại học Chiết Giang, nắm giữ 6 huy chương vàng ACM khu vực châu Á, từng làm việc 9 năm tại công ty định lượng hàng đầu Jane Street, tháng 3 năm nay gia nhập DeepSeek, sau đó vào tháng 5 đã tích cực chiêu mộ nhân tài.
Được tiết lộ, kế hoạch Harness của DeepSeek dự kiến ra mắt đồng thời khi phiên bản chính thức V4 lên sóng. Ngoài ra, theo DeepSeek cho biết ở cuối nhật ký, "Phiên bản chính thức DeepSeek-V4-Pro sẽ được phát hành sớm nhất có thể."
Một cuộc đối đầu trực diện ở cấp độ hệ sinh thái
Nếu như cạnh tranh mô hình lớn năm 2023 là "tranh giành năng lực tổng quát", năm 2024 là "tranh giành ngữ cảnh dài", thì từ khóa của năm 2026, không còn nghi ngờ gì nữa, chính là Agent.
Khả năng Agent - tức khả năng mô hình tự lập kế hoạch, gọi công cụ, thực hiện nhiệm vụ phức tạp - đang trở thành thước đo mới để đánh giá sức mạnh của mô hình lớn. Từ Terminal Bench (thao tác thiết bị đầu cuối), NL2Repo (tạo kho mã nguồn) đến Cybergym (nhiệm vụ an ninh mạng), SWE-bench (kỹ thuật phần mềm), một loạt các bài kiểm tra chuẩn Agent đang định nghĩa lại thế nào là một mô hình tốt.
Nhìn trên phạm vi toàn cầu, nhóm đầu tiên về khả năng Agent hiện vẫn do các gã khổng lồ mã nguồn đóng nắm giữ. Theo dữ liệu từ các nền tảng đánh giá của bên thứ ba như benchlm.ai, GPT-5.6 Sol, Claude Opus series đứng đầu trong hầu hết các bài kiểm tra chuẩn Agent. Trong hàng ngũ Trung Quốc, GLM, Qwen cũng đang đuổi theo rất nhanh.
Lần này DeepSeek đưa khả năng Agent của Flash lên cao đột phá, ý đồ chiến lược rất rõ ràng: dùng mô hình nhẹ có tỷ lệ hiệu suất/giá cao, cắt vào thị trường ứng dụng Agent khổng lồ.
Xét cho cùng, các tình huống Agent nhạy cảm với tốc độ suy luận và chi phí, cao hơn xa so với các tình huống đối thoại thuần túy. Một nhiệm vụ Agent cần gọi công cụ lặp đi lặp lại, suy luận nhiều vòng, nếu dùng mô hình flagship để chạy, chi phí có thể gấp vài lần thậm chí vài chục lần so với Flash. Nếu Flash có thể đạt mức "đủ dùng thậm chí dùng tốt" về khả năng Agent, lợi thế về tỷ lệ hiệu suất/giá của nó sẽ cực kỳ sát thương.
Hai bộ kiểm tra nội bộ mà phía chính thức công bố cũng có mục tiêu rõ ràng. DSBench-FullStack (bộ kiểm tra phát triển toàn phần nội bộ) đạt 68.7 điểm, DSBench-Hard (bộ kiểm tra vấn đề khó Coding Agent nội bộ) đạt 59.6 điểm. Điều này xác nhận từ góc độ khác định vị của DeepSeek - biến Flash thành lựa chọn nền tảng hàng đầu cho nhà phát triển và ứng dụng Agent.
Một cuộc chiến ngầm về hệ sinh thái cũng đang lặng lẽ bắt đầu, phiên bản chính thức V4-Flash hỗ trợ nguyên sinh định dạng API Responses và được điều chỉnh có mục tiêu cho Codex.
Responses API là định dạng API thế hệ mới được OpenAI thúc đẩy mạnh mẽ, so với Chat Completions truyền thống, nó phù hợp hơn với các tình huống Agent - hỗ trợ gọi công cụ linh hoạt hơn, tương tác đa vòng phức tạp hơn và kiểm soát đầu ra chi tiết hơn.
Việc DeepSeek hỗ trợ nguyên sinh định dạng này có nghĩa là các nhà phát triển có thể di chuyển ứng dụng Agent được phát triển dựa trên hệ sinh thái OpenAI sang DeepSeek với chi phí thấp hơn. Đây sẽ là một cuộc đối đầu trực diện ở cấp độ hệ sinh thái giữa hai bên.
Việc điều chỉnh cho Codex lại nhắm vào kịch bản dọc là tạo mã và phát triển phần mềm. Codex là mô hình của OpenAI hướng đến lĩnh vực mã nguồn, việc DeepSeek điều chỉnh có mục tiêu, đồng nghĩa với việc trực tiếp thách thức trên lĩnh vực thế mạnh truyền thống của OpenAI.
Nhìn chung các động thái này, tham vọng của DeepSeek không chỉ dừng lại ở việc trở thành một "sản phẩm thay thế rẻ tiền", mà là muốn thiết lập vị trí hệ sinh thái của riêng mình trong thời đại Agent.
Sau 50 tỷ USD gọi vốn: Cửa sổ thời gian dưới định giá cao
Lần cập nhật này, cách DeepSeek hoàn thành vòng gọi vốn bên ngoài đầu tiên chưa đầy hai tháng.
Khoảng hơn một tháng trước, DeepSeek hoàn thành vòng gọi vốn bên ngoài đầu tiên sau gần ba năm thành lập, tổng số tiền hơn 50 tỷ NDT, lập kỷ lục về số tiền gọi vốn một vòng trong ngành AI Trung Quốc, định giá sau đầu tư khoảng 52 tỷ USD (khoảng 350 tỷ NDT). Dàn nhà đầu tư bao gồm các gã khổng lồ công nghiệp như Tencent, CATL, JD.com, và nhiều quỹ công nghiệp tài sản nhà nước.

Giữa tháng 7, DeepSeek có ý định thúc đẩy vòng gọi vốn tư nhân mới, định giá trước đầu tư khoảng 71 tỷ USD (tương đương khoảng 480 tỷ NDT), tăng khoảng 37% so với định giá 52 tỷ USD sau vòng gọi vốn đầu tiên. Từ 52 tỷ lên 71 tỷ, khoảng cách chưa đầy sáu tuần.
Đằng sau định giá cao, là sự công nhận của thị trường đối với năng lực kỹ thuật của DeepSeek, cũng là sự đặt cược vào triển vọng thương mại hóa của nó. Nhưng định giá cao đồng thời cũng có nghĩa là kỳ vọng cao, áp lực cao.
Theo nhiều phương tiện truyền thông đưa tin, người sáng lập DeepSeek Liang Wenfeng bản thân đã đóng góp khoảng 20 tỷ NDT trong vòng gọi vốn đầu tiên, thông qua cấu trúc đặc biệt nắm chắc quyền kiểm soát công ty. Người sáng lập xuất thân từ Huanfang Quantitative này, trước đây gần ba năm luôn kiên trì đầu tư bằng vốn tự có, giờ đây chuyển từ "không gọi vốn không lên sàn" sang tích cực đón nhận vốn, bản thân đã là một tín hiệu mạnh mẽ - DeepSeek đang tăng tốc lao về phía thương mại hóa và IPO.
Việc phiên bản chính thức Flash lên sóng, có lẽ có thể coi là sự hoàn thành kỹ thuật của DeepSeek dưới sự hỗ trợ của vốn. Nhưng thử thách thực sự vẫn còn ở phía sau: Liệu phiên bản chính thức Pro có thể ra mắt đúng hẹn không? Việc cải thiện khả năng Agent có thể chuyển hóa thành thu nhập thực tế không? Dưới sự kẹp kích của các gã khổng lồ như OpenAI, Anthropic, tuyến đường tỷ lệ hiệu suất/giá cao của DeepSeek sẽ phát huy lợi thế như thế nào?
Cánh màn chiến tranh Agent mới chỉ vừa mở ra. DeepSeek dùng một sự tiến hóa vượt bậc của mô hình nhẹ, đặt ra một câu hỏi mới cho ngành - khi lợi nhuận từ huấn luyện sau được khai thác đầy đủ, khi việc nâng cao hiệu quả bắt đầu bù đắp khoảng cách về tham số, logic cạnh tranh của mô hình lớn, có thể phải được viết lại.
Bài viết này từ tài khoản WeChat công cộng "Công nghệ Kỹ thuật Phoenix Net", tác giả: Công nghệ Kỹ thuật Phoenix Net








