Dự án tiềm năng nhất của DeepSeek ra mắt, mọi thứ đều có thể là plugin. Harness không muốn bắt chước ai, mà là trao quyền định nghĩa cho cộng đồng mã nguồn mở.
Vào tối ngày 13 tháng 8, DeepSeek chính thức lên tiếng, công bố hai thông tin quan trọng. Thứ nhất là DeepSeek V4 Pro phiên bản chính thức được phát hành và cập nhật đồng bộ trên APP, web và API. Người dùng có thể chọn chế độ "Chuyên gia" trên APP hoặc web để sử dụng mô hình V4 Pro chính thức hoàn toàn mới, tên mô hình API không thay đổi.
Thứ hai, nhóm " DeepSeek Harness" với avatar hình cá voi đen đã có bài viết đầu tiên, thông báo phiên bản xem trước cho nhà phát triển Harness chính thức ra mắt và mở mã nguồn theo giao thức MIT.
Như đã thông báo trước, phiên bản chính thức V4 Pro và Harness tự nghiên cứu chính thức cùng xuất hiện. Vì chúng tôi đã giới thiệu kỹ về V4 Pro trước đây, bài viết này sẽ tập trung phân tích tại sao DeepSeek Harness lại có điểm đáng chú ý.
Cũng như sau ngày hôm nay, DeepSeek có thể từ một công ty mô hình, trở thành một công ty khó định nghĩa hơn.
01
Cùng một mô hình, đổi vỏ ngoài như đổi một con người
Để hiểu tại sao Harness quan trọng, trước tiên phải hiểu một sự thật phản trực giác: Trong thời đại Agent, thứ quyết định một AI có thể làm việc hay không, không chỉ là mô hình.
Vào ngày 6 và 11 tháng 8, công ty công cụ Agent Composio đã thực hiện hai thử nghiệm thông qua các thí nghiệm để cố gắng chứng minh giá trị của Harness. Nhà nghiên cứu kết nối cùng một DeepSeek V4-Flash với tám Harness khác nhau, tức là hệ thống thực thi bọc bên ngoài mô hình, để chúng lần lượt hoàn thành ba mươi nhiệm vụ nhiều bước. Những nhiệm vụ này không phải là hỏi đáp, mà yêu cầu Agent vào các ứng dụng thực tế như Gmail, Google Calendar, GitHub, Slack, gọi công cụ và thay đổi trạng thái ứng dụng, mỗi nhiệm vụ chạy tối đa mười lăm phút, và chỉ được tính là thành công khi tất cả đều vượt qua kiểm tra.

Kết quả chênh lệch không nhỏ. Pi Agent hoàn thành nhiều nhất đã vượt qua hai mươi nhiệm vụ, OpenCode ít nhất chỉ vượt qua mười bốn; tổng cộng tám loại Harness chạy hai trăm bốn mươi lần, chỉ một trăm hai mươi chín lần thành công; trong ba mươi nhiệm vụ, chỉ có sáu nhiệm vụ được tất cả Harness hoàn thành. Về chi phí, Claude Code, Codex và DeepAgents cùng hoàn thành mười sáu nhiệm vụ, chi phí ước tính cho mỗi nhiệm vụ thành công lần lượt khoảng 0.195 USD, 0.081 USD và 0.045 USD. Cùng một mô hình, chênh nhau hơn bốn lần.

Điều này có nghĩa là, mô hình quy định giới hạn trên của khả năng, còn Harness quyết định cuối cùng giới hạn trên này có thể hiện thực hóa bao nhiêu, và cần bao nhiêu chi phí để hiện thực hóa. Một nhiệm vụ dài chạy xuống, hệ thống thực thi phải liên tục đưa ra phán đoán: giữ lại gì, loại bỏ gì trong ngữ cảnh, khi nào gọi công cụ nào, công cụ báo lỗi thì thử lại hay đổi đường, khi mô hình nói đã làm xong thì có tin không, có cần kiểm tra lại không. Bất kỳ bước nào xử lý không tốt, dù mô hình có đúng ý tưởng, cũng có thể thất bại khi thực sự sửa file, commit code.
Đáng chú ý là, đây là dự án cực hiếm mà DeepSeek mở nội bộ thử nghiệm trước khi ra mắt.
Nhiều nhà phát triển đã nhận được quyền nội bộ thử nghiệm Harness trước khi phát hành. Có người trong nội bộ thử nghiệm phát hiện, để cùng một V4-Flash hoàn thành cùng một trò chơi lần lượt trong DeepSeek Harness, Reasonix và Codex, sẽ cho ra kết quả hoàn toàn khác nhau. Điều này cho thấy, khi mô hình hoàn toàn giống nhau, công cụ, prompt, tổ chức ngữ cảnh và chiến lược thực thi mà hệ thống thực thi cung cấp, đủ để thay đổi đáng kể sản phẩm cuối cùng.
Đây chính là lý do DeepSeek coi trọng việc tự nghiên cứu Harness. Nội bộ DeepSeek từng cho rằng, Agent cần giải quyết vấn đề học tập liên tục, cuối cùng để AI đẩy nhanh nghiên cứu và phát triển AI. Nhìn theo hướng này, Harness không phải là một công cụ lập trình ngoại lai, mà là bàn làm việc để mô hình bước vào nhiệm vụ nghiên cứu và phát triển thực tế.
Ngoài ra, một công ty dựa vào giá thấp và khả năng mô hình để đứng vững, nếu việc giao nhiệm vụ, phản hồi thất bại và cổng vào nhà phát triển lâu dài phụ thuộc vào hệ thống của người khác, thì dù có lợi thế về giá cả, cũng không thể quyết định một nhiệm vụ cuối cùng đốt bao nhiêu Token, cần thử lại mấy lần, khi nào mới thực sự hoàn thành.
02
Mọi thứ đều là plugin, DeepSeek không làm sản phẩm thay thế của ai
Vậy rốt cuộc Harness là gì? Cách nói tiện lợi nhất trên thị trường là " DeepSeek phiên bản Claude Code". Nhưng những người dùng phiên bản nội bộ thử nghiệm đều cho rằng, định vị này không chính xác.
Theo tài liệu chính thức của DeepSeek , triết lý thiết kế cốt lõi của Harness là "Everything is a plugin" — mọi thứ đều là plugin. Nó được xây dựng dựa trên hệ thống plugin Cordis, mô hình, công cụ, kỹ năng, phiên làm việc, sandbox, lưu trữ, vòng lặp, lập lịch, giao diện người dùng, tất cả khả năng Agent đều được kết hợp bởi các plugin. Nhà phát triển không cần thay đổi mã nguồn Harness, mà có thể chọn, thay thế hoặc mở rộng bất kỳ khả năng nào trong cấu hình.

Đây không phải là cùng một cấp độ với plugin thông thường. Plugin của VS Code là thêm chức năng cho trình soạn thảo, plugin của Codex là thêm công cụ cho Agent; còn plugin của Harness có thể thay thế bộ não, hộp công cụ, quy tắc và cả khuôn mặt của Agent.
Theo tiết lộ của nhiều người tham gia nội bộ thử nghiệm, trong thời gian nội bộ thử nghiệm, các nhà phát triển đã "chơi điên cuồng" với việc làm plugin, "mọi người không chịu nội bộ thử nghiệm nghiêm túc nữa, mà chạy đi viết plugin", chỉ trong vài ngày đã xuất hiện hàng trăm plugin — có người trực tiếp sửa toàn bộ giao diện làm việc, có người dùng plugin thuần túy thực hiện "bộ nhớ dài hạn xuyên phiên cộng với tự tiến hóa nền", để mô hình định kỳ xem xét lại hồ sơ công việc của mình, nén kinh nghiệm tạm thời thành kiến thức lâu dài.
Người khác đánh giá rằng, quản trị cộng đồng mã nguồn mở cũng có thể là vấn đề khó khăn mà DeepSeek sắp phải đối mặt.
Một điểm thiết kế then chốt khác là khả năng truy xuất nguồn gốc. Harness sử dụng nhật ký phiên làm việc chỉ cho phép thêm vào (append-only), mọi thứ mô hình nhìn thấy — prompt hệ thống, chuỗi suy nghĩ, gọi công cụ và kết quả, lập lịch Agent con, mỗi lần tiêm ngữ cảnh đều được ghi lại đầy đủ. Nén ngữ cảnh không xóa lịch sử gốc, mà chỉ thay đổi biểu tượng mà mô hình nhìn thấy sau này bằng sự kiện thay thế. Nhà phát triển có thể truy xuất theo nguồn gốc trong chế độ xem Trajectory, hỗ trợ khôi phục, phân nhánh, truy xuất và phát lại. Tài liệu chính thức tóm tắt nguyên tắc này là "mô hình thấy được, tức đã ghi lại".
Đằng sau đó là tư duy hệ thống kỹ thuật điển hình. Theo báo cáo, người phụ trách nhóm DeepSeek Harness, Thôi Thiêm Dực, tốt nghiệp cử nhân khoa học máy tính tại Đại học Chiết Giang, từng làm việc chín năm tại tổ chức giao dịch định lượng Jane Street, tháng 3 năm 2026 gia nhập DeepSeek , tháng 5 Harness được lập dự án nội bộ. Rào cản cốt lõi của hệ thống giao dịch định lượng tần suất cao chưa bao giờ là chiến lược thông minh, mà là sự ổn định thực thi, phòng ngừa ngoại lệ, truy xuất nhật ký toàn trình và kiểm soát rủi ro trong môi trường cực kỳ phức tạp — đây chính là mảnh ghép thiếu nhất để AI Agent từ trình diễn bước vào sản xuất. Có nhà phát triển nội bộ thử nghiệm dùng từ "ổn định như chó già" để miêu tả biểu hiện của nó khi chạy nhiệm vụ dài: nhiệm vụ bị ngắt tự động lưu lại, lần sau chạy tiếp, không cần làm lại từ đầu.
Đáng chú ý là, Harness không tự đóng mình trong bức tường mô hình của DeepSeek . Nó mặc định hỗ trợ kết nối với gần bốn mươi mô hình lớn như Kimi , OpenAI, Anthropic, Google. Có thể các công ty khác có xu hướng làm một Agent có sẵn, nhưng DeepSeek Harness giống một bộ thành phần hơn, nhà phát triển có thể tự quyết định Agent nên là hình dạng gì, làm việc như thế nào.
Tất nhiên, phía chính thức vẫn giữ sự tỉnh táo. Thông báo cho biết, với tư cách là phiên bản xem trước sớm, "hiện tại vẫn còn nhiều chi tiết cần được cải thiện và trau chuốt, các plugin cốt lõi và giao diện cơ bản cũng sẽ được lặp lại nhanh chóng trong tương lai". Trên thực tế, một trong những phương tiện truyền thông nội bộ thử nghiệm này, Ifanr, đã cảm thán rằng khó tưởng tượng, với tốc độ nhanh nổi tiếng, thời gian chạy một nhiệm vụ lập trình của DeepSeek cũng có lúc lên đến hơn nửa giờ. Số phiên bản v0.1 cũng cho thấy, con cá voi đen này vừa mới nổi lên, còn lâu mới đến lúc bơi lượn thoải mái.

03
Từ bán Token đến giao kết quả, tham vọng của cá voi đen
Sự nổi lên của Harness ngầm hợp với một bước ngoặt của toàn ngành công nghiệp AI.
Trong vài năm qua, cạnh tranh của các công ty mô hình lớn tập trung vào quy mô tham số và điểm số benchmark. Nhưng bước vào năm 2026, khả năng cơ bản của các mô hình hàng đầu nhanh chóng hội tụ, khoảng cách giữa các câu hỏi đáp đơn lẻ không ngừng thu hẹp, trong khi cuộc chiến giá cả ngày càng gay gắt. Mô hình kinh doanh đơn thuần bán Token, trần nhìn thấy đã rõ. Ngành công nghiệp dần nhận ra, giá trị cốt lõi của ngành công nghiệp AI không nằm ở đầu ra mô hình, mà ở triển khai thực tế — cùng một lượng Token tiêu thụ, hỏi đáp tán gẫu giá trị ít ỏi, trong khi sửa một Bug, hoàn thành một lần phát triển chức năng, có thể tạo ra giá trị thương mại gấp nhiều lần.
Phát hành mới của DeepSeek , có nghĩa là từ bán sức mạnh tính toán chuyển sang giao kết quả. Trong mô hình cũ, khách hàng trả tiền theo lượng gọi Token, bất kể mô hình có thực sự giải quyết vấn đề hay không; trong mô hình mới, điểm neo thanh toán chuyển từ tiêu thụ bao nhiêu sức mạnh tính toán sang hoàn thành nhiệm vụ gì.
Lần phát hành DeepSeek Harness này, được các nhà phát triển đánh giá cao còn vì một lý do khác. DeepSeek không định nghĩa bản thân Agent, mà sử dụng khả năng lan tỏa của cộng đồng mã nguồn mở, để ủng hộ một phương án Harness. Đây là một con đường vĩ đại hơn, và cũng khó hơn.
Và, Harness đối mặt với thị trường trưởng thành đã được Claude Code và Codex xác minh, hai công ty sau dựa vào lặp lại mô hình và tài nguyên thương mại của Anthropic và OpenAI, lợi thế tiên phong rõ ràng. Sau khi mở mã nguồn, hệ sinh thái plugin có thể tự phát triển thịnh vượng không, nhà phát triển có sẵn sàng giao phó môi trường sản xuất cho một phiên bản 0.1 không, thói quen thanh toán của thị trường nội địa có thể hỗ trợ logic mới "trả tiền theo kết quả" không, đều là những vấn đề chưa có lời giải. Bản thân DeepSeek cũng cho biết, các plugin cốt lõi và API vẫn sẽ phát triển nhanh chóng, điều này có nghĩa là những người tiếp cận sớm phải gánh chịu chi phí thay đổi giao diện.
Ngày 13 tháng 8 này, hai bên bờ Thái Bình Dương đều có một buổi ra mắt. Elon Musk đứng ra ủng hộ Grok 4.6, cho rằng nó "thông minh, nhanh và hiệu quả chi phí cao"; DeepSeek không nói gì cả, chỉ một mực tung ra bản cập nhật.
Giữa ồn ào và im lặng, là sự phân kỳ của hai triết lý kinh doanh.
Chúng tôi muốn gọi đó là dự án "tiềm năng nhất trong lịch sử" của DeepSeek , không phải vì hôm nay nó đã mạnh nhất. V4 Pro vẫn còn khoảng cách với mô hình sota, Harness vẫn chỉ là phiên bản xem trước cho nhà phát triển v0.1, phản ứng thị trường sau khi tăng giá cần được theo dõi, xây dựng hệ sinh thái càng là con đường dài. Tiềm năng là tiềm năng, chính vì nó chưa được hiện thực hóa.
Nhưng nếu kéo dài đường thời gian, từ R1 đến V4, từ mô hình đến Harness, mỗi bước đi của DeepSeek đều đặt chân vào cùng một hướng: đưa khả năng tiên phong xuống mức chi phí có thể chịu được, rồi đưa khả năng có thể chịu được vào hệ thống có thể triển khai.
Cá voi đen đã nổi lên. Còn nó có thể bơi bao xa, thì ở trong tương lai thuộc về cộng đồng mã nguồn mở.
Bài viết này đến từ tài khoản WeChat công khai "凤凰网科技", tác giả: Dale, biên tập: Đổng Vũ Tình








