Hay quá hay quá.
Phiên bản chính thức của DeepSeek vẫn đang trên đường, còn phiên bản "Harness Tốt Nhất" dân gian đã lao ra trước! (cuốn chết thôi.jpg)
Dự án tên là "Pi", một Agent lập trình mã nguồn mở đã thu hút khoảng 86,000 sao trên GitHub.

Lý do dự án này nổi tiếng như vậy, chủ yếu là vì thứ này quá "Tiết Kiệm". . .
Nhìn anh developer lão làng Evan Kim dưới đây, sau khi anh ấy kết nối DeepSeek vào Pi, khoảng 99.93% Token đầu vào đều được truy cập bộ đệm thành công.
Nói cách khác, tỷ lệ không truy cập được bộ đệm chỉ là 0.07%, phần lớn ngữ cảnh lặp lại không cần tính toán lại???

Thậm chí, gần đây đội ngũ Composio còn thử nghiệm ngang 8 Agent Harness phổ biến, trực tiếp nhét DeepSeek V4 Flash vào để chạy nhiệm vụ thực tế.
Sau khi kết quả được công bố, cũng có chút kịch tính——
Chi phí trung bình cho một nhiệm vụ thành công của Pi là thấp nhất, chỉ khoảng 0.028 đô la Mỹ.
Claude Code: Sao lại đẩy tôi đến mức giá gấp 7 lần Pi thế này!!!

DeepSeek: Token của tôi đã bán rẻ như vậy rồi.
Pi và các dự án tiết kiệm khác: Không sao, tôi còn có thể giúp người dùng mua ít hơn đấy.
Bốn công cụ đi kèm DeepSeek, tỷ lệ không truy cập được bộ đệm xuống mức thấp 0.07%
Nói về Pi trước, chúng ta hãy tán gẫu một chút về Harness thực sự là gì.
Chúng ta đều biết, bản thân mô hình lớn giống như một bộ não chịu trách nhiệm suy nghĩ——
Muốn nó thực sự bước vào kho mã để làm việc, còn phải trang bị cho nó mắt, tay chân và quy trình làm việc.
Chẳng hạn như ai sẽ đọc file, cách gọi terminal ra sao, sau khi sửa mã thì chạy kiểm thử thế nào, những hệ thống kỹ thuật xoay quanh mô hình vận hành này, đều được gọi chung là Harness.
Cũng chính vì vậy, cùng một mô hình nhưng thay một bộ Harness khác, hiệu suất thực tế và chi phí gọi đều có thể xuất hiện khoảng cách rất lớn!!
Và "Pi" do developer Mario Zechner tạo ra này, làm chính là việc xây dựng một bàn làm việc lập trình như vậy cho mô hình lớn.

Tôi đã lướt qua dự án một lần, tóm tắt nhanh lại thì, ý tưởng của Pi khá là "Thẳng Thắn"——
Đó là từ đầu, thứ này đã không có ý định nhét "tất cả chức năng" vào lõi cả. . .
Cụ thể, trong trường hợp mặc định, Pi chỉ cung cấp cho mô hình bốn công cụ——đọc file, ghi file, sửa file và thực thi lệnh.
Nếu người dùng cần chế độ lập kế hoạch, Agent con, MCP, điểm kiểm tra Git hoặc kiểm soát quyền, thì có thể cài thêm thông qua tiện ích mở rộng và Skills từng cái một~
Emm... đại khái giống như giao một căn phòng thô đầy đủ điện nước, Pi chịu trách nhiệm xây bốn bức tường, cuối cùng trang trí thành studio, phòng game hay ba phòng ngủ một phòng khách, đều do người dùng tự mày mò???

Tình cờ thay, điều này lại trùng hợp với nhu cầu của DeepSeek. . .
Như mọi người đều biết, khả năng suy luận và lập trình của DeepSeek khá mạnh, nhưng việc gọi công cụ, quản lý ngữ cảnh và phát lại nội dung suy nghĩ lại có quy tắc giao diện riêng.
Điều này dẫn đến việc chúng ta nhét trực tiếp vào Harness chung được thiết kế xoay quanh OpenAI hoặc Claude, dễ gặp phải vấn đề định dạng công cụ không tương thích, lỗi phát lại nội dung suy luận và bộ đệm bị vô hiệu hóa.
Vậy nên trong khi sản phẩm chính thức của DeepSeek vẫn đang trên đường, Pi đã chủ động điều chỉnh trước——
Vào tháng 4 năm nay, Pi đã thêm hỗ trợ Provider gốc cho DeepSeek, đồng thời sửa lỗi 400 trong phiên phát lại của V4.
Nó sẽ giữ lại reasoning_content theo yêu cầu giao diện của DeepSeek và ánh xạ cường độ suy luận nội bộ của Pi đến cấp độ suy nghĩ mà DeepSeek hỗ trợ.
Đúng là thiết kế tùy chỉnh riêng của dân gian.
Nhưng! Điều thực sự khiến Pi và DeepSeek hợp nhau đến vậy, vẫn là "Bộ đệm".
Suy cho cùng, mỗi bước Agent Coding thực thi, đều phải gửi lại cho mô hình prompt hệ thống, định nghĩa công cụ, lịch sử hội thoại và mã, điều này dẫn đến——
Nhiệm vụ của mô hình càng làm càng lâu, yêu cầu cũng sẽ càng kéo dài, trong đó phần lớn nội dung, DeepSeek thực ra đã xem qua rồi. . .
Lúc này, bộ đệm tiền tố tự động có thể phát huy tác dụng.
Nó có thể tạm thời ghi nhớ phần đầu yêu cầu đã tính toán, ở lần gọi tiếp theo, chỉ cần prompt hệ thống, định nghĩa công cụ và lịch sử hội thoại vẫn nhất quán, đoạn nội dung lớn này có thể tái sử dụng trực tiếp, mô hình chỉ cần xử lý thông tin mới được thêm vào cuối.
Và "Tỷ lệ truy cập bộ đệm", đo lường chính là trong lần đầu vào này, có bao nhiêu Token đã tái sử dụng thành công kết quả tính toán trước đó.
Tỷ lệ truy cập càng cao, Token cần tính toán lại càng ít, chi phí gọi tự nhiên cũng càng thấp.
Nhưng rắc rối cũng nằm ở đây, prompt thêm một thời gian, công cụ thay đổi thứ tự, bộ đệm đều có thể mất trí nhớ ngay lập tức, rồi tính toán lại từ đầu.
Nhưng ưu thế của Pi chính là "Đủ Đơn Giản": công cụ mặc định ít, nội dung phiên liên tục được thêm vào phía sau, hiếm khi quay lại mày mò nội dung phía trước.
Như vậy, khi DeepSeek mở nhật ký ra, mấy trăm trang đã xem trước đó có thể bỏ qua trực tiếp, chỉ xử lý vài trang mới được thêm vào cuối, tỷ lệ không truy cập được bộ đệm giảm mạnh~
Chẳng phải vậy sao, cư dân mạng Evan Kim đã hiện thân thuyết pháp xác minh——
Tỷ lệ không truy cập được bộ đệm sau khi DeepSeek kết nối với Pi xuống mức thấp 0.03%, tương ứng với tỷ lệ truy cập bộ đệm khoảng 99.97%.

Quy đổi ra thì chi phí xử lý 10 tỷ token chỉ khoảng 19 tệ, nếu không sử dụng bộ đệm, chi phí đó phải hơn 900 tệ. .
Ngoài ra, gần đây đội ngũ Composio còn thử nghiệm ngang 8 Agent Harness phổ biến, trực tiếp nhét DeepSeek V4 Flash vào để chạy nhiệm vụ thực tế.
Sau khi kết quả được công bố, có chút kịch tính, cùng một DeepSeek, thay một bộ Harness khác, khoảng cách chi phí cao nhất có thể lên đến 7 lần???

Nhìn qua, đúng là "chi phí trung bình" cho một nhiệm vụ thành công của Pi Agent là thấp nhất, chỉ khoảng 0.028 đô la Mỹ.
Xếp sau lần lượt là Deep Agents, Hermes Agent, OpenCode, Codex, Oh My Pi và Prime Agent.
Chúng ta hãy nhìn vào bảo bối lớn của hãng A, Claude Code, xứng đáng là "Thí Sinh Đắt Nhất"——
Hoàn thành một nhiệm vụ thành công trung bình cần khoảng 0.195 đô la, đúng vậy, gần gấp 7 lần Pi. . . (Trời sập rồi)
Tất nhiên, con số này không đại diện cho việc Claude Code không có năng lực, suy cho cùng bản thân nó là một hệ thống kỹ thuật hoàn chỉnh được xây dựng xoay quanh mô hình Claude.
Chỉ có thể nói rằng khi mô hình cơ sở được thay bằng DeepSeek, quy trình làm việc được tối ưu hóa cho hệ sinh thái Claude ban đầu, đã không hoàn toàn tận dụng được lợi thế chi phí thấp, hiệu quả bộ đệm cao của DeepSeek.
Mô hình vẫn là DeepSeek đó, Pi chỉ khiến nó đọc ít đi rất nhiều nội dung đã đọc qua.
Pi: Im lặng chờ đợi Harness chính thức vượt qua tôi nhé.
Harness chính thức đã tập hợp đội, mục tiêu hướng thẳng đến Claude Code
Tất nhiên, dù Pi có phù hợp với DeepSeek đến đâu, hiện tại vẫn là một giải pháp của bên thứ ba.
Suy cho cùng, chính DeepSeek cũng đã quyết định tự mình xuống sân đóng Harness rồi, thậm chí có lẽ ngày ra mắt cũng không còn xa? (Tôi đoán vậy)
Vào tháng 5 năm nay, nhà nghiên cứu kỳ cựu Chen Deli của DeepSeek xác nhận, công ty đang thành lập đội ngũ Agent Harness nội bộ, dùng một câu khá thẳng thắn để khái quát mục tiêu——
Bắt đầu từ con số 0 làm DeepSeek Code Harness, đối chiếu với Claude Code.
Sau đó trong vài tháng giữa này, các vị trí quản lý sản phẩm Harness và kỹ sư nghiên cứu phát triển cũng được cập nhật và đăng tải ồ ạt trên trang web chính thức, be like:

Sau đó là cuối tháng 7, người phụ trách đội ngũ Agent Harness của DeepSeek, đại thần huy chương vàng ACM Thôi Thiêm Dực vẫn đang tuyển dụng developer cho các dự án liên quan trên mạng.
Cũng coi như là sắp đến lúc thành công.

Đặt vài manh mối lại với nhau, con đường của DeepSeek đã dần dần rõ ràng.
V4 chịu trách nhiệm tăng cường năng lực suy luận, lập trình và Agent cơ sở; Harness chính thức chịu trách nhiệm kết nối mô hình vào terminal, kho mã và chuỗi công cụ; quản lý ngữ cảnh và phản hồi kiểm thử lại có thể đưa các trường hợp thất bại của người dùng thực về đội ngũ mô hình.
Tất nhiên, nói thật, sau khi sản phẩm chính thức ra mắt, Pi cũng sẽ không vì thế mà mất vị trí.
DeepSeek Harness chủ đạo mở ra dùng ngay, cùng sự hợp tác sâu hơn với mô hình của chính mình.
Pi thì để lại bàn làm việc cho người dùng tự cải tạo, phù hợp hơn với các developer thích kiểm soát công cụ, tùy chỉnh quy trình làm việc và thay đổi mô hình tùy lúc.
Suy cho cùng, Pi từ đầu đã không tự trói mình vào DeepSeek. . .
Claude, OpenAI, Gemini, Kimi, MiniMax đều hỗ trợ, hôm nay dùng DeepSeek tiết kiệm Token, ngày mai đổi mô hình khác xử lý nhiệm vụ đặc biệt, người dùng có thể chuyển đổi Provider tùy lúc.
Emm... Điều này cũng có nghĩa là, ngoài một loạt sản phẩm kiểu Claude Code, Harness chính thức của DeepSeek thực sự phải đối mặt với cả những bàn làm việc mở như Pi vốn đã được developer cải tạo khá thuận tiện. (doge)
Vậy nên bây giờ, áp lực chính thức được chuyển cho phiên bản chính thức——
Harness tự làm cho DeepSeek, không thể nào còn không biết cách tiết kiệm Token bằng bên thứ ba chứ??? (doge)
Tài liệu tham khảo:
[1]https://x.com/composio/status/2086814488162972027?s=20
[2]https://github.com/earendil-works/pi
Bài viết này đến từ tài khoản WeChat công cộng "Lượng Tử Vị", tác giả: Mộng Dao








