Biên tập | Sia
Ngay tại thời điểm CEO Cursor Michael Truell tiết lộ rằng OpenAI có kế hoạch chặn người dùng Cursor tiếp tục truy cập mô hình của họ sau ba tháng, mối quan hệ giữa hai bên bỗng trở nên căng thẳng, thì Codex của OpenAI bất ngờ có một động thái mới.

Vừa rồi, những người dùng trả phí này bất ngờ đón nhận một đợt hoàn trả hạn mức sử dụng – Trưởng nhóm Codex Tibo đã thông báo trên tweet rằng sẽ đặt lại hạn mức sử dụng cho tất cả người dùng trả phí của Codex và ChatGPT Work.

Lần này không đơn giản chỉ là tặng thêm một ít.
Tibo cho biết, gần đây họ đã tập trung xử lý hàng nghìn phản hồi từ người dùng, gần như lật tung cơ chế tính toán lượng sử dụng đằng sau Codex. Kết quả phát hiện, cảm giác của người dùng trước đây rằng hạn mức sao mà nhanh hết vậy, hoàn toàn không phải là ảo giác.
Sau khi một loạt lỗi được sửa chữa, tùy theo cách sử dụng khác nhau, họ dự kiến: với cùng một hạn mức sử dụng Codex, bây giờ có thể kéo dài hơn trước từ 10% đến 50%. Con số hạn mức có thể không thay đổi, nhưng lượng công việc thực tế có thể làm được đã tăng lên.
Danh sách vấn đề được công bố lần này, gần như có thể coi là một cuốn "Cẩm nang về cách AI Agent âm thầm đốt Token". Một số lỗi trong đó, nhìn có vẻ không đáng kể, nhưng khi đốt hạn mức lại cực kỳ mãnh liệt.
Một nhiệm vụ, nhiều nhất có thể 'ngốn' tới 70% hạn mức tuần
OpenAI liệt kê một mạch 8 loại vấn đề đã phát hiện và sửa chữa.
Đầu tiên, chính là nén ngữ cảnh (Compaction). Công cụ lập trình AI chạy càng lâu, ngữ cảnh càng lớn, hệ thống thường sẽ nén thông tin lịch sử lại để tiếp tục làm việc.
Vấn đề nằm ở chỗ, trước đây khi Codex thực hiện nén ngữ cảnh, nó vẫn giữ lại các hình ảnh cũ trong ngữ cảnh. Kết quả, bản thân việc nén là để làm ngữ cảnh nhỏ đi, nhưng hình ảnh cũ không bị xóa, ngữ cảnh vẫn rất lớn, lớn đến mức thậm chí có thể ngay lập tức kích hoạt thêm một lần nén nữa.
Vì vậy đã xuất hiện một tình huống hơi kỳ ảo: việc nén vốn để tiết kiệm ngữ cảnh, bản thân nó lại bắt đầu tiêu tốn nhiều ngữ cảnh hơn. Sau khi OpenAI sửa lỗi này, đối với những người dùng sử dụng nhiều hình ảnh, lượng sử dụng liên quan đã giảm trực tiếp khoảng 10%.
Nhưng đây vẫn chưa phải là điều đáng kinh ngạc nhất. Kẻ giết hạn mức thực sự, đến từ cơ chế mục tiêu nhiệm vụ (Goals) của Codex.
OpenAI phát hiện, trong một số trường hợp, mục tiêu /goal do người dùng đặt ra rõ ràng đã được thực thi xong, nhưng Agent lại không dừng lại theo dự kiến, mà tiếp tục thực hiện sau đó.
Một trường hợp khác là công cụ rõ ràng đã hỏng, nhưng mô hình vẫn không ngừng thử lại. Nhiệm vụ nhìn có vẻ đã kết thúc, nhưng AI vẫn đang làm việc từng lượt ở hậu trường.
OpenAI cho biết, trong một số trường hợp họ thấy, chỉ riêng vấn đề này đã có thể tiêu tốn từ 15% đến 70% hạn mức tuần của người dùng. Nghĩa là, trong trường hợp cực đoan, một nhiệm vụ bất thường có thể trực tiếp 'ngốn' mất bảy phần mười hạn mức tuần. Hiện tại, vấn đề này cũng đã được sửa chữa.
Có một nhiệm vụ hậu trường, thậm chí suýt chạy tới 15000 lần
Một vấn đề khác xuất hiện ở Memory, tức hệ thống trí nhớ.
Memory Worker ở hậu trường của Codex trong một số trường hợp có thể kế thừa một số Stop Hook. Về bản chất, Stop Hook là để kiểm soát thời điểm nhiệm vụ dừng lại. Nhưng sau khi lỗi xảy ra, một số nhiệm vụ hậu trường ngược lại có thể vì điều kiện dừng không được thỏa mãn mà chạy mãi không dừng.
Vấn đề loại này thực tế ảnh hưởng đến chưa đến 1% người dùng. Nhưng vấn đề nằm ở chỗ, các trường hợp cá biệt lại cực kỳ kỳ lạ. OpenAI đề cập, họ thậm chí đã phát hiện một trường hợp, hành động hệ thống kiểm tra xem một nhiệm vụ có thể kết thúc hay không, có thể được thực hiện tới 15000 lần.
Với tuyệt đại đa số người dùng, lỗi này có thể hoàn toàn không cảm nhận được. Nhưng với người dùng không may gặp phải, Token có thể âm thầm bốc hơi ở hậu trường. Cảm giác này đại khái giống như máy tính không mở gì cả, nhưng quạt tản nhiệt đột nhiên bắt đầu chạy ầm ầm.
Subagent cũng lén nâng cấp cấu hình
Một vấn đề rất đặc trưng của thời đại Agent, xảy ra trên Subagent (tác nhân con).
Codex hiện tại không nhất thiết chỉ dựa vào một mô hình để hoàn thành nhiệm vụ. Nhiệm vụ phức tạp có thể được chia nhỏ, sau đó gọi nhiều Agent con phối hợp thực hiện. Vấn đề nằm ngay ở đây.
OpenAI phát hiện, một số mô hình năng lực nhỏ hơn, như Luna, đôi khi trong tình huống người dùng không yêu cầu rõ ràng, sẽ tự chọn mô hình hỗ trợ có năng lực mạnh hơn, chi phí cũng cao hơn.
Thậm chí kỳ lạ hơn, ngay cả khi mô hình chính chịu trách nhiệm điều phối nhiệm vụ không chạy ở chế độ /fast, nó cũng có thể yêu cầu các Agent con bên dưới sử dụng /fast.
Điều này giống như sếp ngồi hạng phổ thông, nhưng lại lén mua vé hạng thương gia cho mấy trợ lý. Nhiệm vụ đương nhiên vẫn là nhiệm vụ đó, nhưng mức tiêu hao tài nguyên đằng sau đã không còn là một chuyện nữa. Hiện tại vấn đề này cũng đã được sửa chữa.
Nhiệm vụ tự động, nói một ngày một lần, thực tế có thể lén chạy nhiều hơn
Automations cũng bị phát hiện có vấn đề.
OpenAI cho biết, một số tác vụ lập lịch tùy chỉnh trước đây có thể xuất hiện tình trạng: tần suất thực thi thực tế cao hơn tần suất người dùng thiết lập. Ví dụ người dùng ban đầu chỉ muốn một nhiệm vụ tự động định kỳ thực hiện, nhưng hệ thống có thể đánh thức nhiệm vụ thường xuyên hơn so với thời gian đã đặt.
Nhìn một lần có thể không nhiều. Nhưng đặc điểm của Agent chính là – nó có thể tự chạy trong tình huống không có thao tác của người dùng. Chạy một lần không đắt. Chạy thêm vài chục lần, thì chưa chắc. Vấn đề này hiện cũng đã được sửa chữa.
Chỉ riêng việc tóm tắt xem mình đã làm gì, cũng có thể 'ngốn' mất 20% hạn mức tuần
Một vấn đề điển hình khác, đến từ Computer History.
Để Agent hiểu mình trước đây đã làm gì trên máy tính, hệ thống cần lưu lại, sắp xếp, thậm chí tóm tắt lịch sử hoạt động trước đó. Nhưng trong phiên bản cũ, Codex có thể lặp lại việc tóm tắt các hoạt động lịch sử đã có độ trùng lặp cao. Tương đương với cùng một đoạn nhật ký công việc, được sắp xếp lại từng lượt.
OpenAI cho biết, trong một số trường hợp, phần chi phí bổ sung này có thể chiếm khoảng một phần năm tổng lượng sử dụng hàng tuần của người dùng. Tức khoảng 20%.
Còn một mức tiêu hao hậu trường tương tự, đến từ Rolling Task Summaries. Ban đầu các lượt hội thoại thông thường cũng có thể kích hoạt yêu cầu hậu trường bổ sung, dùng để tạo tóm tắt nhiệm vụ cuộn.
Chi phí một lần không tính lớn, OpenAI ước tính tăng khoảng 1% lượng Token sử dụng. Vẫn là câu nói đó: một lần 1% không nhiều, nhưng không chịu nổi mỗi lần đều thêm một ít. OpenAI đã trực tiếp tắt cơ chế này.
MCP cũng không thoát: cùng một kết quả công cụ có thể được mã hóa hai lần
Loại vấn đề cuối cùng, xảy ra khi gọi công cụ MCP.
OpenAI phát hiện, kết quả trả về của một số công cụ có thể bị mã hóa lặp lại hai lần. Ngoài ra, một số mô tả công cụ có thể bị cắt ngang ngoài ý muốn, sau đó hệ thống lại phải lấy lại một lần nữa.
Những vấn đề loại này nhìn riêng lẻ đều giống như các lỗi kỹ thuật nhỏ. Nhưng khi Agent một ngày gọi hàng chục lần, hàng trăm lần, thậm chí nhiều hơn các công cụ, mỗi lần truyền tải lặp lại đều có nghĩa là sự tiêu hao Token thực tế. Tích tiểu thành đa, cuối cùng đều phản ánh vào hạn mức của người dùng.
Một khoản chi phí ngày càng khó tính
Nhìn chung các bản sửa lỗi lần này, một thay đổi rất rõ ràng đang xuất hiện: trước đây sử dụng ChatGPT, người dùng về cơ bản có thể hiểu một cuộc hội thoại là một lần gọi mô hình.
Nhưng đến với sản phẩm Agent như Codex, mọi chuyện đã hoàn toàn khác.
Bạn chỉ nhập một câu trên giao diện, nhưng hệ thống nhìn thấy có thể là cả một luồng công việc Agent, việc cuối cùng sử dụng bao nhiêu hạn mức đang ngày càng trở nên khó hiểu một cách trực quan.
Có Token là mô hình thực sự dùng để viết mã. Có Token dùng để hiểu ngữ cảnh. Lại có Token, thậm chí chỉ là hệ thống hậu trường để duy trì trí nhớ, tạo tóm tắt hoặc điều phối Agent mà sinh ra. Bất kỳ khâu nào ở đây xuất hiện vòng lặp, gọi lặp lại hoặc điều phối sai, điều duy nhất người dùng cuối cùng cảm nhận được chỉ là: sao chưa làm gì mà hạn mức đã hết?
OpenAI rõ ràng đã nhận thức được vấn đề này. Ngoài việc sửa chữa các lỗi trên, họ còn cho biết đã thực hiện điều chỉnh ở tầng kiến trúc, tránh các vấn đề tương tự tái diễn. Nếu các bất thường liên quan xảy ra lại, đội ngũ cũng sẽ tự động nhận được cảnh báo.
Quan trọng hơn, OpenAI đang phát triển tính năng hiển thị lượng sử dụng mới. Trong tương lai người dùng có thể trực tiếp xem trong ứng dụng, hạn mức của mình cuối cùng được dùng vào đâu, mà không cần phải đoán nữa.
Từ góc độ này, việc đặt lại hạn mức lần này có lẽ chỉ là phúc lợi bề mặt. Và, OpenAI dường như vẫn chưa định dừng tay ở đây?

Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID: almosthuman2014), tác giả: 关注科学AI的





