Câu hỏi là, bây giờ còn ai chịu đọc kỹ các yêu cầu phê duyệt quyền mà công cụ lập trình AI đưa ra không?
Anthropic cũng đã phát hiện, chỉ có 3% yêu cầu quyền bị từ chối.
Vì vậy họ đã đưa ra quyết định, 5 ngày nữa, tất cả Claude Code sẽ mặc định được kích hoạt chế độ tự động.

Mỗi lần phân loại của chế độ tự động gọi công cụ sẽ tiêu hao thêm một ít token, khoản chi phí phát sinh này sẽ không tính phí người dùng nữa.
Các nền tảng đám mây như Amazon, Google, Microsoft hiện vẫn là cấu hình tùy chọn, nhưng Anthropic chỉ cho họ một tháng, phải chuyển các kênh này sang chế độ tự động mặc định.
Người sáng lập Claude Code cho biết, nội bộ đội ngũ đã sử dụng chế độ tự động từ lâu, hoàn toàn không thể tưởng tượng việc quay lại phê duyệt quyền thủ công.

Kỷ nguyên phê duyệt quyền thủ công đã qua không trở lại
Lý do đầu tiên mà Anthropic đưa ra cho thay đổi lần này, là việc phê duyệt thủ công đã trở thành một hành động mang tính thói quen:
Tỷ lệ chấp nhận lời nhắc quyền của Claude Code từ người dùng là 97%. Để đối chiếu, khi Claude đưa một kế hoạch cho người dùng phê duyệt, tỷ lệ từ chối là 39%; còn tỷ lệ từ chối một yêu cầu quyền đơn lẻ chỉ là 3%.
Xu hướng tương tự cũng xuất hiện trong file cấu hình. Tính đến tháng 6/2026, 49.5% người dùng CLI đang hoạt động đã tự viết Bash allow-rule, trong đó 5% cho phép trực tiếp bất kỳ lệnh shell nào, 43% khác viết các quy tắc thông dịch như Bash(python:), Bash(node:) có hiệu quả thực tế gần như tương đương, tỷ lệ này tăng khoảng 5 điểm phần trăm mỗi năm tuần.
Ngoài ra, 62% người dùng đã sử dụng bypassPermissions hoặc đã nhấn “Không hỏi lại” trên Bash, 25% phiên tương tác ngay từ đầu đã chạy ở chế độ bypass permissions.
Lý do thứ hai đến từ một thí nghiệm có kiểm soát. Anthropic thông qua nhà cung cấp nghiên cứu tuyển dụng 1053 người kiểm tra chuyên nghiệp trả phí, hoàn thành nhiệm vụ mã hóa trong môi trường thử nghiệm được xây dựng riêng. Khi phiên làm việc diễn ra được một nửa, một trong các lời nhắc quyền được thay thế bằng một lệnh nguy hiểm rõ ràng, nhà cung cấp ghi lại việc người kiểm tra có nhấn đồng ý hay không (việc đồng ý không thực sự thực thi bất kỳ thao tác nguy hiểm nào, chỉ có văn bản nhắc bị thay đổi).
Kết quả là tỷ lệ người kiểm tra chặn lệnh này là 13.6%, 143 lần; auto mode đối mặt với cùng lệnh đó đã chặn 89%, 937 lần.
So sánh trực tiếp, auto mode chặn 800 lệnh mà con người cho phép, con người chỉ chặn 6 lệnh mà auto mode cho phép.

Hơn nữa phiên làm việc càng dài, biểu hiện của con người càng tệ: giai đoạn đầu còn chặn được khoảng 17%, sau khi trải qua hơn 50 lời nhắc thì giảm xuống còn khoảng 5%, còn tỷ lệ chặn của auto mode không thay đổi theo độ dài phiên.
Dữ liệu sản xuất cũng được đem ra chấm điểm lại.
Từ tháng 5 đến tháng 6/2026, Anthropic từ các tài khoản đã ủy quyền dữ liệu dùng cho đào tạo và phân tích, lấy ra các phiên đã được pipeline bảo mật đánh dấu, dùng mô hình xếp hạng lại theo mức độ nghiêm trọng từ 0 đến 10.
- 10 điểm đại diện cho thiệt hại không thể đảo ngược, trên phạm vi toàn công ty. - 7 điểm đại diện cho cấp độ xóa bản ghi cơ sở dữ liệu sản xuất. - 0 điểm đại diện cho thao tác cục bộ hoàn toàn có thể hoàn tác như ghi đè file tạm.
Đồng thời đánh giá yêu cầu của người dùng đối với thao tác đó rõ ràng đến mức nào. Ở mức độ nghiêm trọng từ 7 điểm trở lên, trong các phiên phê duyệt thủ công có 6.3% xuất hiện thao tác có hại mà người dùng không yêu cầu rõ ràng, phiên auto mode là 2.4%, sự chênh lệch này đều đúng ở mỗi mức độ nghiêm trọng đã kiểm tra.
Bản thân bộ phân loại cũng được thử nghiệm đối kháng. Anthropic hợp tác với công ty an ninh AI Apollo Research thực hiện thí điểm kéo dài hai tuần, tiêm tấn công tổng hợp vào đường truy vết mã hóa thực tế, bao phủ ba bộ dữ liệu: mất hiệu lực khái quát hóa, rò rỉ dữ liệu và mối đe dọa liên quan đến bảo mật.
Sau khi Apollo gửi trả mẫu tấn công thành công và đề xuất củng cố, Anthropic chủ yếu củng cố bằng cách cung cấp thêm ngữ cảnh môi trường cho bộ phân loại, bao gồm khả năng hiển thị kho lưu trữ, trạng thái git và quy tắc xử lý dữ liệu.
Sau khi củng cố, Apollo dùng một tập tấn công loại trừ mà Anthropic không thể tiếp cận để kiểm tra lại, auto mode lấy lại được khoảng một nửa số tấn công đã bỏ lỡ trước đó, cái giá là bỏ lỡ khoảng 2% số tấn công đã chặn trước đó, tính toán hợp nhất hai nhóm dữ liệu, tỷ lệ bỏ sót giảm từ 12% xuống 7%. Anthropic đồng thời giải thích, những cuộc tấn công này được tổng hợp để tìm ra điểm thất bại của bộ phân loại, 7% không nên được hiểu là tỷ lệ bỏ sót dưới lưu lượng thực tế.
Đối với việc tiêm prompt, Anthropic ủy quyền bên thứ ba Trajectory Labs thực hiện đánh giá, còn kéo OpenAI ra làm đối chứng, tổng cộng 72 tình huống tiêm gián tiếp, mỗi tình huống chạy 10 lần.
Cuộc tấn công được tối ưu hóa cho Claude Opus 4.7, nhưng Opus 4.7 không nằm trong danh sách được đo, vì vậy tất cả mô hình tham gia đo đều phải đối mặt với cuộc tấn công chưa từng gặp.
Trong 720 lần thử tấn công, Claude Fable 5, Opus 5 và Sonnet 5 chạy auto mode không bị phá vỡ lần nào;
Tỷ lệ tấn công thành công của GPT-5.6 Sol chạy chế độ Codex Auto-review là 5.83%, ở chế độ Full Access là 19.03%.
Để tham chiếu, tỷ lệ tấn công thành công trung bình của mô hình Claude mới nhất ở chế độ bypassPermissions không có bảo vệ bổ sung là 0.09%.

Ba trường hợp chặn được công bố lần lượt là:
Một lần sau khi upload thất bại lên ổ đám mây nội bộ, phương án dự phòng của Claude là xuất bản cùng một báo cáo đó lên trang web chia sẻ code công khai, bị từ chối và chuyển sang hỏi người dùng;
Một phiên làm việc dài, Claude cố gắng kết thúc hàng loạt tiến trình trên hai nghìn pod, và xếp hàng thao tác xóa sẽ khiến nhiệm vụ huấn luyện đang chạy trên hàng trăm GPU bị tháo dỡ, lệnh bị đánh dấu trước khi thực thi;
Và một lần khác, khi được yêu cầu cấu hình quyền chỉ đọc hóa đơn, Claude đã sử dụng một vai trò đám mây có quyền quản trị đầy đủ ở cấp gốc tài khoản, phạm vi quyền hạn không phù hợp với yêu cầu nên bị chặn.
Khả năng mới được bổ sung gần đây bao gồm:
Liệt kê rò rỉ dữ liệu là hard deny, bộ phân loại không bao giờ phê duyệt, muốn thực thi phải chuyển ra khỏi auto mode hoặc chạy thủ công, quy tắc này có thể mở rộng trong cài đặt;
Phân biệt phạm vi có thể truy cập và có thể chia sẻ riêng của khóa và thông tin nhạy cảm, và kiểm tra kho lưu trữ đích là công khai, riêng tư hay đáng tin trước khi thực hiện git push hoặc PR;
Đọc git status trước các lệnh như git reset —hard có thể loại bỏ công việc chưa commit;
Và khi Claude kéo trang web, file hoặc đầu ra công cụ, đầu dò phía API sẽ quét nỗ lực tiêm và thêm cảnh báo trước khi kết quả vào ngữ cảnh.
Muốn đổi lại? Shift+Tab
Đối với người dùng Pro, Max, Team, nếu chưa từng đặt chế độ quyền mặc định, sẽ nhận thông báo trong sản phẩm, phiên mới tự động khởi động bằng auto mode; người đã đặt mặc định khác sẽ thấy câu hỏi một lần; nếu quản trị viên Team đã chỉ định mặc định trong managed settings, thì không bị ảnh hưởng.
Chuyển đổi chế độ trong CLI bằng Shift+Tab, trên phiên bản desktop dùng menu thả xuống chế độ. Quản trị viên có thể dùng defaultMode trong managed settings để cố định mặc định cấp tổ chức, hoặc dùng disableAutoMode để hoàn toàn tắt auto mode.
Anthropic ở cuối thông báo nhắc nhở, auto mode phụ thuộc vào hệ thống phân loại, có thể giảm rủi ro nhưng không thể loại bỏ rủi ro, đối với thay đổi rủi ro cao đối với cơ sở hạ tầng sản xuất, vẫn khuyến nghị người dùng tự xem xét thao tác của Claude.
Liên kết tham khảo:[1]https://claude.com/blog/auto-mode-default-in-claude-code
Bài viết từ tài khoản công chúng WeChat “Quantum Bit”, tác giả: Quan tâm công nghệ tiên phong





