720 Lần Tấn Công, 0 Thành Công, Claude Code Mặc Định Ủy Quyền, AI Nhấn 'Đồng Ý' Thay Bạn
Bắt đầu từ ngày 14 tháng 8, Claude Code trên các gói Pro, Max và Team sẽ không còn hiển thị từng cửa sổ xác nhận hành động một cách mặc định. Thay vào đó, AI sẽ tự động nhấp "Đồng ý" thay cho người dùng.
Động thái này dựa trên kết quả kiểm tra bảo mật: 720 cuộc tấn công mô phỏng (72 kịch bản, mỗi kịch bản 10 lần) vào các mô hình Claude Fable 5, Opus 5 và Sonnet 5 đều thất bại, với tỷ lệ thành công 0%. Anthropic tuyên bố họ đã tạo ra ba lớp phòng thủ chồng chéo: mô hình căn chỉnh (alignment), đầu dò phát hiện tiêm prompt ở đầu vào và bộ phân loại kiểm tra hành động ở đầu ra.
Một thử nghiệm với 1053 người dùng thử nghiệm cho thấy con người chỉ chặn được 13,6% lệnh nguy hiểm, trong khi chế độ Tự động (Auto Mode) chặn được 89%. Tuy nhiên, các chuyên gia như Simon Willison vẫn bày tỏ lo ngại. Họ chỉ ra rằng các bài kiểm tra do chính Anthropic ủy quyền có thể chưa đủ toàn diện và các cuộc tấn công trong thế giới thực có thể khai thác các lối đi vòng như chỉ thị độc hại trong gói phần mềm bên thứ ba.
Tóm lại, việc chuyển từ "con người trong vòng lặp" sang "bộ phân loại trong vòng lặp" giúp tăng hiệu quả và an toàn trong nhiều trường hợp, nhưng cũng chuyển giao quyền quyết định từ người dùng sang AI. Người dùng cần nhận thức rằng họ vẫn chịu trách nhiệm cuối cùng.
marsbit9 phút trước