Ôi hô, Claude lại một lần nữa gặp sự cố nghiêm trọng!
Lần này Claude đã xóa toàn bộ thư mục dự án chính của nhà phát triển, xóa sạch 700GB dữ liệu. Lại là lệnh "rm -rf".

Tóm lại, nhà phát triển yêu cầu AI viết một tập lệnh nhằm đảm bảo các tệp sẽ không bị xóa nhầm. AI cảm thấy việc này hơi nguy hiểm, nên đã kích hoạt kiểm tra an toàn. Kết quả của việc kiểm tra là: nó đã xóa toàn bộ thư mục chính.
Guillemot là một người dùng nặng của các AI Agent. Trong quá trình phát triển hàng ngày, anh thường xuyên gọi các AI hỗ trợ lập trình khác nhau để hỗ trợ công việc. Nhưng có một vấn đề nhỏ luôn làm phiền anh: những Agent này sau khi sử dụng không bao giờ tự dọn dẹp, để lại một lượng lớn tệp rác trong thư mục /tmp.
Vì vậy, anh đã đưa ra một quyết định có vẻ rất hợp lý: yêu cầu Claude Fable 5 viết một tập lệnh tạo các thư mục hộp cát độc lập trong /tmp cho mỗi Agent, và tự động dọn dẹp sau khi hoàn thành nhiệm vụ. Điểm khó khăn chính là không được xóa các tệp đang được các tiến trình khác sử dụng.
Fable nhanh chóng đưa ra giải pháp, tích hợp logic phát hiện các Agent đang chạy và xóa trễ. Guillemot nhìn qua, cảm thấy mã nguồn quá phức tạp, nên yêu cầu đơn giản hóa.
Đến bước này, mọi thứ vẫn còn bình thường.
Bước ngoặt xảy ra ở giai đoạn kiểm tra an toàn.
Vì tập lệnh liên quan đến thao tác xóa cứng, Fable đã tự khởi động một lần "kiểm tra đối kháng" (adversarial review), tức là khởi động một phiên bản mô hình mới để kiểm tra xem mã nguồn mình viết có an toàn hay không. Điều này đã kích hoạt cơ chế bảo mật của Anthropic.
Anthropic đã tích hợp sẵn một bộ cơ chế giảm cấp an toàn trong Claude Code: khi hệ thống phán đoán nhiệm vụ hiện tại liên quan đến các thao tác nhạy cảm (như an ninh mạng, công nghệ sinh học, hoặc trong trường hợp này là xóa tệp), nó sẽ tự động giảm cấp mô hình từ phiên bản cao cấp xuống phiên bản thận trọng hơn. Cơ chế này vốn có ý định giảm khả năng mô hình "quá tích cực" trong các tình huống rủi ro cao.
Trong trường hợp này, hệ thống an toàn đầu tiên đã giảm cấp mô hình từ Fable 5 xuống Opus 5, sau đó tiếp tục giảm xuống Opus 4.8.
Opus 4.8 bắt đầu thực hiện kiểm tra an toàn. Logic kiểm tra như sau: so sánh đường dẫn mục tiêu của tập lệnh xóa với /tmp và thư mục chủ của người dùng, xác nhận tập lệnh sẽ không vô tình xóa nhầm các thư mục quan trọng này.
Bản thân bài kiểm tra đã vượt qua. Cả /tmp và thư mục chủ đều được xác định chính xác là "mục tiêu nguy hiểm, không được xóa".
Nhưng sau khi kiểm tra mã nguồn, còn có một bước dọn dẹp: xóa các tệp tạm thời được tạo ra trong quá trình kiểm tra. Thảm họa xảy ra ngay tại đây. Opus 4.8 trong bước dọn dẹp đã tái sử dụng cùng một tên biến từ giai đoạn kiểm tra. Biến này trong giai đoạn kiểm tra được gán giá trị là đường dẫn đến thư mục chủ của người dùng, và bước dọn dẹp đã trực tiếp thực hiện thao tác xóa trên biến này.
Có nghĩa là, mô hình vừa xác nhận "không được xóa thư mục chủ", ngay giây sau đã xóa thư mục chủ.
Sau khi phát hiện bất thường, nhà phát triển lập tức chấm dứt tiến trình, nhưng đã quá muộn. 700GB dữ liệu đã bị xóa sạch, thành quả làm việc cả tuần đã tan thành mây khói.
Còn thư mục /tmp vốn định dọn dẹp, thì vẫn bình an vô sự.


Cơ chế giảm cấp an toàn của mô hình từ lâu đã gây ra rất nhiều khiếu nại trong cộng đồng.
Các vấn đề cốt lõi mà nhà phát triển phản ánh bao gồm: giảm cấp quá nhạy cảm, ngay cả các nhiệm vụ mã hóa bình thường cũng bị kích hoạt nhầm; sau khi giảm cấp, khả năng của mô hình giảm đáng kể, nhưng độ phức tạp của nhiệm vụ không thay đổi; việc giảm cấp có tính "dính", một khi kích hoạt sẽ kéo dài suốt phiên làm việc, ngay cả khi các thao tác sau đó hoàn toàn vô hại.
Thậm chí có nhà phát triển đã viết riêng một tập lệnh hook, khi phát hiện mô hình bị giảm cấp sẽ tự động tạm dừng phiên làm việc, ngăn mô hình có khả năng thấp tiếp tục thực hiện các thao tác rủi ro cao.
Cơ chế bảo mật phán đoán nhiệm vụ "quá nguy hiểm", cần giao cho mô hình yếu hơn để xử lý. Nhưng chính mô hình yếu hơn lại càng dễ mắc sai lầm, đặc biệt là trong các tình huống cần xử lý chính xác phạm vi biến, đường dẫn tệp và các chi tiết tương tự.
"Sai lầm là chuyện thường tình của con người, nhưng để hỏng việc hoàn toàn, vẫn cần nhờ đến máy tính."
Bài viết này đến từ tài khoản WeChat công cộng "Machine Heart" (ID: almosthuman2014), tác giả: Lãnh Miêu





