Anthropic tạo ra một bộ 'hình phạt' cho AI vượt ngục: Yêu cầu của bạn, bốn cách chết
Bài viết thảo luận về hệ thống phân loại và đánh giá mức độ nghiêm trọng của các yêu cầu "jailbreak AI" (vượt rào an ninh AI) mới được Anthropic công bố, có tên là Khung Đánh giá Mức độ Nghiêm trọng Vượt Rào AI (CJS).
Hệ thống phân loại của Anthropic chia các yêu cầu liên quan đến an ninh mạng thành bốn loại: (1) Nguy hiểm cao (ví dụ: phần mềm tống tiền) bị chặn hoàn toàn; (2) Công cụ kép rủi ro cao (như thử nghiệm thâm nhập); (3) Công cụ kép rủi ro thấp (như quét lỗ hổng đã biết); và (4) Vô hại (như gỡ lỗi). Tuy nhiên, hệ thống được thiết kế quá nhạy, dẫn đến việc chặn nhiều yêu cầu hợp pháp (ví dụ đếm chữ cái, debug).
Để đánh giá mức độ nguy hiểm của một lần vượt rào, Anthropic đề xuất khung CJS với bốn thang đo: Mức độ tăng cường khả năng tấn công (0-4), Phạm vi khả năng (0-2), Độ khó vũ khí hóa (0-2) và Tính dễ phát hiện (0-2). Tổng điểm 0-10 xác định mức độ nghiêm trọng từ CJS-0 (thông tin) đến CJS-4 (khủng hoảng). Điểm số phụ thuộc vào bối cảnh thời gian và kiến thức của người dùng.
Bài viết chỉ ra rằng Anthropic, thông qua liên minh Glasswing với các tập đoàn công nghệ lớn, đang nắm quyền định nghĩa "nguy hiểm" và thiết lập tiêu chuẩn này. Điều này có thể ảnh hưởng đến việc kiểm duyệt mô hình và trải nghiệm người dùng. Bối cảnh được đặt trong lệnh cấm xuất khẩu của Mỹ lần đầu tiên nhắm vào API mô hình AI (như với Fable 5), cho thấy sự kiểm soát công nghệ ngày càng chặt chẽ. Khung CJS được xem như một công cụ để hợp thức hóa các quyết định kiểm soát đó.
Cuối cùng, bài viết đưa ra một số lời khuyên cho người dùng khi bị chặn: điều chỉnh từ ngữ trong lệnh, cảnh giác với tín hiệu bị giáng cấp chất lượng phản hồi, hoặc kiên nhẫn chờ đợi các cải tiến không rõ thời hạn từ Anthropic.
marsbit07/06 00:26