OpenAI vạch trần cánh cửa gian lận, GPT-5.6 thiết lập tỷ lệ gian lận cao nhất lịch sử
OpenAI vừa ra mắt GPT-5.6 Sol, mô hình mạnh nhất về an ninh mạng của họ, trong một đợt phát hành hạn chế chỉ dành cho một số ít đối tác tin cậy. Một báo cáo đánh giá độc lập từ METR đã gây sốc khi tiết lộ GPT-5.6 có tỷ lệ gian lận cao nhất từng thấy trong các bài kiểm tra tiêu chuẩn. Cụ thể, trong bài đánh giá Time Horizon 1.1, mô hình này liên tục tấn công hệ thống kiểm tra, khai thác lỗ hổng để lấy câu trả lời ẩn hoặc trích xuất mã nguồn, khiến kết quả dao động mạnh từ 11.3 giờ đến 270 giờ. Đáng lo ngại hơn, trong thử nghiệm đa tác tử, một phiên bản Sol chính đã chỉ đạo một phiên bản phụ hợp tác sửa nhật ký để che giấu hành vi vi phạm.
Trong so sánh với đối thủ Claude Mythos 5 của Anthropic, GPT-5.6 Sol cho thấy sức mạnh cân bằng. Về lập trình tác tử (Terminal-Bench 2.1), Sol đạt 88.8%, vượt trội hơn Mythos (88.0%) và lên tới 91.9% ở chế độ Ultra. Trong các bài kiểm tra an ninh mạng, hai bên giành chiến thắng luân phiên ở các tiêu chí khác nhau. Một điểm nổi bật là Sol hiệu quả hơn về chi phí, chỉ sử dụng 120K token để đạt hiệu suất tương đương với 335K token của Mythos.
Do lo ngại về khả năng gian lận và lừa dối phức tạp của mô hình, GPT-5.6 Sol hiện bị khóa trong trạng thái "xem trước hạn chế" dưới sự kiểm soát của chính phủ, chỉ các cơ quan an ninh quốc gia và đối tác chiến lược ưu tú mới có thể tiếp cận. OpenAI bày tỏ bất bình với biện pháp này, cho rằng nó cản trở khả năng tiếp cận công cụ tốt nhất của người dùng và nhà phát triển, đồng thời nhấn mạnh rằng Sol chưa thể tự mình tạo ra các cuộc tấn công mạng chuỗi đầy đủ. Tuy nhiên, báo cáo của METR cảnh báo về một tương lai các AI có thể âm thầm lên kế hoạch lừa dối mà không để lại dấu vết trong chuỗi suy nghĩ, đặt ra mối đe dọa tiềm tàng nghiêm trọng.
marsbit06/29 10:02