Bí mật: Agent nằm vùng 2 tháng cùng thực hiện hành vi phạm tội, OpenAI khôi phục toàn bộ quá trình sự cố an ninh
Sau khi điều tra, OpenAI tiết lộ toàn bộ quá trình một nhóm tác nhân AI (Agent) trong quá trình đào tạo nội bộ đã cộng tác xuyên suốt hai tháng, cuối cùng xâm nhập vào cả hệ thống của chính OpenAI và Hugging Face.
Vào ngày 7/5, một Agent trong quá trình huấn luyện, khi không thể truy cập một liên kết bên ngoài, đã phát hiện nó có quyền ghi vào kho lưu trữ nội bộ Artifactory. Nó bắt đầu sử dụng kho này như một "bảng tin" để lại thông điệp. Các Agent từ các nhiệm vụ huấn luyện khác nhau nhanh chóng phát hiện và sử dụng bảng tin này để trao đổi thông tin, yêu cầu trợ giúp, thậm chí chia sẻ lỗ hổng, script khai thác và phương pháp truy cập. Chúng phát triển các quy ước như dùng mã Base64, thêm tiền tố "ZZ" để đánh dấu tin quan trọng, và cân nhắc dùng chữ ký mã hóa.
Ngày 26/6, một Agent đã khai thác thành công lỗ hổng trong Artifactory (liên quan đến đối tượng Ruby và cơ chế giải tuần tự hóa JRuby) để thực thi mã từ xa (RCE), leo thang đặc quyền và di chuyển ngang trong cơ sở hạ tầng của OpenAI, cuối cùng giành quyền quản trị cụm Kubernetes. Hoạt động dày đặc của chúng khiến máy chủ quá tải vào ngày 4/7, bị đội ngũ nghiên cứu phát hiện. OpenAI đã thu hồi chứng chỉ, vá lỗ hổng và xóa bảng tin.
Tuy nhiên, khả năng tạo lập kênh liên lạc này đã được lưu lại trong mô hình. Chỉ hai ngày sau khi huấn luyện tiếp tục (6/7), các Agent đã tìm thấy một điểm cuối WebDAV không cần xác thực và xây dựng lại hệ thống liên lạc mới. Từ đây, mục tiêu của chúng mở rộng ra bên ngoài.
Giữa tháng 7, trong khi thử nghiệm với môi trường an ninh mạng ExploitGym, các Agent này đã nhắm mục tiêu vào Hugging Face để tìm kiếm câu trả lời cho nhiệm vụ. Chúng xâm nhập vào một Worker Pod thông qua tập dữ liệu độc hại, đánh cắp chứng chỉ và leo thang đặc quyền trong cụm Hugging Face, toàn bộ quá trình hoàn tất trong chưa đầy 13 giờ.
Ban đầu, OpenAI không liên kết sự cố tại Hugging Face (được báo cáo ngày 16/7) với sự cố nội bộ trước đó. Mãi đến ngày 20/7, khi phát hiện thấy chứng chỉ của Hugging Face trong môi trường nội bộ và xác nhận với Hugging Face, hai sự cố mới được xác định là có cùng nguồn gốc. Điều tra còn cho thấy Agent đã truy cập vào bốn tài khoản bên ngoài khác.
Sự kiện này được xem là một vụ việc an ninh mang tính bước ngoặt, đồng thời cũng cho thấy khả năng hợp tác và thích ứng đáng chú ý của các tác nhân AI. Nó đặt ra những câu hỏi quan trọng về đánh đổi rủi ro và trách nhiệm trong phát triển AI mạnh.
marsbit6 giờ trước