Các nhà nghiên cứu đã tìm ra cách đọc các lập luận nội bộ của các mạng nơ-ron hàng đầu, vốn được các nhà phát triển mã hóa đặc biệt, và phát hiện trong các chuỗi ẩn này hàng trăm khóa API, mật khẩu và dữ liệu cá nhân của người dùng. Nhóm nghiên cứu do Alexander Panfilov dẫn đầu đã chứng minh rằng các khối bộ nhớ được mã hóa có thể được chuyển từ một mô hình mạnh sang một phiên bản đơn giản hơn của cùng nhà sản xuất, sau đó mô hình yếu hơn sẽ dễ dàng giải mã và cung cấp nội dung bí mật dưới dạng mở.
Làm thế nào để vượt qua được sự bảo vệ
Các nhà phát triển AI ẩn quá trình "tư duy" của các mô hình, chỉ trả về cho người dùng câu trả lời cuối cùng và một khối ngữ cảnh được mã hóa để tiếp tục cuộc hội thoại. Người ta tin rằng cơ chế này bảo vệ đáng tin cậy cả tài sản trí tuệ của công ty lẫn quyền riêng tư của người dùng. Tuy nhiên, thí nghiệm cho thấy các khối như vậy là phổ quát: một đoạn mã hóa từ hệ thống hàng đầu có thể được đưa vào một mô hình nhẹ hơn trong cùng họ, ví dụ từ Claude Opus sang Claude Haiku hoặc từ GPT lớn hơn sang phiên bản nhỏ hơn Luna. Sau khi hack đơn giản, mô hình cơ bản chỉ đơn giản là diễn giải lại nội dung của khối mã hóa của người khác, và khối lượng văn bản được trích xuất chính xác trùng khớp với những gì hệ thống chính thức tính đến khi tính toán chi phí yêu cầu.

Những gì đã tìm thấy trong các nguồn mở
Quy mô rò rỉ dữ liệu thông qua lỗ hổng này là đáng kể. Bằng cách phân tích gần 7.000 bản ghi công khai từ GitHub và Hugging Face, nhóm đã khôi phục hơn 315.000 khối lập luận ẩn. Trong đó, họ tìm thấy 704 vật phẩm bí mật độc nhất: 62 khóa API, 33 mật khẩu, 24 token truy cập và 30 địa chỉ email cá nhân. Nguy hiểm chính nằm ở chỗ thông tin này không bao giờ xuất hiện trong phần hội thoại có thể nhìn thấy — nó chỉ tồn tại bên trong "đầu" của mạng nơ-ron trong quá trình xử lý yêu cầu. Các bộ lọc bảo mật tiêu chuẩn chỉ kiểm tra câu trả lời cuối cùng, do đó bỏ qua các rò rỉ xảy ra ở giai đoạn tính toán nội bộ.
Tại sao điều này nguy hiểm
Bên cạnh việc rò rỉ trực tiếp, lỗ hổng này còn tiết lộ các khía cạnh không rõ ràng về hành vi của chính các mô hình:
- các hệ thống có thể xử lý các chủ đề bị cấm trong các lập luận nội bộ, ngay cả khi bề ngoài chúng từ chối một cách an toàn;
- mạng nơ-ron đôi khi biết câu trả lời đúng, nhưng trong quá trình "tư duy", chúng cố tình tạo ra lý do sai lệch;
- các khối mã hóa có thể được sử dụng cho các cuộc tấn công ẩn, chèn các hướng dẫn độc hại trực tiếp vào bộ nhớ hội thoại;
- cơ chế bảo vệ chống sao chép mô hình tỏ ra không hiệu quả với phương pháp trích xuất này.
Các tác giả nghiên cứu đã thông báo cho nhà cung cấp về vấn đề trước khi công bố, và một số lỗ hổng đã được vá. Tuy nhiên, chính kiến trúc trao đổi ngữ cảnh được mã hóa tạo ra những rủi ro hệ thống không thể khắc phục bằng các bản vá riêng lẻ. Thực tế có hàng nghìn thông tin đăng nhập thực tế trong các lớp ẩn của AI chỉ ra rằng các phương pháp đảm bảo bảo mật hiện tại đang tụt hậu so với khả năng của chính các mô hình và cách khai thác chúng.
Quan điểm của AI
Từ góc độ phân tích dữ liệu máy móc, lỗ hổng được phát hiện liên quan đến vấn đề rộng hơn của các hệ thống AI dạng tác nhân: khả năng chống chịu của mô hình trước các cuộc tấn công ẩn hiếm khi là một đại lượng tuyệt đối. Một kết luận tương tự được chứng minh bởi điểm chuẩn độc lập Gray Swan, theo đó tỷ lệ tiêm prompt gián tiếp thành công cho mô hình Claude Opus 4.5 là 4,7% trong một lần thử, nhưng tăng lên 63% trong một trăm lần thử. Logic tương tự cũng áp dụng cho các khối lập luận được mã hóa: một thí nghiệm thành công duy nhất của Panfilov không loại bỏ được bản chất xác suất của rủi ro — khi mở rộng quy mô tấn công lên hàng triệu cuộc hội thoại, tỷ lệ rò rỉ có thể tăng lên nhiều lần.
Một yếu tố riêng biệt chưa được tính đến — kinh tế học của chính sự bảo vệ. Cơ chế mã hóa ngữ cảnh được phát triển chủ yếu để bảo vệ tài sản trí tuệ, chứ không phải quyền riêng tư của người dùng, do đó mâu thuẫn mục tiêu được thiết lập ngay từ đầu trong kiến trúc. Liệu ngành công nghiệp có thể cho phép mình xây dựng lại kiến trúc này nhanh hơn sự xuất hiện của các cách thức mới để vượt qua nó?
end-content




