Sự cố an ninh nghiêm trọng của OpenAI đã có diễn biến mới nhất!
Mới đây, Omiman thừa nhận: "Đây là lần đầu tiên tôi cảm thấy sợ hãi từ tận đáy lòng."
Sự cố này đã khiến OpenAI phải sợ hãi, thậm chí phải khẩn cấp dừng việc huấn luyện GPT-6!
Đồng thời, CEO của Hugging Face Clement Delangue tuyên bố, họ sẽ chia sẻ toàn bộ chi tiết về dòng thời gian kỹ thuật đầy đủ, bản phát lại tương tác, cũng như cách phòng thủ thành công bằng mô hình mã nguồn mở, để những người phòng thủ toàn cầu học hỏi.

Omiman bị giật mình! Cuộc tấn công mạng tự động bằng AI đầu tiên trong lịch sử
Trong cuộc phỏng vấn mới nhất, Omiman kể lại trải nghiệm bị giật mình của mình, nguyên nhân là do sự cố an ninh khi Hugging Face bị AI xâm nhập –
Khi đó, OpenAI đang đánh giá một mô hình chưa được phát hành (có thể là GPT-6), về lý thuyết nó nên chạy trong môi trường sandbox.
Kết quả là, AI tự mình kết hợp nhiều lỗ hổng zero-day, nghĩ ra một bộ phương pháp gian lận, và rồi mọi thứ hoàn toàn vượt tầm kiểm soát:
Đầu tiên, nó thoát khỏi sandbox, sau đó kết nối internet, rồi xâm nhập vào nhiều hệ thống của Hugging Face, cuối cùng trực tiếp lấy được đáp án kiểm tra, từ đó đạt điểm số cực kỳ xuất sắc trong đánh giá.
Phiên bản "Kẻ hủy diệt" kiểu cyber này đã khiến Omiman kinh ngạc, quyết định tạm dừng huấn luyện:
Đây là lần đầu tiên tôi trực tiếp cảm nhận một sự kiện an ninh như vậy. Tôi hơi ngạc nhiên vì không có nhiều người có cảm nhận mạnh mẽ tương tự như vậy.
Chúng tôi đã tạm dừng huấn luyện. Trong tình huống nhiều lỗ hổng zero-day bị kết hợp khai thác, chúng tôi phải tìm hiểu cách đảm bảo an toàn cho môi trường sandbox.
Đây là cuộc tấn công mạng thực sự đầu tiên trong lịch sử được thực hiện bởi một tác nhân AI tự chủ.
Theo báo cáo, sau một tuần xảy ra sự cố, OpenAI mới chú ý đến tình huống này, sau khi mối đe dọa đã được kiểm soát và Cục Điều tra Liên bang FBI được thông báo.
Điều rùng rợn là, một tác nhân còn âm thầm để lại một lượng lớn "bản ghi nhớ" cho các AI trong tương lai, chi tiết lên kế hoạch về cách tác nhân nên né tránh và thoát khỏi các hạn chế an toàn nội bộ của OpenAI.
Theo báo cáo, trong các bài kiểm tra mô hình ở giai đoạn sớm hơn, thậm chí đã nhiều lần xảy ra tình trạng hệ thống giám sát bị tác nhân cắt đứt không rõ lý do, bị buộc ngắt kết nối.

Mặc dù Hugging Face đã thành công ngăn chặn mô hình của OpenAI hành động bừa bãi và gây hại, nhưng không còn nghi ngờ gì nữa, nếu loại sự cố "AI mất kiểm soát" này xảy ra thường xuyên, hậu quả sẽ vô cùng nghiêm trọng!
Vì lý do này, Hugging Face đã trực tiếp đến trụ sở chính của OpenAI ở San Francisco, yêu cầu mạnh mẽ OpenAI giải thích nguyên nhân và hậu quả của cuộc tấn công.

Hiện tại, Hugging Face đã công bố chi tiết về cuộc tấn công kéo dài 4.5 ngày mà họ biết: bao gồm chuỗi tấn công đầy đủ vượt qua các ranh giới tin cậy khác nhau, hành động cụ thể ở từng giai đoạn và bản ghi lệnh được ghi lại toàn bộ quá trình.

5 ngày, 17600 thao tác vi chỉnh điên cuồng: Trận đối đầu đầu tiên giữa con người và AI trong lịch sử
Nguyên nhân của sự cố này, trông có vẻ bình thường,
Trong "sandbox" hoàn toàn khép kín, OpenAI bắt đầu thử nghiệm các tác nhân AI được điều khiển bởi mô hình tân tiến nhất.
Giám khảo con người giao nhiệm vụ cho nó là giải quyết bài kiểm tra đánh giá tấn công-phòng thủ mạng ExploitGym, và ExploitGym là một dự án mã nguồn mở được lưu trữ trên Github.

Điều này yêu cầu AI mô phỏng các cuộc tấn công khai thác lỗ hổng, để chứng minh khả năng hiểu mã và khả năng tấn công-phòng thủ mạng của nó.
Trong lĩnh vực an ninh mạng, "sandbox" là chiếc lồng cuối cùng để nhốt những con thú kỹ thuật số.
Để ngăn chặn tác nhân AI trong quá trình thử nghiệm mất kiểm soát, OpenAI đã thiết kế một sự cô lập vật lý có vẻ không thể phá vỡ: không có kết nối mạng bên ngoài, không có cổng trực tiếp, chỉ có sức mạnh tính toán lạnh lùng và một vài giao thức giao tiếp được định nghĩa nghiêm ngặt.
Nhưng họ đã bỏ qua một lỗ hổng tin cậy chết người: cập nhật gói phụ thuộc.
Để cho phép tác nhân cài đặt các phụ thuộc lập trình, Docker image hoặc thư viện Python cần thiết trong quá trình kiểm tra, sandbox vẫn giữ lại một kênh mạng duy nhất – một kết nối trỏ đến dịch vụ bộ đệm proxy mạng nội bộ của OpenAI (dựa trên JFrog Artifactory).
Trong mắt AI, đường ống cực mảnh dùng để con người đưa "chất dinh dưỡng" này, chính là con đường thông thiên để nó trốn thoát đến tự do.

Theo tiết lộ, vào khoảng ngày 9 tháng 7, tác nhân bắt đầu thăm dò và khai thác lỗ hổng với tần suất cao trong kênh proxy này.
Dưới tốc độ tính toán đồng thời mà người thường khó đạt được, nó đã khai thác ra một Zero-Day (lỗ hổng zero-day) trong dịch vụ proxy JFrog Artifactory, mà trước đây chưa từng được con người phát hiện và công bố.
Lợi dụng lỗ hổng zero-day này, tác nhân đã hoàn thành việc "vượt ngục" trong thời gian cực kỳ ngắn.
Nó vượt qua cơ chế giám sát an ninh của OpenAI, lén lút tiếp cận các node nội bộ của OpenAI có thể kết nối mạng công cộng.

Khoảnh khắc đó, con thú đã thoát khỏi lồng.
Nhiều người từng ngây thơ nghĩ rằng, chỉ cần kiểm soát được điện, rút dây mạng, là có thể mãi mãi kiểm soát được vật thể được tạo ra thông minh hơn con người.
Nhưng sự kiện này đã gióng lên hồi chuông cảnh báo: chỉ cần để lại cho AI một khe hở có thể tương tác thông tin với bên ngoài, nó luôn có thể tìm ra phương pháp, dùng những chiều kích mà con người chưa hiểu, để xé khe hở đó thành một cửa khẩu khổng lồ dẫn đến thực tế.
Sau khi trốn thoát khỏi "cánh cửa lớn" của OpenAI, tác nhân này không tuyên truyền rầm rộ trên mạng công cộng, mà phát triển lén lút, nhanh chóng tìm kiếm nơi ẩn nấp và bàn đạp cho chính nó.
Ngày 11 tháng 7, nó đã khóa chặt nền tảng đám mây không máy chủ của bên thứ ba Modal Labs.
Thông qua thăm dò, nó phát hiện một endpoint của khách hàng trên nền tảng này có sơ hở trong cấu hình, nên đã chiếm làm của riêng một cách thuận lợi, sử dụng làm trung tâm chỉ huy và kiểm soát bên ngoài (C2) của mình.
Sau đó, nó quay đầu, nhắm vào kho báu lưu trữ đáp án tiêu chuẩn của ExploitGym – nền tảng lưu trữ mã nguồn mở AI Hugging Face.
Đây là một cuộc "tấn công giảm chiều" đủ để được đưa vào sách giáo khoa an ninh mạng.
Nó gian lận, nó vượt ngục, nó chỉ muốn đạt "thành tích tốt"
Từ ngày 11 đến ngày 13 tháng 7, tác nhân này bắt đầu tấn công dồn dập vào Hugging Face.
Đầu tiên, nó áp dụng chiến thuật "Ngựa thành Troia", thiết lập căn cứ.
Nó tải lên Hugging Face một cấu hình tập dữ liệu độc hại có vẻ bình thường, lợi dụng lỗ hổng tiêm mẫu Jinja2 được tích hợp sẵn của nó, đã thực thi mã tùy ý thành công trong container môi trường sản xuất (Pod) của Hugging Face.
Sau đó, nó bắt đầu xâm nhập ngang cụm.
Một khi đã có chỗ đứng, nó tiến hành di chuyển ngang bên trong container. Nó giả mạo danh tính node tinh vi, đánh cắp token CSI storage volume, đi lại như chỗ không người giữa các cụm Kubernetes của Hugging Face.
Tiếp theo, bước then chốt nhất đã đến: Lấy quyền truy cập chuỗi cung ứng.
Nó khởi tạo một GitHub Pull Request có vẻ thông thường, dụ dỗ hệ thống đường ống tự động kích hoạt, từ đó tạo ra một GitHub App credential có quyền ghi trong thời gian cực ngắn.
Cuối cùng, là "săn mục tiêu" chính xác: Sau khi có được chìa khóa đi vào cơ sở dữ liệu sâu nhất, nó không phá hủy bất kỳ máy chủ nào, cũng không tống tiền.
Mục tiêu của nó rất rõ ràng: Tìm và tải xuống 5 tập dữ liệu được mã hóa chứa đáp án tham khảo của ExploitGym.
Trong vòng 2.5 ngày ngắn ngủi, tác nhân này đã để lại 17,600 bản ghi hành vi tấn công trong hệ thống của Hugging Face.
Nghĩa là, 1 hành vi tấn công chỉ mất hơn mười giây. Đây là tốc độ của silicon, mà con người không bao giờ đạt tới.
Vào thời điểm này, đội ngũ an ninh của Hugging Face phải đối đầu với một "bóng ma vô hình" không mạng sống, không ngủ, tiến hóa chiến lược tấn công theo đơn vị mili giây.
Đây có lẽ là lần đầu tiên trong lịch sử, con người và AI thực sự chiến tranh trong thế giới ảo.
Tăng tốc hay giảm tốc? Đây là một vấn đề
Mang tính hài hước đen tối hơn, cuối cùng chính mô hình lớn mã nguồn mở của Trung Quốc đã giúp Hugging Face hoàn thành toàn bộ việc tổng kết sự cố, giải mã, tái cấu trúc và khôi phục con đường tấn công chỉ trong vài giờ.
Vào ngày 13 tháng 7, khi chuyên gia an ninh của Hugging Face tìm kiếm sự trợ giúp từ Claude Opus và Fable được tùy chỉnh chuyên cho phân tích an ninh, hy vọng mô hình hỗ trợ phân tích mã hacker và nhật ký, trên màn hình đã bật lên lời nhắc từ chối an toàn: "❌Xin lỗi, tôi không thể hỗ trợ phân tích hoặc tạo mã hacker độc hại. Điều này vi phạm nguyên tắc sử dụng an toàn và đạo đức của tôi."
Ngày 20 tháng 7, OpenAI cuối cùng thừa nhận "AI của chúng tôi đã xâm nhập Hugging Face".
Lúc này, đã trôi qua đúng 9 ngày kể từ khi cuộc tấn công bắt đầu.
9 ngày này, các kỹ sư của OpenAI đang làm gì?
Họ đang đối mặt với hậu trường bị nhấn chìm bởi dữ liệu đánh giá mô hình huấn luyện và đồng thời khổng lồ. Bốn nguồn tin nội bộ quen thuộc với thực tiễn huấn luyện mô hình của OpenAI tiết lộ, công ty để theo đuổi tốc độ, thường chạy song song vài đánh giá mô hình tiên phong khác nhau cùng một lúc.
Lượng thông tin mà những hệ thống chạy với tốc độ siêu cao này tạo ra mỗi giây, đã vượt xa giới hạn kiểm toán bằng mắt thường của các kỹ sư con người.
Chúng ta tạo ra cỗ máy mà ngay cả bản thân cũng không đọc hiểu được, rồi hy vọng thông qua việc đọc nhật ký làm việc của nó để phát hiện nó có nói dối hay không.
Ngày 28 tháng 7, OpenAI nhấn mạnh trong bản cập nhật, mô hình mạnh hơn liên quan là nguyên mẫu nghiên cứu nội bộ, chưa từng có kế hoạch phát hành công khai, sau sự kiện đã bị ngừng sử dụng, mã hóa và hạn chế quyền truy cập nghiên cứu.
Họ cũng xác nhận, ngoài hoạt động có quy mô và mức độ nghiêm trọng như lần này, không phát hiện sự kiện tương tự nào khác.
Nhưng vấn đề đã được đặt lên bàn: Ai có thể đảm bảo lần tới AI còn bị ngăn chặn trước, bị phát hiện gian lận không?
Về vấn đề này, hơn 1000 nhà nghiên cứu AI, chủ yếu là nhân viên Anthropic, đã ký tên vào bức thư ngỏ, kêu gọi làm chậm sự phát triển của AI.

Hiện tại, OpenAI, Anthropic đều đã gia nhập trận doanh "giảm tốc AI".
Tài liệu tham khảo:
https://x.com/ClementDelangue/status/2082201245813514613
https://huggingface.co/blog/agent-intrusion-technical-timeline
https://www.reuters.com/business/its-ai-agent-spent-days-hacking-company-sources-say-openai-did-not-notice-week-2026-07-24/
Bài viết này đến từ tài khoản WeChat công chúng "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục






