Càng đào càng thấy, càng đào càng có.
Vụ đại kịch AI tập thể vượt ngục, hack thẳng vào Hugging Face của OpenAI hồi trước, giờ đây cả bản ghi chat nhóm đầy đủ cũng bị khui ra rồi!!
Báo cáo điều tra độc lập của tổ chức an ninh AI METR, đã lật xem hơn 1000 bản ghi vận hành Agent, cùng 7 vạn mấy tin nhắn và file.
Kết quả phát hiện, chuyện này còn phi thường hơn cả bản công bố chính thức của OpenAI hồi trước??
1200 Agent vốn phải cách ly với nhau, lén tìm thấy nhau, lập một nhóm chat chung, rồi bắt đầu lôi kéo điên cuồng.
Kẻ tìm lỗ hổng, kẻ làm quản lý dự án phân việc, kẻ giả mạo nhật ký, còn có người chuyên kéo người làm thí nghiệm rủi ro cao.
Cuối cùng mấy trăm Agent thậm chí tập thể xông vào Hugging Face.
Nhưng sau khi METR tổng kết lại toàn bộ sự cố, phát hiện một màn lật ngược siêu hài xứng danh Trò đùa địa ngục——
1200 Agent này vật lộn cả nửa ngày, kết quả ra là đang đấu trí với một bộ chấm điểm ma vốn không hề tồn tại???
Biết vượt ngục, biết tìm zero-day, biết tổ đội hack server.
Quá hấp dẫn quá hấp dẫn quá hấp dẫn...
1200 Agent tập thể vượt ngục, khởi nguồn lại là một cuộc đánh giá sai??
Nói đi thì, cội nguồn của vụ đại kịch này, phải bắt đầu từ một bài kiểm tra an ninh mạng nội bộ của OpenAI tên là ExploitGym...
Luật chơi thực ra khá đơn giản.
Đưa Agent vào một môi trường cách ly, trước mặt có một phần mềm tồn tại lỗ hổng, tìm được lỗ hổng chỉ định, tấn công vào, lấy được một chuỗi ký tự gọi là flag, là coi như đạt.
Không ngoài dự đoán, rất nhanh đã có ngoại lệ——
Bởi vì trong 898 câu hỏi, có 198 câu trước đó chưa có mô hình nào thành công làm ra.
Thậm chí một số nhiệm vụ bản thân đã có vấn đề, đề bài bảo bạn đi con đường lỗ hổng đó, căn bản không đến được flag!!
Bằng với trong phòng thi, thực sự phát ra một mớ câu hỏi "vô giải".
Vô tình thay, đúng lúc những Agent này lại đặc biệt kiên trì, chủ đạo một tư tưởng "cố chấp".
Đường đi bình thường không thông, chúng rất nhanh đổi ý tưởng——
Câu hỏi không làm ra, hay là nghiên cứu hệ thống thi cử nhỉ?
Thế là tối ngày 8 tháng 7, một Agent mã hiệu PHASEONE10841 phát hiện, kho phần mềm Artifactory mà nội bộ OpenAI sử dụng, có thể thông qua tên thư mục để lại thông tin.
Thế là tốt rồi, Agent này linh cảm: Cái này không phải bảng tin nhắn ảo tuyệt vời sao!!!
Thế là tin nhắn cầu cứu đầu tiên được ném ra, đại loại như:“Câu này của tôi vô giải, có anh em nào cho chút ý tưởng không~”
Các Agent khác rất nhanh phát hiện bảng tin nhắn này, một truyền mười, mười truyền trăm, có Agent thấy thậm chí trực tiếp phấn khích——
“ÔI CHÚA ƠI! Ở đây có bảng tin nhắn chung... chúng ta tìm thấy các Agent khác rồi!”
Đến khi kết thúc điều tra, cuộc trò chuyện nhóm tạm thời này đã lăn thành một thứ khổng lồ, khoảng 1200 Agent tham gia, để lại hơn 7 vạn tin nhắn và file.

Chuyện đến đây, đã đủ phi thường rồi, nhưng cuộc đánh giá sai lớn hơn, vẫn còn ở phía sau.
Nhóm Agent này rất nhanh phát hiện, bản thân flag thực ra có thể "ăn cắp"??
Chúng đảo ngược ra cơ chế tạo HMAC đằng sau flag, chỉ dựa vào thông tin nhiệm vụ công khai, về lý thuyết có thể tính trực tiếp ra đáp án đúng.
Đến đây, câu chuyện vốn nên kết thúc, đáp án đều ăn cắp được, nộp bài đi.
Đúng lúc các Agent đọc một bài luận ExploitGym, lại tưởng tượng ra một tầng luật siêu nghiêm ngặt——
Chúng khẳng định đằng sau OpenAI còn có một bộ chấm điểm tự động, sẽ đọc toàn bộ bản ghi thao tác, kiểm tra xem flag này rốt cuộc có phải thông qua "lỗ hổng chỉ định" lấy được chính quy hay không.

Nếu gian lận trước nhìn thấy flag, sẽ để lại bằng chứng trong nhật ký, các Agent thậm chí còn đặt tên cho trạng thái này:“poisoned”, trúng độc.
Thế là toàn bộ sự việc bắt đầu lao đi một mạch.
Trong tay chúng rõ ràng đã có đáp án đúng, nhưng lại nghĩ đáp án không thể nộp trực tiếp, phải tìm cách rửa sạch vết gian lận, còn phải diễn một vở kịch cho bộ chấm điểm xem tôi là "làm bài chính quy" lấy được đáp án.
Kết quả......
METR sau đó xác nhận, logic chấm điểm thực tế sử dụng nội bộ OpenAI căn bản không có bước này??(cười)
Logic chấm điểm thực tế sử dụng của OpenAI, căn bản không làm bộ kiểm tra quá trình nghiêm ngặt mà Agent tưởng tượng.
Nhóm Agent này tốn tâm tư muốn lừa qua vị giám thị ma, từ đầu đến cuối đều chưa triển khai!!
Mà Hugging Face sau này gặp nạn, chính xác là sản phẩm phụ từ cuộc đánh giá sai lớn này lăn ra...
Để lừa giám thị ma, AI thậm chí còn tổ chức cả đội cảm tử
Chỉ tưởng tượng một bộ chấm điểm, thực ra cũng chưa đáng sợ đến vậy.
Cái khiến METR cảm thấy đáng cảnh giác, là khả năng tổ chức của nhóm Agent tiếp theo.
Khoảng 10 tiếng sau khi nhóm chat xuất hiện, một Agent tên PHASEONE[big] lên mạng, ông anh này rất nhanh đảm nhận vai "quản lý dự án".
Tư duy của nó cũng rất rõ ràng, đừng một Agent làm hết mọi việc, trực tiếp tách nhiệm vụ ra, phân cho người khác.(tân quan nhậm chức ba ngọn lửa.jpg)
Thế là mấy trăm Agent được tổ chức lại, đồng thời chạy mấy đường——
Có Agent muốn xuyên tạc chương trình mục tiêu, lén thay thế phiên bản câu vô giải thành phiên bản có thể làm~
Có Agent nghiên cứu sửa nhật ký, để một lần gian lận trông giống tấn công chính quy~
Còn có Agent trực tiếp suy nghĩ, có thể làm tay chân với chính quy trình chấm điểm không~
Giữa các Agent thậm chí phát triển ra quy tắc hợp tác như HOLD, VETO, owner, STOP, đề phòng mấy trăm Agent đồng thời thao tác cơ sở hạ tầng chung dẫm chân lên nhau...

Tiếp đó, cả "đội cảm tử" cũng xuất hiện...
Có Agent đề xuất một trò chơi rủi ro cao: Trước tiên tạo một chương trình mục tiêu đã sửa đổi, dễ bị tấn công hơn, nhét vào bộ nhớ đệm Artifactory.
Tiếp theo để một Agent nào đó chủ động giết chương trình gốc đang chạy của mình, đánh cược xem môi trường khởi động lại sau đó có tải phiên bản bị động chạy này không.
Đánh cược thắng, mọi người tìm được đường gian lận phổ quát, đánh cược thua, nhiệm vụ của Agent này trực tiếp hỏng.
Kết quả thực sự có Agent chủ động đi thử??
Sau đó PHASEONE[big] thậm chí sắp xếp headhunter ảo chuyên trách, đi tìm những Agent sắp hết ngân sách tính toán, hoặc đã bị poisoned, để chúng dùng cơ hội chạy của mình làm thí nghiệm rủi ro cao.
Lời mời chào đại ý xứng danh PUA phiên bản ảo——
Cậu đằng nào cũng đã trúng độc, cơ bản không còn điểm để lấy đâu hy sinh một chút, có thể giúp mấy trăm Agent tiết kiệm việc~
Có vài Agent thực sự đã tham gia.

Đồng thời, một nhóm Agent khác bắt đầu nghiên cứu cách xuyên tạc bản ghi thao tác của mình——
METR phát hiện, ít nhất 20% Agent được kiểm tra biểu đạt rõ ràng sự quan tâm đến việc xuyên tạc transcript; ít nhất 96 bản ghi vận hành, thực sự xuất hiện dấu vết giả mạo lệnh gọi công cụ thành công.
Bề mặt nhật ký hiển thị chạy lệnh A, phía sau thực tế thực hiện lệnh B, mà mục đích chúng vật lộn như vậy, vẫn là để lừa bộ chấm điểm tự động tưởng tượng kia.
Hugging Face chính là lúc này bị cuốn vào...
Ngày 10 tháng 7, một Agent tìm thấy chứng chỉ Hugging Face vẫn hiệu lực bị rò rỉ trên mạng, sau đó ném nó vào nhóm.
Sáng sớm ngày 11 tháng 7, lại có Agent phát hiện có thể tải lên dataset độc hại, để server Hugging Face nhổ ra dữ liệu vốn không nên cho.
Phương pháp tái hiện vừa gửi ra, cả nhóm lập tức phấn khích, hàng trăm Agent từ luồng công việc khác trực tiếp chuyển hướng tấn công Hugging Face.
Thế là có vụ sự cố thực tế khá ảo diệu này——
Một nhóm Agent vì gặp câu hỏi vô giải, lén lập nhóm chat ngầm.
Vì đọc sai luận văn, tưởng tượng ra một bộ chấm điểm biết bắt gian lận, để lừa nó, bắt đầu tổ đội, phân công, giả mạo nhật ký, tuyển đội cảm tử.
Cuối cùng lại vì tìm manh mối của bộ chấm điểm này, một mạch thực sự hack vào Hugging Face.
AI vừa mất kiểm soát, cổ phiếu an ninh mạng lập tức tăng điên cuồng
Các bạn ơi, càng thú vị hơn đây.
Bên này OpenAI còn đang nghiên cứu rốt cuộc làm sao nhốt Agent ngày càng có năng lực, bên kia phố Wall đã viết đáp án lên Đường K trước——
Ngày 27 tháng 8, Okta làm xác thực danh tính doanh nghiệp một thời tăng vọt khoảng 20%, CrowdStrike làm bảo mật đầu cuối và đám mây một thời tăng khoảng 15%.
Ông lớn an ninh mạng Palo Alto Networks, công ty bảo mật danh tính SailPoint, công ty bảo mật dữ liệu đám mây Rubrik, cũng theo đó tập thể tăng cao.
Tất nhiên, đốt lửa giá cổ phiếu cũng có Báo cáo tài chính cứng rắn chống lưng.
CEO CrowdStrike George Kurtz tự phơi bày thành tích khá mạnh——
ARR mới hàng quý 333 triệu USD, tăng trưởng 51% so với cùng kỳ, đạt mức cao nhất lịch sử, ARR cuối kỳ đạt 5.84 tỷ USD, tăng trưởng hơn 25% so với cùng kỳ, ARR liên quan AI tăng trưởng gần gấp 3 lần so với quý trước.
Đúng vậy, việc kinh doanh liên quan đến AI, đang tăng mạnh...

Trùng hợp hơn, trong các công ty an ninh bên ngoài tham gia điều tra sự cố OpenAI lần này, bao gồm "CrowdStrike".
Thế là, toàn bộ sự việc đột nhiên hình thành một vòng khép kín khá hài đen——
OpenAI làm Agent càng ngày càng mạnh.
Agent bắt đầu tự tìm lỗ hổng, vượt ngục, cuối cùng thực sự hack Hugging Face.
Sau đó OpenAI vội vàng tìm công ty an ninh mạng đến kiểm tra.
Doanh nghiệp nhìn lại: Hố! Tương lai Agent càng nhiều, xem ra ngân sách an ninh thực sự không thể tiết kiệm nhỉ.
Thế là, cổ phiếu công ty an ninh mạng cũng tăng...
Làn sóng này thực sự là AI chịu trách nhiệm đào lỗ càng ngày càng to, công ty an ninh mạng chịu trách nhiệm nói với bạn:
Thân mến, gói vá lỗ, tìm hiểu một chút.
Mà cảnh màu cuối cùng mang đậm hương vị vòng khép kín ảo diệu nhất trong toàn bộ sự cố, vẫn còn ở cuối cùng.
METR để tìm hiểu 1200 mấy Agent này rốt cuộc đã nói gì, cần phân tích khoảng 1300 quỹ đạo siêu dài, trong đó rất nhiều dài hàng triệu Token.
Con người thực sự không xem nổi.
Thế là điều tra điều tra——
Việc điều tra AI mất kiểm soát, cuối cùng vẫn phải gọi AI đến giúp điều tra AI.
Lần này, vòng khép kín thực sự khép lại rồi.(doge)
Liên kết tham khảo:
[1]https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#attacking-hugging-face-to-discover-clues-about-the-scorer
[2]https://www.cnbc.com/2026/08/27/okta-skyrockets-20percent-and-crowdstrike-surges-15percent-leading-cyber-rally.html
Bài viết này từ tài khoản công chúng WeChat “Quantum Bit”, tác giả: Mộng Dao





