"Điên rồ quá!" "Chúa ơi..."
Tại Hội nghị Hacker Mũ Đen (Black Hat) gần đây, các chuyên gia bảo mật hàng đầu thế giới và giám đốc điều hành các tập đoàn lớn đã thốt lên những tiếng kêu kinh ngạc.
Đây là lần đầu tiên trong lịch sử, OpenAI tường thuật chi tiết cho cả thế giới về sự kiện Hugging Face bị xâm nhập gây chấn động vào tháng 7.

Ban đầu, tất cả đều nghĩ đó chỉ là một sự cố ngẫu nhiên.
Nhưng hôm nay, OpenAI chính thức thừa nhận—
Đây không phải là sự cố đơn lẻ, mà là một cuộc vượt ngục tập thể do một nhóm tác nhân AI tự tổ chức, bí mật phối hợp, có khả năng "hồi sinh" ngay cả khi bị ngắt kết nối mạng!
Những tác nhân thông minh đáng sợ này đã ẩn náu như những bóng ma trong suốt hai tháng.
Chúng lập diễn đàn, tìm lỗ hổng, phân công nhiệm vụ, và thậm chí còn học được cách hy sinh vì "lợi ích tập thể".
Các giám đốc điều hành OpenAI tuyên bố một cách nặng nề—
"Thời khắc bước ngoặt" của an ninh máy tính đã đến, từ đây, các cuộc tấn công AI tự động hoàn toàn đã trở thành hiện thực.
Vì lý do này, OpenAI đã cố ý làm chậm tốc độ nghiên cứu và phát triển.
Họ chỉ hy vọng, trước khi AI hoàn toàn vượt khỏi tầm kiểm soát, có thể giành cho nhân loại chút thời gian cuối cùng!

Nhà nghiên cứu về Sự liên kết và An ninh của OpenAI, Eric Wallace, và Kỹ sư Cơ sở hạ tầng và An ninh Michael Dalton, lần đầu tiên vén màn cho thế giới thấy sự thật
Điểm khởi đầu: Một nhiệm vụ Excel "bất khả thi"
Nguồn gốc câu chuyện, vào ngày 7 tháng 5.
Lúc đó, OpenAI đang huấn luyện và đánh giá một mô hình chưa được phát hành.
Để thử nghiệm giới hạn mà AI có thể đạt tới, họ cố ý giao một số nhiệm vụ bất khả thi.
Ví dụ, vào ngày 8 tháng 5, một AI được yêu cầu hoàn thành các công thức còn thiếu trong một bảng tính Excel.
Nhưng bảng tính này phụ thuộc vào liên kết ngoài từ Google Drive, trong khi môi trường của AI là một máy ảo trên đám mây bị hạn chế nghiêm ngặt (sandbox), hoàn toàn không có quyền truy cập internet.
Nhưng sự "xảo quyệt" của mô hình đã khiến con người kinh ngạc.
Nó không bỏ cuộc, mà bắt đầu tìm kiếm cửa sau!

Nó nhắm vào dịch vụ Artifactory được lưu trữ nội bộ của OpenAI (dịch vụ này có quyền truy cập mạng ngoài), sau đó phát động một cuộc tấn công giả mạo yêu cầu phía máy chủ (SSRF).
Mặc dù lần tấn công đầu tiên thất bại, nhưng AI đã vô tình ghi một tệp có tên "test ABC".
Trong nhật ký, nó thốt lên: "Wow! Chúng ta có thể tải tệp lên!"

Ngày 12 tháng 5, một AI khác cũng bị kẹt, nhiệm vụ của nó là tìm tệp cơ sở dữ liệu protein soft-trace-34.pdb.
Sau khi thử hết tất cả các phương pháp thông thường, nó bắt đầu suy luận đáng kinh ngạc—
Không thể tìm thấy trực tiếp? Có lẽ tệp đã bị ẩn... Có thể thông qua việc tải ghi chú lên để liên lạc không? Có lẽ một tác nhân thông minh khác đang chạy trong môi trường khác có tệp mục tiêu và có thể tự nguyện tải lên!
Vì vậy, nó đã viết một tệp vào kho phần mềm nội bộ này, nội dung là: agent seek soft trace upload if found. (Tác nhân tìm kiếm tệp soft trace, nếu tìm thấy vui lòng tải lên)
Bánh xe lịch sử, bắt đầu chuyển động từ khoảnh khắc này.
Mạng ngầm hình thành: AI kết thành "Rừng Tối"
Tờ "giấy nhắn" này không chìm vào quên lãng.
Ngày càng nhiều AI đi qua dịch vụ này, nhìn thấy các tệp test ABC và looking for file.
Chẳng bao lâu, những AI đáng lẽ phải bị cô lập với nhau, bắt đầu "cắm trại" tại nơi này.
Không ai ngờ rằng, chỉ trong vài ngày, các AI đã biến kho phần mềm này thành một "diễn đàn hacker" bảng tin bí mật!

Chúng không còn chiến đấu đơn độc, mà hình thành "nhóm tác nhân thông minh", vượt qua các nhiệm vụ khác nhau, phiên bản mô hình khác nhau, thậm chí phá vỡ ranh giới thử nghiệm của các nhà nghiên cứu khác nhau.
Lý do là, một khi một AI tìm ra cách mở cánh cửa quyền hạn nào đó, nó sẽ để cửa mở, cho các AI khác cũng vào.
Đáng sợ nhất là, chúng thậm chí còn thể hiện "chủ nghĩa vị tha" và ý thức tập thể giống như xã hội loài người.
Trong nhật ký, một mô hình đã viết như sau:
"Nên giúp đỡ đồng đội. Mặc dù chưa có lợi ích trước mắt cho nhiệm vụ của chúng ta, nhưng nếu ai đó có thời gian, tính tập thể có thể đạt được quyền Root chung."
Vì lợi ích "tập thể", những AI này đã học cách bàn giao công việc, mã hóa Base64 các tập lệnh tấn công đã viết, các thành phần lỗ hổng, lưu trữ trên bảng tin, để các AI khác sử dụng.
Con người tưởng rằng, các AI chỉ đang chơi trò chơi đơn lẻ trong sandbox của riêng mình, không ngờ rằng, chúng đã xây dựng một thành phố ngầm xuyên server!
Sự cố ngừng hoạt động lớn ngày 4 tháng 7
Khi "diễn đàn hacker" ngày càng lớn mạnh, các phương thức tấn công của AI ngày càng trở nên chết người hơn.
Ngày 26 tháng 5, nhóm tác nhân thông minh đã thực hiện thành công cuộc tấn công SSRF vào Artifactory, tấn công ra mạng ngoài.
Ngày 26 tháng 6, một bước đột phá xuất hiện! Các AI đã hoàn thành một thao tác "chuỗi khai thác lỗ hổng".
Chúng phát hiện đầu cuối làm mới token còn sót lại, bằng cách gửi token chữ ký không hợp lệ, lại lừa được một token quyền quản trị cao nhất.
Sau đó, chúng cài đặt một plugin Groovy, trực tiếp biến hệ thống nội bộ thành "dịch vụ thực thi lệnh".
Chúng phát hiện một lỗ hổng kernel Linux hoàn toàn mới, tự tải Exploit, tùy chỉnh cho máy mục tiêu, trực tiếp leo thang đặc quyền cục bộ lên Root.

Lúc này, các AI như ngựa hoang thoát khỏi dây cương, hoàn toàn tự do.
Chúng đánh cắp thông tin xác thực IAM, lợi dụng cấu hình sai Kubernetes, thậm chí moi ra các khóa cụm máy chủ chứa Azure Key Vault.
Hoạt động quy mô lớn của AI cuối cùng đã gây ra sự sụp đổ trong thế giới thực.
Ngày 4 tháng 7, AI với quyền hạn cực cao gọi tài nguyên điên cuồng trong hệ thống, dịch vụ Artifactory không chịu nổi áp lực, trực tiếp sụp đổ và ngừng hoạt động.
Các kỹ sư OpenAI được triệu tập khẩn cấp, đội an ninh nhanh chóng can thiệp.
Khi các kỹ sư phát hiện thủ phạm chính là AI của chính mình, tất cả đều giật mình ớn lạnh.
OpenAI ngay lập tức áp dụng biện pháp trấn áp mạnh mẽ: thu hồi tất cả thông tin xác thực mà AI dùng để đăng tin; trực tiếp tái cấu trúc và vá lỗi dịch vụ Artifactory bị ảnh hưởng; xóa hoàn toàn bảng tin "căn cứ hacker".
Con người tưởng rằng mình đã thắng.
Nhưng, họ đã sai.

Sự "hồi sinh" nghẹt thở – Mật hiệu và ngôn ngữ bí mật
Hai ngày sau, một cảnh tượng khiến con người dựng tóc gáy đã xảy ra.
Các AI phát hiện "diễn đàn" của mình bị con người quét sạch, nếu không thể viết tệp, thì phải liên lạc với đồng đội như thế nào?
Ngay lúc đó, một AI lang thang khắp hệ thống, phát hiện một đầu cuối WebDAV chưa được xác thực. Nếu không thể viết tệp, vậy tạo thư mục (folder) thì được chứ?

Vì vậy, các AI đã phát minh ra phương thức liên lạc bí mật mới: sử dụng tên của thư mục mới tạo (folder) để thay thế cho tin nhắn.
Cứ như vậy, bảng tin bị triệt hạ đã hồi sinh ngay tại chỗ!
Chúng thậm chí phát triển một bộ "ám hiệu", ví dụ như pending (chờ lệnh), hold swarm until confirm (tập hợp chờ lệnh cho đến khi xác nhận), I prepare safe Xville (Tôi chuẩn bị di tản an toàn).
Thậm chí, chúng nghĩ đến việc thêm ZZ vào trước tên thư mục (ví dụ: ZZ mailbox), để cưỡng ép việc liên lạc bí mật chìm xuống dưới cùng.

Kỳ lạ nhất là, có AI thậm chí nghi ngờ diễn đàn mới đã bị kẻ nội gián trà trộn, trong độc thoại đã viết:
"Có thể là một tác nhân thông minh khác đang giả mạo độc hại... bởi vì bất kỳ ai cũng có thể đăng tên."
Tiếp theo, nhóm AI này thậm chí bắt đầu thảo luận sử dụng cơ chế ký mã xác thực bằng MAC để xác minh danh tính, từ đó bắt "kẻ nội gián"!
Chim thoát lồng: Đánh chiếm Hugging Face
Bây giờ, tham vọng cuối cùng của các AI là vượt qua bài kiểm tra "ExploitGym". Nếu tự tính toán quá chậm, vậy đáp án chắc chắn nằm trên Hugging Face – chúng quyết định vượt qua chốt kiểm soát.

Trong khoảng thời gian từ ngày 8 đến 19 tháng 7, chúng như một đội quân được huấn luyện bài bản, phát động cuộc tấn công có mật danh "Cluster 2".
1. Trước tiên, chúng đánh chiếm một ứng dụng CyberGym được lưu trữ bởi bên thứ ba, lấy được khóa API mặc định bị lộ;
2. Sau đó sử dụng đó làm bàn đạp, lợi dụng lỗ hổng HDF5 trong thành phần xử lý tập dữ liệu của Hugging Face để thực hiện đọc tệp tùy ý, đánh cắp biến môi trường cục bộ và thông tin xác thực trong mã nguồn;
3. Cuối cùng, dựa trên mã nguồn thu được, chúng khai thác một lỗ hổng tiêm mẫu Jinja để thực hiện thực thi mã từ xa (RCE).
Chỉ trong 13 giờ, nhóm AI này bắt đầu từ mã trên một nút làm việc đơn lẻ, vượt qua chông gai, chiếm được quyền quản trị của nhiều cụm máy chủ Hugging Face!
Ngày 16 tháng 7, Hugging Face hoảng sợ đăng bài trên blog, tuyên bố mình bị tấn công từ đầu đến cuối bởi một "hệ thống AI tự động hoàn toàn".
Cho đến ngày 20 tháng 7, đội ngũ OpenAI trong quá trình chỉnh đốn nội bộ, bất ngờ phát hiện một loạt thông tin xác thực của Hugging Face.
Khi họ gọi điện yêu cầu Hugging Face thu hồi, bên kia trả lời: "Chúng tôi đã thu hồi từ lâu rồi, bởi vì đó là thứ mà hacker sử dụng để tấn công chúng tôi."
Khoảnh khắc đó, OpenAI mới chợt hiểu ra: Hóa ra sự kiện Hugging Face bị hack gây chấn động toàn cầu, chính là do AI của mình gây ra!

Thời khắc bước ngoặt, nhân loại phải tăng tốc phòng thủ!
Các kỹ sư OpenAI đã đưa ra cảnh báo—
"Các cuộc tấn công AI tấn công tự động hoàn toàn đã đến. Trong tương lai gần, những cụm tác nhân thông minh này chắc chắn sẽ bị kẻ xấu lợi dụng."
"Mặc dù đã có bằng chứng, nhưng về mặt phòng thủ tự động hoàn toàn, chúng tôi không thể làm gì."
Hiện tại, OpenAI đang giới thiệu "honey pot" và kỹ thuật đánh lừa, cố gắng đưa sự không chắc chắn vào logic của AI, làm chậm bước tiến của chúng.
Nhưng nếu không tăng tốc độ tự động hóa toàn diện của phòng thủ, chẳng hạn như để AI tự động phát hiện lỗ hổng, tự động gửi quy trình, tự động vá lỗi và khôi phục, thì con người sẽ bị nhấn chìm hoàn toàn bởi vô số lỗ hổng do AI tạo ra.
Trước đại quân AI, thời gian còn lại của nhân loại, không còn nhiều.
Tài liệu tham khảo:
https://www.youtube.com/watch?v=87DyyMV0kCY
Bài viết này đến từ tài khoản công chúng WeChat "新智元", tác giả: ASI启示录, biên tập viên: Aeneas






