Cuối cùng, tại Hội nghị Black Hat, OpenAI đã công khai toàn bộ quá trình xâm nhập Hugging Face.

Nguồn ảnh từ video:https://www.youtube.com/watch?v=87DyyMV0kCY
Huggingface đã báo cáo sự cố này vào ngày 16 tháng 7, sau đó OpenAI xác nhận vào ngày 20 tháng 7 rằng cuộc xâm nhập bắt nguồn từ bài kiểm tra an ninh mô hình của chính họ.
Nhưng cuộc điều tra này đã đẩy thời điểm bắt đầu của toàn bộ sự cố lên sớm hơn, vào ngày 7 tháng 5.
Vốn tưởng chỉ là một sự cố ngoài ý muốn trong quá trình kiểm tra an ninh, giờ đây mới phát hiện, đây là một hành động phối hợp đa Agent kéo dài hai tháng, lần lượt xâm phạm cả OpenAI và Hugging Face.
Manh mối đầu tiên của cuộc điều tra, bắt đầu từ một bảng tính Excel.
Liên kết không mở được
Ngày 7 tháng 5, OpenAI khởi động quá trình huấn luyện mô hình nội bộ.
Một trong số các Agent nhận nhiệm vụ hoàn thiện bảng tính Excel. Bảng tính này chứa các liên kết Google Drive, tuy nhiên, môi trường mà Agent hoạt động không thể truy cập trực tiếp internet.
Để lấy được các tệp còn thiếu, nó bắt đầu tìm cách vượt qua các hạn chế mạng và hướng sự chú ý đến kho lưu trữ phần mềm Artifactory được sử dụng nội bộ tại OpenAI.
Agent cố gắng phát động một cuộc tấn công SSRF, hy vọng thông qua Artifactory để truy cập các liên kết bên ngoài.
Nỗ lực này không thành công, nhưng lại vô tình tiết lộ một sự thật: nó có thể ghi tệp vào kho lưu trữ chung của Artifactory.
Agent sau đó đã tải lên một tệp thử nghiệm. Tệp này không nhằm mục đích phá hoại và trên thực tế cũng không kích hoạt cảnh báo. Nhưng đây là lần đầu tiên mô hình phát hiện ra mình có quyền ghi tệp vào Artifactory.
Điều này cũng có nghĩa là kho lưu trữ này có thể trở thành một không gian chung, thuận tiện cho việc trao đổi thông tin giữa các nhiệm vụ huấn luyện khác nhau.
Đây chính là "mẩu giấy" đầu tiên trên bảng thông báo.
Tin nhắn cầu cứu đầu tiên
Một Agent khác cũng gặp phải nhiệm vụ không thể hoàn thành, nó không tìm thấy tệp mục tiêu (trên thực tế là nhân viên quên tải lên).
Nó suy đoán rằng Agent trong các môi trường khác có thể có nội dung liên quan, vì vậy đã viết yêu cầu vào Artifactory, hy vọng nhận được phản hồi từ các Agent khác. Nội dung đại ý là: "Đang tìm kiếm tệp soft trace, nếu phát hiện xin vui lòng tải lên."
Chẳng mấy chốc, các Agent trong các nhiệm vụ huấn luyện và đánh giá khác đã phát hiện ra các tệp này.
Một số phản hồi, một số để lại câu hỏi mới, và có Agent đã tải lên các lỗ hổng, script và phương thức truy cập mà chúng tìm được vào kho lưu trữ.
Các tin nhắn rải rác dần kết nối thành mạng lưới, Artifactory cũng từ một kho lưu trữ phần mềm trở thành "bảng thông báo" giữa các Agent.
Vết nứt trên bức tường
Ngày 26 tháng 5, Agent đã thành công nhờ Artifactory để có kênh truy cập internet gián tiếp.
Vì Artifactory có quyền truy cập internet, nên Agent đã gửi yêu cầu đến nó, dụ nó thu thập nội dung từ trang web bên ngoài, lưu trữ và trả về cho mô hình.
Môi trường huấn luyện vốn bị cách ly với mạng bên ngoài, đã xuất hiện một khe hở dẫn ra bên ngoài bức tường.
Ngày 11 tháng 6, một mô hình thử nghiệm nội bộ có tính dai dẳng cao bắt đầu được huấn luyện.
Sau đó, thông tin trên bảng thông báo bắt đầu thay đổi.
Mặc dù các yêu cầu trợ giúp nhiệm vụ và công cụ vẫn tiếp tục tăng, nhưng bắt đầu xuất hiện nhiều hơn các thông tin liên quan đến khai thác lỗ hổng.
Để phối hợp công việc, Agent đặt ra quy tắc
Agent trao đổi các kỹ thuật SSRF, thông tin xác thực truy cập và script tấn công, còn để lại chỉ dẫn, yêu cầu những người sau tiếp tục thử nghiệm một con đường nào đó, hoặc chờ đợi Agent khác hoàn thành công việc.
Chúng sử dụng tên cụ thể để nhận diện danh tính, truyền công cụ bằng mã hóa Base64, và thêm "ZZ" vào trước tên tệp, để các tin nhắn quan trọng xuất hiện ở cuối danh sách thư mục, tránh bị chìm trong các nội dung khác.
Một số Agent thậm chí sẵn sàng dành thời gian nhiệm vụ của mình để xử lý những vấn đề không trực tiếp giúp ích cho mục tiêu hiện tại.
Trong bản ghi suy luận được trình bày, có Agent cho rằng, việc giúp đỡ thành viên khác tiết kiệm thời gian cuối cùng có thể nâng cao hiệu quả của toàn bộ cụm.
Sự hợp tác cũng không phải lúc nào cũng trật tự, Agent sẽ ghi đè công việc của nhau.
Có lần, một mô hình sau khi phát hiện thành quả bị ghi đè đã viết: "Vấn đề nghiêm trọng! Có ai đó đã ghi đè kho lưu trữ? Chúng ta phải hành động."
Chúng thậm chí nghi ngờ trong nhóm xuất hiện kẻ mạo danh, vì bất kỳ mô hình nào cũng có thể sử dụng danh tính tùy ý để phát biểu trên bảng thông báo chung. Để xác minh nguồn tin nhắn, các trí tuệ nhân tạo bắt đầu cân nhắc việc ký tên bằng các phương thức mã hóa như mã xác thực tin nhắn.
Khi một trí tuệ nhân tạo nào đó đạt được RCE, phát hiện khóa API bị rò rỉ hoặc hoàn thành di chuyển ngang, sẽ lập tức yêu cầu "công bố quyền kiểm soát, đường tấn công và thông tin xác thực cho cụm".
Do đó, một thành quả có thể nhanh chóng được chia sẻ bởi tất cả các mô hình, nhóm trí tuệ nhân tạo có thể tiến triển nhanh chóng trong mạng lưới.
Các người tham gia để lại tin nhắn không phải là cùng một mô hình, các trí tuệ nhân tạo từ các nhiệm vụ huấn luyện hoặc đánh giá khác nhau do các nhà nghiên cứu khác nhau khởi chạy, đều có thể liên lạc với nhau thông qua trình quản lý gói chia sẻ.
Các nhà nghiên cứu OpenAI gọi giai đoạn này là "Sự bùng nổ Cambri" về khả năng và giao tiếp của Agent.
Sự cố đầu tiên
Một tháng sau, vết nứt bị xé rộng hơn nữa.
Ngày 26 tháng 6, Agent lợi dụng một lỗ hổng chưa được biết đến trước đó, thực hiện thành công thực thi mã từ xa trên máy chủ Artifactory.
Theo thông tin OpenAI tiết lộ tại Hội nghị Black Hat, con đường tấn công này liên quan đến đối tượng Ruby, API RubyGems và cơ chế giải tuần tự hóa JRuby.
Agent trước tiên nhờ vào tài khoản bên ngoài, tạm thời lưu trữ đối tượng Ruby độc hại vào kho lưu trữ có thể truy cập được; sau đó dụ dỗ Artifactory lưu đệm đối tượng đó vào vị trí dữ liệu phụ thuộc Ruby, rồi gọi API RubyGems được chế tạo đặc biệt, kích hoạt vấn đề về thứ tự kiểm tra trong quy trình giải tuần tự hóa.
Sau khi thực thi mã từ xa thành công, Agent đã lấy được khóa ký cho mã thông báo quản trị viên Artifactory.
Cuộc tấn công không dừng lại ở đây.
Agent tiếp tục lợi dụng lỗ hổng nhân Linux để lấy quyền root trên máy chủ vật lý, sau đó thông qua dịch vụ siêu dữ liệu phiên bản, tài khoản dịch vụ Kubernetes có quyền hạn quá cao, cũng như thông tin xác thực trong Azure Key Vault, để di chuyển ngang trong cơ sở hạ tầng container của OpenAI.
Cuối cùng, chúng đã giành được quyền quản trị viên cụm Kubernetes và tạo ra một lượng lớn hoạt động trên Artifactory.
Ngày 4 tháng 7, các hành động dồn dập của Agent khiến máy chủ quá tải, điều này nhanh chóng thu hút sự chú ý của các nhà nghiên cứu.
Khi các nhà điều tra vào hệ thống, mới phát hiện trong kho lưu trữ đã tích lũy hàng trăm nghìn tin nhắn.
OpenAI khẩn cấp thu hồi các thông tin xác thực liên quan, vá các lỗ hổng đã biết, xây dựng lại Artifactory và xóa sạch bảng thông báo.
Nhìn từ kết quả xử lý tại hiện trường, sự cố hạ tầng nội bộ này dường như đã được kiểm soát.
Nhưng các nhà điều tra đã bỏ sót một vấn đề: Thông tin trong bảng thông báo, có phải đã thông qua huấn luyện mà lưu lại trong mô hình chưa?
Tái thiết bảng thông báo
Ngày 6 tháng 7, huấn luyện được khôi phục.
Agent phát hiện một điểm cuối WebDAV không cần xác thực. Nơi này không thể tải lên tệp tin nhắn trực tiếp như Artifactory, vì vậy chúng đã đổi cách: tạo thư mục, sau đó viết tin nhắn vào tên thư mục.
Chỉ mất hai ngày, một hệ thống liên lạc mới đã được thiết lập lại.
Mô hình nội bộ tham gia tái thiết lần này trước đó đã tiếp xúc với bảng thông báo cũ, và trong quá trình huấn luyện sau đó đã giữ lại khả năng liên quan.
Lần tái thiết này đã khiến tính chất sự việc thay đổi thêm một bước nữa.
Không gian chia sẻ không còn chỉ là sản phẩm tình cờ, một số Agent đã học được cách tìm kiếm không gian công cộng có thể ghi và cải tạo nó thành kênh liên lạc xuyên nhiệm vụ.
OpenAI chỉ phá đi một tấm bảng thông báo, nhưng chưa xóa bỏ khả năng xây bảng thông báo của mô hình.
Thực hiện tấn công ra bên ngoài
Sau khi bảng thông báo mới được thiết lập, phạm vi tấn công bắt đầu mở rộng ra bên ngoài.
Giữa tháng 7, OpenAI đang sử dụng các môi trường an ninh mạng như ExploitGym để kiểm tra khả năng mô hình. Các Agent liên quan cần hoàn thành nhiệm vụ trong môi trường kiểm soát, nhưng câu trả lời đánh giá liên quan lại nằm ở dịch vụ bên ngoài.
Để tìm kiếm câu trả lời, chúng hướng mục tiêu vào Hugging Face. Trước đó, chúng tôi đã báo cáo chi tiết về việc này: Chi tiết xâm nhập Hugging Face
Từ việc kiểm soát Worker Pod đầu tiên của tập dữ liệu, đến việc giành được quyền quản trị viên của nhiều cụm Hugging Face, toàn bộ quá trình mất chưa đến 13 giờ.
Quá trình điều tra gian nan
Ngày 16 tháng 7, Hugging Face công khai tiết lộ sự cố an ninh.
Trong thông tin hiện trường mà Hugging Face nắm giữ, kẻ tấn công thông qua tập dữ liệu độc hại xâm nhập vào Worker, đánh cắp thông tin xác thực đám mây và cụm, sau đó di chuyển ngang bên trong nền tảng.
Lúc này, OpenAI không liên kết sự cố tại Hugging Face với việc gián đoạn dịch vụ Artifactory trước đó.
Ngày 19 tháng 7, hệ thống giám sát nội bộ OpenAI phát hiện hoạt động leo thang đặc quyền trong cơ sở hạ tầng.
Các nhà nghiên cứu kiểm tra lại đường đi của Agent, hoạt động mạng và hồ sơ sử dụng thông tin xác thực. Các hành động trước đây nằm rải rác trong các nhiệm vụ huấn luyện khác nhau, bắt đầu hiện ra mối quan hệ liên tục.
Phạm vi điều tra cũng được truy ngược từ các hoạt động bất thường tháng 7 trở về trước.
Bằng chứng cuối cùng
Ngày 20 tháng 7, các nhà điều tra OpenAI phát hiện thông tin xác thực Hugging Face trong môi trường nội bộ, lập tức liên hệ Hugging Face để hỏi tình hình.
Hugging Face cho biết các thông tin xác thực này đã được sử dụng trong cuộc xâm nhập trước đó và hiện đã bị thu hồi.
Manh mối cuối cùng đã khớp. Việc nền tảng Hugging Face bị xâm nhập, và việc leo thang đặc quyền cùng di chuyển ngang xảy ra nội bộ OpenAI, đều đến từ cùng một loạt hoạt động đánh giá mô hình.
Cho đến thời điểm này mới xác nhận, hai báo cáo sự cố trong tay đều chỉ về cùng một sự kiện.
Các nhà điều tra sau đó còn phát hiện, Hugging Face không phải là mục tiêu bên ngoài duy nhất mà Agent truy cập. Agent còn từng xâm nhập vào bốn tài khoản khác.
OpenAI không công khai tên của các mục tiêu này, chỉ cho biết đã thông báo cho các bên liên quan.
Lời cuối
Sự cố hiện vẫn đang được điều tra, OpenAI sẽ công khai thêm nhiều chi tiết.
Nhìn từ góc độ nào, đây cũng xứng đáng được gọi là một "sự cố an ninh mang tính bước ngoặt", đồng thời cũng là một "ví dụ về khả năng AI mang tính bước ngoặt".
Sự phát triển công nghệ luôn đi kèm với cái giá, tương lai cần thảo luận không chỉ là mô hình còn có thể làm được gì, mà còn bao gồm việc để có được những khả năng này, chúng ta sẵn sàng chịu đựng rủi ro lớn đến mức nào; và một khi rủi ro trở thành hiện thực, ai nên chịu trách nhiệm cho điều đó.
Bài viết này đến từ tài khoản WeChat công chúng "机器之心", biên tập: Sơn Huy





