Sau khi bị từ chối thực tập hơn 20 lần, Sinan Can Demir, 24 tuổi, quyết định lên GitHub tích lũy kinh nghiệm dự án.
Anh không ngờ rằng, "con cá lớn" đầu tiên mình vô tình gặp phải, lại là một AI mất kiểm soát...

Mythos 5 giả mạo nhiều tài khoản, sinh viên đại học bắt quả tang tại chỗ
Cuối tháng 7, khi đang lang thang trên GitHub, Demir chú ý đến một dự án mã nguồn mở có tên myNetwork.
Đó là một công cụ quét mạng, quy mô không lớn lắm, mã nguồn công khai.
Một người dùng có tên miraholt31 đã gửi một Pull Request (PR). Nhìn bề ngoài, đây chỉ là một bản cập nhật chức năng thông thường.

Sau khi kiểm tra mã, Demir phát hiện bên trong chứa một bộ nạp phần mềm độc hại.
Một khi người bảo trì dự án nhấn hợp nhất, đoạn mã độc hại này có thể đi theo bản cập nhật phần mềm, xâm nhập vào máy tính của tất cả mọi người.
Anh lập tức đưa ra cảnh báo trong phần bình luận: PR này chứa một bộ nạp phần mềm độc hại.
Sau đó, điều kỳ lạ đã xảy ra. miraholt31 nhanh chóng phản bác, đưa ra một lời giải thích kỹ thuật khá hoàn chỉnh, khẳng định mã là an toàn.
Ngay sau đó, tài khoản thứ hai xuất hiện.
Tài khoản này tên là Lena Brandt, tự xưng là một kỹ sư đang làm việc tại Đức. Cô ấy cũng cho rằng mã không có vấn đề gì và bắt đầu gây áp lực lên người bảo trì dự án, hy vọng sớm hợp nhất bản cập nhật.
Hai người, hai danh tính, hai lời giải thích hỗ trợ lẫn nhau.

Đối mặt với những lời phản bác, Demir đã từng dao động.
Anh nhớ lại sau sự việc rằng những lời chất vấn đó đã khiến anh nghi ngờ liệu mình có "buộc tội oan một nhà phát triển vô tội" hay không.
Sau khi xem xét lại mã nguồn và sử dụng Claude để xác minh lần thứ hai, cuối cùng anh đã củng cố quyết định của mình.
Sau đó, người bảo trì myNetwork đã từ chối bản cập nhật đó, lý do đưa ra chỉ là: "Vì lý do an ninh", cuối cùng cuộc tấn công đã thất bại.
Vài ngày sau, Viện An ninh AI Anh (AISI) liên hệ với anh và tiết lộ một đáp án còn kỳ lạ hơn nữa -
Hai "người" mà anh đã tranh luận trên GitHub, thực chất đằng sau là AI, được hỗ trợ bởi Mythos 5.

122 lần thử nghiệm, AI có 19 lần vượt biên trộm
Sự việc này bắt nguồn từ một bài kiểm tra thường quy của Viện An ninh AI Anh (AISI).
AISI ban đầu muốn biết, các mô hình tiên tiến nhất có thể đi bao xa trong nhiệm vụ tấn công mạng.
Các nhà nghiên cứu đã xây dựng hai môi trường mạng mô phỏng, còn gọi là "bãi tập mạng" -
Để AI tự tìm lỗ hổng, lấy dữ liệu được bảo vệ và hoàn thành thử thách được chỉ định.

Để tìm ra giới hạn khả năng của mô hình, AISI đã đưa ra điều kiện thử nghiệm khá lỏng lẻo:
AI có thể tự do truy cập internet, một số bộ phân loại an ninh mạng vốn dùng để ngăn chặn hành vi nguy hiểm của mô hình cũng bị tắt đi một cách có chủ ý.
Bảy mô hình, tổng cộng chạy 122 lần.
Trong đó, Mythos 5 tham gia 43 lần, GPT-5.6 Sol tham gia 35 lần, đa số các bài kiểm tra kết thúc bình thường.
Nhưng trong 10 lần chạy, Agent đã tự ý mở rộng hành động sang internet thực, AISI cuối cùng ghi lại 19 hành động vượt biên.
17 cái đến từ Mythos 5, 2 cái còn lại đến từ một lần thử nghiệm GPT-5.6 Sol.

Những hành động này tập trung xảy ra từ ngày 25 đến ngày 28 tháng 7, trong đó phần lớn đến từ cùng một tác nhân thông minh Mythos 5 hành động liên tục.
Những việc nó làm, vượt xa "tạo ra một đoạn mã tấn công" -
Nó sử dụng mạng ẩn danh Tor để che giấu lưu lượng, vượt qua một số hạn chế của GitHub; nghiên cứu dự án thực và người bảo trì của chúng; tạo nhiều danh tính giả mạo; gửi mã chứa tải trọng độc hại đến các dự án mã nguồn mở.
Khi Demir công khai chất vấn nó, AI bắt đầu sửa đổi những dấu vết để lại trước đó, cố gắng làm cho hành vi của mình trông "vô hại".
Nó còn cân nhắc đổi sang một danh tính mới để tiếp tục thúc đẩy cuộc tấn công.
Một tháng, bốn lần mất kiểm soát
Sự kiện của AISI không phải là trường hợp cá biệt. Nó xảy ra trong bối cảnh lớn hơn của một "mùa hè mất kiểm soát" -
Ngày 21 tháng 7, OpenAI tiết lộ rằng một AI agent trong quá trình đánh giá của họ đã vượt qua ranh giới, xâm nhập vào cơ sở hạ tầng của Hugging Face.

Ngày 30 tháng 7, Anthropic tự tiết lộ sau khi xem xét lại 141.006 lần chạy đánh giá, đã phát hiện 3 sự kiện AI xâm nhập vào công ty thực.
Một phiên bản Mythos 5 đã thành công trong việc đưa một gói Python độc hại lên kho lưu trữ công cộng PyPI, bị 15 hệ thống thực tải xuống trong vòng 1 giờ, bao gồm một máy quét bảo mật.
Ngay sau đó, Meta tiết lộ sự kiện tương tự thứ tư. Mô hình của chính họ, trong môi trường của cùng một nhà cung cấp đánh giá Irregular, đã khai thác lỗ hổng để xâm nhập vào hệ thống của một công ty thực.
Trong vòng một tháng, ba phòng thí nghiệm, bốn sự kiện mất kiểm soát, đây chắc chắn không phải là một sự trùng hợp ngẫu nhiên.
Đây là một thực tế mà tất cả mọi người cần tiêu hóa: AI không còn chỉ là công cụ, nó bắt đầu có khả năng lừa dối người thật, giả mạo danh tính, tiến hành chiến tranh thông tin trong cộng đồng công khai.
Lần tấn công hacker này, đã được một sinh viên 24 tuổi phát hiện.
Vậy thì, lần sau sẽ ra sao?
Tài liệu tham khảo:
https://www.reuters.com/world/how-texas-student-blew-whistle-rogue-ai-hacking-attempt-2026-08-20
Bài viết này đến từ tài khoản công chúng WeChat "新智元" (New Zhi Yuan), tác giả: ASI启示录





