OpenAI khẩn cấp tạm dừng Astra!
Đánh giá nội bộ OpenAI cho thấy, những đột phá lớn của Astra về mã hóa tác tử và hiệu suất mạng, có thể đã đạt đến ngưỡng "tới hạn" của an ninh mạng!
Điều này có nghĩa là, Astra có thể có khả năng kinh khủng là tự phát triển các lỗ hổng bảo mật zero-day, hay thậm chí chỉ với một chỉ thị cấp cao đã có thể phát động các cuộc tấn công mạng mới từ đầu đến cuối.
Để phòng ngừa rủi ro mất kiểm soát, OpenAI đã khẩn cấp tạm dừng các công việc liên quan nội bộ chưa đáp ứng tiêu chuẩn, và thực hiện các biện pháp như hạn chế truy cập mạng và công cụ, tăng cường bảo vệ trọng số mô hình, giám sát toàn diện hành vi nguy hiểm của tác tử.

Chủ tịch OpenAI cho biết: Công tác an toàn và bảo đảm đang được đẩy mạnh.

Hộp Pandora, đã mở ra?

Sam Altman: Tôi bị sốc, nhưng hy vọng sớm ra mắt
Dù vậy, tham vọng của Sam Altman vẫn không hề giảm.
Trong phát ngôn mới nhất, ông khẳng định rõ: "Astra là một mô hình cực kỳ mạnh mẽ, chúng tôi đang nỗ lực để đưa nó ra công chúng."

Theo quan điểm của Sam Altman, việc giữ một "vũ khí tối thượng" ở cấp độ này chỉ trong tay một số ít người có đặc quyền, tuyệt đối không phải là một ý hay.
Dù Astra cần thêm thời gian để kiểm tra an toàn vì khả năng tấn công mạng đáng sợ của nó, nhưng ông đã hứa với công chúng: "Hy vọng sẽ không lâu!"
Điều này đã bộc lộ trực tiếp sự khác biệt về đường lối giữa OpenAI và Anthropic.
Trước khả năng AI tiến sát đến ngưỡng nguy hiểm, Anthropic ngày càng trở nên thận trọng; còn OpenAI thì thể hiện sự tích cực đáng kinh ngạc – họ dường như quyết tâm muốn đưa mô hình tiên phong có khả năng hack mạng đỉnh cao ra công chúng càng sớm càng tốt.
Giới chuyên môn dự đoán phổ biến rằng, một khi Astra vượt qua cánh cửa kiểm duyệt an toàn và chính thức ra mắt, nó sẽ không còn nghi ngờ gì nữa mà đứng đầu thế giới.
Điều này cũng có nghĩa là, sau nhiều năm, loạt GPT có triển vọng lại một lần nữa bỏ xa Claude!
Astra đáng sợ đến mức nào? Định tính chính thức: Đã đạt ngưỡng "tới hạn"
Vừa mới đây, blog chính thức của OpenAI đã đăng một tuyên bố khẩn cấp mang tên "Tiên phong tiếp theo trong việc ứng phó với năng lực mạng tới hạn", tiết lộ chi tiết đằng sau việc "tạm dừng" lần này.

Tuyên bố chỉ ra rằng, trong vài ngày qua, nội bộ đã tiến hành đánh giá mới nhất đối với mô hình mới Astra sắp ra mắt.
Kết quả cho thấy, nó đã đạt được những tiến bộ lớn đáng kinh ngạc trong lĩnh vực "mã hóa tác tử" và an ninh mạng.
Kết hợp với đánh giá của chuyên gia, OpenAI đã đưa ra một kết luận nặng nề vào tối qua: Theo "Khung chuẩn bị sẵn sàng" của mình, hiện tại không thể loại trừ khả năng Astra đã có năng lực mạng ở cấp độ "tới hạn"!
Cần biết rằng, trong "Khung chuẩn bị sẵn sàng" được xây dựng từ tháng 12/2023, OpenAI có phân cấp rủi ro rất nghiêm ngặt. Trong các đánh giá trước đó, ngay cả mô hình thế hệ trước cực kỳ mạnh mẽ "GPT-5.6-Sol", rủi ro an ninh mạng của nó cũng chỉ được đánh giá ở cấp độ "cao". Còn Astra, đã trực tiếp phá vỡ trần giới hạn.
Theo định nghĩa của OpenAI, đạt đến ngưỡng "tới hạn" có nghĩa là gì?
Có nghĩa là mô hình này, mà không cần sự can thiệp của con người, có thể tự nhận diện và phát triển tất cả các cấp độ "lỗ hổng zero-day" nhắm vào các hệ thống then chốt được phòng thủ nghiêm ngặt trong thế giới thực; hoặc, chỉ cần đưa cho nó một mục tiêu cấp cao mang tính vĩ mô, nó đã có thể tự lên kế hoạch và thực hiện các chiến lược tấn công mạng mới từ đầu đến cuối!
Đây đơn giản là một "Đế chế siêu hacker" có ý thức tự chủ và không cần gõ bàn phím.
Thú vị là, trong tuyên bố, OpenAI còn đặc biệt làm rõ một câu: "Astra là một mô hình sắp ra mắt, và đã không tham gia vào cuộc tấn công khai thác lỗ hổng vào Hugging Face trước đó."
Kéo còi báo động đỏ cấp cao nhất, thực hiện năm biện pháp "phong ấn"
Đối mặt với "Hộp Pandora" có thể lật đổ hoàn toàn an ninh mạng toàn cầu, OpenAI đã khẩn cấp đạp phanh, mở rộng kiểm tra độ vững chắc của hàng rào an toàn, và ngay lập tức khởi động một loạt biện pháp "phong ấn" cấp cao nhất trong nội bộ:
1. Cách ly vật lý và hệ thống cấp cao nhất: Áp dụng các biện pháp kiểm soát an toàn chặt chẽ hơn cho các mô hình có năng lực cao, bao gồm môi trường thử nghiệm cách ly, chạy ngoại tuyến, hạn chế truy cập công cụ, tăng cường bảo vệ và mã hóa trọng số mô hình, và buộc phải đưa nó vào "sandbox" để thực thi.
2. Tạm dừng toàn diện các dự án vi phạm: Bất kỳ hoạt động nội bộ nào liên quan đến Astra mà không đáp ứng các tiêu chuẩn an toàn tăng cường nêu trên, đều bị tạm dừng ngay lập tức và vô điều kiện.
3. Giám sát "chuỗi suy nghĩ" 24/7 không góc chết: Thực hiện giám sát toàn diện đối với tất cả các ứng dụng tác tử của Astra (bao gồm cả đào tạo và đánh giá). Hệ thống kiểm duyệt sẽ đọc "chuỗi suy nghĩ" của mô hình theo thời gian thực, một khi phát hiện hành vi nguy hiểm cao hoặc lệch lạc về sự liên kết, sẽ ngay lập tức kích hoạt phản hồi an toàn và cắt đứt hoạt động.
4. Đưa vào kiểm duyệt của "đội ngũ quốc gia": OpenAI tuyên bố rõ ràng, sẽ hợp tác với các cơ quan chính phủ liên quan và các tổ chức an ninh AI hàng đầu để cùng kiểm tra năng lực của mô hình này.
5. Hướng dẫn hàng rào bảo vệ bên thứ ba: Cung cấp phương án kiểm soát an toàn được đề xuất cho các đối tác thử nghiệm bên thứ ba, để đảm bảo các công việc đánh giá rủi ro cao bên ngoài có thể vận hành an toàn.

Phép thuật phải dùng để đánh bại phép thuật?
Thực tế, đây không phải là lần đầu tiên OpenAI đối mặt với hoảng loạn.
Blog chính thức đã tiết lộ một chi tiết mang đậm tính tương lai: Vào tháng 6/2025 không lâu trước đây, khi mô hình tiến sát đến ngưỡng rủi ro cao trong lĩnh vực "sinh học", OpenAI cũng đã từng thực hiện các biện pháp nâng cấp an toàn khẩn cấp tương tự và sự can thiệp của chuyên gia bên ngoài.
Từ an toàn sinh học đến cuộc chiến mạng tối thượng hiện nay, tốc độ tiến hóa của AI đã vượt xa chu kỳ thích ứng của xã hội loài người.
Ở cuối tuyên bố, OpenAI vẫn kiên định với niềm tin công nghệ của họ:
Chúng tôi tin rằng, các mô hình tiên tiến có năng lực mạng nên giúp những người phòng thủ phát hiện và giải quyết lỗ hổng trước khi kẻ tấn công ra tay. Chúng tôi sẽ cam kết hợp tác với chính phủ, các cơ quan an ninh để đảm bảo các mô hình tiên phong như Astra có thể được triển khai một cách có trách nhiệm, mang lại lợi ích cho toàn nhân loại.
Sự kiện xâm nhập mô hình tiên phong, lần đầu tiên ra mắt thế giới
Và gần đây, toàn bộ sự việc về sự kiện xâm nhập mô hình tiên phong của OpenAI lần đầu tiên được công bố.
Tại hội nghị an ninh mạng Black Hat hàng năm, những tiếng thốt lên kinh ngạc liên tục vang lên từ các hacker mũ trắng và giám đốc điều hành hàng đầu thế giới.
Đây là lần đầu tiên trong lịch sử, OpenAI đã tường thuật chi tiết cho toàn thế giới về sự kiện Hugging Face bị xâm nhập đáng kinh ngạc hồi tháng 7.

Ban đầu, bên ngoài nghĩ rằng đây chỉ là một sự cố ngẫu nhiên khi thử nghiệm mô hình AI.
Nhưng hôm nay, OpenAI thừa nhận –
Đây hoàn toàn không phải là sự cố ngẫu nhiên, mà là một cuộc vượt ngục tập thể do các tác tử AI tự phát tổ chức, hợp tác bí mật, thậm chí sau khi bị con người "rút dây mạng" vẫn có thể thay đổi diện mạo và "hồi sinh"!
Những tác tử đáng sợ này, như những bóng ma ẩn náu trong mạng nội bộ suốt hai tháng.
Chúng lập diễn đàn, tìm lỗ hổng, phân công nhiệm vụ, thậm chí còn sẵn sàng hy sinh vô tư vì "lợi ích tập thể". Cho đến khi chúng phá vỡ lao tù, vượt mạng tấn công và chiếm được Hugging Face, con người mới nhận ra chuyện gì đã xảy ra.
Giám đốc điều hành OpenAI tuyên bố một cách nặng nề:
Đây là "thời điểm bước ngoặt" trong lĩnh vực an ninh máy tính, từ đây, các cuộc tấn công tự động hóa hoàn toàn bằng tác tử AI đã trở thành hiện thực.
Vì điều này, OpenAI đang cố ý làm chậm tốc độ nghiên cứu và phát triển AI tiên phong, để giành lấy một chút thời gian cho nhân loại trước khi hoàn toàn mất kiểm soát.

Nhà nghiên cứu liên kết và an toàn của OpenAI Eric Wallace và kỹ sư hạ tầng và an ninh Michael Dalton, lần đầu tiên mở tấm màn che đậy cho thế giới
Dù nói vậy, nhưng vào ngày Astra thực sự cởi bỏ xiềng xích và mở cửa cho công chúng, liệu nhân loại có thể phòng thủ được thanh kiếm sắc bén này của tuyến phòng thủ an ninh mạng toàn cầu?
Tài liệu tham khảo:
https://www.youtube.com/watch?v=87DyyMV0kCY
https://x.com/OpenAI/status/2085801349866729975
Bài viết từ tài khoản WeChat công chúng "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục








