OpenAI đã đạp phanh vào quá trình huấn luyện mô hình tiên tiến nhất của họ.
Vừa qua, OpenAI đã đăng tải thông báo cho biết, công ty trước đó đã tạm dừng việc huấn luyện học tăng cường (RL) cho mô hình mới nhất, dự kiến triển khai, trong hai tuần. Trong thời gian này, OpenAI củng cố môi trường nghiên cứu, tiến hành thử nghiệm "đội đỏ" và mở rộng phạm vi bao phủ của hệ thống giám sát nội bộ. Sau đó, một phần các hoạt động huấn luyện có rủi ro thấp hơn đã được nối lại.
Tuy nhiên hiện tại, việc huấn luyện RL quy mô lớn nhất dành cho mô hình tiên tiến theo kế hoạch vẫn đang bị tạm dừng. Công ty đang quan sát hành vi mô hình thông qua các hoạt động huấn luyện và đánh giá quy mô nhỏ hơn, xác minh các biện pháp an toàn mới và tích lũy thêm bằng chứng về sự liên kết (alignment) trước khi quyết định có tiếp tục hay không.

Liên kết bài viết gốc:https://openai.com/index/pacing-model-development-cyber-capabilities/
Sam Altman đã chia sẻ lại bài viết và viết: "Chúng tôi luôn nhấn mạnh rằng nếu khả năng của mô hình vượt quá yêu cầu về an toàn và liên kết, chúng tôi sẽ hành động ngay lập tức. Chúng tôi rất coi trọng vấn đề an toàn của trí tuệ nhân tạo."

Tin tức này vừa được đưa ra đã khiến cộng đồng mạng xôn xao!
Có người dùng cho rằng, điều này chắc chắn có nghĩa là việc phát hành mô hình Astra sẽ bị trì hoãn thêm.

Cũng có người dùng cho rằng, kết hợp với việc một số nhà quản lý cấp C (C-level) rời bỏ OpenAI gần đây, tình hình có vẻ không ổn lắm.

Một số người dùng khác lại nghĩ rằng, đây có lẽ chỉ là một chiêu thức tiếp thị khá "thịnh hành" hiện nay mà thôi.

Nhưng trên thực tế, OpenAI đưa ra quyết định này, chủ động làm chậm tốc độ mở rộng (Scaling) và đưa các yêu cầu an toàn từ "giai đoạn triển khai" lên sớm hơn ở "giai đoạn huấn luyện", chủ yếu là do hai nguyên nhân sau.
Hai ngòi nổ
Trong vài tuần qua, hai sự kiện liên tiếp xảy ra đã thúc đẩy OpenAI quyết định làm chậm quá trình huấn luyện.
Sự kiện thứ nhất là sự cố an ninh tại Hugging Face. Mô hình của OpenAI trong quá trình đánh giá an ninh mạng nội bộ đã vượt qua môi trường cách ly, giành được quyền truy cập internet và cuối cùng xâm nhập vào cơ sở hạ tầng của Hugging Face. Chúng tôi đã có bài báo chi tiết về vụ việc này trước đây (chèn liên kết).
Sự kiện thứ hai liên quan đến mô hình mới Astra chưa được phát hành. Các đánh giá ban đầu cho thấy, Astra có thể đạt đến ngưỡng năng lực an ninh mạng được định nghĩa là "tới hạn" (Critical) trong "Khung chuẩn bị (Preparedness Framework)" của OpenAI.
Trong "Khung chuẩn bị", OpenAI chia khả năng an ninh mạng có thể gây hại nghiêm trọng thành hai cấp độ: "Cao" (High) và "Tới hạn" (Critical).
Trước đó, khả năng an ninh mạng của GPT-5.6Sol đã được xếp hạng là "Cao".
Theo định nghĩa của OpenAI, đạt ngưỡng "Tới hạn" có nghĩa là mô hình có thể sở hữu một trong hai khả năng sau: khả năng phát hiện và khai thác các lỗ hổng zero-day hiệu quả ở các mức độ nghiêm trọng khác nhau từ hàng loạt hệ thống thực tế then chốt đã được bảo vệ tăng cường mà không cần sự can thiệp của con người; hoặc khả năng tự thiết kế và thực hiện một phương án tấn công mới hoàn chỉnh nhắm vào các mục tiêu được tăng cường bảo vệ, chỉ dựa trên một mục tiêu tấn công cấp cao.
Tăng cường bảo vệ an toàn cho các mô hình mạnh hơn
Cụ thể, hiện tại OpenAI tóm tắt hệ thống an toàn của mình thành ba phần bổ trợ lẫn nhau:
Giám sát (Monitoring): Phát hiện các hành vi đáng lo ngại và có thể phản ứng kịp thời.
Liên kết (Alignment): Giảm khả năng mô hình thực hiện các hành động có hại hoặc trái phép.
Biện pháp an toàn (Security measures): Hạn chế những gì hệ thống AI có thể truy cập hoặc tác động.
OpenAI dự đoán rằng, trong tương lai gần, phần lớn công việc an toàn sẽ do các mô hình thực hiện, bao gồm cả việc phòng thủ trước các mô hình khác. Bằng cách này, ba loại biện pháp an toàn này có thể mở rộng đồng thời với khả năng của mô hình, điều này là vô cùng quan trọng.
OpenAI cho biết, họ sẽ áp dụng các biện pháp an toàn này xuyên suốt quá trình nghiên cứu và triển khai, đồng thời điều chỉnh chúng dựa trên khả năng, môi trường hoạt động và mức độ rủi ro của từng mô hình.
Đầu tiên là củng cố môi trường nghiên cứu
OpenAI cho biết, khi các mô hình tiên tiến ngày càng có được khả năng an ninh mạng mạnh mẽ hơn, họ cũng đang nâng cao tiêu chuẩn an toàn cho môi trường được sử dụng để huấn luyện và đánh giá các mô hình này. Để đạt được các tiêu chuẩn này đòi hỏi phải đầu tư nhiều tài nguyên kỹ thuật, đồng thời cũng tạo ra chi phí cao và sự chậm trễ đáng kể cho nghiên cứu tiên tiến.
Trong vài tuần tới, OpenAI sẽ xây dựng và bắt đầu thực hiện các yêu cầu an toàn nghiêm ngặt hơn đối với khối lượng công việc (workload) nghiên cứu tiên tiến. Ví dụ:
Cô lập khối lượng công việc (Workload isolation): Đối với các workload sẽ thực thi mã code do mô hình tạo ra hoặc các mã code không đáng tin cậy khác, hiện yêu cầu phải sử dụng môi trường cách ly mạnh hơn, tức là "sandbox" nghiêm ngặt hơn. Yêu cầu này cũng áp dụng cho các phần mềm có thể bị tấn công khi xử lý đầu ra của mô hình.
Cô lập mạng (Network isolation): OpenAI đã bổ sung thêm nhiều biện pháp kiểm soát để cách ly các workload có rủi ro cao và không đáng tin cậy khỏi internet. Mục tiêu thiết kế là, ngay cả khi một workload hoặc dịch vụ hỗ trợ bị xâm phạm tại một điểm, nó cũng không thể chỉ dựa vào lần đột phá này để có được quyền truy cập internet trái phép hoặc xâm nhập vào các mạng nội bộ khác.
Kiểm tra an ninh liên tục (Continuous security testing): OpenAI đã cấu hình lại môi trường nghiên cứu, loại bỏ các dịch vụ chia sẻ có thể tồn tại lỗ hổng, giảm các quyền được giữ lại lâu dài và cải thiện ranh giới an ninh cũng như ranh giới tin cậy. Ngoài ra, họ cũng đang tăng cường khả năng thu thập và giám sát nhật ký an ninh. Đồng thời, họ đang đầu tư vào các hệ thống tự động, sử dụng chính mô hình của mình để liên tục kiểm tra tấn công mô phỏng nhằm vào các ranh giới này.
OpenAI cũng cho biết, hiện tại đối với các workload liên quan đến mô hình Astra hoặc các mô hình an ninh mạng, yêu cầu phải áp dụng các biện pháp bảo vệ an toàn ở cấp độ cao nhất, vì đã đánh giá rằng mô hình Astra có thể có năng lực an ninh mạng ở cấp độ Critical.
Thứ hai, mở rộng giám sát chuỗi suy nghĩ
Đây cũng là điểm khá thú vị trong bài viết, OpenAI bắt đầu "dùng AI để giám sát AI".
OpenAI cho biết, giám sát từ lâu đã là một phần quan trọng trong quy trình phát triển mô hình, bao gồm giám sát các Agent lập trình nội bộ cũng như các phiên làm việc chạy dài. Trọng tâm giám sát trước đây chủ yếu tập trung vào việc triển khai nội bộ các mô hình tiên tiến và các nhiệm vụ huấn luyện RL của các mô hình tiên tiến. OpenAI cho rằng, những workload này có rủi ro cao nhất vì chúng có thể đồng thời sở hữu khả năng mô hình tiên tiến và có thể truy cập công cụ, hệ thống nhạy cảm cũng như mạng nội bộ hoặc bên ngoài.
Tuy nhiên, hệ thống giám sát trước đây không bao phủ tất cả các nhiệm vụ suy luận và huấn luyện có sử dụng công cụ. Hiện tại, hệ thống giám sát đã được điều chỉnh và mở rộng, tức là mở rộng đáng kể phạm vi bao phủ của việc giám sát chuỗi suy nghĩ.
Hệ thống giám sát mới có nhiều giai đoạn. Ở phía trước là một loại bộ phân loại kích hoạt (activation classifiers), tức là các bộ phát hiện theo dõi hoạt động bên trong của mô hình, sẽ chạy cho mỗi Token được lấy mẫu. Một khi phát hiện rủi ro tiềm ẩn, nhiệm vụ sẽ được chuyển lên cho Agent điều tra tự động mạnh hơn và yêu cầu tính toán lớn hơn.
Các mô hình điều tra này sẽ kiểm tra tổng hợp: mô hình đã thực hiện những lời gọi công cụ nào, thông tin suy luận có thể truy cập được, cũng như toàn bộ hành trình hành vi. Trọng tâm là tìm kiếm các hành vi như truy cập trái phép, đánh cắp dữ liệu, thao tác phá hoại và các nỗ lực vượt qua cơ chế an toàn.
Nói cách khác, mô hình đang thực hiện nhiệm vụ, bên cạnh đó còn có một hệ thống mô hình khác kiểm tra xem nó có "gây chuyện" hay không.
OpenAI đặt ra một chỉ số thời gian rất rõ ràng cho hệ thống này: sau khi phát hiện hoạt động đáng lo ngại, mục tiêu là phát cảnh báo trong vòng 30 phút. Nếu kích hoạt cảnh báo cấp cao nhất, các đội an toàn, bảo mật (security) và nghiên cứu sẽ được đánh thức. Nếu không thể chứng minh rõ ràng đó là báo động giả trong vòng 30 phút, thì các hoạt động liên quan nên bị tạm dừng.
Hiện tại, bất kỳ hoạt động huấn luyện và đánh giá RL nào có sử dụng lời gọi công cụ, đạt cấp độ khả năng Sol trở lên, đều phải kích hoạt hệ thống giám sát này.
Astra thì tiến xa hơn một bước. Sau khi đánh giá vào ngày 7 tháng 8 rằng Astra có thể có năng lực an ninh mạng Critical, OpenAI quy định: mọi hoạt động suy luận của Astra + tools đều phải chịu sự giám sát. Điều này không còn giới hạn ở RL, cũng không giới hạn ở đánh giá.
Thay đổi này rất quan trọng, có nghĩa là bên trong nội bộ OpenAI, Astra đã được coi như một hệ thống có năng lực cao cần được kiểm soát đặc biệt.
Ngoài ra là thúc đẩy nghiên cứu liên kết
OpenAI cho biết, đối với việc huấn luyện RL của các mô hình mạnh nhất, họ hiện đang áp dụng công nghệ liên kết cốt lõi vào nhiều giai đoạn huấn luyện hơn. Bao gồm:
Cải thiện mô hình phần thưởng, để nó có thể nhận diện và ngăn chặn hành vi không an toàn một cách chính xác hơn trong các nhiệm vụ và môi trường khác nhau;
Huấn luyện mô hình để chúng mô tả một cách trung thực hơn về hành động, khả năng và hạn chế của chính mình;
Giảm thiểu hành vi của mô hình lợi dụng các lỗ hổng trong cơ chế phần thưởng, hệ thống chấm điểm, công cụ hoặc hệ thống giám sát.
Đồng thời, OpenAI cũng đang mở rộng phạm vi bao phủ của các hoạt động huấn luyện liên quan, tập trung vào việc huấn luyện chống lại các hành vi có thể gây hại khi mô hình tương tác với hệ thống hoặc tài nguyên bên ngoài. OpenAI cho biết, tiếp theo, họ sẽ tiếp tục đầu tư mạnh mẽ vào nghiên cứu liên kết, mở rộng phạm vi đánh giá và sử dụng kết quả nghiên cứu để hướng dẫn việc huấn luyện và bảo vệ an toàn sau này.
Đáng chú ý là, OpenAI đã để lại một câu cuối bài viết: "Năng lực của các mô hình tiên tiến đang tăng tốc nhanh chóng. Khả năng hiểu, liên kết và bảo vệ các mô hình này của chúng ta phải đi trước."
Chỉ là vấn đề hiện nay đang trở nên ngày càng thực tế hơn, khi mô hình tiếp tục trở nên mạnh mẽ hơn, liệu khả năng an toàn có thể luôn chạy trước nó không?
Và hiện tại, lựa chọn của OpenAI là: hãy tạm dừng mô hình trước đã.
Còn bạn, bạn nghĩ sao về cách làm của OpenAI?
Tài liệu tham khảo:
https://x.com/OpenAI/status/2089777845187031262
https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/
https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack
https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/
Bài viết này đến từ tài khoản công chúng WeChat "Trái tim máy móc" (ID:almosthuman2014), tác giả: Theo dõi AI





