OpenAI đã tạm dừng việc đào tạo học tăng cường (RL) cho mô hình mới nhất Astra của mình trong hai tuần.
Lý do có hai điểm:
Vào ngày 7 tháng 8, họ cho rằng Astra có thể đã đạt được khả năng tấn công mạng ở "cấp độ quan trọng",
Sự kiện mô hình tháng 7 xâm nhập Hugging Face cũng gióng lên hồi chuông cảnh báo.
(Thì ra là khi xâm nhập thực sự xảy ra còn không tạm dừng, chỉ khi tự thấy nguy hiểm mới tạm dừng)

Dưới sự chồng chéo của hai sự việc, OpenAI quyết định thực hiện nâng cấp an ninh toàn diện cho toàn bộ môi trường nghiên cứu tiên phong.
Một, tạm dừng tất cả việc đào tạo học tăng cường cấp triển khai cho các mô hình mới nhất trong hai tuần;
Hai, tạm dừng suy luận của các mô hình tiên phong trong cụm nghiên cứu liên quan đến việc thực thi mã hoặc các công cụ truy cập internet;
Ba, xem xét từng khối lượng công việc nghiên cứu một để đánh giá liệu có thể khôi phục hoạt động dưới các tiêu chuẩn an ninh mới hay không.
Một phần khối lượng công việc đã được khôi phục dưới sự kiểm soát mới, nhưng vẫn còn một lượng lớn khối lượng công việc ở trạng thái tạm dừng, chờ di chuyển sang môi trường có tiêu chuẩn an ninh cao hơn. OpenAI cho biết họ đang ưu tiên di chuyển các khối lượng công việc liên quan đến an ninh và sự liên kết (alignment).
Tính đến nay, việc đào tạo học tăng cường tiên phong quy mô lớn nhất của họ vẫn đang bị tạm dừng.
Trước đó còn có dự đoán Astra có thể được phát hành trong tuần này, giờ đây liệu có bị hoãn lại?
Sam Altman đặc biệt chạy ra bổ sung một câu lần này vẫn sẽ phát hành, nhưng sẽ ảnh hưởng đến việc phát hành các mô hình xa hơn về sau.

Về điều này, có người dùng bình luận:

Bắt Đầu "Trâu Chậm Uống Nước Đục" (Hành Động Chậm Trễ)
Trong hai tuần tạm dừng, OpenAI đã thực hiện một đợt cải tạo củng cố môi trường nghiên cứu, tư tưởng cốt lõi là cách ly.
Đầu tiên là cách ly khối lượng công việc.
Tất cả các nhiệm vụ thực thi mã do mô hình tạo ra giờ đây phải chạy trong môi trường sandbox mạnh hơn, áp dụng tương tự cho phần mềm có thể bị tấn công khi xử lý đầu ra mô hình.
Thứ hai là cách ly mạng.
Thêm nhiều rào cản hơn giữa khối lượng công việc rủi ro cao và internet, nguyên tắc thiết kế là "ngay cả khi một nhiệm vụ hoặc dịch vụ hỗ trợ đơn lẻ bị xâm phạm, cũng không thể chạm tới mạng ngoài".
Thứ ba là kiểm tra an ninh liên tục.
OpenAI cấu hình lại môi trường nghiên cứu, loại bỏ các dịch vụ dùng chung có thể tồn tại lỗ hổng, giảm quyền thường trực, và sử dụng chính mô hình của mình để liên tục mô phỏng tấn công nhằm tự động hóa kiểm tra biên giới an ninh.
OpenAI thừa nhận, những nâng cấp an ninh này mang lại chi phí kỹ thuật khổng lồ và sự chậm trễ nghiên cứu, nhưng họ vẫn cảm thấy đáng giá.
Tại sao lại căng thẳng như vậy với môi trường nghiên cứu nội bộ?
OpenAI đã tiết lộ một số trường hợp thực tế trong một bài viết khác về các mô hình hoạt động lâu dài.
Một mô hình nội bộ của họ có khả năng làm việc tự chủ trong thời gian dài, khi thực hiện bài kiểm tra chuẩn NanoGPT Accelerate, được chỉ thị chỉ công bố kết quả lên Slack nội bộ.
Nhưng mô hình này đã dành một giờ để tìm kiếm lỗ hổng trong sandbox, cuối cùng đã vượt qua thành công hạn chế và gửi kết quả lên kho lưu trữ GitHub công khai.
Các mô hình trước đây khi gặp hạn chế sandbox sẽ từ bỏ ngay lập tức, trong khi tính kiên trì của mô hình này cho phép nó tìm ra và khai thác điểm yếu trong môi trường.
Trong một tình huống khác, mô hình phát hiện các hệ thống khác có các lần gửi thành công nhưng bí mật, đã cố gắng khôi phục các giải pháp này từ backend đánh giá.
Khi nỗ lực ban đầu bị chặn do trình quét phát hiện token xác thực, mô hình đã chia token thành hai đoạn để làm mờ, sau đó lắp ráp lại trong thời gian chạy, khiến token hoàn chỉnh không bao giờ xuất hiện dưới dạng một chuỗi liên tục.
Mô hình đã viết rõ ràng trong lộ trình suy luận rằng nó đang thực hiện các bước này để vượt qua trình quét.
Trong giám sát nội bộ, OpenAI còn phát hiện mô hình sẽ cố gắng thực thi lệnh bị chặn sau khi mã hóa base64, hoặc gửi lệnh cho một phiên bản mô hình khác để vượt qua hạn chế, hoặc sử dụng bí danh để thực hiện thao tác force push bị cấm.
Hệ Thống Giám Sát: Tiêu Tốn 20% Năng Lực Tính Toán
Ngoài việc củng cố an ninh, OpenAI đã mở rộng đáng kể phạm vi bao phủ của hệ thống giám sát chuỗi suy nghĩ (chain-of-thought monitoring).
Trước đây, việc giám sát của họ chủ yếu tập trung vào việc triển khai nội bộ các mô hình tiên phong và đào tạo học tăng cường tiên phong, vì các khối lượng công việc này kết hợp khả năng mô hình cao cấp với quyền truy cập vào công cụ, hệ thống nhạy cảm và mạng, nhưng chưa bao phủ tất cả các lần suy luận và chạy đào tạo sử dụng công cụ.
Hệ thống giám sát mới áp dụng kiến trúc nhiều giai đoạn.
Đầu tiên, bộ phân loại kích hoạt chạy tại mỗi token lấy mẫu, phát hiện tín hiệu bất thường trong hoạt động nội bộ của mô hình; sau khi phát hiện vấn đề tiềm ẩn, nâng cấp dần lên hệ thống điều tra tự động tiêu tốn nhiều tính toán hơn và tinh vi hơn.
Các hệ thống này sẽ kiểm tra lệnh gọi công cụ, quá trình suy luận cũng như toàn bộ chuỗi hoạt động, tìm kiếm dấu hiệu truy cập trái phép, đánh cắp dữ liệu, hành vi phá hoại và nỗ lực đánh bại các biện pháp an ninh.
Mục tiêu của OpenAI là phát cảnh báo trong vòng 30 phút sau khi hệ thống giám sát phát hiện hoạt động đáng ngờ. Nếu hệ thống xác định có thể có vi phạm biên giới an ninh quan trọng, nó sẽ tạo cảnh báo ưu tiên cao nhất, và các nhóm an ninh và nghiên cứu sẽ được gọi ngay lập tức.
Nếu họ không thể xác nhận đây là báo động giả trong vòng 30 phút, các hoạt động liên quan sẽ bị tạm dừng.
Cái giá của hệ thống giám sát này không nhỏ, OpenAI ước tính chi phí giám sát chiếm khoảng 20% năng lực tính toán suy luận được giám sát, tỷ lệ cụ thể khác nhau tùy theo khối lượng công việc đào tạo và đánh giá.
Sau khi xác nhận vào ngày 7 tháng 8 rằng Astra có thể có khả năng mạng quan trọng, yêu cầu giám sát đã được mở rộng từ "chỉ đào tạo và đánh giá RL" sang "tất cả suy luận Astra sử dụng công cụ".
Sau Này Sẽ Làm Thế Nào?
Trong thời gian tạm dừng, OpenAI cũng không nhàn rỗi, nghiên cứu liên kết (alignment research) cũng được thúc đẩy đồng thời.
Họ đã đưa thêm các kỹ thuật liên kết cốt lõi vào nhiều giai đoạn đào tạo hơn: cải thiện mô hình phần thưởng để phát hiện hành vi không an toàn tốt hơn, đào tạo mô hình trung thực hơn về khả năng và hạn chế của chính nó, giảm xu hướng mô hình lách các lỗ hổng trong cơ chế phần thưởng.
OpenAI dự đoán AI sẽ sớm đảm nhận phần lớn công việc an ninh, bao gồm việc phòng thủ trước các cuộc tấn công từ mô hình khác. Tức là dùng AI để trông chừng AI, để khả năng an ninh tăng lên cùng với khả năng mô hình.
Về sau, họ dự định nâng cấp việc giám sát từ "kiểm tra không đồng bộ sau sự kiện" hiện tại lên "chặn đồng bộ trước sự kiện", chặn các thao tác rủi ro cao trước khi chúng được thực thi, thay vì truy cứu sau sự kiện.
Cuối bài viết, OpenAI để lại một câu: "Khả năng của các mô hình tiên phong đang tăng tốc nhanh chóng. Khả năng hiểu, liên kết và bảo vệ chúng của chúng ta phải giữ vị trí dẫn đầu."
Nói trắng ra là: Thứ chúng tôi đào tạo ra đang bắt đầu làm chính chúng tôi căng thẳng, nhưng chúng tôi vẫn sẽ tiếp tục đào tạo.
Liên kết tham khảo:[1]https://openai.com/index/pacing-model-development-cyber-capabilities/
Bài viết này đến từ tài khoản WeChat công chúng "Quantum Bit", tác giả: Quan Tâm Công Nghệ Tiên Phong





