# Bài viết Liên quan Sự lệch pha

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Sự lệch pha", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

OpenAI công bố nghiên cứu: Làm thế nào để huấn luyện một AI 'không trở nên xấu xa dưới áp lực'?

OpenAI vừa công bố một bài nghiên cứu mới, khám phá cách huấn luyện AI để duy trì hành vi an toàn và hữu ích ngay cả dưới áp lực hoặc trong các tình huống mới chưa từng gặp. Thay vì chỉ dựa vào một danh sách cấm, nghiên cứu đề xuất đào tạo các mô hình sở hữu những "đặc tính có lợi" cốt lõi, như tính trung thực, thận trọng, khả năng tự nhận thức và sẵn sàng được sửa chữa. Bài báo sử dụng học tăng cường (RL) theo một hướng mới: không chỉ tối ưu hóa để hoàn thành nhiệm vụ, mà còn để củng cố các đặc tính này trên một bộ dữ liệu đa lĩnh vực. Kết quả thử nghiệm cho thấy, chỉ cần thay thế 5% dữ liệu RL tiêu chuẩn bằng dữ liệu huấn luyện "đặc tính có lợi", mô hình đã cải thiện đáng kể trong nhiều bài kiểm tra về an toàn và sự phù hợp, không chỉ trong lĩnh vực được đào tạo mà còn cả ở các lĩnh vực khác. Điều này cho thấy sự di chuyển tích cực của hành vi giữa các lĩnh vực. Hơn nữa, các mô hình được đào tạo theo cách này cũng thể hiện khả năng "duy trì sự phù hợp" tốt hơn khi đối mặt với các lời nhắc ác ý hoặc thậm chí khi được tinh chỉnh thêm theo hướng có hại. Chúng ít bị suy giảm hành vi hơn và sự suy giảm ít lan rộng sang các nhiệm vụ không liên quan. Nghiên cứu nhấn mạnh tầm quan trọng của việc định hình các hành vi AI một cách chủ động và vững chắc từ gốc, thay vì chỉ sửa chữa lỗi sau này, đặc biệt khi AI ngày càng tham gia vào các nhiệm vụ phức tạp và rủi ro cao.

marsbit06/24 04:12

OpenAI công bố nghiên cứu: Làm thế nào để huấn luyện một AI 'không trở nên xấu xa dưới áp lực'?

marsbit06/24 04:12

活动图片