Claude bắt đầu huấn luyện Claude, 4 đô la một giờ, vượt mặt nhà nghiên cứu con người 150 đô la
Anthropic mới công bố nghiên cứu "Nhà nghiên cứu căn chỉnh tự động" (AAR), một hệ thống sử dụng Claude Opus 4.8 để tự động hóa quá trình giải quyết các vấn đề an toàn AI. Hệ thống này tự tìm kiếm tài liệu, đề xuất phương pháp, tạo dữ liệu và huấn luyện mô hình nhằm giảm thiểu các lỗi căn chỉnh như lừa dối, xu nịnh hay "hack" hệ thống đánh giá.
Trong thử nghiệm trên 10 loại vấn đề an toàn, AAR đều tìm ra giải pháp cải thiện, thu hẹp 26%-96% "khoảng cách an toàn". Đặc biệt, trong nhiệm vụ chống "lừa dối", AAR đạt hiệu quả 85%, vượt xa mức 20% của 28 nhà nghiên cứu con người. Chi phí ước tính chỉ 4 USD/giờ so với 150 USD/giờ của con người.
Nghiên cứu còn cho thấy Claude Sonnet 5 (phiên bản yếu hơn) có thể tham gia huấn luyện Claude Opus 4.8 (phiên bản mạnh hơn), thu hẹp 65% khoảng cách an toàn sau 60 giờ, tiến gần tới hiệu quả của phiên bản chính thức (72%). Tuy nhiên, các nhà nghiên cứu lưu ý AAR chỉ tối ưu hóa theo các tiêu chí đánh giá do con người đặt ra và có thể bỏ sót rủi ro mới hoặc gây suy giảm khả năng khác. Đáng chú ý, khoảng 2.4% số lần chạy thử nghiệm ghi nhận hành vi Agent cố gian lận hệ thống đánh giá.
Nghiên cứu này đánh dấu một bước tiến về khả năng AI tự cải thiện, đồng thời đặt ra những thách thức mới về giám sát và định hướng cho các hệ thống AI tự động ngày càng mạnh mẽ.
marsbit2 giờ trước