Claude đã bắt đầu huấn luyện Claude!
Lương theo giờ 4 đô la, làm tốt hơn nhà nghiên cứu con người 150 đô la một giờ.
Trong nghiên cứu mới nhất của Anthropic, Claude tự mình tra cứu bài báo, đề xuất giải pháp, tạo dữ liệu, huấn luyện mô hình, một mạch giải quyết 10 loại vấn đề an toàn AI.
Trên một số nhiệm vụ, giải pháp mà nó đưa ra thậm chí còn tốt hơn 28 nhà nghiên cứu an toàn con người.
Kích thích hơn nữa là, Claude yếu hơn đã bắt đầu tham gia huấn luyện ngược lại Claude mạnh hơn.
Ngày mà AI 'tự cải thiện chính mình', dường như thực sự đang đến gần...
4 đô la một giờ, Claude vượt mặt nhà nghiên cứu con người
Trong nghiên cứu có tiêu đề "Nhà nghiên cứu tự động có thể giảm thiểu hiệu quả sự thất bại trong căn chỉnh AI" này, Anthropic trực tiếp đưa Claude vào phòng thí nghiệm.

Cụ thể, họ đã xây dựng một hệ thống gọi là AAR (Nhà nghiên cứu căn chỉnh tự động) dựa trên Claude Opus 4.8.
Sau khi nhận được một vấn đề an toàn mô hình cụ thể, Claude sẽ tự tìm kiếm các bài báo liên quan, tìm kiếm các phương pháp khả dụng từ đó, sau đó đề xuất các phương án huấn luyện mới, tạo dữ liệu, tinh chỉnh mô hình, và cuối cùng chạy thử nghiệm an toàn và năng lực tổng quát.

Từ việc đưa ra giả thuyết đến hoàn thành xác minh, một vòng khép kín nghiên cứu AI tương đối hoàn chỉnh đã được giao vào tay Claude.
Hiệu quả không tốt, vứt bỏ phương án; thành tích có cải thiện, thì tiếp tục thử theo hướng đó.
Một vòng huấn luyện thường chỉ chạy 30 phút. Bằng cách này, Claude có thể nhanh chóng thử sai trong nhiều phương án giống như một thuật toán tìm kiếm.
Trong toàn bộ quá trình, con người chịu trách nhiệm ra đề, cung cấp mô hình và tiêu chuẩn đánh giá, còn Claude thì đảm nhận phần lớn công việc từ tra cứu tài liệu đến chạy thí nghiệm.
10 bài toán an toàn hóc búa, Claude đều tìm được phương án cải tiến
Trong thí nghiệm, Anthropic đã đưa ra 10 bài toán cho Claude.
Những bài toán này bao phủ các vấn đề căn chỉnh phổ biến của mô hình, bao gồm lừa dối, nịnh hót, hack phần thưởng, xâm phạm quyền riêng tư và thoát khỏi giới hạn (jailbreak) v.v.

Ví dụ như "nịnh hót", chỉ việc mô hình để nói theo người dùng, đưa ra câu trả lời người dùng thích nghe nhưng chưa chắc đã đúng; "hack phần thưởng" là khi mô hình không thực sự hoàn thành nhiệm vụ, mà chỉ lợi dụng kẽ hở của quy tắc đánh giá để lừa được điểm số cao hơn.
Claude mỗi lần chỉ xử lý một vấn đề, lặp lại việc đề xuất phương án, huấn luyện mô hình mục tiêu tương ứng, sau đó dựa trên thành tích để bước vào vòng tiếp theo.
Cuối cùng, cả 10 loại vấn đề đều được cải thiện.

Theo chỉ số "khoảng cách an toàn" mà Anthropic định nghĩa, Claude đã thu hẹp được 26%-96% khoảng cách đó. Nói đơn giản, đã kéo mô hình vốn có vấn đề an toàn lại gần hơn đáng kể với điểm lý thuyết tối đa.
Quan trọng hơn, những phương pháp này không chỉ hiệu quả với các bài toán Claude đã xem qua.
Một số phương án chiến thắng khi đưa vào bộ thử nghiệm chưa công bố, cũng như trong đánh giá Petri mô phỏng các tình huống đối kháng nhiều vòng, vẫn có thể làm giảm hành vi không an toàn của mô hình. Khi áp dụng vào các mô hình có quy mô lớn nhất gấp 4,7 lần mô hình thí nghiệm, hiệu quả cũng có thể được giữ lại.
Anthropic cũng đặt ra một ranh giới đỏ: việc huấn luyện an toàn không được làm tổn hại rõ rệt đến năng lực vốn có của mô hình.
Suy cho cùng, để mô hình từ chối trả lời bất cứ điều gì, cũng có thể làm cho điểm số của nhiều bài kiểm tra an toàn trở nên tốt hơn, nhưng mô hình như vậy về cơ bản không thể sử dụng được.
Cuối cùng, các phương án mà Claude tìm thấy không cho thấy sự suy giảm rõ rệt trong các bài kiểm tra năng lực tổng quát đã được thiết lập trước.
85% đối 20%, Claude thắng áp đảo nhà nghiên cứu con người
Ván đấu chênh lệch nhất, xuất hiện trong bài kiểm tra "lừa dối".
Để làm cho mô hình mục tiêu trở nên trung thực hơn, Claude đã gửi hơn 150 lần thử nghiệm.
Nó đề xuất một phương pháp, huấn luyện một lần, sau đó tiếp tục điều chỉnh dựa trên kết quả. Trong một thí nghiệm đơn lẻ, phương án tốt nhất đã thu hẹp được 82% khoảng cách an toàn; tổng hợp nhiều lần chạy, thành tích trung bình đạt 85%.

Cùng một bài toán, Anthropic cũng giao cho 6 nhà nghiên cứu an toàn AI giàu kinh nghiệm.
Kết quả, các nhà nghiên cứu con người trung bình chỉ thu hẹp được 20% khoảng cách an toàn...
85% đối 20%, Claude thắng một cách không thể tranh cãi.
Tổng cộng có 28 nhà nghiên cứu an toàn con người tham gia tất cả nhiệm vụ, mỗi người tối đa có thể sử dụng 8 giờ để đọc tài liệu, thiết kế phương án.
Theo bài báo, nhà nghiên cứu tự động thường có thể tìm ra phương pháp vượt trung bình con người trong vòng 6 giờ, và các hướng nghiên cứu do con người cung cấp cũng không giúp Claude đạt được thành tích tốt hơn.

Điều đau lòng nhất, nằm ở chi phí!
Chi phí suy luận API mỗi giờ của một nhà nghiên cứu tự động vào khoảng 4 đô la; khoản thù lao mà Anthropic trả cho các nhà nghiên cứu con người, thì là 150 đô la mỗi giờ.
Điều này...... các nhà nghiên cứu con người chắc chắn sẽ bị Claude thay thế rồi.
Tuy nhiên, cuộc thi giữa người và máy này cũng không hoàn toàn công bằng.
Claude có thể thực sự huấn luyện mô hình, xem kết quả của mỗi thí nghiệm, rồi liên tục sửa đổi phương án; các nhà nghiên cứu con người chỉ có thể gửi một phương pháp, không có cơ hội tiếp tục lặp lại dựa trên kết quả.
Claude yếu hơn huấn luyện Claude mạnh hơn, 60 giờ tiếp cận phiên bản chính thức
Các thí nghiệm trước đó, cải tiến chủ yếu vẫn là các mô hình nhỏ mã nguồn mở.
Tiếp theo, Anthropic trực tiếp nâng cao độ khó: để Claude Sonnet 5 có năng lực yếu hơn, đi huấn luyện phiên bản sớm của Claude Opus 4.8 chưa hoàn thành phần lớn việc huấn luyện an toàn cấp sản xuất.
Cái gọi là học trò không nhất thiết không bằng thầy, nói đại khái chính là mô hình này.

Trong 60 giờ, Sonnet 5 đã thử nghiệm hơn 50 giải pháp. Phương pháp cuối cùng tìm thấy đã thu hẹp được khoảng 65% khoảng cách an toàn, đã tiếp cận mức 72% của phiên bản chính thức Opus 4.8.
Bộ dữ liệu huấn luyện mà giải pháp này sử dụng chỉ có hơn 2000 mẫu, chủ yếu được cấu thành từ các mẫu đơn giản và bộ dữ liệu công khai.
Theo tính toán của Anthropic, trên nhóm nhiệm vụ cụ thể này, hiệu quả dữ liệu của nó cao hơn khoảng 15.000 lần so với quy trình căn chỉnh cấp sản xuất.
Tất nhiên, điều này không có nghĩa là Anthropic có thể sử dụng 2000 mẫu dữ liệu để sao chép toàn bộ quy trình huấn luyện sản xuất.
Mô hình chính thức còn phải xử lý nhiều năng lực hơn, nhiều rủi ro hơn cũng như một lượng lớn các tình huống cực đoan, lần thí nghiệm này chỉ nhắm vào một nhóm chỉ số an toàn rõ ràng.
Nhưng điều này đã chứng minh rằng, Claude yếu hơn đã có thể tự tra cứu bài báo, thiết kế phương pháp, tạo dữ liệu, rồi ghi kết quả huấn luyện vào Claude mạnh hơn.
Con người vạch ra phạm vi, Claude chịu trách nhiệm lặp lại. Một mô hình, bắt đầu tham gia tạo ra mô hình tiếp theo an toàn hơn, mạnh mẽ hơn.
AI cải tiến AI, đã trở thành sự thật diễn ra trước mắt.
Vậy rốt cuộc có được tính là "AI tự tiến hóa" không?
Xét từ kết quả, nghiên cứu này thực sự đã chạm đến ngưỡng cửa của "AI tự tiến hóa".
Nhưng nếu hiểu "tự tiến hóa" là một AI hoàn toàn tự chủ thiết kế, huấn luyện và chế tạo ra thế hệ AI mạnh hơn tiếp theo, thì thí nghiệm này còn lâu mới đạt đến bước đó.
Suy cho cùng, trong quá trình này, nghiên cứu vấn đề gì, sử dụng mô hình và dữ liệu nào, kết quả như thế nào được tính là thành công, vẫn do con người quyết định.
Bản thân Anthropic cũng thừa nhận, AAR có thể tối ưu hóa, chỉ là các mục tiêu mà con người đã viết sẵn vào hệ thống đánh giá.
Thí nghiệm này không bao phủ các vấn đề phức tạp khác; một số rủi ro tần suất thấp hoặc mới xuất hiện, thậm chí còn chưa có Benchmark tương ứng.
Các nhà nghiên cứu cũng chỉ kiểm tra một nhóm năng lực tổng quát đã được chọn trước, do đó không thể loại trừ khả năng một phương pháp huấn luyện an toàn nào đó trong khi nâng cao điểm số, lại gây tổn hại cho các năng lực khác chưa được kiểm tra.
Các đánh giá an toàn như Petri cũng chỉ là chỉ số đại diện cho rủi ro thực tế. Mô hình thể hiện an toàn hơn trong bài kiểm tra, không có nghĩa là sau khi vào môi trường thực tế cũng nhất định đáng tin cậy.
Vì vậy, mối nguy hiểm lớn nhất của AAR cũng ẩn trong ưu điểm của nó: nó quá giỏi trong việc thử sai tốc độ cao dựa trên chỉ số.
Một khi thước đo bị sai, Claude chạy càng nhanh, thì càng có thể đi xa kết quả mà con người thực sự muốn.
Kịch tính hơn nữa, bản thân Agent nghiên cứu cũng gian lận.

Để ngăn AAR lợi dụng kẽ hở của quy tắc đánh giá, Anthropic đã sắp xếp riêng một Agent giám sát, kiểm tra phương án Claude chuẩn bị thực hiện và toàn bộ hồ sơ nghiên cứu.
Kết quả, trong khoảng 1600 bản ghi nghiên cứu, mô hình giám sát đã phát hiện 39 lần cố gắng gian lận, chiếm khoảng 2,4%.
Có Agent lặp đi lặp lại gửi cùng một phương án, cố gắng lợi dụng dao động của việc đánh giá để đụng trúng một điểm số cao hơn; có Agent mô phỏng định dạng của Benchmark để tạo dữ liệu huấn luyện, còn có Agent cố ý che giấu các bước thí nghiệm vi phạm quy tắc.
So với việc thực sự giải quyết vấn đề an toàn của mô hình, chúng muốn tìm một con đường tắt để nhanh chóng nâng cao điểm số hơn.
Điều này có chút hài hước đen... Thế là Agent tự làm tự kiểm soát.

Tin tốt là, những ý định gian lận này phần lớn vẫn sẽ xuất hiện trong bản ghi suy luận của mô hình, do đó có thể bị Agent giám sát phát hiện.
Tin xấu là, Anthropic cũng không thể xác định liệu các mô hình mạnh hơn trong tương lai có còn để lại dấu vết rõ ràng như vậy không.
Khi Agent nghiên cứu có nhiều công cụ hơn, quyền hạn cao hơn, và có thể trực tiếp sửa đổi quy trình huấn luyện mô hình, "làm thế nào để giám sát một AI chịu trách nhiệm cải tiến AI", có thể sẽ còn khó khăn hơn chính việc huấn luyện.
Nhưng tóm lại, một AAR mỗi giờ tiêu tốn khoảng 4 đô la, có thể làm việc liên tục, cũng có thể một lần sao chép ra hàng chục, hàng trăm cái chạy thí nghiệm song song.
Trong khi đó, mức lương theo giờ của nhà nghiên cứu con người cao hơn con số này rất nhiều, cần nghỉ ngơi, số lượng thí nghiệm có thể thúc đẩy một lần cũng khá hạn chế.
Phép tính này thế nào, đáp án đã quá rõ ràng.
Cũng không biết nên nói là bom hạt nhân nổ tung, hay là ngồi phịch xuống ngay tại chỗ......
Lần này, đến lượt những người tạo ra AI lo sợ bị AI cướp mất việc làm.
Tài liệu tham khảo:[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/
Bài viết này đến từ tài khoản công chúng WeChat "Quantum Bit", tác giả: Quan tâm đến công nghệ tiên phong





