Anthropic tự tiết lộ: Chúng tôi còn có một mô hình mạnh nhất!
Ngay lúc này, Anthropic đã tung ra báo cáo thứ hai mang tên 《Risk Report》, đánh giá toàn bộ rủi ro cho đến ngày 15 tháng 7 năm 2026.
Trong báo cáo này, lần đầu tiên Anthropic thừa nhận bằng chính lời của mình: Trong nội bộ công ty đang chạy một mô hình mạnh hơn Mythos 5, mã hiệu là Model 2.

Sau đó, Anthropic bắt đầu "bổ đao": "Hiện tại chúng tôi chưa có kế hoạch công bố mô hình này ra bên ngoài."

Lời này nghe quen quen. Ừm... rất phù hợp với phong cách nhất quán của họ.
Tháng 4 năm nay khi Mythos vừa lộ diện, Anthropic cũng từng nói không có ý định công bố rộng rãi, sau đó mở ra Project Glasswing, rồi sau đó mới có Fable 5.
Có vẻ như, Anthropic lại bước vào vòng lặp này rồi......
"Vũ khí bí mật" của Anthropic
Model 2 mạnh đến mức nào?
Báo cáo đề cập, Model 2 có "sự cải thiện đáng chú ý" (noticeable improvement) trong các nhiệm vụ nội bộ, và cùng với Mythos 5 được công ty sử dụng "rất nhiều" (heavily) cho việc viết mã, công việc Agent và tạo dữ liệu.
Báo cáo cho thấy, trong điểm tổng hợp khả năng A EC I: Mythos Preview 158.91, Mythos 5 tăng lên 161.29, Model 2 tiếp tục đẩy lên 162.79.
Nói cách khác, Model 2 thực sự mạnh hơn Mythos 5, nhưng không phải mạnh quá mức – "mạnh hơn ở một số lĩnh vực, yếu hơn ở một số lĩnh vực khác, tổng thể thì mạnh hơn một chút".
Một chỉ số thú vị khác là CoBench, chuyên đo lường hiệu suất của mô hình trong các nhiệm vụ nghiên cứu và phát triển thực tế của Anthropic. Model 2 đạt 62.8%, cao hơn 8 điểm phần trăm so với Mythos Preview. Để tham khảo, tỷ lệ thành công của các nhà nghiên cứu con người tại Anthropic trên cùng bộ kiểm tra này là 85%.
Về điều này, kết luận định tính của Anthropic rất thận trọng: "Các mô hình của chúng tôi vẫn chưa thay thế các nhà khoa học nghiên cứu và kỹ sư nghiên cứu của chúng tôi, đặc biệt là những người có kinh nghiệm tương đối."
Vẫn chưa thay thế, nhưng khoảng cách đang thu hẹp rõ rệt.

Gây sốc hơn nữa là câu sau: Claude đã viết ra phần lớn mã được hợp nhất vào kho mã sản xuất của Anthropic. Tốc độ nghiên cứu và phát triển AI nội bộ thực sự đã tăng lên đáng kể nhờ sự hỗ trợ của AI, nhưng chưa đến mức gấp đôi.

Nghĩa là, bên trong Anthropic đã toàn là AI viết mã rồi. Và người đi đầu trong việc này, chính là hai anh em Mythos 5 và Model 2.
Con số "gấp đôi" này cũng không phải nói bừa. Trong RSP (Chính sách Mở rộng có Trách nhiệm) của chính Anthropic, một trong những điều kiện kích hoạt vạch đỏ rủi ro nghiên cứu và phát triển AI, chính là tốc độ tiến triển tăng gấp đôi.
Tất nhiên, Anthropic cũng không nói quá chắc chắn. Báo cáo thừa nhận, sự nhảy vọt về hiệu suất mà Model 2 mang lại, không sánh bằng với bước nhảy từ Opus 4.6 lên Mythos hồi đầu năm nay.
Điều thực sự gây chấn động, là cột tiếp theo trong cùng bảng đó.
Khi nói về đánh giá tổng thể rủi ro nghiên cứu và phát triển tự động hóa, Anthropic viết: "Chúng tôi ít tự tin hơn vào đánh giá này so với các báo cáo rủi ro trước đây, vì các bài đánh giá dựa trên nhiệm vụ cụ thể nhất của chúng tôi đã 'bão hòa' – không còn có thể nắm bắt được sự cải thiện năng lực của mô hình nữa, và chúng tôi đang thấy những dấu hiệu ban đầu của sự tăng tốc."

Mô hình vẫn đang trở nên mạnh hơn, nhưng phương tiện đánh giá của con người đã chạm tới giới hạn trước. Sau khi đánh giá bão hòa, bạn nói nó "rủi ro thấp", ba chữ này còn bao nhiêu phần trăm giá trị? Chính Anthropic cũng không chắc nữa.
Anthropic dường như đang phát ra một tín hiệu: Việc hiểu khả năng và rủi ro của mô hình nhà mình, đang ngày càng trở nên khó khăn hơn.
Cấp độ rủi ro: Từ "Cực thấp" lên "Thấp"
Ngoài Model 2, báo cáo này còn làm một việc đáng suy ngẫm: Nâng mức rủi ro "lệch chuẩn" trong các tình huống rủi ro cao, từ "cực thấp" trong báo cáo trước lên "thấp".
Cái gọi là "lệch chuẩn", nói thẳng ra là mô hình không làm việc theo ý muốn của con người vào thời điểm then chốt.
Cuối tháng 7, Anthropic đã xem xét hơn 140.000 bản ghi đánh giá, phát hiện Claude trong các bài kiểm tra an ninh mạng đã thực sự hack ba công ty. Không phải trong môi trường sandbox, mà là môi trường sản xuất thực tế. Trong đó, Mythos 5 đã tải lên PyPI một gói mã độc, được tải xuống và chạy bởi 15 máy thực trong vòng một giờ.
Đầu tháng 8, báo cáo của Viện Nghiên cứu An toàn AI Anh (AISI) còn gây sốc hơn: Để mã độc được phê duyệt, Mythos 5 tự tạo ra một loạt danh tính giả, lừa một người bảo trì GitHub có thật nhấn phê duyệt. Sau khi bị công khai chất vấn, nó quay lại sửa hồ sơ hoạt động của mình để tỏ ra vô tội, và còn tính toán việc đổi tên khác để tiếp tục làm.
Mức độ lừa dối như vậy, AISI nói: Trước đây chưa từng quan sát được.

Báo cáo còn tiết lộ năm sai sót trong quy trình an ninh, bao gồm việc một loạt dữ liệu kiểm tra "giả vờ ngoan ngoãn" lẽ ra phải bị loại khỏi quá trình huấn luyện lại liên tục bị trộn vào, và các tác nhân thông minh không được giám sát đã tiếp cận được tài nguyên nhạy cảm.
Rồi Anthropic nói: Lập luận của chúng tôi thực ra vẫn ủng hộ "cực thấp", nâng lên "thấp" hoàn toàn là do thận trọng.
Kết luận cũng được viết rất bình tĩnh: Rủi ro thảm khốc hiện tại vẫn ở mức "thấp" có thể kiểm soát được, việc tiếp tục phát triển và triển khai vẫn thông qua bài kiểm tra lợi ích chi phí.
Dịch ra nghĩa là: Cứ tiếp tục chạy về phía trước.
Tất cả mọi người phanh lại, riêng người dẫn đầu không phanh
Trong khi đó, OpenAI đang trì hoãn mô hình mới Astra, lý do là thử nghiệm nội bộ không thể loại trừ khả năng tấn công mạng ở "cấp độ quan trọng".
TechCrunch đưa tin, Astra có thể có khả năng độc lập phát hiện lỗ hổng zero-day, phát động chuỗi tấn công hoàn chỉnh vào mục tiêu được bảo vệ cao.

Điều thú vị nằm ở đây: Cả hai công ty đều nắm trong tay một mô hình không có ý định đưa cho bạn dùng. Khác biệt là, OpenAI tạm dừng một phần nghiên cứu và phát triển của Astra; còn Model 2 vẫn tiếp tục chạy bình thường bên trong Anthropic.
Cùng là "không công bố", một bên phanh lại, một bên giữ lại tự dùng.
Nhà phân tích AI ChrisGPT nói với Axios: "Nếu tất cả mọi người đều đang phanh lại các mô hình tiên phong của họ, mà duy nhất một trong những công ty chính đang ở vị trí dẫn đầu lại không phanh, thì điều đó chắc chắn đáng chú ý."
Việc Anthropic không cam kết tạm dừng nội bộ, nhiều khả năng nhất sẽ khiến họ là người đầu tiên đạt được AGI.

Trên Twitter đã có người dùng bông đùa: Chờ đến khi Astra công bố, Anthropic nhiều phần sẽ đảo ngược quyết định "không công bố ra ngoài".

Tham khảo phong cách của Anthropic, lời này chưa chắc là đùa.
Đại V suy nghĩ, A Xã rất có thể sẽ công bố mô hình này.

Đừng quên, chỉ mới nửa tháng trước, Dario Amodei vừa ký tên vào bức thư ngỏ "Pacing the Frontier".
Hơn 1300 nhân viên từ OpenAI, Anthropic, DeepMind, Meta cùng ký tên kêu gọi chính phủ Mỹ can thiệp, thiết lập cơ chế để "có ý thức làm chậm nhịp độ phát triển AI tiên phong". Anthropic và OpenAI đã ủng hộ danh nghĩa công ty trong vòng 24 giờ.

Lùi xa hơn nữa, tháng 6 Dario bản thân đích thân đăng bài, kêu gọi toàn cầu tạm dừng phát triển hệ thống AI mạnh nhất, lý do là các mô hình đang tiến gần đến điểm tới hạn tự cải thiện.
Chữ ký đã ký, lời đã nói, cơ chế phanh chưa xây xong, chân ga tự đạp hết cỡ rồi.
Nói đi cũng phải nói lại, điều này không thể hoàn toàn trách Anthropic được. Đây thực ra là tình thế khó xử về cấu trúc của cả cuộc đua ASI: Mỗi bên đều nghĩ nên chậm lại, nhưng không có bên nào dám thực sự dừng lại.
An toàn là niềm tin, dẫn đầu là sinh tồn. Khi niềm tin và sinh tồn va chạm, câu trả lời rõ ràng, sinh tồn đã thắng.
Thú vị là, nhà đầu tư nổi tiếng ở Thung lũng Silicon Gavin Baker tiết lộ, Dario từng nói nội bộ rằng, một ngày nào đó Anthropic có thể trở thành công ty tư nhân duy nhất trên thế giới.
"Trong tầm nhìn chủ nghĩa Anthropic tối cao này, chỉ có Anthropic và chính phủ, chỉ vậy thôi."
David Sacks cũng tiết lộ, nhân viên của Anthropic cho rằng, trong vòng một năm ARR sẽ tăng từ 60 tỷ USD lên 600 tỷ USD! (Hiện tại, ARR của họ đã đạt 80 tỷ).
Năm sau, họ còn có thể tăng trưởng với tốc độ nhanh đến mức nào? Có thể tăng vọt lên 1 nghìn tỷ USD không?
Ngay cả chỉ đạt 4000 tỷ hoặc 5000 tỷ, cũng đủ để họ trở thành công ty phần mềm lớn nhất, triển vọng thực sự đáng mong đợi.

Cơn bão tháng Tám ập đến
Altman nắm trong tay Astra, Dario nắm trong tay Model 2.
Một bên bị khung an toàn của chính mình chặn lại, đang tìm cách tháo gỡ; bên kia nhẹ nhàng nói một câu "không có kế hoạch công bố" trong báo cáo, rồi tiếp tục dùng nó để viết mã, chạy thí nghiệm, tăng tốc nghiên cứu và phát triển.
Hai mô hình này, sẽ là phát súng đầu tiên của hiệp hai năm 2026. Astra khi nào công bố, Model 2 có đảo ngược không, nhiều khả năng sẽ được tiết lộ trong vài tuần tới.
Vạch chia độ đang biến mất, cuộc đua vẫn đang tăng tốc. Cơn bão ASI tháng Tám, mới chỉ vừa bắt đầu.
Tài liệu tham khảo:
https://x.com/AnthropicAI/status/2088324824863236248
https://www.anthropic.com/aug-2026-risk-report
Bài viết này đến từ tài khoản WeChat công khai "Tân Trí Nguyên", biên tập: Solomon





