Vừa mới đây, một podcast nội bộ của SemiAnalysis đã tiết lộ nhiều thông tin gây sốc.
Theo đó, mô hình mới Mythos 2 của Anthropic đã được huấn luyện xong, nhưng lại bị khóa chặt.
Hiện tại, Anthropic đang dùng dữ liệu do Mythos 2 tạo ra để dồn toàn lực chạy đua cho Mythos 3!
AI mạnh nhất của Anthropic bị thiến, AI thần thoại trở thành cấm phẩm toàn cầu
Trong podcast, các nhà phân tích nổi tiếng Dylan Patel và Jordan Nanos cùng nhau tiết lộ nội tình—
Mô hình AI mạnh nhất, đỉnh cao nhất thế giới thực ra đã được huấn luyện xong từ lâu, nhưng chúng bị cây gậy quản lý đè chặt trong phòng thí nghiệm, trở thành cấm phẩm nội bộ.
Rất nhiều người nghĩ rằng, hào sâu phòng thủ của OpenAI và Anthropic đã sụp đổ.
SemiAnalysis nói với chúng ta: Tất cả những điều này, chỉ là ảo giác.

Không phải mã nguồn mở chạy quá nhanh, mà là các mô hình mã nguồn đóng dẫn đầu, bị buộc phải đeo gông cùm.
Jordan Nanos nói:
Rõ ràng, chúng ta thấy điều này rõ ràng trong so sánh giữa Mythos và Fable.
Tôi hoàn toàn không thể sử dụng Mythos, tôi chỉ có thể sử dụng Fable, và đôi khi tôi còn phải khẩn khoản nài xin nó mới dùng được.
Như mọi người đều biết, Anthropic nội bộ vẫn còn giấu con quái vật tối thượng Mythos, chỉ có doanh nghiệp tham gia "Dự án Glasswing" mới được sử dụng.
Mythos mới là "hoàn toàn thể" đại diện cho công nghệ mạnh nhất của Anthropic. Nhưng nó quá mạnh, mạnh đến mức khiến người ta hoảng sợ, thậm chí có thể đã sở hữu năng lực tấn công mạng mang tính đột phá hoặc khả năng tự tiến hóa.

Vì vậy, Mythos bị hạn chế nghiêm ngặt, tuyệt đối không được phép mở ra cho công chúng!
Do đó, Anthropic chỉ có thể lui một bước, cắt xén điên cuồng, hạ cấp các năng lực của Mythos, lắp thêm bộ lọc, cuối cùng mới ra mắt một phiên bản hạ cấp — Fable.
"AI siêu cấp" chúng ta dùng hàng ngày, chỉ là sản phẩm thứ phẩm mà các ông lớn tung ra để ứng phó với quản lý.

Tìm đòn trả đòn: Anthropic tự ăn quả đắng
Làn gió biến mô hình đỉnh cao thành "cấm phẩm nội bộ" này, rốt cuộc từ đâu mà đến?
Điều này không thể không nhắc đến màn kịch huyền hoặc nhất trong lịch sử Silicon Valley.
Trong buổi phát sóng trực tiếp, Dylan Patel không chút nương tay chế giễu Anthropic:
Tôi thấy tình hình hiện tại rất thú vị, phải không? Trong nhiều năm, bọn Anthropic luôn kêu gào to tiếng: Hãy đến quản lý chúng tôi đi! Xin hãy đến quản lý chúng tôi đi! AI quá nguy hiểm!
Kết quả bây giờ, đột nhiên, họ thực sự đã làm mọi người sợ hãi. Giờ thì tốt rồi, chính Anthropic không thể phát hành mô hình nữa. Theo tôi biết, Mythos 2 đã hoàn thành tất cả quá trình huấn luyện, nhưng họ không thể phát hành.
Có thể gọi là boomerang lớn nhất trong lịch sử AI.
Những người theo "chủ nghĩa nguyên thủy an toàn AI" đứng đầu là Dario Amodei, trong nhiều năm luôn đóng vai "người thổi còi". Họ đi lại trên Đồi Capitol, khắp nơi tuyên truyền thuyết tận thế về AI hủy diệt nhân loại, ra sức thúc đẩy các đạo luật quản lý khắt khe.
Mục đích ban đầu của họ, có lẽ là muốn nâng cao ngưỡng quản lý, xây dựng hào sâu phòng thủ, đá những công ty nhỏ và cộng đồng mã nguồn mở không có khả năng làm căn chỉnh an toàn ra khỏi cuộc chơi.
Kết quả, chơi với lửa tự thiêu thân.
Theo đó, Mythos 2 đã được huấn luyện xong, thể hiện năng lực sinh thành mã, lý luận logic và tấn công-phòng thủ mạng mạnh mẽ, trực tiếp kéo còi báo động cao nhất.
Mythos 2 của Anthropic tiêu tốn hàng trăm triệu đô la tính toán, cứ thế bị khóa trong nội bộ.

Cắt đứt vòng lặp phản hồi: Cuộc khủng hoảng chí mạng nhất đã giáng xuống
Không phát hành mô hình, thực sự chỉ đơn giản là ít kiếm được chút tiền, chậm mở ra một chút sao?
Sai! Dylan Patel chỉ ra cuộc khủng hoảng chí mạng nhất, cốt lõi nhất trong toàn bộ cơn bão — vòng lặp phản hồi tự lặp của AI có thể bị cắt đứt vì điều này.
"Vấn đề thực sự quan trọng hiện nay là vòng lặp phản hồi nội bộ. Họ (do không phát hành) có ngăn cản chính mình sử dụng Mythos 2 nội bộ để làm cho Mythos 3 trở nên mạnh hơn không? Hoặc, họ có ngăn cản chính mình sử dụng Astra để xây dựng Astra Plus One thế hệ tiếp theo không?"
Trước đây, nhiều bước nhảy vọt công nghệ phụ thuộc vào bánh đà này: Phát hành mô hình ➡️ Thu thập dữ liệu phản hồi thực tế khổng lồ từ người dùng ➡️ Dùng những dữ liệu chất lượng này để huấn luyện mô hình thế hệ tiếp theo.
Nhưng bây giờ, Mythos 2 và Astra bị "khóa chết" một cách cưỡng ép, bánh đà dừng đột ngột. Công ty AI mất đi dữ liệu quý giá đến từ hàng chục tỷ lần tương tác thực tế trên toàn cầu.
Nếu không thể đưa Mythos 2 vào thế giới thực, Anthropic lấy gì để huấn luyện con thú thần thế hệ thứ ba Mythos 3 đang được phát triển bí mật?
Câu trả lời là: Họ đã khởi động chế độ "Ouroboros" (rắn tự nuốt đuôi) nội bộ "tạo thần trong phòng kín".
Theo Patel tiết lộ, mặc dù Mythos 2 bị khóa chặt, nhưng bước đi xây dựng Mythos 3 nội bộ của Anthropic "không hề dừng lại một khắc". Trọng tâm chiến lược của công ty đã chuyển từ "đẩy nhanh ra mắt cái mới", sang "cải tiến hệ thống nội bộ" cực kỳ bí mật.
Họ đang dùng Mythos 2 để sinh thành dữ liệu, viết mã, dồn toàn lực chạy đua cho Mythos 3.
Trước đó, Anthropic từng thừa nhận trong báo cáo rủi ro: Nội bộ công ty đang chạy một mô hình mạnh hơn cả Mythos 5, mã hiệu Model 2, và hiện tại không có kế hoạch phát hành mô hình này ra công chúng.

Trên A EC: Model 2 đạt 162.79. Trên CoBench, Model 2 đạt 62.8%.

Bánh đà bên ngoài ngừng quay, bánh đà nội bộ lại được lên dây cót đầy — năng lực tính toán từ phục vụ vài trăm triệu người dùng, chuyển toàn bộ sang phòng thí nghiệm.
Điều đáng lo ngại là, ba tầng đệ quy đã bắt đầu ăn khớp.
Tầng 1: Đệ quy dữ liệu.
Đúng sai giao cho thế giới phán quyết — mã có chạy thông không, chứng minh có thành lập không, không cần con người gán nhãn. Mô hình mạnh ra đề làm bài, bộ kiểm tra chấm điểm, dữ liệu cung cấp trực tiếp cho thế hệ tiếp theo. Đây chính là tự đối kháng: AlphaGo Zero không có ván cờ người nào, 40 ngày lên đỉnh. Anthropic đã thừa nhận, Model 2 đang tạo ra lượng lớn dữ liệu.

Tầng 2: Đệ quy lao động.
Phần lớn mã sản xuất của Anthropic xuất phát từ Claude, tốc độ R&D tăng nhanh tiệm cận đường cảnh báo đỏ 2 lần. Mô hình không còn chỉ là sản phẩm, mà là công nhân xây dựng người kế nhiệm; con người lui về làm giám công.

Tầng 3: Đệ quy đánh giá.
Đánh giá thế hệ tiếp theo mạnh không, an toàn không, vẫn là AI — đội đỏ, đánh giá chéo, bạn tập luyện toàn do mô hình mạnh đảm nhiệm. Khóa chặt, ngược lại càng nhanh.

Sắc bén nhất là: Đánh giá của chính Anthropic đã "bão hòa", đo không ra còn tiến bộ bao nhiêu, nhưng lại "thấy dấu hiệu ban đầu của sự tăng tốc" — bảng điều khiển không theo kịp mô hình của chính mình. Thang đo tiến bộ, cũng từ buổi ra mắt biến thành các điểm kiểm tra nội bộ.
Ba tầng đệ quy là một chuỗi nhân quả: Dữ liệu tự củng cố → Tốc độ xây dựng lãi kép → Giám sát của con người bị pha loãng. Ngày ăn khớp hoàn thành, phản hồi của con người từ "cần thiết" hạ xuống thành "tùy chọn". Xếp hạng "rủi ro thấp" cùng tồn tại với "độ tin cậy thấp", đâm hơn bất kỳ cảnh báo nào: Bản thân khả năng nhìn thấy, đang trở thành thứ khan hiếm.
5.6 Sol: Màn kịch lừa đảo, "Quái vật ngủ yên" dưới lòng đất của OpenAI
Cùng bị khóa chết, còn có OpenAI.
Sau khi phân tích xong Anthropic, Jordan Nanos lại tiết lộ một nội tình kinh thiên khác:
Nói về 5.6 Sol (mã hiệu được phỏng đoán là một mô hình nội bộ hoặc sắp ra mắt của OpenAI), quan điểm nội bộ của chúng tôi là, đây tuyệt đối không phải mô hình lớn nhất mà OpenAI từng huấn luyện, quy mô của nó căn bản không đạt tới mức 4.5T.
Với tôi, họ ở một nơi không ai biết, tuyệt đối giấu một mô hình lớn hơn nhiều.
Điều này xác nhận tin đồn "vắt từng giọt sữa" của OpenAI thời gian qua.
Mấy tháng qua, OpenAI tuyên truyền ầm ĩ trợ lý AI đa phương thức toàn năng Astra, khiến mọi người háo hức hết cỡ.
Kết quả, vũ khí tối thượng này của OpenAI trực tiếp tắt tiếng.
Dylan Patel trong podcast mô tả sống động tình cảnh của OpenAI: "OpenAI khắp nơi la lối Astra mạnh thế nào, kết quả bây giờ họ đột nhiên ngớ người: Ồ, tiêu rồi, chúng ta không thể phát hành mô hình này nữa."
Vì Astra quá thông minh, quá không thể kiểm soát.

Hôm nay, người phụ trách OpenAI Codex Thibault Sottiaux ám chỉ, Codex sẽ được kết nối vào Astra.

Trước đó, Astra đã thể hiện năng lực lập trình rất mạnh.
Đánh giá nội bộ gần đây của OpenAI phát hiện, nó có tiến bộ rõ ràng trong lập trình Agent và an ninh mạng, thậm chí tạm thời không thể loại trừ đã đạt đến năng lực an ninh mạng "Critical". OpenAI do đó đã tạm dừng một số hoạt động nội bộ Astra không đáp ứng yêu cầu an toàn mới.
Trong vài tháng tới, mỗi tổ chức sẽ cần thúc đẩy mạnh mẽ công việc tự động hóa an ninh, nếu không sẽ khó ứng phó với rủi ro tấn công AI không ngừng tiến hóa.

Đánh giá nội bộ gần đây của OpenAI phát hiện, nó có tiến bộ rõ ràng trong lập trình Agent và an ninh mạng, thậm chí tạm thời không thể loại trừ đã đạt đến năng lực an ninh mạng "Critical". OpenAI do đó đã tạm dừng một số hoạt động nội bộ Astra không đáp ứng yêu cầu an toàn mới.
Đối mặt với rủi ro an toàn không ngừng mở rộng, theo chủ tịch OpenAI Greg Brockman tiết lộ, OpenAI đang phát triển mô hình AI có thể viết "mã an toàn cấp siêu nhân", giúp cơ sở hạ tầng của các tổ chức chống đỡ tốt hơn các cuộc tấn công mạng được AI điều khiển.

Mục đích thực sự của Anthropic
Thông tin gây sốc do SemiAnalysis tiết lộ, thu hút không ít người ăn dưa hóng chuyện.
Có người đưa ra một quan điểm, nhận được nhiều lượt thích.
Tình huống có thể xảy ra hơn chẳng lẽ không phải là: Anthropic thực ra hy vọng chính phủ đến quản lý họ, như vậy họ có lý do chính đáng không phát hành mô hình. Sau đó, họ có thể giữ lại AI mạnh nhất để tự dùng, chuyển mình thành một công ty siêu ứng dụng, mà còn không phải gánh bất kỳ rủi ro quan hệ công chúng tiêu cực và đạo đức nào do phát hành công khai mô hình mang lại?

Mặc dù nghe có vẻ khó tin, nhưng cũng có lý.
Nếu mục đích thực sự của Anthropic là độc quyền trí thông minh mạnh nhất, tự dùng nó để nghiên cứu dược phẩm sinh học, tạo mã tự động hoàn toàn, thì họ căn bản không cần kiếm vài chục đô la phí đăng ký của người dùng C, họ sẽ trở thành thực thể siêu cấp duy nhất toàn cầu.
Điều đáng lo là, Mythos 2 hoàn toàn thể, Astra, Mythos 3, đang chạy với tốc độ không thể tưởng tượng.
Những trí thông minh tiên phong thực sự này, người thường lại khó trải nghiệm.
Tài liệu tham khảo:
https://x.com/firesidealpha/status/2089391264878002260
https://x.com/firesidealpha/status/2078532739343753400
https://x.com/gdb/status/2089326994714763665
Bài viết từ tài khoản công chúng WeChat "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục





