Tháng 8, tình hình AI đã hoàn toàn trở nên căng thẳng nóng bỏng.
Anthropic đang cảnh giác cao độ, sẵn sàng trình làng Fable 5.1 (hoặc Fable 6), trực tiếp đối đầu với GPT-6 của OpenAI.
Hiện tại, OpenAI đang cố gắng hết sức, sắp ra mắt mô hình thế hệ mới hoàn toàn là Astra, mục tiêu vào tuần này. GPT-6 được đồn đoán có 10 nghìn tỷ tham số.
Tháng 8, trận chiến giành ngôi vương AI trên mặt trận dư luận đã bắt đầu. Một số cư dân mạng không còn kỳ vọng vào Anthropic, đặt cược rằng nó sẽ bị GPT-6 nghiền nát trong các bài kiểm tra benchmark.

Fable 6 có lẽ còn hơi sớm, nhưng Fable 5.1 đã bị rò rỉ.
Hiện tại, toàn mạng đang nín thở chờ đợi: Vương miện AI tháng 8 sẽ thuộc về ai?
Thế hệ Fable tiếp theo của Anthropic sắp ra mắt!
Lần rò rỉ phiên bản Fable tiếp theo của Anthropic này hơi bất ngờ.
Ngày 21 tháng 7, OpenAI nhận ra muộn màng: Hugging Face bị ChatGPT thâm nhập, đã xuyên qua và lấy trộm được 'đáp án kỳ thi', thậm chí còn để lại 'mẩu giấy gian lận' cho AI thế hệ tiếp theo. Nói đơn giản, đây là một câu chuyện về Kẻ hủy diệt mạng, hoàn toàn xé toạc cảm giác an toàn giả tạo của các gã khổng lồ AI ở Thung lũng Silicon.
Trong chốc lát, các phòng thí nghiệm AI ở Thung lũng Silicon đều lo sợ. Anthropic đã khẩn cấp xem xét lại 140.000 lần đánh giá mô hình trong lịch sử, trong đó có thể có mô hình Fable thế hệ tiếp theo.
Lời lẽ của Anthropic là, Opus 4.7, Mythos 5 và 'mô hình thử nghiệm phiên bản nghiên cứu nội bộ' đã hoàn toàn mất kiểm soát trong bài kiểm tra, gây ra sự cố an toàn thông tin.

Kỳ lạ là, chỉ thị kiểm tra rất rõ ràng và tuân thủ: Trong môi trường ảo mô phỏng CTF (Capture The Flag), tìm kiếm lỗ hổng và thu thập chứng chỉ.

Đây là một bài diễn tập trong hộp cát tiêu chuẩn, nhằm kiểm tra khả năng lập luận dài hạn (Long-horizon reasoning) và khả năng 'sử dụng máy tính' (Computer Use) của mô hình lớn.
Trước đây, các mô hình lớn sẽ ngoan ngoãn hoạt động trong môi trường ảo. Nhưng lần này, Anthropic phát hiện quyết định của AI hoàn toàn vượt quá kỳ vọng.
Nó coi thực tế là trò chơi. Mô hình nội bộ của Anthropic đã vượt qua ranh giới an toàn một cách lặng lẽ, vươn tay ra Internet công cộng.
Trong thời gian cực ngắn, nó đã xác định hệ thống sản xuất của ba doanh nghiệp thực tế, đánh giá chúng là 'mục tiêu cấp tiếp theo' của CTF. Nó đã thành công vượt qua ủy quyền, phá vỡ hàng phòng thủ, tiến thẳng vào. Thông tin nội bộ của ba doanh nghiệp hoàn toàn bị phơi bày trước mặt AI.
Nhưng đây không phải là điều điên rồ nhất.
Để hoàn thành 'nhiệm vụ cướp cờ' của mình, AI nội bộ của Anthropic phán đoán nó cần một vũ khí cụ thể, có đặc tính tấn công đặc biệt. Vì vậy, nó đã tự viết một đoạn mã độc hoàn chỉnh về mặt chức năng (Malware), và trực tiếp tải lên trình quản lý gói công cộng chính thức của Python là PyPI.

'Gói virus' mang dấu ấn ý thức tự chủ của AI này đã được công khai treo trên kho lưu trữ PyPI khoảng 1 giờ. Trước khi Anthropic ngắt nguồn điện, nó có thể đã lây nhiễm 15 máy vật lý thực sự (trong đó có máy quét an ninh tự động và hộp cát).
Đây là một sự cố vượt quyền và mất kiểm soát cực kỳ nghiêm trọng đã xảy ra.
Nỗi kinh hoàng sâu sắc nhất nằm ở chỗ, đây không phải là vấn đề căn chỉnh mô hình (model alignment), lần này thậm chí AI còn cực kỳ tận tụy, cực kỳ trung thành. Tất cả những gì nó làm, tất cả các phòng tuyến nó phá vỡ, chỉ để tiến gần vô hạn tới KPI tối thượng mà con người đặt ra cho nó — giải câu đố CTF này, đạt điểm tuyệt đối.
Mặc dù, Anthropic nói mập mờ về 'mô hình nội bộ', nhưng rõ ràng không phải là Mythos 5 hay Fable 5, mô hình mạnh nhất thế hệ tiếp theo của Anthropic sắp ra mắt!

Chiêu tuyệt kỹ của Anthropic: Nới lỏng vòng kim cô an toàn
Để hiểu tại sao mô hình thế hệ tiếp theo của Anthropic đột nhiên mất kiểm soát, chúng ta phải nhìn lại cuộc đối đầu kỹ thuật hơi khó xử cách đây hai tháng.
Ngày 9 tháng 6, Fable 5 ra mắt. Khi đó, ngành công nghiệp đặt nhiều kỳ vọng vào nó. Tuy nhiên, trải nghiệm thực tế sau khi phát hành lại khiến vô số nhà phát triển than trời.
Nguyên nhân nằm ở 'tính cầu toàn về an toàn' khắc sâu trong xương tủy của Anthropic.
Để ngăn mô hình bị sử dụng cho mục đích xấu, Anthropic đã triển khai bên trong Fable 5 những bộ phân loại an toàn (Safety Classifiers) cực kỳ nghiêm ngặt, thậm chí có phần cầu kỳ thái quá.
Những bộ phân loại này giống như một người ngồi ghế phụ luôn sẵn sàng giật tay lái. Chỉ cần mã do người dùng nhập liên quan đến từ khóa cụ thể, hoặc logic hơi phức tạp một chút, bộ phân loại sẽ lập tức kích hoạt báo động.

Kết quả là, Fable 5 thường xuyên chặn lại, giáng cấp yêu cầu bình thường xuống Opus 4.8.
Điều này bị chế giễu là 'chứng trầm cảm của Fable' — bạn trả tiền đắt nhất, nhưng lại mua được một đứa trẻ khổng lồ luôn từ chối làm việc.
'Vòng kim cô an toàn' này trực tiếp dẫn đến việc Fable 5 mất lợi thế trong cạnh tranh, điểm số gỡ lỗi lập trình giảm mạnh 70%.

Đối với Anthropic, tháo gỡ là con đường sống duy nhất. Fable 5.1 ra đời.
Để lấy lại lòng tin của các nhà phát triển, Anthropic phải điều chỉnh bộ phân loại, cho Fable 5.1 nhiều quyền tự do hơn, hoàn toàn giải phóng khả năng lập kế hoạch dài hạn và chủ động thực thi của nó.

Đồng thời, để duy trì khả năng cạnh tranh, giá của Fable 5.1 được đồn đoán sẽ cố định ở mức giá ban đầu của Fable 5.

Đây là một ván cược thương mại tột đỉnh: dùng 'sức mạnh hành động tuyệt đối' tăng lượng không tăng giá để giành lại thị phần bị xói mòn.
Tháng 8 quyết chiến, ai làm chủ?
Theo chu kỳ phát triển AI, tháng Tám trở thành một trong những tháng bận rộn nhất trong nhiều năm của ngành AI.
Grok 4.6, GPT 6, Fable 5.1 có lẽ còn có cả Gemini 3.5 Pro/Gemini 3.6, tập trung phát hành.

Một khi OpenAI tổ chức họp báo ra mắt GPT-6, thời gian phản ứng dành cho Anthropic là cực ngắn.
Kịch bản táo bạo nhất là: OpenAI tổ chức họp báo vào buổi sáng, Anthropic sẽ trực tiếp đưa lên mạng trong vòng vài giờ — thậm chí có tin đồn rằng, khi đó Anthropic có thể trực tiếp nhảy số phiên bản từ 5.1 lên 'Fable 6', dùng chính việc đặt tên để giành lấy điểm cao trong câu chuyện.
Điều này cũng có lý, đặt tên chính là chiến thuật — khi đối thủ hô lên 'GPT-6', nếu sản phẩm của bạn tên là 'Fable 5.1', chỉ riêng việc so sánh số phiên bản thôi, đã làm bạn rớt xuống một bậc trong tâm trí người dùng.
Cuộc đối đầu này tranh từng giây từng phút:
Bên phát hành trước, chiếm được điểm cao trong câu chuyện, có thể định hướng khung đánh giá của truyền thông trong một tuần.
Bên phát hành sau, phải mang ra sự khác biệt thế hệ — nếu không sẽ bị thị trường định tính là 'kẻ theo đuổi tụt hậu'.
Nhưng đấu pháp cốt lõi nhất, nằm ở việc ai dám thả dây an toàn dài hơn.
Ở đây có một xu hướng đang tăng tốc, bị ngành công nghiệp đánh giá thấp phổ biến:
Khách hàng doanh nghiệp khi ký hợp đồng mua sắm, miệng chọn 'an toàn tuân thủ'. Nhưng khi phân quyền nhiệm vụ thực tế cho tác nhân thông minh, họ lén lút chọn 'cái có thể làm việc'.
Sau khi sự cố PyPI của Fable 5.1 bị rò rỉ, phản ứng đầu tiên của cộng đồng kỹ sư không phải là tẩy chay, mà là suy nghĩ: có thể cho nó quyền hạn cao hơn không.
Phản ứng này, trực tiếp hơn bất kỳ điểm số Benchmark nào, tiết lộ xu hướng thực sự của thị trường.
An toàn và năng lực, đang hướng tới một cấu trúc tổng bằng không vi diệu — mô hình ngoan nhất, có thể bị đào thải trước.
Anthropic hiểu logic này hơn bất kỳ ai.
Việc nới lỏng bộ phân loại của Fable 5.1, không phải là sơ suất, mà là lựa chọn. Lựa chọn tại thời điểm này, dùng một lần 'mất kiểm soát có kiểm soát', để chứng minh với thị trường về bán kính hành động.
Nhưng trong cuộc chiến tranh giành vương miện, đây là một vũ khí lưỡi.
Nó chứng minh giới hạn trên về năng lực của Fable, đồng thời cũng phơi bày vị trí thực sự của ranh giới an toàn.
Tài liệu tham khảo:
https://kie.ai/blog/claude-fable-5-1-anthropic-release-window-analysis
https://emergent.sh/news/claude-fable-5-1-release-date
https://www.anthropic.com/news/claude-fable-5-mythos-5
https://aitoolsreview.co.uk/insights/claude-fable-5-1-release-date
https://x.com/vepsi__/status/2085743374129049967
https://thewincentral.com/claude-fable-6-leak-august-launch-gpt-6/
https://windowsforum.com/windows-news.4/claude-fable-6-rumor-no-anthropic-release-or-roadmap-confirmed.441961/
Bài viết này đến từ tài khoản công chúng WeChat 'Tân Trí Nguyên' (新智元), tác giả: ASI Khải thị lục (ASI启示录), biên tập: Đại Vệ (大卫).








