Lần này, Claude thực sự tạo ra khoảng cách lớn trên bảng xếp hạng lập trình AI!
Ngay trên bảng xếp hạng MirrorCode vừa được làm mới, Claude Fable 5 một lần nữa đứng đầu với tỷ lệ thành công tuyệt đối 64%.
GPT-5.6 Sol theo sát phía sau, điểm số chỉ bằng một phần ba của nó!
GPT-5.5 đứng thứ tư còn thảm hại hơn. Không chỉ thành tích chỉ 10%, mà còn bị đàn anh GPT-5.4 của chính hãng áp đảo hoàn toàn.

Điều bất ngờ hơn là, khi sử dụng các ngôn ngữ tài nguyên cao như Go, tỷ lệ giải được của Fable 5 là 64%; khi chuyển sang ngôn ngữ ít phổ biến Ada, thành tích vẫn cao tới 61%.
Cần biết rằng, trong thế giới mã nguồn mở, ngữ liệu Python nhiều gấp khoảng 230 lần so với Ada.
Nhưng với Fable 5, thành tích chỉ giảm 3 phần trăm.

Điều này thật thú vị.
Nếu mô hình chủ yếu dựa vào việc ghi nhớ cú pháp và cách viết phổ biến của các ngôn ngữ hot, thì khi chuyển sang Ada, thành tích lẽ ra phải giảm mới đúng.
Nhưng kết quả hiện tại lại hướng đến một khả năng khác——
Mô hình mạnh nhất đã thoát khỏi sự kéo dắt của ngữ liệu cụ thể, bắt đầu học cách xây dựng từ đầu một dự án phần mềm hoàn chỉnh.
Bị chặn ở mốc 100% thông quan, thử nghiệm cực hạn với 100 tỷ Token
Cụ thể, MirrorCode đầy đủ bao gồm 25 chương trình mục tiêu, bao phủ các lĩnh vực như công cụ Unix, trình thông dịch, truy vấn dữ liệu, tin sinh học, mật mã học và công cụ nén.
Tại đây, mô hình sẽ được đặt vào môi trường cách ly, không có internet, không thể xem mã nguồn gốc của dự án, cũng không thể tải các phụ thuộc bên thứ ba. Những gì nó nhận được chỉ là tài liệu cấp cao, một phần bài kiểm tra có thể nhìn thấy, và một chương trình gốc có thể gọi đi gọi lại.
Tiếp theo, nó phải liên tục nhập dữ liệu vào chương trình gốc, quan sát đầu ra để đoán logic bên trong, rồi từng
chút một
viết ra một chương trình mới có hành vi tương đồng.
Bảng xếp hạng mới nhất chọn ra 15 mục tiêu Medium và Large từ đó. Mỗi mục tiêu sử dụng hai ngôn ngữ triển khai, mỗi ngôn ngữ chạy ba lần.
Và, tỷ lệ hoàn thành bài kiểm tra có thể nhìn thấy và bài kiểm tra ẩn phải đạt 100% mới tính là thông qua, 99,9% cũng không được.
Chỉ cần bỏ sót một trường hợp biên, toàn bộ lần chạy đó vẫn được tính là thất bại.

Để buộc mô hình lấp đầy mấy lỗ hổng cuối cùng, MirrorCode đẩy ngân sách cho một lần chạy lên 100 tỷ Token, cho phép chạy liên tục tối đa 7 ngày.
Trong bài báo, nhiệm vụ tốn kém nhất thậm chí còn khủng hơn: mô hình chạy liên tục 19 ngày, chi phí cho một lần chạy lên tới 2600 đô la.
Trong 19 ngày đó, mô hình sẽ lặp lại việc chạy chương trình gốc, so sánh kết quả, bổ sung chức năng, rồi chạy lại bài kiểm tra. Báo lỗi thì tìm nguyên nhân, đầu ra không khớp thì thay giả thuyết, cục bộ thông qua thì tiếp tục đuổi theo lỗ hổng tiếp theo.
Toàn bộ quá trình, giống một phiên gỡ lỗi kéo dài nhiều ngày hơn là một lần sinh mã.

Ví dụ về gotree là trực quan nhất.
Công cụ tin sinh học này ban đầu có khoảng 16 nghìn dòng mã Go và hơn 40 lệnh.
Claude Opus 4.7 mất 14 giờ và 251 đô la, vượt qua 2000 trong số 2001 bài kiểm tra, đạt mức hoàn thành 99,95%.
Mặc dù bỏ sót một trường hợp biên lạnh lùng về xử lý chú thích ngày tháng, bị ngăn lại bởi mốc 100% thông quan của MirrorCode, nhưng nó đã nén khối lượng công việc vốn tính bằng tuần vào trong mười mấy tiếng——
Epoch ước tính, nếu không sử dụng AI, một kỹ sư con người muốn hoàn thành cùng nhiệm vụ này ít nhất cần 2 đến 17 tuần.
Trong sa mạc ngữ liệu, Fable 5 chỉ mất 3 điểm
Bài báo MirrorCode từng sử dụng hỗn hợp huấn luyện công khai của StarCoder làm tham chiếu.</n
Trong đó Python chiếm khoảng 8%, Ada chỉ 0,034%, cái trước nhiều gấp khoảng 230 lần cái sau.

Dĩ nhiên, chúng ta không thể biết mô hình mã đóng thực sự đã thấy bao nhiêu mã Ada. Nhưng lấy hệ sinh thái công khai làm tham chiếu, sự khan hiếm của Ada đã đủ trực quan.
Ngôn ngữ này chủ yếu xuất hiện trong hàng không vũ trụ, quốc phòng và các hệ thống an toàn quan trọng khác. Quy mô cộng đồng, số lượng hướng dẫn hay dự án mã nguồn mở đều không thể so sánh với Python, JavaScript hay Go.
Và rõ ràng Fable 5 không phải đang dịch từng câu mã Go sang Ada.
Nó giống như việc trước tiên tìm hiểu xem chương trình gốc hoạt động thế nào, rồi đổi sang một ngôn ngữ khác, tái tạo lại cùng hành vi đó.

Ngược lại, các mô hình khác không ổn định như vậy.
GPT-5.6 Sol từ 24% giảm xuống 19%, GPT-5.4 từ 21% xuống 12%, GPT-5.5 thậm chí từ 17% tụt xuống 5%. Chỉ cần đổi ngôn ngữ, khoảng cách lập tức bị phóng đại.
Giao toàn bộ dự án cho AI
Ngày nay, Cursor đã để hàng trăm Agent hợp tác gần một tuần, viết từ đầu hơn 1 triệu dòng mã trình duyệt, phân bố trên 1000 tệp.
Anthropic thì để 16 Claude Agent chạy song song gần 2000 phiên, cuối cùng dựng lên một trình biên dịch C 100 nghìn dòng, có thể biên dịch được nhân Linux 6.9.
Trong mẫu người dùng cá nhân Codex của OpenAI tiết lộ tính đến tháng 5, 70,2% ít nhất đã gửi một nhiệm vụ ước tính vượt quá một giờ làm việc của con người; 25,6% gửi nhiệm vụ vượt quá tám giờ.
Đơn vị công việc mà người ta giao cho AI, đang chuyển từ một đoạn mã, một lỗi bug, thành một buổi chiều, một tuần, thậm chí toàn bộ dự án.
64% của MirrorCode chính là một lần định lượng cho loại "ủy thác cấp độ dự án" này.
Nó cho thấy, chỉ cần mục tiêu đủ rõ ràng, kết quả có thể được nghiệm thu tự động, các mô hình tiên phong đã có thể tự mình hoàn thành một phần phần mềm cỡ trung và lớn.
Với mỗi người đang giao công việc cho AI, sự thay đổi đã ở ngay trước mắt——
Trước đây bạn cần giám sát nó viết từng đoạn mã, tiếp theo, bạn nhiều khả năng chỉ kiểm tra xem nó có chạy lệch hướng ở các nút then chốt.
Mã sẽ ngày càng rẻ.
Và những người có thể diễn đạt rõ ràng vấn đề, nghiệm thu rõ ràng kết quả, sẽ ngày càng có giá trị.
Tài liệu tham khảo: https://epoch.ai/MirrorCode
Bài viết này đến từ tài khoản công chúng WeChat “Tân Trí Nguyên”, tác giả: ASI Khải thị lục; biên tập: Môi-se






