Claude Một Đêm Biến Đần, Cả Mạng Tranh Cãi Điên Cuồng!
Ngay hôm qua, nhà phát triển argofowl đã bỏ ra cả buổi chiều, suýt chút nữa đã lật tung Claude Code từ trên xuống dưới.

Anh ta lần theo từng bước, đầu tiên nghi ngờ t3 code bị sập, sau đó lại nghĩ mã của mình có lỗi.
Kiểm tra đến cuối cùng, anh ta thậm chí bắt đầu nghi ngờ - lẽ nào mình đã làm hỏng Mac?
Khi argofowl cuối cùng mở nhật ký yêu cầu API thực sự ra, mọi sự thật đã sáng tỏ, trong đó hiện rõ một con số "10".

Tuy nhiên, trong backend Claude Code, anh ta rõ ràng đã chọn "high", mức độ suy luận cao nhất.
Ai ngờ được, nhật ký cập nhật của Claude Code, không viết một chữ nào.
Suy luận high biến thành 10
Claude Code Biến Đần Bị Phơi Bày
Argofowl phát hiện ra, từ Claude Code 2.1.237 trở đi, mô hình đã đọc mức độ suy luận "high" thành 10 trên 100.
Mà con số này, chính là giá trị tương ứng với mức "low" trong quá khứ.
Tìm hiểu kỹ phát hiện, Anthropic đã đưa các phiên Fable 5 của Claude Code phiên bản 2.1.236 trở lên vào một thí nghiệm "nén thang giá trị nỗ lực (effort)".
Tuy nhiên, phiên bản cũ và Opus 5 không bị ảnh hưởng.

Đây rất có thể là một thử nghiệm A/B, nên không phải ai cũng sẽ gặp phải.
Đối với các nhà phát triển, đây mới là điểm đau thực sự. Mô hình mạnh hơn yếu hơn một chút, còn có thể chịu được.
Nhưng bạn kéo tôi vào nhóm thí nghiệm, lại không định nói cho tôi biết: vậy cả buổi chiều này tôi đang debug cái gì? Đang điều chỉnh mã của mình, hay đang điều chỉnh thử nghiệm A/B của bạn?
Không ngờ, sau khi blogger công nghệ Chubby chuyển tiếp, giới AI trực tiếp nổ tung -
Có vẻ như, Anthropic đã lặng lẽ điều chỉnh mô hình trở nên đần hơn, nhưng không nói với bất kỳ ai.

Trong chốc lát, các bài đăng tự kiểm tra "Claude có đần hơn không?" tràn ngập trên X.
Có người đăng tải so sánh đầu ra của cùng một prompt ở các phiên bản khác nhau, có người lật lại hồ sơ phiên trò chuyện của mình từ hai tuần trước để thực hiện diff từng dòng.
Anthropic Nhận Sai, Kỹ Sư Xuống Xe
Đối mặt với cơn bão này, phản hồi của kỹ sư Claude Code Thariq Shihipar đến rất nhanh.
Đôi khi chúng tôi sẽ kiểm tra cấu hình dịch vụ API trong Claude Code trước, rồi mới quyết định có nên đẩy toàn bộ hay không.
Thí nghiệm đang chạy hiện nay, chỉ là thay đổi cách ánh xạ giá trị số của effort. Vì vậy một số người sẽ thấy Claude nói mình là "10".

Điểm mấu chốt là, thang đo này không phải từ 0 đến 100, con số đó tự nó không có ý nghĩa gì, mức effort bạn chọn chính là mức effort bạn nhận được.
Anh ấy nhấn mạnh, nhóm đã thực hiện đánh giá sâu để xác nhận, điều này không ảnh hưởng đến hiệu suất mô hình.

Opus 5 Giảm Trí Tuệ Lớn, Là Thật
Vừa giải quyết xong vấn đề của Fable, Chubby lại thẳng thắn nói, Opus 5 hiện tại cảm giác giống như một lần hạ cấp đáng kể.
Nó luôn làm việc qua loa, thường xuyên mắc lỗi sơ đẳng. Một khi bị chỉ ra là không thực hiện theo chỉ dẫn, nó chỉ cơ học trả lời câu đó -
Bạn nói đúng, là tôi sơ suất. Lật đi lật lại, không hết.
Thực ra, mấy ngày trước, đã có người phát hiện ra vấn đề rõ ràng "giảm trí tuệ" của Opus 5.
Ngoài vấn đề đề cập ở trên, nó còn tạo ra bug, rồi tiêu tốn nhiều thời gian sửa bug, tự sửa sai lặp đi lặp lại trong cùng một nhiệm vụ.......


Sau khi bị người dùng mạng truy vấn một vòng, kỹ sư Thariq công khai thừa nhận - Opus 5 là một mô hình "thể hiện rất không ổn định", lúc cao lúc thấp, không ổn định.
Nội bộ nhóm đang nỗ lực giải quyết vấn đề này, đây là ưu tiên cao nhất đối với chúng tôi.

Điểm Chạy Luôn Đi Lên
Cảm Nhận Thực Tế Đi Xuống
Cơn sóng gió Opus 5 này, xé toạc ra thực ra là một khe hở khó xử nhất của toàn ngành:
Điểm benchmark (chạy) và cảm nhận thực tế, đang có sự tách rời một cách có hệ thống.
Một bên là bảng thành tích sáng chói đến mức gần như không thể chê: tổng điểm 82.72, SWE-bench Pro 79.2%, Terminal-Bench 86.7%.
Một bên khác, lại là cảm nhận thực tế hoàn toàn trái ngược của người dùng: "dài dòng", "lười biếng", "thích cãi lại".
Nơi hoang đường nhất chính là, hai loại đánh giá này đồng thời xuất hiện trên Opus 5.
Hơn nữa, "mô hình trở nên đần hơn" cũng không phải là vấn đề riêng của Anthropic.

Ngày nay, việc cập nhật phiên bản mô hình lớn, đang trở thành chiếc hộp đen kém minh bạch nhất của toàn bộ ngành công nghiệp AI.
Phần mềm truyền thống có số phiên bản ngữ nghĩa, có nhật ký cập nhật, cũng có cơ chế rollback. Nhà phát triển có thể biết rõ ràng mình đang sử dụng phiên bản nào, đã xảy ra những thay đổi gì.
Mô hình lớn, thì khác.
Dưới cùng một tên mô hình, phía server có thể bất cứ lúc nào tiến hành thử nghiệm A/B, thay đổi phương án lượng tử hóa, điều chỉnh định tuyến mô hình, thậm chí thay đổi tài nguyên suy luận.
Bảng điều khiển duy nhất mọi người có trong tay, chỉ còn lại cảm nhận thực tế của chính mình.
Đáng tiếc thay, trực giác lại là thứ dễ bị bác bỏ nhất, cũng khó chứng minh là sai nhất.
Giá trị lớn nhất của cơn sóng gió này, là đưa vết thương ngầm tồn tại lâu dài của ngành lên sân khấu một cách triệt để:
Khi mô hình trở thành cơ sở hạ tầng, sự ổn định chính là một khế ước tin tưởng. Điểm benchmark có thể dùng để marketing, sự ổn định chỉ có thể dựa vào việc thực hiện từng lần từng lần.
Tài liệu tham khảo:
https://x.com/trq212/status/2091252347913773169?s=20
https://x.com/kimmonismus/status/2091178321669198014
Bài viết này đến từ tài khoản công chúng WeChat "Tân Trí Nguyên" (新智元), tác giả: ASI Khải Thị Lục, biên tập: Đào Tử





