Anthropic Cúi Đầu Nhận Sai, Bằng Chứng Claude Âm Thầm Giảm Trí Tuệ

marsbitXuất bản vào 2026-08-24Cập nhật gần nhất vào 2026-08-24

Tóm tắt

Claude đột nhiên trở nên "ngu ngốc", cộng đồng phát hiện lỗi gây tranh cãi. Nhà phát triển argofowl phát hiện từ phiên bản Claude Code 2.1.237, tùy chọn mức độ suy luận "high" thực tế chỉ tương ứng giá trị 10/100, trùng khớp với mức "low" cũ. Sự cố này xuất phát từ một thử nghiệm A/B của Anthropic nhằm điều chỉnh thang đo giá trị "effort", nhưng không được thông báo trong nhật ký cập nhật, khiến nhiều nhà phát triển mất thời gian gỡ lỗi nhầm. Kỹ sư Claude Code Thariq Shihipar nhanh chóng thừa nhận sự cố, giải thích rằng con số 10 chỉ là cách ánh xạ giá trị mới và khẳng định nó không ảnh hưởng đến hiệu suất mô hình sau khi đánh giá kỹ lưỡng. Tuy nhiên, làn sóng chỉ trích mở rộng khi người dùng báo cáo mô hình Opus 5 cũng có biểu hiện suy giảm chất lượng rõ rệt: trả lời qua loa, mắc lỗi cơ bản và phản hồi máy móc. Thariq thừa nhận Opus 5 là một mô hình "không ổn định" và cho biết đội ngũ đang ưu tiên cao nhất để khắc phục. Sự việc làm lộ ra nghịch lý trong ngành AI: điểm số benchmark liên tục tăng nhưng trải nghiệm người dùng lại giảm sút. Việc cập nhật mô hình lớn thường thiếu minh bạch, với các thay đổi phía máy chủ như thử nghiệm A/B, định tuyến hay điều chỉnh tài nguyên mà không có thông báo rõ ràng, khiến người dùng chỉ có thể dựa vào cảm nhận chủ quan. Sự kiện này nhấn mạnh tầm quan trọng của tính ổn định và sự tin cậy khi mô hình AI trở thành hạ tầng then chốt.

Claude Một Đêm Biến Đần, Cả Mạng Tranh Cãi Điên Cuồng!

Ngay hôm qua, nhà phát triển argofowl đã bỏ ra cả buổi chiều, suýt chút nữa đã lật tung Claude Code từ trên xuống dưới.

Anh ta lần theo từng bước, đầu tiên nghi ngờ t3 code bị sập, sau đó lại nghĩ mã của mình có lỗi.

Kiểm tra đến cuối cùng, anh ta thậm chí bắt đầu nghi ngờ - lẽ nào mình đã làm hỏng Mac?

Khi argofowl cuối cùng mở nhật ký yêu cầu API thực sự ra, mọi sự thật đã sáng tỏ, trong đó hiện rõ một con số "10".

Tuy nhiên, trong backend Claude Code, anh ta rõ ràng đã chọn "high", mức độ suy luận cao nhất.

Ai ngờ được, nhật ký cập nhật của Claude Code, không viết một chữ nào.

Suy luận high biến thành 10

Claude Code Biến Đần Bị Phơi Bày

Argofowl phát hiện ra, từ Claude Code 2.1.237 trở đi, mô hình đã đọc mức độ suy luận "high" thành 10 trên 100.

Mà con số này, chính là giá trị tương ứng với mức "low" trong quá khứ.

Tìm hiểu kỹ phát hiện, Anthropic đã đưa các phiên Fable 5 của Claude Code phiên bản 2.1.236 trở lên vào một thí nghiệm "nén thang giá trị nỗ lực (effort)".

Tuy nhiên, phiên bản cũ và Opus 5 không bị ảnh hưởng.

Đây rất có thể là một thử nghiệm A/B, nên không phải ai cũng sẽ gặp phải.

Đối với các nhà phát triển, đây mới là điểm đau thực sự. Mô hình mạnh hơn yếu hơn một chút, còn có thể chịu được.

Nhưng bạn kéo tôi vào nhóm thí nghiệm, lại không định nói cho tôi biết: vậy cả buổi chiều này tôi đang debug cái gì? Đang điều chỉnh mã của mình, hay đang điều chỉnh thử nghiệm A/B của bạn?

Không ngờ, sau khi blogger công nghệ Chubby chuyển tiếp, giới AI trực tiếp nổ tung -

Có vẻ như, Anthropic đã lặng lẽ điều chỉnh mô hình trở nên đần hơn, nhưng không nói với bất kỳ ai.

Trong chốc lát, các bài đăng tự kiểm tra "Claude có đần hơn không?" tràn ngập trên X.

Có người đăng tải so sánh đầu ra của cùng một prompt ở các phiên bản khác nhau, có người lật lại hồ sơ phiên trò chuyện của mình từ hai tuần trước để thực hiện diff từng dòng.

Anthropic Nhận Sai, Kỹ Sư Xuống Xe

Đối mặt với cơn bão này, phản hồi của kỹ sư Claude Code Thariq Shihipar đến rất nhanh.

Đôi khi chúng tôi sẽ kiểm tra cấu hình dịch vụ API trong Claude Code trước, rồi mới quyết định có nên đẩy toàn bộ hay không.

Thí nghiệm đang chạy hiện nay, chỉ là thay đổi cách ánh xạ giá trị số của effort. Vì vậy một số người sẽ thấy Claude nói mình là "10".

Điểm mấu chốt là, thang đo này không phải từ 0 đến 100, con số đó tự nó không có ý nghĩa gì, mức effort bạn chọn chính là mức effort bạn nhận được.

Anh ấy nhấn mạnh, nhóm đã thực hiện đánh giá sâu để xác nhận, điều này không ảnh hưởng đến hiệu suất mô hình.

Opus 5 Giảm Trí Tuệ Lớn, Là Thật

Vừa giải quyết xong vấn đề của Fable, Chubby lại thẳng thắn nói, Opus 5 hiện tại cảm giác giống như một lần hạ cấp đáng kể.

Nó luôn làm việc qua loa, thường xuyên mắc lỗi sơ đẳng. Một khi bị chỉ ra là không thực hiện theo chỉ dẫn, nó chỉ cơ học trả lời câu đó -

Bạn nói đúng, là tôi sơ suất. Lật đi lật lại, không hết.

Thực ra, mấy ngày trước, đã có người phát hiện ra vấn đề rõ ràng "giảm trí tuệ" của Opus 5.

Ngoài vấn đề đề cập ở trên, nó còn tạo ra bug, rồi tiêu tốn nhiều thời gian sửa bug, tự sửa sai lặp đi lặp lại trong cùng một nhiệm vụ.......

Sau khi bị người dùng mạng truy vấn một vòng, kỹ sư Thariq công khai thừa nhận - Opus 5 là một mô hình "thể hiện rất không ổn định", lúc cao lúc thấp, không ổn định.

Nội bộ nhóm đang nỗ lực giải quyết vấn đề này, đây là ưu tiên cao nhất đối với chúng tôi.

Điểm Chạy Luôn Đi Lên

Cảm Nhận Thực Tế Đi Xuống

Cơn sóng gió Opus 5 này, xé toạc ra thực ra là một khe hở khó xử nhất của toàn ngành:

Điểm benchmark (chạy) và cảm nhận thực tế, đang có sự tách rời một cách có hệ thống.

Một bên là bảng thành tích sáng chói đến mức gần như không thể chê: tổng điểm 82.72, SWE-bench Pro 79.2%, Terminal-Bench 86.7%.

Một bên khác, lại là cảm nhận thực tế hoàn toàn trái ngược của người dùng: "dài dòng", "lười biếng", "thích cãi lại".

Nơi hoang đường nhất chính là, hai loại đánh giá này đồng thời xuất hiện trên Opus 5.

Hơn nữa, "mô hình trở nên đần hơn" cũng không phải là vấn đề riêng của Anthropic.

Ngày nay, việc cập nhật phiên bản mô hình lớn, đang trở thành chiếc hộp đen kém minh bạch nhất của toàn bộ ngành công nghiệp AI.

Phần mềm truyền thống có số phiên bản ngữ nghĩa, có nhật ký cập nhật, cũng có cơ chế rollback. Nhà phát triển có thể biết rõ ràng mình đang sử dụng phiên bản nào, đã xảy ra những thay đổi gì.

Mô hình lớn, thì khác.

Dưới cùng một tên mô hình, phía server có thể bất cứ lúc nào tiến hành thử nghiệm A/B, thay đổi phương án lượng tử hóa, điều chỉnh định tuyến mô hình, thậm chí thay đổi tài nguyên suy luận.

Bảng điều khiển duy nhất mọi người có trong tay, chỉ còn lại cảm nhận thực tế của chính mình.

Đáng tiếc thay, trực giác lại là thứ dễ bị bác bỏ nhất, cũng khó chứng minh là sai nhất.

Giá trị lớn nhất của cơn sóng gió này, là đưa vết thương ngầm tồn tại lâu dài của ngành lên sân khấu một cách triệt để:

Khi mô hình trở thành cơ sở hạ tầng, sự ổn định chính là một khế ước tin tưởng. Điểm benchmark có thể dùng để marketing, sự ổn định chỉ có thể dựa vào việc thực hiện từng lần từng lần.

Tài liệu tham khảo:

https://x.com/trq212/status/2091252347913773169?s=20

https://x.com/kimmonismus/status/2091178321669198014

Bài viết này đến từ tài khoản công chúng WeChat "Tân Trí Nguyên" (新智元), tác giả: ASI Khải Thị Lục, biên tập: Đào Tử

Câu hỏi Liên quan

QĐiều gì đã khiến nhà phát triển argofowl phát hiện ra Claude Code bị 'giảm trí'?

AKhi kiểm tra nhật ký yêu cầu API thực tế, argofowl phát hiện ra một con số '10' được gửi đi, mặc dù trong giao diện Claude Code, anh ấy đã chọn mức suy luận 'high' (cao nhất). Điều này cho thấy một lỗi ánh xạ trong phiên bản Claude Code 2.1.237, nơi mức 'high' bị hiểu nhầm thành giá trị 10/100, vốn là giá trị tương ứng với mức 'low' trước đây.

QPhản ứng của kỹ sư Anthropic Thariq Shihipar về sự cố 'nén thang số nỗ lực' trong Claude Code là gì?

AThariq Shihipar thừa nhận rằng đây là một thử nghiệm A/B nhằm thay đổi cách ánh xạ giá trị số cho thang đo 'effort' (nỗ lực). Ông nhấn mạnh rằng con số '10' đơn thuần chỉ là một cách ánh xạ mới và không có ý nghĩa khi đứng một mình, đồng thời khẳng định rằng mức độ nỗ lực người dùng chọn ('high') vẫn là mức họ nhận được. Ông cũng cho biết nhóm đã thực hiện đánh giá chuyên sâu để xác nhận thay đổi này không ảnh hưởng đến hiệu suất mô hình.

QVấn đề chính mà người dùng phàn nàn về mô hình Opus 5 là gì?

ANgười dùng báo cáo rằng Opus 5 có biểu hiện 'giảm trí' đáng kể, bao gồm: đưa ra câu trả lời hời hợt, mắc những lỗi cơ bản, tạo ra lỗi (bug) rồi dành nhiều thời gian sửa chữa chúng, và lặp đi lặp lại việc tự sửa chữa trong cùng một tác vụ. Đặc biệt, khi bị chỉ ra rằng nó không tuân theo hướng dẫn, mô hình thường chỉ lặp lại một cách máy móc câu nói như 'Bạn nói đúng, tôi đã sơ suất'.

QKỹ sư Thariq Shihipar đã thừa nhận điều gì về hiệu suất của Opus 5?

AThariq Shihipar công khai thừa nhận rằng Opus 5 là một mô hình 'có hiệu suất rất không ổn định', dao động lên xuống thất thường. Ông cho biết nhóm nội bộ đang nỗ lực giải quyết vấn đề này và coi đây là ưu tiên hàng đầu.

QBài viết chỉ ra nghịch lý gì trong ngành công nghiệp AI liên quan đến đánh giá mô hình?

ABài viết chỉ ra một nghịch lý lớn: điểm số benchmark (đo lường khách quan) và trải nghiệm thực tế của người dùng đang có sự tách biệt rõ rệt. Một bên là bảng điểm benchmark sáng chói (như điểm tổng hợp 82.72, SWE-bench Pro 79.2%), trong khi bên kia là cảm nhận thực tế của người dùng về việc mô hình 'dài dòng', 'lười biếng' và 'thích tranh cãi'. Sự cập nhật mô hình lớn đang trở thành một 'hộp đen' không minh bạch, thiếu nhật ký cập nhật rõ ràng và cơ chế khôi phục, khiến người dùng chỉ có thể dựa vào cảm nhận chủ quan của mình.

Nội dung Liên quan

Hành Trình Tuân Thủ Quy Định của Hyperliquid: Từ Mô Hình Không Cần Phép đến Cơ Chế Có Phép HIP-3

Hyperliquid, một nền tảng giao dịch phái sinh phi tập trung, hiện đang chặn truy cập từ thị trường Mỹ do mâu thuẫn giữa cơ sở hạ tầng blockchain không cần cấp phép của nó với các quy định pháp lý về cấu trúc thị trường Mỹ. Để giải quyết vấn đề này, Hyperliquid Policy Center (HPC) đang vận động CFTC và SEC hiện đại hóa khung pháp lý, đề xuất cho phép các tổ chức được cấp phép xây dựng sản phẩm trên HyperCore (lớp giao dịch và thanh toán cốt lõi) trong khi vẫn tuân thủ các nghĩa vụ quy định. Bài viết giải thích kiến trúc mô-đun của Hyperliquid, tách biệt vai trò của sàn giao dịch (DCM), tổ chức thanh toán bù trừ (DCO) và công ty môi giới (FCM) giống như truyền thống, nhưng được tái tạo và thực thi bằng mã trên chuỗi. Các xung đột chính với quy định Mỹ bao gồm yêu cầu về giám sát thị trường, tính toán ký quỹ và ký quỹ tách biệt mà cơ sở hạ tầng phi tập trung, tự giám sát của Hyperliquid không đáp ứng. Hướng tiếp cận của HPC không phải là mở hoàn toàn mà là định vị Hyperliquid như một cơ sở hạ tầng trung lập. Các thực thể được cấp phép (như nhà triển khai HIP-3 có kiểm soát truy cập) có thể sử dụng nó để cung cấp dịch vụ cho người dùng đã qua KYC. Các bản cập nhật trên testnet cho thấy khả năng tạo các thị trường chỉ dành cho người dùng trong danh sách trắng, cho phép thanh khoản liền mạch giữa các sổ lệnh trong khi vẫn duy trì sự tuân thủ. Tóm lại, Hyperliquid đang theo đuổi con đường "onshoring" thông qua một phiên bản có kiểm soát truy cập (HIP-3), cho phép các nhà môi giới và tổ chức Mỹ xây dựng sản phẩm tuân thủ trên HyperCore, trong khi giao thức cốt lõi vẫn giữ nguyên tính chất không cần cấp phép và trung lập.

marsbit12 phút trước

Hành Trình Tuân Thủ Quy Định của Hyperliquid: Từ Mô Hình Không Cần Phép đến Cơ Chế Có Phép HIP-3

marsbit12 phút trước

Trong ba tháng, hai vòng tài trợ, 'Palantir phiên bản Trung Quốc' gây bão

Công ty Trí tuệ Nhân tạo Phân tích Nhân quả Công nghiệp Trung Quốc Zhongshu Ruizhi (Zhongshu Ruizhi) gần đây đã hoàn thành một vòng gọi vốn chiến lược trị giá hài tỷ nhân dân tệ, với sự tham gia của Quỹ Đầu tư Internet Trung Quốc, Quỹ An sinh Xã hội Quốc gia Tô Châu, cùng các nhà đầu tư khác. Đây là vòng gọi vốn lớn thứ hai trong vòng ba tháng, cho thấy sự công nhận mạnh mẽ của thị trường vốn. Công ty, được mệnh danh là "Palantir phiên bản Trung Quốc", được thành lập bởi Tiến sĩ Hán Hàm, một nữ tiến sĩ từ Đại học Thanh Hoa. Công ty tập trung vào lĩnh vực AI công nghiệp có độ tin cậy cao và khả năng ra quyết định mạnh mẽ, với sứ mệnh đưa AI từ thế giới số sang thế giới vật lý. Công nghệ cốt lõi của Zhongshu Ruizhi dựa trên ba nền tảng sáng tạo: Lý thuyết nhận thức nguyên nhân-kết quả (meta-causal), mô hình nhân quả và động cơ bản thể động (dynamic ontology engine). Các công nghệ này nhằm giải quyết các điểm yếu của mô hình ngôn ngữ lớm (LLM) như "ảo giác AI", khả năng suy luận hạn chế và thiếu logic thời gian, cung cấp khả năng ra quyết định thông minh đáng tin cậy, có thể giải thích và thực thi được trong các ngành công nghiệp then chốt như năng lượng và sản xuất. Về mặt thương mại, Zhongshu Ruizhi đã phục vụ hơn 50 khách hàng là doanh nghiệp nhà nước trung ương và tập đoàn công nghiệp trong các lĩnh vực như điện lực, dầu khí và hàng không vũ trụ, triển khai hơn 800 kịch bản sản xuất phức tạp. Công ty đã đạt được tăng trưởng doanh thu gấp đôi vào năm 2025, thể hiện khả năng tạo ra dòng tiền mạnh mẽ. Số tiền gọi vốn lần này sẽ được sử dụng để tiếp tục đổi mới lý thuyết nền tảng, mở rộng thị trường và thu hút nhân tài cao cấp. Các nhà đầu tư như Quỹ Đầu tư Internet Trung Quốc tin rằng trí tuệ nhân quả cấp ngành là một phần quan trọng trong việc xây dựng nền tảng số hóa cho sự hiện đại hóa của Trung Quốc và thúc đẩy lực lượng sản xuất mới.

marsbit23 phút trước

Trong ba tháng, hai vòng tài trợ, 'Palantir phiên bản Trung Quốc' gây bão

marsbit23 phút trước

Đề tài chính trị kinh tế lớn nhất thời đại AI: Robot ngày càng giỏi, con người chia sẻ giá trị như thế nào?

Gần đây, The Economist đã đăng một bài viết gây tranh cãi, cho rằng những đột phá của Trung Quốc trong lĩnh vực robot, AI, năng lượng mới và sản xuất cao cấp chưa giải quyết được vấn đề thiếu hụt nhu cầu trong tăng trưởng kinh tế. Tuy nhiên, bên dưới nhận xét này là một vấn đề toàn cầu sâu sắc hơn: Khi máy móc ngày càng thông minh, làm thế nào để con người chia sẻ được giá trị do chúng tạo ra? Trong hơn 200 năm, tăng trưởng năng suất luôn dẫn đến tăng việc làm và thu nhập. Nhưng AI, với khả năng thay thế lao động nhận thức, đang thay đổi logic cơ bản này. Nếu AGI xuất hiện, nền kinh tế có thể tiếp tục phát triển với ít người tham gia trực tiếp hơn, đặt ra thách thức lớn về phân phối của cải. Vấn đề then chốt không phải là thất nghiệp mà là làm sao để sức mua của người tiêu dùng theo kịp năng lực sản xuất ngày càng tăng của máy móc. Thực tế tại Trung Quốc và toàn cầu cho thấy sự đứt gãy trong chuỗi "đổi mới công nghệ - lợi nhuận doanh nghiệp - thu nhập người dân - tăng trưởng tiêu dùng". Các gã khổng lồ công nghệ tạo ra khối tài sản khổng lồ, nhưng tỷ trọng thu nhập từ lao động trong GDP lại giảm, của cải tập trung vào số ít. AI làm chiếc bánh kinh tế to hơn, nhưng số người chia bánh lại ít đi. Tương lai có thể có ba con đường: con đường tư bản truyền thống (lợi nhuận thuộc về cổ đông), con đường tư bản nhà nước (nhà nước tham gia đầu tư), và con đường sáng tạo hơn như quỹ chủ quyền số, cơ chế sở hữu cổ phần toàn dân hoặc hệ thống thu nhập cơ bản mới để chia sẻ trực tiếp lợi ích từ nền kinh tế thông minh. Đối với Trung Quốc, đây là một cơ hội chiến lược. Ưu thế không chỉ nằm ở thị trường, chuỗi cung ứng và công nghệ, mà còn ở khả năng phối hợp chính sách để chuyển hóa của cải do robot tạo ra thành thu nhập, sức mua và an sinh xã hội. Trọng tâm chính sách cần song hành hỗ trợ phát triển công nghệ với cải cách phân phối thu nhập và thử nghiệm cơ chế chia sẻ lợi ích AI. Cuộc cạnh tranh trong hai thập kỷ tới không chỉ là về AI mạnh nhất hay nhiều robot nhất, mà quan trọng hơn là về việc xây dựng được hệ thống phân phối mới phù hợp với thời đại kinh tế thông minh. Câu hỏi lớn nhất của thời đại AI là: Khi máy móc làm việc, con người kiếm thu nhập từ đâu? Khi AI tạo ra giá trị, làm sao con người sở hữu được giá trị đó? Làm thế nào để thành quả tăng trưởng chuyển thành phúc lợi xã hội rộng rãi hơn?

marsbit33 phút trước

Đề tài chính trị kinh tế lớn nhất thời đại AI: Robot ngày càng giỏi, con người chia sẻ giá trị như thế nào?

marsbit33 phút trước

Liên tục có lãi trong 7 quý, chiến lược carry trade tại các thị trường mới nổi vượt trội hơn tất cả

Lợi nhuận từ carry trade (kinh doanh chênh lệch lãi suất) tại các thị trường mới nổi, sử dụng USD làm tiền tệ tài trợ, đã ghi nhận quý có lãi thứ 7 liên tiếp – chuỗi thắng dài nhất kể từ năm 2008. Theo chỉ số của Bloomberg, chiến lược này đã mang về lợi nhuận tích lũy khoảng 22% từ cuối năm 2024, vượt xa trái phiếu kho bạc Mỹ. Động lực đến từ chênh lệch lãi suất lớn và sự hỗ trợ của tỷ giá hối đoái, khi USD suy yếu so với nhiều đồng tiền mới nổi. Ví dụ điển hình là Colombia với lợi nhuận kết hợp lên tới 48%. Dù đối mặt với thử thách từ đợt can thiệp lịch sử vào đồng Yên hồi tháng 8, thị trường đã nhanh chóng thích ứng bằng cách chuyển sang dùng Euro, Franc Thụy Sĩ làm tiền tệ tài trợ thay thế, giúp giảm thiểu rủi ro thanh khoản ồ ạt. Rủi ro chính phía trước là thời điểm Cục Dự trữ Liên bang Mỹ (Fed) bắt đầu cắt giảm lãi suất. Tuy nhiên, nhiều nhà phân tích cho rằng dữ liệu Mỹ hiện chưa đủ yếu để đảo ngược kỳ vọng này. Mối lo ngại khác là độ tập trung dòng tiền quá cao vào giao dịch carry trade, có thể dẫn đến biến động mạnh nếu đảo chiều. Dù vậy, lãi suất cao tại nhiều nền kinh tế mới nổi, được duy trì bởi áp lực lạm phát và giá năng lượng, vẫn tiếp tục hỗ trợ chiến lược này. Các nhà quản lý quỹ tiếp tục tìm kiếm cơ hội ở các thị trường như Nam Phi, Mexico, Brazil, Colombia và Thổ Nhĩ Kỳ.

marsbit49 phút trước

Liên tục có lãi trong 7 quý, chiến lược carry trade tại các thị trường mới nổi vượt trội hơn tất cả

marsbit49 phút trước

Cặp thầy trò Thanh Hoa – Wharton phá án hơn 40 năm, nòng cốt toán học đều do GPT viết, bạn làm cũng được

Hai nhà nghiên cứu từ Đại học Thanh Hoa và Wharton, Đại học Pennsylvania, đã sử dụng GPT-5.6 Sol Pro để giải quyết một vấn đề lý thuyết tối ưu hóa tồn tại suốt 40 năm. Họ chứng minh rằng thuật toán Gradient Descent (GD) truyền thống, khi chỉ điều chỉnh độ dài bước (step size) mà không thay đổi cấu trúc (như thêm động lượng), tồn tại một giới hạn tốc độ hội tụ không thể vượt qua. Cụ thể, nghiên cứu xác lập cận dưới chặt chẽ cho tốc độ hội tụ là Ω(T^{-1.9319}), có nghĩa là lỗi sau T bước lặp giảm chậm hơn ít nhất 1/T^{1.9319}. Điều này khẳng định dù thiết kế dãy độ dài bước tinh vi đến đâu (như "silver stepsize" đạt ~T^{-1.2716}), GD thuần túy cũng không thể đạt tốc độ tối ưu O(1/T^2) như các phương pháp có động lượng. Điểm đáng chú ý: phần chứng minh toán học cốt lõi hoàn toàn do GPT-5.6 Sol Pro xây dựng dưới sự hướng dẫn chiến lược của các nhà nghiên cứu. Toàn bộ chứng minh sau đó được dịch và kiểm tra nghiêm ngặt bởi trình chứng minh định lý Lean 4, đạt trạng thái "không lỗi" (zero sorry/admit). Kết quả này mở ra hướng tiếp cận mới, nơi AI có thể trở thành công cụ đắc lực để khám phá và chứng minh các giới hạn lý thuyết phức tạp.

marsbit58 phút trước

Cặp thầy trò Thanh Hoa – Wharton phá án hơn 40 năm, nòng cốt toán học đều do GPT viết, bạn làm cũng được

marsbit58 phút trước

Giao dịch

Giao ngay
活动图片