Vừa qua, AI Trung Quốc lọt vào top 2 lập trình toàn cầu, chỉ còn Claude phía trước

marsbitXuất bản vào 2026-05-27Cập nhật gần nhất vào 2026-05-27

Tóm tắt

Hôm nay, Code Arena công bố bảng xếp hạng mới nhất. Qwen3.7-Max của Alibaba đạt 1541 điểm, lọt vào top 4 toàn cầu, vượt qua các mô hình hàng đầu như GPT-5.5 và Gemini 3.5 Flash. Hiện chỉ có Claude Opus 4.7 và Opus 4.6 xếp trên nó. Điều này giúp Alibaba trở thành công ty Trung Quốc duy nhất trong top đầu, đứng thứ hai thế giới, chỉ sau Anthropic. Qwen3.7-Max được mệnh danh là "mô hình nền tảng cho Agent", được thiết kế để thực hiện các nhiệm vụ tự chủ dài hạn. Trong một thử nghiệm, nó có thể chạy liên tục 35 giờ, thực hiện 1158 lần gọi công cụ để tối ưu hóa mã, đạt tốc độ tăng trung bình gấp 10 lần. Khả năng lập trình vượt trội của nó được chứng minh qua các thử nghiệm thực tế. Khi được yêu cầu tạo một trò chơi đua xe 3D, Qwen3.7-Max tạo ra một phiên bản có thể chơi được ngay lần đầu, bao gồm giao diện bắt đầu và hiệu ứng âm thanh - những chi tiết mà các mô hình khác như Gemini, Claude hay ChatGPT bỏ sót hoặc cần nhiều lần sửa lỗi. Hai yếu tố then chốt giúp Qwen3.7-Max đạt được thành tích này là: 1) Đào tạo mở rộng môi trường, giúp mô hình học các chiến lược tổng quát thay vì chỉ hoạt động tốt trong một framework cụ thể; 2) Khả năng thực thi tự chủ dài hạn, cho phép nó đưa ra hàng nghìn quyết định liên tục mà không bị suy giảm ngữ cảnh hay rơi vào vòng lặp. Với việc Qwen3.7-Max gia nhập cuộc đua, cuộc cạnh tranh về mô hình lập trình toàn cầu không còn là câu chuyện độc quyền của Thung lũng Silicon.

Ngay hôm nay, bảng xếp hạng mới nhất của Code Arena đã được công bố!

Qwen3.7-Max với 1541 điểm đã lọt vào top 4 toàn cầu, một bước vượt qua hàng loạt mô hình đỉnh cao như GPT-5.5, Gemini 3.5 Flash.

Đứng trước nó, giờ chỉ còn Claude Opus 4.7 và Opus 4.6.

Nói cách khác, trên đấu trường mô hình lập trình toàn cầu, Alibaba là nhà sản xuất Trung Quốc duy nhất lọt vào bàn chơi này, chỉ đứng sau Anthropic, xếp thứ hai.

Qwen3.7-Max lọt vào top 5 toàn cầu

Mô hình phi Claude duy nhất

Thực ra, trước khi Code Arena công bố bảng xếp hạng, Qwen3.7-Max đã tạo nên tên tuổi trong cộng đồng nhà phát triển nước ngoài.

Atomic Chat đã thực hiện một so sánh trực diện, cho Opus 4.7, GPT-5.5 và Qwen3.7-Max thi đấu trên cùng một sân khấu, nhiệm vụ là viết một AI Tetris có khả năng tự huấn luyện.

Kết quả, Qwen3.7-Max không chỉ vượt qua cả Opus 4.7 và GPT-5.5 với chi phí token chỉ $1.32, mà còn cải thiện hiệu suất lên 56%.

Một nhà phát triển nước ngoài khác đã chọn để Qwen3.7-Max xây dựng một mô hình 3D của vũ trụ, hiệu quả đủ để gây chấn động.

Trong nhiệm vụ tạo mô hình "tháp bảo thu nhỏ phong cách pixel 3D", tốc độ xuất và chất lượng đầu ra của Qwen3.7-Max cũng vượt trội hoàn toàn.

Nhà phát triển Paul Couvert còn ca ngợi rằng, khi Qwen3.7-Max được tích hợp với Hermes Agent và OpenCode, về cơ bản có thể thay thế GPT-5.5 và Opus 4.7.

Lập trình, quá đỉnh

Tuy nhiên, điểm số cao không bằng thực chiến.

Chúng tôi đã sắp xếp cho Qwen3.7-Max một thử thách "trò chơi đua xe" cứng nhân.

Một đoạn Prompt chi tiết được đưa vào, chẳng mấy chốc, Qwen3.7-Max cho ra ngay một file HTML có thể chơi được.

Phiên bản đầu tiên có một lỗi nhỏ, các phím chuyển hướng A/D bị đảo ngược trái phải.

Nhưng sau đợt điều chỉnh đối thoại đơn giản ở vòng thứ hai, một trò chơi đua xe 3D hoàn chỉnh đã chạy được.

Khoảnh khắc mở ra, thật sự, có chút bất ngờ.

4 xe cùng chạy, đua tốc độ trên đường đua vòng tròn 3 vòng, trên đường đua rải rác hơn 100 đồng xu, chạm vào chướng ngại vật sẽ giảm tốc, mất kiểm soát.

Bảng điểm sau cuộc đua, thứ hạng, thời gian, số xu, vòng đơn nhanh nhất, không thiếu mục nào.

Nhưng điều thực sự gây bất ngờ, là hai chi tiết mà chỉ Qwen3.7-Max làm được.

Một là giao diện bắt đầu. Sau khi kiểm tra ngang bốn mô hình, chỉ có nó tạo một trang bắt đầu chính thức cho trò chơi, nhấn "Start" mới vào cuộc đua. Ba nhà còn lại mở ra là chạy ngay, thậm chí không có cả màn hình tiêu đề.

Hai là hiệu ứng âm thanh. Prompt cuối cùng có đính kèm một yêu cầu, thêm hiệu ứng tiếng động cơ gầm rú và tiếng ăn xu. Trong bốn mô hình, cũng chỉ có nó xử lý được bonus này, tiếng động cơ và tiếng đinh đoong của đồng xu đều được sắp xếp.

Hãy xem biểu hiện của các đối thủ khác.

Hình ảnh của Gemini 3.5 Flash rõ ràng mỏng manh hơn một bậc, thiếu đi cảm giác nổi bật ba chiều sắp bật ra.

Bố cục UI cũng có vấn đề, thông tin bảng đồng hồ phân tán ở bốn góc màn hình, tiêu điểm thị giác rời rạc.

Ngược lại, cách xử lý của Qwen3.7-Max là tập trung các chỉ số chính vào trung tâm màn hình, phù hợp hơn với điểm rơi tự nhiên của ánh nhìn người chơi.

Hiệu ứng của Claude Opus 4.6, có chút khó diễn tả.

Không chỉ đồng xu trên đường đua ít đến thảm hại, mà 3 xe đua AI còn di chuyển gần như đồng bộ, không có tính ngẫu nhiên, như được sao chép ra.

Cuối cùng là GPT-5.5.

Có thể thấy, chất lượng hình ảnh thực sự mạnh hơn nhiều so với hai nhà trước, thao tác cũng mượt mà hơn.

Nhưng không hiểu sao, đồng xu lại được làm thành "vòng bánh" màu vàng...

Kiểu dáng chỉ là chuyện nhỏ. Quan trọng là, cả Gemini, Claude, ChatGPT đều phải sửa vài vòng lỗi mới chạy thông được toàn bộ chức năng.

Chỉ có Qwen3.7-Max ở vòng tạo đầu tiên đã cơ bản có thể chơi được.

Điểm số gần nhau, thực chiến không hư, giá chỉ bằng một phần nhỏ. Kết luận còn lại, chờ các nhà phát triển dùng chân để bỏ phiếu.

Mô hình "nền tảng" thời đại Agent

Lý do Qwen3.7-Max có thể thể hiện trình độ như vậy trên võ đài lập trình cạnh tranh nhất, câu trả lời nằm ở định vị sản phẩm của nó.

Vài ngày trước, khi Alibaba ra mắt Qwen3.7-Max, họ đã gắn cho nó một nhãn rất đặc biệt: Mô hình nền tảng Agent.

Nó sinh ra, là mô hình được thiết kế cho việc thực thi nhiệm vụ tự chủ trong thời gian dài.

Dữ liệu thử nghiệm nội bộ cho thấy, trong một nhiệm vụ lập trình tự chủ, Qwen3.7-Max chạy liên tục 35 giờ, thực hiện 1158 lần gọi công cụ.

Mã nguồn được tạo ra cuối cùng so với bản triển khai tham chiếu Triton, đạt được tốc độ tăng trung bình hình học đáng kinh ngạc là 10 lần.

Ấn tượng hơn nữa là khả năng "chiến đấu dai sức" của nó——

Sau khi quá trình suy luận tiến đến giờ thứ 30, mô hình vẫn giữ được sự nhạy bén, tiếp tục khám phá ra không gian tối ưu hóa mới.

Toàn bộ quá trình không bị thoái hóa ngữ cảnh, không trôi lệch hướng dẫn, không vòng lặp chết!

Phải nói rằng, điểm khó của việc này không nằm ở 1000 lần gọi công cụ. Sau khi giao thức MCP mở rộng, gọi 1000 lần công cụ không có gì lạ.

Điểm khó nằm ở suy luận liên tục trong 35 giờ.

Phần lớn mô hình khi chạy nhiệm vụ dài sẽ sụp đổ: hoặc ngữ cảnh tích tụ càng lúc càng rối, mục tiêu định ở nửa đầu đến sau quên sạch sẽ; hoặc rơi vào vòng lặp chết, lặp lại thử nghiệm cùng một phương án thất bại.

Qwen3.7-Max đã làm ra được việc "liên tục làm đúng".

Tiết lộ công nghệ cốt lõi

Sự nhảy vọt lập trình này của Qwen3.7-Max, chúng tôi hiểu cốt lõi có thể liên quan đến nâng cấp của hai phương pháp huấn luyện.

Thứ nhất là, mở rộng môi trường.

Khi Qwen3.7-Max thực hiện huấn luyện lập trình, mỗi nhiệm vụ được chia thành ba chiều độc lập: bản thân nhiệm vụ, khung thực thi, phương thức xác thực, ba thứ kết hợp tự do.

Cùng một đề bài, đôi khi làm trong khung Claude Code, đôi khi làm trong OpenClaw, đôi khi đổi một phương thức xác thực.

Hiệu quả giống như một thực tập sinh được luân chuyển đến tất cả các nhóm dự án. Thứ nó buộc phải học là chiến lược tổng quát giải quyết vấn đề, không phải "trong một khung cụ thể thì làm sao để lách".

Điều này giải thích một hiện tượng phản trực giác: Qwen3.7-Max biểu hiện đều ổn trong các khung Claude Code, OpenClaw, Qwen Code, không xuất hiện tình trạng "trong khung của mình thì mạnh, đổi cái khác thì tụt dốc".

Nâng cấp thứ hai là, thực thi tự chủ tầm xa.

Trong huấn luyện, nhóm đã đưa vào khung "trò chơi sinh tồn tích lũy động".

Tức là, để mô hình đưa ra quyết định liên tục hơn một nghìn bước trong môi trường mô phỏng thay đổi liên tục, tự xây dựng giả thuyết, điều chỉnh chiến lược dựa trên phản hồi, và không được "thoái hóa ngữ cảnh" vì chạy quá lâu.

Ở đây có một dữ liệu trực quan, YC-Bench mô phỏng công ty khởi nghiệp vận hành cả năm, Qwen3.7-Max đạt doanh thu 2,08 triệu USD, gấp đôi thế hệ trước (1,05 triệu).

Quan trọng hơn, nó thể hiện sự tiến hóa chiến lược, khi gặp khủng hoảng ở giai đoạn giữa có thể tự chủ điều chỉnh hướng đi, nhận diện và chặn khách hàng độc hại, cuối cùng hội tụ vào vòng lặp thực thi ổn định.

Đây chính là nền tảng hỗ trợ cho trường hợp tối ưu hóa kernel 35 giờ, cũng là lý do tại sao trên Kernel Bench L3, Qwen3.7-Max có thể khiến 96% tình huống chạy ra hiệu quả tăng tốc.

Mà lập trình mới chỉ là mặt trận đầu tiên. Nền tảng suy luận tầm xa cộng với gọi công cụ này, hướng tới một tham vọng lớn hơn——Nền tảng Agent tổng quát.

Chung kết lập trình, thêm một kẻ gây rối

Từ khi Code Arena ra mắt đến nay, những gì nó kiểm tra luôn là kỹ năng cứng, suy luận đa bước, sắp xếp công cụ, bàn giao dự án hoàn chỉnh, toàn là cạnh tranh thực chiến cấp độ Agent.

Hôm nay, Qwen3.7-Max với thành tích 1541 điểm đã chèn vào vị trí thứ tư, kẹp giữa Opus 4.6 Thinking và Opus 4.6.

Trên đường đua mà Claude thống trị phần lớn nửa năm này, nó đã đưa ra câu trả lời của mình, mô hình Trung Quốc không chỉ là kẻ đuổi theo, mà còn có thể là người định nghĩa.

Cuộc đua mô hình lập trình toàn cầu, không còn là độc diễn của thung lũng Silicon nữa.

Tài liệu tham khảo:

https://arena.ai/leaderboard/code/webdev

Bài viết này đến từ tài khoản WeChat công chúng "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục

Câu hỏi Liên quan

QMô hình AI Trung Quốc nào vừa đạt vị trí thứ tư trong bảng xếp hạng Code Arena toàn cầu?

AMô hình Qwen3.7-Max của Alibaba đã đạt 1541 điểm và lọt vào top 4 trên bảng xếp hạng Code Arena.

QTheo bài viết, hiện tại chỉ có mô hình nào vượt trội hơn Qwen3.7-Max về khả năng lập trình?

ATheo bài viết, hiện tại chỉ có các mô hình Claude Opus 4.7 và Claude Opus 4.6 của Anthropic là xếp trên Qwen3.7-Max.

QTrong thử thách phát triển game đua xe 3D, Qwen3.7-Max thể hiện ưu điểm nào so với các đối thủ?

AQwen3.7-Max tạo ra một trò chơi có giao diện bắt đầu (Start page) chính thức và hiệu ứng âm thanh (tiếng động cơ, tiếng ăn xu), trong khi các mô hình khác không làm được. Ngoài ra, nó cũng ít lỗi hơn và tạo ra trò chơi có thể chơi được ngay từ lần tạo đầu tiên.

QBài viết gọi Qwen3.7-Max là mô hình 'Agent基座模型'. Điều này có nghĩa là gì?

A'Agent基座模型' (Mô hình nền tảng cho Agent) có nghĩa là Qwen3.7-Max được thiết kế đặc biệt để thực thi các tác vụ phức tạp một cách tự chủ trong thời gian dài, với khả năng gọi công cụ liên tục và duy trì lập luận ổn định mà không bị suy giảm ngữ cảnh, trôi lệnh hay rơi vào vòng lặp vô hạn.

QHai phương pháp huấn luyện then chốt nào giúp Qwen3.7-Max đạt được khả năng lập trình vượt trội?

AHai phương pháp huấn luyện chính được đề cập là: 1) Mở rộng môi trường (Environment Extension): huấn luyện mô hình trên nhiều tổ hợp khác nhau của nhiệm vụ, khuôn khổ thực thi và phương thức xác minh. 2) Thực thi tự chủ dài hạn (Long-range Autonomous Execution): sử dụng khung 'tồn tại động lũy tích' để mô hình thực hiện hàng nghìn bước quyết định liên tục trong môi trường mô phỏng biến đổi.

Nội dung Liên quan

Tại sao Bitcoin duy trì mức 64.000 USD sau lần tạm dừng cứng rắn của Fed

Bitcoin duy trì quanh mức 64.000 USD sau cuộc họp của Fed. Dù Fed giữ lãi suất trong khoảng 3,50–3,75%, ba thành viên ủy ban đã bỏ phiếu ủng hộ tăng lãi suất, gửi đi tín hiệu chính sách thắt chặt hơn dự kiến. Bitcoin phản ứng biến động nhưng cuối cùng ổn định quanh 64.000 USD, với vùng hỗ trợ 63.000–63.500 USD và kháng cự ở 66.000 USD. ETF Bitcoin ghi nhận dòng vốn ròng chảy vào 32,1 triệu USD, chấm dứt chuỗi rút tiền, trong khi ETF Ethereum tiếp tục thất thoát 18,65 triệu USD. Điều này cho thấy sự luân chuyển vốn sang Bitcoin giữa bối cảnh bất ổn vĩ mô. Ethereum giao dịch quanh 1.900 USD, áp lực bán tăng nhưng mạng lưới vẫn mạnh với lượng ETH chờ staking cao. Các altcoin khác di chuyển không đồng nhất. Về pháp lý, dự luật CLARITY Act bị trì hoãn đến sau kỳ nghỉ tháng 8 của Thượng viện Mỹ, khiến thị trường thận trọng hơn về khả năng thông qua vào năm 2026. Tóm lại, thị trường tiền mã hóa đang trong trạng thái chờ đợi, với Bitcoin thể hiện sự kiên cường nhờ dòng vốn ETF. Các nhà đầu tư trung hạn cần theo dõi khả năng giữ trên 63.000 USD của Bitcoin, mức 1.860 USD của Ethereum và dòng vốn thể chế để tìm tín hiệu cho sự phục hồi trong nửa cuối năm 2026.

cryptonews.ru1 giờ trước

Tại sao Bitcoin duy trì mức 64.000 USD sau lần tạm dừng cứng rắn của Fed

cryptonews.ru1 giờ trước

Parker Lewis Lý Giải Tại Sao Bitcoin Vẫn Là Đồng Tiền Tốt Nhất

Nhà phân tích Bitcoin uy tín Parker Lewis chỉ trích mạnh mẽ các chiến lược tiếp thị của các công ty tự xưng là kho bạc tiền mã hóa. Ông cho rằng việc các công ty này huy động vốn thông qua việc bán "tín dụng số" dưới dạng cổ phiếu ưu đãi vĩnh viễn đã làm sai lệch bản chất của tiền mã hóa đầu tiên. Lewis nhấn mạnh Bitcoin không có lợi suất định sẵn, và việc hứa hẹn cổ tức thường xuyên là một trò chơi rủi ro cao, dựa chủ yếu vào việc thu hút nhà đầu tư mới trên thị trường tăng trưởng. Ông dẫn chứng sự chênh lệch lớn giữa thị trường tín dụng toàn cầu (300 nghìn tỷ USD) và thị trường cổ phiếu ưu đãi vĩnh viễn (1 nghìn tỷ USD) để chứng minh rủi ro của các công cụ phái sinh này, thường được chuyển cho các nhà đầu tư nhỏ lẻ. Lewis bác bỏ quan điểm cho rằng Bitcoin quá biến động, lập luận rằng biến động là hệ quả tự nhiên của việc chấp nhận một loại tài sản mới. Với nguồn cung cứng và không co giãn, mỗi làn sóng người dùng mới sẽ dẫn đến biến động giá mạnh. Thay vì mua cổ phiếu phái sinh của các công ty như MicroStrategy, ông khuyên nên mua Bitcoin trực tiếp, vì điều này an toàn hơn về mặt toán học so với việc giao tiền cho các nhà quản lý tập đoàn. Việc chuyển hướng sang các công cụ phái sinh làm mất tập trung vào mối đe dọa thực sự: sự mất giá nhanh chóng của tiền pháp định. Lewis đưa ra "Chỉ số thịt bò" của riêng mình, cho thấy mức lạm phát tiêu dùng thực tế khoảng 12-13% mỗi năm, cao hơn nhiều so với số liệu chính thức. Ông kết luận rằng chiến lược tài chính an toàn và hiệu quả nhất trong bối cảnh lạm phát toàn cầu là sở hữu trực tiếp Bitcoin và tự kiểm soát khóa riêng tư, thay vì theo đuổi lợi nhuận đầy rủi ro từ cổ phiếu kho bạc tiền mã hóa.

cryptonews.ru1 giờ trước

Parker Lewis Lý Giải Tại Sao Bitcoin Vẫn Là Đồng Tiền Tốt Nhất

cryptonews.ru1 giờ trước

Bắt giữ các thành viên trong âm mưu lừa đảo với XRP, chiếm đoạt 9 triệu đô la từ 71 nhà đầu tư

Vào ngày 30/7, Cảnh sát Thủ đô Seoul thông báo đã bắt giữ ba nghi phạm trong một vụ lừa đảo đầu tư liên quan đến tiền điện tử XRP. Nhóm này bị cáo buộc vận hành nền tảng đầu tư gian lận Fxrpntwork.com, thu hút 71 nhà đầu tư chuyển khoảng 3,4 triệu đô la XRP trong một tuần (từ 16-23/10) trước khi đóng cửa trang web và biến mất. Các nghi phạm quảng bá trang web thông qua blog, bài báo trực tuyến và video YouTube, hứa hẹn bảo toàn vốn gốc và lợi nhuận hàng tháng từ 1,5% đến 1,8%. Họ hướng dẫn nạn nhân chuyển XRP từ các sàn giao dịch Hàn Quốc qua nền tảng nước ngoài rồi vào ví do nhóm kiểm soát. Cảnh sát Seoul cảnh báo các nhà đầu tư cần kiểm tra kỹ nguồn thông tin chính thức trước khi chuyển tiền. Các đối tượng đã sao chép thương hiệu của Flare Network và FXRP để tạo vẻ ngoài hợp pháp. Ripple và Interpol cảnh báo đây là thủ đoạn phổ biến, với các mạng lưới tội phạm xuyên quốc gia ngày càng có tổ chức. Việc hứa hẹn lợi nhuận đảm bảo vẫn là dấu hiệu phổ biến của lừa đảo tiền điện tử. Hai nghi phạm 29 tuổi đã bị bắt, một người 34 tuổi khác bị đề nghị truy tố, và một nghi phạm 29 tuổi khác đang bị truy nã ở nước ngoài với thông báo đỏ của Interpol. Cảnh sát cũng đã phong tỏa tài sản ảo trị giá 17,3 tỷ won và đang điều tra các chuyển khoản liên quan trị giá 27,3 tỷ won để xác định thêm nạn nhân và đồng phạm.

cryptonews.ru1 giờ trước

Bắt giữ các thành viên trong âm mưu lừa đảo với XRP, chiếm đoạt 9 triệu đô la từ 71 nhà đầu tư

cryptonews.ru1 giờ trước

Giao dịch

Giao ngay
活动图片