Vừa qua, AI Trung Quốc lọt vào top 2 lập trình toàn cầu, chỉ còn Claude phía trước

marsbitXuất bản vào 2026-05-27Cập nhật gần nhất vào 2026-05-27

Tóm tắt

Hôm nay, Code Arena công bố bảng xếp hạng mới nhất. Qwen3.7-Max của Alibaba đạt 1541 điểm, lọt vào top 4 toàn cầu, vượt qua các mô hình hàng đầu như GPT-5.5 và Gemini 3.5 Flash. Hiện chỉ có Claude Opus 4.7 và Opus 4.6 xếp trên nó. Điều này giúp Alibaba trở thành công ty Trung Quốc duy nhất trong top đầu, đứng thứ hai thế giới, chỉ sau Anthropic. Qwen3.7-Max được mệnh danh là "mô hình nền tảng cho Agent", được thiết kế để thực hiện các nhiệm vụ tự chủ dài hạn. Trong một thử nghiệm, nó có thể chạy liên tục 35 giờ, thực hiện 1158 lần gọi công cụ để tối ưu hóa mã, đạt tốc độ tăng trung bình gấp 10 lần. Khả năng lập trình vượt trội của nó được chứng minh qua các thử nghiệm thực tế. Khi được yêu cầu tạo một trò chơi đua xe 3D, Qwen3.7-Max tạo ra một phiên bản có thể chơi được ngay lần đầu, bao gồm giao diện bắt đầu và hiệu ứng âm thanh - những chi tiết mà các mô hình khác như Gemini, Claude hay ChatGPT bỏ sót hoặc cần nhiều lần sửa lỗi. Hai yếu tố then chốt giúp Qwen3.7-Max đạt được thành tích này là: 1) Đào tạo mở rộng môi trường, giúp mô hình học các chiến lược tổng quát thay vì chỉ hoạt động tốt trong một framework cụ thể; 2) Khả năng thực thi tự chủ dài hạn, cho phép nó đưa ra hàng nghìn quyết định liên tục mà không bị suy giảm ngữ cảnh hay rơi vào vòng lặp. Với việc Qwen3.7-Max gia nhập cuộc đua, cuộc cạnh tranh về mô hình lập trình toàn cầu không còn là câu chuyện độc quyền của Thung lũng Silicon.

Ngay hôm nay, bảng xếp hạng mới nhất của Code Arena đã được công bố!

Qwen3.7-Max với 1541 điểm đã lọt vào top 4 toàn cầu, một bước vượt qua hàng loạt mô hình đỉnh cao như GPT-5.5, Gemini 3.5 Flash.

Đứng trước nó, giờ chỉ còn Claude Opus 4.7 và Opus 4.6.

Nói cách khác, trên đấu trường mô hình lập trình toàn cầu, Alibaba là nhà sản xuất Trung Quốc duy nhất lọt vào bàn chơi này, chỉ đứng sau Anthropic, xếp thứ hai.

Qwen3.7-Max lọt vào top 5 toàn cầu

Mô hình phi Claude duy nhất

Thực ra, trước khi Code Arena công bố bảng xếp hạng, Qwen3.7-Max đã tạo nên tên tuổi trong cộng đồng nhà phát triển nước ngoài.

Atomic Chat đã thực hiện một so sánh trực diện, cho Opus 4.7, GPT-5.5 và Qwen3.7-Max thi đấu trên cùng một sân khấu, nhiệm vụ là viết một AI Tetris có khả năng tự huấn luyện.

Kết quả, Qwen3.7-Max không chỉ vượt qua cả Opus 4.7 và GPT-5.5 với chi phí token chỉ $1.32, mà còn cải thiện hiệu suất lên 56%.

Một nhà phát triển nước ngoài khác đã chọn để Qwen3.7-Max xây dựng một mô hình 3D của vũ trụ, hiệu quả đủ để gây chấn động.

Trong nhiệm vụ tạo mô hình "tháp bảo thu nhỏ phong cách pixel 3D", tốc độ xuất và chất lượng đầu ra của Qwen3.7-Max cũng vượt trội hoàn toàn.

Nhà phát triển Paul Couvert còn ca ngợi rằng, khi Qwen3.7-Max được tích hợp với Hermes Agent và OpenCode, về cơ bản có thể thay thế GPT-5.5 và Opus 4.7.

Lập trình, quá đỉnh

Tuy nhiên, điểm số cao không bằng thực chiến.

Chúng tôi đã sắp xếp cho Qwen3.7-Max một thử thách "trò chơi đua xe" cứng nhân.

Một đoạn Prompt chi tiết được đưa vào, chẳng mấy chốc, Qwen3.7-Max cho ra ngay một file HTML có thể chơi được.

Phiên bản đầu tiên có một lỗi nhỏ, các phím chuyển hướng A/D bị đảo ngược trái phải.

Nhưng sau đợt điều chỉnh đối thoại đơn giản ở vòng thứ hai, một trò chơi đua xe 3D hoàn chỉnh đã chạy được.

Khoảnh khắc mở ra, thật sự, có chút bất ngờ.

4 xe cùng chạy, đua tốc độ trên đường đua vòng tròn 3 vòng, trên đường đua rải rác hơn 100 đồng xu, chạm vào chướng ngại vật sẽ giảm tốc, mất kiểm soát.

Bảng điểm sau cuộc đua, thứ hạng, thời gian, số xu, vòng đơn nhanh nhất, không thiếu mục nào.

Nhưng điều thực sự gây bất ngờ, là hai chi tiết mà chỉ Qwen3.7-Max làm được.

Một là giao diện bắt đầu. Sau khi kiểm tra ngang bốn mô hình, chỉ có nó tạo một trang bắt đầu chính thức cho trò chơi, nhấn "Start" mới vào cuộc đua. Ba nhà còn lại mở ra là chạy ngay, thậm chí không có cả màn hình tiêu đề.

Hai là hiệu ứng âm thanh. Prompt cuối cùng có đính kèm một yêu cầu, thêm hiệu ứng tiếng động cơ gầm rú và tiếng ăn xu. Trong bốn mô hình, cũng chỉ có nó xử lý được bonus này, tiếng động cơ và tiếng đinh đoong của đồng xu đều được sắp xếp.

Hãy xem biểu hiện của các đối thủ khác.

Hình ảnh của Gemini 3.5 Flash rõ ràng mỏng manh hơn một bậc, thiếu đi cảm giác nổi bật ba chiều sắp bật ra.

Bố cục UI cũng có vấn đề, thông tin bảng đồng hồ phân tán ở bốn góc màn hình, tiêu điểm thị giác rời rạc.

Ngược lại, cách xử lý của Qwen3.7-Max là tập trung các chỉ số chính vào trung tâm màn hình, phù hợp hơn với điểm rơi tự nhiên của ánh nhìn người chơi.

Hiệu ứng của Claude Opus 4.6, có chút khó diễn tả.

Không chỉ đồng xu trên đường đua ít đến thảm hại, mà 3 xe đua AI còn di chuyển gần như đồng bộ, không có tính ngẫu nhiên, như được sao chép ra.

Cuối cùng là GPT-5.5.

Có thể thấy, chất lượng hình ảnh thực sự mạnh hơn nhiều so với hai nhà trước, thao tác cũng mượt mà hơn.

Nhưng không hiểu sao, đồng xu lại được làm thành "vòng bánh" màu vàng...

Kiểu dáng chỉ là chuyện nhỏ. Quan trọng là, cả Gemini, Claude, ChatGPT đều phải sửa vài vòng lỗi mới chạy thông được toàn bộ chức năng.

Chỉ có Qwen3.7-Max ở vòng tạo đầu tiên đã cơ bản có thể chơi được.

Điểm số gần nhau, thực chiến không hư, giá chỉ bằng một phần nhỏ. Kết luận còn lại, chờ các nhà phát triển dùng chân để bỏ phiếu.

Mô hình "nền tảng" thời đại Agent

Lý do Qwen3.7-Max có thể thể hiện trình độ như vậy trên võ đài lập trình cạnh tranh nhất, câu trả lời nằm ở định vị sản phẩm của nó.

Vài ngày trước, khi Alibaba ra mắt Qwen3.7-Max, họ đã gắn cho nó một nhãn rất đặc biệt: Mô hình nền tảng Agent.

Nó sinh ra, là mô hình được thiết kế cho việc thực thi nhiệm vụ tự chủ trong thời gian dài.

Dữ liệu thử nghiệm nội bộ cho thấy, trong một nhiệm vụ lập trình tự chủ, Qwen3.7-Max chạy liên tục 35 giờ, thực hiện 1158 lần gọi công cụ.

Mã nguồn được tạo ra cuối cùng so với bản triển khai tham chiếu Triton, đạt được tốc độ tăng trung bình hình học đáng kinh ngạc là 10 lần.

Ấn tượng hơn nữa là khả năng "chiến đấu dai sức" của nó——

Sau khi quá trình suy luận tiến đến giờ thứ 30, mô hình vẫn giữ được sự nhạy bén, tiếp tục khám phá ra không gian tối ưu hóa mới.

Toàn bộ quá trình không bị thoái hóa ngữ cảnh, không trôi lệch hướng dẫn, không vòng lặp chết!

Phải nói rằng, điểm khó của việc này không nằm ở 1000 lần gọi công cụ. Sau khi giao thức MCP mở rộng, gọi 1000 lần công cụ không có gì lạ.

Điểm khó nằm ở suy luận liên tục trong 35 giờ.

Phần lớn mô hình khi chạy nhiệm vụ dài sẽ sụp đổ: hoặc ngữ cảnh tích tụ càng lúc càng rối, mục tiêu định ở nửa đầu đến sau quên sạch sẽ; hoặc rơi vào vòng lặp chết, lặp lại thử nghiệm cùng một phương án thất bại.

Qwen3.7-Max đã làm ra được việc "liên tục làm đúng".

Tiết lộ công nghệ cốt lõi

Sự nhảy vọt lập trình này của Qwen3.7-Max, chúng tôi hiểu cốt lõi có thể liên quan đến nâng cấp của hai phương pháp huấn luyện.

Thứ nhất là, mở rộng môi trường.

Khi Qwen3.7-Max thực hiện huấn luyện lập trình, mỗi nhiệm vụ được chia thành ba chiều độc lập: bản thân nhiệm vụ, khung thực thi, phương thức xác thực, ba thứ kết hợp tự do.

Cùng một đề bài, đôi khi làm trong khung Claude Code, đôi khi làm trong OpenClaw, đôi khi đổi một phương thức xác thực.

Hiệu quả giống như một thực tập sinh được luân chuyển đến tất cả các nhóm dự án. Thứ nó buộc phải học là chiến lược tổng quát giải quyết vấn đề, không phải "trong một khung cụ thể thì làm sao để lách".

Điều này giải thích một hiện tượng phản trực giác: Qwen3.7-Max biểu hiện đều ổn trong các khung Claude Code, OpenClaw, Qwen Code, không xuất hiện tình trạng "trong khung của mình thì mạnh, đổi cái khác thì tụt dốc".

Nâng cấp thứ hai là, thực thi tự chủ tầm xa.

Trong huấn luyện, nhóm đã đưa vào khung "trò chơi sinh tồn tích lũy động".

Tức là, để mô hình đưa ra quyết định liên tục hơn một nghìn bước trong môi trường mô phỏng thay đổi liên tục, tự xây dựng giả thuyết, điều chỉnh chiến lược dựa trên phản hồi, và không được "thoái hóa ngữ cảnh" vì chạy quá lâu.

Ở đây có một dữ liệu trực quan, YC-Bench mô phỏng công ty khởi nghiệp vận hành cả năm, Qwen3.7-Max đạt doanh thu 2,08 triệu USD, gấp đôi thế hệ trước (1,05 triệu).

Quan trọng hơn, nó thể hiện sự tiến hóa chiến lược, khi gặp khủng hoảng ở giai đoạn giữa có thể tự chủ điều chỉnh hướng đi, nhận diện và chặn khách hàng độc hại, cuối cùng hội tụ vào vòng lặp thực thi ổn định.

Đây chính là nền tảng hỗ trợ cho trường hợp tối ưu hóa kernel 35 giờ, cũng là lý do tại sao trên Kernel Bench L3, Qwen3.7-Max có thể khiến 96% tình huống chạy ra hiệu quả tăng tốc.

Mà lập trình mới chỉ là mặt trận đầu tiên. Nền tảng suy luận tầm xa cộng với gọi công cụ này, hướng tới một tham vọng lớn hơn——Nền tảng Agent tổng quát.

Chung kết lập trình, thêm một kẻ gây rối

Từ khi Code Arena ra mắt đến nay, những gì nó kiểm tra luôn là kỹ năng cứng, suy luận đa bước, sắp xếp công cụ, bàn giao dự án hoàn chỉnh, toàn là cạnh tranh thực chiến cấp độ Agent.

Hôm nay, Qwen3.7-Max với thành tích 1541 điểm đã chèn vào vị trí thứ tư, kẹp giữa Opus 4.6 Thinking và Opus 4.6.

Trên đường đua mà Claude thống trị phần lớn nửa năm này, nó đã đưa ra câu trả lời của mình, mô hình Trung Quốc không chỉ là kẻ đuổi theo, mà còn có thể là người định nghĩa.

Cuộc đua mô hình lập trình toàn cầu, không còn là độc diễn của thung lũng Silicon nữa.

Tài liệu tham khảo:

https://arena.ai/leaderboard/code/webdev

Bài viết này đến từ tài khoản WeChat công chúng "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục

Câu hỏi Liên quan

QMô hình AI Trung Quốc nào vừa đạt vị trí thứ tư trong bảng xếp hạng Code Arena toàn cầu?

AMô hình Qwen3.7-Max của Alibaba đã đạt 1541 điểm và lọt vào top 4 trên bảng xếp hạng Code Arena.

QTheo bài viết, hiện tại chỉ có mô hình nào vượt trội hơn Qwen3.7-Max về khả năng lập trình?

ATheo bài viết, hiện tại chỉ có các mô hình Claude Opus 4.7 và Claude Opus 4.6 của Anthropic là xếp trên Qwen3.7-Max.

QTrong thử thách phát triển game đua xe 3D, Qwen3.7-Max thể hiện ưu điểm nào so với các đối thủ?

AQwen3.7-Max tạo ra một trò chơi có giao diện bắt đầu (Start page) chính thức và hiệu ứng âm thanh (tiếng động cơ, tiếng ăn xu), trong khi các mô hình khác không làm được. Ngoài ra, nó cũng ít lỗi hơn và tạo ra trò chơi có thể chơi được ngay từ lần tạo đầu tiên.

QBài viết gọi Qwen3.7-Max là mô hình 'Agent基座模型'. Điều này có nghĩa là gì?

A'Agent基座模型' (Mô hình nền tảng cho Agent) có nghĩa là Qwen3.7-Max được thiết kế đặc biệt để thực thi các tác vụ phức tạp một cách tự chủ trong thời gian dài, với khả năng gọi công cụ liên tục và duy trì lập luận ổn định mà không bị suy giảm ngữ cảnh, trôi lệnh hay rơi vào vòng lặp vô hạn.

QHai phương pháp huấn luyện then chốt nào giúp Qwen3.7-Max đạt được khả năng lập trình vượt trội?

AHai phương pháp huấn luyện chính được đề cập là: 1) Mở rộng môi trường (Environment Extension): huấn luyện mô hình trên nhiều tổ hợp khác nhau của nhiệm vụ, khuôn khổ thực thi và phương thức xác minh. 2) Thực thi tự chủ dài hạn (Long-range Autonomous Execution): sử dụng khung 'tồn tại động lũy tích' để mô hình thực hiện hàng nghìn bước quyết định liên tục trong môi trường mô phỏng biến đổi.

Nội dung Liên quan

Can thiệp Mỹ-Nhật: Khởi đầu của 'Hiệp định Plaza' mới, hệ thống Bretton Woods 2.0 và cái kết của kỷ nguyên Carry Trade Yên Nhật

Tác giả: Diệp Trân, Phố Wall Kiến Văn Mỹ và Nhật Bản đã có hành động phối hợp hiếm có trong nhiều thập kỷ để hỗ trợ đồng yên, khiến thị trường đánh giá lại mô hình dòng vốn toàn cầu vốn phụ thuộc lâu dài vào việc vay vốn với lãi suất thấp bằng đồng yên. Các nhà chiến lược cho rằng nếu xu hướng chính sách này tiếp tục, nó có thể đánh dấu bước ngoặt cho các giao dịch carry trade bằng yên và thúc đẩy những điều chỉnh sâu hơn trong việc phân bổ vốn toàn cầu. Bộ trưởng Tài chính Mỹ Bessent và Tổng thống Trump đã xác nhận sự tham gia tích cực của Mỹ trong việc hỗ trợ đồng yên. Bessent tuyên bố Mỹ sẽ không ngần ngại tham gia các hành động can thiệp chung tiếp theo để điều chỉnh tình trạng định giá thấp nghiêm trọng của đồng yên. Trump nhấn mạnh can thiệp này thể hiện mối quan hệ đồng minh và kỳ vọng Washington sẽ thu được lợi ích tài chính thực chất. Sự phối hợp chính sách hiếm có này ngay lập tức gây ra phản ứng mạnh trên thị trường tài chính. Đồng yên tăng mạnh lên mức 157,40 yên/USD, mức mạnh nhất kể từ đầu tháng 5, nhờ can thiệp trực tiếp, hướng dẫn bằng lời nói của giới chức và hướng dẫn cho các ngân hàng giao dịch. Phân tích thị trường chỉ ra rằng động thái của liên minh Mỹ-Nhật đã vượt ra ngoài phạm vi quản lý tỷ giá thông thường. Việc Nhật Bản có thể bán dự trữ ngoại hối để bảo vệ đồng tiền của mình, cùng với việc định giá lại phần dài hạn của đường cong lợi suất trái phiếu Mỹ liên quan, đang đẩy thị trường vốn toàn cầu vào một trạng thái bình thường mới được định hình bởi việc tái cơ cấu thanh khoản. Sự phục hồi mạnh mẽ của đồng yên không chỉ là kết quả của hoạt động can thiệp mà còn chạm đến logic cơ bản của hệ thống tài chính toàn cầu. Phân tích cho thấy trật tự cũ dựa trên carry trade bằng yên và nới lỏng định lượng của ngân hàng trung ương đang tan rã. Lãi suất thị trường trong tương lai sẽ ngày càng được quyết định bởi chính thị trường vốn. Các nhà phân tích lưu ý rằng nếu Tokyo phải bảo vệ đồng yên, Bộ Tài chính Nhật Bản có thể cần bán trái phiếu Mỹ. Khi chủ nợ nước ngoài lớn nhất của Mỹ trở thành người bán, lợi suất dài hạn của trái phiếu Mỹ chắc chắn phải được định giá lại. Việc tăng lợi suất trái phiếu dài hạn được cho là do quá trình thanh lý dự trữ ngoại hối của Nhật Bản và sự chuyển đổi vai trò vốn của các công ty công nghệ lớn, vốn đang phát hành trái phiếu quy mô lớn để đầu tư vào cơ sở hạ tầng AI, chứ không chỉ đơn thuần là rủi ro lạm phát. Phân tích cho rằng những biến động trên thị trường hối đoái hiện tại không chỉ là một cuộc can thiệp kỹ thuật mà còn mang ý nghĩa của một "Thỏa thuận Plaza" mới và khởi đầu cho Hệ thống Bretton Woods 2.0. Hoa Kỳ đang tìm cách thoát khỏi tình trạng trì trệ lâu dài thông qua kinh tế học phía cung, trong khi Nhật Bản cũng có thể tái cấu trúc vai trò kinh tế và địa chính trị của mình. Dù cuộc can thiệp chung này cuối cùng chỉ là một hành động ổn định tỷ giá ngắn hạn hay là sự khởi đầu của sự phối hợp chính sách quốc tế dài hạn hơn, nó đã buộc thị trường phải xem xét lại mô hình carry trade bằng yên kéo dài hàng thập kỷ và những thay đổi mới có thể xảy ra trong dòng vốn toàn cầu.

marsbit41 phút trước

Can thiệp Mỹ-Nhật: Khởi đầu của 'Hiệp định Plaza' mới, hệ thống Bretton Woods 2.0 và cái kết của kỷ nguyên Carry Trade Yên Nhật

marsbit41 phút trước

Robot 'Teletubbies' Đến Nhà Làm Vệ Sinh, 200 Nghìn Đồng/Giờ, Trí Tuệ Nhân Tạo 'Thuần Khiết'

Ở San Francisco, một công ty khởi nghiệp robot có tên Tau Robotics đã ra mắt dịch vụ dọn dẹp nhà cửa bằng robot hình người với giá 30 USD/giờ. Tuy nhiên, điểm đáng chú ý là các robot này hiện hoạt động dựa trên điều khiển từ xa (teleoperation) hơn là trí tuệ nhân tạo tự chủ hoàn toàn. Công ty, thành lập năm 2024 với khoảng 10 nhân viên, giới thiệu ba robot "nhân viên": Chelsea chuyên dọn dẹp nhà bếp và phòng tắm, Elon phụ trách dọn dẹp định kỳ và ghi nhớ vị trí đồ đạc, và Tony tập trung vào việc vệ sinh chuyên sâu. Lý do chọn thiết kế hình người, theo bài viết, là để tạo điều kiện thuận lợi cho việc điều khiển từ xa, vì người vận hành có thể ánh xạ trực quan các cử động của mình lên robot. Cách tiếp cận "gian lận thông minh" này nhằm mục đích thu thập dữ liệu từ môi trường thực tế để huấn luyện AI trong tương lai, tương tự mô hình "chế độ bóng" trong xe tự lái. Bài viết so sánh với thị trường Trung Quốc, nơi trọng tâm chính của robot hình người vẫn là trong môi trường công nghiệp có kiểm soát, và đề cập đến một công ty Mỹ khác là 1X Neo cũng theo đuổi hướng đi tương tự. Mặc dù hiệu quả về mặt kỹ thuật, nhưng việc người tiêu dùng có sẵn sàng trả tiền cho một robot được điều khiển từ xa với camera trong nhà mình hay không vẫn là một câu hỏi mở. Dịch vụ của Tau Robotics hiện đang trong chế độ mời thử nghiệm tại San Francisco.

marsbit1 giờ trước

Robot 'Teletubbies' Đến Nhà Làm Vệ Sinh, 200 Nghìn Đồng/Giờ, Trí Tuệ Nhân Tạo 'Thuần Khiết'

marsbit1 giờ trước

Từ Hàn Quốc đến Mỹ: Nhờ AI, Lao Động Chân Tay Ngày Càng 'Lên Ngôi'

Trí tuệ nhân tạo (AI) đang định hình lại thị trường lao động. Bằng đại học 4 năm không còn là "tấm vé an toàn", trong khi các nghề kỹ thuật như thợ điện, thợ hàn, thợ sửa ống nước đang có nhu cầu cao và mức lương hấp dẫn chưa từng thấy. Thanh niên từ Mỹ đến Hàn Quốc đang thay đổi quan điểm về giáo dục và nghề nghiệp. Số liệu cho thấy sự chuyển dịch rõ rệt: doanh thu trường dạy nghề ở Mỹ tăng mạnh 11.4%, trong khi các đợt sa thải nhân viên văn phòng do AI cũng lên mức cao kỷ lục. Áp lực AI thay thế lao động trí thức, cộng với nhu cầu mở rộng cơ sở hạ tầng và trung tâm dữ liệu, đang đẩy cung-cầu nghiêng về lao động kỹ thuật. Khảo sát cho thấy 60% thế hệ Z có kế hoạch làm nghề lao động kỹ thuật vào năm 2026, vì tin rằng những nghề này có tính an toàn nghề nghiệp cao hơn trước AI. Nhiều nghề kỹ thuật hiện có mức lương trung bình ngang bằng hoặc vượt các nghề yêu cầu bằng đại học. Mô hình học việc "vừa học vừa làm" hấp dẫn, và công việc này khó bị AI thay thế hoặc gia công ra nước ngoài. Tại Hàn Quốc, học sinh tốt nghiệp trung học bán dẫn có tỷ lệ có việc làm ngay lên tới 96.4%. Tuy nhiên, ngành này đang đối mặt với khoảng trống kép: làn sóng nghỉ hưu ồ ạt và nhu cầu mở rộng cơ sở hạ tầng. Dự báo Mỹ sẽ thiếu hụt hàng triệu lao động có kỹ năng. Nhiều tập đoàn lớn như Meta, Lowe's đã đầu tư hàng trăm triệu USD vào các chương trình đào tạo. Dù nhu cầu thị trường rõ ràng, định kiến xã hội coi trọng bằng đại học hơn học nghề vẫn tồn tại. Các chuyên gia nhấn mạnh cần có những nỗ lực chủ động từ ngành công nghiệp để thu hẹp khoảng cách nhận thức này, thông qua các chương trình trải nghiệm thực tế cho giới trẻ, nhằm giải quyết tận gốc tình trạng thiếu hụt lao động kỹ thuật.

marsbit1 giờ trước

Từ Hàn Quốc đến Mỹ: Nhờ AI, Lao Động Chân Tay Ngày Càng 'Lên Ngôi'

marsbit1 giờ trước

Từ TPU đến Agent Tự Tiến Hóa: Jeff Dean Nhìn Nhận Bước Tiếp Theo của AI Như Thế Nào?

Trong buổi phỏng vấn tại YC Startup School 2026, Jeff Dean chia sẻ tầm nhìn về tương lai của AI. Ông nhấn mạnh rằng cuộc cạnh tranh AI không còn là ai có mô hình lớn hơn, mà là ai có thể tổ chức trí thông minh hiệu quả hơn. Điểm then chốt là sự chuyển dịch từ việc huấn luyện các mô hình đơn thuần sang xây dựng các hệ thống "Agent" có khả năng làm việc lâu dài, tự động thử nghiệm, xác minh và tích lũy kinh nghiệm. Các Agent này cần được trang bị công cụ, bộ nhớ, môi trường thực thi và cơ chế phản hồi rõ ràng. Jeff Dean cho rằng cơ hội cho các startup nằm ở những lĩnh vực chuyên biệt nơi các mô hình phổ thông hiện có tỷ lệ thành công rất thấp (gần 0-1%), nhờ vào dữ liệu độc quyền, công cụ đánh giá chuyên môn hoặc mô hình chuyên sâu. Ông cũng dự đoán phần cứng chuyên dụng cho suy luận (inference) với độ trễ thấp và tiêu thụ năng lượng thấp sẽ là chìa khóa. Khi chi phí tạo mã trở nên rẻ hơn, giá trị thực sự sẽ nằm ở khả năng xác định vấn đề đáng giải quyết, thiết kế thông số kỹ thuật rõ ràng và có "khiếu" thẩm định. Tương lai của AI là xây dựng các hệ thống có thể tự động hóa phương pháp khoa học, chạy các vòng lặp thử nghiệm với tốc độ cao để khám phá và cải tiến không ngừng.

marsbit1 giờ trước

Từ TPU đến Agent Tự Tiến Hóa: Jeff Dean Nhìn Nhận Bước Tiếp Theo của AI Như Thế Nào?

marsbit1 giờ trước

Giao dịch

Giao ngay
活动图片