Google Deep Think thống trị bảng xếp hạng Olympic 8 ngôn ngữ, tự động giải quyết 4 vấn đề chưa có lời giải, rào cản nghiên cứu sụp đổ

marsbitXuất bản vào 2026-04-08Cập nhật gần nhất vào 2026-04-08

Tóm tắt

Google DeepMind vừa công bố thành tích đột phá của AI Deep Think khi vượt qua 8 kỳ thi Olympic bằng 8 ngôn ngữ khác nhau, bao gồm Toán, Lập trình, Vật lý và Hóa học. Hệ thống này đạt điểm tối đa trong kỳ thi Toán học Nhật Bản (JMO) và ICPC châu Á, đồng thời đạt 86.3% ở Olympic Toán Trung Quốc. Deep Think cũng chứng minh khả năng nghiên cứu khoa học độc lập bằng cách giải quyết 4 vấn đề toán học chưa có lời giải và đóng góp vào các lĩnh vực như vật lý lý thuyết, kinh tế học. Mặc dù kết quả chưa được xác thực bởi bên thứ ba, thành tích đa ngôn ngữ này cho thấy tiềm năng phá vỡ rào cản ngôn ngữ trong nghiên cứu khoa học, giúp các nhà khoa học không dùng tiếng Anh tiếp cận công cụ AI tiên tiến. DeepMind định vị Deep Think như "bộ khuếch đại trí tuệ" toàn cầu, mở rộng khả năng tự động hóa tư duy phức tạp.

「Deep Think」đánh bại/sánh ngang đối thủ trong mọi cuộc thi!

Vừa qua, nhà nghiên cứu cấp cao Google DeepMind Conglong Li đã đăng 12 bài liên tiếp trên nền tảng X, công bố một bảng điểm chưa từng thấy.

Một AI, cùng một bộ não, tám đề thi ngôn ngữ khác nhau, tất cả đều nộp bài với điểm số cao.

Ở bất kỳ mô hình nào, thành tích như vậy thực sự hiếm thấy.

Từ huy chương vàng IMO đến phủ sóng giải khu vực

Việc Deep Think đạt điểm cao trên nhiều bảng xếp hạng lần này không phải là một sự bùng nổ đơn lẻ đột ngột, mà là một đường cong phát triển năng lực đã diễn ra gần một năm.

Đầu tiên là đứng đầu trên đấu trường suy luận khó nhất.

Tháng 7/2025, Gemini Deep Think lần đầu tiên đạt tiêu chuẩn huy chương vàng tại Olympic Toán học Quốc tế (IMO), đạt 35/42 điểm. Cùng kỳ cũng đạt thành tích cao tương tự tại chung kết thế giới ICPC.

Hai thành tích này đã được DeepMind chính thức công bố trên blog.

Google DeepMind sau đó đã đưa hai thành tích này vào blog chính thức, như một dấu mốc cho việc Deep Think vượt qua "ngưỡng thi đấu thế giới" về toán học và lập trình.

Tiếp theo, Deep Think bắt đầu chuyển từ "đột phá đơn lẻ đẳng cấp vô địch thế giới" sang "xác minh hệ thống đa ngôn ngữ, đa lĩnh vực, đa tình huống".

Tháng 2/2026, Google đã liên tiếp đăng ba blog.

Một bài giới thiệu mô hình chính Gemini 3.1 Pro, một bài giới thiệu bản nâng cấp lớn cho chế độ suy luận chuyên dụng Deep Think, và một bài từ nhóm khám phá khoa học DeepMind, trực tiếp định vị Deep Think là "công cụ khuếch đại trí tuệ con người".

Deep Think sau khi nâng cấp đã đưa ra một loạt chỉ tiêu cứng:

Humanity's Last Exam đạt 48.4% (không có trợ giúp công cụ), ARC-AGI-2 đạt 84.6% (được xác minh chính thức bởi Quỹ ARC Prize), điểm Elo lập trình thi đấu Codeforces là 3455, phần thi viết của Olympic Vật lý và Hóa học Quốc tế 2025 đạt trình độ huy chương vàng.

Lộ trình này rất rõ ràng: đầu tiên sử dụng các cuộc thi đẳng cấp thế giới như IMO, ICPC để chứng minh khả năng suy luận mạnh mẽ của nó, sau đó sử dụng thành tích đa ngôn ngữ, giải khu vực và Olympic đa lĩnh vực để chứng minh khả năng suy luận sâu tổng quát có thể di chuyển ổn định xuyên ngôn ngữ và lĩnh vực.

Sự phát triển năng lực của Gemini Deep Think từ huy chương vàng IMO đến tăng tốc nghiên cứu cấp Tiến sĩ

Xem xét chi tiết từng thành tích trong bảng điểm 8 ngôn ngữ

Bây giờ, hãy thực sự mở bảng điểm này ra xem.

Tiếng Nhật nổi bật nhất.

Kỳ thi chọn Olympic Toán học Nhật Bản lần thứ 35 năm 2025 (JMO Finals), điểm tuyệt đối.

Vòng sơ khảo ICPC châu Á tại Nhật Bản, điểm tuyệt đối.

Trong đó, thành tích tại JMO Finals thậm chí còn vượt quá mức 80% tương ứng với điểm cao nhất của kỳ thi đó, đạt tiêu chuẩn "tương đương huy chương vàng" theo thông báo chính thức.

Tiếng Pháp cũng đạt điểm tuyệt đối, 100%.

Tiếng Trung thì thú vị.

Tại Olympic Toán học Trung Quốc lần thứ 41 (CMO), Deep Think đạt 86.3%, rất xuất sắc. Nhưng tại Olympic Tin học Trung Quốc (NOI) chỉ đạt 63.3%.

Khoảng cách giữa 86.3% và 63.3% đã vẽ ra ranh giới thực sự của khả năng suy luận AI.

Trong các kỳ thi toán, mô hình đối mặt với suy diễn trừu tượng, xây dựng chứng minh và diễn dịch nhiều bước, đây chính xác là dải năng lực mà Deep Think giỏi nhất.

Nhưng đến các kỳ thi tin học, vấn đề không chỉ là "nghĩ thông suốt", mà còn bao gồm việc dịch logic thành mã thực thi, kiểm soát điều kiện biên, cân nhắc các ràng buộc độ phức tạp, và tránh sai sót ở cấp độ triển khai.

Cái trước gần hơn với suy luận thuần túy, cái sau yêu cầu đồng thời đạt chuẩn "suy luận + thiết kế thuật toán + triển khai kỹ thuật".

Ở các ngôn ngữ khác như Hàn Quốc, Hindi, Việt Nam, Nga, Bồ Đào Nha trong các kết quả thi tương ứng, Deep Think cũng đều đánh bại đối thủ hoặc ít nhất là ngang bằng.

Nếu gộp tiếng Nhật, tiếng Pháp, tiếng Trung lại để xem, điểm bất thường nhất lần này thực ra không phải là một môn đơn lẻ nào đó đạt điểm tuyệt đối, mà là cùng một mô hình, cùng một hệ thống suy luận Deep Think, trên đề thi của nhiều ngôn ngữ khác nhau, đều giao nộp thành tích thuộc nhóm dẫn đầu.

Bảng điểm này có đáng tin không?

Nhưng ở đây có một thiếu sót then chốt:

Conglong Li đã không liệt kê dữ liệu so sánh cụ thể của các đối thủ cạnh tranh: tất cả thành tích đều đến từ đánh giá nội bộ của Google. Không có xác minh độc lập của bên thứ ba, không có chứng nhận chính thức từ ban tổ chức cuộc thi, phương pháp đánh giá hoàn toàn không được công khai.

Mỗi bài tập được làm một lần hay làm nhiều lần lấy kết quả tốt nhất? Sử dụng bao nhiêu năng lực tính toán khi suy luận? Có can thiệp của kỹ thuật gợi ý nhân tạo không?

Những chi tiết này ảnh hưởng trực tiếp đến hàm lượng vàng của thành tích, cũng đều không được đề cập.

Một điểm dễ bị bỏ qua khác: tất cả các kỳ thi này đều là vòng chọn khu vực của các quốc gia, không phải chung kết quốc tế.

Giữa độ khó của đề thi khu vực và chung kết quốc tế, cách nhau một cấp độ.

Nhà nghiên cứu đã nói rõ, những thành tích này "sẽ được đưa vào thẻ mô hình (model card)", tính đến thời điểm phát hành, thẻ mô hình vẫn chưa được cập nhật chính thức.

Vì vậy, hiện tại đây dường như vẫn là một bảng điểm do thí sinh tự chấm điểm, tự công bố, chưa nộp cho phòng giáo vụ đóng dấu.

Tính công bằng nghiên cứu đa ngôn ngữ, chiến trường thực sự bị bỏ qua

Tại sao Google lại dành sức lực đặc biệt để đánh giá giải khu vực bằng 8 ngôn ngữ?

Việc đánh giá năng lực suy luận AI hiện tại, hầu như hoàn toàn dựa trên tiếng Anh.

MATH, GSM8K, HumanEval, ARC-AGI...... tất cả đều là tiếng Anh.

Các nhà toán học, vật lý học, kỹ sư trên toàn thế giới, chỉ cần tiếng mẹ đẻ không phải là tiếng Anh, khi sử dụng công cụ nghiên cứu AI đều phải vượt qua một rào cản ngôn ngữ.

8 ngôn ngữ Google chọn không phải ngẫu nhiên.

Tiếng Nhật, Hàn Quốc, Trung Quốc bao phủ trọng điểm nghiên cứu Đông Á, Hindi, Việt Nam bao phủ thị trường mới nổi, tiếng Pháp, Nga, Bồ Đào Nha bao phủ châu Âu và Nam Mỹ.

Cộng lại, đây là phần lớn sản lượng nghiên cứu toàn cầu.

DeepMind trong blog chính thức đã định vị Deep Think là "công cụ khuếch đại trí tuệ con người", nói rằng nó có thể "xử lý truy xuất kiến thức và xác minh nghiêm ngặt, để các nhà khoa học tập trung vào chiều sâu khái niệm và định hướng sáng tạo".

Kết hợp với thành tích đa ngôn ngữ lần này, hàm ý của câu nói này không khó hiểu: công cụ khuếch đại này, không chỉ dành cho các nhà khoa học nói tiếng Anh.

Đáng chú ý hơn là Deep Think đã đi được bao xa trong việc ứng dụng nghiên cứu.

DeepMind đã công bố một tác nhân nghiên cứu toán học tên là Aletheia, dựa trên Deep Think, có thể tự động tạo, xác minh, sửa đổi giải pháp cho các vấn đề toán học cấp nghiên cứu.

Aletheia được điều khiển bởi Deep Think, có khả năng tạo lặp, xác minh và sửa chữa đối với các vấn đề toán học cấp nghiên cứu

Aletheia đã tham gia tạo ra nhiều bài báo nghiên cứu, trong đó một bài hoàn toàn do AI tự chủ hoàn thành, tính toán hằng số cấu trúc cụ thể trong hình học số học.

Ngoài ra, trong đánh giá bán tự chủ 700 vấn đề toán học mở, nó còn tự giải quyết độc lập 4 vấn đề trước đó chưa có lời giải.

Chế độ Gemini Deep Think cũng thể hiện tiềm năng to lớn trong các lĩnh vực như khoa học máy tính, vật lý học, kinh tế học.

Trong lĩnh vực khoa học máy tính, Deep Think giúp lật đổ một giả thuyết tồn tại mười năm chưa giải quyết, trong lĩnh vực vật lý tìm ra nghiệm giải tích mới cho bức xạ hấp dẫn của dây vũ trụ, trong lĩnh vực kinh tế mở rộng một định lý lý thuyết đấu giá.

Sơ đồ quy trình suy luận AI, cho thấy việc khám phá không gian giải pháp quy mô lớn ở lớp mạng được tổng hợp thành suy luận có cấu trúc như thế nào, và được xác nhận thông qua xác minh tự động và nhân tạo.

Thông qua hợp tác với chuyên gia giải quyết 18 vấn đề nghiên cứu hóc búa, phiên bản nâng cao của Gemini Deep Think đã giúp đột phá các nút thắt cổ chai tồn tại lâu dài trong các lĩnh vực thuật toán, học máy và tối ưu hóa tổ hợp, lý thuyết thông tin và kinh tế học.

Điều này đã vượt xa phạm vi "giải bài tập thi".

Khi các đối thủ cạnh tranh vẫn còn xoay quanh bảng xếp hạng benchmark tiếng Anh, Google đã tìm thấy một chiến trường mới trong lĩnh vực "công cụ tăng tốc nghiên cứu AI".

Thứ quan trọng nhất của sự việc này thực ra không phải là điểm số, tín hiệu thực sự đằng sau nó là: rào cản ngôn ngữ của công cụ nghiên cứu AI đang được coi là một vấn đề kỹ thuật để giải quyết.

Nếu con đường này thành công, các nhà khoa học nghiên cứu bằng tiếng Nhật, Hàn Quốc, Trung Quốc, Hindi trên toàn thế giới, lần đầu tiên sẽ đứng trên cùng một vạch xuất phát với những người nói tiếng Anh bản ngữ.

Lần này, Google đã đặt bài lên bàn.

Còn đối thủ cạnh tranh nào sẽ theo bài, tin rằng chúng ta cũng sẽ sớm thấy.

Tài liệu tham khảo:

https://blog.google/intl/ja-jp/company-news/technology/gemini-31-pro-gemini-31-pro-deep-think/%20

https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/%20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/%20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/

Bài viết từ tài khoản WeChat công cộng "Tân Trí Nguyên" (新智元), tác giả: Tân Trí Nguyên

Câu hỏi Liên quan

QGoogle DeepMind đã công bố thành tích gì đáng chú ý của Deep Think trong các kỳ thi Olympic?

AGoogle DeepMind công bố Deep Think đạt điểm cao trong 8 ngôn ngữ khác nhau, bao gồm điểm tuyệt đối trong Olympic Toán học Nhật Bản (JMO Finals) và ICPC châu Á tại Nhật, cùng điểm số ấn tượng ở các kỳ thi Olympic Toán, Lý, Hóa, và lập trình.

QTại sao kết quả của Deep Think trong kỳ thi Olympic Tin học Trung Quốc (NOI) thấp hơn so với Olympic Toán học Trung Quốc (CMO)?

AKết quả NOI (63.3%) thấp hơn CMO (86.3%) do Olympic Tin học yêu cầu không chỉ suy luận mà còn cả thiết kế thuật toán, triển khai mã lệnh, kiểm soát điều kiện biên và tối ưu độ phức tạp, trong khi Toán học thiên về suy luận trừu tượng và chứng minh - lĩnh vực Deep Think mạnh hơn.

QDeep Think đã đạt được những đột phá nào trong nghiên cứu khoa học thực tế?

ADeep Think đã tự động giải quyết 4 vấn đề toán học chưa có lời giải trong 700 bài toán mở, giúp lật đỏ một giả thuyết tồn tại 10 năm trong khoa học máy tính, tìm ra lời giải giải tích mới cho bức xạ hấp dẫn của dây vũ trụ trong vật lý, và mở rộng một định lý lý thuyết đấu giá trong kinh tế.

QTại sao việc đánh giá Deep Think trên 8 ngôn ngữ lại quan trọng đối với cộng đồng nghiên cứu toàn cầu?

AĐánh giá đa ngôn ngữ (Nhật, Hàn, Trung, Hindi, Việt, Nga, Bồ Đào Nha, Pháp) giúp phá vỡ rào cản ngôn ngữ trong nghiên cứu, cho phép các nhà khoa học không dùng tiếng Anh tiếp cận công cụ AI công bằng, thúc đẩy hợp tác và sáng tạo toàn cầu mà không phụ thuộc vào ngôn ngữ mẹ đẻ.

QCó những hạn chế nào trong báo cáo thành tích của Deep Think do Conglong Li công bố?

ABáo cáo thiếu dữ liệu so sánh trực tiếp với đối thủ, không có xác nhận từ bên thứ ba hoặc ban tổ chức kỳ thi, phương pháp đánh giá (số lần thử, lượng tính toán, can thiệp kỹ thuật) không được tiết lộ, và tất cả kết quả dựa trên đánh giá nội bộ của Google, chưa được cập nhật chính thức trong model card.

Nội dung Liên quan

Lãi Mở XRP Chạm Mốc 2,6 Tỷ USD Khi Nhu Cầu Phái Sinh Tăng

Dữ liệu từ CoinGlass cho thấy lãi mở (open interest) của hợp đồng tương lai XRP đã tăng hơn 10% trong 24 giờ, đạt mốc 2,6 tỷ USD, đưa XRP trở thành một trong những tài sản tiền điện tử có lãi mở phái sinh lớn nhất. Mức tăng này phản ánh nhu cầu giao dịch phái sinh quanh XRP đang gia tăng đáng kể. Tuy nhiên, lãi mở tăng cho thấy nhiều vị thế đang được mở ra, nhưng không tự động chỉ ra rằng dòng tiền này lạc quan hay bi quan về giá. Nó có thể đến từ các vị thế mua, bán khống, phòng ngừa rủi ro hoặc giao dịch đòn bẩy. Do đó, sự tích tụ này có thể hỗ trợ một đợt biến động mạnh hơn, nhưng cũng làm tăng rủi ro biến động và thanh lý. Các nhà giao dịch cần xem xét thêm các chỉ số khác như phí funding, khối lượng giao dịch spot, hướng giá và dữ liệu thanh lý để có bức tranh đầy đủ. Sự gia tăng lãi mở cho thấy XRP đang thu hút sự chú ý nghiêm túc từ thị trường phái sinh, nhưng sự bền vững của xu hướng sẽ phụ thuộc vào việc liệu hoạt động spot có tăng theo để xác nhận hay không. Kết quả cuối cùng có thể là một xu hướng mạnh hơn hoặc đơn giản là thêm biến động cho một thị trường vốn đã sôi động.

bitcoinist37 phút trước

Lãi Mở XRP Chạm Mốc 2,6 Tỷ USD Khi Nhu Cầu Phái Sinh Tăng

bitcoinist37 phút trước

Nhịp Đập Thị Trường BTC: Tuần 30

Bitcoin (BTC) đã hồi phục từ dưới 58.000 USD để thử nghiệm mức 65.000 USD trước khi đi vào giai đoạn củng cố quanh 64.500 USD. Động lượng tăng đã chậm lại và khối lượng giao dịch spot vẫn ở mức thấp. Mặc dù vậy, sự phục hồi được duy trì trong bối cảnh thị trường đang tìm kiếm điểm cân bằng vững chắc hơn. Chênh lệch biến động (volatility spreads) thu hẹp cho thấy thị trường phái sinh không còn định giá phí bảo hiểm rủi ro cao, phản ánh tâm lý phòng thủ giảm bớt. Dù sự tham gia của thị trường giao ngay còn yếu, khẩu vị đầu cơ đang dần quay trở lại. Lãi suất mở (open interest) cho hợp đồng tương lai và quyền chọn tăng lên, dòng tiền của nhà giao dịch vĩnh viễn (perpetual taker flow) chuyển sang mua ròng và nhu cầu bảo vệ trước rủi ro giảm xuống. Hoạt động on-chain cũng đang ổn định, được hỗ trợ bởi sự cải thiện vừa phải về thông lượng kinh tế và sự tham gia của người dùng. Dòng vốn vẫn thận trọng, nhưng dòng tiền ETF spot tại Mỹ đang phục hồi và các nhóm ETF đang trở lại gần mức hòa vốn, cho thấy áp lực bán từ tổ chức đang giảm dần. Nhìn chung, thị trường Bitcoin dường như ngày càng cân bằng hơn, với niềm tin dài hạn tạo đà hỗ trợ trong khi sự tham gia đầu cơ vẫn được kiểm soát. Tuy nhiên, tỷ trọng ngày càng tăng của vốn ngắn hạn nhạy cảm với giá cả làm tăng khả năng biến động mạnh hơn, khiến thị trường vẫn kiên cường nhưng ngày càng nhạy cảm với sự thay đổi trong động lượng và áp lực bán.

insights.glassnode2 giờ trước

Nhịp Đập Thị Trường BTC: Tuần 30

insights.glassnode2 giờ trước

Nhu cầu Bitcoin tại thị trường giao ngay suy yếu khi vốn mới do dự bất chấp dòng tiền vào ETF

Mặc dù dòng tiền vào các quỹ ETF Bitcoin đã chuyển sang tích cực kể từ giữa tháng 7, nhưng điều này vẫn chưa đủ để đưa giá Bitcoin vượt lên vùng cung địa phương quanh mốc 65.000 USD. Theo phân tích từ CryptoQuant, nhu cầu mua Bitcoin trên thị trường giao ngay (spot) trong 30 ngày đã suy yếu đáng kể, giảm từ -80.000 BTC xuống -170.000 BTC. Sự ổn định tương đối của giá hiện tại chủ yếu được hỗ trợ bởi các lệnh mua để đóng vị thế bán (short-covering) trên thị trường phái sinh và áp lực bán từ các nhà đầu tư ngắn hạn đã giảm bớt. Chỉ số "Nhà đầu tư mới vào Bitcoin", đo lường tỷ trọng vốn hóa nắm giữ bởi các đồng coin non trẻ (dưới 1 tháng tuổi), vẫn ở gần mức thấp nhất trong năm, cho thấy sự tham gia của dòng vốn mới còn yếu. Tỷ lệ lợi nhuận trên đầu ra đã chi tiêu của nhà đầu tư ngắn hạn (STH SOPR) cũng duy trì dưới mức 1.0, có nghĩa là họ vẫn đang chốt lỗ trung bình. Những chỉ báo này cùng củng cố quan điểm rằng thị trường hiện đang trong giai đoạn ổn định cục bộ, chứ chưa có dấu hiệu đảo chiều tăng mạnh. Các nhà phân tích nhấn mạnh rằng, cần theo dõi việc giá có thể vượt qua đỉnh dao động địa phương 67.300 USD hay không để xác nhận một sự đảo chiều thực sự.

ambcrypto4 giờ trước

Nhu cầu Bitcoin tại thị trường giao ngay suy yếu khi vốn mới do dự bất chấp dòng tiền vào ETF

ambcrypto4 giờ trước

Vì sao giao dịch "cá voi" 32,6 triệu USD của Chainlink có thể định hình đà tăng của LINK về phía 9 USD

Một giao dịch chuyển 3,89 triệu LINK (trị giá 32,58 triệu USD) từ ví Coinbase Institutional sang một ví ẩn danh đã thu hút sự chú ý đến Chainlink. Chuyển động này làm dấy lên suy đoán về việc các tổ chức lớn đang tích lũy thay vì bán ra ngay lập tức. Dòng tiền ròng trên sàn giao dịch đã chuyển sang dương với lượng vào khoảng 620,18 nghìn USD, đánh dấu sự thay đổi sau một thời gian dài dòng tiền ra chiếm ưu thế. Tuy nhiên, tâm lý trên thị trường phái sinh vẫn thận trọng, với chỉ số CVD 90 ngày cho thấy lệnh bán vẫn chiếm ưu thế. Về mặt kỹ thuật, LINK đang giao dịch quanh mức 8,35 USD, thử thách vùng kháng cự gần đó. Chỉ số RSI ở mức 57,71 cho thấy áp lực mua đang tăng lên. Để duy trì đà hồi phục, giá cần vượt qua được ngưỡng 8,35 USD, từ đó mở đường hướng tới mục tiêu 9,00 USD. Ngược lại, nếu bị từ chối tại đây, giá có thể quay lại kiểm tra vùng hỗ trợ 8,18 USD. Tóm lại, hoạt động của ví tổ chức và dòng tiền ròng trên sàn là tín hiệu tích cực, nhưng tâm lý bán trên thị trường phái sinh vẫn tạo ra sự thận trọng, khiến triển vọng ngắn hạn của LINK chưa thực sự rõ ràng.

ambcrypto5 giờ trước

Vì sao giao dịch "cá voi" 32,6 triệu USD của Chainlink có thể định hình đà tăng của LINK về phía 9 USD

ambcrypto5 giờ trước

Giao dịch

Giao ngay
活动图片