Hôm nay, trận chiến này thật kỳ diệu!
Một bên là Lương Văn Phong, cuối cùng đã tung ra bản chính thức DeepSeek V4 Pro vào lúc nửa đêm.
Bên kia, Musk đã đầu tư vào flagship tiếp theo Grok 4.6, tập trung vào chi phí thấp, hiệu năng mạnh.
Hai gã khổng lồ, cùng một thời điểm phát hành, mùi thuốc súng lập tức bốc cao.

Mục tiêu họ nhắm đến, gần như là cùng một việc —
Giúp mô hình có thể liên tục gọi công cụ, sửa đổi mã, xác minh kết quả trong các nhiệm vụ dài, cuối cùng giao một sản phẩm thực sự có thể sử dụng.
DeepSeek V4 Pro đã đến
Grok 4.6 của Musk ra trận
Thành tích nổi bật nhất của bản chính thức DeepSeek V4 Pro là đạt vị trí tuyệt đối số một trong hai bài đánh giá, trực tiếp vượt mặt Fable 5.
Bài kiểm tra tác nhân an ninh mạng CyberGym đạt 83.3 điểm, vượt 83.1 điểm của Fable 5, 78.3 điểm của Opus 4.8.
Tự động hóa nhiệm vụ AutomationBench đạt 31.8 điểm, đè xuống 29.1 điểm của Fable 5 và 27.2 điểm của Opus 4.8.
Lần "áp sát" nhất, xảy ra tại Terminal-Bench 2.1.
DeepSeek đạt 87.9 điểm, vượt 85.0 điểm của Opus 4.8, chỉ kém 0.1 điểm so với 88.0 điểm của Fable 5.
Trong các bài kiểm tra tác nhân Agent khó khác, DeepSeek đã thực hiện một bước nhảy vọt tuyệt đối so với Opus 4.8.
Trong "Bài thi cuối của con người" có công cụ đạt 60.0 điểm, vượt 57.9 điểm của Opus 4.8, tiếp tục áp sát 63.0 điểm của Fable 5.
Ngay cả tác nhân kỹ thuật phần mềm trước đây yếu nhất, DeepSWE cũng tăng vọt từ 12.8 điểm bản preview lên 62.7 điểm, gần gấp 4.9 lần trước.
Thành tích này không chỉ vượt 58.0 điểm của Opus 4.8, mà chỉ còn cách 70.0 điểm của Fable 5 là 7.3 điểm.

Cùng lúc đó, Musk cũng đặt Fable 5 và GPT-5.6 Sol lên lửa.
Grok 4.6 đầu tiên bắt kịp GPT-5.6 về năng lực tổng hợp, sau đó liên tục vượt mặt trong các bài kiểm tra mã hóa.
Chỉ số thông minh tổng hợp đạt 61 điểm, chỉ kém 1 điểm so với 62 điểm của Fable 5.
CursorBench đạt 69.9%, vượt 67.2% của GPT-5.6, chỉ cách 0.6 điểm phần trăm so với 70.5% của Fable 5.
FrontierCode đạt 61.3%, cũng vượt 60.6% của GPT-5.6, tiếp tục sát nút 63.6% của Fable 5.
Đến với công việc tri thức gần hơn với giao hàng thực tế tại nơi làm việc, Grok 4.6 trực tiếp lật kèo vượt mặt, đạt vị trí số một trong cả ba bài đánh giá.
GDPval-AA v2 đạt 1753 Elo, vượt 1741 của Fable 5, cũng vượt 1728 của GPT-5.6.
AA-Briefcase lại đạt 1577 Elo, vượt 1574 của Fable 5 và 1502 của GPT-5.6.
Nhiệm vụ pháp lý chuyên nghiệp Harvey LAB đạt 15.8%, Fable 5 chỉ có 11.3%, GPT-5.6 thậm chí chỉ có 2.5%.

Khốc liệt hơn, DeepSeek V4 Pro và Grok 4.6 không chỉ đuổi kịp các mô hình đỉnh cao của OpenAI và Anthropic về hiệu năng, mà còn cùng nhau hạ giá trí tuệ tiên phong.
Mỗi triệu Token đầu ra, Grok 4.6 cần 6 USD, GPT-5.6 Sol cần 30 USD, Claude Opus 5 cần 25 USD, Fable 5 cần 50 USD.
Còn DeepSeek chỉ cần 0.87 USD —
Khoảng 1/7 của Grok 4.6, 1/35 của GPT-5.6 Sol, 1/29 của Claude Opus 5, 1/57 của Fable 5!


Kiểm tra đầu tiên toàn mạng
DeepSeek đại chiến Grok
Hiện tại, đợt kiểm tra thực tế đầu tiên đã được tung ra. DeepSeek V4 Pro và Grok 4.6, cuối cùng cũng từ bảng điểm chạy bước vào trường nhiệm vụ thực tế.
Vòng đầu tiên, chúng tôi trực tiếp tăng cường độ cho DeepSeek.
Chỉ với một prompt, nó đã xây dựng một quả địa cầu 3D tương tác hoàn chỉnh từ con số không trong trình duyệt.
Các tương tác cơ bản như kéo, xoay, thu phóng đều khả dụng; dòng dữ liệu toàn cầu, tuyến đường động và đánh dấu địa lý, cũng được trải đầy trên bề mặt địa cầu.
Nhìn vào chi tiết, tán xạ khí quyển, kết xuất mây, ánh sáng bóng ngày đêm và toàn bộ giao diện UI, cũng đầy đủ.

Tiếp theo, trực tiếp kéo hai mô hình vào cùng một võ đài.
Blogger AI "Hướng Dương Kiều Mộc" đầu tiên sử dụng DeepSeek V4 Pro chạy liên tiếp ba nhiệm vụ nhỏ, sau đó đưa cùng prompt của hai bài trong số đó cho Grok 4.6, trực tiếp so sánh sản phẩm cuối.
Nhiệm vụ đầu tiên, là gọi 3 Skill để phát triển và triển khai một trang web.
DeepSeek chạy thông suốt toàn bộ quy trình, từ thiết kế trang và mức độ hoàn thành mà xem, biểu hiện tổng thể rất ổn định.
Nhiệm vụ thứ hai, là sao chép 60 phong cách thiết kế một lần, và tạo một bộ thẻ Bento tập trung trưng bày.
Vòng này, DeepSeek đã tạo ra sự phân biệt rõ ràng về font chữ, phối màu và bố cục, hiệu ứng thị giác tổng thể khá tốt.
Nhiệm vụ cuối cùng, là tạo từ đầu một trò chơi 3D đập gạch.
Trò chơi không chỉ có thể trực tiếp chơi được, mà còn thêm vào cảnh 3D, nhạc nền và hiệu ứng âm thanh động, phản hồi thao tác và tính khả dụng đều đầy đủ.



Sau đó, prompt giống nhau được giao cho Grok 4.6.
Trong ván đấu 3D đập gạch này, hai mô hình gần như hòa nhau.
Trò chơi do Grok tạo ra cũng có chất lượng, dù là hiệu ứng thị giác, độ hoàn chỉnh của cảnh hay tính khả dụng, đều không thua kém DeepSeek V4 Pro.
Đến ván thiết kế 60 Bento này, Grok 4.6 gỡ lại một điểm.
Một số trang do nó tạo ra, trong bố cục, phối màu và tầng thứ thị giác trưởng thành hơn, hiệu quả cuối cùng cũng đẹp hơn.


Trận đối đầu gay gắt hơn, xảy ra trên Flappy Bird.
Nhà phát triển Jun Song đưa ra prompt hoàn toàn giống nhau, để DeepSeek V4 Pro và Grok 4.6 lần lượt "tự tay vò" một trò chơi từ con số không.
Kết quả, hai mô hình đi theo hai con đường hoàn toàn khác nhau.
DeepSeek V4 Pro tiêu hao hơn 20.000 Token, chi phí chỉ 0.019 USD; Grok 4.6 chỉ sử dụng khoảng 5000 Token, chi phí lại lên đến 0.03 USD.

Nhưng nhìn vào sản phẩm cuối cùng, ván này DeepSeek rõ ràng vượt trội hơn.
Trong trò chơi không chỉ có cảnh xa núi và những đám mây chồng lớp, ống dẫn nước cũng có gradient và cảm giác khối lượng. Khi nhân vật xuyên qua ống dẫn nước, màn hình thậm chí sẽ bật lên animation nổi "+1".
Từ tầng thứ cảnh đến phản hồi thao tác, chi tiết gần như được tối đa hóa, mức độ hoàn thành xây dựng đầu cuối rõ ràng cao hơn Grok 4.6.
Trong một bài kiểm tra front-end khác do nhà phát triển Hamza thực hiện, DeepSeek V4 Pro lại một lần nữa đánh bại Grok 4.6.
Dù là mức độ hoàn thành trang hay hiệu ứng thị giác cuối cùng, sản phẩm do V4 Pro giao nộp đều vượt trội hơn.

Tuy nhiên, V4 Pro cũng không phải thần thánh ở mọi trận.
Trong một bài kiểm tra so sánh chim bồ nông, so với bản Flash, mức độ hoàn thành tổng thể bức tranh của V4 Pro cao hơn, hình dáng con voi cũng đẹp hơn.
Vấn đề duy nhất là — hướng di chuyển của chim bồ nông, bị vẽ hoàn toàn ngược lại.

Tiếp tục tăng độ khó, để DeepSeek V4 Pro, GPT-5.6 Sol và Claude Opus 5 sử dụng Three.js tạo ra cùng một cây anh đào, khoảng cách càng rõ ràng hơn.
Dù là chi tiết thân cây và cành lá, hay ánh sáng bóng, độ sâu trường ảnh và bầu không khí tổng thể, V4 Pro đều không bằng hai mô hình đỉnh cao kia.



DeepSeek V4 Pro; GPT-5.6 Sol; Claude Opus 5
Xem qua mấy vòng kiểm tra thực tế, DeepSeek V4 Pro và Grok 4.6 thực sự đã đánh đến cùng một mức, khó phân cao thấp.
Hai AI cùng một ngày
Đuổi kịp OpenAI và Anthropic
Đối với sự bùng nổ đồng thời của hai mô hình này, đại gia Rick De Oliveira đưa ra đánh giá là, "Mạnh mẽ, và hợp lý."
Dưới sự hỗ trợ của DeepSeek V4 Pro và Grok 4.6, hai từ này gần như không thể xuất hiện cùng lúc, hôm nay, lần đầu tiên thực sự cùng nhau xuất hiện.
Từ an ninh mạng, nhiệm vụ tri thức đến Agent tự chủ giải quyết vấn đề, chúng đã trên nhiều chiến trường, dựa vào chi phí thấp hơn trực tiếp đập vỡ trần năng lực tiên phong.

Nhìn lại trận "pháo kích" AI kỳ diệu hôm nay, DeepSeek và Grok cùng nhau viết lại một quy tắc trò chơi:
Trí tuệ đỉnh cao, không còn cao không với tới.
Trước đây, nhà phát triển thường chỉ có thể lựa chọn khó khăn giữa "dùng không nổi" và "không đủ mạnh".
Mà hôm nay, DeepSeek dùng giá chỉ bằng vài phần chục của SOTA để lật bàn, Grok thì theo sát với tỷ lệ giá/hiệu năng cực cao.
Cuộc tấn công trực diện "năng lượng cao giá thấp" này, đã xé toạc khe nứt của trật tự cũ.

Và chiến tranh vẫn chưa kết thúc.
Musk đã thông báo trước, Grok 4.7 sắp tới, mục tiêu nhắm thẳng vào vượt mặt tất cả AI đỉnh cao; sự phản công của OpenAI và Anthropic, cũng chắc chắn sẽ tiếp nối.


Đứng trong thời đại tiến hóa với đơn vị "giờ" này, trí tuệ không còn là đặc quyền của số ít gã khổng lồ, sự bùng nổ ứng dụng thuộc về tất cả mọi người, mới chỉ vừa bắt đầu.
Tài liệu tham khảo:
https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
https://x.ai/news/grok-4-6
https://x.com/vista8/status/2087577905081823559
https://x.com/vista8/status/2087566666477744620
https://x.com/jun_song/status/2087602149979254914
Bài viết từ tài khoản WeChat công chúng "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục, biên tập: Mai Sắc Đào Tử






