Lương Văn Phong bất ngờ tấn công Musk, DeepSeek V4 Pro đối đầu Grok 4.6, bài kiểm tra đầu tiên gây sốc
Hôm nay, cuộc đối đầu giữa DeepSeek V4 Pro và Grok 4.6 đã chính thức diễn ra. Cả hai mô hình AI mạnh mẽ này đều được phát hành cùng thời điểm, tập trung vào khả năng thực hiện các nhiệm vụ dài, tự động gọi công cụ, sửa mã và xác minh kết quả.
**Về hiệu suất:**
* **DeepSeek V4 Pro** xuất sắc trong các bài kiểm tra tự động hóa (AutomationBench) và bảo mật mạng (CyberGym), vượt qua cả Fable 5 và Claude Opus. Điểm số trong bài kiểm tra tác nhân phần mềm (DeepSWE) tăng gần 5 lần.
* **Grok 4.6** thể hiện ấn tượng trong các tác vụ tri thức và mã hóa, đạt điểm số cao trong các bài kiểm tra như CursorBench và FrontierCode, thậm chí vượt mặt Fable 5 và GPT-5.6 Sol trong một số nhiệm vụ chuyên nghiệp như phân tích pháp lý (Harvey LAB).
**Về chi phí:** DeepSeek V4 Pro gây sốc với mức giá chỉ 0.87 USD cho một triệu token đầu ra, rẻ hơn đáng kể so với Grok 4.6 (6 USD), GPT-5.6 Sol (30 USD), Claude Opus 5 (25 USD) và Fable 5 (50 USD).
**Kết quả thử nghiệm thực tế:**
Các bài kiểm tra xây dựng trang web, tạo thiết kế Bento và phát triển game (như Flappy Bird, 3D Brick Breaker) cho thấy cả hai mô hình đều có năng lực mạnh mẽ. Trong một số tác vụ, DeepSeek V4 Pro cho ra sản phẩm chi tiết và hoàn chỉnh hơn, trong khi Grok 4.6 có ưu thế về mặt thẩm mỹ trong thiết kế. Tuy nhiên, ở các tác vụ đồ họa 3D phức tạp (như tạo cây anh đào bằng Three.js), cả hai vẫn còn khoảng cách so với GPT-5.6 Sol và Claude Opus 5.
**Tóm lại,** DeepSeek V4 Pro và Grok 4.6 đã thu hẹp đáng kể khoảng cách về hiệu năng với các mô hình đỉnh cao từ OpenAI và Anthropic, đồng thời phá vỡ rào cản giá cả. Sự cạnh tranh này đang mở ra một kỷ nguyên mới, nơi trí tuệ đỉnh cao trở nên dễ tiếp cận và hợp túi tiền hơn cho mọi người. Cuộc chạy đua vẫn tiếp tục với lời hứa hẹn về Grok 4.7 và các bản cập nhật sắp tới từ các gã khổng lồ AI khác.
marsbit28 phút trước