CUDA lại một lần nữa bị 'đâm'...
Lần này thủ phạm, vẫn là chính AI do NVIDIA nuôi lớn.
Một công ty khởi nghiệp mới thành lập chỉ một năm, sử dụng Agent lập trình AI, chỉ mất 10 giờ, đã dựng lên một bộ "phần mềm kiểu CUDA".

Khoan đã.
Ý bạn là đế chế phần mềm mà NVIDIA mất gần 20 năm xây dựng, đã bị sao chép dễ dàng như vậy??

Không chỉ vậy. DeepSeek cũng đang thử viết ít mã CUDA cấp thấp hơn.
Họ đã mã nguồn mở một thư viện toán tử GPU có tên TileKernels, viết bằng TileLang, giúp loại bỏ phần lớn công việc viết mã CUDA cấp thấp thủ công.
Tuy nhiên, những "khủng hoảng CUDA" tương tự, chúng ta cũng không phải nghe lần đầu.
Cứ sau một khoảng thời gian, CUDA lại bị lôi ra 'đánh đòn' một lần, nào là bị thay thế, bị xuyên thủng, hào phòng thủ lại bị lật đổ...
Có thật là như vậy không?
"Sao chép" CUDA trong 10 giờ
Nhắc đến NVIDIA, phản ứng đầu tiên của nhiều người là GPU.
H100, Blackwell, Rubin, nhờ vào các thế hệ chip mạnh hơn, NVIDIA đã hưởng lợi nhuận lớn nhất từ làn sóng AI này.
Nhưng lợi thế thực sự khó lung lay của NVIDIA, thực ra không phải là phần cứng, mà là phần mềm.
Chip có thể mua, thông số có thể đuổi theo, công nghệ sản xuất cũng sẽ lặp lại. Thứ thực sự khiến khách hàng dùng NVIDIA rồi khó đổi đi, là toàn bộ hệ sinh thái phần mềm được xây dựng xung quanh GPU.
Và CUDA, chính là cốt lõi của đế chế phần mềm này.
CUDA viết tắt của Compute Unified Device Architecture, do giám đốc cấp cao NVIDIA Ian Buck dẫn đầu, mất gần 20 năm để xây dựng.
Nó thường được gọi là ngôn ngữ lập trình, nhưng chính xác hơn, CUDA là một nền tảng phần mềm hoàn chỉnh xây dựng xung quanh GPU của NVIDIA.
Nếu chia đơn giản thành ba lớp, dưới cùng là lớp nhân (kernel), Kernel trực tiếp điều khiển chip, trình biên dịch và thời gian chạy.
Ở giữa là lớp thư viện — các thư viện tính toán được tối ưu hóa cao như cuBLAS, cuDNN, cùng với các công cụ gỡ lỗi, xác minh và phân tích hiệu suất.
Trên cùng, là các framework phát triển như PyTorch, TensorFlow, kho mã khổng lồ và quy trình làm việc do doanh nghiệp tích lũy, cùng cộng đồng nhà phát triển trưởng thành xung quanh CUDA.

△
Nói vậy có thể hơi trừu tượng, nhưng bạn có thể tưởng tượng GPU của NVIDIA như một nhà máy.
Lớp dưới cùng của CUDA chịu trách nhiệm nói cho máy móc biết mỗi bước phải làm thế nào, lớp giữa cung cấp công cụ sản xuất có sẵn, lớp trên cùng là toàn bộ hệ thống sản xuất đã vận hành nhiều năm.
Vì vậy, đối với khách hàng, họ mua không chỉ là một card của NVIDIA, mà là một nhà máy có thể sử dụng ngay.
Bây giờ, một anh chàng tên là Jeremy Nixon, mang AI Agent đến.

Nixon là người sáng lập công ty khởi nghiệp phần mềm AI Infinity, trước đây cũng từng là nhà nghiên cứu tại Google Brain.
Nhóm của anh phát triển một AI research Agent có tên Ignition, chuyên viết phần mềm cấp thấp cho các chip AI khác nhau.
Nó có thể tạo GPU Kernel, chạy thử nghiệm, tìm lỗi, đo hiệu suất, sau đó tự động viết lại mã dựa trên kết quả.
Kỹ sư con người chịu trách nhiệm đưa ra định hướng cấp cao, những công việc lặt vặt và tốn chất xám còn lại, cứ giao cho Agent lặp đi lặp lại.
Cứ như vậy, Infinity dùng Ignition để xây dựng một bộ phần mềm kiểu CUDA cho công ty chip AI khởi nghiệp d-Matrix.
Chỉ mất 10 giờ.
Hả??
Những mã cấp thấp trước đây cần kỹ sư phần mềm chip mò mẫm gỡ lỗi nhiều lần, giờ thực sự có thể giao cho AI rồi?

Thực sự không thể nói hoàn toàn là chiêu trò.
AI Agent quả thực rất phù hợp với loại nhiệm vụ lập trình có phản hồi rõ ràng này.
Mã có biên dịch được không, kết quả tính toán có đúng không, hiệu suất có tăng không, đều có thể có đáp án thông qua chạy thực tế.
Vì vậy, Agent có thể tạo thành một vòng lặp khép kín:
Viết mã → Biên dịch → Chạy → Kiểm tra tính đúng đắn và hiệu suất → Tiếp tục sửa đổi dựa trên phản hồi
Tuy nhiên, Infinity chủ yếu tấn công vào lớp đầu tiên của CUDA: tạo và tối ưu hóa Kernel suy luận (inference) cho các chip khác nhau, và xây dựng khả năng phần mềm cấp thấp xung quanh các Kernel này.
Họ đang phát triển một thư viện suy luận chung cho nhiều loại chip, nhưng điều này không có nghĩa là họ đã sao chép toàn bộ hệ sinh thái hoàn chỉnh tích lũy trong gần 20 năm của CUDA chỉ trong 10 giờ.
Nhưng...
Nhưng!
Bạn thực tế không cần sao chép một CUDA, vẫn có thể huy động được 15 triệu USD vốn đầu tư.

Định giá hiện tại của công ty này cũng đã lên tới 100 triệu USD.
Có đe dọa được NVIDIA hay không thì chưa biết, nhưng rõ ràng giới đầu tư khá là tin tưởng. (doge)
Mặt trận suy luận, chiến trường thứ hai khởi động!
Nếu nói AI Agent là vũ khí công thành, thì thị trường suy luận (inference) chính là khe hở trên tường thành.
Tính toán mô hình lớn chủ yếu chia làm hai giai đoạn:
Huấn luyện (training) là tạo mô hình, cần hàng chục nghìn card phối hợp chạy vài tháng; Suy luận (inference) là sử dụng mô hình đã huấn luyện để trả lời câu hỏi, một cụm nhỏ hoặc thậm chí card đơn cũng có thể chạy.
Ở mặt huấn luyện, CUDA hiện tại vẫn gần như vô địch.
Huấn luyện quy mô lớn cực kỳ nhạy cảm với hiệu suất, độ ổn định và sự phối hợp cụm. Giao tiếp giữa các chip, điều phối bộ nhớ, cách khôi phục khi chương trình lỗi, bất kỳ tổn thất hiệu suất nào, khi phóng đại lên hàng nghìn thậm chí hàng chục nghìn chip, đều sẽ trở thành thời gian và chi phí thực tế.
Vì vậy, doanh nghiệp lựa chọn nền tảng huấn luyện thường cực kỳ bảo thủ.
Các chip khác dù thông số trên giấy tốt, chỉ cần phần mềm chưa đủ chín muồi, cụm chưa đủ ổn định, chi phí phần cứng tiết kiệm được, rất có thể sẽ phải trả gấp bội từ chi phí phát triển và thử sai.
Nhưng ở mặt suy luận, luật chơi đã thay đổi.
Giám đốc thương mại của công ty chip AI Hàn Quốc Rebellions, Marshall Choy cho rằng:
Ở mặt suy luận, CUDA không còn là yếu tố quyết định. Đây sẽ là cuộc cạnh tranh của phần mềm mã nguồn mở.

Tại sao các đối thủ cạnh tranh đều nhắm vào suy luận?
Bởi vì huấn luyện quan tâm "hiệu suất tối đa", còn suy luận quan tâm là "chi phí cho mỗi câu trả lời".
Huấn luyện cần hàng chục nghìn card phối hợp, suy luận có thể chia nhỏ thành cụm nhỏ hoặc card đơn; huấn luyện không dám đổi chip, nhưng suu luận thì có thể.
Chỉ cần chạy được, rẻ, khách hàng sẵn sàng thử.
Quan trọng hơn, phần mềm suy luận có thể chạy đa nền tảng chip. Nếu framework suy luận có thể hỗ trợ nhiều loại chip, người dùng có thể chuyển đổi giữa các phần cứng khác nhau, không cần viết lại mã —
Hiệu ứng khóa chặt lớn nhất của CUDA, từ đó mất tác dụng.
Điều này mở ra cơ hội cho chip suy luận chuyên dụng.
Nhiệm vụ suy luận không nhất thiết cần toàn bộ khả năng từ huấn luyện đến phối hợp cụm của CUDA. Chip được thiết kế lại cho mô hình cụ thể, ngữ cảnh cụ thể, chỉ cần có thể chạy nhanh hơn, rẻ hơn hoặc tiết kiệm điện hơn, đã có cơ hội cắt một phần thị trường từ tay NVIDIA.
Ví dụ như d-Matrix, bản thân là một công ty chip chuyên về suy luận.

Công ty này thành lập năm 2019, chuyên tấn công chip suy luận AI sinh thành (generative AI).
Đồng sáng lập kiêm CEO Sid Sheth từng nhớ lại, họ sớm đánh giá, cơ hội do AI suy luận mang lại cuối cùng sẽ vượt qua huấn luyện.
Bộ phần mềm kiểu CUDA mà Infinity dùng AI Agent xây dựng trong 10 giờ, phục vụ chính là chip suy luận của d-Matrix.
Vậy là, câu chuyện hoàn chỉnh của "sự kiện 10 giờ" được kết nối:
Chip mới muốn vào thị trường suy luận, nhưng thiếu phần mềm chín muồi; AI Agent nhanh chóng tạo và tối ưu Kernel cấp thấp, nén công việc thích ứng vốn có thể mất vài tháng thậm chí vài năm xuống còn giờ hoặc ngày.
Sid còn tuyên bố thẳng:
Mặc dù NVIDIA duy trì vị thế chủ đạo trong lĩnh vực huấn luyện, nhưng ở mặt suy luận, hào phòng thủ đã bị suy yếu.

Không chỉ mình d-Matrix nhìn thấy khe hở này.
Rebellions chuyên về suy luận, d-Matrix, Cerebras đặt cược vào chip cấp wafer, Inferentia của Amazon, TPU của Google, MI300X của AMD......
Các hãng chip và gã khổng lồ điện toán đám mây, đã sớm bố trí binh lực trên thị trường suu luận, chuẩn bị cướp một miếng thịt từ tay NVIDIA.
Với những công ty này, họ không cần ngay lập tức thay thế NVIDIA.
Họ chỉ cần chứng minh, trong một số nhiệm vụ suy luận cụ thể, không phụ thuộc vào toàn bộ phần cứng và hệ sinh thái CUDA của NVIDIA, vẫn có thể chạy nhanh hơn hoặc rẻ hơn.
Thế là đủ.
Hào phòng thủ của NVIDIA, rốt cuộc có bị lật đổ không
Câu trả lời có thể là... còn lâu lắm.
Như đã nói ở trên, 10 giờ viết lại là "mã thích ứng cho một con chip", còn hệ sinh thái CUDA còn có 20 năm tích lũy thư viện, công cụ gỡ lỗi, cộng đồng, hàng triệu nhà phát triển.
Đây không phải là thứ có thể dễ dàng bị lật đổ.
Quan trọng hơn, mã có thể sinh ra, không có nghĩa là có thể dùng được.
Người sáng lập INT21 Bing Xu, công ty phần mềm chip AI trước đây HippoML bị NVIDIA mua lại, bản thân ông mới rời NVIDIA vào tháng 4 năm nay.

Nhận định của ông là: Agent có thể tạo ra lượng lớn mã trong thời gian ngắn, nhưng xác minh (verification) mới là nút thắt lớn nhất.
AI sinh ra mười nghìn dòng mã rất nhanh, nhưng "chứng minh mười nghìn dòng này trong các trường hợp biên khác nhau đều tính đúng, chạy ổn" thì cực kỳ chậm.
Tài sản sâu nhất của CUDA chính là chuỗi công cụ xác minh của nó — vì vậy ông cho rằng, thời đại Agent, hệ sinh thái xác minh sẽ trở thành hào phòng thủ tiếp theo của CUDA.
Đồng sáng lập kiêm CEO của Modular, Chris Lattner, cũng hắt một gáo nước lạnh.

Ông cho rằng cải tiến do Agent mã hóa mang lại là từ từ, "sự cường điệu bị phóng đại nghiêm trọng".
Lý do có ba: Thứ nhất, viết mã chỉ là một phần nhỏ của kỹ thuật phần mềm, tối ưu hóa cấp sản xuất mới quyết định hiệu suất chip, trực tiếp quyết định chi phí chạy AI;
Thứ hai, phần mềm chip là lĩnh vực tinh anh nhỏ, mã công khai ít hơn nhiều so với phát triển ứng dụng, dữ liệu huấn luyện AI có thể học trong lĩnh vực này vốn đã ít;
Thứ ba, chi phí di chuyển hàng triệu dòng mã hiện có vẫn còn, đây không phải là vấn đề kỹ thuật có thể giải quyết, mà thuộc về quyết định tổ chức.
Còn một điểm dễ bị bỏ qua là: Chính NVIDIA cũng đang sử dụng AI.
Phó chủ tịch hệ sinh thái nhà phát triển NVIDIA, Ankit Patel cho biết:
Chúng tôi cũng đang sử dụng AI Agent để phát triển CUDA nhanh hơn, và xác minh trên quy mô lớn hơn.
Dùng mâu của mình, đâm thuẫn của đối phương, lợi thế tương đối của bên tấn công cũng sẽ giảm.
Bing Xu tổng kết lại: Thắng thua của trận chiến này, phụ thuộc vào tốc độ đối thủ cạnh tranh đuổi kịp NVIDIA, có nhanh hơn tốc độ tự lặp lại của NVIDIA hay không.
Nhưng rõ ràng, nhà sản xuất chip lớn nhất thế giới này, "không ngủ hay giậm chân tại chỗ".
Tóm lại, trong ngắn hạn hào phòng thủ của NVIDIA vẫn an toàn, nhưng biến đổi sẽ âm thầm xảy ra trước ở mặt suy luận.
Ẩn số thực sự dài hạn là: Hào phòng thủ đang di chuyển từ "lượng mã tích lũy" sang "hệ sinh thái xác minh và tối ưu hóa".
Ai chiếm vị trí mới trước, người đó mới là người chiến thắng tiếp theo.
Tham khảo liên kết:[1]https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8
Bài viết từ tài khoản công chúng WeChat "Quantum Bit", tác giả: Ting Yu






