Chỉ một câu nói, một ngày cuối tuần, Claude đã trực tiếp đưa mô hình tiên tiến nhất của hãng chạy trên một dàn máy AMD MI355X hoàn toàn mới!
Kỹ sư con người không cần sửa một dòng code nào.
Ai ngờ, thành lũy CUDA mà NVIDIA xây đắp suốt 20 năm, lại bị vượt qua dễ dàng như vậy.

Một cuối tuần, Claude "khởi động" GPU mới của AMD
Câu chuyện là thế này.
Hồi trước, AMD gửi đến Anthropic một dàn máy trang bị MI355X.
Đội ngũ xem xong, trong lòng đã chuẩn bị tinh thần cho một trận chiến khó khăn. Nền tảng mới đi kèm chồng phần mềm mới, chắc chắn cần một đợt tương thích mới.
Tuy nhiên, Anthropic tay trên đã có Claude.
Đội ngũ quyết định để một kỹ sư thử trước: kết nối Claude với máy, và ném cho nó một câu: "Đi, khởi động dàn máy này đi."
Khi kết thúc cuối tuần quay lại bàn làm việc, trên màn hình đã xuất hiện một đường cong hiệu suất liên tục tăng — không chỉ chạy được mà hiệu suất còn không ngừng được cải thiện qua từng vòng lặp.
Tom Brown, Đồng sáng lập kiêm Giám đốc Điều hành Tính toán của Anthropic kể xong, Lisa Su (Tổng giám đốc AMD) lập tức tiếp lời:
Khi nghe nói Anthropic chỉ có một kỹ sư xử lý MI355X, phản ứng đầu tiên của bà là yêu cầu đội ngũ AMD lập tức qua hỗ trợ.
Kết quả, đội ngũ quay lại báo cáo với bà, đối phương nói không cần, mọi thứ đã xong xuôi cả rồi.

Chẳng mấy chốc, thí nghiệm cuối tuần này đã được kết nối với kế hoạch triển khai thực tế.
Ngay gần đây, Anthropic tuyên bố sẽ triển khai tối đa 2GW GPU Instinct trong hệ thống AMD Helios, với 1GW đầu tiên dự kiến khởi động vào nửa đầu năm 2027.
Và cả hai bên sẽ trực tiếp sử dụng Claude để tối ưu hóa khối lượng công việc của AMD, tăng tốc phát triển phần mềm ROCm.
Sách hướng dẫn chip, chào đón một độc giả phi nhân loại
Claude có thể thực hiện "đòn tấn công giảm chiều" vào hệ sinh thái CUDA là vì AMD đã trực tiếp phát triển cho AI một bộ công cụ có thể điều chỉnh GPU.
ROCm.AI được công bố tại hội nghị AMD Advancing AI 2026, chính là bộ công cụ GPU hoàn chỉnh dành cho Claude, Codex và Cursor.
Cổng vào gọi là AMD Skills, bên trong chứa đầy kiến thức ROCm đã được xác minh.
Sau khi nhận được kiến thức này, Agent có thể tự cài đặt môi trường, triển khai mô hình, đọc nhật ký, kiểm tra lỗi, sau đó thông qua ROCm CLI gọi máy thật. Nhà phát triển chỉ cần nêu mục tiêu, phần đường còn lại để Agent tự tìm.

Điểm nhấn, AMD thậm chí còn thay đổi cách viết sách hướng dẫn chip.
Phó chủ tịch phụ trách Phần mềm AI & Giải pháp của công ty, Anush Elangovan tiết lộ tại hiện trường, mỗi thế hệ GPU AMD sẽ công khai tập lệnh (ISA), và cung cấp ISA mà AI có thể đọc được.
Sau khi đọc hiểu sách hướng dẫn, Agent có thể trực tiếp bắt tay vào điều chỉnh hiệu suất.
AMD giao phần công việc này cho Hyperloom. Nó sẽ khởi động dịch vụ suy luận, chạy ra đường cơ sở, sau đó đi tìm nút cổ chai ở CPU và GPU, thử nghiệm các cấu hình khác nhau, tạo ra hạt nhân tùy chỉnh, cuối cùng chạy lại phương án mới.
Trong buổi trình diễn trực tiếp, Hyperloom đã nâng tốc độ đầu ra của mô hình MiniMax M3 lên 38%. AMD còn để nó chạy qua một lúc 14.000 mô hình, kết tủa kết quả thử nghiệm thành kinh nghiệm có thể tái sử dụng trực tiếp cho lần sau.

AMD còn đang cùng các công ty mô hình tiên phong huấn luyện khả năng này. Nguyên văn lời Elangovan rất thú vị: để các mô hình tiên phong "sinh ra đã biết lập trình AMD".
Sau này khi nhìn một con chip, hiệu suất tính toán đỉnh và băng thông bộ nhớ tất nhiên quan trọng, nhưng AI có thể đọc hiểu nó, gọi nó, điều chỉnh được hiệu suất của nó hay không, cũng sẽ được đặt lên cùng một bảng thông số.
Nhà phát triển mà các công ty chip cần tranh thủ, giờ đây đã thêm một loại: Agent.
Đòn tấn công giảm chiều từ ASI
CUDA từ năm 2006 bước đi đến ngày nay, dựa vào hệ sinh thái được hàng vạn kỹ sư viết từng dòng code xây dựng nên.
Trình biên dịch, thư viện toán học, công cụ gỡ lỗi, công cụ phân tích hiệu suất, tài liệu phát triển, cái gì cũng có.
Khó sao chép hơn, là cảm giác tích lũy qua bao thế hệ kỹ sư.
Điều chỉnh toán tử thế nào, tăng tốc truyền thông ra sao, phân bổ bộ nhớ như thế nào, chỗ nào dễ xảy ra vấn đề nhất khi triển khai phân tán, những kinh nghiệm này đều bị khóa trong đầu của số ít chuyên gia.
Người đến sau dù chế tạo được chip có hiệu năng tương đương, cũng phải đi lại con đường phần mềm dài đằng đẵng này từ đầu. Sản xuất chip có thể tiến triển theo quý, nhưng tích lũy hệ sinh thái chỉ có thể "ngâm" theo năm.
Mà Agent bù đắp chính là đoạn đường này.
Nó sẽ đọc tài liệu nền tảng, gọi công cụ phân tích hiệu suất, tìm xem tốc độ bị nghẽn ở đâu, sau đó sửa code, biên dịch, kiểm tra. Một phương án không hiệu quả thì đổi phương án khác; điểm chuẩn tốt hơn thì tiếp tục tối ưu theo hướng đó.
Con người đào tạo một kỹ sư GPU đỉnh cao phải tính theo năm, khởi động thêm một Agent chỉ cần mở thêm một nhiệm vụ.
Một kỹ sư thả ra một đàn Agent, là có thể kiểm tra lỗi song song, định vị nút cổ chai hiệu suất. Cấu hình chạy thông một lần, hạt nhân viết xong, lỗi đã gặp phải, cũng có thể ngay lập tức trở thành điểm khởi đầu cho lô Agent tiếp theo.
Nén quá trình đuổi kịp tính bằng năm thành tính bằng nhiệm vụ, giá trị nhất của AI chính là ở chỗ này. Đây cũng là đòn tấn công giảm chiều kiểu ASI đối với hệ sinh thái CUDA.
Ngày nay, kỹ sư Trung Quốc đã đứng ở tuyến đầu của cuộc cải tạo chồng phần mềm GPU bằng AI này, kinh nghiệm tầng sâu họ tích lũy, cũng đang được tổng hợp thành nhiều năng lực hơn mà Agent có thể gọi.
Điểm khởi đầu mới để đuổi kịp CUDA đã xuất hiện: giao giao diện phần cứng và công cụ phần mềm cho AI, để Agent trực tiếp bắt tay vào việc.
Khoảng cách hệ sinh thái 20 năm, lần đầu tiên có thể giao cho một đàn Agent ngày đêm không ngừng đuổi ngược trở lại.
Bài viết từ tài khoản công chúng WeChat "Trí Nguyên Mới" (新智元), tác giả: ASI Khải Thị Lục (ASI启示录)








