Công ty AMD đã đồng ý mua lại công ty khởi nghiệp Taalas ở Toronto, công ty này giải quyết vấn đề chính của việc suy luận mạng nơ-ron – nhu cầu liên tục truyền các trọng số của mô hình từ bộ nhớ vào bộ xử lý để tạo ra mỗi token. Các chip của Taalas không cần thao tác này: trọng số mô hình thực sự được "hàn" vào các bóng bán dẫn. Chính việc truyền dữ liệu này làm hạn chế tốc độ suy luận hiện đại và biến bộ nhớ có băng thông cao (HBM) thành mặt hàng khan hiếm nhất trong ngành công nghiệp bán dẫn.
Thỏa thuận sẽ được coi như một vòng cạnh tranh khác giữa AMD và Nvidia trong lĩnh vực suy luận AI, nhưng ở mặt trận này nó thay đổi rất ít. Điều thú vị hơn là vụ mua lại nói lên tình trạng của thị trường bộ nhớ – giao dịch nóng nhất trong bán dẫn hiện nay.
Taalas đã tạo ra cái gì
Taalas được thành lập vào năm 2023 bởi Ljubisa Bajic, người trước đó đã sáng lập công ty chip Tenstorrent, và vợ ông là Lejla Bajic, một cựu chiến binh của các bộ phận kỹ thuật ATI và AMD, người đã đảm nhận vị trí Giám đốc điều hành. Công ty đã huy động được 219 triệu USD từ Fidelity, Quiet Capital và nhà đầu tư bán dẫn Pierre Lamond – số tiền này được dùng để phát triển cái gọi là mạch tích hợp chuyên dụng cho một mô hình cụ thể.
Chip thử nghiệm đầu tiên, được sản xuất theo quy trình công nghệ 6 nanomet của TSMC, phục vụ mô hình Llama 3.1 8B của Meta với tốc độ 16.960 token mỗi giây. Theo tuyên bố của công ty, điều này nhanh hơn 48 lần so với card đồ họa Nvidia và nhanh hơn 8,5 lần so với bộ tăng tốc Cerebras tại thời điểm so sánh. Chip thế hệ thứ hai, được thiết kế cho các mô hình với 20 tỷ tham số, dự kiến ra mắt trong năm nay.
Kiến trúc được chia thành hai khu vực: vùng mà trọng số mô hình được ghi cứng dưới dạng bộ nhớ ROM mặt nạ, và bộ nhớ SRAM thông thường cho bộ nhớ đệm và các bộ điều chỉnh tinh chỉnh, những thứ vẫn có thể thay đổi. "Chính việc lập trình cứng này phần nào mang lại cho chúng tôi tốc độ," Bajic nói với The Next Platform vào tháng Hai.
AMD dự định tích hợp chip Taalas vào các giá Helios theo sơ đồ phân chia: bộ tăng tốc Instinct sẽ xử lý prompt, còn chip Taalas sẽ tạo token, tất cả dưới sự quản lý của ngăn xếp phần mềm ROCm. Công ty nhấn mạnh rằng đây là một vụ sáp nhập, không phải tuyển dụng nhóm – việc hoàn tất thỏa thuận dự kiến vào quý IV. Phó chủ tịch cấp cao phụ trách AI của AMD, Vamsi Boppana, mô tả vụ mua lại như một sự mở rộng nền tảng.
Sự thỏa hiệp mà Taalas chấp nhận
Việc hàn trọng số vào chip có một cái giá hiển nhiên: mỗi chip chỉ phục vụ đúng một mô hình – vĩnh viễn. Việc thay đổi mô hình yêu cầu tính toán lại một phần cấu trúc liên kết, và ngay cả với chu kỳ rút ngắn của Taalas, khi chỉ thay đổi hai lớp kim loại trên một wafer gần như hoàn chỉnh, điều này cũng mất khoảng hai tháng tại các cơ sở của TSMC. Các mô hình hàng đầu được cập nhật nhanh hơn. Sự đánh cược này chỉ có lợi ở những nơi mô hình ổn định, được sử dụng rộng rãi và đủ giá trị để đóng băng.
Chính sự thỏa hiệp này cũng giải thích tại sao thỏa thuận không thay đổi thế trận trên thị trường suy luận AI. Nvidia đã trả 20 tỷ USD cho Groq vào tháng 12 – vụ mua lại lớn nhất trong lịch sử của họ – để tích hợp phần cứng chuyên dụng tạo token vào chính nền tảng mà toàn bộ ngành công nghiệp đã được xây dựng xung quanh. Cuộc chiến cho suy luận AI diễn ra ở cấp độ hệ sinh thái và phần mềm đã được triển khai, và một chip bị ràng buộc với một mô hình không tham gia vào cả hai điều đó. Điều mà cách tiếp cận của Taalas thực sự chứng minh là một luận điểm hẹp hơn nhưng thú vị hơn: hạn chế về bộ nhớ gây khó khăn cho suy luận AI – đó là một giải pháp kỹ thuật, không phải là một thực tế vật lý bất biến, và nó có thể được khắc phục.
Vấn đề bộ nhớ
Thị trường hiện đang định giá dựa trên giả định rằng tình trạng thiếu hụt bộ nhớ này là vĩnh viễn. Giá DRAM thông thường đã tăng gần 90% trong quý I. Bộ nhớ có băng thông cao (HBM) thực tế đã được bán hết cho đến hết năm 2026, và quy mô thị trường HBM năm nay dự kiến đạt 54,6 tỷ USD. SK hynix, công ty kiểm soát hơn một nửa nguồn cung HBM, đã vượt mức vốn hóa thị trường 1 nghìn tỷ USD và công bố kế hoạch xây dựng các nhà máy mới trị giá 38,1 tỷ USD. Đối với một nhà đầu tư bình thường, toàn bộ cược vào bộ nhớ dựa trên một giả định duy nhất: nhu cầu AI sẽ giữ cho bộ nhớ tiếp tục khan hiếm trong nhiều năm tới.
Giả định này đang bị tấn công từ nhiều phía. Taalas hoàn toàn loại bỏ bộ nhớ cho trọng số khỏi quá trình phục vụ mô hình, trong khi các kỹ sư của Nvidia nén và lượng tử hóa mô hình chính xác là để giảm dung lượng bộ nhớ mà một mô hình triển khai sử dụng.
Bản thân các nhà sản xuất bộ nhớ cũng đang làm việc theo hướng tương tự. Công nghệ zHBM của Samsung, được giới thiệu tại hội nghị FMS tuần trước, xếp trực tiếp bộ nhớ lên bộ tăng tốc, nhân băng thông hiệu quả. SK hynix và Sandisk vừa công bố tiêu chuẩn đầu tiên cho bộ nhớ flash tốc độ cao, nhắm mục tiêu thay thế NAND giá rẻ cho công việc mà HBM đang thực hiện ngày nay. Hầu như mọi công ty lớn trong ngành đều đang tài trợ cho cách riêng của họ để giảm nhu cầu về chính tài nguyên mà thị trường coi là khan hiếm vĩnh viễn.
AMD đã mua bằng chứng cho thấy suy luận AI có thể hoạt động mà không cần truy cập vào thành phần mà sự khan hiếm của nó đang định hình toàn bộ chu kỳ nhu cầu AI hiện tại – và sẽ bán bằng chứng này bên trong các giá đỡ nơi vẫn có GPU và HBM. Các nhà đầu tư, những người coi giá bộ nhớ hiện tại là một đặc điểm cố định của toàn bộ chu kỳ xây dựng cơ sở hạ tầng AI, đang đặt cược chống lại một phong trào kỹ thuật quy mô lớn và ngày càng tăng, nhằm mục tiêu đạt được kết quả ngược lại.
Bộ nhớ luôn là một ngành kinh doanh có tính chu kỳ. Những người trả giá cho nó hôm nay vừa mới tài trợ cho một lý do nữa tại sao điều này sẽ vẫn tiếp tục như vậy.
Ý kiến AI
Từ góc độ phân tích dữ liệu máy móc, tiền lệ chính cho chip Taalas có thể được tìm thấy không phải trong thế giới AI, mà là trong ngành công nghiệp tiền điện tử. Các mạch tích hợp chuyên dụng để khai thác bitcoin giải quyết một nhiệm vụ tương tự – hàn thuật toán vào chip để đạt tốc độ – và gặp phải tác dụng phụ tương tự: hoàn toàn không linh hoạt. Hash Telegraph đã mô tả cách sự chuyên môn hóa phần cứng, được đẩy đến cực hạn, tạo ra rủi ro lỗi thời về mặt đạo đức khi thuật toán cơ bản thay đổi hoặc xuất hiện một mô hình tính toán mới.
Các khía cạnh kỹ thuật mà bài viết không đề cập chi tiết liên quan đến kinh tế của thời gian chờ: trong khi chip Taalas phục vụ một mô hình, các phòng thí nghiệm cạnh tranh phát hành các phiên bản mới vài tháng một lần, và chu kỳ lập trình lại cấu trúc liên kết mất khoảng hai tháng tại các cơ sở của TSMC. Lịch sử của ASIC cho thấy sự chuyên môn hóa chỉ có lợi trên một thuật toán ổn định – câu hỏi là liệu kiến trúc của các mô hình ngôn ngữ lớn có đủ ổn định cho sự đánh cược này hay không.






