# Bài viết Liên quan Suy luận

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Suy luận", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Vượt qua "Bức tường Bộ nhớ": Cuộc Cách mạng ở Cấp độ Wafer và Lộ trình Tính toán trong Thời đại Suy luận AI

Năm 2026, chi phí đầu tư cho suy luận AI của các nhà cung cấp điện toán đám mây quy mô lớn lần đầu tiên vượt quá chi phí cho huấn luyện, đánh dấu bước chuyển từ "luyện mô hình lớn" sang "sử dụng mô hình lớn". Trong thời đại suy luận, điểm nghẽn chính chuyển sang "tường bộ nhớ" (memory wall), nơi chi phí và độ trễ di chuyển dữ liệu giữa GPU và DRAM (như HBM) vượt xa bản thân tính toán. Cerebras Systems, với kiến trúc động cơ quy mô wafer (WSE), đề xuất một giải pháp triệt để: thay vì cắt một tấm wafer thành nhiều chip nhỏ, họ sử dụng gần như toàn bộ wafer làm một chip khổng lồ duy nhất. Chip WSE-3 mới nhất cung cấp băng thông bộ nhớ trên chip cực cao nhờ 44GB SRAM, lên tới 21 PB/s, cao hơn 2625 lần so với GPU B200 của NVIDIA, giúp giảm đáng kể độ trễ trong suy luận mô hình lớn. Trong kiến trúc của Cerebras, trọng số mô hình được lưu trữ bên ngoài trên MemoryX và được truyền theo từng lớp đến chip khi cần, cho phép thông lượng token nhanh hơn từ 1.5 đến 5 lần so với B200 trong các mô hình khác nhau. Nó cũng có lợi thế lớn về hiệu suất năng lượng cho kết nối trên chip. Tuy nhiên, Cerebras phải đối mặt với những thách thức: lợi thế SRAM có thể chạm trần vật lý do giới hạn thu nhỏ theo tiến trình bán dẫn, yêu cầu hệ thống làm mát chuyên dụng, băng thông I/O ra bên ngoài thấp gây khó khăn cho mở rộng quy mô lớn, và hệ sinh thái phần mềm độc quyền. Các gã khổng lồ công nghệ đang theo đuổi nhiều con đường khác để giải quyết điểm nghẽn suy luận, bao gồm tự phát triển ASIC (như TPU, Maia), tận dụng công nghệ đóng gói tiên tiến phổ biến (như SoW của TSMC), và khám phá kết nối/quang học. Áp lực thương mại cũng rất lớn, khi Cerebras phải chuyển đổi thành nhà cung cấp dịch vụ đám mây và triển khai năng lực trung tâm dữ liệu khổng lồ theo các hợp đồng. Tóm lại, cuộc đua kiến trúc suy luận AI là về sự đánh đổi: Cerebras tối ưu hóa cực độ cho độ trễ thấp trên một wafer, trong khi NVIDIA duy trì tính linh hoạt và thông lượng cao thông qua kiến trúc cụm GPU. Tương lai của cả hai hướng đi vẫn chưa được định đoạt, phụ thuộc vào sự phát triển của tải công việc và công nghệ.

marsbit06/05 11:10

Vượt qua "Bức tường Bộ nhớ": Cuộc Cách mạng ở Cấp độ Wafer và Lộ trình Tính toán trong Thời đại Suy luận AI

marsbit06/05 11:10

CPU, lặng lẽ trở lại vị trí trung tâm của sân khấu tính toán AI

Trong ba năm qua, AI đều xoay quanh GPU, nhưng câu chuyện bắt đầu thay đổi từ năm 2026. Intel ra mắt Xeon 6+ với 288 lõi E-core, tập trung vào tính toán mật độ cao, hiệu quả năng lượng cho tải công việc suy luận AI và tác nhân thông minh. Báo cáo từ SemiAnalysis chỉ ra rằng, khi AI chuyển từ đào tạo sang triển khai hàng loạt, các nhiệm vụ như điều phối, xử lý luồng dữ liệu và quản lý đồng thời trở thành nút thắt mới – lĩnh vực mà CPU tỏ ra vượt trội hơn GPU. Xeon 6+ được sản xuất trên quy trình Intel 18A, đánh dấu sự trở lại của Intel trong cuộc đua CPU máy chủ mật độ cao, cạnh tranh với AMD Bergamo và CPU tự nghiên cứu dựa trên ARM của các nhà cung cấp đám mây. Tuy nhiên, câu chuyện “CPU trở lại” vẫn đối mặt với thách thức từ NVIDIA (với giải pháp CPU+GPU tích hợp) và làn sóng tự nghiên cứu CPU của các gã khổng lồ đám mây. Tóm lại, CPU đang tìm thấy vị trí mới quan trọng với tư cách là “mặt phẳng điều khiển” trong cơ sở hạ tầng AI, chứ không phải là sự thay thế cho GPU. Sự thành công của Intel phụ thuộc vào hiệu suất của quy trình 18A và khả năng chiếm lĩnh thị trường bên ngoài các CPU tự nghiên cứu của nhà cung cấp đám mây. Cuộc cạnh tranh định hình lại vai trò của CPU trong kỷ nguyên AI vẫn đang tiếp diễn.

marsbit06/03 10:44

CPU, lặng lẽ trở lại vị trí trung tâm của sân khấu tính toán AI

marsbit06/03 10:44

Chạy MoE trên điện thoại? Meta đề xuất MobileMoE, iPhone 16 Pro tăng tốc đến 3.8 lần

Trong những năm gần đây, Mô hình Chuyên gia Hỗn hợp (MoE) đã được sử dụng rộng rãi cho các mô hình lớn trên đám mây. Tuy nhiên, trên điện thoại, Kiến trúc Ngôn ngữ Lớn (LLM) vẫn chủ yếu sử dụng kiến trúc dày đặc. Meta đã đề xuất MobileMoE, lần đầu tiên triển khai suy luận MoE hiệu quả trên điện thoại thông minh thương mại. Kết quả cho thấy, trên 14 bài kiểm tra cơ bản, MobileMoE-S/M đạt độ chính xác trung bình tương đương hoặc cao hơn với chỉ 1/2 đến 1/4 lượng tính toán suy luận so với mô hình dày đặc cơ sở, trong khi sử dụng bộ nhớ tương tự. Trong thử nghiệm thực tế, MobileMoE-S trên iPhone 16 Pro (backend GPU/MLX) tăng tốc độ đáng kể, tăng tốc lên đến 3.8 lần trong giai đoạn đầu vào. MobileMoE là một loại mô hình ngôn ngữ MoE được thiết kế cho triển khai trên thiết bị đầu cuối, thay thế các lớp feed-forward dày đặc bằng các lớp MoE trong kiến trúc Transformer decoder-only. Quy trình đào tạo bao gồm bốn giai đoạn: tiền đào tạo, đào tạo trung gian, tinh chỉnh có giám sát và đào tạo nhận thức lượng tử hóa. Các thí nghiệm cho thấy cấu hình tối ưu sử dụng 8 chuyên gia (E=8), độ hạt chuyên gia 8 (g=8), với một chuyên gia được chia sẻ. MobileMoE thiết lập một biên giới Pareto mới cho LLM trên thiết bị đầu cuối, cân bằng tốt hơn giữa độ chính xác và chi phí suy luận. Sau khi lượng tử hóa INT4, mô hình vẫn duy trì tính cạnh tranh. Khi triển khai trên Samsung Galaxy S25 và iPhone 16 Pro, MobileMoE-S cho thấy tốc độ nhanh hơn đáng kể và mức sử dụng bộ nhớ thấp hơn so với các mô hình so sánh. Hướng phát triển trong tương lai bao gồm củng cố quá trình hậu đào tạo, mở rộng đa phương thức và tối ưu hóa việc triển khai trên NPU di động để tiếp tục cải thiện hiệu quả.

marsbit06/01 06:11

Chạy MoE trên điện thoại? Meta đề xuất MobileMoE, iPhone 16 Pro tăng tốc đến 3.8 lần

marsbit06/01 06:11

Việc giảm giá 99% của Xiaomi MiMo không phải là chiêu trò marketing! Luo Fuli đăng X để phản bác những kẻ bi quan

Trong bài viết, tác giả phân tích động thái giảm giá API lên tới 99% cho dòng MiMo-V2.5 của Xiaomi và phản bác các ý kiến cho rằng đây chỉ là chiến lược marketing hay "bán lỗ cướp thị trường". Lộ Phúc Lợi, người đứng đầu MiMo, đã công bố một blog kỹ thuật dài 5000 chữ để giải thích cơ sở kỹ thuật của mức giá mới. Bài viết mô tả sáu trụ cột công nghệ chính cho phép mức giảm giá này: 1. **Kiến trúc Hybrid SWA (Sliding Window Attention):** Giảm dung lượng bộ nhớ tạm (KVCache) xuống còn 1/7 so với Full Attention truyền thống. 2. **Quản lý KVCache hai bể riêng biệt:** Tối ưu hóa việc phân bổ bộ nhớ để triệt để tận dụng lợi thế của SWA, tăng gấp 5 lần số lượng người dùng đồng thời. 3. **Hệ thống tiền tố cache được cải tiến:** Đảm bảo an toàn và nâng cao tỷ lệ trúng cache lên tới 93-95%, khiến phần lớn yêu cầu đọc lặp lại hầu như không cần tính toán lại. 4. **Hệ thống lưu trữ phân tán GCache:** Triển khai trực tiếp trên ổ SSD của máy GPU, giảm chi phí lưu trữ xuống gần bằng 0. 5. **Hệ thống điều phối LLM-Router:** Tối ưu định tuyến và lập lịch, ưu tiên các yêu cầu có cache, tăng hiệu suất tổng thể. 6. **Dự đoán đa token (MTP):** Giảm chi phí tạo văn bản (output), hoàn thiện vòng tròn giảm chi phí cho toàn bộ quá trình xử lý. Những cải tiến này, khi kết hợp, tạo ra một chuỗi tối ưu toàn diện làm giảm đáng kể chi phí tính toán và lưu trữ cho mỗi yêu cầu. Bài viết kết luận rằng mức giảm 99% không phải là con số tiếp thị, mà là kết quả có thể chứng minh của một hệ thống kỹ thuật hoàn chỉnh, một phương pháp giảm chi phí đáng để ngành tham khảo.

marsbit05/31 10:39

Việc giảm giá 99% của Xiaomi MiMo không phải là chiêu trò marketing! Luo Fuli đăng X để phản bác những kẻ bi quan

marsbit05/31 10:39

Triết lý đầu tư của Gavin Baker - nhà đầu tư sớm vào NVIDIA: Mua vào nút cổ chai hạ tầng AI, phòng hộ rủi ro thị trường chung

Bài viết tổng hợp quan điểm đầu tư của Gavin Baker, người sáng lập Atreides Management và là nhà đầu tư sớm vào Nvidia. Ông tin rằng AI không phải bong bóng mà đang trong một siêu chu kỳ cơ sở hạ tầng, thúc đẩy bởi các nút thắt cổ chai vật lý như điện năng, wafer bán dẫn và sức mạnh tính toán. Lợi nhuận vượt trội, theo ông, nằm ở các công ty cung cấp "công cụ" như kết nối GPU, bộ nhớ, chip suy luận, quy trình sản xuất tiên tiến và nguồn cung điện, chứ không phải ở các mô hình lớn hay chatbot. Chiến lược của Baker là "mua cổ phần các tài sản thắt cổ chai AI, bảo vệ trước rủi ro thị trường". Ông tập trung đầu tư vào các công ty như Astera Labs, Micron, Nvidia, Cerebras, Positron và Unity, đồng thời sử dụng quyền chọn bán QQQ để phòng ngừa sự điều chỉnh chung của thị trường. Ông lập luận rằng chu kỳ AI hiện tại khác với bong bóng dot-com vì được các công ty lớn, thông minh nhất tài trợ bằng tiền mặt, không phải bằng đòn bẩy nợ. Hơn nữa, các ràng buộc về nguồn cung vật lý từ các công ty như TSMC và ASML ngăn cản việc mở rộng quá nhanh và tạo bong bóng. Các xu hướng chính ông nhắm đến bao gồm mô hình ngôn ngữ nhỏ chuyên ngành, cơ sở hạ tầng chủ quyền, chuyển dịch sang suy luận và hậu đào tạo, cũng như kết hợp năng lượng và không gian.

marsbit05/30 03:27

Triết lý đầu tư của Gavin Baker - nhà đầu tư sớm vào NVIDIA: Mua vào nút cổ chai hạ tầng AI, phòng hộ rủi ro thị trường chung

marsbit05/30 03:27

Phân Tích Triết Lý Đầu Tư Của Gavin Baker - Nhà Đầu Tư Sớm Vào NVIDIA: Mua Vào Các Nút Thắt Của Hạ Tầng AI, Bán Khống Rủi Ro Thị Trường Tổng Thể

**Tóm tắt: Triết lý đầu tư của Gavin Baker - Đầu cơ hạ tầng AI, phòng ngừa rủi ro thị trường** Gavin Baker, nhà đầu tư sớm vào NVIDIA, tin rằng AI không phải bong bóng mà đang ở trong một siêu chu kỳ cơ sở hạ tầng. Lợi nhuận lớn nhất không đến từ các mô hình lớn hay chatbot, mà từ các "người bán xẻng" giải quyết các nút cổ chật vật lý: **điện năng, wafer bán dẫn và sức mạnh tính toán (token)**. Ông nhấn mạnh hai ràng buộc then chốt kìm hãm sự bùng nổ thiếu kiểm soát: **nguồn cung điện và năng lực sản xuất chip (thông qua TSMC, ASML)**. Chừng nào các nút cổ chật này còn tồn tại, vốn đầu tư vào AI sẽ khó tạo thành bong bóng như dot-com năm 2000, vì lần này được dẫn dắt bởi các công ty lớn dùng tiền mặt, không phải đòn bẩy nợ. **Chiến lược đầu tư của Baker là "đầu cơ nút cổ chật, phòng ngừa rủi ro thị trường":** * **Đầu tư mạnh (Long):** Tập trung vào các công ty giải quyết điểm nghẽn trong hạ tầng AI, như **Astera Labs** (kết nối GPU), **Micron** (bộ nhớ), **NVIDIA**, **Cerebras & Positron** (chip suy luận/inference), và **Unity** (động cơ mô phỏng cho world models). Ông cũng lạc quan về **mô hình nhỏ chuyên ngành (SLM)** và **cơ sở hạ tầng chủ quyền**. * **Phòng ngừa rủi ro (Hedge):** Sở hữu **quyền chọn bán (put) QQQ** để bảo vệ danh mục trước nguy cơ sụt giảm chung của thị trường, phản ánh quan điểm thận trọng với toàn bộ thị trường dù vẫn tin tưởng vào AI. Tóm lại, Baker xem cơ hội trong các hạn chế vật lý. Khi nhu cầu AI tăng theo cấp số nhân nhưng nguồn cung điện và chip bị giới hạn, những công ty tháo gỡ được các điểm nghẽn này sẽ nắm giữ chìa khóa cho siêu chu kỳ AI và tạo ra lợi nhuận vượt trội.

marsbit05/29 08:37

Phân Tích Triết Lý Đầu Tư Của Gavin Baker - Nhà Đầu Tư Sớm Vào NVIDIA: Mua Vào Các Nút Thắt Của Hạ Tầng AI, Bán Khống Rủi Ro Thị Trường Tổng Thể

marsbit05/29 08:37

Trí Phổ Dựa Vào Đâu Để Tăng Gần 30% Trong Một Ngày?

Hôm nay, cổ phiếu của "cổ phiếu mô hình lớn toàn cầu đầu tiên" Zhipu AI (02513.HK) đã bùng nổ. Động lực chính đến từ một thông số kỹ thuật cụ thể: Tốc độ đầu ra API của phiên bản cao tốc GLM-5.1 (GLM-5.1-highspeed) đạt 400 token/giây, thiết lập kỷ lục mới về tốc độ API trong ngành công nghiệp mô hình lớn toàn cầu. Tốc độ 400 token/giây này quan trọng như thế nào? Khi AI chuyển từ ChatBot sang thời đại Agent, mỗi tác vụ thường yêu cầu hàng chục hoặc thậm chí hàng trăm lần gọi mô hình. Độ trễ thấp ở đây trở thành yếu tố then chốt, trực tiếp ảnh hưởng đến trải nghiệm người dùng và hiệu quả công việc. Tốc độ này nhanh gấp khoảng 3-5 lần so với các mô hình hàng đầu hiện tại như GPT-4o hay Claude Sonnet. Để đạt được bước đột phá này, Zhipu AI đã thực hiện những đổi mới đồng thời trên ba cấp độ: 1. **TileRT – Công cụ suy luận:** Biên dịch toàn bộ mô hình thành một động cơ chạy liên tục, loại bỏ chi phí khởi động và chờ đợi lặp đi lặp lại giữa các toán tử, cho phép GPU duy trì hoạt động ở tốc độ cao. 2. **Chiến lược song song:** Tối ưu hóa việc triển khai cơ chế chú ý MLA (Multi-head Latent Attention) của GLM-5.1 trên nhiều GPU. Họ áp dụng kiến trúc chạy không đồng nhất, trong đó GPU 0 chuyên xử lý chỉ mục thưa thớt và định tuyến, trong khi các GPU khác xử lý tính toán dày đặc, giảm thiểu đáng kể chi phí giao tiếp. 3. **Kiến trúc mạng ZCube:** Một thiết kế mạng mới thay thế cấu trúc ROFT (Fat-Tree) truyền thống. ZCube loại bỏ lớp Spine (xương sống), làm phẳng toàn bộ mạng và kết nối tất cả các bộ chuyển mạch Leaf (lá) theo một cấu trúc đặc biệt. Thiết kế này đảm bảo rằng giữa hai GPU bất kỳ chỉ có một đường dẫn tối ưu duy nhất, về cơ bản loại bỏ khả năng tắc nghẽn mạng do cân bằng tải không hiệu quả. Những cải tiến này mang lại lợi ích rõ ràng: cụm sản xuất nâng cấp lên ZCube đạt được mức tăng 15% thông lượng, giảm 40.6% độ trễ đuôi và giảm khoảng một phần ba chi phí thiết bị mạng. Về lâu dài, công nghệ này không chỉ nâng cao hiệu quả sử dụng GPU mà còn có thể định hình lại cấu trúc hạ tầng AI, mở ra cơ hội cho các nhà cung cấp chip AI, thiết bị chuyển mạch và mô-đun quang trong nước.

marsbit05/23 01:25

Trí Phổ Dựa Vào Đâu Để Tăng Gần 30% Trong Một Ngày?

marsbit05/23 01:25

Đột phá quan trọng về AI cộng tác! Stanford và Nvidia cùng nhau loại bỏ hao phí giao tiếp trong AI, tốc độ suy luận tăng mạnh 2.4 lần

Tưởng tượng một nhóm trợ lý AI hợp tác giải một bài toán. Cách làm truyền thống buộc chúng phải liên tục "viết" và "đọc" suy nghĩ dưới dạng văn bản, gây lãng phí thời gian, token và làm thất thoát thông tin – vấn đề được gọi là **"Language Tax" (Thuế ngôn ngữ)**. Mới đây, nghiên cứu hợp tác giữa UIUC, Stanford, NVIDIA và MIT đã đề xuất **RecursiveMAS**, một phương pháp đột phá cho phép các agent AI giao tiếp trực tiếp thông qua **"tư duy"** trong không gian tiềm ẩn (latent space), thay vì phải mã hóa và giải mã thành văn bản. Hệ thống này hoạt động như một vòng lặp đệ quy, nơi các agent chuyển tiếp biểu diễn vector ẩn cho nhau cho đến khi hoàn thành nhiệm vụ, chỉ giải mã thành văn bản ở bước cuối cùng. **Lợi ích chính:** - **Tốc độ:** Tăng tốc suy luận từ **1.2 đến 2.4 lần**, hiệu quả tăng theo số vòng lặp đệ quy. - **Chi phí:** Giảm tiêu thụ token **tới 75.6%**. - **Độ chính xác:** Cải thiện trung bình **8.3%** trên nhiều tác vụ chuẩn (toán học, lập trình, hỏi đáp), do giảm thiểu tổn thất thông tin khi "nén" tư duy thành chữ. - **Hiệu quả huấn luyện:** Chỉ cần huấn luyện một mô-đun kết nối nhẹ **RecursiveLink** (0.31% tham số), trong khi đóng băng trọng số mô hình gốc, giảm đáng kể chi phí tính toán. **Ý nghĩa & Hạn chế:** RecursiveMAS mở ra hướng tiếp cận mới để mở rộng hệ thống đa tác nhân: thay vì tăng số lượng agent, có thể **tăng độ sâu đệ quy**. Tuy nhiên, nghiên cứu vẫn cần được kiểm chứng độc lập, đồng thời đối mặt với thách thức về khả năng giải thích (vì quá trình hợp tác diễn ra trong "hộp đen") và khả năng tương thích giữa các kiến trúc model khác nhau. Tóm lại, đây là một bước tiến quan trọng hướng tới việc loại bỏ "nút thắt ngôn ngữ", giúp sự hợp tác giữa các AI trở nên trực tiếp và hiệu quả hơn, giống như **"thần giao cách cảm"**.

marsbit05/21 00:14

Đột phá quan trọng về AI cộng tác! Stanford và Nvidia cùng nhau loại bỏ hao phí giao tiếp trong AI, tốc độ suy luận tăng mạnh 2.4 lần

marsbit05/21 00:14

Ngành chip này đang bùng nổ

Thị trường chip AI toàn cầu đang trải qua một sự chuyển dịch mô hình sâu sắc, với sự trỗi dậy mạnh mẽ của chip ASIC (Application-Specific Integrated Circuit) từ khoảng năm 2025. Động lực chính đến từ sự dịch chuyển trọng tâm nhu cầu tính toán AI từ huấn luyện sang suy luận (inference) quy mô lớn, nơi ASIC thể hiện ưu thế vượt trội về hiệu suất năng lượng, độ trễ và chi phí so với GPU đa dụng. Các tín hiệu rõ ràng bao gồm: Google TPU chiếm 78% thị phần máy chủ AI; OpenAI hợp tác với Broadcom triển khai cụm ASIC 10 GW; MediaTek và Qualcomm công khai mục tiêu lớn cho ASIC trung tâm dữ liệu; các nhà cung cấp dịch vụ thiết kế IC như Xinyuan và ASR ghi nhận đơn hàng bùng nổ. Dự báo cho thấy thị phần ASIC trong chip AI sẽ tăng lên 45% vào 2027, với quy mô thị trường đạt 300 tỷ USD. Sự bùng nổ được thúc đẩy bởi tính kinh tế của AI suy luận quy mô lớn, kiến trúc Transformer thống nhất tạo điều kiện tối ưu hóa ASIC, và nhu cầu chiến lược của các nhà cung cấp dịch vụ đám mây (CSP) trong việc nắm quyền kiểm soát kiến trúc và chuỗi cung ứng. Các CSP như Google, AWS, Meta đang tích cực phát triển hoặc đặt hàng chip tự thiết kế. Bức tranh cạnh tranh toàn cầu được định hình lại với sự tham gia của các tân binh như MediaTek, Qualcomm cùng các gã khổng lồ truyền thống Broadcom, Marvell. Tại Trung Quốc, Xinyuan và ASR nổi lên như những nhà cung cấp dịch vụ thiết kế ASIC độc lập quan trọng, hưởng lợi từ làn sóng nhu cầu. Xu hướng này cũng thúc đẩy tái cấu trúc chuỗi cung ứng, với việc Google đàm phán bán TPU cho Meta, đánh dấu bước chuyển từ chip tự dùng sang thương mại hóa. Tuy nhiên, ASIC đối mặt với thách thức về chi phí phát triển cao, rào cản phần mềm (CUDA của NVIDIA), phụ thuộc vào năng lực đóng gói tiên tiến (CoWoS của TSMC) và sự đánh đổi giữa hiệu suất chuyên dụng và tính linh hoạt. Tóm lại, kỷ nguyên vàng của ASIC không phải là sự thay thế hoàn toàn GPU, mà hướng tới một hệ sinh thái đa dạng nơi GPU thống trị huấn luyện và ASIC tối ưu cho suy luận, trao quyền kiểm soát kiến trúc tính toán cho nhiều đối tượng hơn trong ngành.

marsbit05/18 00:34

Ngành chip này đang bùng nổ

marsbit05/18 00:34

Tăng 108% Ngay Ngày Đầu! Ngựa Ô AI Lớn Nhất Năm 2026 Ra Đời, Altman Lại 'Kiếm Tiền Trong Giấc Ngủ'

Bài viết tường thuật về vụ IPO lớn nhất năm 2026 của Cerebras, một công ty chip AI. Cổ phiếu Cerebras (mã: ) tăng 108% trong ngày đầu niêm yết trên Nasdaq, định giá công ty lên tới 100 tỷ USD. Bài viết nhấn mạnh việc công ty huy động được 5,55 tỷ USD và sự chuyển mình từ thua lỗ sang lợi nhuận trong năm 2025. Người sáng lập OpenAI, Sam Altman, thu lợi gấp 10 lần từ khoản đầu tư cá nhân từ năm 2017. Bản thân OpenAI cũng có lợi nhuận kế toán lớn nhờ một thỏa thuận mua cổ phần với giá rất thấp và là khách hàng lớn của Cerebras với hợp đồng trị giá hơn 20 tỷ USD. Sản phẩm cốt lõi của Cerebras là chip WSE-3 khổng lồ, được quảng cáo là có hiệu suất vượt trội cho tác vụ suy luận AI (AI inference) so với GPU của NVIDIA. Bài viết kết luận bằng cách đặt vụ IPO của Cerebras trong bối cảnh rộng hơn: đây chỉ là màn mở đầu cho một làn sóng IPO khổng lồ sắp tới từ các gã khổng lồ AI như SpaceX (bao gồm xAI), OpenAI và Anthropic, với tổng định giá tiềm năng lên tới hơn 3 nghìn tỷ USD, báo hiệu một cuộc chạy đua vũ trang về năng lực tính toán hướng tới kỷ nguyên Trí tuệ nhân tạo siêu việt (ASI).

marsbit05/15 11:24

Tăng 108% Ngay Ngày Đầu! Ngựa Ô AI Lớn Nhất Năm 2026 Ra Đời, Altman Lại 'Kiếm Tiền Trong Giấc Ngủ'

marsbit05/15 11:24

活动图片