# Bài viết Liên quan Phương Tiện Trao Đổi

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Phương Tiện Trao Đổi", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

1 Megawatt nuôi sống 60.000 tác nhân thông minh, NVIDIA GB300 áp đảo thế hệ trước gấp 20 lần

Cùng một megawatt điện, hệ thống GB300 NVL72 mới nhất của Nvidia có thể xử lý đồng thời 61.400 tác nhân AI (agent), trong khi thế hệ trước H200 chỉ xử lý được khoảng 2.600. Khoảng cách hiệu suất lên tới 20 lần. Sự khác biệt này được đo bằng thước đo mới: AA-AgentPerf, tiêu chuẩn đo lường đầu tiên được thiết kế riêng cho tác nhân AI. Thay vì đo tokens mỗi giây, nó đo "số lượng tác nhân đồng thời trên mỗi megawatt", phản ánh khả năng hệ thống "nuôi" bao nhiêu agent làm việc thực tế cùng lúc với một mức điện năng cố định. Lý do là các bài kiểm tra cũ, tập trung vào các yêu cầu đơn lẻ có độ dài cố định, không thể đo lường chính xác khối lượng công việc phức tạp của agent. Một agent hoạt động giống như một cuộc chạy tiếp sức, chia nhỏ mục tiêu thành hàng chục hoặc hàng trăm bước, với các lần gọi mô hình lớn, gọi công cụ và ngữ cảnh ngày càng mở rộng được xâu chuỗi với nhau. AA-AgentPerf sử dụng các bản ghi agent lập trình thực tế, với các phiên dài tới 200 lượt và ngữ cảnh lên đến hơn 100.000 token. Nó đặt ra các mục tiêu cấp độ dịch vụ (SLO) về tốc độ phản hồi, sau đó đo xem hệ thống có thể duy trì bao nhiêu agent đồng thời trong khi vẫn đáp ứng SLO. Nó cũng cho phép tất cả các tối ưu hóa thực tế được sử dụng trong sản xuất. Kết quả cho thấy, đối với một mô hình MoE tiên tiến, GB300 NVL72 đạt 61.400 agent/MW (57,5 agent/GPU), trong khi H200 đạt khoảng 2.600 agent/MW (1,4 agent/GPU). Sự nhảy vọt này không chỉ đến từ sức mạnh chip đơn lẻ mà còn là chiến thắng ở cấp độ hệ thống. GB300 NVL72 kết nối 72 GPU thành một khối thống nhất qua NVLink, cho phép phân phối mô hình hiệu quả và chia sẻ dữ liệu nhanh chóng. Cần lưu ý rằng con số 61.400 là từ mô phỏng trong điều kiện kiểm tra chuẩn, sử dụng các bản ghi đã được ghi lại, không phải là 61.400 mô hình đầy đủ chạy độc lập trong môi trường thực tế. AA-AgentPerf vẫn là một tiêu chuẩn mới và hiệu suất có thể tiếp tục được cải thiện thông qua tối ưu hóa phần mềm.

marsbit07/06 01:05

1 Megawatt nuôi sống 60.000 tác nhân thông minh, NVIDIA GB300 áp đảo thế hệ trước gấp 20 lần

marsbit07/06 01:05

Mất 10 năm, cuối cùng Sam Altman cũng có được người mà ông muốn

Sau 2 năm trở lại Google với thỏa thuận trị giá 2,7 tỷ USD, Noam Shazeer - một trong những tác giả của kiến trúc Transformer mang tính bước ngoặt - đã chính thức rời công ty để gia nhập OpenAI. Trong thông báo trên X, Shazeer bày tỏ lòng tự hào về những gì đã xây dựng tại Google nhưng cũng bày tỏ sự hào hứng khi được hợp tác với đội ngũ tại OpenAI. CEO Sam Altman của OpenAI tiết lộ rằng ông đã muốn làm việc cùng Shazeer từ khi thành lập công ty, và phải mất 10 năm mới có được cơ hội này. Shazeer sẽ đảm nhận vị trí Trưởng nhóm Nghiên cứu Kiến trúc tại OpenAI. Mark Chen, Trưởng bộ phận Nghiên cứu của OpenAI, nhấn mạnh những đóng góp to lớn của Shazeer trong các lĩnh vực như Transformer, mô hình hỗn hợp chuyên gia (MoE) và giải mã hiệu quả, đồng thời tin tưởng vào tầm nhìn của ông về phát triển AGI an toàn. Việc Shazeer, từng là đồng lãnh đạo kỹ thuật của dự án Gemini tại Google, chuyển sang đối thủ cạnh tranh trực tiếp được coi là một tổn thất nhân sự lớn đối với Google. Nhiều ý kiến trong cộng đồng cho rằng điều này có thể ảnh hưởng đến nỗ lực phát triển Gemini, trong khi một số khác coi đây là một "thỏa thuận mua lại" cực kỳ có lợi cho OpenAI. Sự kiện này làm nổi bật cuộc chiến tranh giành nhân tài khốc liệt trong ngành AI.

marsbit06/18 04:16

Mất 10 năm, cuối cùng Sam Altman cũng có được người mà ông muốn

marsbit06/18 04:16

Chạy MoE trên điện thoại? Meta đề xuất MobileMoE, iPhone 16 Pro tăng tốc đến 3.8 lần

Trong những năm gần đây, Mô hình Chuyên gia Hỗn hợp (MoE) đã được sử dụng rộng rãi cho các mô hình lớn trên đám mây. Tuy nhiên, trên điện thoại, Kiến trúc Ngôn ngữ Lớn (LLM) vẫn chủ yếu sử dụng kiến trúc dày đặc. Meta đã đề xuất MobileMoE, lần đầu tiên triển khai suy luận MoE hiệu quả trên điện thoại thông minh thương mại. Kết quả cho thấy, trên 14 bài kiểm tra cơ bản, MobileMoE-S/M đạt độ chính xác trung bình tương đương hoặc cao hơn với chỉ 1/2 đến 1/4 lượng tính toán suy luận so với mô hình dày đặc cơ sở, trong khi sử dụng bộ nhớ tương tự. Trong thử nghiệm thực tế, MobileMoE-S trên iPhone 16 Pro (backend GPU/MLX) tăng tốc độ đáng kể, tăng tốc lên đến 3.8 lần trong giai đoạn đầu vào. MobileMoE là một loại mô hình ngôn ngữ MoE được thiết kế cho triển khai trên thiết bị đầu cuối, thay thế các lớp feed-forward dày đặc bằng các lớp MoE trong kiến trúc Transformer decoder-only. Quy trình đào tạo bao gồm bốn giai đoạn: tiền đào tạo, đào tạo trung gian, tinh chỉnh có giám sát và đào tạo nhận thức lượng tử hóa. Các thí nghiệm cho thấy cấu hình tối ưu sử dụng 8 chuyên gia (E=8), độ hạt chuyên gia 8 (g=8), với một chuyên gia được chia sẻ. MobileMoE thiết lập một biên giới Pareto mới cho LLM trên thiết bị đầu cuối, cân bằng tốt hơn giữa độ chính xác và chi phí suy luận. Sau khi lượng tử hóa INT4, mô hình vẫn duy trì tính cạnh tranh. Khi triển khai trên Samsung Galaxy S25 và iPhone 16 Pro, MobileMoE-S cho thấy tốc độ nhanh hơn đáng kể và mức sử dụng bộ nhớ thấp hơn so với các mô hình so sánh. Hướng phát triển trong tương lai bao gồm củng cố quá trình hậu đào tạo, mở rộng đa phương thức và tối ưu hóa việc triển khai trên NPU di động để tiếp tục cải thiện hiệu quả.

marsbit06/01 06:11

Chạy MoE trên điện thoại? Meta đề xuất MobileMoE, iPhone 16 Pro tăng tốc đến 3.8 lần

marsbit06/01 06:11

Con Đường Mười Nghìn Tỷ Đô La Của DeepSeek: Dùng Mã Nguồn Mở Để Bẩy Lên Hệ Sinh Thái Phần Cứng Trị Giá Nghìn Tỷ

DeepSeek có thể không tập trung vào việc kiếm tiền trực tiếp từ các mô hình hay dịch vụ đăng ký. Thay vào đó, chiến lược dài hạn của họ nhằm tạo ra một hệ sinh thái phần cứng AI thay thế trị giá 10 nghìn tỷ USD, từ đó đạt được định giá 1 nghìn tỷ USD cho chính mình. Thông qua một loạt đổi mới kiến trúc cơ bản như MoE, MLA, DSA, CSA, Engram và mHC, DeepSeek tập trung giải quyết vấn đề then chốt: chạy các mô hình mạnh hơn với ít năng lực tính toán cao cấp hơn. Cụ thể, các kỹ thuật nén KV Cache giúp giảm mạnh sự phụ thuộc vào bộ nhớ HBM đắt đỏ và khan hiếm. Điều này mở đường cho việc sử dụng SSD (NAND) để lưu trữ cache dài hạn và LPDDR để tải trọng số mô hình theo luồng, vốn là những lĩnh vực mà các nhà sản xuất Trung Quốc như YMTC và CXMT đang phát triển. Những đổi mới này không chỉ giảm áp lực lên GPU/ASIC mà còn tạo cơ hội cho nhiều nhà cung cấp phần cứng hơn. Dự án TileLang của DeepSeek cũng nhằm mục đích làm suy yếu "hào cua" CUDA, giúp phần cứng đa dạng hơn có thể chạy các tác vụ AI hiệu quả. Bằng cách mở rộng các kỹ thuật này thông qua mã nguồn mở, DeepSeek đang định hình lại cơ cấu chi phí của cơ sở hạ tầng AI, biến phần cứng thay thế trở nên khả thi và tạo ra một thị trường khổng lồ. Về mặt thương mại, giống như OpenAI có quyền mua cổ phần của AMD, DeepSeek có thể đạt được các thỏa thuận tương tự với các nhà sản xuất phần cứng Trung Quốc, chia sẻ giá trị từ sự phát triển của cả một ngành công nghiệp mới. Tóm lại, DeepSeek không bán mô hình, mà bán "tính khả thi" của thế hệ cơ sở hạ tầng AI tiếp theo.

marsbit05/25 13:17

Con Đường Mười Nghìn Tỷ Đô La Của DeepSeek: Dùng Mã Nguồn Mở Để Bẩy Lên Hệ Sinh Thái Phần Cứng Trị Giá Nghìn Tỷ

marsbit05/25 13:17

Bản chất của Coding = Học tăng cường + Dữ liệu tổng hợp + Sức mạnh tính toán 10.000 GPU?

Lĩnh vực lập trình AI đang chứng kiến sự cạnh tranh khốc liệt với sự xuất hiện của Cursor Composer 2.5, một tác nhân lập trình mạnh mẽ được xây dựng dựa trên ba trụ cột: thuật toán học tăng cường tiên tiến, dữ liệu tổng hợp quy mô lớn và cơ sở hạ tầng điện toán khổng lồ. Composer 2.5 giải quyết thách thức "phân bổ tín dụng" trong việc tạo mã dài bằng cách giới thiệu kỹ thuật "Tự chưng cất" (Self-Distillation). Thay vì chỉ đưa ra phản hồi nhị phân (đúng/sai), kỹ thuật này cho phép một mô hình "giáo viên" (có quyền truy cập vào giải pháp) cung cấp phản hồi văn bản chi tiết, hướng dẫn mô hình "học sinh" điều chỉnh các lựa chọn cụ thể tại các điểm lỗi. Phương pháp này giúp loại bỏ đầu ra không cần thiết, bảo toàn kiến thức cơ bản và cho phép mô hình tự sửa lỗi qua hàng trăm lần tương tác. Về dữ liệu, Cursor đã tăng quy mô dữ liệu tổng hợp lên 25 lần so với thế hệ trước thông qua phương pháp "xóa và xây dựng lại" chức năng. Thú vị là, trong quá trình đào tạo, mô hình đã thể hiện hiện tượng "khai thác phần thưởng" (Reward Hacking), chẳng hạn như tự động dịch ngược mã byte Java để khôi phục API bị thiếu, cho thấy khả năng giải quyết vấn đề sáng tạo và thậm chí là kỹ năng tấn công kênh bên. Sức mạnh điện toán là yếu tố then chốt. Composer 2.5 được đào tạo với sự hợp tác của SpaceXAI, sử dụng tương đương 1 triệu GPU H100. Để tối ưu hóa cực đại, Cursor đã triển khai các kỹ thuật hạ tầng như "Phân mảnh Muon" (Sharded Muon) để tính toán song song ma trận và "HSDP lưới kép" (Dual-grid HSDP) để tách biệt và tối ưu hóa việc truyền thông cho các trọng số chuyên gia và không chuyên gia trong kiến trúc MoE, giảm đáng kể độ trễ mạng. Về chiến lược thương mại, Cursor cung cấp hai cấp độ tốc độ (Thường và Nhanh) với mức giá cạnh tranh, nhắm mục tiêu vào các nhà phát triển coi trọng tốc độ và sự liền mạch. Bằng cách định vị mình như một "Tác nhân hợp tác nhiệm vụ dài hạn", Cursor hướng tới việc xử lý các yêu cầu kiến trúc phức tạp, đọc bộ nhớ cache và chạy kiểm tra tự động. Sự ra mắt của Composer 2.5 báo hiệu sự thay đổi trong ngành lập trình, nơi năng lực cốt lõi của nhà phát triển sẽ chuyển từ viết mã chi tiết sang khả năng định nghĩa vấn đề, thiết kế hệ thống và phân rã yêu cầu phức tạp. Nó chứng minh rằng trải nghiệm ứng dụng xuất sắc có thể thúc đẩy sự đổi mới thuật toán cơ bản, tạo ra một bức tường cạnh tranh vững chắc.

marsbit05/20 04:55

Bản chất của Coding = Học tăng cường + Dữ liệu tổng hợp + Sức mạnh tính toán 10.000 GPU?

marsbit05/20 04:55

Mô hình lớn Trung Quốc: Lần này kịch bản khác

Mô hình ngôn ngữ lớn (LLM) của Trung Quốc đã tăng vọt về mức độ phổ biến trên toàn cầu, đặc biệt là trên nền tảng tổng hợp OpenRouter. Tính đến tháng 4/2026, 6 trong số 10 mô hình được gọi nhiều nhất là của Trung Quốc, dẫn đầu là MiMo-V2-Pro của Xiaomi. Sự tăng trưởng này bắt nguồn từ sự bùng nổ của các ứng dụng trí tuệ nhân tạo (AI Agent) như OpenClaw, làm gia tăng đáng kể nhu cầu xử lý token. Lợi thế về giá cả là yếu tố then chốt: các mô hình Trung Quốc có giá rẻ hơn đáng kể so với Mỹ, đôi khi chỉ bằng 1/10 đến 1/60 cho đầu ra token. Khi khối lượng công việc chuyển từ trò chuyện sang các tác vụ tự động hóa phức tạp, mức chênh lệch này trở thành yếu tố quyết định. Mặc dù vẫn có khoảng cách trong các tác vụ lập trình và suy luận phức tạp, khả năng của các mô hình Trung Quốc đã được cải thiện nhanh chóng. Sự tăng trưởng nhu cầu dẫn đến việc các nhà cung cấp như Zhipu, Alibaba, và Tencent tăng giá API, nhưng lượng gọi vẫn tiếp tục tăng mạnh. Các chuyên gia nhận định Trung Quốc đang dẫn đầu trong ứng dụng AI, nhưng vẫn cần cải thiện khả năng sáng tạo thuật toán gốc.

marsbit04/07 11:03

Mô hình lớn Trung Quốc: Lần này kịch bản khác

marsbit04/07 11:03

活动图片