Việc giảm giá 99% của Xiaomi MiMo không phải là chiêu trò marketing! Luo Fuli đăng X để phản bác những kẻ bi quan

marsbitXuất bản vào 2026-05-31Cập nhật gần nhất vào 2026-05-31

Tóm tắt

Trong bài viết, tác giả phân tích động thái giảm giá API lên tới 99% cho dòng MiMo-V2.5 của Xiaomi và phản bác các ý kiến cho rằng đây chỉ là chiến lược marketing hay "bán lỗ cướp thị trường". Lộ Phúc Lợi, người đứng đầu MiMo, đã công bố một blog kỹ thuật dài 5000 chữ để giải thích cơ sở kỹ thuật của mức giá mới. Bài viết mô tả sáu trụ cột công nghệ chính cho phép mức giảm giá này: 1. **Kiến trúc Hybrid SWA (Sliding Window Attention):** Giảm dung lượng bộ nhớ tạm (KVCache) xuống còn 1/7 so với Full Attention truyền thống. 2. **Quản lý KVCache hai bể riêng biệt:** Tối ưu hóa việc phân bổ bộ nhớ để triệt để tận dụng lợi thế của SWA, tăng gấp 5 lần số lượng người dùng đồng thời. 3. **Hệ thống tiền tố cache được cải tiến:** Đảm bảo an toàn và nâng cao tỷ lệ trúng cache lên tới 93-95%, khiến phần lớn yêu cầu đọc lặp lại hầu như không cần tính toán lại. 4. **Hệ thống lưu trữ phân tán GCache:** Triển khai trực tiếp trên ổ SSD của máy GPU, giảm chi phí lưu trữ xuống gần bằng 0. 5. **Hệ thống điều phối LLM-Router:** Tối ưu định tuyến và lập lịch, ưu tiên các yêu cầu có cache, tăng hiệu suất tổng thể. 6. **Dự đoán đa token (MTP):** Giảm chi phí tạo văn bản (output), hoàn thiện vòng tròn giảm chi phí cho toàn bộ quá trình xử lý. Những cải tiến này, khi kết hợp, tạo ra một chuỗi tối ưu toàn diện làm giảm đáng kể chi phí tính toán và lưu trữ cho mỗi yêu cầu. Bài viết kết luận rằng mức giảm 99% không phải là con số tiếp thị, mà là kết quả có thể chứng minh của một hệ thống kỹ thuật...

Văn | Tượng Tiên Chí

Luo Fuli đăng một bài trên X, muốn đặt dấu chấm hết cho tranh cãi giảm giá của Xiaomi MiMo.

Ngày 26 tháng 5, tài khoản chính thức Xiaomi MiMo đã đăng một thông báo trên X: API dòng MiMo-V2.5 giảm giá vĩnh viễn, mức giảm cao nhất 99%. Tất cả các độ dài context đều được định giá thống nhất, gói Token nâng cấp lên 5-8 lần.

Thông báo này đã làm xôn xao cộng đồng AI trong nước suốt cả tuần. Phản ứng đầu tiên của giới công nghiệp được chia thành vài luồng. Luồng lớn nhất cho rằng đây là "một đợt chiến tranh giá cả nữa" - hai năm nay từ ZhiPu, DeepSeek, Byte DouBao đến Alibaba Tongyi, các mô hình lớn trong nước lần lượt giảm giá, ai cũng đang trong cuộc cạnh tranh.

Một luồng khác nhìn nhận theo hướng bi quan: Xiaomi vừa thông báo lợi nhuận năm nay giảm một nửa, lúc này vẫn đốt 600 tỷ cho AI, API trực tiếp cắt giảm 90% - điển hình của "lỗ vốn để chiếm thị trường". Còn có người cho rằng đây là hiệu ứng DeepSeek tiếp tục - người sau này đã kéo mức giá chuẩn của cả ngành xuống sàn, ai không theo sẽ bị loại.

Vì vậy với tư cách là người phụ trách MiMo, Luo Fuli tối qua đã công khai một bài blog kỹ thuật dài 5000 chữ, đưa bảng kế hoạch kỹ thuật giảm giá ra cho mọi người xem.

"Nhìn đây, đây là năng lực kỹ thuật thực sự, không phải là thủ đoạn marketing".

Để hiểu Luo Fuli đang nói gì, trước hết phải hiểu 99% này thực chất đang giảm cái gì.

Nó không phải giảm giá toàn bộ mô hình. Mức chiết khấu 99% đặc biệt nhắm vào một mức định giá gọi là Input (Cache Hit) - tức là phần "người dùng đọc lại lịch sử context trong cuộc hội thoại dài". Mức giảm cho input mới thông thường (No Cache Hit) nhỏ hơn nhiều, và mức giảm cho output của mô hình (Output) là nhỏ nhất.

Nếu bạn hình dung mô hình như một quán cà phê, thì sự việc này sẽ dễ hiểu hơn.

Bạn gọi một ly latte ít đường, quán cà phê có hai cách làm: mỗi lần đều xay hạt đong siro đổ sữa từ đầu, nguyên liệu nhân công đều phải trả một lần; nhưng mô hình biết tuần này bạn ngày nào cũng uống ly latte ít đường giống nhau, nên làm sẵn một ấm lớn bỏ vào tủ lạnh, lần sau múc một phần. Việc MiMo lần này làm là cách thứ hai - chuyển phần người dùng đọc lặp lại từ "tính toán lại" thành "lấy ngay", vì vậy chi phí thực tế của phần này gần bằng 0, tự nhiên có thể cho chiết khấu 99%.

Để làm được "lấy ngay", bài blog kỹ thuật đã nói đến sáu công trình, mỗi cái đều không thể thiếu. Dưới đây sẽ phân tích từng cái một.

Công trình một: Nén "ký ức" của mô hình xuống 1/7

Khi mô hình đối thoại với bạn, mỗi token đều phải tính một "trạng thái trung gian", lưu lại để bước tiếp theo sử dụng. Thứ này gọi là KVCache - có thể hiểu là "sổ tay ký ức ngắn hạn" của mô hình. Mỗi khi nói một câu, mô hình ghi chú tóm tắt câu này vào sổ tay, lần sau trực tiếp lật sổ ra xem, không cần nghe lại tất cả nội dung bạn đã nói từ đầu.

Mô hình truyền thống mỗi tầng đều làm "Full Attention" - tức là mỗi token đều phải xem toàn bộ tất cả token của đoạn hội thoại, sổ tay càng lật càng dày. MiMo-V2.5-Pro đã thay đổi kiến trúc: Trong 70 tầng, 60 tầng chỉ xem 128 token gần nhất (SWA, Sliding Window Attention), chỉ có 10 tầng "quản lý hồ sơ" xem toàn bộ.

Kết quả là thể tích KVCache trực tiếp bị nén xuống còn 1/7 của Full Attention, lượng tính toán cũng là 1/7.

Đây là nền móng đầu tiên của việc giảm chi phí. Ví dụ, ban đầu công ty yêu cầu mỗi nhân viên phải nhớ tất cả biên bản cuộc họp, kết quả là não của mỗi người đều không đủ dùng, hiệu suất cũng thấp. Quy định mới giảm gánh nặng não bộ của 60 nhân viên xuống còn 1/7, chỉ giữ lại 10 quản lý hồ sơ quản lý toàn bộ lịch sử - khả năng ghi nhớ tổng thể của công ty không giảm, nhưng hiệu suất tăng 7 lần.

Công trình hai: Để không gian tiết kiệm được từ SWA thực sự có thể sử dụng

Về kiến trúc, nén sổ tay xuống 1/7 là bước đầu tiên, nhưng để "1/7 trên lý thuyết" thực sự trở thành "1/7 thực tế", còn một trở ngại.

Hệ thống KVCache truyền thống phân bổ bộ nhớ cho tất cả các tầng thống nhất theo "lượng dùng tối đa có thể". Ý nghĩa là: dù 60 tầng SWA chỉ cần cuốn sổ nhỏ, hệ thống cũng phân bổ cho tất cả các tầng theo "cuốn sổ lớn của quản lý hồ sơ" - không gian tiết kiệm được của SWA bị dự trữ lãng phí, bằng như không tiết kiệm.

Cách làm của đội ngũ Luo Fuli là chia KVCache thành hai pool độc lập. 10 tầng Full Attention đi "pool lớn", phân bổ theo độ dài đầy đủ; 60 tầng SWA đi "pool nhỏ", chỉ phân bổ theo cửa sổ 128 token.

Ví dụ, ban đầu công ty phát cho mỗi nhân viên một "tủ hồ sơ có thể chứa tài liệu 100 năm" - nhưng 60 nhân viên thực ra chỉ cần "tủ nhỏ chứa tài liệu một tuần", 99% không gian trong những tủ lớn đó trống rỗng. Cách làm mới là phân tủ theo nhu cầu thực tế. Kết quả là cả văn phòng có thể chứa thêm hơn 5 lần đồng nghiệp vào làm việc - cùng một GPU có thể phục vụ số người dùng đồng thời tăng gấp 5 lần.

Bước này nhìn có vẻ đơn giản, nhưng không có nó, ưu thế thiết kế kiến trúc SWA phía trước bằng như thiết kế vô ích.

Công trình ba: Để "người dùng cũ đọc lại" thực sự có thể trúng cache

Sổ tay nén xuống 1/7 + không gian thực sự dùng được, bước tiếp theo phải giải quyết một vấn đề cũ: tỷ lệ trúng của cache tiền tố.

Nhiều cuộc hội thoại của người dùng có phần mở đầu giống nhau - cùng một đoạn system prompt, cùng một thư viện mã, cùng một tài liệu dài. Hệ thống sẽ lưu kết quả tính toán này lại, lần sau khớp được thì tái sử dụng trực tiếp. Cơ chế này gọi là cache tiền tố.

Nhưng trong chế độ SWA xuất hiện một cái hố: hai yêu cầu token giống nhau, không có nghĩa là KV vẫn còn. Có thể tiền tố đã tính toán, nhưng phần ngoài cửa sổ SWA đã sớm bị loại bỏ. Nếu hệ thống vẫn áp dụng quy tắc cũ "token giống nhau là trúng" để tái sử dụng cho bạn, sẽ đọc phải dữ liệu vô hiệu hoặc bị ghi đè, hiệu quả mô hình sẽ sụp đổ trực tiếp.

Đội ngũ Luo Fuli nâng cấp quy tắc lên "độ dài an toàn cửa sổ" - chỉ cam kết phần "bạn có thể mượn đầy đủ".

Ví dụ, thư viện có 1 triệu cuốn sách, bạn muốn mượn trọn bộ "Tam Thể" gồm ba cuốn. Kiến trúc ban đầu sẽ nói với bạn "cuốn sách này có", bạn chạy đến phát hiện trên giá chỉ còn bìa và tập một, hai tập sau đều bị mượn rồi. Loại "trúng giả" này khiến bạn chạy vô ích còn phải mượn lại. Quy tắc hệ thống mới đổi thành chỉ cam kết phần bạn có thể mượn đầy đủ - trước hết đưa bạn cuốn thứ nhất, sau đó lại điều hai cuốn sau cho bạn.

Nghe có vẻ nghiêm ngặt hơn, tỷ lệ trúng sẽ giảm. Nhưng thực tế ngược lại: vì SWA khiến thể tích KVCache nén xuống 1/7, cùng một không gian lưu trữ có thể chứa nội dung nhiều hơn gấp mấy lần, tỷ lệ trúng thực tế ngược lại tăng lên đáng kể.

Luo Fuli trong blog đã đưa ra số liệu thực tế trực tuyến: Dưới khung harness chủ lưu, tỷ lệ trúng cache phía máy chủ trung bình 93%, người dùng tần suất cao chu kỳ dài có thể đạt trên 95%.

Dịch ý nghĩa của con số này: 95% yêu cầu "đọc lại" căn bản không cần GPU tính toán, lấy trực tiếp từ cache. Đây chính là cơ sở vật lý của mức chiết khấu 99%.

Công trình bốn: Đưa "cache" vào SSD đi kèm GPU

Tỷ lệ trúng tăng lên, vấn đề tiếp theo là: những cache này được lưu ở đâu.

Bộ nhớ GPU (HBM memory trên GPU) rất đắt và hạn chế - một máy H100 tám card chỉ có 640GB bộ nhớ, nhưng KVCache mà MiMo cần lưu có thể là cấp độ hàng chục TB. Vì vậy phải phân tầng: dùng gần đây đặt vào bộ nhớ (L1), hơi cũ đặt vào bộ nhớ CPU (L2), dữ liệu lạnh lưu vào cache phân tán (L3).

Giống như bạn quản lý tiền vậy. Tiền mặt trong ví là bộ nhớ - dùng ngay lấy ngay nhưng không để được nhiều. Số dư thẻ ngân hàng là bộ nhớ CPU - lấy một lần mất 30 giây nhưng để được nhiều. Tiền gửi có kỳ hạn là cache phân tán L3 - lấy một lần mất 2 phút nhưng rẻ hơn nhiều.

Cách làm thông thường của ngành là xây dựng riêng một cụm lưu trữ cho L3, máy chuyên dụng, phòng máy chuyên dụng, tháng tháng trả tiền thuê.

Cách làm của đội ngũ lưu trữ Xiaomi khác. Họ tự nghiên cứu một bộ cache phân tán gọi là GCache, triển khai trực tiếp trên SSD đi kèm máy GPU - cùng phân bố chung trong một máy với nhiệm vụ huấn luyện, nhiệm vụ suy luận.

Dịch sang tiếng thông thường: người khác để lưu trữ lượng dữ liệu lớn, đã thuê riêng một nhà kho; Xiaomi phát hiện nhà để xe của máy GPU thực ra đang trống, trực tiếp lưu dữ liệu vào đó. Tiền thuê hàng tháng tiết kiệm được.

Nguyên văn trong blog kỹ thuật là: "Chi phí lưu trữ bổ sung là 0."

Sức sát thương của việc này lớn hơn vẻ ngoài. Trong "sổ sách tính toán năng lực" thông thường của "công ty AI", chi phí lưu trữ là một khoản chi cố định - mô hình của bạn càng lớn, người dùng càng nhiều, hóa đơn lưu trữ càng dài. Cách làm GCache này đánh bay mục này. Kết hợp với thể tích nhỏ SWA + tỷ lệ trúng 93-95%, thời gian tồn tại (TTL) của KVCache trong L3 kéo dài từ vài phút đến vài giờ thậm chí vài ngày - TTL càng dài, cửa sổ có thể trúng của context lịch sử càng rộng, tỷ lệ trúng cache càng cao, mức chiết khấu 99% đó càng đứng vững.

Công trình năm: Để yêu cầu trúng cache đi con đường ngắn nhất

Cache có thể chứa, có thể tra cứu, còn rẻ, bước cuối cùng là: làm thế nào để yêu cầu chính xác được định tuyến đến máy chính xác.

Xiaomi đã phát triển một hệ thống điều phối của riêng mình gọi là LLM-Router, làm ba việc:

Một là điều phối thân thiết. Các yêu cầu có tiền tố giống nhau được định tuyến đến cùng một máy, để tái sử dụng cache tối đa hóa.

Hai là phân nhóm theo độ dài. Chia yêu cầu ngắn (0-64K), yêu cầu trung bình (64K-256K), yêu cầu dài (256K-1M) vào các kênh xử lý khác nhau, tránh yêu cầu ngắn bị yêu cầu dài làm chậm.

Ba là tối ưu hóa TTFT. Trong hàng đợi chờ suy luận, ưu tiên điều phối các yêu cầu có lượng tính toán thực tế nhỏ (tức là các yêu cầu trúng cache nhiều) - tránh chúng bị các yêu cầu tính toán nặng kiểu "input hoàn toàn mới" làm tắc nghẽn.

Ví dụ, trong điều phối sân bay thông thường, tất cả hành khách bay cùng một điểm đến tập trung vào cùng một phòng chờ, chia sẻ quy trình lấy hành lý - đây là điều phối thân thiết. Người mang vali xách tay và người mang 3 vali ký gửi lớn đi hai lối an ninh khác nhau, người nhanh không bị người chậm làm chậm - đây là phân nhóm theo độ dài. Khi lên máy bay ưu tiên cho người chỉ mang vali xách tay, họ lên nhanh, để máy bay có thể cất cánh sớm - đây là tối ưu hóa TTFT.

Chiến lược điều phối này qua thực tế đã nâng tỷ lệ trúng cache L2 lên 25%, thông lượng input đơn máy tăng 30%, độ trễ P90 của yêu cầu dài giảm 30%.

Dịch lại tức là: cùng một GPU có thể phục vụ nhiều người dùng hơn. Nửa logic còn lại của việc giảm giá nằm ở đây - sản lượng hiệu quả trên đơn vị năng lực tính toán cao hơn, chi phí trên đơn vị người dùng thấp hơn.

Công trình sáu: Để mô hình "gõ chữ" cũng nhanh hơn

Năm việc phía trước đều tối ưu hóa phía "đọc" - giảm chi phí người dùng đọc lại context lịch sử xuống gần bằng 0. Việc thứ sáu là tối ưu hóa phía "viết" - tức là quá trình mô hình sinh token tiếp theo.

Mô hình truyền thống một lần chỉ có thể sinh 1 token. MiMo hỗ trợ nguyên bản 3 tầng MTP (Multi-Token Prediction) - một lần dự đoán 3 token tiếp theo, nếu dự đoán giữa chừng đúng, trực tiếp bỏ qua tính toán ở giữa.

Ví dụ, gõ chữ truyền thống là gõ từng chữ một - bạn muốn gõ "hôm nay thời tiết", phải nhấn 4 lần phím. MTP giống như có tính năng tự động bổ sung đoán chữ tiếp theo 1-2 chữ của bạn là gì - nếu nó đoán đúng, bạn không cần nhấn thêm hai lần đó nữa.

MTP của MiMo trong kịch bản agentic thực tế: giải mã 128 token đầu tiên tăng tốc 2.3 lần, 128-256 token tăng tốc 1.5 lần.

Ý nghĩa của việc này là, chiết khấu 99% đặc biệt hướng đến Input (Cache Hit), nhưng khi mô hình thực tế phục vụ người dùng, input và output xảy ra trong cùng một yêu cầu - nếu output không tiết kiệm, chi phí yêu cầu tổng thể chỉ tiết kiệm được một nửa. MTP khiến nửa output đó cũng giảm xuống, mô hình lợi nhuận của toàn bộ đợt giảm giá mới khép kín.

Nối sáu việc thành một chuỗi giảm chi phí:

Kiến trúc SWA → KVCache 1/7 → Hai pool thực sự giải phóng dung lượng → Cùng một GPU có thể chứa hơn 5 lần người dùng đồng thời → Tỷ lệ trúng cache tiền tố 93-95% → 95% yêu cầu hầu như không cần tính toán → GCache khiến chi phí lưu trữ về 0 → Điều phối ưu tiên điều chuyển yêu cầu trúng → MTP khiến việc sinh cũng tiết kiệm → Thời gian GPU trên đơn vị yêu cầu giảm một bậc độ lớn → Chi phí đơn vị giảm 95%+ → Định giá giảm 99%, tỷ suất lợi nhuận gộp vẫn dương.

Thiếu bất kỳ khâu nào, chuỗi này đều đứt ở một khúc nào đó. Giảm giá 99% không phải là con số marketing, là hiệu ứng tích lũy sau khi sáu trụ cột công trình chồng lên + xác minh thực tế trực tuyến.

Nhìn lại vài cách giải thích ban đầu của giới công nghiệp, mỗi cách đều có phần lý của nó. Hai năm nay cuộc chiến tranh giá cả giữa các công ty mô hình lớn Trung Quốc là thật; lợi nhuận Xiaomi giảm một nửa vẫn phải đổ tiền vào AI là thật; DeepSeek kéo mức giá chuẩn của ngành xuống sàn cũng là thật.

Nhưng lần này Luo Fili công khai blog kỹ thuật và phân tích chi tiết công nghệ một cách chi tiết, không nghi ngờ gì là hy vọng phản kích lại cách nói về chiến tranh giá cả, để "vấn đề kỹ thuật quy về kỹ thuật, vấn đề marketing quy về marketing."

Cô ấy đã viết trong blog, hiệu suất suy luận của dòng mô hình MiMo-V2.5 không đến từ đột phá đơn điểm của một khâu nào, mà là kết quả của tối ưu hóa phối hợp đa chiều. Hybrid SWA khiến prefill và decode cùng hưởng lợi, nhưng cách triển khai KVCache chưa được tối ưu hóa đầy đủ ngược lại sẽ đẩy cao chi phí ở các khâu. Xoay quanh mục tiêu này, đội ngũ MiMo đã xây dựng lại một cách có hệ thống quản lý KVCache, cache phân cấp, cây cache tiền tố, công phá vấn đề cốt lõi của SWA KVCache, tối ưu hóa chiến lược điều phối và liên kết Prefill / Decode, và thông qua kiểm tra kịch bản thực tế trực tuyến, cuối cùng biến ưu thế hiệu suất lý thuyết của nó thành hiện thực trong môi trường sản xuất. Đến lúc này, Hybrid SWA mới phát huy được ưu thế kiến trúc vừa có cường độ vừa có hiệu suất trong suy luận văn bản dài. Kết hợp với cấu hình MoE và các tối ưu hóa suy luận đa phương thức khác nhau, đã nâng cao hiệu suất dịch vụ suy luận trực tuyến ở mức độ rất lớn.

Đây là một cách đánh có hệ thống của kỹ thuật AI, cũng là phương tiện giảm chi phí đáng để ngành cùng tham khảo học hỏi.

Chiến tranh giá cả không cần viết blog, thực hiện công trình mới cần.

Câu hỏi Liên quan

QViệc giảm giá 99% của MiMo-V2.5 có phải là một chiến dịch marketing không? Đâu là lý do thực sự đằng sau việc giảm giá này?

AKhông, việc giảm giá 99% không phải là một chiến dịch marketing. Lý do thực sự là một loạt các cải tiến kỹ thuật hệ thống, bao gồm kiến trúc Hybrid SWA giúp giảm dung lượng KVCache xuống 1/7, hệ thống bộ nhớ đệm phân tầng GCache triển khai trên chính SSD của máy GPU (giảm chi phí lưu trữ về gần 0), và tỷ lệ hit cache lên đến 93-95%. Những cải tiến này giúp giảm đáng kể chi phí tính toán thực tế cho các yêu cầu đọc lặp lại, từ đó cho phép giảm giá mạnh mà vẫn đảm bảo tỷ suất lợi nhuận dương.

QKỹ thuật 'Sliding Window Attention' (SWA) đã giúp giảm chi phí như thế nào trong mô hình MiMo-V2.5?

AKiến trúc Hybrid SWA trong MiMo-V2.5-Pro chỉ định 10 trong tổng số 70 lớp mạng thực hiện 'Full Attention' (chú ý toàn bộ ngữ cảnh), trong khi 60 lớp còn lại chỉ xử lý cửa sổ 128 token gần nhất. Điều này giúp giảm dung lượng KVCache (bộ nhớ tạm của mô hình) xuống còn 1/7 so với kiến trúc Full Attention truyền thống, đồng thời cũng giảm khối lượng tính toán tương ứng. Đây là nền tảng đầu tiên để giảm chi phí.

QHệ thống bộ nhớ đệm GCache của Xiaomi có điểm đột phá gì so với cách làm thông thường?

AKhác với cách làm thông thường là xây dựng một cụm lưu trữ riêng biệt (L3) cho dữ liệu lạnh, nhóm kỹ thuật của Xiaomi tự phát triển GCache - một hệ thống bộ nhớ đệm phân tán triển khai trực tiếp trên ổ SSD đi kèm chính các máy chủ GPU chạy suy luận và huấn luyện. Cách tiếp cận 'tận dụng không gian trống' này giúp loại bỏ hoàn toàn chi phí thuê hạ tầng lưu trữ bổ sung, đồng thời kéo dài thời gian tồn tại (TTL) của dữ liệu trong cache, góp phần nâng cao tỷ lệ hit cache và củng cố cơ sở cho việc giảm giá.

QTỷ lệ hit cache cao (93-95%) đóng vai trò gì trong việc cho phép giảm giá 99%?

ATỷ lệ hit cache cao 93-95% là cơ sở vật lý then chốt cho mức giảm giá 99%. Nó có nghĩa là với 93-95% các yêu cầu đọc lại ngữ cảnh lịch sử từ người dùng, hệ thống không cần phải sử dụng GPU để tính toán lại mà có thể lấy trực tiếp kết quả từ bộ nhớ đệm. Chi phí cho những yêu cầu này do đó gần như bằng 0, tạo ra không gian để định giá giảm 99% cho phần Input (Cache Hit) mà vẫn có lãi.

QNgoài việc tối ưu hóa đầu vào (Input), MiMo còn có kỹ thuật nào để giảm chi phí cho phần đầu ra (Output) của mô hình?

AĐể giảm chi phí cho phần đầu ra (Output - quá trình mô hình sinh token), MiMo tích hợp sẵn kỹ thuật Dự đoán Đa Token (Multi-Token Prediction - MTP) với 3 lớp. Thay vì dự đoán từng token một, MTP cho phép dự đoán đồng thời 3 token tiếp theo. Nếu dự đoán đúng, hệ thống có thể bỏ qua các bước tính toán trung gian. Trong các tác vụ agent, MTP giúp tăng tốc độ decode lên 2.3 lần cho 128 token đầu và 1.5 lần cho token từ 128-256, từ đó giảm chi phí tính toán cho phần sinh nội dung và hoàn thiện vòng lặp giảm chi phí toàn diện.

Nội dung Liên quan

Ngày Tươi Sáng Khó Trở Lại, Các Quỹ VC Crypto Đang Trải Qua Điều Gì?

Đầu tư mạo hiểm chuyên sâu vào tiền mã hóa đang trải qua một sự chuyển đổi lớn. Các quỹ chuyên biệt hàng đầu như Paradigm (vừa huy động 1,2 tỷ USD) và Framework Ventures (huy động 400 triệu USD) đang mở rộng danh mục đầu tư sang các lĩnh vực khác như AI, robot, hàng không vũ trụ, thậm chí xóa bỏ các tham chiếu về "tiền mã hóa" khỏi thông điệp của mình. Quý I/2026 chỉ có 8 quỹ VC thuần túy về tiền mã hóa mới được thành lập, mức thấp nhất kể từ năm 2020. Theo lý thuyết chu kỳ công nghệ của Carlota Perez, tiền mã hóa đang chuyển từ giai đoạn "xây dựng" sang "phổ cập". Các gã khổng lồ truyền thống như Stripe, BlackRock, VISA đã hiểu và tích hợp công nghệ blockchain vào hoạt động cốt lõi của họ, làm xói mòn lợi thế thông tin độc quyền trước đây của các quỹ chuyên sâu. Ngành VC đang phân cực thành hình dạng "tạ tạ": một bên là các nền tảng đầu tư tổng hợp khổng lồ (a16z, Sequoia) có thể bao trùm toàn bộ lĩnh vực; bên kia là các quỹ nhỏ, chuyên sâu dựa vào hiểu biết sâu để đầu tư mạo hiểm vào các dự án tiên phong. Các quỹ quy mô trung bình thuần túy về tiền mã hóa đang bị mắc kẹt trong "vùng chết", vì không đủ lớn để cạnh tranh ở các vòng tăng trưởng, cũng không thể chỉ dựa vào các khoản đầu tư hạt giống nhỏ để đạt mức thoái vốn cần thiết (thường gấp 3 lần quỹ). Áp lực từ các nhà đầu tư (LP) cũng thúc đẩy sự thay đổi. Với lợi nhuận thực tế (DPI) thấp từ các quỹ năm 2021 và làn sóng AI hút 70% vốn đầu tư mạo hiểm, các nhà quản lý quỹ buộc phải đa dạng hóa để đáp ứng kỳ vọng của LP. Đối với các startup tiền mã hóa, điều này có nghĩa là việc gọi vốn sẽ khó khăn hơn. Họ phải cạnh tranh với vô số dự án AI để thu hút sự chú ý của các quỹ tổng hợp. Hơn nữa, các quỹ tổng hợp ít có khả năng đầu tư vào cơ sở hạ tầng công cộng hoặc nghiên cứu cơ bản (như MEV, công cụ cross-chain) – vốn rất quan trọng cho sự phát triển của hệ sinh thái nhưng khó có lợi nhuận thương mại trực tiếp. Tóm lại, "nhà đầu tư tiền mã hóa" như một danh mục riêng biệt đang trở nên lỗi thời. Tiền mã hóa đang trở thành cơ sở hạ tầng tài chính cơ bản. Các quỹ chuyên sâu cỡ trung đang thu hẹp hoặc biến mất. Tương lai sẽ là sự phân công: các quỹ tổng hợp lớn nắm giữ các khoản đầu tư tăng trưởng vào cơ sở hạ tầng tài chính dựa trên blockchain, trong khi các quỹ nhỏ, chuyên biệt tiếp tục ươm mầm cho các thí nghiệm tiên phong và ngách mới như mã hóa tài sản (tokenization), chứng khoán trên chuỗi.

Foresight News18 phút trước

Ngày Tươi Sáng Khó Trở Lại, Các Quỹ VC Crypto Đang Trải Qua Điều Gì?

Foresight News18 phút trước

Khi Sự Đồng Thuận Diễn Ra Ngày Càng Nhanh, Các Nhà Đầu Tư Trẻ Đang Đánh Cược Vào Điều Gì?

Khi sự đồng thuận thị trường ngày càng nhanh, các nhà đầu tư trẻ đang tập trung vào đâu? Đầu tư công nghệ hiện nay đang trải qua sự chuyển dịch rõ rệt, với bốn xu hướng chính được các nhà đầu tư trẻ hàng đầu quan tâm. **Xu hướng 1: AI rời màn hình, bước vào thế giới vật lý.** Trọng tâm đầu tư đang chuyển từ mô hình lớn và ứng dụng sinh dữ liệu sang robot, thiết bị AI, xe tự lái và hệ thống công nghiệp. Thách thức lớn không còn là khả năng của mô hình, mà là năng lực triển khai, độ tin cậy và hiệu quả chi phí khi tích hợp vào môi trường vật lý. Ngành giao hàng tự động (ví dụ: Bạch Tê Ngưu với hơn 2000 xe) là minh chứng cho xu hướng này. **Xu hướng 2: Lợi nhuận từ mô hình lớn chưa hết, cạnh tranh chuyển sang "Bánh xe thông minh".** Thay vì chỉ tìm kiếm kiến trúc kế tiếp, các nhà đầu tư tập trung vào các công ty có thể nhúng khả năng AI hiện có vào quy trình làm việc thực tế, tạo ra vòng lặp phản hồi "bánh xe thông minh": dữ liệu người dùng -> cải thiện mô hình -> trải nghiệm tốt hơn -> nhiều người dùng hơn. Sự thành công của Zhipu AI và Kling AI của Kuaishou cho thấy giá trị của việc xây dựng hệ thống tự củng cố này. **Xu hướng 3: Nghẽn dữ liệu thúc đẩy công nghệ nền tảng mới, mô hình cơ bản khoa học trở thành hướng đi không đồng thuận.** Khi dữ liệu chất lượng cao từ internet trở nên khan hiếm, việc đào tạo AI cần các nguồn kiến thức mới. Các phương pháp như học tăng cường, tự đối kháng và đặc biệt là **Mô hình Cơ bản Khoa học** (Scientific Foundation Models) hứa hẹn sử dụng dữ liệu và quy luật từ các lĩnh vực chuyên sâu (sinh học, vật liệu) để mở rộng biên giới của AI, mặc dù đây vẫn là một lĩnh vực đầy thách thức. **Xu hướng 4: Càng tiến vào vùng nước sâu của công nghệ cứng, càng cần vốn kiên nhẫn.** Trong các lĩnh vực như hàng không vũ trụ thương mại, máy tính lượng tử và năng lượng tiên tiến, chu kỳ xác minh dài hơn và con đường thương mại hóa không rõ ràng. Các nhà đầu tư cần xây dựng phán đoán sớm, tập trung vào năng lực nghiên cứu cốt lõi, khả năng kỹ thuật và sự kiên cường của đội ngũ, thay vì kỳ vọng lợi nhuận ngắn hạn. Sự quan tâm đến robot không gian, điện toán không gian và vật liệu năng lượng không gian phản ánh tầm nhìn dài hạn này. Tóm lại, các nhà đầu tư trẻ ngày nay không chỉ theo đuổi các khái niệm nóng, mà đang chuyển sang phân tích sâu sắc con đường tích hợp công nghệ vào ngành công nghiệp, tìm kiếm các hệ thống tạo ra vòng lặp phản hồi bền vững và sẵn sàng đồng hành cùng các dự án công nghệ cứng trong hành trình dài hạn.

marsbit46 phút trước

Khi Sự Đồng Thuận Diễn Ra Ngày Càng Nhanh, Các Nhà Đầu Tư Trẻ Đang Đánh Cược Vào Điều Gì?

marsbit46 phút trước

Giải phóng 100 triệu USD thanh khoản? Chính sách mới của Pump.fun thử nghiệm chiến thuật bơm giá trong 5 phút

Bài viết thảo luận về cơ chế BOOST mới được Pump.fun công bố vào ngày 21/7, trở thành cơ chế phát hành mặc định cho các token mới. Cơ chế này nhắm giải quyết vấn đề "thanh khoản chết" - khoảng 20% vốn bị khóa vĩnh viễn trong nhóm thanh khoản (LP) sau khi token di chuyển từ bonding curve, gây lãng phí ước tính hơn 100 triệu USD mỗi năm. Thay vì khóa số vốn này, BOOST sẽ dùng nó (khoảng 17,6 SOL hoặc 2516 USDC) để mua token ngay trong 5 phút đầu sau khi di chuyển lên PumpSwap, thông qua cơ chế TWAP, và ngay lập tức đốt số token mua được. Điều này tạo áp lực mua tức thời và giảm nguồn cung vĩnh viễn. Mục tiêu của Pump.fun là tạo ra "pháo hoa" trong 5 phút đầu, kích thích giao dịch và cải thiện trải nghiệm cho nhà giao dịch meme - đối tượng thường quan tâm đến đợt "bứt phá" ngay khi token ra mắt. Cách tiếp cận này nhằm tăng tỷ lệ token tạo ra khối lượng giao dịch bền vững, từ đó củng cố doanh thu nền tảng và tính bền vững của việc mua lại token PUMP. Tuy nhiên, bài viết cũng nêu lo ngại: cơ chế có thể khiến các token chất lượng thấp dễ thành công hơn về mặt hình thức và làm tăng rủi ro sau 5 phút, khi áp lực mua biến mất và token có thể lao dốc nhanh hơn nếu gặp bán tháo.

Foresight News57 phút trước

Giải phóng 100 triệu USD thanh khoản? Chính sách mới của Pump.fun thử nghiệm chiến thuật bơm giá trong 5 phút

Foresight News57 phút trước

Đơn vị quản lý tài sản lớn nhất Ấn Độ SBI lên sàn, số liệu giao dịch hé lộ tín hiệu gì?

SBI Funds Management, công ty quản lý quỹ lớn nhất Ấn Độ, đã niêm yết vào ngày 21/7. Đợt IPO trị giá khoảng 10,3 tỷ USD được định giá kỷ lục gấp 42 lần, cho thấy nhu cầu mạnh mẽ từ các nhà đầu tư tổ chức và bán lẻ đối với tài sản tài chính cốt lõi. Tuy nhiên, giá đóng cửa ngày đầu tiên chỉ tăng khoảng 6,3%, thấp hơn nhiều so với kỳ vọng chênh lệch 16% trên thị trường chợ đen, cho thấy vốn sẵn sàng nhưng không chấp nhận trả giá quá cao. Sự thành công thận trọng của SBI đặt ra một cột mốc định giá mới cho thị trường IPO Ấn Độ: cửa sổ IPO vẫn mở, nhưng ưu tiên cho các công ty có thương hiệu mạnh, dòng tiền ổn định và câu chuyện tăng trưởng thâm nhập dài hạn rõ ràng. Một tín hiệu đáng chú ý khác là phí bảo lãnh phát hành cực thấp (khoảng 0,01%), khiến một số ngân hàng quốc tế rút lui. Điều này phản ánh quyền định giá đang nghiêng về phía các tổ chức phát hành mạnh như SBI, những người có thể dựa vào kênh phân phối nội địa và thương hiệu, làm giảm giá trị cận biên mà các ngân hàng đầu tư quốc tế mang lại. Tăng trưởng ổn định của ngành quản lý quỹ Ấn Độ (dự báo CAGR 16-18%) hỗ trợ định giá, nhưng thị trường vẫn cân nhắc các yếu tố chu kỳ. Bài kiểm tra thực sự cho cửa sổ IPO sẽ là các đợt chào bán lớn tiếp theo như Reliance Jio và Sở giao dịch chứng khoán quốc gia (NSE). Thành công của họ ở mức định giá hợp lý sẽ khẳng định xu hướng mới; nếu bị trì hoãn, SBI sẽ chỉ là một thành công đơn lẻ.

marsbit1 giờ trước

Đơn vị quản lý tài sản lớn nhất Ấn Độ SBI lên sàn, số liệu giao dịch hé lộ tín hiệu gì?

marsbit1 giờ trước

Nhật Bản muốn dùng AI để mua tăng trưởng, thị trường trái phiếu có tin không?

Nội các Nhật Bản đã thông qua "Phương hướng cơ bản về vận hành và cải cách tài chính kinh tế 2026", chuyển trọng tâm mục tiêu tài chính từ cân bằng thu chi ngân sách cơ bản sang ổn định và giảm tỷ lệ nợ/GDP. Động thái này nhằm tạo không gian đầu tư vào các lĩnh vực chiến lược như AI, bán dẫn để thúc đẩy tăng trưởng, giải quyết vấn đề lão hóa và thiếu lao động. Tuy nhiên, thị trường trái phiếu tỏ ra hoài nghi. Việc làm suy yếu "mỏ neo" tài chính truyền thống có thể bị coi là nới lỏng kỷ luật ngân sách. Lợi tức trái phiếu chính phủ Nhật kỳ hạn 10 năm đã tăng, phản ánh lo ngại về tính tín nhiệm tài chính. Kế hoạch đầu tư 370 nghìn tỷ Yên đến năm 2040 không phải là ngân sách mới tập trung chỉ cho AI, mà là tổng đầu tư công-tư vào nhiều lĩnh vực. Thành bại của khung chính sách mới phụ thuộc vào việc liệu tốc độ tăng trưởng kinh tế danh nghĩa có vượt quá lãi suất dài hạn hay không, và liệu các khoản đầu tư chiến lược có thực sự cải thiện năng suất và thu ngân sách. Thị trường sẽ tiếp tục định giá dựa trên khả năng chính phủ chứng minh được hiệu quả đầu tư và con đường giảm nợ bền vững.

marsbit1 giờ trước

Nhật Bản muốn dùng AI để mua tăng trưởng, thị trường trái phiếu có tin không?

marsbit1 giờ trước

Giao dịch

Giao ngay
活动图片