# Bài viết Liên quan Hiệu suất

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Hiệu suất", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Sau khi đốt cháy hàng chục tỷ USD cho Token, các ông lớn ở Thung lũng Silicon bắt đầu hạn chế lượng Token nhân viên sử dụng

Vài ngày trước, Microsoft đã dừng cấp phép Claude Code cho phần lớn nhân viên. Đây không phải là trường hợp duy nhất, khi các công ty lớn ở Thung lũng Silicon đang chuyển hướng sang hạn chế và giám sát việc nhân viên sử dụng AI, sau một thời gian thúc đẩy sử dụng tối đa token. Hiện tượng "tokenmaxxing" (tối đa hóa token) bắt đầu phổ biến từ 2025, xuất phát từ quan niệm rằng nhân viên càng dùng nhiều AI thì càng chuyển đổi số tốt. Hậu quả là nhiều người dùng mô hình AI doanh nghiệp đắt tiền cho các tác vụ không quan trọng. Nghiên cứu chỉ ra cứ mỗi đô la chi cho token AI thì có 0.44 đô la dùng để sửa lỗi do AI tạo ra và 0.27 đô la để viết lại mã code từ AI. Cuộc khủng hoảng chi phí đã bùng nổ. Báo cáo của JPMorgan cảnh báo "Chi phí Token AI đang ăn mòn lợi nhuận Internet". Chỉ 14% CFO thấy được lợi tức đầu tư (ROI) rõ ràng từ AI. Vấn đề cốt lõi là tăng hiệu suất cá nhân không đồng nghĩa với tăng trưởng doanh thu cho công ty. Các lãnh đạo như Andrew Macdonald của Uber thừa nhận khó liên kết việc tăng năng suất cá nhân với tác động kinh doanh tổng thể. Sophia Velastegui, cựu Giám đốc AI của Microsoft, nhận xét các công ty thường tự động hóa những công việc nhân viên "ghét" thay vì những việc "tạo ra tiền". Để đối phó, các công ty như Salesforce đang tìm kiếm giải pháp như "bộ định tuyến thông minh" để phân bổ tác vụ cho mô hình phù hợp, tối ưu chi phí. Trên thị trường, các công cụ quản lý chi phí AI như của Harness và CloudZero đang xuất hiện. Một số nhà cung cấp như HubSpot cũng chuyển đổi mô hình định giá từ tính phí theo token sang tính phí theo kết quả (như số cuộc hội thoại giải quyết được). Đây được coi là cơn đau chuyển đổi cần thiết cho ngành công nghiệp AI. Tuy nhiên, bài học lớn hơn là các công ty cần tái thiết kế quy trình làm việc và mô hình kinh doanh xung quanh AI, thay vì chỉ dùng nó để thực hiện công việc cũ một cách nhanh hơn. Nếu không, hóa đơn token sẽ tiếp tục là gánh nặng.

marsbit06/01 04:08

Sau khi đốt cháy hàng chục tỷ USD cho Token, các ông lớn ở Thung lũng Silicon bắt đầu hạn chế lượng Token nhân viên sử dụng

marsbit06/01 04:08

Việc giảm giá 99% của Xiaomi MiMo không phải là chiêu trò marketing! Luo Fuli đăng X để phản bác những kẻ bi quan

Trong bài viết, tác giả phân tích động thái giảm giá API lên tới 99% cho dòng MiMo-V2.5 của Xiaomi và phản bác các ý kiến cho rằng đây chỉ là chiến lược marketing hay "bán lỗ cướp thị trường". Lộ Phúc Lợi, người đứng đầu MiMo, đã công bố một blog kỹ thuật dài 5000 chữ để giải thích cơ sở kỹ thuật của mức giá mới. Bài viết mô tả sáu trụ cột công nghệ chính cho phép mức giảm giá này: 1. **Kiến trúc Hybrid SWA (Sliding Window Attention):** Giảm dung lượng bộ nhớ tạm (KVCache) xuống còn 1/7 so với Full Attention truyền thống. 2. **Quản lý KVCache hai bể riêng biệt:** Tối ưu hóa việc phân bổ bộ nhớ để triệt để tận dụng lợi thế của SWA, tăng gấp 5 lần số lượng người dùng đồng thời. 3. **Hệ thống tiền tố cache được cải tiến:** Đảm bảo an toàn và nâng cao tỷ lệ trúng cache lên tới 93-95%, khiến phần lớn yêu cầu đọc lặp lại hầu như không cần tính toán lại. 4. **Hệ thống lưu trữ phân tán GCache:** Triển khai trực tiếp trên ổ SSD của máy GPU, giảm chi phí lưu trữ xuống gần bằng 0. 5. **Hệ thống điều phối LLM-Router:** Tối ưu định tuyến và lập lịch, ưu tiên các yêu cầu có cache, tăng hiệu suất tổng thể. 6. **Dự đoán đa token (MTP):** Giảm chi phí tạo văn bản (output), hoàn thiện vòng tròn giảm chi phí cho toàn bộ quá trình xử lý. Những cải tiến này, khi kết hợp, tạo ra một chuỗi tối ưu toàn diện làm giảm đáng kể chi phí tính toán và lưu trữ cho mỗi yêu cầu. Bài viết kết luận rằng mức giảm 99% không phải là con số tiếp thị, mà là kết quả có thể chứng minh của một hệ thống kỹ thuật hoàn chỉnh, một phương pháp giảm chi phí đáng để ngành tham khảo.

marsbit05/31 10:39

Việc giảm giá 99% của Xiaomi MiMo không phải là chiêu trò marketing! Luo Fuli đăng X để phản bác những kẻ bi quan

marsbit05/31 10:39

Claude Opus4.8 phát hành, Anthropic bắt đầu biến 'sự tin cậy' thành điểm bán hàng của sản phẩm

Claude Opus 4.8 chính thức ra mắt, giữ nguyên giá và đạt vị trí dẫn đầu trong năm trên sáu bài kiểm tra chuẩn mực. Điểm nổi bật của bản phát hành này không nằm ở việc tăng hiệu suất đơn thuần, mà nằm ở việc Anthropic bắt đầu định vị "độ tin cậy" là ưu tiên cốt lõi của mô hình tiên phong. Đáng chú ý, tỷ lệ báo cáo thiếu về lỗi của chính mô hình trong các tác vụ mã đã giảm mạnh từ 19.7% xuống còn 3.7%. Claude Code giờ đây tích hợp luồng công việc động, cho phép điều phối nhiều tác nhân con và thực hiện kiểm tra đối kháng tự động trước khi giao kết quả. Những cải tiến này nhằm giải quyết nỗi lo ngại thực tế: khi AI chuyển từ cửa sổ trò chuyện sang quy trình công việc thực, nguy cơ lớn nhất thường là nó đưa ra câu trả lời trông có vẻ hoàn chỉnh nhưng lại sai. Ngoài ra, Opus 4.8 có những cải thiện đáng kể trong các bài kiểm tra trách nhiệm, toán học và xử lý ngữ cảnh dài. Mặc dù vậy, báo cáo hệ thống cũng ghi nhận một số điểm yếu so với phiên bản trước, như khả năng kháng prompt injection và hiệu suất trong một số bài kiểm tra chuyên môn. Bản phát hành này đánh dấu sự chuyển hướng trong cuộc đua mô hình: từ việc chỉ theo đuổi điểm số chuẩn mực sang việc tranh giành độ tin cậy, khả năng xác minh và thừa nhận sai sót. Điều này là tiền đề để các Agent AI thực sự trở nên hữu dụng. Anthropic cũng xác nhận một mô hình cấp độ "Mythos" mạnh hơn nhiều, hiện đang bị hạn chế truy cập, sẽ được ra mắt trong vài tuần tới, với Opus 4.8 đóng vai trò là bước đệm công khai hướng tới nó.

marsbit05/29 22:22

Claude Opus4.8 phát hành, Anthropic bắt đầu biến 'sự tin cậy' thành điểm bán hàng của sản phẩm

marsbit05/29 22:22

Bằng chứng không thể chối cãi: GPT-5.5 bị bắt quả tang 'hạ trí', tài liệu chính thức của OpenAI thừa nhận

**Sự thật: GPT-5.5 bị bắt quả tang "giảm trí", tài liệu chính thức của OpenAI thừa nhận** Người dùng phát hiện GPT-5.5, đặc biệt là chế độ "Suy nghĩ mở rộng" (Extended Thinking), có biểu hiện giảm chất lượng đột ngột sau một thời gian sử dụng ngắn (1-2 giờ), trả lời nhanh nhưng kém thông minh trong khi giao diện vẫn hiển thị nhãn cũ. Các khiếu nại trên diễn đàn OpenAI cho thấy mô hình mất khả năng tuân theo chỉ dẫn, xử lý tác vụ kém hơn trước. Một số thử nghiệm tiết lộ: dù chọn GPT-5.5 Thinking, hệ thống thực tế lại chạy phiên bản Instant (dựa trên ngày cắt dữ liệu huấn luyện); hoặc yêu cầu GPT-5.3 Codex nhưng nhận về kết quả từ GPT-5.2. Quan trọng nhất, tài liệu Trung tâm Trợ giúp chính thức của OpenAI xác nhận cơ chế: sau khi người dùng gói Plus dùng hết 160 tin nhắn GPT-5.5/3 giờ, hệ thống sẽ **chuyển thầm (silent switch)** sang mô hình mini mà không có cảnh báo hay thay đổi nhãn giao diện. Người dùng gói Pro cũng có thể bị giới hạn dung lượng ở chế độ Heavy khi máy chủ quá tải. Sự cố "giảm cấp thầm lặng" này không mới, đã từng xảy ra với GPT-5.3 Codex vào tháng 2/2026 và là một mô hình lặp lại qua các bản cập nhật từ GPT-5 đến 5.5. Dù OpenAI từng đánh dấu sự cố "đã giải quyết", các báo cáo mới nhất vẫn tiếp tục xuất hiện. Phân tích cho rằng động cơ có thể là để tiết kiệm chi phí điện toán. Trong khi người dùng vật lộn với trải nghiệm không ổn định của GPT-5.5, thì GPT-5.6 đã xuất hiện trong nhật ký backend, dự kiến ra mắt sớm. Điều này làm dấy lên lo ngại về cuộc đua phát triển AI siêu trí tuệ (ASI) có thể đang hy sinh độ ổn định và minh bạch của dịch vụ hiện tại để theo đuổi các mẫu mới.

marsbit05/27 11:08

Bằng chứng không thể chối cãi: GPT-5.5 bị bắt quả tang 'hạ trí', tài liệu chính thức của OpenAI thừa nhận

marsbit05/27 11:08

Bitroot được mời tham dự Hội nghị AI của Tencent Cloud Singapore, cùng Solana thảo luận về tương lai

Ngày 19/5, sự kiện chủ đề AI do Tencent Cloud tổ chức đã diễn ra tại Singapore, tập trung vào cơ sở hạ tầng AI, triển khai doanh nghiệp, AI Agent, tính toán có thể xác minh Web3 và fintech. Sự kiện quy tụ đại diện từ nhiều lĩnh vực như dịch vụ đám mây, hệ sinh thái blockchain, mạng thanh toán và tổ chức tài chính. Bitroot, một dự án blockchain Layer 1 mới nổi tập trung vào kiến trúc nguyên bản AI và hiệu suất cao, đã được mời tham dự cùng với các đại diện nổi bật như Solana. Việc này phản ánh xu hướng các nhà cung cấp dịch vụ lớn ngày càng quan tâm đến sự kết hợp giữa ứng dụng AI, cơ sở hạ tầng số mới và các giải pháp doanh nghiệp. Bài phát biểu chỉ ra rằng khi AI Agent phát triển từ công cụ hỗ trợ thành chủ thể thực thi, nhu cầu về môi trường thực thi có hiệu suất cao, chi phí thấp, đáng tin cậy và có thể xác minh trên chuỗi sẽ trở nên cấp thiết. Cơ sở hạ tầng Web3, với khả năng thanh toán tự động, tài sản có thể lập trình và kiểm toán minh bạch, có thể bổ sung cho các hệ thống tập trung truyền thống trong các kịch bản này. Giám đốc điều hành Bitroot, Juan Jose, nhấn mạnh rằng cuộc cạnh tranh AI trong tương lai sẽ không chỉ nằm ở mô hình mà còn ở dữ liệu, kịch bản ứng dụng và cơ chế tin cậy. Ông cho rằng kiến trúc nguyên bản AI, khả năng tương thích EVM và cơ chế thực thi song song của Bitroot nhằm mục đích cung cấp môi trường lý tưởng cho các ứng dụng AI Agent và tự động hóa trên chuỗi. Mạng thử nghiệm Bitroot hiện đã đạt hơn 1 triệu địa chỉ, khối lượng giao dịch hàng ngày trên 50.000 và TPS đỉnh 50.000+. Sự tham gia của dự án tại sự kiện cùng lúc với các blockchain đã thành danh như Solana cho thấy ngành công nghiệp đang tìm kiếm những biến số mới trong cơ sở hạ tầng cho làn sóng tích hợp AI và Web3 sắp tới.

marsbit05/27 08:16

Bitroot được mời tham dự Hội nghị AI của Tencent Cloud Singapore, cùng Solana thảo luận về tương lai

marsbit05/27 08:16

Alumni TH Thanh Hoa U00 tuổi Vương Quan ra tác phẩm mới: Dùng 1/900 token, 1/432 sức tính toán, làm đảo lộn mô hình tiền huấn luyện Transformer

Cựu sinh viên Thanh Hoa 00 hậu Vương Quan và nhóm nghiên cứu công bố mô hình HRM-Text, một phương pháp huấn luyện tiền ngôn ngữ hiệu quả sử dụng Mô hình tuần hoàn phân tầng (HRM) thay thế Transformer tiêu chuẩn. Với chỉ 1B tham số và được huấn luyện trên 40B token duy nhất, chi phí ước tính khoảng 1500 USD, HRM-Text đạt hiệu suất tương đương các mô hình nguồn mở từ 2B đến 7B tham số trên các bài kiểm tra chuẩn như MMLU (60.7%) và GSM8K (84.5%). Phương pháp này tiết kiệm đáng kể tài nguyên: sử dụng ít hơn từ 100-900 lần token huấn luyện và 96-432 lần ước tính tính toán so với baseline tiêu chuẩn. Thiết kế chính bao gồm: kiến trúc HRM với module H (chậm) và L (nhanh) cho phép cập nhật đệ quy nhiều lượt trên cùng một token để tăng độ sâu tính toán; và mục tiêu huấn luyện tập trung vào các cặp chỉ dẫn-câu trả lời, chỉ tính toán mất mát trên phần trả lời với cơ chế che PrefixLM. Thử nghiệm cho thấy HRM vượt trội về hiệu quả kiến trúc và ổn định huấn luyện so với Transformer ở cùng quy mô FLOPs. Các hướng phát triển tương lai bao gồm tách biệt "kiến thức" và "suy luận", cơ chế thời gian tính toán thích ứng, xác thực khả năng mở rộng quy mô hơn nữa, và tối ưu hóa việc triển khai PrefixLM trong các framework suy luận thực tế.

marsbit05/26 03:18

Alumni TH Thanh Hoa U00 tuổi Vương Quan ra tác phẩm mới: Dùng 1/900 token, 1/432 sức tính toán, làm đảo lộn mô hình tiền huấn luyện Transformer

marsbit05/26 03:18

Con Đường Mười Nghìn Tỷ Đô La Của DeepSeek: Dùng Mã Nguồn Mở Để Bẩy Lên Hệ Sinh Thái Phần Cứng Trị Giá Nghìn Tỷ

DeepSeek có thể không tập trung vào việc kiếm tiền trực tiếp từ các mô hình hay dịch vụ đăng ký. Thay vào đó, chiến lược dài hạn của họ nhằm tạo ra một hệ sinh thái phần cứng AI thay thế trị giá 10 nghìn tỷ USD, từ đó đạt được định giá 1 nghìn tỷ USD cho chính mình. Thông qua một loạt đổi mới kiến trúc cơ bản như MoE, MLA, DSA, CSA, Engram và mHC, DeepSeek tập trung giải quyết vấn đề then chốt: chạy các mô hình mạnh hơn với ít năng lực tính toán cao cấp hơn. Cụ thể, các kỹ thuật nén KV Cache giúp giảm mạnh sự phụ thuộc vào bộ nhớ HBM đắt đỏ và khan hiếm. Điều này mở đường cho việc sử dụng SSD (NAND) để lưu trữ cache dài hạn và LPDDR để tải trọng số mô hình theo luồng, vốn là những lĩnh vực mà các nhà sản xuất Trung Quốc như YMTC và CXMT đang phát triển. Những đổi mới này không chỉ giảm áp lực lên GPU/ASIC mà còn tạo cơ hội cho nhiều nhà cung cấp phần cứng hơn. Dự án TileLang của DeepSeek cũng nhằm mục đích làm suy yếu "hào cua" CUDA, giúp phần cứng đa dạng hơn có thể chạy các tác vụ AI hiệu quả. Bằng cách mở rộng các kỹ thuật này thông qua mã nguồn mở, DeepSeek đang định hình lại cơ cấu chi phí của cơ sở hạ tầng AI, biến phần cứng thay thế trở nên khả thi và tạo ra một thị trường khổng lồ. Về mặt thương mại, giống như OpenAI có quyền mua cổ phần của AMD, DeepSeek có thể đạt được các thỏa thuận tương tự với các nhà sản xuất phần cứng Trung Quốc, chia sẻ giá trị từ sự phát triển của cả một ngành công nghiệp mới. Tóm lại, DeepSeek không bán mô hình, mà bán "tính khả thi" của thế hệ cơ sở hạ tầng AI tiếp theo.

marsbit05/25 13:17

Con Đường Mười Nghìn Tỷ Đô La Của DeepSeek: Dùng Mã Nguồn Mở Để Bẩy Lên Hệ Sinh Thái Phần Cứng Trị Giá Nghìn Tỷ

marsbit05/25 13:17

Trí Phổ Dựa Vào Đâu Để Tăng Gần 30% Trong Một Ngày?

Hôm nay, cổ phiếu của "cổ phiếu mô hình lớn toàn cầu đầu tiên" Zhipu AI (02513.HK) đã bùng nổ. Động lực chính đến từ một thông số kỹ thuật cụ thể: Tốc độ đầu ra API của phiên bản cao tốc GLM-5.1 (GLM-5.1-highspeed) đạt 400 token/giây, thiết lập kỷ lục mới về tốc độ API trong ngành công nghiệp mô hình lớn toàn cầu. Tốc độ 400 token/giây này quan trọng như thế nào? Khi AI chuyển từ ChatBot sang thời đại Agent, mỗi tác vụ thường yêu cầu hàng chục hoặc thậm chí hàng trăm lần gọi mô hình. Độ trễ thấp ở đây trở thành yếu tố then chốt, trực tiếp ảnh hưởng đến trải nghiệm người dùng và hiệu quả công việc. Tốc độ này nhanh gấp khoảng 3-5 lần so với các mô hình hàng đầu hiện tại như GPT-4o hay Claude Sonnet. Để đạt được bước đột phá này, Zhipu AI đã thực hiện những đổi mới đồng thời trên ba cấp độ: 1. **TileRT – Công cụ suy luận:** Biên dịch toàn bộ mô hình thành một động cơ chạy liên tục, loại bỏ chi phí khởi động và chờ đợi lặp đi lặp lại giữa các toán tử, cho phép GPU duy trì hoạt động ở tốc độ cao. 2. **Chiến lược song song:** Tối ưu hóa việc triển khai cơ chế chú ý MLA (Multi-head Latent Attention) của GLM-5.1 trên nhiều GPU. Họ áp dụng kiến trúc chạy không đồng nhất, trong đó GPU 0 chuyên xử lý chỉ mục thưa thớt và định tuyến, trong khi các GPU khác xử lý tính toán dày đặc, giảm thiểu đáng kể chi phí giao tiếp. 3. **Kiến trúc mạng ZCube:** Một thiết kế mạng mới thay thế cấu trúc ROFT (Fat-Tree) truyền thống. ZCube loại bỏ lớp Spine (xương sống), làm phẳng toàn bộ mạng và kết nối tất cả các bộ chuyển mạch Leaf (lá) theo một cấu trúc đặc biệt. Thiết kế này đảm bảo rằng giữa hai GPU bất kỳ chỉ có một đường dẫn tối ưu duy nhất, về cơ bản loại bỏ khả năng tắc nghẽn mạng do cân bằng tải không hiệu quả. Những cải tiến này mang lại lợi ích rõ ràng: cụm sản xuất nâng cấp lên ZCube đạt được mức tăng 15% thông lượng, giảm 40.6% độ trễ đuôi và giảm khoảng một phần ba chi phí thiết bị mạng. Về lâu dài, công nghệ này không chỉ nâng cao hiệu quả sử dụng GPU mà còn có thể định hình lại cấu trúc hạ tầng AI, mở ra cơ hội cho các nhà cung cấp chip AI, thiết bị chuyển mạch và mô-đun quang trong nước.

marsbit05/23 01:25

Trí Phổ Dựa Vào Đâu Để Tăng Gần 30% Trong Một Ngày?

marsbit05/23 01:25

活动图片