Khi các dịch vụ mã hóa, nén, lập chỉ mục, ghi nhớ và ngữ cảnh tiến lại gần phương tiện lưu trữ, ranh giới giá trị giữa SSD, DRAM, HBM và HBF sẽ được định nghĩa lại.
AI Agent đang biến máy tính từ "hoàn thành một lần gọi mô hình sau khi nhận câu hỏi" trở thành một hệ thống vận hành liên tục quan sát, suy luận, gọi công cụ, sửa đổi môi trường và duy trì trạng thái.
Một tác vụ có thể truy cập liên tục vào mô hình, bộ nhớ, chỉ mục vector, cơ sở dữ liệu nghiệp vụ, lưu trữ đối tượng và dịch vụ mạng, đồng thời liên tục ghi lại kết quả công cụ, lộ trình thực thi, sở thích người dùng, ngữ cảnh tạm thời và hồ sơ kiểm toán. Agent chạy càng lâu, giá trị càng phụ thuộc vào việc dữ liệu có được lưu trữ an toàn, truy xuất chính xác, cập nhật kịp thời và tái sử dụng chi phí thấp hay không [1].
Điều này có nghĩa là bộ nhớ không còn chỉ là điểm kết thúc ghi dữ liệu sau khi Agent hoàn thành công việc, mà sẽ dần dần đi vào vòng lặp nhận thức, ghi nhớ và ra quyết định của Agent. AI SSD đã cho thấy hướng đi đầu tiên: lưu trữ mô hình và Adapter, tiếp nhận KV Cache bị đẩy ra khỏi bộ nhớ, rút ngắn thời gian khởi động từ trạng thái lạnh, mở rộng dung lượng mô hình có thể triển khai. Tiến thêm một bước nữa, SSD còn có thể thực hiện mã hóa, nén, loại bỏ trùng lặp, đánh dấu, lập chỉ mục, bảo trì phiên bản và quản lý vòng đời khi dữ liệu được ghi xuống, đồng thời cung cấp dung lượng lâu dài cho Bộ nhớ Agent.
Thay đổi này không xuất hiện từ không khí. Ổ đĩa tự mã hóa đã có thể hoàn tất mã hóa và giải mã dữ liệu trong suốt bên trong bộ điều khiển; tiêu chuẩn lưu trữ tính toán liệt kê nén, mã hóa, lọc chính quy và mã xóa là các chức năng có thể được thực thi bởi phía lưu trữ; các sản phẩm như Samsung SmartSSD cũng từng chuyển quá trình quét cơ sở dữ liệu và xử lý video xuống phía ổ đĩa [4][5][7]. Điểm mới trong thời đại Agent là những khả năng này không còn chỉ phục vụ xử lý dữ liệu chung chung, mà bắt đầu được kết hợp lại xoay quanh danh tính, ngữ cảnh, trí nhớ, lộ trình công cụ và chi phí Token của tác nhân thông minh.
Trong thị trường tương lai, có thể xuất hiện các tên gọi như "SSD An toàn", "SSD Nén", "SSD Truy xuất", "SSD Trí nhớ" hoặc "SSD Ngữ cảnh", cũng có thể không hình thành các danh mục phần cứng tách biệt mà hợp nhất thành SSD kiểu chức năng có thể lập trình: hình thức cơ bản vẫn tương thích với lưu trữ tiêu chuẩn, phần mềm lớp trên phát hiện và gọi chức năng thiết bị theo ngữ cảnh.
NVMe đã hình thành các tập lệnh như Computational Programs và Subsystem Local Memory, cung cấp đường dẫn tiêu chuẩn hóa cho việc phát hiện, cấu hình và thực thi chương trình phía thiết bị [6]. Vấn đề công nghiệp thực sự không chỉ là có thể đặt một bộ xử lý bên trong ổ đĩa hay không, mà là ai sẽ định nghĩa ngữ nghĩa dữ liệu, ranh giới chức năng và kết quả đầu cuối.
Agent Không Phải Một Lần Gọi
Mà Là Một Chuỗi Dữ Liệu Được Ghi Liên Tục
Đối tượng bền vững chính của chatbot truyền thống là bản ghi cuộc trò chuyện, trong khi Agent sẽ tạo ra đồ thị dữ liệu phức tạp hơn. Nó cần lưu trữ kết quả quan sát, đầu ra công cụ, kế hoạch và suy ngẫm, trạng thái trung gian của tác vụ, hồ sơ người dùng, ảnh chụp nhanh môi trường, bằng chứng truy xuất và nhật ký thực thi; phía mô hình còn tạo ra KV Cache, Prefix Cache, Adapter, trọng số chuyên gia và Checkpoint. Thời điểm cập nhật, phạm vi tái sử dụng và cấp độ an toàn của các đối tượng khác nhau là khác nhau, nhưng cùng nhau quyết định việc suy luận tiếp theo có thể tiếp tục hay không.
Bộ nhớ Agent cũng không đồng nghĩa với việc nhồi nhét tất cả lịch sử trò chuyện vào cơ sở dữ liệu vector. Nghiên cứu hệ thống gần đây về Bộ nhớ Agent từ góc độ quản lý dữ liệu đã chia nó thành bốn mô-đun: biểu diễn và lưu trữ, trích xuất thông tin, truy xuất và định tuyến, bảo trì, và chỉ ra rằng không có một kiến trúc nào có thể tối ưu trên mọi khối lượng công việc [9].
Các hệ thống như Mem0 cũng nhấn mạnh việc chuyển đổi cuộc trò chuyện gốc thành ký ức dài hạn nhỏ gọn hơn, có thể tái sử dụng, để giảm tải Token đầu vào và gánh nặng truy xuất trong các phiên dài [10]. Điều này có nghĩa là lớp lưu trữ trong tương lai vừa phải lưu trữ nội dung, vừa phải lưu trữ cách thức nội dung được tổ chức, cập nhật và quên lãng.
Do đó, việc ghi dữ liệu Agent xuống đĩa cần một thỏa thuận phong phú hơn "ghi thành công". Một đối tượng bộ nhớ nên mang theo danh tính người dùng hoặc Agent, người thuê, nguồn gốc, thời gian, phiên bản, quyền, độ tin cậy, thời hạn lưu giữ và khả năng xóa; ngữ cảnh mô hình còn cần liên kết với phiên bản mô hình, Tokenizer, mã hóa vị trí và Adapter. Chỉ khi không gian tên và vòng đời được xác định rõ ràng, các hoạt động nén, lập chỉ mục, lưu vào bộ nhớ cache và chia sẻ sau này mới không phá vỡ ranh giới ngữ nghĩa.
Vai trò hợp lý của SSD kiểu chức năng trong chuỗi dữ liệu này không phải là tự đánh giá một trải nghiệm có đáng nhớ hay không, mà là thực hiện công việc xác định gần dữ liệu sau khi Runtime đã cung cấp đối tượng và chiến lược. Ví dụ: chọn khóa theo người thuê, đặt dữ liệu theo vòng đời, nén và loại bỏ trùng lặp các đối tượng có thể thu nhỏ, bảo trì trang chỉ mục và siêu dữ liệu, ưu tiên hoàn tất việc tải lại sắp được sử dụng cho suy luận, và phản hồi độ trễ đuôi, hiện tượng khuếch đại ghi và tình trạng phương tiện lưu trữ cho lớp trên. Quyết định ngữ nghĩa được giữ lại cho Agent và Runtime, việc thực thi dữ liệu càng gần phương tiện lưu trữ càng tốt.

Hình 1: Phổ khả năng của SSD kiểu chức năng trong thời đại Agent. Các chức năng an toàn, giảm nội dung, chỉ mục, bộ nhớ, ngữ cảnh suy luận và quản trị có thể được củng cố trong thiết bị, hoặc có thể được hoàn thành bởi chương trình có thể tải xuống, Runtime và nút lưu trữ cùng nhau. Hình minh họa là suy diễn cơ chế ngành, ranh giới năng lực lưu trữ tính toán và an toàn tham khảo đặc điểm kỹ thuật SNIA và NVMe [4][5][6].
Phán đoán cốt lõi: Nâng cấp SSD trong thời đại Agent không chỉ đơn giản là tăng sức mạnh tính toán trong ổ đĩa, mà là kết hợp thiết bị khối tiêu chuẩn, chức năng gần dữ liệu có thể phát hiện, ngữ nghĩa đối tượng và quản trị vòng đời. Chức năng càng gần phương tiện lưu trữ càng phải xác định, có thể kiểm toán, có thể cách ly; quyết định càng gần mô hình càng cần được giữ lại trong Runtime.
Mã hóa tự động đã tồn tại, sự thay đổi nằm ở việc chiến lược bắt đầu theo sau Agent
"Mã hóa tự động khi dữ liệu ghi xuống đĩa" không phải là khái niệm tương lai. Ổ đĩa tự mã hóa sẽ được mã hóa dữ liệu ghi, giải mã dữ liệu đọc bởi phần cứng chuyên dụng trong bộ điều khiển, và thực hiện bảo vệ dữ liệu tĩnh trong suốt thông qua quản lý khóa và kiểm soát chính sách [5].
Đối với hệ thống Agent, yêu cầu mới là độ chi tiết mã hóa từ toàn bộ ổ đĩa hoặc một không gian tên duy nhất được tinh chỉnh hơn nữa đến người dùng, Agent, tác vụ và đối tượng: ký ức cá nhân và bộ nhớ cache ứng dụng trên cùng một thiết bị phía đầu cuối không được vượt quyền lẫn nhau, ngữ cảnh chia sẻ của Agent đa người thuê phía đám mây cũng phải xác định rõ những gì có thể tái sử dụng, những gì chỉ được đọc trong một miền quyền.
Đặc điểm kỹ thuật NVMe đã giới thiệu các khả năng chi tiết hơn như khóa do máy chủ quản lý và Key Per I/O [6], cung cấp nền tảng cho việc mỗi I/O mang theo ngữ cảnh bảo mật khác nhau. SSD kiểu an toàn trong tương lai còn có thể kết hợp nguồn gốc dữ liệu, dấu thời gian, hồ sơ truy cập, kiểm tra tính toàn vẹn và xóa tin cậy, khiến Agent không chỉ có thể trả lời "tôi nhớ gì", mà còn có thể trả lời "ký ức này đến từ đâu, có bị sửa đổi không, ai đã đọc, khi nào phải xóa". Đối với tài chính, y tế, kho kiến thức doanh nghiệp và AI cá nhân, chuỗi bằng chứng có thể quan trọng như tốc độ truy xuất.
Mã hóa cũng sẽ thay đổi thứ tự của các chức năng gần dữ liệu khác. Luồng byte sau khi mã hóa thường khó nén và loại bỏ trùng lặp hiệu quả, do đó việc giảm nội dung nói chung nên thực hiện trước mã hóa [5]; lập chỉ mục cần phân biệt ranh giới giữa đặc điểm văn bản gốc, siêu dữ liệu được bảo vệ và văn bản mã hóa có thể tìm kiếm. Khả năng cạnh tranh của SSD kiểu chức năng không chỉ là có bao nhiêu chức năng, mà là có thể sử dụng đường ống có thể xác minh để tổ chức nén, lập chỉ mục, mã hóa, ghi đĩa và xóa một cách chính xác hay không, đồng thời tránh bất kỳ khâu nào mở rộng mặt tấn công.
Nén, lập chỉ mục và bảo trì bộ nhớ có thể trở thành chức năng SSD tiếp theo
Nén là một trong những chức năng dễ hình thành vòng khép kín thương mại nhất. Agent sẽ liên tục ghi văn bản, JSON, nhật ký, vector, Checkpoint và kết quả trung gian đa phương tiện, trong đó một phần đáng kể có cấu trúc lặp lại. Nếu nén được hoàn tất trước khi dữ liệu vào mạng hoặc NAND, có thể giảm truyền tải, ghi vật lý và chiếm dụng dung lượng, đồng thời gián tiếp giảm tiêu thụ năng lượng và hao mòn phương tiện. Nhưng tỷ lệ nén, độ trễ bổ sung, tiết kiệm CPU và hiện tượng khuếch đại ghi phải được đánh giá cùng nhau; đối với trọng số mô hình đã được lượng tử hóa hoặc nén cao, tiếp tục nén có thể mang lại lợi ích hạn chế.
Chức năng lập chỉ mục liên quan trực tiếp hơn đến Agent, vì bộ nhớ chỉ có giá trị khi được gọi lại chính xác. KIOXIA AiSAQ đặt vector và cấu trúc chỉ mục trên SSD, sử dụng phân cụm và tìm kiếm đồ thị thân thiện với SSD để giảm chiếm dụng DRAM, và đã trình diễn truy xuất vector quy mô hàng chục tỷ trên một máy chủ duy nhất [8]. Điều cần phân biệt nghiêm ngặt là, AiSAQ trước hết là một bộ công nghệ phần mềm lấy SSD làm phương tiện chỉ mục chính, không có nghĩa là SSD thông thường sẽ tự động tạo Embedding hoặc hiểu ngữ nghĩa. Con đường ngành có thể hơn là GPU, NPU hoặc CPU chịu trách nhiệm tạo biểu diễn, SSD và chương trình gần dữ liệu chịu trách nhiệm tổ chức chỉ mục, lọc ứng viên và trả về tập kết quả nhỏ hơn.
Bảo trì bộ nhớ phức tạp hơn lập chỉ mục. Bộ nhớ Agent dài hạn sẽ xảy ra thêm mới, hợp nhất, xung đột, sửa đổi, giảm quyền, hết hạn và quên lãng; cùng một sự thật còn có thể đồng thời tồn tại bản ghi gốc, tóm tắt, vector và biểu diễn đồ thị tri thức [9]. "SSD Trí nhớ" trong tương lai có thể cung cấp cập nhật nguyên tử, nhật ký, TTL, đặt nóng lạnh và xóa an toàn cho các phiên bản này, nhưng không thể chỉ dựa vào độ tương tự để quyết định ký ức thực sự là gì. Chất lượng bộ nhớ vẫn phụ thuộc vào việc trích xuất, định tuyến, xử lý xung đột và đánh giá ở lớp trên.
Từ góc độ sản phẩm, những chức năng này không nhất thiết cần mỗi ổ đĩa đều chạy mô hình phức tạp. Nén, mã hóa, băm, lọc, bảo trì trang chỉ mục và vòng đời đối tượng đều phù hợp với mạch chuyên dụng hoặc chương trình nhẹ xác định; Embedding, sắp xếp lại, tóm tắt và hợp nhất bộ nhớ có thể được hoàn thành bởi máy chủ hoặc bộ tăng tốc độc lập.
Điểm then chốt của SSD kiểu chức năng là sử dụng ID đối tượng thống nhất và giao diện có thể quan sát để kết nối hai loại công việc, nhằm di chuyển ít dữ liệu hơn, chứ không phải nhồi nhét tất cả tính toán AI vào ổ đĩa.
Phía đầu cuối: SSD có thể trở thành lớp trạng thái dài hạn của Agent cá nhân
Agent phía đầu cuối sẽ tiếp xúc liên tục với tài liệu cá nhân, ảnh, email, lịch trình, trạng thái ứng dụng, hồ sơ duyệt web và dữ liệu cảm biến thiết bị. Bộ nhớ thống nhất chỉ phù hợp để giữ lại tập làm việc hiện tại, trong khi SSD có thể lưu trữ thư viện mô hình cục bộ lớn hơn, Adapter, chỉ mục vector, ký ức cá nhân và lộ trình công cụ. Chỉ cần duy trì hình thức NVMe tiêu chuẩn, SSD kiểu chức năng trước tiên vẫn có thể được cài đặt trực tiếp làm ổ hệ thống thông thường bởi AI PC và trạm làm việc, sau đó dần dần mở khóa khả năng an toàn, chỉ mục và ngữ cảnh thông qua driver, Runtime và firmware.
Giá trị của nó đối với người tiêu dùng không phải là "ổ cứng biết suy nghĩ", mà là AI cục bộ có thể nhớ lâu hơn, tiếp tục làm việc trong điều kiện mạng yếu, và giảm dữ liệu thô và Token đầu vào tải lên đám mây mỗi lần tác vụ. Agent hội nghị có thể lưu trữ trạng thái âm thanh, tóm tắt và tác vụ, Agent lập trình có thể duy trì chỉ mục kho lưu trữ và lịch sử sửa đổi, Agent gia đình có thể chia sẻ ảnh, tài liệu và trạng thái thiết bị đã được ủy quyền trên các thiết bị. SSD giữ các trạng thái này gần thiết bị, Router sau đó quyết định xử lý cục bộ hay gọi đám mây dựa trên chất lượng, quyền riêng tư, tiêu thụ điện năng và mạng.
Thị trường phía đầu cuối cũng có thể mở rộng từ một ổ đĩa thành nút lưu trữ nhỏ. AI PC, máy chủ gia đình hoặc hộp biên tại cửa hàng có thể cung cấp hình ảnh mô hình cục bộ, ký ức cá nhân, thư viện vector và lưu trữ mã hóa cho điện thoại, máy tính bảng, robot và camera, tránh việc mỗi thiết bị lặp lại lưu trữ cùng một bộ dữ liệu. Mô hình kinh doanh sẽ mở rộng từ nâng cấp dung lượng sang phụ phí AI PC, đăng ký Agent cục bộ, quản lý mô hình và gói kỹ năng, cũng như nút AI riêng tư cho gia đình và doanh nghiệp nhỏ.
Lưu trữ cục bộ không tự động đồng nghĩa với quyền riêng tư. Nếu ứng dụng có thể đọc bộ nhớ tùy ý, chỉ mục không thể xóa phiên bản cũ, khóa và danh tính thiết bị tách rời, thì càng nhiều chức năng càng có nghĩa là mặt tấn công lớn hơn. SSD kiểu chức năng phía đầu cuối phải coi cách ly ứng dụng, sự đồng ý của người dùng, thời hạn lưu giữ, xóa có thể xác minh và thu hồi khóa sau khi mất thiết bị là khả năng sản phẩm, chứ không chỉ coi quyền riêng tư như khẩu hiệu tiếp thị.
Phía đám mây: SSD sẽ đi từ thiết bị đến nút lưu trữ Agent
Quy mô trạng thái của Agent phía đám mây lớn hơn và cũng cần chia sẻ nhiều hơn. Một yêu cầu phức tạp sẽ nối tiếp nhiều lần gọi mô hình, thực thi công cụ, truy cập bộ nhớ và truyền tải mạng; hợp tác đa Agent còn tạo ra kế hoạch, tin nhắn, bằng chứng và nhật ký thực thi chia sẻ [1]. SSD cục bộ tại nút có thể lưu trữ mô hình, Checkpoint và chỉ mục tần suất cao, lớp Flash cấp giá đỡ hoặc POD có thể tiếp nhận KV, Prefix, Adapter và bộ nhớ chia sẻ được tái sử dụng trên nhiều GPU, lưu trữ đối tượng chung tiếp tục lưu trữ dữ liệu trạng thái lạnh và nguồn sự thật dài hạn.
Mooncake đã tổ chức CPU, DRAM, SSD và RDMA/NIC thành nhóm KV Cache phân tán, và để trình lập lịch quyết định đường dẫn yêu cầu dựa trên vị trí bộ nhớ cache và mục tiêu TTFT, TBT [3]. NVIDIA CMX thì thiết lập lớp ngữ cảnh Flash cấp POD hướng đến KV Cache giữa HBM, bộ nhớ máy chủ và lưu trữ chia sẻ chung, đưa nút lưu trữ chia sẻ vào đường dẫn dữ liệu suy luận [2]. Lợi ích đầu cuối của các hệ thống này không thể chỉ quy cho một SSD duy nhất, nhưng cho thấy "nút lưu trữ tham gia sản xuất Token" đang đi từ khái niệm đến sản phẩm cơ sở hạ tầng.
Nút lưu trữ Agent thế hệ tiếp theo có thể đồng thời cung cấp dịch vụ ngữ cảnh, bộ nhớ và quản trị. Nó có thể duy trì thư mục Prefix và KV chia sẻ, khởi động nóng mô hình và Adapter, lưu trữ chỉ mục vector và đồ thị, nén và mã hóa dữ liệu theo người thuê, ghi lại lệnh gọi công cụ và chuỗi bằng chứng, đồng thời phơi bày tỷ lệ trúng, P99, hiện tượng khuếch đại ghi, tiêu thụ năng lượng và tình trạng phương tiện lưu trữ cho trình lập lịch. Những gì khách hàng mua sẽ không chỉ là dung lượng và băng thông của ổ đĩa, mà còn là tỷ lệ sử dụng GPU, SLO goodput, Token/$, Token/W, QPS/$ và tốc độ phản hồi kiểm toán.
Điều này cũng sẽ thay đổi mô hình kinh doanh. Ổ đĩa đơn vẫn có thể được bán theo dung lượng, độ bền và hiệu suất; nút lưu trữ thì có thể hình thành doanh thu kết hợp dưới dạng Appliance nhiều ổ, mặt phẳng điều khiển, cấp phép Runtime, hỗ trợ dài hạn và SLA; lớp trên còn có thể xuất hiện dịch vụ tính phí theo dung lượng ngữ cảnh hiệu quả, số lượng đối tượng bộ nhớ, thông lượng truy xuất hoặc Token hiệu quả. Một khi SSD kiểu chức năng chịu trách nhiệm cho kết quả đầu cuối, ranh giới giá trị sẽ mở rộng từ linh kiện bán dẫn sang cơ sở hạ tầng dữ liệu.

Hình 2: Phân công điển hình của bộ nhớ Agent phía đầu cuối và phía đám mây. Phía đầu cuối nhấn mạnh dữ liệu cá nhân, mô hình cục bộ, khả năng ngoại tuyến và kiểm soát quyền riêng tư; phía đám mây nhấn mạnh ngữ cảnh chia sẻ, quản trị đa người thuê, tỷ lệ sử dụng GPU và kinh tế học Token. Hình minh họa là suy diễn hình thức sản phẩm, phía cụm tham khảo Mooncake và CMX [2][3].
Ranh giới giá trị giữa HBM, HBF, DRAM và SSD sẽ được định nghĩa lại
Tái cấu trúc lưu trữ do Agent mang lại không nên được hiểu là SSD thay thế bộ nhớ. Ý tưởng Tiered Memory do SK hynix đề xuất tại FMS 2026 là kết nối HBM, DRAM, NAND/HBF và SSD theo tốc độ, dung lượng và chi phí, tập trung giảm di chuyển dữ liệu [11]. Điều này tương ứng với thực tế của hệ thống Agent: dữ liệu phải sử dụng cho Token hiện tại, dữ liệu sẽ sử dụng trong vài mili giây tới, dữ liệu có thể tái sử dụng qua các phiên và dữ liệu lưu trữ dài hạn, cần các phương tiện lưu trữ khác nhau tiếp nhận.
HBM vẫn là lớp lõi gần tính toán GPU nhất, mang trọng số hiện tại, kích hoạt, KV nóng và trạng thái trung gian của toán tử, chỉ số là Token/s, băng thông và tỷ lệ sử dụng tính toán. Agent tăng ngữ cảnh dài và hợp tác đa mô hình, sẽ đẩy cao hơn nhu cầu về HBM, chứ không làm suy yếu giá trị của nó. Hạn chế của HBM là chi phí dung lượng và nguồn cung, do đó hệ thống cần di chuyển dữ liệu không cần truy cập ngay lập tức sang lớp chi phí thấp hơn, và khởi động nóng chính xác trước khi sử dụng.
HBF, tức High Bandwidth Flash, là cấp độ mới hình thành nhanh chóng từ năm 2025. Thông số kỹ thuật mở đầu tiên được SK hynix và Sandisk công bố vào tháng 8 năm 2026 bao phủ dung lượng tối đa 512GB, băng thông chia thành ba cấp từ khoảng 0.4TB/s đến 3.0TB/s, và sử dụng kết nối UCIe với bộ xử lý [12]. HBF sử dụng NAND để có dung lượng lớn hơn HBM, mục tiêu là tiếp nhận tập công việc suy luận lớn chuyên về đọc giữa HBM và SSD. Nó vẫn đang trong giai đoạn đầu tiêu chuẩn hóa và sản phẩm hóa, thông số kỹ thuật chính thức không bằng hiệu suất sản xuất rộng rãi, cũng không thể loại bỏ hạn chế của NAND về độ trễ, độ bền ghi và truy cập trạng thái biến đổi.
Nghiên cứu H3 đưa ra một sự phân công rõ ràng hơn: đặt dữ liệu chỉ đọc trên HBF, giữ các dữ liệu khác trong HBM, sử dụng ưu điểm của cả hai để xây dựng hệ thống suy luận hỗn hợp [13]. Đối với Agent, HBF phù hợp hơn với trọng số mô hình, chuyên gia MoE và tập công việc lớn chủ yếu là đọc; KV, kích hoạt và trạng thái chạy cập nhật thường xuyên vẫn phù hợp hơn với HBM hoặc DRAM. Nếu HBF trưởng thành, có thể giảm nhu cầu tăng GPU/HBM vì dung lượng, nhưng nhiều khả năng hơn là bổ sung chứ không thay thế.
DRAM và CXL nằm ở vùng đệm trung gian của trạng thái biến đổi và dung lượng chia sẻ. Host KV, tập nóng chỉ mục, bộ đệm tải trước và trạng thái chạy Agent cần độ trễ thấp và sửa đổi thường xuyên; mở rộng, tổng hợp và chia sẻ CXL có thể giảm đảo bộ nhớ, và cung cấp dung lượng linh hoạt hơn cho nhiều máy chủ [14]. SK hynix tại FMS 2026 còn trình diễn bộ nhớ tổng hợp CXL và giải pháp hỗn hợp DRAM-SSD cho chia sẻ KV, dự đoán và tải trước, nhưng đây là kết quả trình diễn cụ thể, cần được xác minh trên nhiều nền tảng hơn [11].
SSD kiểu chức năng đảm nhận các đối tượng ấm lạnh lớn hơn, bền vững hơn, cần quản trị nhiều hơn: mô hình, Adapter, KV/Prefix, chỉ mục vector, Bộ nhớ Agent, nhật ký và Checkpoint. So với HBF, SSD xa tính toán hơn, nhưng có hình thức tiêu chuẩn, hệ sinh thái trưởng thành, ưu thế về dung lượng và chi phí, và cũng phù hợp hơn để chia sẻ cấp nút. Cạnh tranh tương lai sẽ không chỉ xoay quanh băng thông phương tiện lưu trữ, mà sẽ xoay quanh ai có thể giao đúng đối tượng trong thời hạn chính xác, và chịu trách nhiệm cho Token hiệu quả, thông lượng truy xuất và quản trị dữ liệu.

Hình 3: Phân công lại giữa HBM, HBF, DRAM/CXL, SSD kiểu chức năng và lưu trữ chia sẻ trong thời đại Agent. Thông số kỹ thuật HBF sử dụng thông số mở đầu tiên được SK hynix và Sandisk công bố vào tháng 8 năm 2026 [12]; logic phân lớp tham khảo Tiered Memory FMS 2026, H3 và tài liệu CXL [11][13][14].
AI SSD là mẫu ngành đầu tiên của SSD kiểu chức năng
AI SSD hiện có về cơ bản đi vào xu hướng này từ hai phía. Một bên là SSD doanh nghiệp được tăng cường cho tải AI, thông qua độ trễ thấp, IOPS cao, băng thông liên tục, độ bền và mật độ dung lượng, cung cấp nền tảng phương tiện lưu trữ cho bộ nhớ cache mô hình, Checkpoint và chỉ mục vector. Yingren N3X và Huawei OceanDisk LC 560 thuộc loại đại diện này [19][20]. Chúng trước hết giải quyết vấn đề dữ liệu AI có thể được tiếp nhận ổn định, ghi liên tục và gọi lại kịp thời hay không, không phải vì hướng đến AI mà tự động sở hữu ngữ nghĩa Bộ nhớ Agent, chỉ mục hoặc ngữ cảnh. Bên còn lại bắt đầu chủ động tham gia đường dẫn dữ liệu suy luận: SSD không còn chỉ nhận yêu cầu khối chung từ hệ điều hành, mà thông qua phần mềm trung gian, Runtime hoặc khả năng xử lý phía lưu trữ, dần dần nhận diện các đối tượng AI như trọng số mô hình, chuyên gia, KV Cache và cửa sổ tải trước. Phison, Longsys và Inpera-Lianyun đúng là ba cách thức tổ chức nghiên cứu phát triển đại diện theo hướng này.
Phison aiDAPTIV áp dụng phương án "khả năng SSD trưởng thành + phần mềm trung gian + chuỗi công cụ hoàn chỉnh". aiDAPTIVLink chịu trách nhiệm quản lý bộ nhớ giữa bộ nhớ GPU và Flash, thời gian chạy cắt lát trọng số mô hình, ưu tiên giữ lại trọng số hoạt động trong VRAM, dỡ trọng số không hoạt động vào SSD aiDAPTIVCache, và có thể lưu KV Cache bị đẩy ra, tránh tính toán lại khi ngữ cảnh bị loại bỏ [15]. Giá trị thương mại của lộ trình này nằm ở việc kết hợp SSD, cấp phép phần mềm, công cụ triển khai và hỗ trợ hệ thống thành giải pháp có thể giao hàng: khách hàng không cần thiết kế lại chip tính toán, vẫn có thể mở rộng dung lượng mô hình và ngữ cảnh có thể sử dụng trên trạm làm việc hoặc máy chủ cục bộ. Trọng tâm kỹ thuật của nó là tương thích với hệ sinh thái GPU và phần mềm AI hiện có, và dựa vào bộ điều khiển, firmware, thiết kế độ bền và hợp tác nền tảng trưởng thành, biến Flash thành lớp dung lượng ổn định ngoài bộ nhớ GPU.
Longsys SPU+iSA gần hơn với sự kết hợp "lớp thực thi lưu trữ + lớp quyết định phần mềm". SPU đảm nhận nén không mất mát, bộ nhớ cache cao cấp HLC và lập lịch dữ liệu giữa các phương tiện NAND khác nhau ở phía thiết bị; iSA thì xoay quanh việc dỡ chuyên gia MoE, vòng đời KV Cache và Device Smart Prefetch để đưa ra quyết định, chuyển đặc điểm tải AI thành hành động tải trước, ghi lại, nén và di chuyển nóng lạnh [16]. Do đó, nó quan tâm không chỉ là đưa nhiều dữ liệu hơn vào SSD, mà còn giảm chiếm dụng DRAM, tăng dung lượng hiệu quả, và để xử lý phía lưu trữ phù hợp với nhịp suy luận phía đầu cuối. Lộ trình này chỉ ra rằng, khi có khả năng thực thi mạnh hơn gần bộ điều khiển, SSD có thể từ thiết bị khối tiến thêm một bước trở thành nút xử lý gần dữ liệu có thể đảm nhận nén, bộ nhớ cache và lập lịch đối tượng.
Inpera-Lianyun áp dụng lộ trình được định nghĩa chung bởi tính toán và lưu trữ. Inpera xuất phát từ cấu trúc mô hình, Runtime, hệ điều hành, sự phối hợp CPU/GPU/DRAM và thiết kế tham khảo nguyên máy, quan sát kích hoạt chuyên gia, vòng đời KV, độ chính xác dữ liệu và cửa sổ tính toán; Lianyun thì ánh xạ các nhu cầu này vào bộ điều khiển SSD, firmware, phân vùng bộ nhớ cache, hàng đợi, thích ứng NAND và hệ thống sản xuất hàng loạt [17][18]. Điều này khiến định nghĩa sản phẩm có thể suy ngược từ độ trễ Token, dung lượng mô hình và SLO nguyên máy để quyết định dữ liệu nên vào SSD khi nào, lưu với độ chi tiết nào, tải trước ra sao, và hoạt động nào phù hợp để chuyển xuống gần bộ điều khiển, thay vì chỉ tối ưu hóa cục bộ trên I/O khối hiện có. So với hai lộ trình trước, sự hợp tác xuyên tính toán - lưu trữ này cần sự phối hợp hệ thống sâu hơn, nhưng cũng có nhiều cơ hội hơn để phát hiện sớm các vấn đề đường dẫn dữ liệu mới và hình thành giao diện thiết bị mới khi kiến trúc mô hình và hạ tầng suy luận tiếp tục thay đổi.
Ba lộ trình không loại trừ lẫn nhau. Ưu thế của Phison nằm ở việc đóng gói nhanh khả năng thành giải pháp có thể triển khai bằng bộ điều khiển trưởng thành, sản phẩm SSD và chuỗi công cụ phần mềm; Longsys cố gắng sử dụng SPU và iSA để đưa nhiều xử lý và lập lịch hơn sang phía lưu trữ; Inpera-Lianyun thì định nghĩa ngược thiết bị từ giao diện giữa ngữ nghĩa tính toán và thực thi lưu trữ. Cùng nhau, chúng chỉ ra rằng, đổi mới cốt lõi của AI SSD đã chuyển từ "thay một ổ đĩa nhanh hơn cho AI" sang "định nghĩa lại trách nhiệm giữa Runtime, cấp bộ nhớ, bộ điều khiển và Flash". Đây cũng là lý do AI SSD có thể trở thành sản phẩm tiên phong của SSD kiểu chức năng: một khi phần mềm có thể biểu đạt cho thiết bị loại đối tượng, mức độ ưu tiên, vòng đời và thời hạn dịch vụ, SSD đã có nền tảng để mang nhiều chức năng xác định hơn.
Tư duy nghiên cứu phát triển tương tự hoàn toàn có thể chuyển sang SSD kiểu chức năng thế hệ tiếp theo. Dọc theo lộ trình Phison, nhà sản xuất có thể thêm mô-đun dịch vụ mã hóa, nén, chỉ mục và bộ nhớ được quản lý theo Agent hoặc người thuê vào sự kết hợp SSD và phần mềm trung gian, giảm ngưỡng triển khai bằng khả năng tương thích phần mềm và công cụ giao hàng; dọc theo lộ trình Longsys, nén, lập lịch nóng lạnh, quét chỉ mục hoặc tổ chức dữ liệu có thể được thực thi bởi đơn vị xử lý lưu trữ, sau đó trình lập lịch thông minh lớp trên phát chiến lược xuống; dọc theo lộ trình Inpera-Lianyun, có thể xuất phát từ nhu cầu của Runtime Agent về bộ nhớ dài hạn, quyền, TTL, SLO truy xuất và chi phí Token, sau đó cùng định nghĩa lệnh bộ điều khiển, siêu dữ liệu đối tượng, hàng đợi firmware và bố cục phương tiện. Hai lộ trình đầu giỏi về sản phẩm hóa và thực thi phía thiết bị, lộ trình sau vì đồng thời hiểu hệ thống tính toán tiêu thụ dữ liệu thế nào, hệ thống lưu trữ tổ chức dữ liệu ra sao, nên khi khám phá chức năng mới chưa hình thành tiêu chuẩn, có thể có không gian thiết kế lớn hơn.
Ý nghĩa của bối cảnh chéo này sẽ được phóng đại hơn nữa trong thời đại Agent. Nhiều chức năng lưu trữ tương lai không phải là thuật toán thuần túy trong ổ đĩa: mã hóa cần hiểu ranh giới quyền của Agent, người dùng và tác vụ, nén cần biết dữ liệu khi nào lại được tính toán sử dụng, lập chỉ mục cần hợp tác với Embedding, Retriever và Model Router, Bộ nhớ Agent còn liên quan đến ghi, hợp nhất, quên, phiên bản và chuỗi bằng chứng. Nếu chỉ xuất phát từ phía phương tiện lưu trữ, dễ thu hẹp vấn đề thành băng thông, dung lượng hoặc toán tử đơn lẻ; nếu chỉ xuất phát từ phía mô hình, lại có thể bỏ qua FTL, hiện tượng khuếch đại ghi, độ trễ đuôi, bảo vệ mất điện và ràng buộc sản xuất hàng loạt. Cách thức nghiên cứu phát triển chung xuyên tính toán và lưu trữ như Inpera-Lianyun này, vừa có thể tìm kiếm giao diện khả thi giữa hai loại ràng buộc, do đó khi phát triển SSD chức năng mới, nút lưu trữ AI và thậm chí cơ sở hạ tầng dữ liệu Agent, có tiềm năng hình thành lộ trình kỹ thuật khác biệt.
Từ góc độ SSD kiểu chức năng, tầm quan trọng của các giải pháp này không chỉ ở việc có thể mở rộng một mô hình nào đó, mà ở chỗ chúng thiết lập kênh trao đổi thông tin giữa phần mềm và phương tiện lưu trữ. Hôm nay truyền tải là lớp mô hình, chuyên gia, khối KV và gợi ý tải trước; tương lai có thể mở rộng đến danh tính Agent, đối tượng bộ nhớ, phiên bản, TTL, chiến lược truy cập, gợi ý chỉ mục và thời hạn hoàn thành muộn nhất. Ai có thể biến chức năng thành giao diện ổn định, thay vì tùy chỉnh đường dẫn một lần cho một mô hình duy nhất, người đó có nhiều cơ hội hơn để vượt qua thế hệ mô hình, và mở rộng doanh thu ổ đĩa đơn thành cấp phép Runtime, nút lưu trữ, dịch vụ ngữ cảnh và dịch vụ dữ liệu tính phí theo Token hiệu quả.
Cũng cần cảnh giác với sự mở rộng khái niệm. Nén tự động không bằng tất cả dữ liệu đều tiết kiệm dung lượng như nhau, chỉ mục trên ổ đĩa không bằng SSD hiểu ngữ nghĩa, Bộ nhớ Agent cũng không bằng chuyển thư viện vector vào firmware. Mỗi chức năng nên được chứng minh bằng chỉ số đầu cuối, bao gồm tỷ lệ nén và độ trễ bổ sung, tỷ lệ gọi lại và QPS/$, P99 và SLO, hiện tượng khuếch đại ghi và độ bền, cách ly khóa và xác minh xóa, cũng như Token/$ và Token/W cuối cùng.

Hình 4: Sản phẩm đại diện của SSD doanh nghiệp được tăng cường cho tải AI: Yingren N3X và Huawei OceanDisk LC 560. Dùng lại ảnh minh họa gốc, tài liệu sản phẩm xem [19][20].

Hình 5: Khám phá AI SSD tham gia suy luận: Phison aiDAPTIV, Longsys SPU+iSA, và giải pháp AI SSD Inpera-Lianyun. Dùng lại ảnh minh họa gốc, tài liệu lộ trình xem [15][16][17][18].

Hình 6: Vai trò của AI SSD trong đường dẫn suy luận LLM, và lộ trình kỹ thuật chính của các nhà sản xuất được bài viết gốc tổng hợp. Dùng lại ảnh minh họa gốc; góc nhìn ngành mở rộng về mã hóa, nén, chỉ mục, Bộ nhớ Agent, HBF và lưu trữ phân lớp được thêm vào trong bài viết này, không thay đổi logic hiện có trong hình.
Ngành công nghiệp tương lai có thể triển khai đồng thời theo ba hướng
Hướng thứ nhất là chức năng hóa SSD. Ổ đĩa chung tiếp tục tồn tại, nhưng các khả năng an toàn, nén, truy xuất, trí nhớ và ngữ cảnh sẽ đi vào sản phẩm dưới dạng chức năng củng cố, chương trình có thể tải xuống hoặc cấu hình xác định bằng phần mềm. Thị trường cuối cùng không nhất thiết cần năm loại SSD khác nhau, mà có thể cần một khung chức năng có thể phát hiện, kết hợp, cách ly, sau đó các sản phẩm cấp tiêu dùng, doanh nghiệp và dịch vụ đám mây chọn các tổ hợp khả năng khác nhau.
Hướng thứ hai là nút hóa lưu trữ. Ổ đĩa đơn giải quyết dung lượng cục bộ và xử lý gần dữ liệu, nút lưu trữ AI thì kết hợp nhiều ổ đĩa, mạng, thư mục đối tượng, khóa, chỉ mục, dịch vụ ngữ cảnh và khả năng quan sát, chịu trách nhiệm cho SLO đầu cuối. Nút phía đầu cuối phục vụ cá nhân và đội hình thiết bị, nút phía đám mây phục vụ cụm GPU và hệ thống đa Agent. Đơn vị cạnh tranh sẽ mở rộng từ "mỗi ổ đĩa" thành "mỗi trạm, giá đỡ hoặc POD có thể giao bao nhiêu Token hiệu quả và yêu cầu truy xuất".
Hướng thứ ba là tổ hợp lại cấp bộ nhớ. HBM tiếp tục theo đuổi băng thông cao nhất, HBF thử dùng NAND để cung cấp dung lượng đọc chuyên sâu lớn hơn gần đóng gói, DRAM và CXL đảm nhận trạng thái biến đổi, mở rộng và tổng hợp, SSD kiểu chức năng cung cấp đối tượng bền vững và dịch vụ gần dữ liệu, lưu trữ chia sẻ lưu trữ nguồn sự thật lạnh toàn cục. Khả năng hệ thống có giá trị nhất trong tương lai, là để Router và Runtime đồng thời nhìn thấy sức mạnh tính toán, vị trí dữ liệu, quyền, thời hạn và trạng thái phương tiện lưu trữ, phối hợp giữa nhiều cấp, chứ không phải liên tục chồng chất một phương tiện lưu trữ duy nhất.
Điều này sẽ định nghĩa lại rào cản ngành. Nhà sản xuất phương tiện nắm giữ dung lượng, băng thông và hiệu suất năng lượng, nhà sản xuất bộ điều khiển và firmware quyết định chức năng có thể ổn định triển khai hay không, Runtime và nền tảng Agent nắm giữ ngữ nghĩa đối tượng và lập lịch, OEM, nhà cung cấp đám mây và tích hợp hệ thống quyết định chức năng đi vào sản phẩm thực tế thế nào. Doanh nghiệp có thể vượt qua các ranh giới này, thiết lập giao diện tiêu chuẩn và chứng minh kết quả khách hàng bằng kinh tế học Token, sẽ có nhiều cơ hội hơn để đẩy SSD từ bình chứa dữ liệu lên lớp dữ liệu cơ bản của thời đại Agent.
Kết luận: Lưu trữ sẽ trở thành một phần năng lực của Agent
AI Agent khiến giá trị lưu trữ mở rộng từ "lưu giữ quá khứ" sang "hỗ trợ hành động tiếp theo". Mô hình cần trọng số, suy luận cần ngữ cảnh, Agent cần ký ức dài hạn và bằng chứng đáng tin cậy, doanh nghiệp còn cần an toàn, tuân thủ, kiểm toán và kiểm soát chi phí. Các dịch vụ mã hóa, nén, lập chỉ mục, bảo trì trí nhớ và ngữ cảnh càng gần dữ liệu, càng có cơ hội giảm di chuyển, tính toán lại và chiếm dụng DRAM, nhưng cũng càng cần xác định rõ ranh giới quyền, ngữ nghĩa và trách nhiệm.
Do đó, AI SSD chỉ là điểm khởi đầu. Tương lai có thể xuất hiện nhiều SSD hơn với chức năng cụ thể, cũng có thể hình thành SSD kiểu chức năng có thể lập trình thống nhất và nút lưu trữ Agent. Đồng thời, HBM, HBF, DRAM, CXL và SSD sẽ không tiến hóa theo một chuỗi thay thế đơn giản, mà sẽ định nghĩa lại xung quanh mức độ nóng, khả biến, phạm vi chia sẻ và thời hạn truy cập. Cơ hội ngành thực sự, nằm ở việc chuyển đổi ưu thế của mỗi loại phương tiện lưu trữ thành chi phí Token thấp hơn, tính liên tục của Agent cao hơn và vòng đời dữ liệu đáng tin cậy hơn.
Tài liệu tham khảo:
[1] NVIDIA, "Scaling Agentic AI Factories Through Extreme Co-Design with NVIDIA BlueField," 2026.https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
[2] NVIDIA, "Introducing NVIDIA BlueField-4-Powered CMX Context Memory Storage Platform for the Next Frontier of AI," 2026.https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/
[3] R. Qin et al., "Mooncake: Trading More Storage for Less Computation—A KVCache-centric Architecture for Serving LLM Chatbot," USENIX FAST ’25, 2025.https://www.usenix.org/conference/fast25/presentation/qin
[4] SNIA, "Computational Storage Architecture and Programming Model, Version 1.0," 2022.https://www.snia.org/sites/default/files/technical-work/computational/release/SNIA-Computational-Storage-Architecture-and-Programming-Model-1.0.pdf
[5] SNIA, "Storage Security: Encryption and Key Management," 2023.https://www.snia.org/sites/default/files/technical-work/whitepapers/SNIA-Encryption-KM-WP-2023-09-05.pdf
[6] NVM Express, "NVM Express Releases Specifications to Unify AI, Cloud, Client and Enterprise Storage," 2024.https://nvmexpress.org/nvm-express-releases-nvm-express-specifications-to-unify-ai-cloud-client-and-enterprise-storage/
[7] Samsung Electronics, "Samsung Electronics Develops Second-Generation SmartSSD Computational Storage Drive," 2022.https://news.samsung.com/global/samsung-electronics-develops-second-generation-smartssd-computational-storage-drive-with-upgraded-processing-functionality
[8] KIOXIA, "AiSAQ Achieves 4.8 Billion High-Dimensional Vector Search Database on a Single Server," 2026.https://americas.kioxia.com/en-us/business/news/2026/ssd-20260316-2.html
[9] Y. Wang et al., "Are We Ready for an Agent-Native Memory System?," arXiv:2606.24775, 2026.https://arxiv.org/abs/2606.24775
[10] P. Chhikara et al., "Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory," arXiv:2504.19413, 2025.https://arxiv.org/abs/2504.19413
[11] SK hynix, "The Next-Generation Memory Architecture in the AI Era? SK hynix Charts the Direction at FMS 2026," 2026.https://news.skhynix.com/en/fms-2026/
[12] SK hynix, "SK hynix Unveils First HBF Standard Specifications with Sandisk," 2026.https://news.skhynix.com/en/hbf-at-fms-2026/
[13] M. Ha, E. Kim, and H. Kim, "H3: Hybrid Architecture Using High Bandwidth Memory and High Bandwidth Flash for Cost-Efficient LLM Inference," IEEE Computer Architecture Letters, 2026.https://ieeexplore.ieee.org/document/11371745
[14] Compute Express Link Consortium, "Overcoming the AI Memory Wall: How CXL Memory Pooling Powers Scalable AI Computing," 2025.https://computeexpresslink.org/blog/overcoming-the-ai-memory-wall-how-cxl-memory-pooling-powers-the-next-leap-in-scalable-ai-computing-4267/
[15] Phison Electronics, "How aiDAPTIV+ Works," official product documentation.https://phisonaidaptiv.com/zh-tw/how-aidaptiv-works/
[16] Longsys, "SPU và iSA," 2026.https://cn.longsys.com/about/news/13353.html
[17] Maxio Technology, "CFMS 2026|AI推理时代,存储主控芯片价值跃迁," 2026.https://www.maxio-tech.com/news/11645/13048.html
[18] Economic Observer, "寅谱计算携手AMD发布Infplane Mini AI工作站:Hilbert," 2025.https://www.eeo.com.cn/2025/1222/774317.shtml
[19] Yingren Technology, "从N3X到Gen6:英韧科技如何用三大要素打造国产AI SSD," 2026.https://www.yingren.cn/news/%E4%BB%8En3x%E5%88%B0gen6%EF%BC%9A%E8%8B%B1%E9%9F%A7%E7%A7%91%E6%8A%80%E5%A6%82%E4%BD%95%E7%94%A8%E4%B8%89%E5%A4%A7%E8%A6%81%E7%B4%A0%E6%89%93%E9%80%A0%E5%9B%BD%E4%BA%A7ai-ssd/
[20] Huawei, "Huawei OceanDisk LC 560 SSD Data Sheet," 2025.https://e.huawei.com/en/documents/products/storage/97dc7a1dc98f4d3d90b268db03235cf7
Bài viết này đến từ tài khoản WeChat công cộng "新智元", tác giả: ASI启示录, biên tập viên: 所罗门








