Cuando el cifrado, la compresión, la indexación, los servicios de memoria y de contexto se acercan al medio, los límites de valor de SSD, DRAM, HBM y HBF serán redefinidos.
Los AI Agent están transformando la computadora de un sistema que "completa una llamada al modelo tras recibir una pregunta" a uno de funcionamiento continuo que observa, razona, invoca herramientas, modifica el entorno y retiene estados.
Una tarea puede acceder de forma continua a modelos, memoria, índices vectoriales, bases de datos empresariales, almacenamiento de objetos y servicios de red, y también reescribir constantemente resultados de herramientas, trazas de ejecución, preferencias de usuario, contexto temporal y registros de auditoría. Cuanto más tiempo se ejecute el Agent, más dependerá su valor de que los datos puedan guardarse de forma segura, recuperarse correctamente, actualizarse a tiempo y reutilizarse a bajo coste [1].
Esto significa que el almacenamiento ya no es solo el punto final de escritura en disco tras el trabajo del Agent, sino que entrará gradualmente en sus bucles de percepción, memoria y toma de decisiones. El AI SSD ya ha mostrado las primeras direcciones: guardar modelos y Adapters, asumir la KV Cache expulsada de la memoria, acortar el arranque en frío, ampliar la capacidad de modelos desplegables. Un paso más allá, el SSD también podría ejecutar cifrado, compresión, deduplicación, etiquetado, indexación, mantenimiento de versiones y gestión del ciclo de vida durante la escritura de datos, además de proporcionar capacidad a largo plazo para la Agent Memory.
Este cambio no surge de la nada. Los discos autoeccriptables ya pueden realizar el cifrado/descifrado de datos de forma transparente en el controlador; los estándares de almacenamiento computacional enumeran la compresión, el cifrado, el filtrado de expresiones regulares y los códigos de borrado como funciones que puede ejecutar el lado del almacenamiento; productos como el Samsung SmartSSD también han trasladado al lado del disco el escaneo de bases de datos y el procesamiento de vídeo [4][5][7]. La novedad en la era de los Agent es que estas capacidades ya no solo sirven para el procesamiento genérico de datos, sino que comienzan a recombinarse en torno a identidad del agente, contexto, memoria, trazas de herramientas y costes de Token.
En el futuro pueden aparecer nombres como "SSD de seguridad", "SSD de compresión", "SSD de recuperación", "SSD de memoria" o "SSD de contexto", o puede que no se formen categorías de hardware separadas, sino que converjan en un SSD funcional programable: la forma básica sigue siendo compatible con el almacenamiento estándar, y el software de nivel superior descubre e invoca las funciones del dispositivo según el escenario.
NVMe ya ha formado conjuntos de comandos como Computational Programs y Subsystem Local Memory, proporcionando rutas estandarizadas para el descubrimiento, configuración y ejecución de programas del lado del dispositivo [6]. El verdadero problema de la industria no es solo si se puede colocar un procesador dentro del disco, sino quién define la semántica de los datos, los límites de las funciones y el resultado de extremo a extremo.
Agent no es una llamada
sino una cadena de datos de escritura continua
El principal objeto persistente de los chatbots tradicionales es el historial de conversaciones, mientras que el Agent genera un grafo de datos más complejo. Necesita guardar observaciones, salidas de herramientas, planes y reflexiones, estados intermedios de tareas, perfiles de usuario, instantáneas del entorno, evidencias recuperadas y registros de ejecución; el lado del modelo también genera KV Cache, Prefix Cache, Adapter, pesos de expertos y Checkpoint. Los tiempos de actualización, el alcance de reutilización y el nivel de seguridad de estos objetos difieren, pero juntos determinan si el razonamiento posterior puede continuar.
Agent Memory tampoco es meter todo el historial de conversaciones en una base de datos vectorial. Recientes estudios sistemáticos sobre Agent Memory desde la perspectiva de la gestión de datos lo desglosan en cuatro módulos: representación y almacenamiento, extracción de información, recuperación y enrutamiento, y mantenimiento, señalando que no existe una arquitectura que sea óptima para todas las cargas de trabajo [9].
Sistemas como Mem0 también enfatizan la transformación del diálogo original en memoria a largo plazo más compacta y reutilizable, para reducir los Tokens de entrada y la carga de recuperación en sesiones largas [10]. Esto significa que en el futuro, la capa de almacenamiento no solo debe guardar contenido, sino también cómo se organiza, actualiza y olvida ese contenido.
Por lo tanto, la escritura de datos del Agent en disco necesita un contrato más rico que "escritura exitosa". Un objeto de memoria debe llevar identidad de usuario o de Agent, inquilino, origen, tiempo, versión, permisos, nivel de confianza, periodo de retención y posibilidad de borrado; el contexto del modelo también debe vincularse a la versión del modelo, Tokenizer, codificación posicional y Adapter. Solo cuando el espacio de nombres y el ciclo de vida estén claros, las posteriores operaciones de compresión, indexación, caché y compartición no romperán los límites semánticos.
El papel adecuado del SSD funcional en esta cadena de datos no es juzgar por sí mismo si una experiencia merece recordarse, sino ejecutar trabajo determinista cerca de los datos una vez que el Runtime ya ha proporcionado los objetos y la estrategia. Por ejemplo, seleccionar claves por inquilino, colocar datos según el ciclo de vida, comprimir y deduplicar objetos reducibles, mantener páginas de índice y metadatos, priorizar la recarga de datos que se usarán pronto en el razonamiento, y dar feedback al nivel superior sobre latencia de cola, amplificación de escritura y salud del medio. La toma de decisiones semánticas queda en el Agent y el Runtime, y la ejecución de datos se acerca lo más posible al medio.

Figura 1. Espectro de capacidades del SSD funcional en la era de los Agent. Las funciones de seguridad, reducción de contenido, indexación, memoria, contexto de razonamiento y gobernanza pueden solidificarse en el dispositivo, o completarse conjuntamente por programas descargables, Runtime y nodos de almacenamiento. La figura es una deducción de mecanismos industriales, los límites de almacenamiento computacional y capacidades de seguridad hacen referencia a las especificaciones SNIA y NVMe [4][5][6].
Juicio clave: La mejora del SSD en la era de los Agent no es simplemente añadir potencia de cálculo dentro del disco, sino combinar el dispositivo de bloques estándar, las funcionalidades cercanas a los datos descubribles, la semántica de objetos y la gestión del ciclo de vida. Las funciones más cercanas al medio deben ser más deterministas, auditables y aislables; las decisiones más cercanas al modelo deben mantenerse en el Runtime.
El cifrado automático ya existe; el cambio es que la estrategia comienza a seguir al Agent
"Cifrado automático de datos al escribir en disco" no es un concepto futuro. Los discos autoeccriptables cifran los datos escritos y los descifran al leer mediante hardware especializado en el controlador, logrando protección estática transparente de datos a través de gestión de claves y control de políticas [5].
Para los sistemas Agent, el nuevo requisito es que la granularidad del cifrado pase de todo el disco o un único espacio de nombres a usuario, Agent, tarea y objeto: la memoria personal y la caché de aplicaciones en el mismo dispositivo del lado del cliente no pueden sobrepasar permisos entre sí, y el contexto compartido de Agent multiinquilino en la nube también debe aclarar qué se puede reutilizar y qué solo puede leerse dentro de un dominio de permisos.
La especificación NVMe ya ha introducido capacidades de mayor granularidad como clave gestionada por el host y Key Per I/O [6], proporcionando la base para que cada I/O lleve un contexto de seguridad diferente. Los futuros SSD de seguridad también podrían combinar origen de datos, marca de tiempo, registros de acceso, verificación de integridad y borrado confiable, permitiendo que el Agent no solo pueda responder "qué recuerdo", sino también "de dónde viene este recuerdo, si ha sido modificado, quién lo ha leído, cuándo debe borrarse". Para finanzas, salud, bases de conocimiento empresarial e IA personal, la cadena de evidencia puede ser tan importante como la velocidad de recuperación.
El cifrado también cambia el orden de otras funciones cercanas a los datos. El flujo de bytes cifrado generalmente es difícil de comprimir y deduplicar eficazmente, por lo que la reducción de contenido debe preceder generalmente al cifrado [5]; la indexación necesita diferenciar entre características en texto plano, metadatos protegidos y el límite del texto cifrado buscable. La competitividad del SSD funcional no es solo cuántas funciones tiene, sino si puede organizar correctamente en una tubería verificable la compresión, indexación, cifrado, escritura en disco y borrado, evitando al mismo tiempo que cualquier enlace amplíe la superficie de ataque.
Compresión, indexación y mantenimiento de memoria pueden convertirse en las próximas funciones de SSD
La compresión es una de las funciones con más fácil retorno comercial. El Agent escribe repetidamente texto, JSON, registros, vectores, Checkpoints y resultados intermedios multimedia, muchos de los cuales tienen estructuras repetitivas. Si la compresión se completa antes de que los datos entren en la red o en la NAND, puede reducir la transmisión, la escritura física y el uso de capacidad, e indirectamente bajar el consumo energético y el desgaste del medio. Pero la tasa de compresión, la latencia adicional, el ahorro de CPU y la amplificación de escritura deben medirse juntos; para pesos de modelos ya cuantificados o altamente comprimidos, seguir comprimiendo puede tener beneficios limitados.
La función de indexación tiene una relación más directa con el Agent, porque la memoria solo tiene valor si se recupera correctamente. KIOXIA AiSAQ coloca vectores y estructuras de índice en el SSD, reduciendo el uso de DRAM mediante agrupamiento y búsqueda en grafos favorables al SSD, y ya ha mostrado recuperación vectorial de miles de millones de escala en un solo servidor [8]. Hay que distinguir estrictamente: AiSAQ es principalmente un conjunto de tecnologías de software que usa el SSD como principal portador del índice, no significa que un SSD ordinario genere automáticamente Embeddings o entienda semántica. La trayectoria industrial más probable es que GPU, NPU o CPU se encarguen de generar las representaciones, y el SSD y los programas cercanos a los datos se encarguen de organizar índices, filtrar candidatos y devolver conjuntos de resultados más pequeños.
El mantenimiento de memoria es más complejo que la indexación. La Agent Memory a largo plazo experimenta adiciones, fusiones, conflictos, revisiones, degradaciones de prioridad, expiración y olvido; un mismo hecho puede existir simultáneamente en registro original, resumen, representación vectorial y de grafo de conocimiento [9]. Los futuros "SSD de memoria" pueden proporcionar actualizaciones atómicas, registros, TTL, colocación fría/caliente y borrado seguro para estas versiones, pero no pueden decidir qué es un recuerdo real basándose solo en similitud. La calidad de la memoria sigue dependiendo de la extracción, enrutamiento, manejo de conflictos y evaluación de niveles superiores.
Desde la perspectiva del producto, estas funciones no necesitan necesariamente que cada disco ejecute modelos complejos. La compresión, el cifrado, el hashing, el filtrado, el mantenimiento de páginas de índice y el ciclo de vida de objetos son adecuados para circuitos específicos deterministas o programas ligeros; la generación de Embeddings, el reordenamiento, el resumen y la fusión de recuerdos pueden realizarlos el host o aceleradores independientes.
La clave del SSD funcional es conectar ambos tipos de trabajo mediante un ID de objeto unificado e interfaces observables, para así mover menos datos, no meter todo el cálculo de IA dentro del disco.
Lado del cliente: el SSD puede convertirse en la capa de estado a largo plazo del Agent personal
El Agent del lado del cliente accede continuamente a documentos personales, fotos, correos, calendarios, estados de aplicaciones, historiales de navegación y datos de sensores del dispositivo. La memoria unificada solo es adecuada para retener el conjunto de trabajo actual, mientras que el SSD puede guardar una biblioteca de modelos local más grande, Adapters, índices vectoriales, memoria personal y trazas de herramientas. Mientras mantenga la forma estándar NVMe, el SSD funcional primero puede instalarse directamente como disco del sistema en AI PC y estaciones de trabajo, y luego activar gradualmente capacidades de seguridad, indexación y contexto mediante controladores, Runtime y firmware.
Su valor para el consumidor no es "el disco duro piensa", sino que la IA local pueda recordar más tiempo, seguir funcionando con red débil y reducir los datos originales y Tokens de entrada que se suben a la nube en cada tarea. Un Agent de reuniones puede retener audio, resúmenes y estado de tareas, un Agent de programación puede mantener índices de repositorios e historial de modificaciones, un Agent doméstico puede compartir fotos, documentos autorizados y estados de dispositivos entre dispositivos. El SSD mantiene estos estados cerca del dispositivo, y el Router decide entonces si procesar localmente o invocar la nube basándose en calidad, privacidad, consumo energético y red.
El mercado del lado del cliente también puede expandirse de un solo disco a un pequeño nodo de almacenamiento. AI PC, servidores domésticos o dispositivos edge de tiendas pueden proporcionar a móviles, tabletas, robots y cámaras espejos de modelos locales, memoria personal, bibliotecas vectoriales y archivos cifrados, evitando que cada dispositivo guarde repetidamente el mismo conjunto de datos. El modelo de negocio pasará de la mejora de capacidad a las primas por AI PC, suscripciones a Agent local, gestión de modelos y paquetes de habilidades, y nodos de IA privados para hogares y pequeñas empresas.
El almacenamiento local no equivale automáticamente a privacidad. Si las aplicaciones pueden leer la memoria arbitrariamente, los índices no pueden borrar versiones antiguas, las claves se desconectan de la identidad del dispositivo, más funciones significan una mayor superficie de ataque. El SSD funcional del lado del cliente debe integrar como capacidades del producto el aislamiento de aplicaciones, el consentimiento del usuario, los periodos de retención, el borrado verificable y la revocación de claves tras pérdida del dispositivo, no solo usar la privacidad como eslogan de marketing.
Lado de la nube: el SSD pasará de dispositivo a nodo de almacenamiento para Agent
Los Agent del lado de la nube tienen un estado a mayor escala y más necesidad de compartir. Una solicitud compleja encadena múltiples llamadas a modelos, ejecuciones de herramientas, accesos a memoria y transmisiones de red; la colaboración multi-Agent también genera planes, mensajes, evidencias y registros de ejecución compartidos [1]. Los SSD locales del nodo pueden guardar modelos, Checkpoints e índices de alta frecuencia, la capa Flash a nivel de rack o POD puede asumir KV, Prefix, Adapter y memoria compartida reutilizados entre GPU, y el almacenamiento de objetos genérico sigue guardando datos en frío y fuentes de hechos a largo plazo.
Mooncake ya ha organizado CPU, DRAM, SSD y RDMA/NIC como un grupo distribuido de caché KV, y hace que el programador decida la ruta de las solicitudes según la ubicación de la caché y los objetivos de TTFT, TBT [3]. NVIDIA CMX establece una capa de contexto Flash a nivel de POD para KV Cache entre HBM, memoria del host y almacenamiento compartido genérico, colocando nodos de almacenamiento compartido en la ruta de datos del razonamiento [2]. Los beneficios de extremo a extremo de estos sistemas no pueden atribuirse a un solo SSD, pero indican que la "participación del nodo de almacenamiento en la producción de Tokens" está pasando de concepto a producto de infraestructura.
El próximo nodo de almacenamiento para Agent podría proporcionar simultáneamente servicios de contexto, memoria y gobernanza. Puede mantener directorios de Prefix y KV compartidos, precalentar modelos y Adapters, guardar índices vectoriales y de grafos, comprimir y cifrar datos por inquilino, registrar llamadas a herramientas y cadenas de evidencia, y exponer al programador tasas de acierto, P99, amplificación de escritura, consumo energético y salud del medio. Lo que los clientes comprarán no será solo la capacidad y el ancho de banda del disco, sino la utilización de GPU, el goodput de SLO, Token/, Token/W, QPS/ y la velocidad de respuesta de auditorías.
Esto también cambiará el modelo de negocio. Los discos individuales aún pueden venderse por capacidad, durabilidad y rendimiento; los nodos de almacenamiento pueden generar ingresos combinados como Appliance de múltiples discos, plano de control, licencias de Runtime, soporte a largo plazo y SLA; en un nivel aún más alto pueden aparecer servicios facturados por capacidad efectiva de contexto, número de objetos de memoria, throughput de recuperación o Tokens efectivos. Una vez que el SSD funcional sea responsable del resultado de extremo a extremo, sus límites de valor se expanden desde el dispositivo semiconductor hasta la infraestructura de datos.

Figura 2. División típica del trabajo en almacenamiento para Agent del lado del cliente y de la nube. El lado del cliente enfatiza datos personales, modelos locales, capacidad offline y control de privacidad; el lado de la nube enfatiza contexto compartido, gobernanza multiinquilino, utilización de GPU y economía de Tokens. La figura es una deducción de formas de producto, el lado de clúster hace referencia a Mooncake y CMX [2][3].
Se redefinirán los límites de valor de HBM, HBF, DRAM y SSD
La reestructuración del almacenamiento impulsada por los Agent no debe entenderse como que el SSD reemplace a la memoria. El enfoque Tiered Memory propuesto por SK hynix en FMS 2026 consiste en conectar HBM, DRAM, NAND/HBF y SSD por velocidad, capacidad y coste, centrándose en reducir el movimiento de datos [11]. Esto coincide con la realidad de los sistemas Agent: los datos que deben usarse para el Token actual, los que se usarán en los próximos milisegundos, los que pueden reutilizarse entre sesiones y los archivados a largo plazo necesitan diferentes medios.
HBM sigue siendo la capa central más cercana al cálculo de GPU, albergando pesos actuales, activaciones, KV calientes y estados intermedios de operadores, con métricas de Token/s, ancho de banda y utilización del cálculo. Los Agent aumentan el contexto largo y la colaboración multimodelo, lo que eleva aún más la demanda de HBM, no reduce su valor. La limitación de HBM es el coste de capacidad y el suministro, por lo que el sistema necesita mover datos no accedidos inmediatamente a capas de menor coste y precalentarlos con precisión antes de usarlos.
HBF, o High Bandwidth Flash, es un nuevo nivel que se ha formado rápidamente desde 2025. Las primeras especificaciones abiertas anunciadas por SK hynix y Sandisk en agosto de 2026 cubren capacidades de hasta 512GB, con anchos de banda clasificados en tres niveles de ~0.4TB/s a 3.0TB/s, y utilizan conexión UCIe al procesador [12]. HBF usa NAND para obtener mayor capacidad que HBM, con el objetivo de albergar conjuntos de trabajo de razonamiento grandes e intensivos en lectura entre HBM y SSD. Todavía está en fase temprana de estandarización y comercialización, las especificaciones oficiales no equivalen a rendimiento de producción masiva generalizado ni eliminan las limitaciones de la NAND en latencia, durabilidad de escritura y acceso de estado variable.
La investigación H3 ofrece una división más clara: colocar datos de solo lectura en HBF y retener otros datos en HBM, construyendo un sistema de razonamiento híbrido con las ventajas de ambos [13]. Para los Agent, HBF es más adecuado para pesos de modelo, expertos MoE y grandes conjuntos de trabajo dominados por lectura; KV, activaciones y estados de ejecución que se actualizan con frecuencia siguen siendo más adecuados para HBM o DRAM. Si HBF madura, puede reducir la necesidad de añadir GPU/HBM por capacidad, pero es más probable que sea un complemento, no un reemplazo.
DRAM y CXL ocupan un terreno intermedio para estado variable y capacidad compartida. KV del host, conjuntos calientes de índices, buffers de prefetch y estado de ejecución del Agent necesitan baja latencia y se modifican con frecuencia; la expansión, agrupación y compartición CXL pueden reducir los silos de memoria y proporcionar capacidad más flexible a múltiples hosts [14]. SK hynix en FMS 2026 también mostró agrupación de memoria CXL y esquemas híbridos DRAM-SSD para compartición, predicción y prefetch de KV, pero estos son resultados de demostración específicos que necesitan validación en más plataformas [11].
El SSD funcional asume objetos más grandes, persistentes y que requieren más gobernanza, en estado templado/frío: modelos, Adapters, KV/Prefix, índices vectoriales, Agent Memory, registros y Checkpoints. Comparado con HBF, el SSD está más lejos del cálculo, pero tiene forma estándar, ecosistema maduro, ventajas de capacidad y coste, y es más adecuado para compartición a nivel de nodo. La competencia futura no girará solo en torno al ancho de banda del medio, sino en torno a quién puede entregar el objeto correcto en el plazo correcto y ser responsable de los Tokens efectivos, el throughput de recuperación y la gobernanza de datos.

Figura 3. Redivisión del trabajo entre HBM, HBF, DRAM/CXL, SSD funcional y almacenamiento compartido en la era de los Agent. Las especificaciones HBF adoptan la primera divulgación oficial de estándares abiertos por SK hynix y Sandisk en agosto de 2026 [12]; la lógica de niveles hace referencia a Tiered Memory de FMS 2026, H3 y documentación CXL [11][13][14].
AI SSD es la primera muestra industrial de SSD funcional
Los AI SSD existentes entran en gran medida en esta tendencia desde dos extremos. Un extremo son los SSD empresariales reforzados para cargas de IA, que a través de baja latencia, alto IOPS, ancho de banda sostenido, durabilidad y densidad de capacidad, proporcionan una base de medios para caché de modelos, Checkpoints e índices vectoriales. Los representantes de este tipo son el Yingren N3X y el Huawei OceanDisk LC 560 [19][20]. Su objetivo principal es que los datos de IA puedan transportarse de forma estable, escribirse continuamente y recuperarse a tiempo; no poseen automáticamente Agent Memory, indexación o semántica de contexto por estar orientados a IA. El otro extremo comienza a participar activamente en la ruta de datos del razonamiento: el SSD ya no solo recibe solicitudes de bloques genéricas del sistema operativo, sino que a través de middleware, Runtime o capacidad de procesamiento del lado del almacenamiento, identifica gradualmente objetos de IA como pesos de modelo, expertos, KV Cache y ventanas de prefetch. Phison, Longsys (Jiangbolong) e Innopeak—Maxio (Yinpu—Lianyun) son tres formas organizativas de I+D representativas en esta dirección.
Phison aiDAPTIV adopta el enfoque de "capacidad SSD madura + middleware + cadena de herramientas completa". aiDAPTIVLink se encarga de la gestión de memoria entre VRAM de GPU y Flash; en tiempo de ejecución, segmenta los pesos del modelo, retiene pesos activos prioritariamente en VRAM, descarga pesos inactivos al SSD aiDAPTIVCache, y puede guardar la KV Cache expulsada, evitando recalcular el contexto tras su eliminación [15]. El valor comercial de esta ruta radica en combinar SSD, licencias de software, herramientas de despliegue y soporte del sistema en una solución entregable: el cliente no necesita rediseñar el chip de cálculo para ampliar la capacidad de modelos y contexto usable en estaciones de trabajo o servidores locales. Su foco técnico es ser compatible con el ecosistema existente de GPU y software de IA, y, apoyándose en controladores, firmware, diseño de durabilidad y colaboración de plataforma maduros, convertir Flash de forma estable en una capa de capacidad además de la VRAM.
Longsys SPU+iSA se acerca más a la combinación de "capa de ejecución de almacenamiento + capa de decisión de software". SPU asume en el lado del dispositivo compresión sin pérdidas, caché avanzado HLC y planificación de datos entre diferentes medios NAND; iSA toma decisiones en torno a la descarga de expertos MoE, el ciclo de vida de KV Cache y Device Smart Prefetch, transformando características de carga de IA en acciones de prefetch, relleno, compresión y migración frío/caliente [16]. Por lo tanto, su enfoque no es solo meter más datos en el SSD, sino reducir el uso de DRAM, aumentar la capacidad efectiva y hacer coincidir el procesamiento del lado del almacenamiento con el ritmo del razonamiento del lado del cliente. Esta ruta muestra que cuando el controlador tiene mayor capacidad de ejecución cercana, el SSD puede pasar de dispositivo de bloques a un nodo de procesamiento cercano a los datos capaz de asumir compresión, caché y planificación de objetos.
Innopeak—Maxio adopta una ruta de definición conjunta cálculo-almacenamiento. Innopeak parte de la estructura del modelo, Runtime, sistema operativo, sinergia CPU/GPU/DRAM y diseño de referencia del equipo completo para observar activación de expertos, ciclo de vida de KV, precisión de datos y ventana de cálculo; Maxio mapea estos requisitos al controlador SSD, firmware, partición de caché, colas, adaptación NAND y sistema de producción masiva [17][18]. Esto permite que la definición del producto pueda, a partir de la latencia de Token, capacidad del modelo y SLO del equipo completo, deducir cuándo deben entrar los datos en el SSD, con qué granularidad guardarse, cómo prefetch, y qué operaciones son adecuadas para trasladarse cerca del controlador, en lugar de solo optimizar localmente sobre E/S de bloques existente. Comparada con las dos rutas anteriores, esta cooperación transversal cálculo-almacenamiento requiere una mayor sinergia de sistemas, pero también tiene más oportunidades de descubrir anticipadamente nuevos problemas de ruta de datos y formar nuevas interfaces de dispositivo mientras la arquitectura del modelo y la infraestructura de razonamiento siguen cambiando.
Las tres rutas no son mutuamente excluyentes. La ventaja de Phison radica en encapsular rápidamente capacidades en una solución desplegable mediante controladores maduros, productos SSD y cadena de herramientas de software; Longsys intenta poner más procesamiento y planificación del lado del almacenamiento con SPU e iSA; Innopeak—Maxio define el dispositivo de forma inversa desde la frontera entre semántica de cálculo y ejecución de almacenamiento. Juntas demuestran que la innovación central del AI SSD ha pasado de "cambiar a un disco más rápido para IA" a "redividir las responsabilidades entre Runtime, niveles de memoria, controlador y Flash". Esta es también la razón por la que AI SSD puede ser el producto precursor del SSD funcional: una vez que el software puede expresar al dispositivo el tipo de objeto, prioridad, ciclo de vida y plazo de servicio, el SSD tiene la base para albergar más funciones deterministas.
Pensamientos de I+D similares pueden migrar completamente al siguiente SSD funcional. Siguiendo la ruta de Phison, los fabricantes pueden añadir en la combinación SSD+middleware módulos de servicio de cifrado, compresión, indexación y memoria gestionados por Agent o inquilino, reduciendo el umbral de despliegue mediante compatibilidad de software y herramientas de entrega; siguiendo la ruta de Longsys, la compresión, planificación frío/caliente, escaneo de índices o organización de datos pueden ser ejecutadas por la unidad de procesamiento de almacenamiento, con el programador inteligente de nivel superior emitiendo estrategias; siguiendo la ruta de Innopeak—Maxio, se puede partir primero de las necesidades del Runtime del Agent para memoria a largo plazo, permisos, TTL, SLO de recuperación y coste de Token, y luego definir conjuntamente comandos del controlador, metadatos de objeto, colas de firmware y disposición de medios. Las dos primeras rutas destacan respectivamente en comercialización y ejecución del lado del dispositivo; la última ruta, al comprender simultáneamente cómo el sistema de cálculo consume datos y cómo el sistema de almacenamiento organiza datos, puede tener mayor espacio de diseño al explorar nuevas funciones aún no estandarizadas.
Esta importancia de contexto transversal se amplificará aún más en la era de los Agent. Muchas funciones de almacenamiento futuras no son meros algoritmos dentro del disco: el cifrado necesita entender los límites de permisos de Agent, usuario y tarea; la compresión necesita saber cuándo se volverán a usar los datos para cálculo; la indexación necesita colaborar con Embedding, Retriever y Model Router; Agent Memory también implica escritura, fusión, olvido, versiones y cadena de evidencia. Si se parte solo del lado del medio, es fácil converger el problema en ancho de banda, capacidad u operador individual; si se parte solo del lado del modelo, se pueden ignorar FTL, amplificación de escritura, latencia de cola, protección contra cortes de energía y restricciones de producción masiva. El enfoque de I+D conjunta transversal cálculo-almacenamiento de Innopeak—Maxio puede buscar precisamente interfaces viables entre dos tipos de restricciones, por lo que posee el potencial de formar una ruta tecnológica diferenciada al desarrollar nuevos SSD funcionales, nodos de almacenamiento para IA e incluso infraestructura de datos para Agent.
Desde la perspectiva del SSD funcional, la importancia de estos esquemas no radica solo en si pueden ampliar un modelo concreto, sino en que establecen canales de intercambio de información entre software y medio. Hoy se transmiten capas de modelo, expertos, bloques KV y sugerencias de prefetch; en el futuro puede extenderse a identidad de Agent, objeto de memoria, versión, TTL, política de acceso, sugerencias de índice y plazo de finalización más tardío. Quien pueda convertir funciones en interfaces estables, en lugar de rutas personalizadas de un solo uso para un modelo único, tendrá más oportunidades de trascender generaciones de modelos y expandir los ingresos por disco único a licencias de Runtime, nodos de almacenamiento, servicios de contexto y servicios de datos facturados por Token efectivo.
También hay que estar alerta ante la expansión conceptual. La compresión automática no equivale a que todos los datos ahorren la misma capacidad; la indexación en disco no equivale a que el SSD entienda semántica; Agent Memory no equivale a mover una base de datos vectorial al firmware. Cada función debe demostrarse con métricas de extremo a extremo, incluyendo tasa de compresión y latencia adicional, tasa de recuperación y QPS/, P99 y SLO, amplificación de escritura y durabilidad, aislamiento de claves y verificación de borrado, y finalmente Token/ y Token/W.

Figura 4. Productos representativos de SSD empresariales reforzados para cargas de IA: Yingren N3X y Huawei OceanDisk LC 560. Se utilizan las imágenes originales del artículo, la información del producto está en [19][20].

Figura 5. Exploración de AI SSD de tipo participación en razonamiento: Phison aiDAPTIV, Longsys SPU+iSA, y esquema Innopeak—Maxio AI SSD. Se utilizan las imágenes originales del artículo, la información de las rutas está en [15][16][17][18].

Figura 6. Función del AI SSD en la ruta de razonamiento LLM, y las principales rutas tecnológicas de fabricantes analizadas en el artículo original. Se utiliza la imagen original del artículo; las perspectivas añadidas en este artículo sobre cifrado, compresión, indexación, Agent Memory, HBF y almacenamiento por niveles son una extensión industrial basada en esto, no cambian la lógica existente en la figura.
La industria futura puede desarrollarse simultáneamente en tres direcciones
La primera dirección es la funcionalización del SSD. Los discos genéricos seguirán existiendo, pero capacidades como seguridad, compresión, recuperación, memoria y contexto entrarán en los productos como funciones solidificadas, programas descargables o configuración definida por software. El mercado final puede que no necesite cinco SSD diferentes, sino más bien un marco de funciones descubrible, combinable y aislable, del que luego los productos de consumo, empresariales y de servicios en la nube elijan diferentes combinaciones.
La segunda dirección es la nodificación del almacenamiento. El disco individual resuelve la capacidad local y el procesamiento cercano a los datos, mientras que el nodo de almacenamiento para IA combina múltiples discos, red, directorio de objetos, claves, índice, servicios de contexto y observabilidad, siendo responsable del SLO de extremo a extremo. Los nodos del lado del cliente sirven a personas y flotas de dispositivos; los nodos del lado de la nube sirven a clústeres GPU y sistemas multi-Agent. La unidad de competencia se expandirá de "cada disco" a "cuántos Tokens efectivos y solicitudes de recuperación puede entregar cada sitio, rack o POD".
La tercera dirección es la recombinación de niveles de memoria. HBM sigue persiguiendo el mayor ancho de banda, HBF intenta proporcionar mayor capacidad de lectura intensiva cerca del encapsulado usando NAND, DRAM y CXL asumen estado variable, expansión y agrupación, el SSD funcional proporciona objetos persistentes y servicios cercanos a los datos, y el almacenamiento compartido guarda la fuente global de hechos en frío. La capacidad de sistema más valiosa en el futuro será que Router y Runtime vean simultáneamente potencia de cálculo, ubicación de datos, permisos, plazos y estado del medio, haciendo sinergia entre múltiples niveles, en lugar de apilar continuamente un solo medio.
Esto redefinirá las barreras industriales. Los fabricantes de medios dominan capacidad, ancho de banda y eficiencia energética; los fabricantes de controladores y firmware deciden si las funciones pueden implementarse de forma estable; Runtime y plataformas de Agent dominan la semántica de objetos y la planificación; OEM, proveedores de nube e integradores de sistemas deciden cómo entran las funciones en productos reales. Las empresas capaces de cruzar estas fronteras, establecer interfaces estándar y demostrar resultados para el cliente con economía de Tokens tendrán más oportunidades de llevar el SSD de contenedor de datos a la capa de datos base de la era de los Agent.
Conclusión: el almacenamiento se convertirá en parte de las capacidades del Agent
Los AI Agent expanden el valor del almacenamiento de "guardar el pasado" a "apoyar la siguiente acción". El modelo necesita pesos, el razonamiento necesita contexto, el Agent necesita memoria a largo plazo y evidencias confiables, las empresas también necesitan seguridad, cumplimiento, auditoría y control de costes. Cuanto más cerca de los datos estén el cifrado, la compresión, la indexación, el mantenimiento de memoria y los servicios de contexto, más oportunidades habrá de reducir movimiento, recálculo y uso de DRAM, pero también más necesidad de clarificar límites de permisos, semántica y responsabilidad.
Por lo tanto, AI SSD es solo el comienzo. En el futuro pueden aparecer más SSD con funciones específicas, o pueden formarse SSD funcionales programables unificados y nodos de almacenamiento para Agent. Al mismo tiempo, HBM, HBF, DRAM, CXL y SSD no evolucionarán siguiendo una simple cadena de sustitución, sino que se redistribuirán el trabajo en torno a calidez, variabilidad, alcance de compartición y plazo de acceso. La verdadera oportunidad industrial radica en convertir la ventaja de cada medio en un menor coste por Token, mayor continuidad del Agent y un ciclo de vida de datos más confiable.
Referencias:
[1] NVIDIA, «Scaling Agentic AI Factories Through Extreme Co-Design with NVIDIA BlueField,» 2026.https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
[2] NVIDIA, «Introducing NVIDIA BlueField-4-Powered CMX Context Memory Storage Platform for the Next Frontier of AI,» 2026.https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/
[3] R. Qin et al., «Mooncake: Trading More Storage for Less Computation—A KVCache-centric Architecture for Serving LLM Chatbot,» USENIX FAST ’25, 2025.https://www.usenix.org/conference/fast25/presentation/qin
[4] SNIA, «Computational Storage Architecture and Programming Model, Version 1.0,» 2022.https://www.snia.org/sites/default/files/technical-work/computational/release/SNIA-Computational-Storage-Architecture-and-Programming-Model-1.0.pdf
[5] SNIA, «Storage Security: Encryption and Key Management,» 2023.https://www.snia.org/sites/default/files/technical-work/whitepapers/SNIA-Encryption-KM-WP-2023-09-05.pdf
[6] NVM Express, «NVM Express Releases Specifications to Unify AI, Cloud, Client and Enterprise Storage,» 2024.https://nvmexpress.org/nvm-express-releases-nvm-express-specifications-to-unify-ai-cloud-client-and-enterprise-storage/
[7] Samsung Electronics, «Samsung Electronics Develops Second-Generation SmartSSD Computational Storage Drive,» 2022.https://news.samsung.com/global/samsung-electronics-develops-second-generation-smartssd-computational-storage-drive-with-upgraded-processing-functionality
[8] KIOXIA, «AiSAQ Achieves 4.8 Billion High-Dimensional Vector Search Database on a Single Server,» 2026.https://americas.kioxia.com/en-us/business/news/2026/ssd-20260316-2.html
[9] Y. Wang et al., «Are We Ready for an Agent-Native Memory System?,» arXiv:2606.24775, 2026.https://arxiv.org/abs/2606.24775
[10] P. Chhikara et al., «Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory,» arXiv:2504.19413, 2025.https://arxiv.org/abs/2504.19413
[11] SK hynix, «The Next-Generation Memory Architecture in the AI Era? SK hynix Charts the Direction at FMS 2026,» 2026.https://news.skhynix.com/en/fms-2026/
[12] SK hynix, «SK hynix Unveils First HBF Standard Specifications with Sandisk,» 2026.https://news.skhynix.com/en/hbf-at-fms-2026/
[13] M. Ha, E. Kim, and H. Kim, «H3: Hybrid Architecture Using High Bandwidth Memory and High Bandwidth Flash for Cost-Efficient LLM Inference,» IEEE Computer Architecture Letters, 2026.https://ieeexplore.ieee.org/document/11371745
[14] Compute Express Link Consortium, «Overcoming the AI Memory Wall: How CXL Memory Pooling Powers Scalable AI Computing,» 2025.https://computeexpresslink.org/blog/overcoming-the-ai-memory-wall-how-cxl-memory-pooling-powers-the-next-leap-in-scalable-ai-computing-4267/
[15] Phison Electronics, «How aiDAPTIV+ Works,» official product documentation.https://phisonaidaptiv.com/zh-tw/how-aidaptiv-works/
[16] Longsys, «SPU y iSA», 2026.https://cn.longsys.com/about/news/13353.html
[17] Maxio Technology, «CFMS 2026|En la era del razonamiento de IA, el valor del chip controlador de almacenamiento da un salto», 2026.https://www.maxio-tech.com/news/11645/13048.html
[18] Observador Económico, «Innopeak Computing se une a AMD para lanzar la estación de trabajo AI Infplane Mini: Hilbert», 2025.https://www.eeo.com.cn/2025/1222/774317.shtml
[19] Yingren Technology, «De N3X a Gen6: Cómo Yingren Technology utiliza tres grandes factores para crear AI SSD nacional», 2026.https://www.yingren.cn/news/%E4%BB%8En3x%E5%88%B0gen6%EF%BC%9A%E8%8B%B1%E9%9F%A7%E7%A7%91%E6%8A%80%E5%A6%82%E4%BD%95%E7%94%A8%E4%B8%89%E5%A4%A7%E8%A6%81%E7%B4%A0%E6%89%93%E9%80%A0%E5%9B%BD%E4%BA%A7ai-ssd/
[20] Huawei, «Huawei OceanDisk LC 560 SSD Data Sheet,» 2025.https://e.huawei.com/en/documents/products/storage/97dc7a1dc98f4d3d90b268db03235cf7
Este artículo proviene del WeChat Official Account "New Zhiyuan", autor: ASI启示录, editor: Salomón






