英伟达HBM告急,下一代GPU受限,这块硬盘却抢走风头

当加密、压缩、索引、记忆及上下文服务日益靠近存储介质时,SSD、DRAM、HBM及HBF的价值界限将发生重塑。

人工智能代理(AI Agent)正将计算机从简单的“接收问题并执行一次模型调用”转变为一个持续观察、推理、调用工具、修改环境并保持状态的运行系统。一项任务可能涉及频繁访问模型、记忆库、向量索引、业务数据库、对象存储及网络服务,同时不断将工具结果、执行轨迹、用户偏好、临时上下文和审计记录写回。Agent的运行时间越长,其价值越发依赖于数据能否安全存储、准确检索、及时更新并低成本复用。

这意味着存储不再仅仅是Agent完成工作后的数据归档终点,而是会逐步融入Agent的感知、记忆和决策流程。AI SSD已初步展现了其应用方向:存储模型与适配器,承载被逐出内存的KV缓存,缩短冷启动时间,并扩大可部署模型容量。更进一步,SSD有望在数据写入时执行加密、压缩、去重、标记、索引、版本管理及生命周期治理,并为Agent的记忆提供长期存储能力。

这种转变并非凭空出现。自加密驱动器已能在控制器内部透明地完成数据加解密;计算存储标准将压缩、加密、正则表达式过滤和纠删码列为可由存储侧执行的功能;三星SmartSSD等产品也曾实现数据库扫描和视频处理下沉到盘侧。Agent时代的新颖之处在于,这些功能不再服务于通用数据处理,而是围绕智能体身份、上下文、记忆、工具轨迹和Token成本进行重新组合。

未来市场可能出现“安全SSD”、“压缩SSD”、“检索SSD”、“记忆SSD”或“上下文SSD”等名称,也可能不会形成彼此割裂的硬件类别,而是汇聚成可编程的功能型SSD。其基础形态仍将兼容标准存储,上层软件则根据场景发现并调用设备功能。

NVMe协议已包含Computational Programs和Subsystem Local Memory等命令集,为设备侧程序发现、配置和执行提供了标准化路径。真正的产业挑战不在于能否在盘内集成处理器,而在于谁来定义数据的语义、功能边界以及端到端的输出结果。

Agent并非一次性调用,而是持续写入的数据链

传统聊天机器人主要持久化对象是对话记录,而Agent则会生成更复杂的数据图。它需要存储观察结果、工具输出、计划与反思、任务中间状态、用户画像、环境快照、检索证据和执行日志。模型侧还会产生KV Cache、Prefix Cache、Adapter、专家权重和Checkpoint。不同对象的更新时间、复用范围和安全级别各不相同,但共同决定了后续推理能否延续。

Agent Memory并非将所有历史对话塞入向量数据库。近期从数据管理视角对Agent Memory的系统研究,将其分解为表示与存储、信息提取、检索与路由、维护四个模块,并指出没有一种架构能在所有工作负载上都占据优势。

Mem0等系统同样强调将原始对话转化为更紧凑、可复用的长期记忆,以降低长会话中的输入Token和检索负担。这意味着未来的存储层既要保存内容,也要保存内容的组织、更新和遗忘方式。

因此,Agent数据落地需要比“写成功”更丰富的约定。一个记忆对象应包含用户或Agent身份、租户、来源、时间、版本、权限、可信度、保留期限和可删除性。模型上下文还需要绑定模型版本、Tokenizer、位置编码与Adapter。只有命名空间和生命周期被明确定义,后续的压缩、索引、缓存与共享才不会破坏语义边界。

功能型SSD在这条数据链中的合理定位,并非自行判断一段经历是否值得记住,而是在运行时(Runtime)给出对象和策略后,靠近数据执行确定性任务。例如,按租户选择密钥,按生命周期放置数据,对可压缩与去重的对象进行处理,维护索引页与元数据,优先完成即将被推理使用的数据加载,并将尾延迟、写放大和介质健康状况反馈给上层。语义决策应保留在Agent和Runtime,数据执行则尽量靠近介质。

图1 Agent时代功能型SSD的能力谱
图1 Agent时代功能型SSD的能力谱。安全、内容缩减、索引、记忆、推理上下文与治理功能可以固化在设备,也可以由可下载程序、Runtime与存储节点共同完成。图为产业机制推演,计算存储与安全能力边界参考SNIA及NVMe规范。

**核心判断:**Agent时代的SSD升级并非简单增加盘内算力,而是将标准块设备、可发现的近数据功能、对象语义和生命周期治理整合起来。越靠近介质的功能越应具备确定性、可审计性和可隔离性;越靠近模型的决策越应保留在Runtime。

自动加密已存在,变化在于策略开始跟随Agent

“数据落地自动加密”并非未来概念。自加密驱动器通过控制器内的专用硬件对写入数据进行加密,读取数据时进行解密,并利用密钥管理和策略控制实现透明的数据静态保护。

对Agent系统而言,新的要求是将加密粒度从整盘或单一命名空间进一步细化到用户、Agent、任务和对象。同一台端侧设备上的个人记忆与应用缓存不能互相越权,云侧多租户Agent的共享上下文也必须明确哪些可复用,哪些只能在特定权限域内读取。

NVMe规范已引入了由主机管理密钥(Host-Managed Keys)和Key Per I/O等更细粒度的能力,为每次I/O携带不同的安全上下文提供了基础。未来的安全型SSD还可能集成数据来源、时间戳、访问记录、完整性校验与可信删除功能,使Agent不仅能回答“我记得什么”,还能回答“这段记忆来自哪里、是否被修改、谁读取过、何时必须删除”。对金融、医疗、企业知识库和个人AI而言,证据链可能与检索速度同等重要。

加密也会影响其他近数据功能的顺序。加密后的字节流通常难以有效压缩和去重,因此内容缩减一般应先于加密;索引则需要区分明文特征、受保护元数据与可搜索密文的边界。功能型SSD的竞争力不仅在于拥有多少功能,而在于能否通过可验证的流水线正确组织压缩、索引、加密、落地和删除流程,同时避免任何一个环节扩大攻击面。

压缩、索引与记忆维护,可能成为下一批SSD功能

压缩是最容易形成商业闭环的功能之一。Agent会反复写入文本、JSON、日志、向量、Checkpoint和多媒体中间结果,其中相当一部分具有结构性重复。若压缩在数据进入网络或NAND之前完成,可以减少传输、物理写入和容量占用,并间接降低能耗与介质磨损。但压缩比、额外时延、CPU节省和写放大必须综合衡量;对已经量化或高度压缩的模型权重,继续压缩可能收益有限。

索引功能与Agent的关系更为直接,因为记忆只有被正确召回才有价值。KIOXIA AiSAQ将向量与索引结构置于SSD上,通过SSD友好的聚类和图搜索降低DRAM占用,并已展示了单服务器数十亿规模向量检索能力。需要严格区分的是,AiSAQ首先是一套以SSD为主要索引载体的软件技术,并不意味着普通SSD会自动生成Embedding或理解语义。更可能的产业路径是,GPU、NPU或CPU负责生成表示,SSD与近数据程序负责组织索引、过滤候选集并返回更小的结果集。

记忆维护比索引更为复杂。长期Agent Memory会涉及新增、合并、冲突、修订、降权、过期与遗忘;同一事实可能同时存在原始记录、摘要、向量和知识图谱表示。未来的“记忆SSD”可以为这些版本提供原子更新、日志、TTL、冷热放置和安全删除,但不能仅凭相似度决定什么是真实记忆。记忆质量仍取决于上层的提取、路由、冲突处理与评估。

从产品角度看,这些功能未必需要每块盘都运行复杂模型。压缩、加密、哈希、过滤、索引页维护和对象生命周期都适合确定性的专用电路或轻量级程序;Embedding、重排序、摘要与记忆合并则可能由主机或独立加速器完成。

功能型SSD的关键在于,使用统一的对象ID和可观测接口将这两类工作连接起来,从而减少数据搬运,而不是将所有AI计算都塞入盘中。

端侧:SSD可能成为个人Agent的长期状态层

端侧Agent会持续接触个人文档、照片、邮件、日程、应用状态、浏览记录和设备传感数据。统一内存只适合保留当前工作集,而SSD可以存储更大的本地模型库、Adapter、向量索引、个人记忆和工具轨迹。只要保持标准NVMe形态,功能型SSD首先仍可作为普通系统盘被AI PC和工作站直接安装,再通过驱动、Runtime与固件逐步开启安全、索引与上下文能力。

它对消费者的价值并非“硬盘会思考”,而是本地AI能够记住更久,在弱网环境下继续工作,并减少每次任务向云端上传的原始数据和输入Token。会议Agent可以保留音频、摘要与任务状态,编程Agent可以维护仓库索引和修改历史,家庭Agent可以跨设备共享经过授权的照片、文档与设备状态。SSD将这些状态保留在设备附近,路由器再根据质量、隐私、功耗和网络决定本地处理还是调用云端。

端侧市场也可能从一块盘扩展为小型存储节点。AI PC、家庭服务器或门店边缘盒子可以为手机、平板、机器人和摄像头提供本地模型镜像、个人记忆、向量库和加密归档,避免每台设备重复存储相同数据。商业模式会从容量升级延伸到AI PC溢价、本地Agent订阅、模型与技能包管理,以及面向家庭和小企业的私有AI节点。

本地存储并不自动等同于隐私。如果应用可以任意读取记忆、索引无法删除旧版本、密钥与设备身份脱节,功能越多反而意味着更大的攻击面。端侧功能型SSD必须将应用隔离、用户同意、保留期限、可验证删除和设备遗失后的密钥吊销作为产品能力,而不是仅将隐私作为营销口号。

云侧:SSD将从设备走向Agent存储节点

云侧Agent的状态规模更大,也更需要共享。一个复杂请求会串联多次模型调用、工具执行、记忆访问和网络传输;多Agent协作还会产生共享计划、消息、证据和执行日志。节点本地SSD可以存储模型、Checkpoint和高频索引,机架或POD级别的Flash层可以承接跨GPU复用的KV、Prefix、Adapter和共享记忆,通用对象存储则继续保存冷态数据和长期事实源。

Mooncake已将CPU、DRAM、SSD与RDMA/NIC整合为分布式KV Cache池,并允许调度器根据缓存位置和TTFT、TBT目标决定请求路径。NVIDIA CMX在HBM、主机内存和通用共享存储之间建立了面向KV Cache的POD级Flash上下文层,将共享存储节点纳入推理数据路径。这些系统的端到端收益不能归因于单块SSD,却表明“存储节点参与Token生产”正从概念走向基础设施产品。

下一代Agent存储节点可能同时提供上下文、记忆和治理服务。它可以维护共享Prefix与KV目录,为模型和Adapter预热,存储向量与图索引,按租户压缩与加密数据,记录工具调用和证据链,并将命中率、P99、写放大、能耗和介质健康状况暴露给调度器。客户购买的将不仅仅是盘的容量和带宽,而是GPU利用率、SLO goodput、Token/s、Token/W、QPS/W和审计响应速度。

这也会改变商业模式。单盘仍可按容量、耐久度和性能销售;存储节点则可能以多盘Appliance、控制面、Runtime授权、长期支持和SLA形成组合收入;更上层还可能出现按上下文有效容量、记忆对象数量、检索吞吐或有效Token计费的服务。功能型SSD一旦对端到端结果负责,价值边界将从半导体器件扩展到数据基础设施。

图2 端侧与云侧Agent存储的典型分工
图2 端侧与云侧Agent存储的典型分工。端侧强调个人数据、本地模型、离线能力和隐私控制;云侧强调共享上下文、多租户治理、GPU利用率和Token经济学。图为产品形态推演,集群侧参考Mooncake与CMX。

HBM、HBF、DRAM与SSD的价值边界将被重新划分

Agent带来的存储重构不应被理解为SSD取代内存。SK hynix在FMS 2026提出的Tiered Memory思路,是将HBM、DRAM、NAND/HBF与SSD按速度、容量和成本连接起来,重点减少数据移动。这恰好对应Agent系统的现实:当前Token必须使用的数据、未来几毫秒将使用的数据、跨会话可能复用的数据和长期归档数据,需要不同介质来承接。

HBM仍是最接近GPU计算的核心层,承载当前权重、激活、热KV和算子中间状态,其关键指标是Token/s、带宽和计算利用率。Agent增加了长上下文和多模型协作,将进一步推高HBM需求,而非削弱其价值。HBM的约束在于容量成本与供给,因此系统需要将不必立即访问的数据移至成本更低的层级,并在使用前准确预热。

HBF,即High Bandwidth Flash,是2025年以来快速形成的新层级。SK hynix与Sandisk在2026年8月公布的首批开放规格覆盖最高512GB容量,带宽分为约0.4TB/s至3.0TB/s三个等级,并采用UCIe连接处理器。HBF使用NAND以获得比HBM更大的容量,目标是在HBM与SSD之间承接读密集的大型推理工作集。它仍处于标准化和产品化早期,官方规格不等于广泛量产性能,也不能消除NAND在时延、写耐久和可变状态访问上的限制。

H3研究提出了一种更清晰的分工:将只读数据置于HBF,将其他数据保留在HBM,以二者的优势构建混合推理系统。对Agent而言,HBF更适合模型权重、MoE专家和读取占主导的大型工作集;频繁更新的KV、激活和运行状态仍更适合HBM或DRAM。HBF若能成熟,可能减少为增加容量而增加GPU/HBM的需求,但更可能是补充而非替换。

DRAM与CXL处于可变状态和共享容量的中间地带。Host KV、索引热集、预取缓冲和Agent运行状态需要较低时延且频繁修改;CXL扩展、池化与共享可以减少内存孤岛,并为多个主机提供更灵活的容量。SK hynix在FMS 2026还展示了CXL pooled memory和DRAM-SSD混合方案用于KV共享、预测与预取,但这些是具体演示结果,需要在更多平台上验证。

功能型SSD承担的是更大、更持久、更需要治理的温冷对象:模型、Adapter、KV/Prefix、向量索引、Agent Memory、日志与Checkpoint。与HBF相比,SSD距离计算更远,却拥有标准形态、成熟生态、容量与成本优势,也更适合做节点级共享。未来竞争不会只围绕介质带宽展开,而会围绕谁能在正确期限内交付正确对象,并为有效Token、检索吞吐和数据治理负责。

图3 Agent时代HBM、HBF、DRAM/CXL、功能型SSD与共享存储的重新分工
图3 Agent时代HBM、HBF、DRAM/CXL、功能型SSD与共享存储的重新分工。HBF规格采用SK hynix与Sandisk于2026年8月公布的首批开放标准口径;分层逻辑参考FMS 2026 Tiered Memory、H3及CXL资料。

AI SSD是功能型SSD的第一批产业样本

现有AI SSD大致从两端进入这一趋势。一端是AI负载强化型企业级SSD,通过低时延、高IOPS、持续带宽、耐久性和容量密度,为模型缓存、Checkpoint和向量索引提供介质基础。英韧洞庭N3X与华为OceanDisk LC 560属于此类代表。它们首先解决的是AI数据能否被稳定承载、持续写入和及时召回,并不因为面向AI就自动拥有Agent Memory、索引或上下文语义。另一端则开始主动参与推理数据路径:SSD不再只接收操作系统发来的通用块请求,而是通过中间件、Runtime或存储侧处理能力,逐步识别模型权重、专家、KV Cache和预取窗口等AI对象。群联、江波龙和寅谱—联芸,正是这一方向上三种具有代表性的

标签
分享至
相关资讯
赛事分析师 - 优直播平台
作者

赛事分析师

在优直播体育赛事中心,您可以轻松浏览全球体育热点,掌握最新赛事动态。从足球到篮球,从NBA到国际赛事,我们无所不包。

用户评论
  • 张伟 2026年5月10日 优直播平台以敏捷的框架为您提供全面的赛事概览。通过迭代式的方法,我们 fosters 协作式思维,以进一步提升整体价值主张。 回复
  • 李娜 2026年4月25日 优直播平台以敏捷的框架为您提供全面的赛事概览。 回复
发表您的观点