忆联携手英特尔发布Agentic AI高效推理加速最佳实践

深圳2026年9月30日 美通社 -- 近日,忆联携手英特尔共同推出《基于Intel KV Cache高性能存储的Agentic AI高效推理加速最佳实践》解决方案白皮书。方案以英特尔® 至强® 6处理器为计算与IO中枢,结合忆联UH812a企业级PCIe 5.0 SSD,构建覆盖GPU HBM、CPU DDR与远端全闪JBOF的分层KV Cache架构,并通过KVShrink、英特尔® QAT、SPDK和RDMA完成端到端优化,为长上下文、多轮交互和高并发Agentic AI推理提供可扩展的缓存基础设施。


该方案的优势主要体现在:

  • 扩展缓存容量:通过HBM、DDR和全闪JBOF分层承载不同热度的数据,突破单机显存与内存容量限制。
  • 提升推理效率:复用已经计算的上下文,减少重复Prefill,降低首Token时延并提升输出吞吐。
  • 优化容量成本:将部分KV Cache下沉至企业级SSD,在满足性能需求的同时,降低对高成本GPU HBM的依赖。
  • 支持弹性扩展:借助RDMA、SPDK和远端JBOF构建可池化的缓存资源,为跨节点共享及高并发Agentic AI应用提供支撑。
  • 实现软硬件协同:融合英特尔®至强® 6处理器与忆联UH812a企业级SSD,充分释放计算、网络与存储平台的整体性能。

分层 KV Cache 提升 Agentic AI 推理效率

随着Agentic AI向长上下文、多轮推理和高并发任务演进,KV Cache容量快速增长,逐渐成为影响首Token时延、系统吞吐、GPU利用率和部署成本的关键资源。

针对单纯扩充GPU HBM成本较高、缓存复用不足及跨节点扩展受限等问题,英特尔与忆联联合构建分层KV Cache方案:以GPU HBM 承载最热数据、CPU DDR扩展热数据容量,并通过RDMA将温数据下沉至远端全闪JBOF;同时结合KVShrink、QAT、SPDK与RDMA,实现KV Cache分层卸载、重复上下文复用、在线压缩和低时延传输。


这样的组合扩大了缓存容量,也使已经计算的上下文能够在不同会话与节点间快速复用,减少重复 Prefill。

关键性能结果:


双方协同形成可落地的系统方案

这项实践覆盖处理器、企业级 SSD、网络与软件栈。

  • 英特尔提供至强® 6处理器的计算和IO能力,并以QAT 与 KVShrink完成压缩和缓存分层;
  • 忆联UH812a则以高带宽、低时延和稳定能效支撑KV Cache的高频存取。

SPDK与RDMA将双方硬件能力连接成低时延数据路径,使性能优化从单个组件延伸至完整系统。

对企业用户而言,双方协同带来的价值在于可复制。用户可以保留GPU HBM对最热数据的快速访问,同时通过DDR与远端全闪存储扩大缓存工作集,降低单纯扩充高成本显存的压力。分层缓存还为跨节点共享、缓存持久化与集群弹性扩展提供基础,有助于在智能客服、知识问答、代码智能体和复杂流程自动化等长上下文场景中提升并发能力与算力利用率。


忆联与英特尔深化联合创新

作为英特尔在中国区首家国产SSD战略合作伙伴,忆联持续推动自研主控、自主固件和企业级SSD与英特尔®至强®平台深度适配。双方此前已围绕高性能存储以及RDMA和NVMe网络存储形成联合方案,验证了处理器、SSD与软件栈协同在高吞吐和低时延场景中的价值。此次合作进一步延伸至Agentic AI的KV Cache管理,从产品适配走向覆盖计算、存储、网络与缓存软件的系统级共创。

忆联指出,随着大模型训练、推理与Agent应用持续演进,存储正从承载数据的后台资源转变为影响AI系统性能、效率与成本的关键基础设施。此次最佳实践以真实配置和测试结果验证了高性能企业级SSD在推理链路中的作用,也为忆联与英特尔继续面向AI关键场景开展联合创新提供了新的技术基础。

未来,忆联将继续与英特尔等生态伙伴推进软硬件协同,围绕AI推理、分布式存储与高性能数据基础设施探索更多可落地的最佳实践,帮助企业更有效地利用GPU算力,并以稳定、可靠、高性能的存储底座支撑 Agentic AI应用规模化部署。

取消
微信二维码
微信二维码
支付宝二维码