Appearance
与Val Bercovici关于解耦预填充/解码的对话
原文标题: A Conversation with Val Bercovici about Disaggregated Prefill / Decode 来源: Fabricated Knowledge
💡 核心观点
本文深入探讨了AI推理中的解耦预填充与解码(Disaggregated Prefill/Decode)这一新兴趋势。核心观点包括:1)推理正成为AI计算支出的主要部分(约80%),而解耦架构通过将计算密集的预填充与内存密集的解码分离到不同GPU上,显著提升效率。2)KV缓存管理是关键瓶颈,传统上缓存仅保持5-15分钟,解耦后可通过无限内存实现“一次预填充,永久解码”,降低延迟和功耗。3)Weka等公司通过软件定义内存和NVMe网络技术,将DRAM级内存扩展到GPU集群,从而支持百万级token上下文窗口,推动AI工厂走向“流水线”式生产。对投资者而言,这一趋势将重塑AI基础设施的定价模式、GPU利用率,并利好NVMe闪存等存储生态。
📖 中文全文
与Val Bercovici关于解耦预填充/解码的对话
来源博客:Fabricated Knowledge 原文标题:A Conversation with Val Bercovici about Disaggregated Prefill / Decode 原文链接:https://www.fabricatedknowledge.com/p/a-conversation-with-val-bercovici
主持人Doug O'Laughlin:欢迎收听《Fabricated Knowledge》。今天是播客特别版,我非常荣幸邀请到Weka公司的Val Bercovici。我们想重点讨论一个我认为每个人都应该关注的重要趋势:解耦预填充与解码(Disaggregated PD)。同时,我也希望Val能分享Weka的故事以及AI赋能的存储技术。
Val Bercovici:谢谢Doug。我是Valentin Bercovici,大家有时会在网上看到我的名字。我长期从事基础设施领域,职业生涯大部分时间专注于存储。大约十年前,我担任NetApp的CTO,此前它收购了一家名为SolidFire的云公司。当时,我还积极参与了谷歌开源Kubernetes项目,并在Linux基金会下共同创建了云原生计算基金会(CNCF)。我喜欢创造新品类,在云和机器学习领域起步较早,但通用AI方面还在追赶。现在我在Weka担任首席AI官,负责AI产品战略、市场推广和教育。因为正如我们即将讨论的,AI工作负载下的基础设施与传统CPU数据中心截然不同。
Doug:是的,背景很重要。事情变化非常快。让我们先梳理一下单个GPU节点上的推理是如何进行的,以及最近解耦预填充/解码如何撼动整个生态系统。听众需要先理解传统节点上的预填充和解码,然后我们才能讨论拆分带来的变化。
Val:好的。先引入一些财务背景——SemiAnalysis的分析领先业界。据估计,AI支出的80%将流向推理。推理不是小事,未来非常重要。大型语言模型(LLM)以及大型推理模型(LRM)尤其依赖推理技术,其测试时计算规模正在远超预训练维度。因此,这些工作负载对基础设施分配、支出和收入都至关重要。
具体到解耦预填充(Disaggregated Prefill),这是一个相对较新的现象,主要出现在2025年。之前已有一些研究论文,但现在是实际落地的阶段。这是一种扩展整个推理过程的方法。需要说明,这不适用于图像或视频模型(扩散生成AI),而是针对基于文本和视频的Transformer模型。Transformer正是当前创新和工程效率聚焦的领域。
为了通俗地解释解耦预填充/解码,可以类比压缩文件:将数据存档、压缩和解压缩。AI讨论中常关注“编码”——即优化模型训练,降低损失函数,找到欠拟合与过拟合的平衡点。这本质上就是“压缩互联网”(行业常用语),将部分或全部在线知识压缩成几十GB的文件加载到GPU中。编码就是压缩,而推理就是解码——如何为每个用户解压模型,并在成百上千的GPU上提供服务。每次我们使用ChatGPT,或者运行Cursor等AI应用时,背后就是解码过程。
如今的解码与过去的解压完全不同。在Zip例子中,压缩和解压都是CPU单线程串行过程。而GPU的核心优势是并行处理——这就是我们花大价钱购买GPU的原因,AI生成(Gen.AI)正是依赖这种并行GPU内核。然而,编码和解码过程本身非常并行化,但要求GPU并行执行不同任务会变得极其低效。
举一个具体例子。查看OpenAI、Google、Anthropic、Together AI等模型提供商的定价页面,你会发现三类价格:每百万输入token的价格、每百万缓存输入token的价格、每百万输出token的价格。缓存类定价(也称上下文缓存或前缀缓存)大约在六到九个月前出现,因为人们发现重复处理相同数据非常低效。如果处理缓存数据,效率高得多。如今OpenAI也加入了价格战,与Google和DeepSeek一起推动成本下降。据SemiAnalysis的报告,行业标准是使用缓存输入定价时,用户可获得约75%的折扣。但有一个巨大限制:所有提供商只会给你5到15分钟的缓存时间,之后上下文就会丢失。为什么?
深入看解码和推理的工作原理。推理需要构建工作记忆。解码不能跳过预填充直接进行——预填充是准备环节。预填充是将你的问题以及相关文档进行分词,为每个token增加10到20,000个维度的上下文,并创建查询键值(KV)矩阵。这个键值缓存(KV cache)从KB级的token变成GB级的工作内存,必须存储在显存中,因为需要持续访问。
主持人:我们也解释一下KV缓存——KV代表键值缓存。
Val:是的,这些是多维矩阵结构。键和值各自消耗数GB数据。推理算法(如Flash Attention)涉及大量矩阵乘法,这就是为什么GPU从图形渲染转型为AI计算——NVIDIA增加张量核心来专门处理大规模矩阵乘法。讽刺的是,AI不需要传统图形或高性能计算那样的高精度,低精度就能获得同等准确率,但处理速度更快。
主持人:所以简单来说,在GPU上运行推理时,你首先将所有权重和KV缓存加载到HBM内存中。预填充是计算密集的部分,之后是不断重复的解码——提交查询,模型生成结果,这部分受内存带宽限制。这就是高层面总结,对吗?
Val:完全正确。就像我们买笔记本电脑时总想买更多内存一样,GPU推理也遵循同样的规则。这里有三个关键内存层级:SRAM(算法实际工作的区域)、高带宽内存(HBM,工作内存)、以及主板上的DRAM(DDR类)。由于HBM空间极其有限——每个GPU只有约200GB,模型权重和KV缓存很快占满,因此需要第三层DRAM作为共享内存。Grace Blackwell架构中增加了Grace CPU控制器,连接大量DRAM,形成了第三层。
软件方面,推理服务器(如NVIDIA Triton TRT-LLM、开源VLLM、SGLang)已经意识到这三层内存,并通过KV缓存管理器进行管理。当HBM耗尽时,必须避免KV缓存驱逐(eviction),否则需要重新预填充,造成30秒延迟和巨大功耗。理想状态是尽量减少预填充次数,将缓存保留在整个集群的数百或数千台GPU服务器中。
主持人:这是目前的技术现状。但我请Val来,不仅是为了解释现有推理方式,更是为了讨论下一步的重大变革:解耦预填充和解码。我们不再需要将预填充和解码放在同一GPU上。通过KV管理器,我们可以路由和管理资源池,实现更好的GPU集群利用率。请Val详细解释为什么这是个大事件,比如KV缓存的摊销、预填充用单个GPU而解码用多个GPU的区别等。
Val:好的。DeepSeek去年公开引入了缓存输入定价,并在几个月前的“六天开源披露”中发表了论文,展示了如何做到。这就像早期云计算中的Snowflake概念——将存储和处理解耦。现在AI推理领域同样发生着解耦:预填充和解码分离。
预填充是GPU密集型,需要张量核心全力工作,因此适合用最高性能的GPU专注于预填充,创建KV工作缓存(持续5-15分钟)。之后才能解码。解码是内存密集型,因为自回归Transformer模型需要反复回顾内存中的上下文来预测下一个token。解码时,内存带宽和延迟成为瓶颈。
因此,预填充和解码对服务器的压力完全不同。现在有意义的做法是:大规模部署专门用于预填充的GPU集群,以及专门用于解码的GPU集群,各自优化。例如,Blackwell用于预填充,Hopper用于解码,各自发挥最佳性能,延长折旧周期,避免人工延迟。
主持人:NVIDIA在GTC上讨论了Dynamo,这实际上是DeepSeek工作的实现。解耦预填充/解码将成为今年推理服务的核心故事。它将解锁更大的扩展性,提升token吞吐量和内存利用率,降低token成本。
Val:是的。首先,解耦预填充引入了“流水线”概念到AI工厂。过去推理就像旧工厂工人围着一辆车转,效率低下。现在数据流动起来,预填充和解码分别由不同专业处理。其次,2025年工作负载从单次聊天转向基于代理(agent),上下文更长、多轮对话更多。解耦后,可以支持更大的上下文窗口、更多用户,并优化token/秒、token/瓦特。
主持人:那么Weka的解决方案是什么?
Val:理想情况下,我们希望一次性预填充,然后永远解码。这需要近乎无限的内存。谷歌通过TPU和环形保留算法实现了百万token上下文窗口,但成本很高。现在,通过管理三层内存(SRAM、HBM、DRAM),并将NVMe(非易失性内存扩展)设备纳入,可以实现突破。Weka的增强内存技术利用AI工厂中GPU连接的高性能计算网络(比主板更快),将网络上的NVMe设备聚合起来,充当DRAM级内存。这样GPU就能获得来自网络的额外内存,远超主板上的DRAM。我们已与Oracle Cloud等合作伙伴发布基准测试,验证了这一点。这等效于无限DRAM,即无限KV缓存,最终实现无限上下文窗口。
主持人:这确实是实现无限上下文窗口的工程方案。模型上下文窗口已在爆炸式增长。接下来我想聊聊存储历史,因为Val经验丰富。Pure Storage是网络附加存储的领导者,但像DDN、VAST、Weka等新挑战者正瞄准GPU驱动的新架构。
Val:我们正处在数据指数级增长的陡峭曲线上。80-90%是非结构化数据。传统存储优化的是结构化事务(如Oracle数据库),但GPU工作负载完全不同。处理指数级增长的非结构化数据需要水平扩展的存储系统,而不是传统存储阵列。Weka从第一天起就是软件定义、容器化的系统,生于云和AI时代,是GPU原生系统。我们将自己称为“网格”(mesh),利用网络比主板更快的现实。Weka不构建存储阵列,而是提供软件定义内存。例如,在NVL72集群中,每个GPU服务器有8个NVMe驱动器,通过Weka软件可将这些设备转化为DRAM类内存。推理服务器(VLLM等)现在能识别这些TB级内存,与有限的GB级HBM和TB级DRAM互补,实现一次预填充后永远解码。对于Cursor类代理工作负载,这尤其有利:不必每10-15分钟重新预填充,而是持续高速推理。最终token经济变得合理,更多token/秒、更大批大小、更低延迟。
主持人:总结来说,解耦预填充/解码与Weka的方案完美结合。GPU利用率将最大化,这对NVMe闪存生态系统是重大利好。
Val:我认为AI业务将发生一个根本变化:目前的三类定价(输入、缓存输入、输出)很快会合并为两类,因为缓存寿命可以从5-15分钟延长到数周或无限。这将简化定价,给用户更多价值。问题是谁先引领这一改变。
主持人:我很期待看到结果。感谢Val参与节目。
Val:同样感谢,非常愉快的对话。
以上就是本周内容!感谢阅读!
关于本集的讨论 评论区与转发
Fabricated Knowledge 让我们了解更多关于世界上最重要的制造产品。有意义的洞察、及时的剖析,以及偶尔的投资想法。订阅。
收听平台:Substack App、Spotify、RSS Feed
本期嘉宾:Doug O'Laughlin
近期节目:
- 与Val Bercovici再谈内存市场(2025年2月16日)
- Will Eatherton:思科如何在AI数据中心竞争(2025年10月27日)
- 采访Applied Digital CEO Wes Cummins(2024年7月9日)
- 采访CHIPS项目办公室Dan Kim和Hassan Khan(2024年5月29日)
- 与SiTime的Rajesh Vashist更新(2023年10月2日)
- 采访Alphawave CEO Tony Pialis(2023年7月5日)
- 采访SiTime CEO Rajesh Vashist(2023年2月14日)
准备好更多内容了吗? 订阅
© 2026 Doug OLaughlin · 隐私 · 条款 · 收集通知 在Substack开始你的旅程 Substack是优秀文化的家园
🔗 原文链接
https://www.fabricatedknowledge.com/p/a-conversation-with-val-bercovici