推理成本的软件、芯片与电力三层压缩路径——推理服务公司负责人、前英伟达GPU内核工程师访谈要点梳理(Invest Like The Best,2026-08-25)
——据Invest Like The Best节目《Ex-NVIDIA Engineer: Why AI Is About to Get 1000x Cheaper》(2026-08-25)整理
摘要:本文对Invest Like The Best节目专访一位前英伟达GPU内核工程师的主要观点进行了梳理汇总。嘉宾于2016年加入英伟达(NVIDIA),参与了第一代张量计算单元争取芯片面积的过程,现经营一家推理服务公司。本文梳理了其以后台长时程任务为目标市场的需求判断,介绍了其在软件、芯片、电力与场地三个层面压缩推理成本的路径,最后阐述了其对成本下降幅度、半导体需求性质与硬件竞争格局的看法。据其介绍,人均每日消耗一万亿token按当前定价约需500万美元,单位token成本需改善三至六个数量级方具备客户基础;上下文缓存按信息熵衡量高出合理水平一至两个数量级。
关键词:推理成本;算力采购;token需求;AI资本开支;开放权重;英伟达
一、后台长时程任务的需求判断
嘉宾认为,推理需求的重心正由低延迟交互转向后台长时程运行,后者的需求在很大程度上不受人的注意力约束。
(一)需求重心的转移
嘉宾表示,现有推理服务商的资源集中于低延迟场景,方向由一家权重较高的客户塑造,这一选择在一年前成立;约六个月前起,需求重心已转向任务持续性与长时程运行。对于延迟越低越好的看法,他表示,等待状态下的延迟诉求成立,目标在于消除等待环节本身,即工作在夜间完成、用户提出需求前即已交付。更关键的是,在反复提示与等待的交互模式下,约束条件是使用者本人的注意力带宽,智能体应运行于人类的时间尺度,管理频率参照同事,与管理工具的方式不同。
这一判断的支撑在于测试时计算扩展,即延长运行时间可提升输出质量,嘉宾称该方向的可下注时点始于上一代长时程模型。据其介绍,今年底后台与实时任务可能各占约一半,长期趋向九比一。其核心论点是“需求无上界”:回路中无人参与,后台消耗不受注意力约束。
(二)适配后台运行的任务类型
嘉宾列举了三类任务:一是深度研究,信息源数量级在万级以上;二是网络安全,可生成代码的规模与破坏路径的规模呈指数关系,且能力前沿参差不齐,大模型可发现的缺陷不能完全覆盖小模型可发现的缺陷,适合多模型广泛采样;三是个人常驻助理,前提是单位成本足够低,用户“在无回报承诺的条件下仍愿意消耗token”。
业务边界上,他将范围限定于可验证问题,包括软件、形式化数学证明及部分科学发现,这类问题当前均隐含一个美元成本,即“可调动多少token使结论成立”;不可验证部分归入人类品味范畴,不纳入业务。
二、软件层与模型侧的效率空间
嘉宾的优化顺序为软件、硬件、电力,起点是现有芯片与数据中心的剩余效率。
(一)以硬件物理极限为目标的软件优化
嘉宾表示,其从英伟达继承的核心方法论是“光速”标准,即以硬件物理极限为目标值,逐一击穿中间瓶颈,考核绝对数值,不以相对竞品的位置为准。他认为市场普遍高估了内核工程的完成度:当代架构建立在既有注意力优化工作之上,模型架构的任何偏移(如位置编码方式变更)都会导致既有内核失配;该领域开创者的方法已由手写内核转为“在白板上写内核”,由人负责概念设计,模型负责实现。基于此,他承认软件层优势将被抹平,模型能力提升会整体抬高这一环节的水位,难以构成长期壁垒,这也是其向硬件与电力层延伸的原因。
效率坐标方面,据其介绍,一是在大维度矩阵乘运算下,硬件利用率可达峰值的70%至80%,此时约束条件已由软件转为功耗;二是实际负载中多数时间并不处于该运算模式,因此工作重心在于持续以大批量任务填充计算单元;三是编程单位正由单卡优化转向整机柜乃至整集群。
(二)延迟与吞吐的取舍
嘉宾表示,GPU属于吞吐导向架构,过去两年的交互式使用形态将行业整体推向延迟导向。取舍的根源在批处理:批量规模决定并行度,同时使单个请求承担他人流量的等待成本。他以公共交通与出租车作类比,其业务定位于前者。
这一取舍直接决定芯片选型。GPU间高速互联用于压低单次操作的延迟下限,但扩展呈次线性,八分片仅得四至五倍加速,损耗来自通信开销与分块效率下降。基于此,对低延迟诉求较弱的服务商而言,互联能力较弱、基础算力性价比较优的芯片具备使用价值,其优化目标是单位成本算力。
(三)Transformer结构与上下文缓存
对于采用大容量片上静态存储路线的加速器,嘉宾认为该路线在权重存储上具备优势,但受制于上下文缓存。他将缓存定义为“当前对话的动态知识”,其内存规模常超过权重本身,且随使用动态增长、事先不可预知。技术上,前馈层在大批量条件下受算力约束,注意力层在长上下文条件下受内存约束,Transformer将两类层结合于同一架构是其固有代价,单一芯片难以同时优化两者,合理路径是异构分置。对于长对话质量衰减,他表示缓存本身是前文的精确表示,衰减来自训练分布,模型训练以较短对话为主。
(四)数据来源与模型效率
数据层面,嘉宾将互联网定性为一次性数据补贴,高质量文本约30万亿token,放宽标准约300万亿,且已被反复训练。他认为随机用户的交互反馈已不具价值,中位模型能力已超过随机人类样本,需求转向专家偏好。下一阶段的效率来源是强化学习环境,给定可验证的困难任务与进展度量,环境本身即构成数据;据其介绍,前沿实验室在数据采购上的支出比重下降,在环境构建上的支出比重上升。他推论,通往通用能力的路径可能是持续堆叠专用能力直至覆盖完整,前提是任务可验证。
关于当前效率较低的环节,他表示,一是算力扩展本身效率较高,当代模型激活密度多低于10%,前沿模型接近1%;二是效率损失集中于注意力及其内存使用,上下文缓存基本未经压缩,当前每token数KB的存储量按信息熵衡量高出合理水平一至两个数量级。
三、芯片选型与电力场地的成本压缩
嘉宾在硬件与电力层面的策略是以价格换取可用性,聚合分散供给形成规模。
(一)芯片分配与非先进芯片的定价
对于先进芯片的分配机制,嘉宾表示,一是供应方将算力等同于权力,若任由支付能力强的买方取得全部供给,将导致单一客户权力过度积累,故分配具有战略性;二是交易关系与财务背书构成实际准入门槛。对于非先进芯片,他认为“性能问题实质是定价问题”,给定合适价格,任何芯片均具备部署价值;主要竞品芯片的软件生态成熟度较低,为外部团队留出优化空间,但这一窗口正在收窄,多家大型买方已公开采购。他将自身优势归为三项:一是同时驾驭多种架构的工程能力;二是无历史包袱条件下的软件栈重建速度;三是在异构服务系统中按比较优势分配负载的运营方式。
在晶圆制造环节,嘉宾提出,产线良品的性能离散度客观存在,代工方为收敛工艺角付出显著的时间与成本;若接受更宽的工艺角与更高的废品率,可换取更低的晶粒成本。其整体优化目标涵盖晶粒成本、供给量、电力成本与场地可得性。
(二)分散场地与可中断电力
据其介绍,从推理买方视角看,吉瓦级项目在美国已基本不可得,百兆瓦级难度上升,十兆瓦级为当前可行边界,兆瓦级供给充裕。市场存在总量可观但高度分散的电力资源,这部分资源对训练集群价值有限,因为训练需要算力集中。他认为市场存在认知时滞,多数开发商仍按百兆瓦级地块的逻辑获取资源,而液冷技术已改变物理尺度,兆瓦级算力当前约对应八个机柜。
该方案的成本让渡主要包括三项:一是无电力冗余;二是通常不配备现场发电;三是多数情况下无冗余网络。据此,他预期部分站点可用率降至95%并表示可以接受,理由在于控制平面可在故障互不相关的前提下迁移负载,且可用率在该区间内对成本函数呈线性影响;前提是异步长时程负载,单次故障导致的重新调度对以小时计的任务影响有限。其向客户提供的条款是平均吞吐具备竞争力、尾部延迟不作承诺,对价为成本优势。
他进一步表示,若可接受95%,则在合适价格下亦可接受80%。间歇性电源与数据中心基载需求的矛盾,可通过“可预测的停机”化解,以天或周为单位的中断可借助气象建模提前调度负载;前提是芯片单价足够低,闲置产生的资本成本可以承受。主持人将这一策略概括为拾荒式获取供给,嘉宾表示认同,称其不参与与头部实验室的算力竞价,转而聚合分散供给,路径类似小型电炉钢厂。他同时指出,全球算力调度效率是另一项损失来源,当年出货的数百万颗芯片实际利用率存疑,相当部分进入不可见的私有池并处于闲置状态。
四、成本下降幅度与硬件格局
嘉宾认为,推理成本仍有数个数量级的下降空间,当前需求具有即时使用属性,硬件格局中高带宽内存是可能的突破口。
(一)成本下降幅度的测算
嘉宾设定的目标状态为人均每日消耗一万亿token,按当前定价约需500万美元。他表示,单位token成本需改善三至六个数量级,压缩至5000美元量级方具备客户基础。500万美元至5000美元约对应一千倍,为其区间下限,上限为六个数量级,他未给出实现的时间跨度。据其介绍,特定尺寸模型的万亿token成本已向数万美元量级逼近。改善来源对应前述三层:一是软件层,包括内核适配、批处理策略、并行方案与计算单元填充率,其中缓存压缩单项即有一至两个数量级空间;二是硬件层,包括次优先芯片、按单位成本算力选型、异构混搭与接受更宽工艺角;三是电力与场地层,包括分散站点、削减冗余、接受较低可用率与使用间歇性电源。他引用的经验法则是“成本每下降一个数量级,即产生一个新的产品品类”。
(二)半导体估值与需求性质
对于半导体板块估值占比偏高的担忧,嘉宾从两个方面作出回应:一是上一轮周期的网络设备投资属于前置性铺设,需求尚未到达,当前的token消费具有即时使用属性,不存在囤积行为;二是2023至2024年的短缺以训练支出为主,训练本身具有前置属性,与当前推理需求性质不同。
(三)硬件格局与芯片创业方向
嘉宾对领先厂商短期看多,同时认为同口径比较近三代产品的单位功耗性能,改善幅度有限,上游制程逐代之间的单位功耗性能变化同样有限,由此推论次优先制程与先进制程之间的差距小于业内讨论所渲染的水平。
对于芯片创业方向,他提出四项供应链约束:一是晶圆产能;二是高带宽内存(HBM)产能;三是先进封装;四是电力与场地。他认为差异化须建立在“领先厂商难以调整的既有选择”之上,产品定位须在单一维度上尖锐化。他将高带宽内存视为突破口,该环节产能扩张缓慢,存储厂商受周期性资本开支影响扩产意愿有限,其团队的对应路线是将上下文缓存卸载至闪存。对于领先厂商不自营token业务,他解释为避免与客户竞争、维持多元服务商生态,使任何单一环节的向上整合或转向竞品均可被后续参与者替代。
(四)开源蒸馏与终局形态
在开源与蒸馏方面,嘉宾认为前沿模型领先三至六个月的溢价当前仍然成立,但持续性有限,约束条件在于企业部署节奏,多数企业仍停留在更早的模型版本,任何变更均需完整的评估流程。他认为能力扩散难以阻断,差异仅在速度,论据之一是公开代码库中模型生成内容占比持续上升。对于终局,他表述为“充裕的token加上多样的外壳”,定制方式以上下文学习为主,权重微调居于次要位置。
总的看,嘉宾认为推理需求正转向不受注意力约束的后台长时程任务,单位token成本仍有三至六个数量级的压缩空间,来源涵盖软件、芯片与电力场地三个层面;在他看来,当前将智能体视为咨询成本高昂的专家、仅在遇到难题时调用的使用方式,与这项技术的成本结构并不匹配。