← 返回AI 应用主题跟踪

GPU经济视角下的推理成本、token需求与实验室毛利——Altimeter创始人Brad Gerstner与Groq前总裁Sunny Madra演讲要点梳理(斯坦福大学MS&E435课程,2026-07-23)

Stanford Online(MS&E435),56 分钟 · 2026-07-23

——据斯坦福大学MS&E435课程《AI超级周期经济学》讲座《Stanford MS&E435 Economics of the AI Supercycle | Spring 2026 | The GPU Economy》(2026-07-23)整理

摘要:本文对斯坦福大学MS&E435课程“GPU经济”一讲中Altimeter创始人兼首席执行官Brad Gerstner与Groq前总裁Sunny Madra的主要观点进行了梳理汇总。梳理了AI应用与软件在边际成本上的差异,介绍了Groq的商业模式转型、推理拆分架构以及推理单价与算力租价的走势,最后阐述了前沿实验室毛利率由负转正的原因与算力资本开支的可持续性。据其介绍,推理成本过去两年到两年半下降接近99%,H100租价却在上涨;将两套推理系统组合后,同一功率下token产出可达原来的2.5倍;实验室建设推理工厂的成本约为每吉瓦500亿美元。

关键词:推理成本;token需求;单位经济;AI资本开支;前沿实验室;英伟达;Groq;Anthropic

一、AI应用的算力成本属性

讲者认为,与软件近零的增量分发成本相比,AI应用每新增一个用户都要消耗真实算力,这是本讲讨论的出发点。

(一)课程前提

本讲开场主讲人为课程讲师Apoorv Agrawal(斯坦福大学管理科学与工程系兼职讲师、Altimeter Capital合伙人),客座讲者为Altimeter创始人兼首席执行官Brad Gerstner,以及Groq前总裁、现随公司并入英伟达(NVIDIA)的Sunny Madra。据讲师介绍,Gerstner在互联网泡沫时期参与创办General Catalyst、早期投资谷歌(Google),移动时代投资Meta,云与软件时代投资Snowflake、Confluent、MongoDB、GitLab,经历了多个超级周期。

讲师开场即提出本讲命题:过去几十年软件的增量分发成本接近零,AI应用做不到,“更多用户用AI应用就需要大量算力”。

(二)token生成的算力强度

Sunny以Snowflake作对照:数据库检索是取一条记录再送回,消耗的计算周期不多;生成一个token所需的浮点运算量则“令人瞠目”,其经验公式为“大致等于模型参数量乘以上下文长度的平方”,且这是每一个token的开销,一次任务要生成大量token。他据此认为,当前阶段的技术“极其出色但极其算力密集,比此前任何一种计算范式高出好几个数量级”。

边缘侧的约束同样明显。Sunny表示,“一个80亿参数的模型,已经算很小了,可以在30分钟内把一部iPhone的电耗光”,要把前沿智能推到边缘,先要回到AI高度算力密集这一基本事实。Gerstner认为苹果(Apple)内部对自身策略同样存在压力,核心矛盾在于隐私:一方面边缘侧能力不足,另一方面苹果不希望把用户信息上传云端。多头逻辑是设备粘性足够强,装进手机的Gemini会是“能力强得多的Siri”,对多数人足够好;空头逻辑是其他公司做出用户更喜欢的环境计算设备。他希望OpenAI专心做智能、不做设备,并认为苹果在设备领域相当有战斗力。

(三)宏观背景

Gerstner以几组数据说明这一领域值得投入:一是全球人均GDP在近两千年里有一千八百年几乎不动,此后翻倍所需年数不断缩短,如今全球GDP约每25年翻一倍;二是科技占全球GDP的比重由5%升至约13%;三是纳斯达克成分公司过去十年每股收益年复合增长15%,非科技公司为6%。他转述Demis Hassabis的说法,AI的影响将是工业革命的十倍、速度也是十倍,并在十年内展开。谈及就业,他以工业革命作类比:过去80%的人在制造业与农业,今天70%的人在服务业;AI会把过去只有2%至3%的人负担得起的私人导师与私人医疗普及到其余人群,“IQ会被商品化,EQ变得极有价值”。

二、推理架构创新与token产出效率

Groq由销售芯片转向提供云端API,并通过拆分解码环节与英伟达系统协同,在同一功率下提升了token产出。

(一)Groq的商业模式转型

据Sunny介绍,Groq创始人Jonathan Ross在谷歌创造了TPU,起因是听Jeff Dean讲“好消息是我们找到了解决语音识别的算法,坏消息是没有足够强的算力去跑它”,于是用FPGA做出第一版。Groq芯片为数据流架构,完全确定性,由编译器预先决定每一次计算发生的位置。Gerstner补充,Groq与Cerebras都成立了十年左右,到第九年仍在为生存挣扎,“他们在为一个当时并不存在的市场造东西”;转折点是他在BG2播客上听黄仁勋(Jensen Huang)表示“一切都变了”,行业从预训练转向推理时推理,推理量“将增长十亿倍”,现有算力系统难以适配此类负载。

Groq在商业模式上作出三方面调整。一是放弃以硬件销售为主,Sunny表示,他们判断“说服人们购买我们的硬件并使用会很难”。二是自建云、自运营数据中心,以API形式提供服务,把开源模型(包括OpenAI开源的Whisper)放上去,“开发者其实不在乎背后是什么,只要有API,开发者是相当可替代的”。三是以旧工艺芯片参与竞争,据其介绍,2018年设计、2019年流片的14纳米V1芯片,在云端对比新五代工艺的Hopper仍具竞争力;云服务上线几周即达到几十万用户,目前约400万用户,而英伟达用了近17年才积累700万开发者。

(二)推理需求的抛物线增长

Sunny表示,推理模型出现后,token消耗“贪婪得多”,这还未计入代理,token消耗曲线“直接抛物线化”,Groq的云服务开始出现故障。他给出的当时行业约束是“OpenAI只有1吉瓦算力,Anthropic也只有1吉瓦”,因此必须同时开发更省token的模型与更省token的架构。

(三)预填与解码的拆分

Sunny介绍,业内已普遍把推理拆为预填(prefill)与解码(decode)两组机器,Groq进一步拆分解码本身,因为解码内部既有算力密集的函数,也有内存带宽密集的函数。GPU算力充足,但外置HBM内存相对较慢;Groq芯片算力不多,片上SRAM充足,带宽“高出近一个数量级”。他们向黄仁勋提议通过NVLink把两种芯片连接起来、各取所长,当时英伟达可将72颗芯片互联、正扩展至576颗,Groq已有模型运行在4000至8000颗芯片上。其结果是:“取同样的功率占用,把两套系统合起来,可以多产出两倍半的token。”

Gerstner将此纳入其“工厂”模型:OpenAI有固定的功率占用,例如9月要接收的约1吉瓦Vera Rubin,工厂一端输入电力与芯片,另一端产出token;收购Groq之后,同样的功率、同样的厂房,token产出提高至两倍半。“我们这个世界的约束是电力和内存”,在此约束下把token产出提高两三倍,对OpenAI或Anthropic是“巨大的经济结果”。据其介绍,全球目前每周消耗“数十万亿”token。

据Sunny介绍,从向黄仁勋展示可运行系统到英伟达以200亿美元完成收购,“大概三十天出头”。他表示,英伟达已有七种芯片、五种机架的生态,“NVIDIA不再只做一颗GPU”,内部也曾考虑开发只负责解码、以SRAM为主的芯片,Groq的原型证明了两家公司、两套完全不同的技术栈可以协同。

三、推理单价与算力租价

讲者认为,推理单价快速下降,但需求增速快于供给效率的提升,上一代GPU的租价反而上涨。

(一)推理单价的下降

据Gerstner介绍,推理成本过去一年下降约90%,过去两年到两年半下降接近99%。他转述Marc Andreessen当天的说法,其接触的多数人现在用OpenClaw每天花100至1000美元购买token,“硅谷接下来二十年就是做把智能成本压下去的技术”。现场举手显示,OpenClaw在学生中的渗透率相当高。

(二)单位成本的三项输入

Sunny将单位成本的输入拆为三项:一是供应链,主要集中在中国台湾地区,包括台积电(TSMC)、封装技术与外部采购的光刻技术;二是工程师的创新;三是可用电力。他认为光刻正在逼近极限,“摩尔定律拿不到了,只能超越它”,应对办法包括两类:一是把芯片做得越来越大,Cerebras的芯片大小如同披萨盒;二是与模型协同的架构创新、内存带宽升级、电路布局优化与量化,他点名了NVFP4。

(三)需求增速与H100租价

与此同时,模型规模持续扩大。据Sunny转述的流传信息,新一代模型正在逼近1万亿至10万亿参数,参数量直接抬高每个token的算力需求。他表示:“即便我们五年做出50倍,模型和需求跑得更快。这就是为什么出现了一个奇特现象:如果你在做初创公司或者要用H100,它的价格其实在涨。”

四、实验室毛利率与用户支付意愿

Gerstner认为,推理成本下降与支付意愿上升同时发生,使前沿实验室的毛利率由负转正。

(一)早期的负毛利

据Gerstner介绍,OpenAI与Anthropic起步时毛利率“高度为负”,相当于“造一个一美元的东西卖两毛钱”,原因在于当时模型能力有限、用户愿付的价格有限,而两年前推理成本又高得多。两家实验室押注两件事同时发生:一是推理成本大幅下降;二是智能变得更有价值后,用户支付意愿大幅上升。

(二)由“给出答案”到“采取行动”

Gerstner将应用演进分为两个阶段。第一阶段是“给出答案”,代码生成是自动补全,ChatGPT是“稍好一点的Google”。当前进入“行动”阶段,代理去建应用、建网站、解决客服问题、多卖一件产品、订一家纽约的酒店。“当它做事的时候,完成任务消耗的token增加一个数量级,但作为一个智能单位交付给终端用户的价值上升一百倍,所以支付意愿急剧上升。”Sunny补充了一个能力例证:Anthropic未发布的模型Mythos在BSD代码中找出一个漏洞,而那段代码被无数工程师检视过,“它做的事已超出人类能力,而这才是第三年”。

(三)token用量持续上升的原因

Sunny从供给侧说明了token用量将持续上升的原因。一是能力上限尚未显现,当前模型尚未在Blackwell、Vera、Rubin等新一代硬件上训练。二是实验室在模型外搭建了“harness”,Claude Code、Cowork、Codex、OpenClaw均属此类,这层外壳“弄清了怎样从模型里持续榨出更多”,任务卡住时向手机推送、不卡时通宵运行,“我们从没有过这样的东西”。三是个人助理扩大工作量,以英伟达内部的个人助理为例,它接入Slack、Teams、邮件与全部文件,每天早上整理当日待办并可代为处理,“你现在都不写邮件了,别人的代理写给你,你的代理看完回过去”,工作量反而增加。

(四)毛利率转正

Gerstner表示:“一年半到两年前这两家还是负毛利,现在是相当正的毛利。这门本来看起来不经济的生意,今天看起来高度经济。”他将成本快速下降归因于“极端协同设计”,认为降本发生在整座工厂层面,“工厂里有一堆摩尔定律在组合式地同时发生”。

五、资本开支的可持续性与算力供给格局

讲者认为,实验室收入与模型能力同步扩张,训练设备可转作推理之用,当前算力建设总体上并未过度。

(一)收入增长对资本开支的验证

Gerstner回顾了在BG2播客上向Sam Altman提出的问题:OpenAI有1.4万亿美元的支出承诺,收入只有130亿美元,如何算得过来。他原本期待对方论证收入将大幅增长、承诺是可重议的期权,得到的回答是“你要是不喜欢你的投资,我把你的股份买回来”。进入2026年,其播客搭档Bill Gurley等人明确认为这是AI泡沫,理由是支出速度缺少对应的付费需求。

改变其看法的是Anthropic的收入数据。据其介绍,Anthropic 1月是“35亿美元一个月”,2月是“80亿美元的月份”,3月是“105亿美元一个月”;他在另一处表示,Anthropic 3月“单月新增100亿美元年化收入”,相当于Databricks与Palantir年收入之和。他强调,这一增量来自产品能力跨过阈值后“全球数百万自利的行动者各自独立判断我必须买这些token”,无需雇用大批销售人员推销,Claude Code与Cowork是主要载体;OpenAI也在增长,但“指数没那么陡”。他称这是自己的“奥本海默时刻”:收入开始与智能在同一条指数上扩张,实验室因此付得起每吉瓦500亿美元去建推理工厂。

(二)训练设备转作推理与基础设施溢出

对于是否存在过度建设,Sunny持否定看法,并给出两方面理由。一是训练设备可转作推理,“训练用的设备会转为推理设备,那些大集群一直在这样转换,两个世界之间有自然的接续”;他引述微软Mustafa Suleyman当天的文章,今天的算力比GPT-2时期强50倍,能力差距则远超此数。二是基础设施存在溢出,日后回看会发现“有几家公司改变了互联网的形态”,谷歌为搜索与视频建设的基础设施“为互联网其余部分铺了路,包括CDN和其他各种东西”,今天为AI建设的基础设施同样会带来创新之外的收益。Gerstner补充,“Anthropic与OpenAI今年新增的算力将超过过去十年所有实验室之和,明年再翻一倍”,而“目前谈到的一切几乎是在没有算力的情况下发生的”。

(三)英伟达的毛利率与竞争

对于英伟达六成上下的毛利率是否可持续,Sunny以在职身份回避,Gerstner以股东身份作答。据其介绍,英伟达市值4.5万亿美元、市盈率约13倍,“市场倍数的一半”,增速70%;市场担心Trainium、TPU、Cerebras、Groq以推理方案与价格争夺份额,“这正是资本主义的好处,NVIDIA要么做出人们愿意多付钱的产品,要么降价、压缩利润率去竞争”。他表示,英伟达已宣布未来八个季度有1万亿美元订单在手,需求超过内存与供应能力所能支撑的建设量,并认为定制ASIC与TPU的成功更多反映的是智能市场与所需算力的规模。他回忆,16年前硅谷的共识是不可能出现万亿美元市值的公司,理由是“大数定律”,他反问“这刻在哪块石板上”,并重申英伟达将率先达到10万亿美元市值。

(四)对前沿进展的判断

Gerstner转述了与黄仁勋、马斯克(Elon Musk)、Sam Altman、Dario Amodei的交流:几位平日相互竞争,此刻“惊人地一致”,都以平实的口吻表示“我们到了,比想的更快,正接近指数的尽头”;Dario认为令他吃惊的是“我们几乎到了指数的尽头而人们似乎没意识到”。Sunny表示,黄仁勋对团队的要求是“不到100倍别来汇报”,并已在用AI设计下一代芯片。在安全方面,Gerstner支持Anthropic将Mythos置于沙盒(内部测试中找出Safari浏览器26个漏洞),认可由亚马逊(Amazon)、微软(Microsoft)等参与的联合加固机制Project Glasswing,同时反对“以恐惧营销行监管俘获之实”。

总的看,两位讲者认为AI应用的每一次使用都对应真实的token成本,推理单价的下降越来越依赖系统级的架构协同,需求增速仍快于供给效率提升;随着应用由“给出答案”走向“采取行动”,用户支付意愿大幅上升,前沿实验室毛利率已由负转正,收入与能力在同一条指数上扩张,为每吉瓦500亿美元的推理工厂建设提供了支撑。