应用层的推理成本结构、自有模型路径与算力约束——Baseten联合创始人兼首席执行官Tuhin Srivastava演讲要点梳理(斯坦福大学MS&E435课程,2026-06-05)
——据斯坦福大学MS&E435课程《AI超级周期经济学》讲座《Stanford MS&E435 Economics of the AI Supercycle | Spring 2026 | Applications, Applied AI》(2026-06-05)整理
摘要:本文对斯坦福大学MS&E435课程“应用与应用AI”专题讲座的主要观点进行了梳理汇总。讲座由课程讲师、Altimeter Capital合伙人Apoorv Agrawal主持,客座讲者为推理基础设施公司Baseten联合创始人兼首席执行官Tuhin Srivastava。梳理了推理支出在前沿模型与自定义模型之间的分配以及应用公司“拥有自己的智能”的逻辑,介绍了开源模型后训练的成本优势、定价模式的转变与开源模型的供给格局,最后阐述了算力供给约束、硬件格局与Baseten面临的主要风险。据其介绍,当前推理支出约90%至95%流向前沿模型,开源模型约落后前沿90天、运行成本低70%至90%,Baseten全部客户每天推理约30万亿token。
关键词:推理成本;开放权重;应用层护城河;前沿实验室;算力采购;Baseten;Tuhin Srivastava
一、推理成本与应用层的价值分配
Srivastava认为,推理是AI价值交付的销货成本,推理支出流向谁,决定了价值在各层之间如何分配,应用公司需要在一定程度上拥有自己的智能。
(一)推理支出的分配现状
据其介绍,Baseten成立于2019年,三位联合创始人共事十到十五年,当时判断“机器学习会很大,那就在旁边建一个基础设施生意,去捕捉它的指数”,过去四年专注于生产级推理,服务“增长居前的一批AI公司”。其客户即应用公司,Baseten的收入即应用公司的成本。
他提出,“推理就是AI价值交付的销货成本”:应用公司向用户出售产品,每一次响应背后消耗的token即公司的直接成本。据其估计,当前推理支出约90%至95%流向前沿模型,约5%流向自定义模型,后者主要是经过后训练的开源模型。Baseten的商业假设正是这一比例将发生变化:应用公司要建成“有利润、可持续、可防御”的生意,路径在于自定义模型。
(二)应用公司的多模型栈
他以两家客户说明应用公司模型栈的构成:一是语音输入应用Wispr Flow,为压缩从说话结束到文字出现的延迟,串联了三到四个语言模型与两个音频模型,均为自建或深度改造的模型;二是医疗环境记录公司Abridge,接入了几乎所有美国医疗系统的电子病历(EMR),从手术室或病房的语音到一份进入EMR的临床记录,中间运行约20个模型。据其介绍,两家公司的模型全部运行在Baseten上。
(三)用户信号与“东印度公司”之喻
主持人提出应用公司自建模型的核心疑虑:从开源模型分叉,等于脱离前沿智能的改进谱系,下一代GPT或Opus可能在数周或数月后超过辛苦后训练出的模型。Srivastava从可行性与护城河两个层面作答。可行性理由见第二部分;护城河方面,他表示:“你有什么东西是对前沿模型可防御的?大概是某个工作流、某种只有你才有的用户信号。如果你一直跟前沿实验室合作,某种程度上你就把所有数据和用户信号都给了他们。”他转述一位上市公司首席执行官的比喻:前沿实验室如同东印度公司,先四处结盟,实则在学习统治的诀窍,等到察觉时,对方已在针对只有你知道的工作流做后训练。
基于此,他认为应用层公司需要“在某种程度上拥有自己的智能”,即以开源模型加自有数据做后训练,把这一层栈掌握在自己手中。主持人追问Baseten掌握这些数据是否同样构成“东印度公司”,他回应“我们是西印度公司,我们在武装反抗军”,并表示公司同时服务多家相互竞争的客户,内部设有隔离边界;数据信任在多数情况下“没有想象中那么难”,因为客户更关心能否快速解决用户问题。
二、开源后训练的成本优势与定价模式
Srivastava认为,开源模型加后训练可以做到“更好、更快、更便宜”,应用公司规模越大,迁移的迫切性越强,定价口径也将随之由算力加价转向按token计价。
(一)成本优势与毛利路径
据其介绍,开源模型大约落后前沿模型90天,运行成本大约便宜70%至90%,叠加专用模型后训练,可以做到“更好、更快、更便宜”。客户通常在已实现产品市场契合、需要把毛利从0提升到40%、50%、60%乃至70%的时点找上门。主持人转述市场传闻称,前沿实验室以外的头部编码公司仍被传为负毛利,把token用量向开源迁移对这类公司关乎生存。
Srivastava认为规模越大越迫切,“你越大,走向这条路就越关乎生死”:一是规模很大时若只是转售token,成本将非常高昂;二是所需资本越来越多,通往盈利的路径须依赖后训练;三是迁移后的体验理应改善,针对自有用户信号做后训练有助于提升用户体验,控制权更大也有利于改善延迟与可靠性。他坦言Baseten内部尚无迁移前后体验变化的数据。
(二)由算力加价转向按token计价
主持人列出当前AI的三类定价方式:按结果、按token、按GPU小时。据其介绍,Baseten目前的模式是“对算力加价”,客户把模型部署在Baseten的推理栈上并选择算力类型,一张Baseten的H100或B200比裸算力贵,溢价部分即软件栈的价值。他自评这一模式“相对不成熟”,正在转向按token计价:随着后训练工作流在平台内打通,叙事将从“为算力付多少钱”转为“为每个token付多少钱”,头部客户更偏好后者,因为从Anthropic、OpenAI迁移过来的团队可以按同一口径对比成本。
(三)后训练工作流
后训练工作流由客户与平台分工完成:一是客户定义效用函数,即自身要优化的目标,他强调“我们帮不了你,我们不知道你的产品、你的用户、你的生意在优化什么”;二是客户提供数据并选择开源基座模型;三是平台提供全部脚手架完成后训练,模型直接接入平台预先集成的推理链路。以医疗场景的语音转文字为例,效用函数为转录错误率,客户带着数据与对工作流的理解进入,带着一个运行在Baseten上的专用模型离开。
三、开源模型的供给格局与前沿实验室的激励
Srivastava将“独立应用层的存在”与“开源好到你可以持续在上面做后训练”列为Baseten的两大赌注,开源模型的供给来源与各方激励因此成为关键变量。
(一)开源模型的来源
他表示,美国过去两年未能推出头部水平的开源模型,当前头部开源模型来自中国。原因主要有两方面:一是全球居前的研究人员集中在两家公司,这两家“尽管名字可能暗示了别的东西”,缺乏做开源的动力;二是Moonshot、阿里巴巴(Alibaba)、MiniMax等团队面对与闭源模型反向站位的市场机会,起初借开源获得行业相关性,Meta几年前也曾如此,后来又“著名地转向了另一边”。他列举了美国公司在开源上的投入,包括谷歌(Google)的Gemma、英伟达(NVIDIA)的Nemotron系列以及Reflection AI未来可能推出的模型,并判断美国开源进展“到大约一年前一直在下降,现在有回升”。
(二)“多模型世界”的立场
他表示Baseten主张“多模型世界”:“智能不应该被两个人拥有。过去每当太多权力集中在一两方手里,通常会发生坏事。”他同时认为,两家具有巨大利润动机的公司不应成为其他人的道德仲裁者,美国同样应当拥有好的开源模型,否则“我们只会剩下两家公司,不会有Apple”。
(三)前沿实验室与政府的激励
对于前沿实验室为何不开源落后一代的模型、再派团队进驻企业做数据,他认为OpenAI在一定程度上已在做,但对实验室而言投入后训练近乎放弃自身核心论题,“如果AGI就是一切,那他们为什么要做任何别的事?每一美元都应该投进预训练。”这些模型的目的在于以尽可能高的价格出售,并尽可能拉大能力差距。对于美国政府是否应为开源创造人为激励,他认为政府已开始介入,英伟达、微软(Microsoft)、谷歌也已大量投入但尚未见效,“必须创造人为激励,必须有某种联盟,自上而下地激励这些事”。
四、算力供给约束
Srivastava认为,算力紧缺难以正常化,获取算力是推理业务的战略优势,Baseten正由租用算力转向自建。
(一)多云调度与推理的黏性
据其介绍,Baseten的技术核心是把不同来源的GPU整合为可替换的资源池,“我们跑在18家云上,现在应该是20家,有87个不同的集群在拼算力”。对于规模化应用公司为何不直接使用亚马逊云(AWS)、谷歌云(GCP)、微软Azure或CoreWeave、Nebius等新云,他给出三点理由:一是性能,在这些云上“优化全靠你自己”;二是可靠性与算力,客户需要推理跨云容错运行;三是开发者平台,包括灵活性、安全与可观测性。许多客户先在这些云上自建推理栈,感到困难后转来。对于云厂商自推推理平台,他表示欢迎,认为推理栈上价值很大,且“推理非常非常黏”。
他以数据库作类比:“它有点像人们过去买数据库的方式:选一次,然后就在那上面长。”他转述一位创始人的话,推理即交付给客户的产品本身,“一旦你在token路径上,推理宕机就是产品宕机”;对部分公司而言,推理甚至是账本上居首的成本项,超过其云支出。
(二)供给紧张与价格上涨
他认为租与买代表两种“傲慢”:Baseten认为软件是栈中有黏性的部分,云厂商认为GPU才是,“两边大概都有点傲慢”。公司当初选择租用,一是为了速度,二是“我们没资格去建数据中心”,但正在转向自有:“无论别人怎么告诉你供给有问题,实际都要糟十倍。”据其介绍,谷歌财报显示GCP积压订单约十倍;现在订购1000张GPU,交付期在明年二季度,即12至15个月之后。价格方面,Baseten在某家云上的B200集群当前单价为每小时263美元,合同十月到期,对方五月即通知明年新价为510美元,涨幅接近一倍;他表示“绝对不”接受,仍有多家云可谈。
(三)规模测算与自建决策
他引用OpenAI研究员Noam Brown流传的一页幻灯片,大意是“算力的获取是推理的战略优势”。据其介绍,Baseten全部客户加总的推理服务每天约30万亿token,按token数计大于OpenAI的API与Gemini(对比对象为OpenAI的API产品,不含ChatGPT,“至少按上次报告”)。按此外推,两年后需要约15万张B200等价物,折合约70亿美元算力支出,靠租用无法保证获取,须与芯片供应商建立稳固关系、自行采购与搭建;经济上自建也有约30%的成本优势,参照是Oracle一类规模化云约30%的毛利。
对于算力紧缺何时缓解,他表示“我不认为它会正常化”:一是应用日益代理化,二是模型持续变大,两者都指向推理量大幅上升。他以机场作比,早上五点的纽约肯尼迪机场(JFK)没有排队,八点已排到门外,“我们现在就排在门外”;机场夜间会关门重置,推理需求则持续叠加,本地午夜需求回落时,欧洲与亚洲的需求正在上升。
(四)算力交易与标准化
他认为算力交易远未成熟,“它基本上是个毒品市场。你得有个人”,Baseten有同事整天打电话寻找算力;未来显然会形成市场,但目前更像早期的电力市场,“有很多滑点”。他还以集装箱作类比,认为集装箱把贸易的单位标准化,因而成为屈指可数的几大经济驱动力之一,希望有人做模块化数据中心,“谁标准化了算力单位,谁就能真正工业化”;当前每个数据中心各不相同,标准化后同一批人可在各地维护同一种设施,主持人概括为“给算力做一个API”。
五、硬件格局与主要风险
Srivastava认为,英伟达凭借供应链与开发者生态占据主导,推理架构正走向异构,Baseten的风险主要来自开源、应用层与算力获取三个方面。
(一)硬件格局与推理架构
主持人列举了英伟达之外的芯片,包括Trainium(据主持人介绍收入运行率约200亿美元)、TPU、Cerebras以及Etched、Positron、d-Matrix、SambaNova等。Srivastava表示,Baseten机队大部分运行在英伟达芯片上,TPU“很有前景”,Trainium尚未见到大规模使用。英伟达的优势主要有两方面:一是供应链、极低的资本成本与台积电的紧密关系,“今天有人能与之竞争的想法有点异想天开”;二是开发者生态,“没有任何东西像CUDA”,TensorRT-LLM运行时与vLLM、SGLang等开源框架均原生于英伟达,对要求快速推进的公司而言,这构成选择英伟达的理由。
架构方面,他认为推理的预填(prefill)与解码(decode)两部分以往都在一颗芯片上运行,他认为这种形态大概难以成为终局;据其介绍,英伟达收购了Groq,许多新芯片正在把两部分拆开,内存受限部分在GPU上运行,计算受限部分在另一种芯片上运行,行业将走向异构架构。创新点主要在分离式推理(disaggregation)与内核层,他用“流沙”形容这一市场:“整个栈都在变,你把所有东西扔掉,Ilya可能拿出一个新的模型架构,一切又重新洗牌。”
(二)风险与反命题
他将Baseten的风险归为三类:开源、应用层以及“拿不到足够的算力”。被问及其论题的反命题,他给出三条:一是世界上只有两家公司拿得到算力并拥有一切;二是开源模型不够好、不够多;三是若AGI论题被推到底,“我们都无事可做”,主持人与其补充,那时“推理或许是仅剩的市场”。多空判断上,他看多算力建设的各个环节,空头一侧未点名,仅表示会关注“不创新的公司”:企业需要想清楚如何把自身独有的东西与预训练模型结合并在其上做推理,不做这件事的企业“我会非常害怕”。
总的看,Srivastava认为,推理是应用公司的销货成本,当前推理支出仍高度集中于前沿模型;应用公司可借助开源模型与自有用户信号做后训练,在降低成本的同时掌握自己的智能,规模越大,这一迁移越关乎生存;与此同时,算力供给紧张在可预见的时期内难以正常化,获取算力将成为推理业务的战略优势。