← 返回AI 回报与泡沫跟踪

AI工厂token经济学的成本、需求与价值测算——英伟达Shruti Koparkar、Tue Tran访谈要点梳理(AI Factory Insider,2026-09-01)

NVIDIA,AI Factory Insider Ep.4,34 分钟 · 2026-09-01

——据NVIDIA AI Factory Insider节目《Tokenomics 101: What Are Tokens & Why They Matter | AI Factory Insider Ep. 4》(2026-09-01)整理

摘要:本文对英伟达(NVIDIA)AI Factory Insider系列第四期节目的主要观点进行了梳理汇总。该期由英伟达AI工厂业务副总裁Kaushik Shirhatti主持,AI基础设施产品市场高级经理Shruti Koparkar与市场进入战略运营负责人Tue Tran参与讨论。梳理了以token连接AI基础设施投资与业务回报的计量思路,介绍了token价值的构成、需求估算的三层方法与供给侧的三层效率,最后阐述了变现路径与token用量管控的思路。据其介绍,某电信客户发现只有约8%至16%的任务真正需要旗舰模型;企业AI工厂可从16至32张GPU起步。

关键词:token需求;推理成本;单位经济;模型路由;AI资本开支;英伟达;NeMo Switchyard

一、以token计量AI基础设施的投资回报

三位参与者将token视为连接AI基础设施投资与业务回报的计量单位,并以token价值与生成成本之差判断用例能否规模化。

(一)以产出连接投资与回报

Shirhatti表示,建设AI工厂的企业应始终着眼于客户,即使用AI的用户、机器与智能体,这些客户“不关心工厂里面发生了什么,不关心工厂怎么建的、用了什么基础设施、用了什么软件”,关心的是业务成果何时落地,“而那发生在第一个token落地的时候”。基于此,他提出本期的方法论前提:“如果你想把基础设施与AI工厂的投资,和业务上的投资回报率挂上钩,那座桥就是产出,而产出就是token。”

(二)tokenomics的定义与价差判据

Koparkar将token定义为“人工智能最基本、最基础的单位”:一是对语言模型而言,token是一组数字,通常代表四个字符,可近似理解为一个词;二是对图像生成模型而言,基础单位是像素,token是代表像素的一组数字;三是对生物学模型而言,token可能代表蛋白质分子结构。所有AI回答与智能体完成的工作,最终都建立在token之上。

Tran表示,tokenomics即token与经济学(economics)的合成,“照这个势头,它可能会成为2026年的年度词汇”。其审视对象包括三个问题:“生成一个token的成本是多少?这些token的需求是多少?让这些token被生成出来的价值是多少?”他认为,价值与成本之间的差额是企业真正在意的内容,“它真正决定了一个AI用例是被规模化、在公司里取得成功,还是在试点阶段之后就被砍掉”。

二、token价值的构成与场景匹配

Koparkar认为token并非同质商品,其价值由多个维度决定,用例所需的价值水平决定应当采购哪一类token。

(一)价值构成的三个维度与相对视角

Koparkar以大宗商品作类比,“即便是商品,比如一袋米,也分不同品种,有白米、茉莉香米、糙米,品质各不相同”。她认为token价值主要由三个维度构成:一是嵌入的智能,取决于生成它的模型,模型越复杂,token所含智能越多;二是上下文,即模型能同时查看的数据量,上下文越大,产出的token越智能;三是到达速度,即token的生成速率,她称之为交互性(interactivity)。

在上述绝对视角之外,还存在相对视角,即用例需要多少token价值。她表示,“如果你在不需要溢价token的用例上使用溢价token,那么溢价token提供的所有额外价值都被浪费了,这对经济性显然是坏事”,并据此提出“token效用”(token utility)概念,即把用例映射到相应的token价值上。Shirhatti补充举例,做研究也许应使用溢价token,生成猫的视频则无需为溢价模型付费。

(二)金融与零售场景的匹配

Tran以智能与速度两个维度,给出两组行业案例。

一是金融服务与资本市场。据其介绍,客户的交易与投资活动存在不同速度:高频交易一端速度至关重要,须有极低时延,但“在那个速度上,他们需要做的决策其实相当简单”,要优化的是生成简单token的速度;另一端是以周或月为单位形成五年或十年投资论点的投资者,“他们可以等两小时,可以等一小时”,在意的是token经过强模型、大量上下文的反复推理,数百份报告被纳入分析,“有子智能体在互相积极地反驳,真正确保论证是站得住的”,此时准确度与智能的权重远高于速度。

二是零售。一方面,基于英伟达Metropolis团队蓝图的监控摄像头模型持续查看视频流,只需输出是否发生偷窃等事件的一个token答案,“就那一瞬间,它只需要给你一个非常短的答案,是或否”;另一方面,同一零售连锁为十秒的广告视频生成字幕,模型需生成一百至两百个token,但无需实时完成,“可以放到晚上批处理”。同样的素材,token的数量与质量要求高得多,速度要求则低得多。

三、token需求的估算方法

Koparkar给出了分层估算token需求的方法,并表示“听起来复杂,但一旦开始动手做,一切其实都回到用例”。

(一)基础需求

第一层是粗略测算(back of napkin math),由三个数字相乘得出基础需求:一是用户数量;二是每位用户在分析周期内发起的请求或会话数;三是每个请求所需的token数,这一项取决于用例,聊天类用例所需token少于智能体类用例。

(二)放大与抑制需求的乘数

第二层是可使token需求迅速扩张的若干乘数。一是是否使用推理模型,“推理模型会生成用户看不见的思考token,但你仍然得把它们生成出来”。二是是否采用智能体工作流,主智能体会派生多个子智能体与工具调用,在规划、行动、再规划、再行动的循环中推高需求。三是缓存命中率,方向相反,若模型见过相同提示词,可直接取用已处理的token,从而压低需求。

据其介绍,缓存命中率即指KV缓存(KV cache),可理解为模型的短期记忆:模型处理输入提示词时算出对应的KV值并存储,后续提示词若与之匹配即可直接取用;提示词缓存与前缀匹配也起到类似作用。高命中率的典型场景是企业内部搜索,因为“很多人都在问,我的401(k)信息在哪儿找?我的工资单在哪儿找?”

(三)运营因素

第三层是运营因素:一是负载在一天之中的波动,存在早高峰与夜间低谷;二是季节性,零售客户在节日推广产品时token需求会大幅上升。

四、供给效率与模型选择

Tran将AI工厂的供给能力归结为吞吐,即每秒能够生成的token数量;Koparkar认为供给侧的经济性取决于模型与基础设施两项选择。

(一)模型、硬件与软件三层效率

Tran以汽车发动机作类比,能量进入、产出流出,发动机看马力,AI工厂看吞吐,并将决定生成速率的因素归为三层效率。

一是模型层。早期大语言模型参数较少,但属于稠密模型,“每次你想生成一个新token,都必须读取并对每一个参数做数学运算”,参数量又与智能相关,形成运算量大而智能有限的权衡。混合专家(MoE)架构的参数量与知识容量大得多,但每生成一个token只读取相关专家,“于是你做的运算少得多,得到的答案反而更好”。其代价在网络,专家可能分布于不同GPU,GPU之间须高频通信,对网络性能要求很高。二是硬件层,即上述需求在硬件上的延伸。三是软件层,须以正确方式与硬件协同,有效编排任务运行时机,使停机尽可能少、集群利用率尽可能高。三层叠加,构成把投入能量转化为token的完整AI工厂。

(二)旗舰模型的实际需求比例

Koparkar将供给侧归结为两个选择:选择何种token,以及选择何种基础设施生成token;前者又取决于模型选择,“不是每个用例都需要溢价模型”。据其介绍,某电信客户发现,尽管“很多开发者总是默认用溢价模型,实际上只有大约8%到16%的任务真的需要溢价模型”,其余任务已转向经过后训练的开放模型,或通过API调用更小、更贴合任务的模型。

基于此,她介绍了配套工具:一是智能路由,英伟达在NeMo Agent工具包中新发布的NeMo Switchyard可依据模型匹配度、定价与成本画像等因素,把请求分配至合适模型;二是可观测性,NeMo Relay帮助企业掌握token去向、各类token用于何种用例以及是否产生业务价值,上述软件均已开源;三是基础设施,NVL72系统适合MoE模型,考虑到企业往往须适配现有环境与能耗约束,另有HGX系统至RTX PRO服务器等不同规格;四是调度软件,她援引黄仁勋的说法,Dynamo是AI工厂的操作系统,负责把请求发送至正确的GPU并保持工厂高利用率。Shirhatti将其概括为横跨计算、存储、网络、软件与安全的“极致协同设计”。

五、变现路径与投资回报管理

两位嘉宾梳理了token的变现路径,并认为用量管控的重点在于确保每个token的投资回报合理。

(一)四类变现路径

一是直接出售token,将生成的token供给市场,“几乎就是云的模式”。二是凭借独有智能获得直接收入,Tran将其与提供服务相区分。三是AI原生产品,包括Koparkar所说的新一代公司用AI建立的产品,以及把AI注入现有产品以提供差异化能力。四是以AI改造内部运营,如提升员工生产率、优化供应链管理。Shirhatti认为,“AI给了每个人的机会,不只是在内部优化一个流程,而是重新想象这个流程。”

Tran建议仍在观望的组织“就是开始做”,起步时的驱动变量相当清晰,可从高层次入手、边做边细化,并由业务侧与IT侧共同参与:业务侧定义用例及所需的速度与质量,IT侧回答选用何种“发动机”、上云还是本地部署。

(二)token用量的管控思路

针对如何为“token海啸”设置护栏,Koparkar表示曾与一群企业CEO讨论是否应为AI使用者设定token限额,她并不必然反对,但认为“token海啸之所以成为海啸,只是因为你没看到成果。如果你的token需求很大而你也看到了对等的成果和ROI,你会很高兴”。她的处方仍是从用例出发,明确所需的token效用,再从供给侧优化基础设施与模型选择,例如使用在智能体任务上轨迹更高效的模型,“比如Nemotron 3 Ultra每轮用的token更少、总轮数也更少”。降低每项任务的token数与每个token的成本,即可降低每项任务的成本,投资回报随之显现。她的结论是,“这与其说是要最小化token需求,不如说是要确保你认为自己需要的那些token的ROI是合适的”。Shirhatti补充认为,“token是创新的燃料”。

(三)企业AI工厂的起步规模

Shirhatti表示,业内确有大规模基建扩张,云厂商在建设吉瓦级新场地,但对企业而言,“它可以从16张GPU开始,可以从32张GPU开始,你可以爬、走、再跑”。其路径是先做若干用例、理解相应负载、为项目排定优先级,再开展学习与微调,最后把AI工厂规模化。

总的看,三位参与者认为,AI基础设施投资的回报应以token为单位计量,一个用例能否从试点走向规模化,在很大程度上取决于token价值与生成成本之间的价差;token并非同质商品,需求估算须回到具体用例,推理模型与智能体工作流会成倍放大需求,缓存则起抑制作用;据其介绍,只有约8%至16%的任务真正需要旗舰模型,供给侧的关键在于为任务匹配合适的模型与基础设施,用量管控的重点在于确保每个token的投资回报合理。