← 返回AI 应用主题跟踪

模型到企业工作流的落差、应用层价值分配与AI扩散节奏——Box创始人兼首席执行官Aaron Levie访谈要点梳理(Sequoia Capital,2026-09-15)

Sequoia Capital,65 分钟 · 2026-09-15

——据Sequoia Capital节目《Box's Aaron Levie: On Reinventing Yourself in the AI Age and Enterprise Diffusion》(2026-09-15)整理

摘要:本文对红杉资本(Sequoia Capital)播客节目中主持人与Box创始人兼首席执行官Aaron Levie对谈的主要观点进行了梳理汇总。梳理了模型能力与企业工作流之间的落差及其对应的应用层价值空间,介绍了Levie对token补贴、推理成本与开放权重采用的判断,以及Box在代理harness、模型评测与系统记录厂商策略上的做法,最后阐述了编码之外知识工作的扩散节奏与Box的内部实践。据其介绍,业内约一万亿美元的下注取决于上述落差的大小,Box自建harness将百页贷款文档的抽取准确率由70%提升至97%,五年后企业九成的token将由用户从未主动触发的后台任务消耗。

关键词:企业采用;企业代理;应用层护城河;开放权重;推理成本;Box;Aaron Levie

一、模型能力与企业工作流之间的落差

Levie认为,模型能力与企业实际工作流之间存在较大落差,补上这段落差的软件工作构成应用层的主要价值空间。

(一)落差大小决定应用层的价值空间

Levie表示,两年前“模型套壳”还是贬义标签,如今应用层公司被当作热门的新实验室。他把关键变量描述为一座桥,即从模型能力通向企业既有工作流,业内约一万亿美元的下注落在这座桥“很窄”还是“很宽且需要伸进组织深处”两种结果之间。他的观察是落差确实很大,而补上这段落差的公司会积累足够的数据与领域知识,届时自研模型也变得合理,从而形成飞轮。

(二)基础设施与应用的历史类比

他以云计算作类比:亚马逊云服务(AWS)、谷歌云(GCP)、微软Azure创造了数万亿美元市值,同时又催生了依托这些基础设施而存在的数万亿美元软件价值;十年前看GCP或AWS早期的数据产品,很难预测出Snowflake与Databricks会各自长出上百亿美元收入。他认为智能层将重演这一过程,模型极有价值,把模型接进银行、生命科学、医疗、政府的真实流程仍需大量软件工作。未来两到五年的关键在于模型厂商向上延伸的程度,这对实验室自身也构成张力:一方面希望更靠近客户,另一方面需要生态相信其不会在上层竞争。

(三)工作流落地的具体障碍

Levie指出,通用对话框可以完全横向,而工作流有多方面额外要求:一是需要在特定节点主动提醒人;二是需要对话框天然拿不到的数据访问权;三是需要有人进入组织完成部署,并把领域知识提供给模型;四是需要应对未现代化的遗留系统、人在环的等待与业务流程的变更管理。他表示,除非大实验室扩张到十万人规模去逐项处理这些事,否则扩散型经济将非常庞大,从五十人的事务所到数千人的公司都需要一支队伍负责落地与变更管理。

二、推理成本与模型供给格局

Levie判断token补贴属于阶段性现象,同等能力下的每token成本将持续下行,开放权重模型将逐步承接成熟用例。

(一)token补贴的阶段性

Levie表示,模型厂商对token的补贴在一定支出门槛内有效,而在数百亿美元级的资本规模上可能已越过这一门槛,因为训练投入最终也需要收回。主持人指出实验室可以把API定价定得高于自家一方产品,他承认这一路径成立,但补充了均衡条件:若API是支撑补贴的高毛利业务,而客户均被迁至应用侧产品、API收入随之消失,这套内部补贴就难以为继。

(二)非经济动机参与者与成本下行

他认为更重要的变量是游戏规则不同的参与者,如Meta、SpaceX、英伟达以及中国厂商等,它们不需要与Anthropic、OpenAI相同的毛利结构,为消化庞大的算力集群,接受10%的推理毛利也可以。基于此,一是只要没有他人无法复制的技术秘方,同等能力下的每token成本将持续下行,下行部分更多沉淀到应用层;二是他不会押注一两家实验室拿走95%的价值创造;三是若智能仅剩一家供给,反垄断压力可能推向国有化,保留一定竞争对实验室自身更为有利。

(三)开放权重模型的企业采用

据其介绍,客户中开放权重模型的采用度高于外界估计,低于企业自身期望的水平,且远低于五年后的水平。他把其中三成以上归因于尝鲜与对冲心态:财富500强企业的首席信息官(CIO)在试用开源模型,同一成本档位上Gemini或Muse本已够用,但企业希望保留对冲选项。当前的障碍包括token效率有时偏低,以及偶尔出现推理链中途改用中文等不稳定行为,这对银行客户构成问题。

(四)成熟用例的剥离与两种编排形态

他认同Decagon的Jesse提出的剥离机制:闭源模型收入继续指数增长的同时,每个成熟下来的用例会被逐步迁移至开放权重模型,前提是确实更便宜,或经一轮后训练能获得额外性能。两种编排形态将会并存:一是由前沿模型编排、把长尾任务派给低成本模型;二是由低成本模型默认承担、遇到明显超出能力范围的任务再向上转交。据其判断,结果可能是支出在两侧各占一半,而开放权重模型承载十倍的token量。

三、Box的harness、模型评测与定制化

Box依托海量企业文件自建代理harness,以两套评测集选择模型并持续提升准确率,定制化的推进则受企业权限结构约束。

(一)自建代理harness

据其介绍,Box存有数千亿份企业文件,合同、研究文档、营销素材、贷款文件中装着关键信息,而企业通常并不清楚其中的内容。Box搭建了一套自有的代理harness,把文件系统、权限结构、搜索引擎的内部理解写入其中,包括人在十份文件中如何判断该打开哪一份等经验;harness可以只取正文、只取分块、即时做嵌入,一次并发多路检索再重排,必要时读取全文。Levie表示,与把Claude或OpenAI直接接到Box的API相比,其准确率与延迟均有可度量的优势。

(二)两套评测与模型选择

每个新模型要跑数百项测试,评测集有两套:一是对外发布的complex work eval,覆盖生命科学、金融服务、公共部门、科技等领域的文档型任务;二是由Box自身实例与员工真实用法构成的保留集。据其介绍,半个百分点的模型改进即可被识别,Box按成本与准确率阈值设定默认模型,客户也可在自家的model garden中任选。

Levie表示,模型排名与编码能力高度相关,例外是Gemini在部分用例上明显好于其编码表现所对应的位置,他推测与工具使用能力和Gemini生态的需求形态有关。他认为Fable 5.1处于其所见模型的前沿水平,GDPval与Mercor的APEX等榜单方向一致,Grok、Muse、Fable一档与GPT-5.6目前处于胶着。按用户数看,多数客户直接使用默认模型;按token量看,体量更多来自工作流代理与数据抽取,这部分客户会自行评测,如要求在给定成本档位下数据抽取准确率达到98%,Box会派专职人员进场理解数据环境、对比五个模型。

(三)准确率爬坡决定流程能否自动化

Box Labs是Box内部的应用研究团队,重点是在给定问题上将准确率再提升十个百分点,以及在harness层做自动化的爬坡搜索。Levie以银行的百页贷款文档为例,开箱模型准确率为70%,经体系化调优后达到97%,这一差距决定该流程能否真正实现自动化。

(四)持续学习受权限与访问控制约束

谈及记忆与个性化,Levie表示对把上下文写入模型权重的路线很感兴趣,同时指出企业环境中的权限与访问控制是主要摩擦点。一是研究员对所有材料都有访问权,而一位律师的访问范围可能只有手上五个项目,一墙之隔的同事在做对方当事人的项目,双方之间一份文件都不能流通;二是即使为单个用户训练模型,其每天被加入或移出项目也会改变可用的上下文边界;三是需要一张判断表,数据变化率不高而进入权重能显著提升准确率时即写入权重,其余走上下文。

主持人援引Karpathy的设想,把记忆性信息从权重中剥离,只保留推理能力与一家机构的做事方式,内容交由查询系统。Levie认为关键在于企业的区分度有多少来自执行风格、有多少来自具体案件与具体知识产权的深度,后者往往才是价值所在。他点名Trajectory、Applied Compute、Prime Intellect等方向,认为机构层面的定制几乎必然存在,如礼来(Eli Lilly)会希望拥有属于自己的药物发现模型,而药物发现流程中的信息隔离墙较少,企业反而希望信息在内部充分流通。总体上,这一领域将按垂直行业分化,取决于防火墙在流程中的位置。

四、系统记录厂商的策略与产品形态

Levie认为,拥有数据与工作流的SaaS平台须同时自建代理和对外开放接口,企业流程将更多以后台代理的形式运行。

(一)自建代理与对外开放须同时推进

针对“每家软件公司都想卖我一个自家代理”的讨论,Levie表示,凡是建了SaaS平台、掌握数据与工作流的公司,有两件事必须同时做,只做其一会输。

一是自建代理,在使用自家系统方面要被证明比开箱代理好十到二十分,依靠评测驱动的深度调优,与限制外部接入无关;由于每天与客户交流,还能发现他人想不到的用例,如一位客户希望有一个常驻的治理代理,在员工即将触犯留存或法务保全策略时当场提醒,因为合规与治理负责人无法同时出现在每个人身边。

二是走headless路线,把API通过模型上下文协议(MCP)等方式开放给Claude、ChatGPT以及各类外部平台,或让自家代理本身可被这些系统调用。他认为很多人低估了这里的纯增量用例:他本人通过MCP使用Salesforce的频次比以往高出一个数量级,因为随时可以对CRM数据提问;他也曾对LinkedIn的产品经理表示,若能以MCP接入,他愿意支付十倍的价格。在商业模式上,他对“收费站”的说法有所保留,认为系统记录承担组织工作流、管理与保护数据、提供护栏等职责,对应的是按调用量计费的模式。

(二)后台化的产品形态与token结构

Levie认为通用对话框会长期存在,横向与垂直产品都会有;与此同时,企业大量流程运行在后台,有的由计算机执行,有的由人执行,还有一类本该由人执行,却因雇不起人而从未发生。这类场景需要的是仪表盘、工作流、队列与任务列表,聊天更多用于事后回看;横向产品若把这些组件全部纳入会变得笨重,垂直产品则能按具体流程设计功能界面。

他给出的量化预期是,五年后企业九成的token属于用户从未主动触发的任务,用户只看到结果并进行审核。据其介绍,法律领域已有Harvey与Legora,安全领域正在成形,长时编码领域有Cognition与Factory。

五、知识工作的扩散节奏与Box的内部实践

Levie认为编码之外的知识工作扩散将慢于硅谷预期,扩散顺序取决于岗位与编码的相似程度,放缓的部分恰好对应应用层的价值创造。

(一)编码扩散的六项有利条件

Levie以编码与其他知识工作作对照,认为编码具备六项有利条件:一是价值创造几乎完全体现在产出的文本上;二是模型在代码上被重度训练;三是各家实验室把编码作为竞逐基准,并且每天自用自测;四是使用者技术能力足够,代理报连接失败时自己就能开端口,无需求助支持团队;五是岗位薪酬高,哪怕只获得10%至20%的效率提升也自然有价值;六是代码集中在GitHub,早期编码代理接上仓库即可使用。

知识工作缺少对应的入口。一方面,数据分散在本地系统、遗留文件共享以及不擅长与代理对接的企业环境中,据其介绍,Box的收入运行率为13亿美元,意味着大量企业的内容尚未存放于这类系统中;另一方面,权限方向相反,写代码基本能获得岗位相关的全部材料,知识工作则要逐个申请访问权,还需解决代理如何持有这些权限的问题。

(二)岗位扩散的排序

按与编码的相似度排序,法律较为靠前,因为大量价值同样来自坐在电脑前审阅与撰写文档、处理大体量信息;销售代表处在另一端,其价值创造在于说服外部客户购买,即便配上高水平的自动化,仍受制于客户是否回复、有无预算、能否本周见面等外部条件。Levie认为硅谷需要为扩散慢于预期做准备,而放缓的部分正好对应应用层的价值创造,把技术送到律师、销售代表、生命科学研究员、客服主管手上,是眼下万亿美元量级的机会。

他还指出了内容层面的一层阻力:对多数人而言,代码具有工具属性,生成后能运行即可,因此编码的接受度很高;文档与演示稿则承担判断一个人是否值得信任的功能,收到明显由AI写成的材料会引发排斥,而接收者自己往往也在使用同样的工具。他预计这需要三到五年消化,类比是如今没有人介意财务模型由宏计算得出。

(三)Box的内部实践

据其介绍,Box的内部实践主要包括四个方面。一是数据集中,会议记录、项目计划、路线图、演示稿、财务文件与财务规划材料等全部存放在Box中,公司不允许员工使用其他系统,加上Salesforce等核心系统,数据卫生较好,代理运行更顺畅。二是组织推动,首席信息官深度使用AI,公司设立了小型的AI卓越中心并招聘内部AI岗位推动流程改造,起点是找出杠杆较高的工作流。三是用量复盘,公司有一份按token用量排列的名单,用于检查用法:用量前三的人中可能有一人在浪费,另两人的用法值得推广至其他职能,他曾要求把某个团队拉进会议室,由同事现场演示自身用法。四是产出衡量,部分模块面向客户的功能交付量提升至原先的两到三倍,他强调以交付了多少客户所需的功能为准,代码量本身不作为指标。

值得注意的是,Levie承认Box与Anthropic一类公司仍有差距,由于客户把数据安全与合规托付给Box,取消代码评审等做法无法实行,因此接受一定的生产率折价。谈及当下做创始人的感受,他表示一周半前看到一个两人团队的产品演示,同样的东西五年前需要四十人,代价是每个好点子会立刻出现五个竞争者,而Box早年尚有数年安静打磨产品的窗口。

总的看,Levie认为模型能力与企业工作流之间的落差较大,补上这段落差构成应用层的主要价值来源;随着token成本下行与开放权重模型承接成熟用例,价值将更多沉淀到应用层,企业流程将更多由后台代理执行;编码之外的知识工作扩散将慢于硅谷预期,当AI大幅加速产品构建之后,竞争重心将移向能把产品送到客户手上的一方,这是一场企业扩散之争。