← 返回AI 应用主题跟踪

知识工作代理的扩散路径、数据约束与应用层价值归属——Box首席执行官Aaron Levie访谈要点梳理(Big Technology Podcast,2026-04-08)

Big Technology Podcast,56 分钟 · 2026-04-08

——据Big Technology Podcast节目《OpenAI vs. Anthropic's Direct Faceoff + Future of Agents — With Aaron Levie》(2026-04-08)整理

摘要:本文对Big Technology Podcast节目主持人Alex Kantrowitz专访Box首席执行官Aaron Levie的主要观点进行了梳理汇总。梳理了Levie对OpenAI与Anthropic产品路线收敛的解释以及编码代理能力向全部知识工作外溢的判断,介绍了企业落地AI所面临的数据、信任与责任约束以及代理产品在速度与准确度之间的取舍,最后阐述了其对应用层价值归属与实验室竞争格局的看法。据其介绍,过去约四个月两大模型家族在Box知识工作评测上的提升达两位数百分点,代理可服务人群约为编码场景的30至50倍,任何一家实验室在前沿模型上的领先期约为六个月到一年。

关键词:企业代理;企业采用;前沿实验室;应用层护城河;代理安全;Box;Claude Cowork

一、前沿实验室的产品路线与能力进展

Levie认为,OpenAI与Anthropic的产品路线趋于收敛,模型能力仍在快速抬升。

(一)产品路线收敛

Levie认同“两家实验室在做同一款产品”的说法,并给出解释:如果一个模型具备接近超级智能的能力,它终将收敛到同一批用例上,实验室终须为这些用例正面竞争。Box是SaaS时代的企业内容管理在位企业,与两家实验室均有合作。

对于主持人提出的“Anthropic拿下企业与编码、OpenAI满足于消费者”的分工叙事,Levie作了修正。他指出,ChatGPT已渗入企业,许多企业把ChatGPT作为员工使用的公司标准大模型,这是独立于API业务的一条线,外界很难仅凭某一类数据判定谁在企业端领先。在他看来,两家在企业端都表现相当出色,当前的企业争夺同时在三条战线上展开:一是编码;二是API;三是面向终端用户的公司知识工作,即Claude Cowork类用例。主持人则认为,ChatGPT用户数“可能已达10亿,即便尚未宣布”。

(二)模型能力持续抬升

OpenAI代号为Spud的新模型与Anthropic刚训练完成的更大模型即将发布,Levie的判断是“离撞墙还差得远”,一年前的撞墙论已被冬季以来的进展否定。Box为每一代新模型运行一套复杂知识工作评测,交给代理一组文档并提出一系列高端知识工作难题。据其介绍,过去约四个月里,GPT由5到5.2再到5.4、Claude由4到4.5再到4.6,两个模型家族的更新已带来两位数百分点的提升。他预期下两次发布还会再来一轮提升,每一轮都将解锁一类新的企业工作。

二、编码代理能力向知识工作外溢

Levie认为,过去几个月的突破在于思路转换,即把代理写代码、调用工具、运行脚本的能力用到编码之外,但这一能力向其他知识工作的扩散需要很多年。

(一)通用知识工作者代理

Levie给出的心智模型是:“假如每个人都真正精通使用自己的电脑,可以为任何想做的任务写代码,而这个人是一名律师,是一名营销人员,是做研究的生命科学从业者。”他将这一形态称为通用知识工作者代理,其能力主要包括三方面:一是能使用电脑上的每一个工具;二是能为新问题即时编写代码;三是能通过skills调用既有的脚本与代码。按其说法,Claude Cowork较早做出了这一形态,OpenAI据传也将进入这一领域。

随着这一形态出现,范式由来回对话的聊天机器人转向任务交付:代理获得一项任务和一组资源,包括用户的数据、软件以及本机与云端工具,随后离线工作数分钟、数小时乃至数天,交回可供审阅的产出。据其估算,可服务市场由全部工程师扩大至全部知识工作者,按人数与用例计约为30至50倍。他还认为,这一形态会把代理“吸进企业”:“token短期内不会便宜,企业端每个token的投资回报会高得多,因为它产出的东西以某种方式进入GDP。”

(二)向其他知识工作扩散的约束

Levie认为效率终将胜出,他称之为传真机论证:新技术出现后人会重新给自己的时间定价,读一篇论文找一个事实过去要花两个半小时,代理三秒钟即可完成,“没有回头路”。他关心的问题在于自动化能深入到什么程度、代理能连续运行多久才需要人审核,以及模型在主观任务上的表现。

他从四个方面拆解了编码的特殊性:一是任务完全基于文本;二是代理通常能访问整个代码库;三是代码可验证,训练时可立即评估代码能否运行,模型在编码上训练得较为充分;四是使用者高度技术化,知道代理出错时如何拉回正轨。普通知识工作的条件则相反:营销人员所需的上下文分散在20个系统里,每个系统要单独接线;用户未必熟悉技术,学习新工具对科技圈之外的人是一件苦差;缺乏可验证性,代理完成工作后用户必须复核整份产出;此外还有公司的治理与合规政策。

基于此,他判断这类技术向其他领域扩散“会花很多很多年”,硅谷需要耐心,不宜把AI编码的自动化收益直接外推到法律、医疗、生命科学、建筑与设计;视频剪辑这类主观任务的奖励函数更为棘手,在许多情况下比编码更难。与此同时,他认为这也是机会所在:“如果你能做出通向那个终态的桥梁式产品和平台,让企业尽可能容易地走完这段路,那是巨大的机会。”实验室、垂直或横向品类的初创公司都会参与,Box属于横向一类。

三、企业落地AI的数据与信任约束

Levie认为,企业的AI问题在很大程度上是数据问题,安全与责任划分则构成推广中的另一处摩擦。

(一)数据分散与“一分钟前入职的博士”

Levie指出,硅谷的病毒式推文多来自十人规模的初创公司,它们从零搭建工作方式与数据,可以围绕代理产出组织公司。其他企业则不同:一家存在数十年、拥有一万名员工的公司,数据散落在20、30、50乃至100个系统里,某位客户的合同可能在五个地方,营销素材可能在十个地方。

他将代理比作新员工:“这个人聪明得离谱,有博士学位,但一分钟前刚入职。你给了他工具权限,然后说三十秒后我要你找到新产品的研究资料。”这个人会翻遍所有系统,却不知道哪一份才是权威版本,那是开过多次会、拿错过材料、问过同事才积累出来的部落知识。代理的处境更为不利,因为“代理不知道自己不知道什么”,拿到十个系统的权限后,会直接引用第一批看似相关的文档,不会想到还有两个系统应去交叉比对。

他认为,企业在代理时代受制于自身信息的组织程度,包括流程是否文档化、员工或代理能否触达项目的真实来源,“对人来说找到正确信息有多难,对代理就有十倍难”。他预计企业将在“很多很多年”里持续意识到AI问题实际上是数据问题,需要让基础设施、软件与系统服务于为代理提供上下文;大量遗留基础设施与代理配合不佳,代理因此拿不到数据。据其介绍,Box的业务正是帮助客户把散落在20到30个文档系统中的内容迁移至现代化的信息管理方式。

(二)安全与责任划分

主持人表示,他希望有代理替他处理收件箱,却无法接受一个能在收件箱里自主行动的系统。Levie介绍了当前的通行做法:为OpenClaw类代理单独创建收件箱,把它当作一位拥有自己资源的同事,本人收件箱不对其开放。据其介绍,Box内部已有一批员工为自己的代理开设独立Box账号,人与代理通过共享传递文件,代理只获得分区权限,“我只给它这项任务需要的十个文件,整个Box仓库并不开放给它”。

他指出,这套做法仍有两类问题有待解决。一是经典安全问题,如有人冒用用户名义向代理发送请求、诱导其外泄数据,或通过提示注入使代理泄露信息,他认为行业正在逐个解决。二是监管与合规问题,如医疗机构的代理开错处方,责任如何认定。他表示,实验室的责任范围会很窄,限定在版权与知识产权保护一类,无法承担每一起医疗索赔;现有法律框架都默认交易另一端是人,代理介入后,金融、医疗、法律三个领域需要大量新立法与新判例。

四、代理产品形态与速度准确度取舍

Levie认为,聊天机器人与代理处于同一连续体上,产品设计的核心难题在于速度与准确度的取舍。

(一)聊天机器人与代理的连续体

Levie认为两种形态之间取舍不大:用户打开ChatGPT或Claude交给它一项任务,问昨晚比分就直接回答,要求基于Salesforce数据和Box文档做看板、再生成Jira工单就直接执行;快速搜索、带工具的代理、先定计划再操作软件,是同一条连续体。他指出,聊天机器人形态“太容易放弃任务”,如要求列出100家公司只给出25家,Perplexity Computer则“是一头役马,任务完成前不会停”。他认为,困难查询应主动询问是否在完成后通知,15分钟的异步任务好过永远拿不到答案的快速模式。

(二)速度与准确度的取舍

Levie表示:“可以极快但中等准确,或相当准确但极慢,你只能二选一。”据其介绍,Box近期发布的Box Agent拥有与一位Box用户等同的权限,带有搜索、文档阅读、内容生成、建文件夹等工具;公司原本想在设计时集中决定这一取舍,后来不得不把选择交给客户,分为pro与常规两档。团队为此打磨数月,测试方法是让代理查找一组办公室地址并混入几个假地点,观察代理搜索一次还是五次、十次,“代理如何知道自己不知道什么、如何知道任务真正完成了”,答案取决于愿意投入多少算力。据其介绍,5秒返回时约一半概率出错,15秒返回时正确率约为95%。

(三)并行代理的应用领域

对于多个代理并行生成、测试多个版本的机制,Levie认为会出现,但全球算力供给有限,它会落在经济上可测试的结果上,主要包括金融、营销、医疗与生命科学。他转述一位生命科学公司CEO的说法,可运行的实验数量将增至过去的10到100倍,再从中筛选进入完整临床试验的候选。对于所有人从同一上下文取答案可能导致观点趋同的担忧,他表示会要求代理列出正反两面的表格,由自己作出解释与决策,以避免只拿到“对应你提示词的均值回应”。

五、应用层价值归属与竞争格局

Levie认为,实验室作为智能层将获得很大份额的价值,应用层的空间随模型进步动态扩张,实验室之间的竞争格局可参照云计算的演进。

(一)垂直应用与横向代理之辩

对于价值归属于实验室还是应用层,Levie表示“陪审团尚未裁决”,并列举了两方面论证。一方面,领域专用代理深度理解行业上下文,能接入行业专有或公开的数据系统,能推动该行业工作流的变革管理;另一方面,按“苦涩教训”的逻辑,这些优势“离被吃掉只差两三代模型”。他的看法是,领域上下文始终存在,模型无法知道每个人手头的项目与可访问的数据,必须借助产品接入,问题在于接入这些信息的产品能创造多少价值。对于Harvey、Legora与Claude Cowork式横向代理之争,他认为无法靠推演得出答案。

他以传统SaaS时代为例指出,在已有大量横向产品的品类里,仍然出现了300亿、400亿、500亿美元量级的垂直软件公司,原因是客户更愿意信任一家“每天早上醒来就想着他们工作流”的厂商。按行业划分,一是受监管或高价值工作的行业,客户需要日复一日专注于这项工作的现成方案;二是写邮件、回复日历邀请、更新Salesforce记录等通用任务更适合横向代理;三是“深入某个法律工作流、深入一桩并购交易”,他“多数时候会押应用层”。无论哪种结局,实验室都是智能层,都会拿走一份很大的奖赏,剩下的问题是在实验室之上还能创造多少价值。

(二)wrapper层随模型进步扩张

Levie以一张柱状图说明wrapper的演变:三年前模型较弱,建立在模型上的wrapper要交付高价值结果,需自行承担约80%的工作;模型变强后,模型承担的部分上移,wrapper的部分相应缩小。按静态推演,wrapper会缩至薄薄一层,但这一比例会动态变化,模型能力提升后客户想做的用例随之扩张,wrapper层又会出现一批新的待建能力。

他同时认为,这一层不会出现成百上千个成功产品:企业只想把工作做完、相对竞争对手取得一些优势,不想整天琢磨如何实施新技术;能出现在客户办公室、拿出为其用例专门打造的方案的公司将占据优势,前提是不存在智能更差、价格高出很多或用处小到不值得引入新供应商等反向取舍。

(三)实验室竞争与云计算类比

Levie以与两家均有合作为由未对胜负作答,并给出类比:预测OpenAI与Anthropic的胜负,等同于在2008年预测云战争。据其介绍,2010年亚马逊云服务(AWS)云收入约5亿美元,已占据主导地位,Azure刚刚发布,谷歌云(GCP)当时还叫Google App Engine;到过去一年,云基础设施总支出已达数千亿美元量级。他表示:“如果2010年我们做这期播客问这一切会怎么收场,正确答案应该是这不重要,15年后每家都做成了500到1000亿美元收入的生意。”他把智能视为云的倍数,预计五到十年后这些产品将比现在大5到50倍。

主持人认为,领先优势会通过融资与基础设施形成复利。Levie以云计算的经历回应:云是资本开支密集型软件的原型,当年同样有人预期飞轮效应,15年后美国有四家达到规模的云厂商(含甲骨文),加上新兴云厂商(neocloud)与各国本土厂商,“至少十家非常好的云基础设施生意”。他认为,除非出现一次外界完全不知情的封闭式研究突破,突破总会在生态中扩散,任何一家实验室在前沿模型上的领先大约只有六个月到一年;智能之外存在开发者与配套工具带来的网络效应,但市场规模足够大,他并不担心谁胜出。

总的看,Levie认为,一个足够强的模型会使实验室产品路线趋于收敛,编码代理的能力正在外溢到全部知识工作,但数据分散、可验证性缺失与责任划分等因素决定了这一扩散需要很多年;应用层的价值取决于为企业接入上下文、完成部署的能力,wrapper层会随模型进步不断出现新的待建能力,实验室之间的竞争格局则可能与云计算类似,由多家共同做大。