← 返回AI 应用主题跟踪

企业AI应用的模型选型、部署路径与竞争边界——Decagon联合创始人Jesse Zhang、Ashwin Sreenivas访谈要点梳理(a16z Podcast,2026-07-31)

a16z Podcast,80 分钟 · 2026-07-31

——据a16z Podcast节目《Decagon’s Playbook for Building Enterprise AI Applications》(2026-07-31)整理

摘要:本文对a16z Podcast节目主持人Sarah Wang、Kimberly Tan专访企业AI代理公司Decagon两位联合创始人的主要观点进行了梳理汇总。梳理了Decagon推理负载由前沿模型迁移至开源微调模型的过程及其成本观,介绍了两位嘉宾对应用层与模型实验室边界、前置工程产品化和护城河的看法,最后阐述了其进入大企业的做法以及对SaaS与就业前景的判断。据其介绍,公司90%的工作流运行在开源模型上,每次对话的token用量持续上升,一家客户转用Decagon后约一个月内自行搭建了七条流程。

关键词:企业代理;开放权重;应用层护城河;企业采用;推理成本;Decagon;Sierra

一、推理负载向开源微调模型迁移

随着客户规模扩大、语音代理上线,Decagon将多数工作流由前沿模型迁移至开源微调模型,驱动因素主要是时延与可控性,成本下降属于附带效果。

(一)迁移过程与现状

Decagon主要为企业提供客服、销售与运营类AI代理,a16z为其投资方。CEO Jesse Zhang表示,创业初期的目标是让产品跑起来并交付价值,因此自然选用OpenAI与Anthropic的前沿模型。随着合作的大企业拥有数百万终端客户、公司上线语音代理,时延成为核心指标,问题由“能否给出好回答”转为“能否很快给出好回答”。压低时延需要更小的模型,而前沿实验室的小模型“没法按自己想要的方式控制”,开箱即用也大多达不到任务要求,必须微调,公司由此在一年多前转向开源。

其依据在于代理的任务结构。Jesse认为,代理的工作是对话,一次对话中要同时完成多项任务,如判断客户所谈话题、识别来人是否为恶意用户,“每一个单独的任务都不需要大模型的全部智能”,将小模型微调至单一任务,即可做到与大模型持平或更好。据其介绍,公司目前90%的工作流运行在开源模型上,其余10%仍使用闭源前沿模型,主要用于新项目与新产品;为此公司组建了研究团队Decagon Labs,专门负责开源模型的选取与调优。

他将模型选择归纳为成本、智能、时延三个维度。Decagon主动收回一部分智能,换取时延优势,成本下降随之而来,“我们做这件事并不为了成本,成本只是一个不错的附带效果”。

(二)微调小模型与前沿模型的分工

总裁Ashwin Sreenivas认为,“要么用昂贵的聪明模型,要么调笨一点换便宜”是一种伪权衡(false trade-off)。小模型通用性较差,但在指定任务上,“它们实际上跑赢大型、聪明的新模型”,可同时做到效果更好、成本更低、速度更快。

前沿模型仍有用武之地,主要承担辅助性任务:一是主对话流程中的任务边界清晰,如帮客户改签、走医疗流程,小模型即可胜任;二是新推出的Duet Autopilot等产品从事开放式探索,需回顾上百万条对话、寻找趋势、生成主模型的多个变体并加以比较,这类任务适合可大量试错的前沿模型。

自建与外购方面,Ashwin以与用例的耦合程度划界:一是与模型训练相关的多数环节与自身用例紧密耦合,工具链以自建为主;二是评测尤其如此,公司将评测对准客户结果,考察整个系统端到端的表现,单个模型的损失曲线只作次要参考,关注点在于“这个模型与其他所有模型协同起来,有没有交付我们在意的客户结果”;三是标注数据获取、数据集多样性度量等各公司通用的任务向供应商采购,以尽快把表现领先的模型推入生产。

(三)企业自建微调的节奏

Jesse判断企业终将自行开展开源模型后训练,但所需时间长于市场预期。一是即便对Decagon自身而言,微调也需要取得数据并构建好的评测,而评测高度特定于任务,“公开评测集完成不了这件事”;二是当用例固化、已在生产环境规模化运行时,开源模型在时延与成本上均严格占优,新的、实验性的、确需智能的场景则仍会使用前沿模型,因为其API使用便捷、无需操心基础设施。

基于此,他给出一个与舆论相反的观察:“尽管开源现在热度很高,企业里开源推理的份额实际上正在下降。”原因在于企业正大量启动新用例,新用例先用前沿模型直至跑通,其中一部分被放弃,另一部分获得持续投入并铺开,到那一步企业才有较强动力迁往开源。由于企业一次只能推进有限数量的用例,且需通过模型风险治理与安全审查,这一过程将较为缓慢。

Ashwin补充指出,模型形态持续变化,微调需要持续进行:前沿模型与开源模型每前进一步,都会出现新的可用任务,团队因此“不断训练全新的模型,弃用不再相关的旧模型”。他将Decagon Labs称为一座“模型工厂”,目标是压缩从新模型发布到微调模型可用之间的时间。

(四)成本与token用量

两位嘉宾将时延与准确率视为首要驱动因素,token成本居于次要位置。Ashwin表示,成本是“少数几个你能白拿全部好处的任务之一”,无需在成本、时延与性能之间取舍。Jesse表示,成长期公司需对成本负责,但首要任务是增长,客户只关心代理的表现;公司的产出单位是一次对话,客户看重对话质量,并不关心一次对话花费多少token。据其介绍,公司每次对话使用的token数量持续上升,原因是为提高质量而增加模型调用、校验与并行处理,待赢下市场后再回头优化成本。Ashwin认为,一旦掌握拆解问题、快速训练与部署开源模型的方法,成本压力将大幅减轻。

二、应用层与模型实验室的边界

主持人指出,2026年上半年的主导叙事认为Anthropic与OpenAI将是“最后一批创业公司”,应用只是“薄UI加前置工程师”。两位嘉宾认为双方边界将相互渗透,但业务逻辑与企业部署能力须留在应用层。

(一)用例微调与业务逻辑

Jesse从大型企业的选择视角作出回应,主要包括两层。一是微调的对象是用例。外界常以为微调是为单个客户定制,据其介绍,Decagon的微调绝大部分针对“客服”这一用例,如把模型调至擅长识别客服话题,这对跨客户只做这一件事的Decagon值得,企业自己把研究资源投入调一个客服行为模型则“大概率不值”。二是业务逻辑存放于上下文中。企业教给AI的是自身流程,流程一改微调就要推倒重来,因此不宜通过微调实现;企业自建代理,上线次日查看对话就要修改三处,此后须持续投入工程资源。他表示:“客户航班取消打进来要一次改签三个人,这是AI需要执行的业务逻辑,与模型本身无关,它必须存在于应用层。”

在他看来,核心垂直领域需要的是深度,包括全部系统集成、业务逻辑捕获、测试与实验、对话复核与质量保证、面向合规团队的监控工具;实验室会增加应用能力,但相当通用,属于能做“这件事或那件事”的通用代理。他还以Salesforce与Zendesk均为横向平台为例,认为本赛道的赢家仍将是横向平台,规模与产品深度带来的收益大于垂直特性,垂直与地域维度均会出现整合。

(二)应用公司向垂直实验室演进

Ashwin承认边界正在相互渗透:实验室向上做应用,因为那是企业看见投资回报的方式;应用公司向下做模型,因为能在自身用例上获得更多性能、时延与成本优势,“这种渗透合理,而且会持续”。但他不认同“实验室是最后的创业公司”的说法,理由是“人类本身就是某种AGI”,人类做事同样需要数据库与CRM,即便有了AGI,代理也需要存放工作、获取信息与开展推理的地方;纯为人工操作设计的一类SaaS会承压,但软件整体不会消失。对于长期形态,他表示:“长期看,应用层公司也许就变成特定垂直领域的实验室,因为你的主产品终归是那些在特定任务上非常好的模型。”

三、前置工程的产品化

两位嘉宾认为前置工程是学习工作流的阶段性手段,工作流摸清后即应产品化,Decagon的Duet系列产品即循此路径形成。

(一)前置工程师的定位

Ashwin认为,大量招聘前置部署工程师(FDE)的风潮是“一个陷阱”。其理由主要有三点:一是SaaS时期用户在设计工具或CRM中的工作流已被充分探索,AI产品的工作流尚无人用过,前置工程师的作用是与客户一起首次学习工作流,“看着火车往哪开就往哪铺轨”;二是工作流一旦摸清即应产品化,回到科技公司的规模化属性,Jesse补充称,做不到这一点,“你只是在建一家有光环的咨询公司”;三是FDE一词被用得过于宽松,把免费咨询与做产品混为一谈存在风险。Ashwin曾在Palantir担任部署策略师,他援引Palantir CTO Shyam的内部说法:“前置工程师吃掉痛苦,排出产品。”

Jesse指出,很少有公司能像Palantir那样一开始就签下巨额合同、值得投入大量人力,承诺“任何AI用例都给你做”的公司迟早要面对能否找到可规模化产品的问题,否则就是在建一家现代版埃森哲(Accenture)。Decagon自我定位为产品驱动、由销售提供信息,前置团队的角色称为“代理产品经理”(agent PM),职责是与客户一起找出产品在企业中部署不下去的环节,产出物包括两类:一是产品改进,把销售侧的学习汇编进核心产品,使“下一批十个客户问同样的事时免费得到它”;二是流程改进,陪伴大企业完成组织、流程与新技术引入的转型,这段陪伴本身也已流程化。公司从第一天起即要求所有工作回流至核心产品。

(二)Duet的产品化链条

据其介绍,产品化链条分三步推进。一是早期教代理执行流程需要写代码,前置工程量过大,公司于是发明了用纯文本编写的“代理操作程序”(AOP)。二是进入新客户仍需大量时间手写AOP,公司于是推出Duet,由一个更大更慢的第二代理负责编写AOP、编写接入客户系统的工具、编写测试与模拟,并在上线后监控对话。三是上线后的迭代仍耗费人力,公司于是推出Duet Autopilot,阅读上千条对话、指出表现欠佳的话题并起草改进方案。

Jesse表示,Duet在创业初期无法实现,它依赖推理模型的进步,这些模型主要为编码代理训练,同样能胜任编写流程与测试,这让他切身感到“模型在变得非常通用”。Ashwin总结称,每一项产品改进都源于前置工作的产品化,目标是让工程师与客户侧资源越来越少地介入。

四、护城河与企业销售

两位嘉宾将短期护城河落在让模型在企业中可部署的能力上,并以拆小项目、把上线过程产品化、创始人亲自主导销售等方式进入大企业。

(一)短期护城河在于企业可部署性

对于AGI阶段Decagon的存在依据,Ashwin将时间尺度分开作答。他认为短期护城河在于与企业资源协同的能力,“今天模型的能力远大于它们在企业里被使用的程度”,即便假设模型完美无误,在企业中部署仍需多项前提:一是明确模型能做与不能做什么、避免灾难性错误的机制;二是让企业内数百人在各自擅长的用例上协作、确认代理行为符合预期;三是测试模型不越过监管红线;四是从数百万条对话中为其他团队提取洞见;五是与遗留系统对接。对于更长的时间尺度,他表示:“一旦这些被商品化——因为代理可以即时把它们搭出来——那我不知道,三年后再看。”

主持人转述称,多位采购决策者选择Decagon的原因之一,是押注创始团队在按周乃至按日变化的市场中速度领先。Jesse表示,公司当前的瓶颈在于招聘,“我们是token的饕餮消费者,token账单非常大”,但“该建什么、什么算完成”一类判断代理仍无法完成,品味仍取决于人;AI编码公司虽是这些模型的资深用户,仍在大量招人,因为竞争对手同样拿到了工具,所有人都去建三倍的东西。他认为,从商业角度看,瓶颈更少在模型侧,更多在于能否足够快地把公司建起来。

(二)进入大企业的做法

主持人认为市场呈Decagon与Sierra两强格局。Jesse以一个近期案例说明差异:一家客户由Sierra转至Decagon,理由是此前主要依靠FDE交付,“感觉像一个黑盒”,建新流程或深入了解对话都要经由FDE,据客户介绍,一年下来仅建成约三条流程;转用Decagon后约一个月内自行搭建了七条。他将其概括为“玻璃盒”与“黑盒”之别,核心产品要让客户自己能用、能快速迭代、一切在掌控之中,非技术人员也能操作并理解对话中发生的事。

据其介绍,进入大企业的做法主要有三条。一是拆小项目,与全球大型银行、航空公司与电信商合作受制于组织体量,先挑一两个头部用例取得一次成功。二是把“能否上线”产品化,Ashwin表示,企业内部的问题除了产品能否使用,还有能否上线,受监管的金融业尤其复杂,公司把这段历程完整映射出来,首次会议即可逐项讲清从当前到100%上线的路径,包括模型风险流程、测试方法、初始灰度、问题捕捉与复发防范,“产品与技术当然重要,但对大公司同样重要的是帮他们把部署过程想清楚”。三是创始人亲自压缩周期,Jesse自述约80%的时间用于销售,销售团队负责建立内部支持者、穿透组织,持续重新设计流程、合同与产品配置以缩短周期的工作则须由创始人承担。

五、业务扩展及对SaaS与就业的判断

Decagon已由客服扩展至更广泛的对客场景,两位嘉宾认为代理与记录系统可以共存,AI带来的成本下降将在很大程度上转化为更多服务需求。

(一)由客服扩展至礼宾

据其介绍,Decagon已由客服扩展至“礼宾”(concierge)场景:一是一家客户先上线客服,随后将入站销售交给代理,由其回答问题、开展需求发现,金额较大时再转交企业销售代表;二是另一家客户用其运行运营流程,在账户出现异常时主动外联。Ashwin表示,公司从一开始就把代理定位为“擅长遵循业务流程的代理”,客服只是其中一类场景。支撑这一扩展的模型进步是指令遵循能力:几年前须给出非常紧的指引,现在可给出越来越宽的指引,由模型像人一样理解并填补空缺,需要开放式提问、对话反复往来的销售发现场景由此成为可能。Jesse的长期愿景是“AI代理就是企业的前门”,所有对客交互无论被动主动均由AI处理。

(二)记录系统与CRM

Ashwin从单位经济角度指出,年支出10万美元的客户能获得高度个性化的对待,年支出10美元的客户则得不到,“如果能以10美分给他们同样的体验,它突然就经济了”;人类礼宾会把信息记入CRM,AI代理同样需要存放数据的地方。Jesse对CRM持偏正面看法:CRM本质是数据库,用户不满的是界面难用,未来若由代理直接调用接口,CRM因持有事实源反而会被更多调用,Decagon“没有任何兴趣做CRM”。主持人据此认为“SaaS没死”。

(三)就业与杰文斯悖论

Ashwin介绍了一家早期客户的案例:该客户约两年半前上线时,每月客服咨询量约五万条,上线后发现客户问题远多于此,于是把支持入口放到每个页面和用户容易卡住的位置,并向免费用户开放即时支持。他表示,客服成本下降三成时,多数企业没有裁减六成团队,其反应是“既然这件事对客户明显有价值又便宜得多,那就多做”。主持人认为这是现实中杰文斯悖论(Jevons paradox)的样本。

Jesse表示“AI会消灭工作岗位,但不会消灭职业”,高频、点几下就能得出答案的工作本就不宜由人承担,而让客户更满意的事近乎无限。对于业务流程外包(BPO),他表示视客户而定:一是部分客户显著减少了外包用量;二是部分处于高速增长期的客户希望运营规模不随业务同步扩张;三是部分客户把人员转向创收工作。

总的看,两位嘉宾认为,在边界清晰、已规模化运行的用例上,开源微调模型可在效果、时延与成本上同时占优,前沿模型更多承担新用例与开放式探索任务;业务逻辑须留在应用层,短期内应用公司的立足点在于让模型在企业中可部署,更长期的格局则“三年后再看”,应用层公司可能演变为特定垂直领域的实验室;记录系统作为事实源仍将被代理持续调用,AI带来的成本下降在很大程度上会转化为更多的服务需求。