← 返回AI 应用主题跟踪

应用层公司的研究能力建设、模型层关系与token定价——Harvey联合创始人Gabe Pereyra相关节目合读(Sequoia Capital与Sourcery,2026-08-11)

Sequoia Capital 与 Sourcery 两期合并,29+44 分钟 · 2026-08-11

——据Sequoia Capital《How Harvey Built a Research Lab on a Budget | Gabe Pereyra》与Sourcery with Molly O'Shea《Harvey Co-Founder Gabe Pereyra on the Token Pricing Reckoning Coming for AI》(2026-08-11)整理

摘要:本文对法律AI公司Harvey联合创始人兼总裁Gabe Pereyra于2026年8月11日在红杉资本(Sequoia Capital)Own Your Intelligence活动上的演讲,以及6月18日在Sourcery节目中与主持人Molly O'Shea对谈的主要观点进行了梳理汇总。梳理了应用层公司在资源不对等条件下借助前沿生态建设评测、训练数据与后训练能力的路径,介绍了Harvey与前沿实验室既合作又竞争的关系及开源模型的生产部署方式,最后阐述了推理成本上升背景下token用量、定价模式与应用层价值来源的变化。据节目介绍,Harvey估值110亿美元,年度经常性收入(ARR)超过3亿美元,拥有960名员工、2000家客户,当月处理约13万亿token;据其介绍,单次助手查询可花费20美元。

关键词:前沿实验室;开放权重;模型路由;定价与变现;token需求;Harvey;Gabe Pereyra

一、应用层与前沿实验室的竞争条件

Pereyra认为,应用层公司与前沿实验室之间是一场资源不对等的竞赛,出路在于借用日趋成熟的前沿生态。

(一)资源差距与借用前沿生态

Pereyra此前在谷歌大脑(Google Brain)、DeepMind与Meta从事研究。他在演讲中坦言这是一场不公平的比赛:“有富队,有穷队,然后是我们这些应用层的。”前沿实验室在资金、人才、算力基础设施与数据四个方面均占优势。

据其介绍,四年前Harvey创立时,今天从事后训练、推理服务与数据生产的公司多数尚不存在或刚刚起步,应用公司要么全部自建,要么把精力放在别处,Harvey选择了后者,先建设销售组织与产品。他表示:“今天借助前沿生态,我认为你可以与前沿实验室竞争,做出前沿智能。”其打法分为三步:一是建设评测与训练数据;二是与新型研究实验室(neolab)合作开展后训练;三是将模型稳定地服务到生产环境。他表示,多数人仍在押注应用层会输,而他预计每家公司都要成为AI公司,都需要某个版本的这套方法。

(二)人才获取条件的变化

人才方面,创业初期他试图从实验室招揽熟识的研究人员,对方拿到的是“一亿美元以上的薪酬包”,Harvey难以承受。他认为目前条件已有改善:一是在读博士中不愿去大型实验室的人越来越多;二是早年需要顶尖人才的原因约有一半在于自建训练与服务基础设施,如今Fireworks、Tinker一类API已承担了这部分工作。他表示:“可用的人才池被打开了,拿到这类人才现在看起来非常可行。”

二、评测体系与训练数据建设

Pereyra认为,没有好的评测就无法训练模型,训练不了模型也就谈不上服务,评测与数据建设是整套打法的起点。

(一)法律评测的设计方法

Harvey的法律代理评测LegalAgentBench(LAB)模仿SWE-bench等编程代理评测“代码仓库加单元测试”的结构。Pereyra认为,“法律太主观所以做不了”是一种误解,大型律所的相当一部分工作可以量化,高级律师给初级律师修改文稿即是如此。以尽职调查为例,输入是数据室(目标公司的全部合同)加一条合伙人式的高层指令,输出是给客户的尽调备忘录,“法律单元测试”则检查合伙人会核对的每一项,例如控制权变更条款中哪一条会实质性改变一份关键供应商合同。难点在于把这套任务、子任务与评分标准的分类体系扩展到基金设立、知识产权诉讼等各实践领域。据节目介绍,LAB覆盖24个实践领域、1200余项任务,由大型律所律师审核。

据其介绍,截至8月Harvey今年已发布三个数据集:一是LegalAgentBench,涵盖大型律所初级律师(associate)的任务分类体系;二是教代理开展谈判的合同数据集;三是尽调数据集,其中规模居前的数据室达8000万token,用于研究长上下文与高复杂度任务。评测本身成本较高,尽调数据集有1000多条单元测试,以大模型作为评判者。对于如何设计能够区分前沿模型的评分标准,他表示应从工作本身出发:“只要你把顶级律所正在做的客户事务真实地搭出来,前沿模型今天仍然做不了。”

(二)领域专家引导的合成数据

Harvey训练模型的约束条件是不能使用客户数据。其服务对象是大型律所与企业,法律数据受特权保护,“不能放进通用模型,连我们自己的模型都不能放”。今年开始奏效的办法是由领域专家引导合成数据生成,律师如同工程师引导编码模型一样引导数据生成。

其关键在于从评分标准倒推数据。律所做并购尽调时拿到的是上万份合同以及谈判邮件与会议记录,这些输入数据从不公开,公开的只有收购协议等成品文件,过去让律师凭空构造一个数据室,很难让上万份合同彼此吻合。Harvey的做法是先写评分标准、在其中预埋问题(如合同之间不衔接、某份合同缺失),再据此生成整个数据室,然后借助Mercor、Snorkel使合同更加逼真,模型生成的尽调备忘录即可对照预埋问题逐项核对。Pereyra称之为真正的突破,Harvey可先在合成数据上证明能力,再由律所主动提出使用自身数据,打破了过去“先证明、先给数据”互为前提的僵局。

Harvey应用研究负责人Niko Grupen将这一流程概括为“代理主导、律师审核”:由前大型律所律师组成的内部团队按24个实践领域写出任务与先验信息,代理生成数据,再交由更大范围的律师群体审核。

(三)合成数据的局限

Pereyra也指出这条路径仍有三方面缺口:一是合成数据即便经过人工增强,其分布仍与生产分布不匹配,在尽调上得分很高的模型用于写邮件未必表现好,而不能接触客户数据意味着这一差距难以弥合;二是面对8000万token量级的数据室,模型仍不善于管理上下文;三是终局目标实现难度较大,他将目标定为帮助每家律所与企业客户按自身业务定制系统,并在保护客户数据的前提下随业务持续改进,所需的持续学习是技术、运营与AI三重难题。他给出的产品抓手是律所与客户共同开展业务的共享工作区(Shared Spaces),前提是满足执业伦理、监管与客户数据三重约束。

三、与模型层的关系及开源模型的部署

Pereyra认为,各家模型各有所长,Harvey与前沿实验室的关系将类似Snowflake与云厂商,开源模型的追赶则使应用层的后训练开始具备价值。

(一)评测开源与多模型格局

开源评测数据集的决定当时存在争议。Pereyra的理由来自研究经历,ImageNet等被广泛使用的数据集都是开放的,“除非很多人在上面训练,否则你很难知道自己的数据集是好的”。开源后,实验室发布新模型时越来越多地报告在其数据集上的成绩。战略上他将数据分为两层:一是通用法律能力尽量开源,与所有模型提供商一起提升;二是对Harvey有价值的数据,即帮助律所在私有数据上训练自身系统。

针对研究合作方OpenAI、Anthropic同时也是主要竞争对手的风险,他承认“如果某家实验室的模型领先,那还要Harvey干什么”,同时从初步结果中归纳出三点:一是各模型擅长的领域不同,Anthropic的模型相当强,但有些领域5.5模型更好,有些领域开源模型更好;二是问题正从“哪个模型领先”转向“哪个模型能以更低价位解决这项任务”,模型变强后出现“智能饱和”,简单任务只需确认某个开源模型足够好;三是任务与模型的对应关系本身构成Harvey向律所提供的价值之一,因为“用一个模型解决所有任务已经太贵了”。据节目介绍,首批榜单由Claude Opus 4.7领先。Niko Grupen补充,榜单还可按成本与延迟切分,“过去两年的故事是不计成本、不计延迟地拉高质量,现在人们看的是每单位花费与时间换来多少质量”。Pereyra也承认“评测现在成了靶子”,预计一年内趋于饱和,但各方对法律能力的投入均对Harvey有利,因为Harvey的创新工作并不落在基座模型能力上。

(二)与前沿实验室的竞合关系

Pereyra以云计算作类比:Snowflake、Databricks、Datadog都建在云之上,同时与云竞争,“我认为会长成那样”。他认为律所不能依赖单一实验室,原因有二:一是利益冲突,只使用Anthropic模型的律所若想代理OpenAI,OpenAI不会允许其敏感法律数据进入Anthropic的模型,因此服务OpenAI、谷歌(Google)、微软(Microsoft)的律所必须支持所有提供商;二是平台风险,选定一家后可能面临对方算力不足或模型落后。Harvey的角色是将这些问题抽象掉。对于Anthropic与OpenAI推出的Claude for legal、Codex for legal,他认为其解决的是个人生产力,Harvey解决的是律所与大型法务部门的组织生产力。他表示:“我们不认为通用法律智能是Harvey的价值所在,因为有价值的法律数据多数进不了通用模型”,敏感的内部调查、可能影响市场的并购均不能进入公开模型。

(三)开源模型后训练

Pereyra表示,过去后训练不值得做,因为预训练进步太快,任何后训练成果都会被下一代预训练模型吸收;如今GLM 5.2等开源基座足够强,“可以把它们后训练到前沿智能的水平,也许不是通用前沿,但如果像我们这样有具体任务,它们有竞争力”。他建议从与neolab合作起步,“如果与它们合作还拿不到更好的结果,多半是你的数据集有问题”。据其介绍,Harvey已与Fireworks、Baseten、Trajectory、Applied Compute等机构开展训练、上下文压缩与产品实验合作。同时与多家neolab合作的原因有二:一是研究项目多于内部或单一伙伴的承载能力;二是各家押注方向与所训开源模型不同,合作越多学得越多。其目标受Cursor启发,把合成数据、Mercor的规模化能力与neolab合作打包成可与闭源模型并列服务的自有模型,即Harvey版的Composer。

他从推理层解释了这一趋势:模型性能越来越多来自测试时计算、强化学习环境与外围框架(harness),这类工作越奏效,应用层能做的事越多;推理提供商生意兴旺,直接原因是Harvey这样的客户“必须把一部分流量迁到开源模型,因为用规模居前的闭源前沿模型来服务已经贵得离谱”,加之许多客户希望拥有自己的模型与数据。

(四)生产部署与上线流程

Pereyra指出,Harvey在60个国家运营,拥有多个产品面,客户各有模型偏好,每个模型家族需服务多个版本,并跨提供商设置回退以满足服务水平协议(SLA)。他建议这套基础设施在考虑后训练之前就位。上线前设有自动化通用评测、人工并排测试、各产品面自动化测试与人工产品测试四道闸门,并叠加成本、延迟与区域可用性判断。他举例称,一个评测表现很好的模型可能已经过拟合,放进更通用的助手产品后一旦超出分布就会失效。

在后训练之前还有两步:一是在产品中寻找可直接替换为开源模型的环节,如生成引用无需头部模型,换成GLM 5.2即可获得成本或性能收益;二是模型路由,在无法整体替换的环节按查询路由到开源模型。他特别说明,收集反馈“在我们这里不意味着在客户数据上训练”,信号来自用户测试等渠道。

四、token用量与推理成本

Pereyra认为,随着代理化产品上线,应用层的用量、成本与token消耗同时快速上升,成本优化仍有较大空间。

(一)代理化带来的成本结构变化

据其介绍,成本结构的转折点在6月对谈前约六个月。Harvey原产品是面向律师的聊天式副驾驶,随着编码代理在命令行中跑通,Harvey开始建设将命令行代理迁移至云端的基础设施,即托管代理方案。代价是沙箱、更长的运行时间与多得多的token:“让模型起草一份文件”这类单次助手查询可花费20美元,上传10万份合同由模型审阅的产品一次可花费2万美元。与此同时,法律领域正在经历编程领域两年前经历过的拐点,模型开始能够生成整份文件,此前持观望态度的律师开始接纳。由此四方面变化同时发生:一是模型更贵;二是模型更好;三是运行更久、消耗更多token;四是用户因效果改善而用得更多。他表示“用量、成本、token,所有东西都在爆炸”。

(二)用量规模与成本优化

Pereyra将此前的状态概括为“能力受限”,即模型做不好任务,因而总想用头部模型,用量也未达到服务成本高企的规模,这一状况在六个月内发生了变化。他表示:“对部分实验室而言,我们是embedding的头号消费者。”主持人转述Harvey首席执行官Winston的数字为13万亿token。他认为用量曲线“只是开始”,若所有用户都像少数重度用户那样运行长程代理,成本优化的空间还很大。优化手段主要有两条:一是路由,头部模型变强后并非每项任务都值得送去,LAB正是为此而设;二是将更多流量迁至开源与后训练模型,前沿模型规模大是因为要样样都行,“如果我只需要系统擅长尽调,我大概不需要一万亿参数”,垂直领域的机会在于以前沿成本的一部分获得前沿性能。

五、定价模式与应用层价值来源

Pereyra认为,token计费将重演律所计费小时的演变路径,应用层价值更多来自组织层面的工作流。

(一)按工作定价与按token计价

Pereyra表示,外界尚未意识到成本会变得多高、客户应对有多难。他认为定价将在两端之间拉扯:一端是风险投资者希望看到的按工作定价,即按交付价值收费;另一端是按token计价。按工作定价面临与律所固定收费相同的难题。Harvey创立时常被问及计费小时的前景,多数人假设一切将转向固定收费以保护律所毛利,他认为人们低估了计费小时的好处:“它让整个行业能以一种大家都认可的方式,给极其复杂的工作在巨大规模上定价。”谈过固定收费的律所都表示,一万个客户无法逐一谈判每项委托的价格。

(二)token账单的解释与审计

他预计token计费将重演同一过程。据其介绍,Uber首席技术官公开表示全年的编码token三个月即已用完;客户将陆续收到1000万美元级的用量账单,并追问代理做了什么。律所当年的应对方式是按每名初级律师每个六分钟计时单位说明工作内容,他预计token账单将形成同样的生态,即逐项解释、优化与审计。与此同时存在激励错位:模型提供商按用量收费,在一定程度上有动机让代理多用token,解决办法是由第三方为客户做基准测试与路由,判断“这项任务其实不需要这么多token”。他坦言,Harvey自己的编程团队用了大量token,“他们肯定更高产了,但很难量化”。

对于激励错位必然导致定价失当的观点,他同样援引律所经验:计费小时确实造成了错位,但律所之间的竞争将价格压至合理水平,模型提供商亦将如此。据其介绍,Opus 4.7价格约为5.5模型的三倍,性能高出10%至20%,二者相互施压,开源模型追上后又添一层压力。若只有一家提供商垄断,客户将被锁定,这也是推理提供商与其他模型提供商存在市场空间的原因,“你需要很多选项,和你对付专业服务提供商的定价是同一套办法”。

(三)Harvey的定价结构

据其介绍,Harvey从一开始即计划并行建设两项业务:一是传统的按席位收费的企业软件业务;二是承接模型变强后向用量计价迁移的业务。两者均有必要,因为教育买家需要时间,“按token买东西复杂得离谱”,他甚至预计某个时点会回到订阅制一类形式,因为用量太难预测。

(四)从个人生产力到组织生产力

Pereyra将Harvey原始产品与实验室产品均归为个人生产力工具,而Harvey正转向组织生产力,具体体现在三个层面:一是单个客户项目层面,一个持续六个月、涉及全所20至30人并需协调外部各方的项目中,起草某一节只占很小部分,“很多东西开始像项目管理,编排这些人和这些代理”;二是律所层面,需处理上千个项目的资源分配、计费与投标;三是企业法务层面,财富500强企业需对接上千家律所与上千名内部人员。他的总结是企业软件的传统办法:“在你的领域里做到横向产品不会做的那种超垂直。”

总的看,Pereyra认为应用层公司可借助前沿生态,在评测、合成数据与开源模型后训练上建立研究能力,并在多提供商格局中承担模型分配与路由的角色;随着代理化推高token用量,定价将在按工作定价与按token计价之间拉扯,账单解释与审计的需求将随之出现;他本人将通用法律智能排除在Harvey的价值来源之外,把重心放在私有数据与组织生产力上。