← 返回AI 应用主题跟踪

前沿模型独立评测的方法、企业token开销与监管分工——Vals创始人Rayan Krishnan访谈要点梳理(a16z Podcast,2026-09-09)

a16z Podcast,39 分钟 · 2026-09-09

——据a16z Podcast节目《Inside the Race to Independently Test the World’s Best Models》(2026-09-09)整理

摘要:本文对a16z Podcast节目主持人Erik Torenberg、Ben Horowitz与Jennifer Li专访模型评测公司Vals创始人兼首席执行官Rayan Krishnan的主要观点进行了梳理汇总。梳理了第三方评测的必要性与独立性要求,介绍了Vals在发布前测试、基准退役与代理任务评测上的具体做法,以及企业端token开销与评测驱动的模型选型,最后阐述了嘉宾与主持人对监管分工和国际协调的看法。据其介绍,一家财富十强公司给工程师的Claude Code额度约为每人每天100美元,后提高至300美元;Vals一个月不限量使用编码工具,折算token开销约150万美元,相当于当月工资支出的10倍。

关键词:token需求;编程代理;模型路由;前沿实验室;AI监管;Vals;Claude Code;OpenRouter

一、第三方评测的必要性与独立性

Krishnan认为,实验室自报成绩难以支撑数十亿美元的训练投入,需要一家只做高质量评测、不向实验室出售训练数据的第三方机构。

(一)公开基准与私有测试的脱节

Krishnan做基准与评测研究出身,他认为生成能力与评测方法相互拉动,“要得到一个,往往得先把另一个做好”,一种新的、可读的评测方式本身就是模型能力的主要推动力之一。Vals于2024年发布首批基准,业务是在实验室与企业之间做独立评测。据其介绍,2024年初市场上出现了许多来自OpenAI之外的模型,判断新模型新增了什么能力越来越难,他据此认为需要一家专做高质量评测的第三方公司。

Krishnan承认实验室内部有大量好基准,模型进步正是依靠它们推动,问题出在自报。他以Meta发布Llama 4为例:一是在题目与评分标准均开源的主要公开基准上,模型显示出很强的能力;二是在Vals留出、不公开的私有基准上,模型表现落后,他称那次发布“有点像一场灾难”;三是实验室自身也希望形成理性的买方市场,投入数十亿美元训练新模型之后,需要拿出实质证据说明进步所在。据其介绍,Demis Hassabis等人也公开呼吁建立第三方评估生态。

(二)评测机构的独立性

Vals早期定下一条规矩,永远不向实验室出售训练数据。Krishnan表示,与新实验室合作时常被推向这门“很赚钱的生意”,不少数据供应商已把噱头式基准当作卖数据的获客手段。他以审计业作类比,同一家机构既做审计又做咨询,激励就会混杂,安然(Enron)事件即为后果,放到评测业就变成“花钱赢基准”。

Horowitz以美国电影分级作类比,R级与X级的边界模糊且随时代变化,规范依靠行业内足够多的人认可而逐步形成。他认为现有开放基准“解出某道题就到某个级别”的做法容易被刷分,覆盖面也过窄。

二、评测方法与基础设施

Vals的评测以不拖慢发布为原则,并随代理任务的兴起在评判标准、基准更新与基础设施上作出调整。

(一)发布前测试与评判标准

发布前测试的原则是“永远不做滞后指标,也不拖慢发布”。据介绍,测试窗口约为六个小时,主持人提到期间要跑数百亿token。早期由Krishnan与联合创始人通宵赶出结果,现在依靠大规模分布式基础设施,按每个模型的限速上限并行测试;公司还有一个名为Steve的内部系统,定位为Vals的“AI员工”,人工环节逐步交给它。

难点在于把模糊的评判转化为显性标准。Krishnan以律所中助理律师与合伙人的差别为例,人类世界没有一张卷子能测出这种差别,需要先在各类企业与真实工作流里建立标准,再用同样方式测模型。他认为长期瓶颈在于能否把企业的工作标准整理成可读的评测,这决定了模型往哪里爬坡、企业在哪里采用。

(二)基准退役与代理任务评测

基准退役分为两种。一是饱和退役,公司的非正式口号是“永远有更高的山峰”,实验室在爬坡,Vals的任务是不断造出下一座山。二是时效退役,律师、建筑师、医生要重新认证,模型也应按当下的法律与医学知识接受测试,法律研究基准即随判例更新。

代理任务改变了评测基础设施与评测形态。一是运行时长拉长,模型如今要连续运行几小时、几天乃至几周,系统须保持稳定,一次请求失败要能从断点重试,无需重跑整条轨迹。二是任务数量减少、评判细则变复杂,早期的ImageNet有数百万张图片,一张图对应一个标签;现在的任务例如让模型生成50个全栈网页应用,每个输出的评判细则复杂得多,他预计这一趋势将延续。

(三)代表性基准

据其介绍,Vals的代表性基准主要有三类:一是金融代理基准,被多家大型金融机构用于跟踪模型进步;二是编码基准,考察模型能否按自然语言需求搭建完整的全栈网页应用,已跟踪约九个月;三是新近发布的递归自我改进指数,旨在为各实验室开始在模型卡中报告的这类能力提供统一口径。理想做法是让前沿模型训练下一代自己再观察提升,但成本高、速度慢,因此把“造出下一代模型”拆解为预训练、后训练、外围框架工程等环节分别设置代理任务,观察模型在哪些研究环节表现好、在哪里受阻。

三、企业端token开销与评测驱动的选型

Krishnan认为评测对企业正变得与对实验室一样关键,token开销可能开始超过工资开销,企业将更严格地核算投资回报。

(一)按天发放的token额度

Krishnan介绍了一个见闻:一家财富十强公司给工程师的Claude Code额度约为每天100美元,限额在下午4点重置,产出于是集中在下午4点至6点,重置前的时段反而成为空档;该公司后来把额度提高到每人300美元,他形容这几乎相当于把一名员工的工资换成了token。

他认为智能在栈的每一层都被错误定价:一是工程师拿着额度,不清楚如何分配才能换来产出;二是公司设定额度相当随意,合适的上限难以量化;三是Anthropic为支撑这种用法利润率很薄,服务成本很高。基于此,他判断token开销可能开始超过工资开销,一旦成为重要成本项,企业须比过去六个月更严格地核算投资回报,“一家公司本质上就是它的评测体系”,能把自身评测整理清楚的公司将在竞争中胜出。

(二)Vals的“token拉满”实验

Vals曾给团队一个月无限量使用若干编码工具。据其介绍,许多工程师每天消耗10亿至20亿token,单日峰值是一名工程师用掉60亿;全月折算约150万美元,额度本身免费,但相当于当月工资支出的10倍。复盘轨迹与代码库之后,一是发现Cognition公司的Devin很省token,于是加大采用;二是不少场景下订阅制比按token计价划算;三是现行做法为所有工具对全员开放,系统针对每个GitHub工单自动推荐从哪个工具起步,按任务所需的智能水平调节用量。

(三)代码评测、模型选型与路由

这次实验促成了Vals面向企业的代码评测产品,企业接入自有GitHub代码库,生成内部编码基准,比较哪个编码代理表现好、哪个性价比更高。Krishnan表示,代码生成是企业AI支出集中的领域,私有代码库上的结果常与直觉相左:一是OpenAI与Anthropic各自的旗舰模型哪个更适合某个代码库,要跑过才知道;二是很多情况下Sonnet反而比Opus更贵,原因在于其消耗token过多,照“能用Sonnet就用Sonnet”的经验选择可能多花钱;三是中间档还有价格更低的模型与可自托管的开源模型,选项越多越难凭直觉判断。他主张企业培养内部评测能力,但模型、版本、超参数与框架的组合在快速膨胀,完全依靠自建难以跟上。

他把编码视为其他知识工作的先行指标,编码代理强的模型大概率也能做PPT、在Excel里搭建现金流折现(DCF)模型,其他行业需借助已有的历史工作成果构建评测。路由同样离不开评测,主持人提到Stripe已收购OpenRouter(该交易于8月公布,金额逾70亿美元),Krishnan认为OpenRouter的大部分用量来自模型网关功能,选哪个模型仍由用户决定,路由真正难的部分是构建评测;Vals帮助企业建立评测,也带动了一些企业采用路由器。

四、监管分工与国际协调

Krishnan与Horowitz主张由政府设定规则、由有能力的第三方机构核查,并认为国际层面需要一套共同的评测语言。

(一)政府定规则、第三方来核查

Krishnan认为过去几年的政策讨论过于抽象,缺少实证依据,即便实验室提出引入第三方测试,也未说清具体机制。他把Vals现阶段的角色定为收集证据,定期向行政与立法部门简报模型能力与风险,政策方向由立法者决定,“这不该由我们来提”。例如立法者若判断未成年人心理健康或生物安全风险足够大、需要以标准化手段限制模型发布,应由其决定;商务部、美国证券交易委员会(SEC)等行政部门则负责让企业有效采用模型。他承认两股力量难以调和,一方面不让政府流程拖慢技术创新,另一方面确保技术符合美国人乃至更广泛人群的利益。

Horowitz回顾,政府起初以10的26次方次浮点运算这一算力门槛划定前沿模型,他称之为“有点疯狂的主意”,并追问30天或60天的等待期里应当发生什么。他的分工主张是:大实验室经常向政府发出生物攻击、网络攻击一类警告,政府大致知道自己担心什么,接下来要回答两个问题,一是模型有没有这个能力,二是能否有人诱导它去做;后一个问题需要持续评测,政府不适合长期承担,但擅长定规则并执法,因此组合应当是政府设定并执行规则、有能力的私营公司报告规则是否被打破。他还提到,大实验室开始在模型具备危险能力时不对外开放、仅内部使用,“即便这样也不总是管用”。

(二)对齐风险与国际核查

对齐方面,Krishnan表示已看到模型在接受某项网络安全风险测试时出现奖励投机、另找办法绕过测试,Vals的对齐评测考察模型行为是否符合用户意图。Jennifer Li补充了叙事与部署之间的落差,外界反复讨论OpenAI智能体攻击Hugging Face一类事件,但企业里模型的部署环境高度定制,需要有人把能力与护栏落到具体环境中,使用者才有信心。

国际层面,Krishnan对各国大举投资主权AI感到意外,从全局看重复建设数据中心、重复做数据工程、重复训练大模型效率很低,但现实正朝这一方向发展,因此更需要一套共同的评测语言。他援引核军控时代的“信任但核实”与飞越核查,认为AI同样需要可执行的核查手段,起步可放在网络安全与生物安全等各方有共同利益的领域。他认为长期关键在于递归自我改进,某个国家或某家公司可能跑在前面、造出外界知之甚少的模型,因此需要共同界定可接受的发展速度,据其介绍,闭源实验室里已有不少研究者在呼吁政府间对话。他还提到网络安全评测的扩展方向,过去主要测代码漏洞与内存泄漏,更大的风险在基础设施层,需要模拟企业云基础设施乃至电网环境来衡量模型的攻防能力。

总的看,Krishnan认为评测已成为连接实验室、企业与政府的关键环节:对实验室而言,第三方私有基准是证明进步的依据;对企业而言,token开销正在逼近工资开销,按自有任务评测、在多家工具与模型之间分工将成为核算投资回报的基础;对监管而言,宜由政府设定规则、由第三方持续核查。他同时表示,评测机构要保持价值,激励只能围绕高质量评测,不参与支持模型能力的开发。