← 返回AI 应用主题跟踪

模型路由层视角下的模型市场结构、价格弹性与应用层定位——OpenRouter创始人Alex Atallah访谈要点梳理(20VC with Harry Stebbings,2026-08-10)

20VC with Harry Stebbings,68 分钟 · 2026-08-10

——据20VC with Harry Stebbings节目《OpenRouter's $10B Stripe Deal? | Why Enterprises Fear Frontier Labs More Than China | Alex Atallah》(2026-08-10)整理

摘要:本文对20VC with Harry Stebbings节目主持人Harry Stebbings专访OpenRouter创始人兼首席执行官Alex Atallah的主要观点进行了梳理汇总。梳理了路由层所见的模型供给节奏、平台用量结构与价格弹性,介绍了Atallah对推理服务商格局、多模型格局以及企业对前沿实验室顾虑的判断,最后阐述了路由层的商业模式,以及应用层在用户关系、架构设计与推理成本管理方面的做法。据其介绍,OpenRouter今年7月上线70个模型,GPT 5.6 Luna两周内价格合计下降10倍、用量增长13倍,按量付费计划的抽成费率为5.5%。

关键词:模型路由;token需求;开放权重;前沿实验室;应用层护城河;OpenRouter;Alex Atallah

一、模型供给与平台用量结构

从路由层所处位置看,模型供给仍在快速扩张,平台用量头部长期由开放权重模型占据,平台样本对前沿模型存在一定低估。

(一)OpenRouter基本情况

OpenRouter是面向开发者的统一大语言模型(LLM)接口与模型市场,Atallah此前为OpenSea联合创始人。据节目介绍,OpenRouter累计融资超过1.53亿美元,上一轮估值13亿美元,另有其与Stripe洽谈100亿美元收购的报道,Atallah在节目中对此不予评论。

(二)模型供给节奏

据其介绍,“七月我们上线了70个模型,大约每十小时一个”。他判断这一速度短期内不会放缓,理由有三:一是以代理产品见长的公司有明确动机自研模型并通过代理分发,Cognition与Cursor已有自研模型,Jeff Dean正从谷歌(Google)离开创办代理实验室;二是GPU厂商希望市场保持多样性与竞争,他点名英伟达(Nvidia);三是投资人愿意为“以某种神经多样性方式提升智能”的新实验室出资。对于三年内70%的新实验室将会消亡的说法,他表示不同意,若把被大实验室收购计为退出,他给出的比例为50%。

(三)平台用量结构与样本代表性

用量方面,GLM长期居OpenRouter token用量前三至前四;GPT 5.6 Luna降价后超过GLM,据其介绍,这是OpenAI模型时隔很长时间再度进入平台token用量前三至前五。主持人亦指出,OpenRouter用量前五一度均为中国模型。

在任务分工上,Atallah将开放权重模型的优势定位于确定性任务,即输出形态已知、问题类型已知且已被解决过的问题,如文本分类,应交给低成本模型;前沿模型留给未知的、非确定性的任务。对具体模型,他认为Kimi K3“相当好”,但在网络安全能力与长程任务上仍落后前沿模型;GLM 5.2是开放权重模型的一次大步跨越;Kimi的写作语气较好,而部分前沿模型在编码能力提升时出现“声音退化”,输出变得难读,他认为这一问题可以修复。

关于样本代表性,主持人指出OpenRouter约占全市场token用量的1.5%至2%,且多数前沿模型用量直接经由各实验室API,不经过路由层。Atallah表示:“我们肯定偏向相信我们论点的人,也就是相信多模型未来、想用多个模型的公司。”仍有公司只用OpenAI模型,主要在超大规模云厂商、OpenAI、Anthropic与Gemini之间选择,路由层无法观察到这部分用量,因此平台数据大概率低估前沿模型。他表示会通过调研与第三方调查估计偏差,并认为随着需要使用其他模型的公司增多、平台规模扩大,数据代表性将持续改善。

二、价格弹性与推理服务商格局

Atallah以平台上的降价样本说明token需求具有较高的价格弹性,并认为推理服务商层面尚未出现商品化。

(一)降价与用量的弹性样本

主持人指出token价格约18个月内下跌90%,并提出按支出抽成的OpenRouter是否因此受损。Atallah给出一个弹性样本:GPT 5.6 Luna在OpenRouter上先由OpenAI降价5倍,再与OpenRouter协同降价2倍,两周内价格合计下降10倍,用量增长13倍。据其介绍,一是该样本干扰变量较少;二是发生在DeepSeek与GLM同期给出很低价格的背景下;三是用量放大后并未回落,在13倍的新基数上按此前增速继续增长。

他对杰文斯悖论(Jevons paradox)持承认但保留的态度,表示“很多人谈Jevons悖论,说价格降10倍用量涨超过10倍,但没有人真正把它建模好”,Luna是其掌握的多个个案中干扰较少的一个。关于市场整体增速,他表示若AI市场未来四年继续以每年10至15倍或更高的速度增长,人们会持续低估自身所需的推理量;若增速回落,中小企业(SMB)与SaaS将成为OpenRouter更重要的增长来源。

(二)推理服务商的发展与差异

Atallah表示,创业时未预料到一批独立公司会成长为开放权重模型的托管与服务生态。早期OpenRouter只设主服务商与备用服务商两个位置,不展示实际托管方,因为团队不确定这一层能否形成市场。此后Fireworks、Together等公司在托管新模型的速度与边缘案例处理上明显优于超大规模云厂商,“你多久听到有人在超大规模云上跑GLM?从来没有。”

对于推理层将被商品化、利润被竞争殆尽的说法,他从三方面进行了回应:一是供给约束,市场处于严重供给短缺且将持续一段时间,推理服务商几乎常态缺卡;二是芯片厂商的意愿,超大规模云厂商没有买光GPU挤出独立服务商,原因在于英伟达的首要目标之一是避免客户集中,希望算力层保持竞争;三是服务质量存在可观测的差异,Moonshot发布过各推理服务商服务Kimi K3的基准表,各家结果差异明显,OpenRouter自身对所有开放权重模型在所有服务商上的持续基准测试结果也随时间变化。

他认同Fireworks方面“一个token不等于一个token”的说法,路由层的工作是一旦检测到某家服务商出现质量提升、提速或降价,即把流量导过去,“这种事24小时不停,对大模型来说每五分钟就有大变化”。他同时偏好做定制硬件与底层优化、推动“可移植微调”的服务商:若LoRA等适配层能在基座模型之间迁移,更换底座的成本可能只有几十至几百美元。

三、多模型格局与企业对前沿实验室的顾虑

Atallah认为模型市场将长期呈多模型格局,企业对前沿实验室的顾虑主要集中在战略依赖与数据两方面。

(一)多模型格局的成因

主持人转述Fireworks方面“不要租智能、要拥有智能”的观点,认为若每家公司都有基于自有数据训练的专用模型,路由层可能失去意义。Atallah持相反判断,理由有二:一是创造力,两个训练数据不同的模型合用,比只用一个更可能得到有创造力的结果,而创造力难以验证和打分,“收敛到一个模型在我看来说不通”;二是博弈论,“如果所有公司都在用新买来的数据不断训练自己的模型,那些数据对你也有潜在价值”,企业的合理策略是试用这些模型,看能否提高产出、合并以提升性能或降低成本。

基于此,他认为自建模型必须持续改进才能跟上,且无法赢下整个市场,这一市场规模极为可观,“没有人能赢下全部”。企业更合理的路径是在对本公司重要的领域做一个有已知专长的模型,“品牌是护城河的重要部分,模型会成为品牌的载体”,其余大量任务则通过路由层使用生态中的其他模型。对于Meta的Muse,他认为对方资源充足、会是认真的挑战者,但尚需找到自身定位,“人们还不太知道什么时候该用Muse Spark”。

(二)前沿实验室进入应用市场的风险

主持人援引Palantir方面在CNBC上关于企业担忧与前沿模型商合作的说法。Atallah表示未从客户那里听到同等程度的表述,但确认Claude Design发布、Figma受到波及时出现过一阵不安。他给出一个判断条件:若只是围绕模型能力做一层市场进入包装,如做好集成、定制系统提示词,而实验室对该市场兴趣不大,便不构成问题,这样的市场会有很多;但实验室有进入某些市场的动机,其中之一是让其重视的公司里有多个团队依赖自己。

以Claude Design为例,其营收对Anthropic而言大概率并不显著,但它让设计团队开始重视Anthropic的模型,公司里多了一个希望留在Anthropic上的团队。Atallah表示:“为一个团队做产品、而这个团队对实验室在意的公司变得有战略意义,这是我看到的近期风险集中的地方。”据其观察,很多设计师试用了Claude Design,但尚未听到重复使用的案例,且Figma的财报数字“非常好”。

(三)企业的数据顾虑与安全护栏

在企业对前沿模型与中国模型哪一方更为紧张的问题上,Atallah认为是前者,理由集中在数据:一是数据政策存在较多困惑,发出的提示词如何处理、存放在哪里、由谁查看尚不清晰;二是前沿模型无法在自有机器或自选的服务商上运行,与企业熟悉的“自有基础设施对比VPC”问题结构相同;三是前沿模型当前在网络安全攻防能力上居前,这本身加重了顾虑。他坦言企业更防备总部与管理层都清晰可见的硅谷公司“很奇怪”,并认为各实验室披露模型相关网络事件是正确做法。

在路由层的责任上,他表示若某模型被普遍认为不安全即予下架;若只是存在不安全的用法,则以技术手段加设护栏,并与实验室对齐做法。OpenRouter提供一键开启的提示词注入检测与个人身份信息(PII)脱敏,作为企业首次接触新模型时统一部署安全措施的落点。“模型有点像互联网,你不能因为互联网上有坏东西就在公司禁用互联网,你需要护栏。”

四、路由层的商业模式与竞争壁垒

Atallah认为路由层的价值在于满足计划外的推理容量需求,抽成仅在特定条件下产生,专注度构成其相对竞争壁垒。

(一)收费结构

据其介绍,OpenRouter的收费分为四类情形:一是按量付费计划,抽成费率为5.5%;二是企业计划,基于承诺支出,承诺部分不收费;三是自带密钥(bring your own keys)调用自有推理时免收费用;四是近期将推出自助式的business计划。抽成只在使用OpenRouter自有推理容量且未签企业计划时产生,承诺支出的设计目的在于让平台能够预测需求。对于客户做大后会自建路由以节省抽成的推演,他认为部分客户尚未意识到企业计划的存在,并承认定价层次不够清晰是自身问题。

(二)竞争壁垒

对于Ramp、Merge等公司都在做路由产品、路由层正在商品化的质疑,Atallah从两方面作出回应:一是“很多公司做路由器是因为它时髦”,多为服务既有客户群、分享AI增长,“为了参与而做,没有奔着赢去做”,其网关会落后专注型公司许多个月;二是不向用户开放完整市场、完整灵活性与可定制性的网关,会削弱用户利用整个生态创新的能力,“等于把公司里所有员工需要的东西砍掉”。

(三)主要收入来源与基建纪律

Atallah判断,三年后的主要收入线与今天相同,即帮助企业与初创公司应对计划外的推理容量需求,包括需要试用原本未计划使用的模型、某个模型用量超出预期等,路由层以故障切换与可用性见长。“市场在持续低估自己的推理需求并以这个速度增长,这件事就很值得做。”这一做法源于其OpenSea经验:2020年10月NFT爆发时服务器与搜索索引频繁崩溃,他的目标是避免成为“加密版的Twitter失败鲸”,做法是在尚无10倍流量时按10倍做压力测试,这套在动荡市场中保持在线的基建纪律被沿用到OpenRouter。

关于Stripe收购报道,他表示“不能评论”,随后陈述了无论结果如何都将坚持的方向:为生态提供安全的AI接入,避免单一垄断,维持一个所有人都能探索的模型生态,并让新服务商、新工具与新的推理周边技术上线时易于被发现和接入。

五、应用层的用户关系、架构设计与成本管理

路由层将切换成本压至接近零,开发者仍表现出一定的模型黏性,应用层可通过上下文与harness握住用户关系,并通过分层架构与成本下放管理推理支出。

(一)开发者黏性与记忆归属

据其介绍,留存与流失数据显示,部分开发者在更好的模型出现后仍长期停留在原模型上,原因主要有三:一是“我的应用能跑,我不想弄坏它”,已做过的优化与护栏不愿推倒重来;二是新模型未必更省钱,现有模型价格通常随时间下降,实验室取得新进展时智能与价格曲线同时跳升后再下降,即便在开放权重模型之间换用新模型也未必划算;三是对输出的信任,很多人有自己的“个人评测”,新模型在这些测试上表现欠佳就继续使用旧模型。OpenRouter向实验室提供这些留存与流失数据,并计划更广泛地公开。

关于记忆的归属,Atallah未给出定论,判断模型、推理服务商、应用与路由层都会争夺记忆且各有优势:放在应用层上下文丰富且与模型无关,放在模型层可能在个性化基准上表现居前。“任何一层都不可能捕获全部有价值的记忆,因为应用拥有太多实验室没有的重要上下文,实验室要让它工作就必须激励应用交出这些上下文。”

(二)harness的长期价值

对于Claude Code、Cursor把模型与harness捆绑后路由层是否会被代理框架吸收的问题,Atallah回顾了一项早期判断:2023至2024年多数应用不显示底层模型,业内认为用户只要AI、并不关心模型,OpenRouter则押注用户会在意“在和谁说话”,这一判断已经兑现,Notion等应用也开放了模型选择。harness的情况类似,开发者对不同harness形成偏好,因为harness就是用户体验。

他对捆绑逻辑的回应主要有三点:一是模型越强,系统提示词中堆积的内容越成为负担,Anthropic发表过删减系统提示词后矛盾减少、表现改善的文章,当前很多harness正在删减代码以适配前沿模型;二是“harness是非实验室开发者拥有用户关系的一种方式,对经济体而言这一层极有价值”;三是harness与应用的区别在于可组合性,harness可以调用另一个harness、在云端沙盒中拉起另一个harness,且都基于Unix,模型对bash命令训练充分,围绕harness编排的未知因素远少于围绕应用编排。

(三)编排器加子代理的双层架构

主持人提出一个前沿模型编排四个开放权重模型的架构设想。Atallah认为这是“所有人都需要探索的架构”,OpenRouter已在帮助大量开发者这样做:提供一个针对通用模型调用调优的子代理服务器工具,由编排器模型在需要时调用低成本子代理完成确定性任务,再读回结果继续处理未知的非确定性任务。确定性任务交给低成本模型、非确定性任务留给前沿模型,是其对成本控制给出的操作性划分。

(四)推理成本下放至员工层面

Atallah认为成本管理是讨论不足的问题,很多公司对推理支出感到恐慌,因为这是一种全新的运营支出形态。过去员工成本是静态数字,按季度调整;现在每个员工的成本都是动态的,取决于其在贵模型与便宜模型之间的选择。他预计路由决策会下放到员工层面,公司应将管理者对产出的评估与员工的推理成本对齐,区分“值得庆祝的象限”(产出好且成本有效)与“需要关注的象限”(产出一般且成本失控),只处理后者。主持人认为这在规划上难以操作,他表示员工可自行控制成本,“现在你可以同时想:我作为员工有多好,以及我有多高效”。

总的看,Atallah认为模型市场将长期维持多模型格局,token需求对价格具有较高弹性,路由层的主要价值在于承接计划外的推理容量并保障可用性;应用层可凭借上下文、harness与品牌化的专用模型握住用户关系,同时需关注前沿实验室借助团队依赖进入特定市场的风险,并以分层架构和成本下放管理推理支出。