← 返回AI 应用主题跟踪

端侧AI的部署现状、落地场景、收费模式与架构路线——Liquid AI联合创始人兼首席执行官Ramin Hasani访谈要点梳理(Latent Space,2026-09-18)

Latent Space,70 分钟 · 2026-09-18

——据Latent Space节目《Ninety Percent of Phone AI Still Runs in the Cloud — Ramin Hasani, Liquid AI》(2026-09-18)整理

摘要:本文对Latent Space节目专访端侧基础模型公司Liquid AI联合创始人兼首席执行官Ramin Hasani的主要观点进行了梳理汇总。梳理了端侧与云端推理的分工现状及终端厂商将工作负载迁至设备的成本动机,介绍了Liquid在汽车、AI PC、电商与机器人领域的落地情况,以及设计伙伴服务费加按设备按年授权的收费方式与自助式模型开发平台,最后阐述了其对企业AI需求、模型架构路线与硬件生态的判断。据其介绍,主流手机上约九成AI调用仍走云端,奔驰车内模型体积约600MB、运行在成本约100美元的芯片上,Shopify的Shop应用每月经Liquid模型处理的请求超过10亿次。

关键词:推理成本;企业采用;定价与变现;开放权重;Liquid AI;奔驰;Shopify

一、端侧与云端的分工现状

Hasani认为,端侧模型目前只承接了少部分AI调用,终端厂商将工作负载迁至设备的首要动机是成本,难点在于生产级可靠性。

(一)公司背景与混合部署现状

Liquid AI是一家从头预训练的基础模型公司,源头是Hasani与现任首席技术官约12年前在维也纳技术大学开展的“液态神经网络”研究:他们以只有302个神经元的秀丽隐杆线虫为模型生物,用一阶微分方程描述神经元之间的信息交换,发现几十到几百个神经元的小网络即可控制机器人。2017年,麻省理工学院计算机科学与人工智能实验室(MIT CSAIL)的Daniela Rus邀请二人赴MIT,团队在那里结识第四位联合创始人Alexander Amini。“在算力很小的地方装进足够的智能”自此成为团队的研究主题。

Hasani表示,当前设备智能的通行做法是混合方案,即云端一个模型、设备上若干模型,两端协作。据其介绍,在用户规模居前的手机上,无论Apple Intelligence还是Galaxy AI,约九成调用去了云端,一成留在设备上,原因在于端侧模型还不够强、不够可靠,难以承接更多原本由云端处理的用例。

(二)端侧部署的成本动机

对于厂商为何仍希望把工作负载迁至设备,Hasani给出三方面理由:一是成本,一家公司若有4亿部手机乃至数十亿客户需要支持,既要提供免费的智能入口,又要在云端承担相应推理,成本将高到难以承受,把负载放到设备上相当于为自身创造毛利;二是离线可用;三是满足隐私敏感场景的需要。其中成本居于首位。

(三)生产级可靠性的难点

Hasani强调,端侧部署远不止从开源社区下载一个模型放进设备:一是要做热控制;二是模型在长上下文下的行为会发生变化;三是可靠性须达到一定水平,设备上的质量基准分数只是其中一小部分。据其介绍,Liquid过去两年半经历了多轮量产周期,他的体会是端侧生产级AI难度极高。

二、客户落地与应用场景

Liquid将模型针对CPU进行了优化,目标是把智能带到数据中心之外,客户是在数据中心之外有算力部署的企业,包括汽车、机器人、笔记本电脑与手机厂商。

(一)汽车:梅赛德斯-奔驰车内模型

据其介绍,Liquid与梅赛德斯-奔驰(Mercedes-Benz)的合作于4月宣布,这一推进速度在汽车行业属于较快。用户在车内使用“Hey Mercedes”一类对话功能时,背后是直接装在车内的基础模型。该方案为多模态,可接入摄像头、进行语音交互,推理部分由文本模型承担,模型体积约600MB,可通过远程升级(OTA)推送至每一辆车。首批部署定在今年,覆盖北美所有第三代奔驰车型,运行在一颗成本约100美元的芯片上,他称车内AI由此进入规模化部署阶段。

(二)AI PC:与AMD合作

据其介绍,全球每年出货3亿至4亿台AI PC笔记本电脑,其中约1亿台可能以AMD为核心。双方正推进让Liquid的模型直接运行在笔记本电脑上,主要用途有两类:一是隐私过滤,用户向ChatGPT或Claude Code等云端代理发送大段敏感内容前,先经本地模型屏蔽敏感信息;二是常驻设备的主动式代理,读取本机信息进行分析,同时具备离线与物理隔离环境下的可用性。

(三)企业私有部署:Shopify

Shopify的用法属于私有部署,其关注点在于延迟与质量,通过Shop应用在面向商家与面向消费者的多条产品线上使用Liquid的模型。据其介绍,用户在Shop应用中输入文字,信号即会送到一个Liquid模型,仅这一项每月请求量已超过10亿次,并呈指数式增长。这一合作由Shopify的Mikhail Parakhin引荐,对方当初的态度是“拿来测,好坏由测试说话”,首轮测试后对质量与效率均感到意外。

开源方面,据其介绍,Liquid已发布的模型参数规模从1亿到240亿不等,较大的几款采用混合专家架构,支持音频、视觉、文本输入与音频、文本输出,累计下载量超过4000万次,每周约150万次。

(四)机器人:刻意后置的垂直方向

机器人是团队的出身领域,却是公司自成立起刻意搁置的方向。Hasani的解释是,围绕机器人建立业务难度大、回报滞后,量产级机器人须完成技术验证与确认,再进入监管流程。因此公司先做横向的智能层,服务整车与设备厂商,把验证要求更为敏感的“动作”领域放在后面。据其介绍,目前已有工业机器人公司使用Liquid的视觉语言模型做指令跟随,也有工厂摄像头监控类用法。他认为,随着模型更加成熟、对数据、后训练与定制流程的掌控更强,现在是认真启动机器人方向的合适时点。

三、收费方式与平台化

Hasani确认Liquid的业务以授权协议为主,并通过行业方案沉淀与自助式平台扩大规模。

(一)设计伙伴服务费与按设备授权

据其介绍,收费分为两个阶段:一是早期以“设计伙伴”形式合作,Liquid派出应用机器学习团队与客户共同开发,这段合作期本身收费;二是方案部署后按年、按设备收取授权费,费用依部署位置而定,属于经常性收入。某一垂直行业的方案做成之后,同行业下一家客户所需的服务时间将下降,转为方案部署。例如奔驰作为汽车行业的设计伙伴完成方案后,后续车企客户所需的服务量明显减少。按垂直行业沉淀方案是Liquid加快销售的办法。

(二)自助式模型开发平台

在此基础上,公司正在开发自助式模型开发平台,目前处于测试阶段。其形态是一组可放入客户惯用代理框架的工具,用法类似Claude Code,由代理带领开发者逐步完成模型的开发、构建与部署,目标是达到Liquid自行开发时的生产级质量。现阶段需要开发者在环,平台也提供一键全自动模式,但他承认后者产出的模型质量不及交互式开发。

对于评测集足够好即可忽略过程的观点,他认为这一说法在首次部署时成立,但模型上线后新数据与新请求不断涌入,用户需求分布会突然漂移,静态评测随之过时,因此需要持续演进的系统。现有开发者入口LEAP是面向人工使用的库与开源手册,可微调模型,也可导出llama.cpp可用的GGUF部署包直接上设备,新平台是其自动化版本。

(三)从推理token到定制token

Hasani判断,目前约九成的市场围绕推理token,前沿实验室与Fireworks等推理服务商都是托管模型、按推理收费;下一波公司将围绕“定制token”变现,他提到Thinking Machines等公司,并表示这一类中已出现估值百亿美元级的公司。他对“定制”的界定较宽,涵盖预训练、中期训练、后训练、数据生成与强化学习,再交由代理执行并形成循环,结果是客户拥有自己的模型,并在上线后持续保持在期望水平。他称这是“主权AI”的本义,更进一步则是每个人拥有自己的智能。

四、企业需求侧的变化

Hasani认为,企业自建AI的转化率较低、token使用效率不高,由此形成了对自助式平台的需求。

(一)概念验证难以投产

据其介绍,Liquid迄今与约200家财富500强企业有过接触,他观察到的第一点是企业的疲惫:这些企业花了很长时间自建智能,组建过应用机器学习团队,试过下载开源模型,也试过针对自身课题从头训练,多数未能形成真正的生产线,转而退回云端方案。据其介绍,约八成的概念验证(POC)达不到生产级。

(二)token使用效率偏低

第二点是开发者一侧需求旺盛,人人都想用能力靠前的模型写代码、把token用到上限,他将这种心态形容为开发者脑中的一种病毒。但在成熟组织中核算靠氛围编程(vibe coding)生成的代码仓库究竟创造了多少价值时,他的结论是约九成token是无用的。企业一方面看到这一点、需要控制成本,另一方面要满足内部开发者,因而对既能尽快获得价值、又能控制成本的自助式平台有较强需求。

五、架构路线与硬件生态

Hasani表示,Liquid按目标芯片搜索混合架构,与芯片伙伴保持紧密合作,并认为在软件栈上“生态总是赢”。

(一)LFM架构演进

Liquid的模型系列名为LFM。Hasani回顾了路线来由:循环结构的计算量随输入长度增长接近线性,注意力为二次方,但非线性循环算子在GPU上难以并行;状态空间模型以线性化换取并行,代价是表达力,用于语言时难以学好长程依赖,始终落后于Transformer。Liquid自始即多路线并行,把液态神经网络、Hyena、状态空间模型等替代路线的发明者聚在一起,构建了按部署环境搜索算子组合的系统(相关论文名为STAR),同时优化四项指标:一是质量相对纯Transformer不让步;二是内存占用尽量小;三是延迟尽量低;四是计算速度尽量快。目标芯片是GPU还是NPU,决定了混合架构的具体形态。

据其介绍,第一代LFM是卷积、注意力与原始液态结构的混合;第二代专为在CPU上运行而优化,约八成为双门控一维卷积、约两成为分组查询注意力;目前为LFM 2.5,下一代LFM3将小幅修改,加强质量、稳定性与延迟控制。公司内部缩放定律实验覆盖数千万至700亿参数,得出的经验包括:一是模型越大,架构中的结构性偏置应越少;二是在内存仅8GB一类的小规模场景,可加入更多反馈回路换取表达力;三是状态空间模型与循环结构在音频等连续序列上效果较好,在文本上较差,200亿参数以下循环结构可以很有效。他认为注意力是必需的部件并将长期存在,还需加上硬件感知、具身与持续学习;同时应假定各前沿实验室都有团队在研究替代架构,只是多数人眼下的精力放在推测解码、量化等事后优化上。

(二)硬件感知与生态约束

由于架构搜索是硬件感知的,与芯片伙伴保持紧密合作对Liquid十分重要。他举例称,高通(Qualcomm)一类公司若想为下一代NPU找到在自家芯片上表现靠前的计算图,可以把现有乃至下一代硬件放进搜索回路;Taalas、Etched等把网络权重直接固化进芯片的公司,对架构搜索兴趣浓厚。

软件栈方面,他的原则是不重复造轮子:一是许多推理公司试图替换llama.cpp或在其外层封装来做端侧AI,凡是想做成适配所有硬件的通用方案的,细看都不及原版llama.cpp,成功的是锁定单一生态的几家;二是Modular已归入高通,他预计Mojo会因此走得更顺,但Liquid自身部署并未采用,要在AMD或高通芯片上运行良好都须编写各自专用的内核;三是现有GPU基础设施为并行矩阵乘法优化,循环与层间回环一类结构缺少合适的基础设施。他的总结是“生态总是赢”,这对新进入者并不公平。据其介绍,近期研究重心包括大规模多模态、支撑可靠端侧助手的更长程推理、从内核到强化学习基础设施的效率工程,以及DNA这类人类难以直接读懂的长序列数据。

总的看,Hasani认为端侧AI的需求方是需要向海量终端免费提供智能的设备厂商,其首要动机是把云端推理成本转化为自身毛利,当前约九成调用仍走云端,难点在于端侧模型的生产级可靠性;Liquid以设计伙伴服务加按设备按年授权的方式收费,按垂直行业沉淀方案,并以自助式平台承接其所判断的“定制token”需求。