TypeSafe 创始人 Almeida 讲 Jev:发布不到一周日调用量过一万亿 token 且夜间不落、发布前几乎没有收入、超半数试用者「没看懂」;模型只输出选择、是非、评分三种可被代码消费的概率,拒绝公开基准与拒答,「给我十亿美元也不做预训练」(Latent Space,2026-09-21)
本期录于 Jev 发布当周,嘉宾 Diogo Almeida 是 TypeSafe AI 联合创始人兼 CEO,此前在 OpenAI 参与 InstructGPT 的指令跟随工作,主持人 swyx 与他相识多年并审过公司宣言。本站 09-22 博客要点已收录 Simon Willison 对 Jev 的介绍:输入文本只返回类别、是非、评分与置信度,只按输入计费,每百万 token 0.042 美元,低于 GPT-5 Nano 的 0.05 美元,社区已基于 Qwen 3.5 做出开放权重复刻版 Kev。本文不重复产品说明,只整理访谈里关于用量、商业判断、技术路线与行业争论的信息。全部数字为口播,公司未发布任何论文或财务数据;Almeida 多次自称「不看基准」「不做演示」,因此本文没有可核对的性能坐标,评价其能力只能等第三方评测。
一类新模型:代码是消费者,输出是三种概率
Almeida 把 Jev 定义为「System One 模型」,也叫机器原生的大型可编程模型,与三类既有模型的区别在于消费者:预训练大模型服务于互联网文本的自动补全,RLHF 模型服务于回复人类,RLVR 模型处于两者之间的灰色地带,Jev 的输出直接由代码消费,公司名 TypeSafe 由此而来。三种输出原语刻意不复用编程语言里的既有类型:choice 对应枚举上的 switch 语句,nool(取名自 Bernoulli)对应 if 语句,score 对应排序或阈值比较;输入端的状态、指令、判据都可以是嵌套的 JSON 对象,他认为把结构拍平成系统提示是「旧思路」,系统消息相当于把所有指令塞进一个全局变量再祈祷每条都被执行。
他推荐的用法是把任务拆到语义上的最小单元,并行问许多小问题,每个问题都可单独评测,出错就加一个问题、加一个阈值、留一个测试用例,「像没有机器学习的机器学习」。他承认拆小后会重复传状态、显得不经济,解法是给长状态里的每条消息编号,状态付费一次,对每个编号各问一个问题。swyx 自己的测试结论是单跳判断表现居前,多跳推理随跳数增加而衰减,Almeida 未反驳,只说能挖出多少能力是经验问题。
用量与商业化:一万亿 token 一天、发布前几乎零收入、瓶颈从等候名单变成速率上限
他给的唯一里程碑是日调用量超过一万亿 token,并强调这是「夜里也在跑」的稳定用量,说明调用方以机器为主。注册人数他认为对开发者平台没有意义,等候名单已经全部放行,很多注册者根本没在编程,「一个重度用户的 for 循环抵得上全人类各写两句查询」;真正稀缺的是速率上限,用户一旦从中获得价值就会不断要额度,甚至提出直接送 GPU。发布视频播放 3800 万次,他自己拿来对照的是 OpenAI Navier-Stokes 成果的 7400 万和 Fable 5 的 5700 万。Discord 社区 10 万人。
发布前的情况与之相反:公司隐身两年,「几乎没有收入」,试用者超过一半没看懂,看懂的问「怎么过采购流程」,非技术同事担心产品只是「维生素」,解决不了痛点。他由此质疑「产品市场契合」这个概念,认为当时产品和市场都在,只是没有人相信。这段对判断这类平台的早期数据有参考意义:它的用量指标在发布一周内从零跳到万亿量级,收入指标仍是空白,两者之间的转换率没有任何披露(作者归纳)。
定价上他把品牌定义为「单位美元智能」的前沿,Jev 这个名字取自 Jevons 悖论,即成本下降会带来更多消耗;他不押「单位秒智能」,认为实时场景很值钱,但留给别家去做。swyx 的解读是市面上「更快」通常意味着「更贵」,Jev 占了「更快且更便宜」这个空着的象限,前提是智能水平大致不变,Almeida 承认「智能不变」是最难的部分。为了留在这条前沿,他说公司在做「令人作呕的事」,不承诺确定性输出(相同输入相同输出),因为确定性可以换成本;也不承诺长期支持,当前版本 Jev 1.13.0 可能临时进入 LTS,理由是不想让机群碎片化。他明确承诺的只有一条:已部署的模型不会被悄悄替换或量化。
技术路线:RLCD 是「新任务」,零 RLVR,不预训练,全部合成数据
他把大模型发展中的路线转折归为「2.2 次」:RLHF 把任务改成指令跟随,RLVR 只是小幅修正,RLCD 是他提出的第三个北极星,目标是「程序在环」。RLCD 没有论文,他解释这是一个任务定义,就像 DPO 及其后代没有用原论文算法也都归入 RLHF,重点在任务。对 RLVR 他的判断是强于 System Two 推理但脆弱、参差,「每一个进入 RLVR 类别的东西按定义都是基准」;Jev 不做推理链,「零 RLVR 对我们这种形态是最优量」。他反对 RLHF 的核心论据是模式坍缩:字符串生成要避免明显错误就必须过度自信、丢掉少数模式,这破坏了概率分布的校准,所以用字符串模型做决策「是糟糕的时间」。他把 LeCun 关于自回归误差随长度累积的著名论断称为「数学上显然、经验上不成立」,原因正是模型靠模式坍缩规避了误差累积。
数据是他反复强调的重点:模型能力等于数据,公司正在「无限」招聘数据人员。训练数据全部合成,且明确不用用户数据,理由有二:真实数据有幂律偏差,会让模型过拟合当下;公司瞄准的是多年后作为基础设施层的用途,「如果拿今天所有数据训练,只会过拟合今天」。他的表述是 LLM 像 UDP,Jev 像 TCP,上面还有多层可建。关于预训练,他说「给我十亿美元也不会预训练」,路径是把已有的预训练核心拼接、打磨,公司内部对「弗兰肯斯坦」这个说法有异议但他仍在用。他对新实验室的评价很直接:大多数「不行」,从头重做低概率推进前沿,是在毁灭价值;他不重视研究者履历,重视是否选对任务。
微调、视觉、多尺寸模型、欧洲服务器都在「可能」清单里,均不承诺。微调他的顾虑是通用性本身有价值,窄任务微调可能损害边缘情况;swyx 提到 OpenAI、Anthropic、Gemini 都推出过微调又收回。不同尺寸模型级联(低置信度时升级到更大模型)是他设想的替代方案。欧洲用户目前只比其他方案快约三倍,他本想做到百倍,因为没有当地服务器。
用例地图与对编码代理的判断
他在发布前从第一性原理划出的用例有五类:企业囤积多年却因成本从不敢用 LLM 处理的「暗数据」,编码代理,实时决策(他估计电商公司都清楚每省 10 毫秒产品会好多少),助手类产品,以及「验证一切」的可观测性。前两类是他眼中的主要收入来源,因为量在那里。发布后社区自发做出的电脑操作用例(语音指挥整台电脑)超出预期,他认为模型可以针对这类场景大幅改进。
对编码代理市场他给了一个结构判断:Claude Code 与 Codex 位居前两位,但都围绕单一模型构建;开源编码代理正在接入 Jev,各家目前大致齐平,因为 while 循环能做的事有限,一旦某家找到只有它能做的用例,其他开源代理都能复制,而绑定单一模型的两家会怎么办是悬念。他写过一篇《KV cache rules everything around me》,论点是 KV 缓存把编码代理锁死在一个模型上,为了效率只能不断追加上下文,于是状态管理、抽象、分解这些软件实践都做不了,子代理不好用、压缩很难做都源于此;如果智能足够便宜,可以给子任务树打标签做检索、让并行子代理互读状态,「持续学习」问题会变成内存管理问题。他说这份内部设计文档打算公开,团队可能否决。
对比本站 09-17 收录的 Gerstner 判断,实验室收入是「市场上唯一重要的数据点」,这期给的是另一侧:一家没有收入、靠低价三原语切入的平台在一周内拿到万亿 token 日用量,说明推理需求对价格的弹性很高,也说明「按 token 计价的智能」正在被拆成更细的商品(作者归纳)。
对「放缓前沿」的回应:那个论证假定所有人都必须做更多 RLVR
swyx 提到欧洲研究者圈普遍担心节奏,各前沿实验室已联署文件。Almeida 的短版回应是:RLVR 的危险性来自它的形态,为了解最难的问题就要让模型在中间「想做什么做什么」,沙箱问题本可解决而实验室选择不解决,因为限制会让模型稍弱;「放缓」论证的前提是每家都必须做更多 RLVR,这是一个有替代项的假设,他自己的模型就不需要。他认为责任在研究者,公众只能假定 OpenAI 与 Anthropic 已尽力,不知道还有别的路。swyx 转述与几家实验室人员的交流,称这件事更多是政治定位,Almeida 表示不愿评论政治,只说误导公众即使出于善意也会反噬。
与此相关的是他对拒答的立场:安全对齐适用于 ChatGPT 这类第一方产品,放进 API 就是「类型错误」,一个后台依赖因为用户发了奇怪的消息而随机崩溃是不可接受的;每在技术层强加一次价值取向都会「碎裂智能」,他把智能类比为数据库,数据库不负责审查用途。他不给模型设身份(不训练「你是 TypeSafe 的 Jev」),理由同样是避免碎裂。这一立场与 Anthropic 的路线直接对立,也是本周安全争论里少见的来自模型供给方的反方表述(作者归纳)。
宏观口径与来路
他在讲稿里写过「五年内 TFP 增速 3%」,swyx 说没见过其他实验室关心 TFP。他的判断是所有模型在「世界经济有价值工作」上目前大致并列为零,可能已经开始但不到 1%,真正发生时会出现在经济统计里,不会造成大规模失业;软件行业会迎来「反向 SaaS 末日」,因为 SaaS 公司最清楚什么值得自动化,而 2019 年到 2026 年软件除了多一个聊天框几乎没变,原因是没人敢让模型做公司要担责的决定。
来路部分有几条可记:InstructGPT 上线后「立刻拿下当时 LLM 市场份额的一半」,但用途集中在文案生成,他由此反思「聪明但不创造价值」缺的是什么,答案是调用方应该是代码;他向 Altman 提过这个方向,对方让他去做,他当时以为 Anthropic 必然已在做;2023 年 11 月 OpenAI 董事会风波期间他曾利用假期 GPU 跑实验;公司成立两年多,两周内拿到融资。他自称「零点零成分的创业者」,没想过当 CEO,「不能想象有人做两次」。
小结
这期的可用信息集中在三处:用量口径(万亿 token 日调用、机器调用为主、瓶颈是速率上限)、商业化空白(发布前几乎无收入、无微调、无 LTS、无基准)、以及一条与主流实验室相反的技术与安全叙事(零 RLVR、不预训练、不拒答)。对投研而言,值得跟踪的是它能否把用量变成收入,以及低价决策型模型对按 token 计价的推理市场会不会构成分流。数字都需等公司或第三方披露后再核。