TypeSafe AI推出的决策模型Jev走红,日吞吐突破一万亿Token。创始人Diogo Almeida接受专访,详谈离开OpenAI创业始末,并直言当前大模型盲目卷基准测试与聊天体验,真正创造商业价值的应是面向代码与程序闭环的机器决策。
专注于机器可编程决策模型的 TypeSafe AI 近期备受关注,其推出的模型 Jev 放弃了传统的对话式交互,专注于直接为程序逻辑输出结构化决策。其发布视频在 6 天内播放量超过 3800 万,在第三方评测 JevBench v1.2.1 中位列第一。
在播客访谈中,TypeSafe AI 联合创始人兼 CEO、前 OpenAI 研究员 Diogo Almeida 深入剖析了行业现状。他直言:公开基准评测极易被操纵,与其盲从榜单,不如关注模型在真实代码链路中的可靠性。

Diogo Almeida 指出,当前 AI 行业存在严重的现实脱节。模型已经聪明到足以攻克数学顶尖难题,但在有实际经济价值的工作流中,落地贡献仍然极低。
“我们手里有一台强悍的引擎,却缺少接入真实业务的接口。”Diogo 透露,Jev 的日处理吞吐量已突破 1 万亿 Token,且夜间流量依然保持高位,这证明大量调用来自后台自动化脚本而非散客试用。他强调,平台并不在乎虚高的个人注册量,真正拉动价值的是重度开发者用循环语句进行的自动化批量调用。
他认为,衡量 AI 革命的唯一硬核标尺是**全要素生产率(TFP)**的增长,TypeSafe 的长期目标就是在五年内将该指标推高 3%。

业内通常将大语言模型当成“陪人打字的聊天伙伴”,而 TypeSafe 对 Jev 的定位是“机器原生、大型可编程模型(System-One)”。
预训练模型做文本补全,RLHF(基于人类反馈的强化学习)优化对话讨好用户,而 Jev 面向的是代码调用。为了让模型能无缝嵌入系统底层,Jev 设计了三套核心原语:
Diogo 反对将面向 C 端的“安全对齐”生搬硬套到开发者平台。在业务系统作为依赖项运行时,模型因为误触发安全策略而“拒绝回答”等于系统崩溃。开发者真正需要的是“能力对齐”——输出可预测、行为可控,如同数据库查询一般稳定。

针对当前主流技术路线,Diogo 提出了尖锐反思:RLHF 的副作用在于造成“模式丢弃(mode-dropping)”。模型为了在长文本中不犯显而易见的错误,会主动舍弃罕见但正确的长尾模式,输出平庸但安全的万金油回答。这种保守倾向直接扼杀了概率校准的精准度,将纯文本对话模型套入复杂决策无异于灾难。
对于 RLVR(基于可验证奖励的强化学习),Diogo 认为其本质仍是面向基准测试(benchmark)的拟合,多步推理脆弱性依然存在。TypeSafe 采用的路线是 RLCD(以程序闭环验证为目标的强化学习),让模型直接服务于确定性的编程闭环。

谈到商业化与研发路径,Diogo Almeida 展现出务实态度:“就算给我十亿美元,我也绝不从零预训练大模型,那纯粹是在烧钱。”
AI 工程师完全可以借力成熟底座,通过特定架构裁剪、微调与组合来解决现实问题。Diogo 回忆在 OpenAI 期间,曾因看到可编程路径受阻而深感无力。如今业内追逐全能 Omni 模型,但实际商业世界中,暗数据处理、代码智能体(coding agent)以及低延迟实时场景才是真正的造血源泉。
他建议工程师丢掉臃肿庞杂的 System Prompt,学会将宏大任务拆解为细粒度的独立子查询,用多个高置信度的决策原语配合程序逻辑,实现既稳定又具备容错能力的 AI 应用架构。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断