ChatGPT核心研发者Diogo Almeida隐退两年推出新模型Jev。它放弃文本生成,专注于软件判断场景,直接输出带类型的数据与校准置信度。延迟低至百毫秒,调用成本降低数百倍,彻底改变了LLM工程落地的传统形态。
ChatGPT核心作者之一 Diogo Almeida 历时两年潜行研发的新模型 Jev 正式发布。它不是另一个写文章、做推论的通用大语言模型(LLM),而是专门面向软件决策的全新范式。

简单说:Jev 不生成自然语言文本,只返回带有严格类型和置信度校准的决策结果。开发者传入程序上下文状态与强类型问题,Jev 在 70 到 500 毫秒内单次并行计算完成全部判定,输入每百万 Token 仅需 0.042 美元,输出 Token 完全免费。因为候选值域在提问前已被严格定义,它从物理机制上杜绝了畸形输出与格式解析崩溃。

传统开发中,当你需要借助语言模型的理解能力为代码分支做决策时,实际流程极为笨拙:
你让模型输出自然语言,然后编写另一套胶水代码,费尽心机地把决策值从语言中扒出来。在 Prompt 里强调「只能输出合法 JSON」;写解析逻辑;写验证校验;处理模型套上了 Markdown 代码块;在枚举值从 technical 变成 "technical support" 时捕获异常并重试;还要给模型突然礼貌道歉而不是回答问题的偶发故障写兜底熔断。

这套胶水代码绝非小打小闹。在工业级 AI 系统中,它占了相当大的代码比重,而且是几乎所有系统脆弱性与抖动的根源。
TypeSafe AI 创始人 Diogo Almeida 对此表示:
「在 OpenAI 时,我参与研发了让语言模型遵循指令、与人类流畅对话的核心方法,这项研究后来演变为 ChatGPT。当时我曾认为聊天模型或许是通向 AGI 的路径,但抛开狂热的光环,我很清楚中间缺失了极重要的一块拼图。」
教会模型像人类一样说话的人,花了整整两年时间,做了一个专门向软件说话的模型。
系统 1(System One)模型是指一类专为软件直接消费而设计的 AI 模型,它快速做出结构化决策,返回带类型的数值与精准校准的概率分布,而非生成文字。
人类思考有两个系统:系统 2 是缓慢深思的逻辑推理,系统 1 则是你读完一句话之前就已经完成的瞬时直觉判断。

几乎所有前沿实验室都在卷系统 2 的长思考链。然而真实业务系统里绝大多数判定都属于系统 1,大家却一直用系统 2 的昂贵成本和秒级延迟为它买单。
架构差异不是模型参数大小的问题。普通 LLM 逐个预测下一个 Token,输出越长延迟越高,且输出本质上就是一段可能包含任何内容的非受控字符串。Jev 则是一次性接收完整状态与全部问题,通过单次并行前向传播,直接在预定义好的答案空间里输出强类型判定。
Jev 的命名源自经济学上的「杰文斯悖论」(Jevons paradox):当某种资源的使用效率提升、成本大幅降低时,其消费量并不会减少,反而会迎来指数级激增。当机器智能的决策成本降到传统大模型的两百分之一,它就不再是一个打折的替代品,而会开启一个此前因成本过高而根本无法被自动化的庞大软件空间。

使用逻辑极其简单:输入待判断的状态(State),以及一组问题。Jev 仅支持三类固定问题类型:

以工单分拣场景为例:
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient()
ticket = (
"您好,我尝试绑定支付宝账号已经失败 3 天了,"
"订单一直在流失,请务必立刻处理!"
)
response = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="该由哪个团队处理",
criteria={
"billing": "支付异常或扣费订阅问题",
"technical": "功能缺陷或接口对接问题",
"sales": "价格咨询或账号权限问题",
},
),
"frustration": Score(
instructions="用户的愤怒沮丧程度",
criteria=[
"语气平静,仅陈述事实",
"有些沮丧但仍保持礼貌",
"非常愤怒,包含激烈措辞",
],
),
"is_urgent": Noul(
instructions="工单是否包含明显的紧急或时效诉求",
),
},
)
print(response.answers["department"].choice)
print(response.answers["frustration"].score)
print(response.answers["is_urgent"].noul)
一次网络往返,约 400 毫秒,完成三项业务判定。不需要在提示词里交代「返回 JSON」,因为返回格式根本不受模型任意发挥;也不需要写 json.loads 加 try-catch。
这里有两个技术细节非常值得关注:
首先,沮丧度评分返回的是浮点数(例如 1.035)而非离散索引整数。Score 给出的是刻度轴上的连续相对位置,当情绪介于「略微沮丧」与「非常愤怒」之间时,可以得到平滑的分辨率,无需开发者自行设计复杂的十分制量表。
其次,每一个 Choice 和 Score 返回值都附带经过校准的 confidence(置信度)。这往往是被大多数开发者低估、但实际上最有工程价值的关键字段。
普通 LLM 哪怕在胡说八道时,语调也往往自信满满。你向它提问「你确定吗」,它只会给你生成另一句听起来更笃定的解释,无法作为自动化调用的门禁。

TypeSafe 采用了名为 RLCD(基于校准决策的强化学习) 的训练方法。与针对人类喜好优化的 RLHF 不同,RLCD 专门针对预测概率与真实落地结果的偏差进行反向对齐。如果模型对一组样本标注置信度为 0.9,在统计学意义上,这批样本的实际准确率就极为接近 90%。
这让业务网关的代码判断有了坚实的基础:
action = response.answers["intent"]
if action.confidence < 0.5:
# 机器判断把握不足,转交人工介入
route_to_human(user_message)
elif action.choice == "check_balance":
# 低风险操作:查余额即便误判代价极小,直接放行
show_balance(account_id)
elif action.choice == "approve_transfer":
# 高风险操作:仅在极高把握时免密执行,否则要求用户二次确认
if action.confidence > 0.85:
confirm_then_execute(account_id)
else:
ask_user_to_confirm(account_id)
业务风险高低不同,对应的容错阈值也不同。显示错一个展示页面,用户损失 3 秒钟;转账逻辑误判,用户损失真金白银。有了可靠校准的置信度,控制业务行为门槛的逻辑回到了工程代码中,而不是被隐藏在玄学的提示词里。
当决策空间封闭且已知、系统对延迟或吞吐有硬性要求、或者需要置信度来控制后续流程时,用 Jev。当你需要长篇生成、算术推演或对话解释时,用通用 LLM。
Jev 不是为了正面挑战 Claude 3.5 Sonnet 或 GPT-4o。它替代的是工程团队用便宜的小模型搭配 400 行正则解析写出来的脆弱分类器,以及那些过去因为大模型太贵、太慢而根本没做自动化的内部流程。


在真实商业落地中,最具ROI优势的架构并不是「彻底淘汰现有大模型」,而是建立分层级联机制:把 Jev 当作毫秒级、低成本、带置信度的统一业务分流入口。
绝大多数日常请求被 Jev 解析为确定性状态,由普通后端代码处理;一部分特定任务路由到带垂类上下文的专业小模型;最后真正疑难、复杂的长尾长文本请求,才流转到昂贵的前沿旗舰大模型或人工坐席。
以处理 100 万条工单为例进行财务测算:
成本只是收益的一半,更关键的是体验。这 80 万条常规请求不再需要等待数秒,而是在不到 500 毫秒内即时返回。用户感知到的不仅是便宜,而是几乎无延迟的交互流畅度。
发布仅数天,开发者社区已涌现出一些极具启发性的实验项目:
这些项目印证了同一个软件工程规律:把循环控制、物理安全和算术交给传统程序,把不可量化的狭窄直觉决策交给 Jev。
TypeSafe 在文档中公开列出了该模型的边界与「毛刺」:

在 TypeSafe 的对比评测中,所有模型在结构化工作流下的得分都显著优于单次大 Prompt 模式。Claude Haiku 在单一提示词下的准确率为 18.1%,拆解为窄领域结构化任务后准确率跃升至 53.6%。
无论未来采用哪款模型,将大任务解构为具有强类型定义的细分判断,都是当下收益最高的 AI 架构演进方向。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断