前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/09.29 · 08:03/8 MIN/0 阅读

ChatGPT核心作者新作Jev:让AI只做决策不吐字

ChatGPT核心研发者Diogo Almeida隐退两年推出新模型Jev。它放弃文本生成,专注于软件判断场景,直接输出带类型的数据与校准置信度。延迟低至百毫秒,调用成本降低数百倍,彻底改变了LLM工程落地的传统形态。

ChatGPT核心作者之一 Diogo Almeida 历时两年潜行研发的新模型 Jev 正式发布。它不是另一个写文章、做推论的通用大语言模型(LLM),而是专门面向软件决策的全新范式。

Image 2

简单说:Jev 不生成自然语言文本,只返回带有严格类型和置信度校准的决策结果。开发者传入程序上下文状态与强类型问题,Jev 在 70 到 500 毫秒内单次并行计算完成全部判定,输入每百万 Token 仅需 0.042 美元,输出 Token 完全免费。因为候选值域在提问前已被严格定义,它从物理机制上杜绝了畸形输出与格式解析崩溃。

Image 3

Jev 到底解决什么工程痛点?

传统开发中,当你需要借助语言模型的理解能力为代码分支做决策时,实际流程极为笨拙:

你让模型输出自然语言,然后编写另一套胶水代码,费尽心机地把决策值从语言中扒出来。在 Prompt 里强调「只能输出合法 JSON」;写解析逻辑;写验证校验;处理模型套上了 Markdown 代码块;在枚举值从 technical 变成 "technical support" 时捕获异常并重试;还要给模型突然礼貌道歉而不是回答问题的偶发故障写兜底熔断。

Image 4

这套胶水代码绝非小打小闹。在工业级 AI 系统中,它占了相当大的代码比重,而且是几乎所有系统脆弱性与抖动的根源。

TypeSafe AI 创始人 Diogo Almeida 对此表示:

「在 OpenAI 时,我参与研发了让语言模型遵循指令、与人类流畅对话的核心方法,这项研究后来演变为 ChatGPT。当时我曾认为聊天模型或许是通向 AGI 的路径,但抛开狂热的光环,我很清楚中间缺失了极重要的一块拼图。」

教会模型像人类一样说话的人,花了整整两年时间,做了一个专门向软件说话的模型。

什么是「系统 1」模型?

系统 1(System One)模型是指一类专为软件直接消费而设计的 AI 模型,它快速做出结构化决策,返回带类型的数值与精准校准的概率分布,而非生成文字。

人类思考有两个系统:系统 2 是缓慢深思的逻辑推理,系统 1 则是你读完一句话之前就已经完成的瞬时直觉判断。

Image 5

几乎所有前沿实验室都在卷系统 2 的长思考链。然而真实业务系统里绝大多数判定都属于系统 1,大家却一直用系统 2 的昂贵成本和秒级延迟为它买单。

架构差异不是模型参数大小的问题。普通 LLM 逐个预测下一个 Token,输出越长延迟越高,且输出本质上就是一段可能包含任何内容的非受控字符串。Jev 则是一次性接收完整状态与全部问题,通过单次并行前向传播,直接在预定义好的答案空间里输出强类型判定。

Jev 的命名源自经济学上的「杰文斯悖论」(Jevons paradox):当某种资源的使用效率提升、成本大幅降低时,其消费量并不会减少,反而会迎来指数级激增。当机器智能的决策成本降到传统大模型的两百分之一,它就不再是一个打折的替代品,而会开启一个此前因成本过高而根本无法被自动化的庞大软件空间。

Jev 与通用前沿大模型对比

Image 6

如何使用 Jev?

使用逻辑极其简单:输入待判断的状态(State),以及一组问题。Jev 仅支持三类固定问题类型:

  1. Choice:从开发者定义的候选项中单选其一(最多 255 项)。
  2. Score:针对 2 到 10 个用自然语言描述的阶梯,输出一个连续的标尺分值。
  3. Noul:回答 Yes/No 问题,直接输出事件为 True 的概率值。

Image 7

以工单分拣场景为例:

from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient()  
ticket = (
    "您好,我尝试绑定支付宝账号已经失败 3 天了,"
    "订单一直在流失,请务必立刻处理!"
)
response = client.system_one(
    state=ticket,
    questions={
        "department": Choice(
            instructions="该由哪个团队处理",
            criteria={
                "billing": "支付异常或扣费订阅问题",
                "technical": "功能缺陷或接口对接问题",
                "sales": "价格咨询或账号权限问题",
            },
        ),
        "frustration": Score(
            instructions="用户的愤怒沮丧程度",
            criteria=[
                "语气平静,仅陈述事实",
                "有些沮丧但仍保持礼貌",
                "非常愤怒,包含激烈措辞",
            ],
        ),
        "is_urgent": Noul(
            instructions="工单是否包含明显的紧急或时效诉求",
        ),
    },
)

print(response.answers["department"].choice)   
print(response.answers["frustration"].score)   
print(response.answers["is_urgent"].noul)

一次网络往返,约 400 毫秒,完成三项业务判定。不需要在提示词里交代「返回 JSON」,因为返回格式根本不受模型任意发挥;也不需要写 json.loads 加 try-catch。

这里有两个技术细节非常值得关注:

首先,沮丧度评分返回的是浮点数(例如 1.035)而非离散索引整数。Score 给出的是刻度轴上的连续相对位置,当情绪介于「略微沮丧」与「非常愤怒」之间时,可以得到平滑的分辨率,无需开发者自行设计复杂的十分制量表。

其次,每一个 Choice 和 Score 返回值都附带经过校准的 confidence(置信度)。这往往是被大多数开发者低估、但实际上最有工程价值的关键字段。

什么是置信度校准?

普通 LLM 哪怕在胡说八道时,语调也往往自信满满。你向它提问「你确定吗」,它只会给你生成另一句听起来更笃定的解释,无法作为自动化调用的门禁。

Image 8

TypeSafe 采用了名为 RLCD(基于校准决策的强化学习) 的训练方法。与针对人类喜好优化的 RLHF 不同,RLCD 专门针对预测概率与真实落地结果的偏差进行反向对齐。如果模型对一组样本标注置信度为 0.9,在统计学意义上,这批样本的实际准确率就极为接近 90%。

这让业务网关的代码判断有了坚实的基础:

action = response.answers["intent"]
if action.confidence < 0.5:
    # 机器判断把握不足,转交人工介入
    route_to_human(user_message)
elif action.choice == "check_balance":
    # 低风险操作:查余额即便误判代价极小,直接放行
    show_balance(account_id)
elif action.choice == "approve_transfer":
    # 高风险操作:仅在极高把握时免密执行,否则要求用户二次确认
    if action.confidence > 0.85:
        confirm_then_execute(account_id)
    else:
        ask_user_to_confirm(account_id)

业务风险高低不同,对应的容错阈值也不同。显示错一个展示页面,用户损失 3 秒钟;转账逻辑误判,用户损失真金白银。有了可靠校准的置信度,控制业务行为门槛的逻辑回到了工程代码中,而不是被隐藏在玄学的提示词里。

什么时候用 Jev?什么时候用通用 LLM?

当决策空间封闭且已知、系统对延迟或吞吐有硬性要求、或者需要置信度来控制后续流程时,用 Jev。当你需要长篇生成、算术推演或对话解释时,用通用 LLM。

Jev 不是为了正面挑战 Claude 3.5 Sonnet 或 GPT-4o。它替代的是工程团队用便宜的小模型搭配 400 行正则解析写出来的脆弱分类器,以及那些过去因为大模型太贵、太慢而根本没做自动化的内部流程。

Image 9

降本增效的核心架构:级联设计(Cascade)

Image 10

在真实商业落地中,最具ROI优势的架构并不是「彻底淘汰现有大模型」,而是建立分层级联机制:把 Jev 当作毫秒级、低成本、带置信度的统一业务分流入口。

绝大多数日常请求被 Jev 解析为确定性状态,由普通后端代码处理;一部分特定任务路由到带垂类上下文的专业小模型;最后真正疑难、复杂的长尾长文本请求,才流转到昂贵的前沿旗舰大模型或人工坐席。

以处理 100 万条工单为例进行财务测算:

  • 全部直接跑前沿模型(单次约 0.03 美元):成本约 30,400 美元。
  • 采用 Jev 级联方案(每条工单仅需 0.0004 美元,仅 20% 真正复杂的长尾工单上送前沿模型):成本骤降至 6,480 美元。

成本只是收益的一半,更关键的是体验。这 80 万条常规请求不再需要等待数秒,而是在不到 500 毫秒内即时返回。用户感知到的不仅是便宜,而是几乎无延迟的交互流畅度。

社区开发者落地实验

发布仅数天,开发者社区已涌现出一些极具启发性的实验项目:

  1. 文献自动标引(1kpapers.com):仅花费 0.08 美元,一次性对 1,018 篇学术论文完成特定特征分类。
  2. 极速浏览器 Agent:browser-use/jev-ultrafast 借助 Jev 实现机票检索交互,全流程在真实携程类订票网站上仅耗时 7.1 秒,推演成本仅 0.0039 美元。核心逻辑是利用投机判定:在同一次请求中并行发起点击、输入与选择意图的三项判断,随后只执行符合预期的分支。
  3. 低成本系统自动化操作:awlevin/typesafe-computer-use 无需将整张屏幕截图送入昂贵的多模态大模型,而是先用 OCR 转为确定性 UI 结构,再让 Jev 输出下一步操作。相比纯多模态模型方案,单步决策成本从 0.032 美元降至 0.0002 美元,端到端延迟降低近 4 倍。
  4. MuJoCo 仿真无人机 2.5Hz 姿态决策:RomanSlack/jev-drone 展示了清晰的系统分层思想:500Hz 底层飞控与 50Hz 安全防撞由普通硬编码承载,传统 CV 以 15Hz 处理点云,Jev 以 2.5Hz 负责高层战术决断(障碍规避方案选择与风险打分)。

这些项目印证了同一个软件工程规律:把循环控制、物理安全和算术交给传统程序,把不可量化的狭窄直觉决策交给 Jev。

必须正视的模型局限性

TypeSafe 在文档中公开列出了该模型的边界与「毛刺」:

  • 完全字面理解:Jev 严格根据传入文本字面作答,不具备脑补提问者隐性意图的能力。提问必须严谨、清晰。
  • 状态污染抗性弱:如果传入的状态信息过于臃肿、掺杂过多无关噪音,判断准确率会明显衰减。开发者必须在工程侧预先做好精炼的数据提取。
  • 未做对抗注入防御:Jev 默认输入上下文来自受信任的程序状态。如果直接把未经清洗的用户输入传入 state,攻击者可以通过专门构造的文本诱导判定发生偏移。业务侧必须自行在入口做好安全过滤。

Image 11

在 TypeSafe 的对比评测中,所有模型在结构化工作流下的得分都显著优于单次大 Prompt 模式。Claude Haiku 在单一提示词下的准确率为 18.1%,拆解为窄领域结构化任务后准确率跃升至 53.6%。

无论未来采用哪款模型,将大任务解构为具有强类型定义的细分判断,都是当下收益最高的 AI 架构演进方向。

标签:TypeSafeChatGPT决策模型系统1

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误
置顶

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误

//

24小时热榜

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
TOP1

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

AI智能体爆发,正在重塑万亿服务器硬件供应链
TOP2

AI智能体爆发,正在重塑万亿服务器硬件供应链

3

挑战Meta Muse,Rabbit发布OS3探索智能体新解法

19小时前
挑战Meta Muse,Rabbit发布OS3探索智能体新解法
4

Sharpa发布三款灵巧操作硬件,打通机器人感知操控闭环

19小时前
Sharpa发布三款灵巧操作硬件,打通机器人感知操控闭环
5

海光发布1000系列端侧CPU:首度集成GPU进军工控市场

22小时前
6

Anthropic AI发现新酶系统引争议:被指非独立发现

22小时前
Anthropic AI发现新酶系统引争议:被指非独立发现
7

年产值426亿:长江边小镇拿下全国近四成特种电缆

22小时前
年产值426亿:长江边小镇拿下全国近四成特种电缆
8

中国两大AI云押注“电力时代”:百度走业务,阿里赌供给

23小时前
中国两大AI云押注“电力时代”:百度走业务,阿里赌供给
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断