前OpenAI研究员推出首个“系统一”模型Jev,放弃逐字文本生成,专注类型化概率决策。将Agent每次工具调用和路由分流的延迟压缩至毫秒级,成本降低上百倍。

在现有的 AI Agent 架构里,存在一个巨大的资源错配:
Agent 每做一次微小决策——判断是否该调用工具、请求是否紧急、一段 Bash 命令是否安全——背后消耗的都是一次完整的 LLM 推理。你用写长篇大作的算力,去让模型做一道二选一的单选题。
由前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI,试图打破这一范式。他们推出了名为 Jev 的“系统一模型”(System One Model)。这款模型彻底放弃了文本生成能力,只输出强类型、带校准概率的结构化决策。其响应时间仅为 70 至 500 毫秒,输入成本低至每百万 Token 0.042 美元,且输出 Token 完全不计费。
Almeida 曾在 OpenAI 长期参与 ChatGPT 底层的指令微调与 RLHF 研究。在他看来,对话式大语言模型解决了“如何与人类沟通”的问题,但软件内部那些高频、碎片化的微观判断,从一开始就不该由自回归生成模型来承担。
传统的 LLM 运行机制是自回归生成:吃进非结构化文本,在上下文约束下,一个 Token 接着一个 Token 地往外吐。这种机制赋予了模型写代码、搞创作的通用灵活性,但在面对纯逻辑判断任务时,逐字生成的机制显得极其低效且昂贵。
Jev 的思路是直接砍掉文本生成环节。
调用 Jev 时,开发者传入当前的上下文状态(State,可以是纯文本也可以是结构化数据)以及一个或多个类型化问题(Questions)。模型会在单次并行前向传播中同时计算出所有答案,而不是线性循环。
Jev 目前支持三种核心问题形态:
因为输出空间在调用前就由 Schema 锁死,Jev 从数学层面上消灭了“JSON 格式解析错误”的可能,无需像传统大模型那样依赖重试或正则提取。
让这套机制在自动化管线中立足的关键,是 TypeSafe 提出的 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。
在工业级 Agent 中,一个标榜 95% 准确率但从不告知风险的模型是无法落地的。软件系统真正需要的是自我感知能力:当置信度高于阈值时直接放行,一旦置信度掉入灰度区间,立即平滑降级给人类或更大的前沿模型接管。校准概率是构建高可靠控制流的前提。
根据官方公布的基准测试,在串联多个类型化决策的典型自动化工作流中,Jev 相比 GPT-6 / Claude 级别的模型组合,速度最高提升 193 倍,推理成本最高降低 444 倍。
Jev 并不是要取代大模型。真正的工程价值在于分工:大模型负责开放式推理、长链规划与内容生成;Jev 充当外围神经节点,吃掉那些原本占用模型调用的分支逻辑。
LangChain 团队已迅速跟进,联合 TypeSafe 推出了基于 Jev 的中间件模式,其中两项实践最具代表性:
用 Jev 在请求入口处毫秒级评估任务复杂度,轻量级检索走便宜的小模型,复杂任务才路由给高成本旗舰模型:
from langchain.agents import create_agent
from langchain_typesafe.experimental.middleware import (
ModelChoice,
ModelRouterMiddleware,
)
router = ModelRouterMiddleware(
choices={
"fast": ModelChoice(
model="openai:luna",
criteria="Direct lookups, extraction, and localized changes.",
),
"powerful": ModelChoice(
model="openai:sol",
criteria="Architecture and high-stakes decisions.",
),
},
instructions="Choose the least costly model that can complete the task.",
)
以往在 Cursor、Claude Code 等编程 Harness 中,判断一条 Shell 命令是否危险通常依赖封闭的内部黑盒分类器。现在开发者可以通过中间件直接接管工具安全校验:
from langchain.agents import create_agent
from langchain_typesafe.experimental.middleware import AutoModeMiddleware
guardrail = AutoModeMiddleware(tools=["bash"])
agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])
这种解耦在终端编程工具 SuperQode 中同样得到了验证:将权限三元组(允许、询问、拒绝)的判断交给 Jev,底层的生成模型得以剥离安全审查负担,专注于写出高质量代码。
Agent 的演进正在走出“一个大模型包办一切”的蛮荒期。
以前,由于缺乏专用的判别式轻量组件,开发者不得不写出一堆脆弱的正则表达式,或者一次次捏着鼻子花几秒钟调 LLM 输出一个简单的布尔值。
Jev 代表了一个明确的硬件与算法分工趋势:把“说话”(人类沟通、创造性表达)与“下决定”(路由、风控、过滤、状态流转)彻底拆开。下一代 Agent 变强,未必是因为核心大模型又多了几万亿参数,而是因为围绕它运转的控制层,终于有了毫秒级的专用中枢。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断