火爆硅谷的 Jev一个不会说话的 AI 模型正在把 Agent 的判断从提示词技巧变成原生能力摘要最近有一个叫Jev的模型在海外爆火——接入 Vercel AI Gateway 后24 小时内接近 13% 的付费团队直接采用。它不会写文章、不会聊天、不会写代码只会回答true/false、选择题和打分却比 GPT-4o 快20~200 倍、便宜40~400 倍而且输出 Token 永久免费。更反直觉的是它的创始人 Diogo Almeida 是 ChatGPT 早期核心贡献者、RLHF 之父之一——而他现在做的模型恰恰是要推翻 RLHF 的那套逻辑。关键词Jev、System One Model、RLCD、概率校准、AI Agent、类型安全、判断模型、LLM 应用架构一、先说一个让你血压升高的场景做 Agent 应用的同学一定写过这样的代码respclient.chat.completions.create(modelgpt-4o,messages[{role:system,content:你是一个判断器。只输出 JSON不要解释。},{role:user,content:f判断以下消息是否包含退款意图输出 is_refund 和 confidence\n{text}}],response_format{type:json_object},temperature0)datajson.loads(resp.choices[0].message.content)看起来没毛病但实际用起来全是坑格式漂移偶尔多一句以下是分析过程……你的json.loads直接报错幻觉式自信模型拍着胸脯说confidence: 0.95结果十次错三次——这个概率根本不是校准过的只是听起来自信又慢又贵就为了输出一个true要自回归生成几十个 Token每个输出 Token 都在计费你要当保姆解析、校验、重试、兜底应用层代码比模型还忙。我们早已习惯这一切甚至觉得本来就该这样。但最近出现了一个模型把上面四条坑从根上填平了。它就是本文的主角——Jev一类被称为System One Model系统一模型的新物种。二、Jev 是什么一句话专做判断题的 AI 模型基本信息项目内容全称System One Model公司TypeSafe AI创始人Diogo AlmeidaChatGPT 早期核心贡献者、RLHF 之父之一核心定位模拟人类系统一快思考做快速、直觉式决策关键特点架构层面就不支持生成自然语言你问它问题它不会写文章、不会解释、不会写代码只返回三种东西原语作用输出Noul是非判断true / false 为真概率Choice选择判断从给定选项中选一个 各选项概率Score打分判断在指定等级范围内打分关键性能数据响应时间70 ~ 500 毫秒比前沿模型快20 ~ 200 倍成本低40 ~ 400 倍输出 Token 永久免费接入 Vercel AI Gateway 后24 小时内接近 13% 的付费团队采用听起来像判别式分类器回归不一样。Jev 走的是大模型路线但对训练目标、架构、输出契约做了三重重构这个后面细讲。三、一个灵魂拷问我编排一个判断子 Agent不香吗很多读者的第一反应和我一样“我们在 Agent 编排时本来就可以设一个子 Agent 专门做判断、专门打分啊Jev 有什么特别”你的直觉是对的——应用层确实早就能这么做。但那本质是功能借用不是架构适配。对比一下维度编排判断子 AgentJev底层模型通用生成式 LLM决策专用模型判断方式提示词要求只输出 JSON / 只回答是或否模型架构只支持类型化输出输出可靠性依赖提示词遵循可能格式错误、幻觉自信类型安全物理上无法输出定义外内容概率校准RLHF 副产品系统性不可靠RLCD 训练概率校准就是训练目标速度自回归逐 Token 生成并行采样一次性输出成本输出 Token 计费输出 Token 免费消费者人类 解析代码代码直接消费一句话总结判断子 Agent 是请一位博学家回答是/否。Jev 是为判断专门设计的传感器。就像用多功能料理机去称重——它能做但噪音大、速度慢、精度不可靠你还得在旁边盯着。Jev 就是那个专用的电子秤。四、深挖RLHF 的结构性缺陷——它优化的是讨人喜欢不是概率诚实这是全文最重要的一节也是理解 Jev 为什么反直觉的钥匙。4.1 传统 LLM以人类为消费者传统 LLM 的默认消费者是人类。它的目标是生成自然语言、回答问题、让人类觉得有用、流畅、满意——所以它必须会说话。4.2 判断任务以代码为消费者但 Agent 工作流里的大量任务消费者不是人类而是代码这条消息是否包含退款意图 →true / false工单路由到售后、物流还是财务 →售后 | 物流 | 财务紧急程度 1 到 5 分 →3这些任务不需要解释不需要文采只需要一个类型化的、带概率的、代码可以直接信任的决策。4.3 概率校准说 80% 就真的 80%判断模型的价值很大程度取决于概率是否可靠。如果模型说我有 80% 把握那么一万次同类判断中它应该大约对 8000 次——这叫概率校准。问题在于传统 RLHF 模型输出的概率往往不是校准过的概率而是听起来自信的概率。4.4 模式丢弃Mode DroppingRLHF 的原罪RLHF 的训练目标是收集人类偏好、针对人类偏好优化。这导致一个系统性偏差模型学会输出人类更喜欢的答案模型学会看起来自信模型为了迎合偏好牺牲认知上诚实的概率表达。这就是模式丢弃。维度RLHF 传统 LLMJev / System One Model训练目标人类偏好概率校准优化结果回答更像人、更讨喜概率更可信、更可依赖不确定时倾向给出自信答案倾向给出真实概率输出消费者人类代码概率可靠性系统性不可靠经过校准主要风险幻觉、迎合、格式漂移概率偏差可被度量关键结论RLHF 不是为软件可依赖的判断设计的。它让模型更会聊天但不一定让模型更会做可靠判断。五、三重重构Jev 到底新在哪里Jev 不是把现有模型做得更好而是同时重构了三件事——缺一不可。5.1 训练目标重构RLCD 替代 RLHFJev 使用RLCDReinforcement Learning for Calibrated Decisions面向校准决策的强化学习。RLCD 不关心回答像不像人话讨不讨人喜欢有没有礼貌它只关心一件事模型说70% 把握时是否在大量同类预测中真的有 70% 是对的。这使得概率信号本身变得可被软件信任——你的if (prob 0.9)阈值判断第一次有了统计学意义。5.2 模型架构重构并行采样替代自回归传统 LLM 必须逐 Token 自回归生成。即使只输出一个是/否也要走完整生成流程。Jev 使用非自回归的并行采样架构一次性并行输出所有判断结果不需要逐字生成这是 70~500ms 延迟和输出 Token 免费的物理基础5.3 输出契约重构类型安全传统 LLM 即使加了提示词约束也始终存在不听话的风险。Jev 只支持Noul/Choice/Score三种原语模型物理上无法输出定义之外的任何内容不会输出格式错误的 JSON不会突然开始解释不会脱轨代码可以直接消费结果零解析、零校验5.4 所以为什么以前没有因为在过去几年整个 AI 应用生态围绕生成式 LLM建立。所有工具链、成本模型、开发者习惯都默认智能 生成文本。在这个范式下用 LLM 做判断只是一种功能上的借用。Jev 的出现本质上是第一次有人系统地论证对于判断这一类特定任务需要一个专门设计的、以代码为消费者的传感器而不是一个以人类为消费者的对话引擎。六、一个常见的误解Jev 不是没有噪音而是噪音被校准这里要修正一个很容易被带偏的理解❌ “Jev 输出没有概率” —— 错概率是它的核心输出。❌ “Jev 没有噪音” —— 错它本质仍在输出概率。✅ “Jev 的概率被校准” —— 对。✅ “Jev 的概率可被软件信任” —— 对。❌ “Jev 只是训练方式不同” —— 不全面还涉及架构和输出契约。核心心智模型建议背下来传统 LLM 的概率是自信语气。Jev 的概率是校准信号。七、实战同一个工单路由场景三种写法以下代码为概念示意具体 SDK 以官方文档为准。7.1 传统 LLM提示词 解析 校验写过的都懂importjsonfromopenaiimportOpenAI clientOpenAI()defis_refund_request(text:str)-tuple[bool,float]:respclient.chat.completions.create(modelgpt-4o,messages[{role:system,content:你是一个判断器。只输出 JSON不要解释。},{role:user,content:f判断以下消息是否包含退款意图并给出 0-1 置信度\n{text}}],response_format{type:json_object},temperature0)datajson.loads(resp.choices[0].message.content)# 仍然需要校验格式是否正确概率是否校准模型是否在迎合提示词returnbool(data[is_refund]),float(data[confidence])7.2 编排一个判断子 Agent应用层封装底层没变fromtypingimportTypedDict,LiteralclassState(TypedDict):text:strdecision:Literal[退款,物流,财务]|Noneconfidence:float|Nonedefjudge_agent(state:State)-State:# 内部仍然调用一个通用 LLMresultcall_general_llm(prompt(从 退款/物流/财务 中选择一个输出 JSON含 confidencef{state[text]}))state[decision]result[choice]state[confidence]result[confidence]returnstate# 编排层条件路由ifstate[confidence]0.9:route_to(state[decision])else:route_to(人工)7.3 Jev 原生调用类型安全 校准概率代码直接消费import{Jev}fromtypesafe/jev;constjevnewJev({apiKey:process.env.JEV_API_KEY,});// 1. Noul是非判断constrefundawaitjev.noul({question:这条消息是否包含退款意图,context:message,});if(refund.valuetruerefund.probability0.9){awaitrouteTo(退款);}// 2. Choice选项判断constrouteawaitjev.choice({question:这条工单应路由到哪个部门,choices:[售后,物流,财务],context:ticket.text,});switch(route.value){case售后:awaitrouteTo(售后);break;case物流:awaitrouteTo(物流);break;case财务:awaitrouteTo(财务);break;}// 3. Score打分consturgencyawaitjev.score({question:紧急程度,min:1,max:5,context:ticket.text,});console.log(urgency.value,urgency.probability);7.4 在 Agent 路由里把 Jev 当原生节点用asyncfunctionhandleTicket(ticket:Ticket){// 并行发起多个判断互不阻塞const[isRefund,urgency]awaitPromise.all([jev.noul({question:这条工单是否包含退款意图,context:ticket.text,}),jev.score({question:紧急程度 1-5,min:1,max:5,context:ticket.text,}),]);if(isRefund.valueisRefund.probability0.85){returnrouteTo(退款,urgency.value);}constdeptawaitjev.choice({question:这条工单应路由到哪个部门,choices:[售后,物流,财务],context:ticket.text,});returnrouteTo(dept.value,urgency.value);}7.5 全环节对比环节传统 LLM 判断Jev输出自然语言 / JSON类型化概率决策解析json.loads 校验直接消费概率RLHF 副产品不可靠RLCD 校准速度自回归逐 Token并行采样成本输出 Token 计费输出 Token 免费风险格式漂移、幻觉自信概率偏差可度量八、什么时候用 Jev什么时候用 LLM / Agent两者不是替代关系是分工关系。适合 Jev 的任务封闭式判断、重复性高、需要概率可靠、消费者是代码工单分类、智能路由内容审核、违规判断是否退款、是否紧急、是否升级人工Agent 流程中的微决策、下一步动作选择、状态打分适合传统 LLM 的任务开放式生成、需要语言表达、消费者是人类创作、推理、解释、多步规划工具调用、生成代码、与人类对话推荐混合架构LLM负责生成、推理、解释、规划 Jev负责判断、路由、打分、审核 Agent 编排把 Jev 当作原生判断节点让会说话的模型去创造和推理让不会说话的 Jev 去高效判断和决策。九、速查表建议收藏术语含义JevSystem One Model专做判断题的 AI 模型System One人类快思考快速、直觉式决策Noul / Choice / ScoreJev 的是非 / 选择 / 打分三种判断原语RLHF基于人类反馈的强化学习优化人类偏好RLCD面向校准决策的强化学习优化概率校准模式丢弃RLHF 中为迎合偏好而牺牲概率诚实概率校准说 80% 就真的 80% 正确类型安全模型物理上无法输出定义外内容并行采样非自回归一次性输出判断结果十、写在最后Jev 特别的地方不是它能做判断——用 GPT-4o 加个 system prompt 也能做。而是它同时做到了训练目标RLCD 替代 RLHF把概率校准变成优化目标本身模型架构并行采样替代自回归带来 20~200 倍的速度和免费输出 Token输出契约类型安全替代自由文本让代码零成本直接消费定位跃迁把判断从应用层技巧下沉为模型层原生能力。所以不是以前大家都在迁就传统 LLM而是当 AI 的主要角色从辅助人类转向自动化决策时专门为判断设计的原生组件才第一次变得必要且可行。从辅助人类到自动化决策从功能借用到架构适配从人类消费者到代码消费者——这或许是 2025 年 AI 应用架构最重要的一个范式转变。Jev 是第一个把它做成独立品类的玩家但绝不会是最后一个。如果这篇文章帮你理清了一个模糊很久的问题欢迎点赞、收藏、关注评论区聊聊你在生产里用 LLM 做判断踩过哪些坑你觉得判断型模型会成为 Agent 架构的标准组件吗你所在团队会更倾向自研判别层还是直接接入这类专用模型