尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

AI 不写字之后——Jev 生态大爆发与决策模型的范式转移

发布时间:2026/9/24 2:27:40

资讯中心
01
ARTICLE

AI 不写字之后——Jev 生态大爆发与决策模型的范式转移

AI 不写字之后——Jev 生态大爆发与决策模型的范式转移
AI 不写字之后——Jev 生态大爆发与决策模型的范式转移读前必读一个用 AI 实现 JavaScriptpadStart()字符串填充的 GitHub 项目在社区拿下 60 分并引发激烈争论——如果连字符对齐都做不好AI 的通用智能声称是否可信这个看似荒诞的切面映射出一个正在爆发的真问题当整个行业都在用 LLM 生成文本时一群开发者在反向而行——让 AI「不写字」只输出决策。33ms 单次前向传播校准概率可以用作生产分支条件成本只有 LLM 的 1/50。这不是小修小补这是一场关于「LLM 该不该做所有事」的架构革命。读完你能带走什么理解为什么所有 LLM 的置信度本质上不可信——以及什么数学框架可以真正替代它掌握「非自回归决策」的完整技术栈RLCD 训练、校准门控、决策原语设计获得一份 Jev/Laya/Kev/Candle/OpenJev 五军对决的决策指南——每个工具的边界和适用场景学会在你的 Agent 系统中落地决策分流用最低成本实现最高可靠性适合读者Agent 系统开发者、架构师、技术决策者、关注 AI 工程效率的工程师。预计阅读 18 分钟。一、一个 leftpad 引发的血色争议2026 年 9 月GitHub 上一个名为jev-leftpad的项目悄悄爬上了 Hacker News 热榜——用 TypeSafe AI 的 Jev 决策模型来做 JavaScript 的padStart()函数。也就是把一个字符串填充到指定长度。社区炸了。争论的迅速分成了三派。反对派认为这是一个教科书级的高射炮打蚊子调用一个 AI 模型来做 N 行代码就能搞定的字符操作成本、延迟、失败率都是工程倒退。支持派的反驳超出了代码本身——他们说这不是关于 leftpad而是关于AI 应用的诚实评估如果一个号称前沿智能的模型连字符对齐都无法可靠完成那我们对它的通用智能声称是否该更冷静工程派则从中提炼出了一个真问题在真实生产系统中高频低价值任务过滤、分类、路由、评分到底该用什么驱动这场争论的核心其实指向一个被长期忽视的架构错位**我们用 System 2 的工具在执行 System 1 的任务。**而 Jev 背后的技术路线正是试图纠正这个错位。二、LLM 置信度一个存在性的数学骗局要理解 Jev 路线的价值必须理解当前 LLM 在决策任务上的根本缺陷。2.1 Token 预测≠答案正确率当你问一个 LLM这封邮件是不是钓鱼攻击它回答confidence: 0.97。这个 0.97 意味着什么几乎什么都不是。原因在于自回归 LLM 的工作原理。模型生成0.97这三个 token是基于上下文 token 的条件概率预测。这个预测不是针对答案正确性的概率而是针对token 序列的概率同一个正确答案可以通过完全不同的 token 序列表达而这些不同序列的概率可能天差地别更关键的是Temperature sampling 进一步破坏了 token 概率与正确率的对应关系。当 Temperature0.7 时高 token 概率不代表高多样性场景下的稳定性。你拿到的 0.97充其量是模型听起来很自信的语义而非统计学意义上的正确概率。2.2 过度自信的系统性偏差大量实证研究揭示了一个不安的事实自回归 LLM 在完全不确定时仍然会输出 0.9 的置信度。这种过度自信不是 bug而是 cross-entropy 训练目标的结构性产物。模型的训练目标是让正确答案的 logit 最大化。为了实现这一点logit 被推向无界增长——softmax 后的概率趋向 1.0。结果是模型即使在面对无关输入或无意义问题时仍然给出高置信度预测。这意味着在生产代码中写置信度 0.85 转人工审核这样的逻辑会因为模型从不输出低于 0.85 的值而归零——不是模型多准而是门控逻辑形同虚设。2.3 校准的数学含义什么是有意义的置信度核心标准只有一个ECEExpected Calibration Error。一个完美校准的模型在输出 0.8 置信度的所有预测中实际正确率必须恰好是 80%。如果实际只有 60%那这 0.8 就是虚假的——相差的 0.2 就是校准误差。ECE 的计算方式将置信度分为 N 个桶每个桶计算 |平均置信度 - 实际正确率|按样本数加权平均ECE∑m1M∣Bm∣n∣acc(Bm)−conf(Bm)∣ECE \sum_{m1}^{M} \frac{|B_m|}{n} |acc(B_m) - conf(B_m)|ECEm1∑M​n∣Bm​∣​∣acc(Bm​)−conf(Bm​)∣当前最好的自回归 LLM 在决策任务上的 ECE 通常在 0.15-0.35 之间——这意味着它们的置信度是一个不可靠的工程参数。而基于 RLCD 训练的 System One 模型ECE 可以压到 0.08 以下。0.08 意味着当模型说 80% 确定时你确实可以信任这个 80%。三、System 1 决策引擎从 Kahneman 的心理学到 Almeida 的工程3.1 双系统理论的 AI 映射Kahneman 在《思考快与慢》中的框架被 TypeSafe AI 的创始人 Diogo Almeida 移植到了模型架构层面系统人类认知特征AI 映射典型操作System 1快速/自动/无意识/情绪化单次前向传播决策分类/路由/评分/审核/分支System 2缓慢/刻意/有意识/逻辑化自回归文本生成推理/创作/对话/代码生成Jev 的核心论断是当前 AI 用 System 2 的模型自回归 LLM在执行 System 1 的任务快速结构化决策这是系统性的错配。3.2 非自回归决策的本质System One Models 放弃自回归文本生成转而采用并行采样Parallel Sampling传统 LLM逐 token 生成每个 token 依赖前一个。一个包含 N 个 token 的输出需要 N 次前向传播。延迟随输出长度线性增长。System One Models单次前向传播直接输出结构化概率分布。无论输出复杂度如何延迟恒定通常在 30-500ms。这个取舍的核心是放弃了生成任意文本的灵活性换取了在已知输出空间内做精确概率预测的能力。对于输出空间可枚举的任务比如从 5 个选项中选一个、给出 0-1 的概率值、确定一个 1-5 的评分这种取舍极度划算——你不需要一个能写小说的模型来完成这封邮件该分到哪个队列的任务。3.3 RLCD让概率不再说谎RLCD Reinforcement Learning for Calibrated Decisions强化学习校准决策这是整条技术路线的核心差异化因素。普通的 supervised fine-tuningSFT使用 cross-entropy loss只训练答对。RLCD 通过 PPO 强化学习直接训练概率值的诚实度。RLCD 的训练目标可以形式化为π∗arg⁡max⁡πE[Rcal(y,p^,y^)]\pi^* \arg\max_{\pi} \mathbb{E}[R_{cal}(y, \hat{p}, \hat{y})]π∗argπmax​E[Rcal​(y,p^​,y^​)]其中RcalR_{cal}Rcal​是一个校准感知奖励当预测概率p^\hat{p}p^​与实际正确率∣1[y^y]−p^∣|\mathbb{1}[\hat{y}y] - \hat{p}|∣1[y^​y]−p^​∣对齐时给出高分。传统 RLHFReinforcement Learning from Human Feedback优化的是人类偏好评分RLVRRL with Verifiable Rewards优化的是可验证正确性而 RLCD 优化的是概率与正确率的对齐程度——这是三种完全不同的奖励信号。具体来说RLCD 的训练奖励公式采用 Brier Score 的变体Rcal−∑k1K(pk−1[ky])2R_{cal} -\sum_{k1}^{K} (p_k - \mathbb{1}[ky])^2Rcal​−k1∑K​(pk​−1[ky])2其中pkp_kpk​是模型对第 k 个类别的预测概率1[ky]\mathbb{1}[ky]1[ky]是实际正确类别的 one-hot。Brier Score 的最优解正是完美校准——当pkP(correctk)p_k P(\text{correct}k)pk​P(correctk)时取得。这意味着 RLCD 的模型天然具有校准特性你拿它输出的任何概率值都可以直接在生产代码中做分支判断。四、RLCD 训练管线三阶段从随机到校准理解 RLCD 的训练管线是理解整条技术路线工程价值的关键。这不是理论推演而是一个经过社区实证可复现的完整工程流程。4.1 Stage 1基础能力预训练目标让模型学会答对。使用 supervised fine-tuningSFT cross-entropy loss 作为基础训练让模型在决策任务上的准确率达到可用水平通常 60-75%。这一步的本质是建立模型的逻辑能力——让它在选择题中能识别出正确答案。但此时模型的置信度仍然是虚假的它可能对正确答案给出 0.6 的置信度对错误答案给出 0.9 的置信度。技术要点使用双向编码器如 ModernBERT-large / mmBERT-base而非 decoder-only 架构。双向注意力天然适合从完整输入中判断结构化输出的决策任务避免了 decoder-only 架构对输出长度的依赖。4.2 Stage 2RLCD 校准微调目标让模型的概率值与正确率对齐。这是核心差异化的训练阶段使用 PPOProximal Policy Optimization在连续概率空间中直接优化校准质量采样对每个输入模型产生 K 个候选概率分布奖励计算使用 Brier Score 计算每个候选的校准奖励策略更新PPO 裁剪目标函数更新策略基线减除使用价值函数估计器降低方差关键工程发现PPO 的 clip 范围ϵ0.2\epsilon0.2ϵ0.2、学习率η10−6\eta10^{-6}η10−6、mini-batch 大小 32-64 是经过大量实验验证的稳定配置。经过这一阶段后模型的 ECE 通常从 0.2-0.3 降到 0.08-0.12输出的概率值开始具有工程意义。4.3 Stage 3温度缩放后处理目标进一步消除系统性偏差。温度缩放Temperature Scaling是最简洁有效的校准后处理方法在 logits 后加一个全局温度参数 Tpkcalibratedezk/T∑jezj/Tp_k^{calibrated} \frac{e^{z_k/T}}{\sum_j e^{z_j/T}}pkcalibrated​∑j​ezj​/Tezk​/T​T 1 时概率分布更平坦降低过度自信T 1 时更尖锐。通过在一组 held-out 验证集上优化 T通常 T ∈ [0.5, 2.0]可以将 ECE 再降 10-30%。温度缩放的优势在于不改变模型的预测排序只调整概率的绝对值——这意味着准确率不变同时校准质量提升。经过三阶段训练后一个 System One 决策模型具备了60-75% 的基础准确率Stage 1ECE 0.10 的校准质量Stage 2消除系统性偏差的概率值Stage 3这套管线已被 Laya 项目的训练代码完全开源复现GitHub: NandhaKishorM/laya/finetune。五、五军对决决策模型的生态大爆发围绕 TypeSafe AI 的 System One Models 宣言一个完整的生态在 2026 年 9 月爆发。这不是一个产品的发布而是一个技术范式的分叉点。5.1 闭源先锋TypeSafe Jev创始人Diogo AlmeidaOpenAI ChatGPT 共同发明者模式按量计费 API$0.042/M input tokens输出免费性能官方宣称 70-150ms端到端响应含排队第三方观测 P50 约 236-276ms校准ECE0.246Laya 的 3 倍差准确率typed-decisions 基线 0.727定位高端商业用户愿意为服务稳定性付费不需要本地部署局限无技术论文、无开放权重、无本地部署选项5.2 开源主力Laya创始人Nandakishor MukkunnothConvAI Innovations模式Apache 2.0 完全开源自托管部署性能32.8ms 单 GPU 推理批量 10 问题仅 7.2ms/问题比 Jev 快 7.8 倍校准ECE0.0813 倍优于 Jev准确率typed-decisions 0.766、AG News 0.950定位自托管高吞吐100语言适合成本敏感的高频 API 服务核心优势前身 SalesRLAgent 论文arXiv:2503.23303于 2025 年 3 月发表比 Jev 发布早整整 18 个月。所有模型权重、训练数据、评估工具均已开放。5.3 通用微调方案Kev核心创新证明 RLCD 方法论可移植到任意基座模型底座Qwen3.5 微调定位边缘设备可部署的小尺寸决策家族意义决策模型从专用架构产品变为通用微调管线——任何团队都可以在自己的数据上训练校准决策模型5.4 本地 Rust 实现Laya Candle技术栈基于 Rust 机器学习框架 Candle定位纯本地、零依赖、支持 WASM/边缘设备意义决策模型进入浏览器和嵌入式场景无需 GPU5.5 浏览器 Agent 层OpenJev jev-ultrafastOpenJev社区为绕开 Jev waitlist 创建的免费托管实例完全 API 兼容jev-ultrafast浏览器 Agent 的动态索引动作空间——将页面数百个可交互元素按功能语义聚类为复合动作有效动作空间压缩 10 倍以上意义System One 从后端决策引擎延展到前端智能体生态竞争洞察五方竞争揭示了一个关键趋势决策模型不再是「单一产品的竞争」而是「完整技术栈」的竞争。一个团队如果要在生产系统中落地 System One 决策需要的不只是一个模型而是训练框架 评估工具 推理服务 部署优化 领域适配——Laya 的全开源栈覆盖了完整链路而 Jev 目前只覆盖了 API 层。六、行业格局OpenAI 的 fast-follow 信号社区讨论中有一个被低估的信号「OpenAI is well positioned to fast-follow Jev」。这背后的逻辑清晰而有力OpenAI 已有低延迟模型路径GPT-6 系列的多模态优化中已经包含了低时延推理作为明确目标方向技术储备充足PPO/RLHF 团队在 OpenAI 内部是最成熟的迁移到 RLCD 的成本远小于外界预期市场定位更清晰OpenAI 可以将 System One 决策作为ChatGPT Enterprise 的实时分类/路由模块打包销售如果 OpenAI 在 2026 年 Q4 发布对标产品对 TypeSafe API 商业模式的冲击将是结构性的。但这也验证了整个方向的正确性——当 OpenAI 决定 fast-follow 一个方向时这个方向已经从小众学术探索变成了行业共识。对中国开发者的意义System One 决策引擎对中国 AI 生态有特殊价值DeepSeek/Qwen/GLM 的调用成本正在下降但延迟和置信度问题并未根本解决RLCD 的训练方法论PPO Brier Score 奖励可以用任何中文基座模型复现Laya 提供了 100 语言支持含中文可以直接用于中文内容审核、客服路由等高频场景校准概率的概念一旦被社区接受未校准的 LLM 置信度将逐步成为工程反模式七、生产落地ROI 与真实部署模式决策模型从社区热度到生产落地之间隔着一道工程现实主义的检验。以下是从真实信号中提炼的部署模式。7.1 模式一Decision Gating决策门控场景客服工单自动路由fromlayaimportRouterfromopenaiimportOpenAI routerRouter(preloadTrue)openaiOpenAI()# Phase 1: Laya 快速决策33msdecisionrouter.predict(ticket,{queue:{type:choice,criteria:{...}}})# Phase 2: 低置信度 → LLM 兜底ifdecision.confidence0.85:openai.chat.completions.create(...)# 仅~3%流量进入LLM经济账示意性计算基于公开定价估算100 万次路由决策纯 LLM 方案约 $50-200Laya 方案约 $0.76-4.2假设 97% 的请求由 Laya 即时处理3% 低置信度请求转 LLM总体成本节省约 85-95%P99 延迟从数百 ms 降到 72ms 量级7.2 模式二Multi-LLM Judge Replacement多LLM评估替代场景AI 输出质量评估、安全护栏、内容审核传统方案中LLM-as-Judge的主观性、不一致性和高成本一直是痛点同一输入不同模型给出不同评分同一模型不同次采样给出不同评分评估成本在生产总成本中占相当比例高频场景下尤为显著解决方案类型化 Jev 决策树jevals 项目方案将评估逻辑表达为可组合的决策节点可跨模型复用不需要每次重新调用 LLM评估结果可缓存和微分A/B 评估一致性提升7.3 模式三Agentic Memory ControlAgent 记忆控制Jev-Mem 项目展示了 System One 控制策略在 Agent 记忆管理中的应用System One实时每轮对话结束时即时决策——保留完整上下文、压缩为摘要、或丢弃。决策基于任务相关性和信息新鲜度。System Two空闲非高峰时段执行实体提取、关系建模、知识图谱更新。这个双轨架构解决了 Agent 开发中最被低估的工程问题上下文窗口不是免费的。对大多数 Agent 场景System One 控制可以显著降低有效上下文消耗减少不必要的 token 占用和推理成本。7.4 模式四Real-Time Safety Guard实时安全护栏在安全防护场景中决策模型、传统 LLM 和规则引擎形成了一个互补的防御层次护栏维度决策模型(Jev/Laya)传统LLM规则引擎延迟30-150ms500-2000ms5ms成本($/M tokens)$0.042$3-15$0覆盖未知攻击模式✅ 泛化能力✅ 理解能力❌ 仅已知模式校准门控能力✅ 概率可直接路由❌ 置信度不可靠N/A关键洞察决策模型的核心护栏价值不是比 LLM 更准而是在可接受的成本下覆盖足够广的攻击模式——让绝大多数攻击在 30ms 内被拦截只在极可疑场景中调 LLM 做深度分析。校准概率在这里起到了关键的路由作用——它是门控逻辑的可信基础。八、反思真实边界的冷静判断在生态大爆发中保持清醒需要理解 System One 决策引擎的本质局限。8.1 什么不能做不能生成文本Jev 不输出自然语言。如果你需要模型解释为什么分类为A需要额外调用 LLM。不能处理未预定义空间决策空间必须在 Schema 中预先定义。开域问答、创意写作、多步骤推理都不适合。准确率不是100%在 typed-decisions 任务上Laya 准确率 76.6%Jev 仅 72.7%——这意味着每 4-5 次决策就有 1 次错误必须有兜底机制。8.2 社区争议的真实核心I really don’t understand Jev hype这个 75.55 分的热帖核心论点是System One/Second 框架来自 Kahneman 2011 年的认知心理学非 TypeSafe 的创新。非自回归决策模型在学术界早有论文2025 年 3 月就有开源实现。Jev 的贡献在于工程化产品化不在于科学突破。这个论点值得认真对待。科学突破 ≠ 工程价值。Kubernetes 重混了 Google 的 Borg 思想但它的产业意义不因此减少。Jev 的真正贡献是将 RLCD 训练方法论标准化为一个可复现的流程证明了校准概率在商业场景中的经济价值引发了社区对LLM ≠ 万能的工程反思倒逼开源社区快速产出更优的开放替代方案8.3 不是替代是分工最终System One 模型不会替代 LLM。它们是在同一个系统中分工合作Jev/Laya 承担高频/低延迟/高容量的分类路由打分系统95%的决策量LLM 承担低频/高复杂度/需要深度的推理生成系统5%的决策量校准概率作为两者之间的桥梁——当 System One 不确定时决定是否触发 LLM不写字的AI不是在贬低 LLM而是在说让对的模型做对的事。九、总结与下一步核心洞察LLM 的置信度本质上不可信——token 预测数 ≠ 答案正确率ECE0.15-0.35 意味着置信度 0.85 转人工的门控逻辑形同虚设。RLCD 训练框架给出了工程解——PPO Brier Score 奖励 温度缩放三阶段管线将 ECE 压到 0.08使概率值真正可用作生产分支条件。生态五军对决已成型——Jev(闭源API)、Laya(全开源)、Kev(通用微调)、Candle(Rust本地)、OpenJev(浏览器Agent)各自覆盖不同工程需求。分工范式确立——System One 做高频廉价的决策95%量System Two 做低频深度的推理5%量校准概率是两者间的路由开关。资源速查表资源链接Jev 官方typesafe.aiLaya 源码github.com/NandhaKishorM/layaLaya Demohuggingface.co/spaces/convaiinnovations/laya-demoSalesRLAgent 论文arxiv.org/abs/2503.23303Schema Decisions 论文arxiv.org/abs/2510.01237RLCD 训练 NotebookKaggle 2xT4 全流程
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。