尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

unlazy的研究基石:模型偷懒、过度思考与提前完成——7篇2025-2026论文与基准解读

发布时间:2026/9/28 21:09:14

资讯中心
01
ARTICLE

unlazy的研究基石:模型偷懒、过度思考与提前完成——7篇2025-2026论文与基准解读

unlazy的研究基石:模型偷懒、过度思考与提前完成——7篇2025-2026论文与基准解读
unlazy的研究基石模型偷懒、过度思考与提前完成——7篇2025-2026论文与基准解读【免费下载链接】unlazyAnti-laziness skill for AI agents. Core: the Depth Tree method, which splits a task N layers deep and gives every leaf the full time budget of the whole task, so effort multiplies with depth. Grounded in 2025-2026 research on model laziness, underthinking and premature completion.项目地址: https://gitcode.com/gh_mirrors/unl/unlazyAI 智能体AI agent在长任务中偷懒、过度思考、提前宣告完成是 2025-2026 年大模型研究反复验证的真实问题。unlazy 是一款专为 AI 智能体设计的反偷懒技能skill它用 Depth Tree深度树分解任务、用可运行验收门禁gates证明真的做完了背后正是对 7 篇 2025-2026 年论文与基准的系统解读。本文带你一次看懂 unlazy 的研究基石以及这些结论如何落到具体设计里。为什么 AI 需要被监督三大失败模式 如果你用 AI 智能体做过大型重构或全量审计大概见过这三种场景失败模式典型表现对应研究概念模型偷懒Laziness多部分提示词只完成一半悄悄截断Underthinking / 部分服从过度思考Overthinking在简单步骤上反复空转消耗大量算力测试时计算分配失当提前完成Premature Completion自信地报告done实则留有占位符过早停止探索unlazy 的立场在 README.md 的 Research basis 一节写得很清楚研究支持的是失败模式而不是用了 unlazy 就一定提升多少。这种克制恰恰是它可信的原因。7 篇论文与基准逐一解读 以下按时间顺序梳理 README.md 中 Sources, newest first 引用的核心来源外部原文请点击项目 README 中的来源列表查阅。1️⃣ Quantifying Laziness2025 年 12 月偷懒可以被量化这篇研究首次把懒变成可测量的指标即使给出详细的、多部分的提示词被测模型仍出现部分服从和过早截断。也就是说任务写得越细只做了一部分还觉得完成了的风险越隐蔽。这正是 unlazy 要求先写验收清单再动手的直接依据——把每个可独立省略的结果变成一条可检查的门禁。2️⃣ Thoughts Are All Over the Place2025 年 2 月o1 类模型也会少想很多人以为推理模型只会想太多。这篇研究证明恰恰相反o1 风格的 LLM 在探索任务上会过早停止思考预算的分配并不稳定。它提醒我们既需要防想不够也需要防想过头两者是同一枚硬币的两面。3️⃣ s1: Simple Test-Time Scaling2025 年 3 月一个Wait的预算强制s1 提出了著名的预算强制budget forcing技巧当模型试图停下时反复追加Wait让它继续推理从而加长思考。注意论文边界这不是主张一个 token 就能改善工作而是证明思考长度可以被外部机制约束。unlazy 的启发在于——约束应该来自流程而不是祈祷模型自觉多想想。4️⃣ OptimalThinkingBench2025 年 10 月同时量测过度与不足这个基准把思考太多和思考太少放进同一个评价框架证明思考量与任务难度、模型能力之间不存在一刀切的最优值。对工程实践的启示思考强度应该按杠杆点分配——unlazy 在 references/token-economy.md 里把这写成了规则强推理留给设计、集成、验证机械性叶子用低成本的执行。5️⃣ When More Thinking Hurts2026 年 4 月过度思考的陷阱研究证实在测试时计算扩展test-time compute scaling中更多的思考可能适得其反。盲目堆推理预算不仅贵还会把模型带偏。这解释了 unlazy 为什么把验证从模型推理中搬出去用命令、脚本、退出码做确定性检查比让模型反复自我说服更便宜也更诚实。6️⃣ SlopCodeBench2026 年 5 月没有智能体能从头到尾解完问题这是最扎心的一条基准结论被测的没有任何一个智能体能端到端完整解决问题表现最好的智能体也只通过了14.8%的检查点。而且论文特别强调检查点通过 ≠ 任务完成。unlazy 的完成层级叶子→分支→根正是把局部完成和集成完成严格分开references/orchestration.md 要求自底向上逐层再验证任何一层缺口都不算完成。7️⃣ METR Time Horizon 1.12026 年 1 月任务长度天花板仍在METR 的 Time Horizon 1.1 报告智能体能可靠完成的任务时长P50 翻倍时间全区间拟合为 196.5 天2023 年后的拟合为 130.8 天。文档特意提醒短的那个数字不能被描述为全区间估计。对使用者的含义很直白——单个上下文里的注意力总会耗尽所以才需要 references/method.md 中的 Depth Tree把大任务切到每个叶子都是完整可交付物的粒度而不是假装一个会话能装下一切。 附加阅读COLM 2026 论文 Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet 还发现闭卷知识密集任务在增加测试时计算后幻觉反而更多——再验证一次多算不等于多对。从论文到设计unlazy 的三个核心机制 ⚙️研究给出的是病症unlazy 给出的是处方两者对应关系非常清晰研究结论unlazy 机制相关模块多部分提示词会被部分服从先写 GATES.md 验收清单每个门禁只写一个可观察结果templates/gates-leaf.md检查点通过 ≠ 任务完成深度树逐层再验证--reverify重跑所有已勾选门禁scripts/gate-check.mjs思考预算要花在杠杆点四遍工作法实现→专家重读→缺陷猎杀→低成本低成本打磨references/method.md智能体会自信地提前完成可选 Stop 钩子门禁未满足时阻止智能体收工scripts/stop-hook.mjs核心流程一句话概括先写门禁 → 审查并批准检查命令 → 执行并留证据 → 回报前重新测量所有数字。完整指令见 SKILL.md。对研究证据保持诚实unlazy 不做什么 这一点值得单独强调。早期 README 曾引用维护者跑过的6 次对比实验的输出 token 比例等数字但仓库不包含复现这些数字所需的原始提示词、转录和日志。因此在 research/validation-protocol.md 中这些数字被明确降级为设计历史并给出了一套可复现重跑的最小协议预注册条件、隔离每次运行、操作化定义指标、双盲评审、发布计算脚本、限定结论范围。换句话说unlazy 用别人的基准证明问题真实存在却拒绝用不可复现的数据吹嘘自己的效果。这种负面结果也如实记录的态度是判断一个开源项目是否值得长期依赖的重要信号。快速上手3 分钟体验 unlazy 把仓库克隆到技能目录Claude Code 为~/.claude/skills/unlazyCodex CLI 为~/.codex/skills/unlazy或使用 skills CLInpx skills add Leonxlnx/unlazy用一个显式触发词发起任务例如/unlazy tree 5 refactor the payment module and verify every migration path智能体会先基于 templates/gates-leaf.md 生成GATES.md再用node scripts/gate-check.mjs --status GATES.md让你在不执行任何命令的情况下先审查所有检查满意后显式批准并运行完成报告只包含有证据支持的结论小结模型偷懒真实存在Quantifying Laziness 证明详细提示词仍会被部分服从思考要花在刀刃上OptimalThinkingBench 与 When More Thinking Hurts 共同说明思考强度需按任务分配完成必须可验证SlopCodeBench 显示检查点通过 ≠ 任务完成unlazy 用分层再验证补齐这一环证据要可复现research/validation-protocol.md 展示了如何诚实地对待自己的实验数据如果你受够了AI 说做完了其实没做完这 7 篇论文解释了为什么会这样而 unlazy 给出了一个可落地的答案。【免费下载链接】unlazyAnti-laziness skill for AI agents. Core: the Depth Tree method, which splits a task N layers deep and gives every leaf the full time budget of the whole task, so effort multiplies with depth. Grounded in 2025-2026 research on model laziness, underthinking and premature completion.项目地址: https://gitcode.com/gh_mirrors/unl/unlazy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。