尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Cognition 发布 SWE-2 编码 Agent 模型:性能逼近 Fable 5.1,成本降 81% 却遭 benchmark 质疑

发布时间:2026/9/11 19:40:12

资讯中心
01
ARTICLE

Cognition 发布 SWE-2 编码 Agent 模型:性能逼近 Fable 5.1,成本降 81% 却遭 benchmark 质疑

Cognition 发布 SWE-2 编码 Agent 模型:性能逼近 Fable 5.1,成本降 81% 却遭 benchmark 质疑
Cognition 昨日发布 SWE-2 编码 Agent 模型由 Kimi K3 通过 RL 后训练而来。它在多项评测中表现出色成本大幅降低但在新基准测试中分数不佳引发社区对 benchmark 策略的讨论。模型性能表现SWE-2 在 FrontierCode 1.1 Main 上得分 50.0%距 Fable 5.1 仅差不到 1 个百分点比 GPT-5.6 Sol 高 2.5 分价格还比 Fable 5.1 便宜 64%。在 DeepSWE 1.1 上超 Fable 5.1 和 Grok 4.6略高于 GPT-5.6 SolTerminal-Bench 2.1 更是达 92.8%。新基准测试落差不过在新发布的 Terminal-Bench 4 上SWE-2 仅 27.3%远低于 Opus 5 和 Astra。这种新旧基准分数落差成了“benchmaxxing”讨论焦点。RL 训练方案亮点RL 训练方案是技术看点让训练任务覆盖所有推理努力级别奖励函数 R S − λₑC把 λₑ 设成基座模型在该努力级别的帕累托前沿斜率逻辑严谨。行为指标与成本优化行为指标上SWE-2 medium 平均每轮步数从 127 降到 53首次真实编辑中位步数从 48 降到 18成本降了 81%。社区争议与回应Hacker News 社区讨论集中在 benchmark 策略有人质疑融资估值也有人为其辩护。还有用户反馈使用摩擦Cognition 员工给出回复。编辑观点SWE-2 性能有亮点且成本降低但新基准测试表现不佳引争议。未来需平衡 benchmark 策略与模型实际应用才能在竞争中站稳脚跟。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。