尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

SWE-bench:从零到首次出结果的实操手册

发布时间:2026/9/26 10:06:35

资讯中心
01
ARTICLE

SWE-bench:从零到首次出结果的实操手册

SWE-bench:从零到首次出结果的实操手册
SWE-bench从零到首次出结果的实操手册【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-benchSWE-bench 是让大语言模型修复真实 GitHub issue 的评测基准。本文带你从环境安装到跑通一次完整评测读懂最终报告里的关键数字。快速验证跑通最小案例装好 Docker 后克隆项目并以开发模式安装git clone https://gitcode.com/GitHub_Trending/sw/SWE-bench cd SWE-bench pip install -e .用单个实例的参考补丁gold patch做自检。它不需要模型预测专门用来确认整条评测链路是通的swebench eval lite --gold -i sympy__sympy-20590 --run-id validate-gold跑完会打印类似输出Instances resolved: 1即代表这个任务被参考补丁成功修复Total instances: 1 Instances submitted: 1 Instances completed: 1 Instances resolved: 1 Report written to gold.validate-gold.json拆解单个实例是怎么被评测的是什么。一个任务实例对应一个 GitHub issue输入是仓库的base commit加上 issue 描述目标是产出一个能改 bug、让测试通过的model_patch。怎么工作。每个实例在 Docker 容器里走三步按版本说明在base commit处安装仓库、搭好环境依次打上测试补丁和预测补丁执行仓库的测试脚本解析测试日志逐条判定通过与否你该关注什么。任何一步失败该实例得分都是 0。所以一次没通过不一定说明补丁写错了补丁打不上、环境崩溃同样计 0。配置参数并跑起完整评测先准备预测文件。评测命令读的是 JSONL每行一个 JSON含三个字段{instance_id: sympy__sympy-20590, model_name_or_path: gpt-4, model_patch: diff --git a/... b/...}然后发起评测参数按你的实际情况增减swebench eval lite -p preds.jsonl --run-id my-run -j 8 # -j 按 CPU 核心数调整建议小于 min(0.75*核心数, 24)逐个参数说明-p预测文件路径必须是指定的 JSONL 格式数据集参数lite换成full、verified或 HuggingFace id 可评其他集--run-id命名日志目录结果按run_id加实例 id 缓存-i只评指定的几个实例适合反复调试--modal加了这个就把评测交给云端 Modal 跑改完怎么确认看logs/run_evaluation/my-run/下是否按实例生成了子目录目录里有report.json说明该实例跑完并出了结果。读懂 resolution rate一次运行产出两处东西当前目录或--report-dir指定处的汇总文件model.run_id.json以及每个实例的日志目录logs/run_evaluation/run_id/model/instance_id/里面有report.json、test_output.txt、run_instance.log。关键字段字段含义Total instances数据集任务总数Instances submitted你提交的预测数Instances completed产出报告的实例数Instances resolved补丁修复成功的实例数Instances with errors无法评分的实例数代表成功的是Instances resolved。resolved unresolved才是真正被评分的数量errors 是另外一类跑不出结果的实例。避开常见卡点现象换了补丁重跑结果不变 →原因结果按run_id加实例 id 缓存 →解法换个--run-id再跑现象Instances with errors大于 0 →原因补丁没打上、容器没起来或超时 →解法打开对应实例的run_instance.log看具体原因现象磁盘空间告急 →原因镜像约需 120GB 磁盘 →解法加--cache_level base降低存储占用现象ARM 机器上镜像构建失败 →原因默认拉取 x86 预构建镜像 →解法加--task-repo指向本地任务仓库本地构建接下来往哪深入完整评测指南docs/guides/evaluation.md各数据集怎么选docs/guides/datasets.md评测入口源码swebench/harness/run_evaluation.py【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。