尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

ARC-AGI-3争议解析:从基准测试到AI泛化能力评估

发布时间:2026/9/8 19:09:20

资讯中心
01
ARTICLE

ARC-AGI-3争议解析:从基准测试到AI泛化能力评估

ARC-AGI-3争议解析:从基准测试到AI泛化能力评估
最近AI圈最热闹的话题之一就是François Chollet回应ARC-AGI-3的校准争议。作为一个长期关注AGI评估和模型评测的从业者我想认真聊聊这件事ARC-AGI-3到底是什么争议的焦点在哪以及“AI六个月内从1%升至100%”这个说法该怎么理解。如果你也在跑各种基准测试或者正在思考大模型的泛化边界这篇内容可以帮你还原这次争议的技术底色。不管你是算法工程师、AI产品经理还是单纯关心AGI进度的爱好者这篇文章都会有一定参考价值。1. ARC-AGI-3 争议的来龙去脉1.1 ARC-AGI 不是聊天机器人考试而是“格子游戏”ARC-AGI 的全称是 Abstraction and Reasoning Corpus也就是抽象推理语料库。这个基准不像我们熟悉的 MMLU、GPQA 那样考百科知识也不像 HumanEval 那样只考代码题。它的核心形态是一组“输入输出对”画面是一个或者一组彩色的小网格比如 3x3、9x9格子里面有不同的颜色块。测试者需要从几个示例中推演出隐藏规则然后把它应用到新的输入网格上生成正确的输出网格。举个例子训练示例可能是“所有红色方块向右平移一格”“蓝色图形顺时针旋转 90 度”“颜色数量决定叠加方式”。这些规则人类很容易理解大多数任务成年人只看一遍示例就能做对。但对机器学习模型来说每个任务只给 3 到 5 组示例没有大语料没有预训练机会模型必须当场“学会”并处理新样本。这正是 Chollet 希望考量的东西系统能不能像人一样从少量样例中进行高效泛化而不是背下海量知识再套模板。我见过很多第一次接触 ARC-AGI 的人第一反应是“这不就是小学奥数找规律吗”。这个比喻很贴切因为 ARC-AGI 的难点恰恰在于“找规律”是开放式的可能的规律有无穷多种但正确规则只有一个。传统监督学习需要大量同分布数据而 ARC 的任务数量有限每个任务又是独立规则模型很难用“记忆”混过去。这也是 ARC 系列到现在依然有讨论价值的原因。1.2 从 ARC-AGI-1 到 ARC-AGI-3难度为什么越来越大最早的 ARC-AGI-1 在 2019 年发布当时很多系统只能做到 20% 左右的正确率人类对照组的正确率平均在 80% 到 90% 以上。后来陆续有团队把分数拉高部分原因是模型用了“程序合成”方案把每个格子任务转换成一段代码搜索在小规模的规则空间里枚举可能变换。这种思路有效但离“通用泛化”还很远因为它并没有真正学会不同任务之间的抽象共性。于是 Chollet 团队持续推进版本迭代。ARC-AGI-2 在 2025 年年初发布难度比第一代高了很多很多第一代的高分模型直接跌回个位数正确率。ARC-AGI-3 则是这个系列的最新一代它在任务设计上进一步削减了“可复用模板”的空间训练集和测试集的任务来源更分散每条任务都经过人工筛选和校准确保人类能轻松解决但机器的常见策略会失效。这个“难”是刻意设计出来的。如果一套基准测试所有模型都能靠数据增强、预训练堆料解决那它就测不出泛化能力只能测出算力和钱。ARC 系列希望保持“人类优势区”的任务结构让模型必须学会抽象归纳才能拿到高分。所以 ARC-AGI-3 的分数曲线某种意义上比 GLM、GPT 这类模型的榜单分数更能说明“机器离人类思维还有多远”。1.3 “六个月内从1%升至100%”为什么像天方夜谭这次争议的直接导火索是有人公开了一组测试结果某个 AI 系统在 ARC-AGI-3 上的准确率在半年内从不到 1% 拉升到了 100%。如果这个数据真实意味着在很短的时间里AI 的抽象推理能力发生了“质变”从基本不会做题变成所有题目全对。社区第一反应基本都是这不可能。你让一个学生半年内从数学不及格冲到满分不是没有但要么是学生突然开窍要么是卷子泄了。放在 AI 评测上大家自然怀疑“卷子泄了”测试集是不是提前混进训练数据了评估脚本是不是有 bug计分逻辑是不是写反了甚至有人开始猜是不是把标准答案写进 prompt 里了。François Chollet 的公开回应是校准无误。他没有说“这个成绩代表 AGI 已经到来”而是强调 ARC-AGI-3 的这套评估流程本身没有问题分数是真实计算出来的。这个回应其实比“我们实现了 AGI”温和得多但依然没法立刻平息争议。因为公众想看的是“AI 是不是真的变聪明了”而校准只能说明“分没算错”。正因为如此我觉得有必要把“校准”这件事单独拿出来拆一拆校准到底校准了什么它能不能排除所有作假路径以及我们该怎么理解“从1%到100%”这种极端曲线。2. “校准无误”到底校准了什么2.1 把基准测试当成一台秤校准就是排除系统误差“校准”这个词在不同领域含义不完全一样。在仪器领域比如我们之前聊过的 HDR 显示器校准是说把屏幕亮度、色温调回标准值让显示出你想要的色彩。在机器学习里概率校准通常指模型输出的置信度是否和真实正确率一致。而这里说 ARC-AGI-3 校准无误可以理解成“这台秤本身没有系统性偏差”官方评估脚本对每个任务读入正确输出比对模型预测按统一规则计分没有因为模型身份不同而改变标准。这意味着什么意味着如果某个系统真在 ARC-AGI-3 上拿到 100%那它不是靠评估脚本放水也不是因为正确答案文件被错误读取成了预期输出。从流程层面看这套分数可以复现。但这里有一个容易被忽略的点校准无误只等于“分没算错”不等于“这个系统确实推理得出这些答案”。如果你跑分的时候偷偷给模型看了答案那分数也能算出来但100%没有意义。Chollet 说“校准无误”更多是在回应“官方卷子是不是印错了”的质疑而不是在回应“考生是不是作弊了”的质疑。我在实际评测模型时也经常遇到这种混淆。团队里有人报告了一个超高分第一反应都以为是代码 bug结果查了半天发现代码没问题进一步排查才发现是有人把测试集的 label 写进了 few-shot 示例里。所以“分数看起来合理”和“分数来源干净”是两件完全不同的事。2.2 校准不背锅的另一种可能测试集污染与隐藏工具那么如果校准没问题能不能排除所有干扰答案是不能。因为 ARC-AGI-3 的评测设置里还有很多“灰色地带”。第一个是测试集污染。虽然官方基准一般会强调 ARC-AGI-3 的测试集是私有的但模型可能在预训练阶段接触过类似题目或者在训练时通过公开仓库间接看到了测试样例。如果这类数据进入模型参数那么得分再高也不算泛化。第二个是外部工具。模型不一定非得自己“想”出答案它可以把 ARC 任务转成代码用程序搜索手段枚举可能规律再对候选规则做验证。这种“程序合成”策略算不算 AGIChollet 之前的态度是ARC 并不禁止外部工具但测试的是系统整体解决问题的能力不单纯是模型脑内推理。换句话说如果你用程序搜索把规则空间穷举了分数也算数只是它不能说明“大模型本身具备抽象推理能力”。第三个是自适应测试设计。如果模型有“记忆”它能根据输入特征匹配训练时见过的类似题目这种模式并不痛苦但本质上还是记忆匹配。ARC-AGI-3 的校准流程能保证“每条题目都有唯一正确答案”但没法保证“模型做对题目的方式是人类式归纳”。我在自己的项目里遇到过类似情况一个模型在固定的 10 个任务上 100% 正确但一旦把输入网格旋转 90 度正确率立刻掉到 30%。这种模型不能叫会做 ARC它只是背下了坐标表。ARC-AGI-3 的高分系统大概率也会面临这种“换个形态就崩”的挑战。2.3 实操审计如何自己验证一个基准是否靠谱既然校准不等于完全可信那我们应该怎么做如果拿到一份 ARC-AGI-3 的分数报告建议做下面几步独立审计这套方法也适用于其他基准测试。第一步查重复。把测试集里的每个输入网格和目标输出网格做哈希去训练集、预训练语料里比对。这一步能发现最明显的污染问题。虽然没有完美的近似重复检测但至少能排除“原题一字不差”出现在公开数据里的情况。第二步跑随机基线和空模型。随机猜应该趋近于某个低正确率如果随机都能拿 30%说明题目本身有歧义或者输出空间太小。ARC 官方的输出网格空间很大随机正确率通常极低因此一个合理的基线和谜底能帮你判断分数的含金量。第三步按难度分层看分数分布。ARC-AGI-3 的任务不可能均匀简单如果模型只在简单任务上满分、困难任务全错那说明它掌握的是浅层模式。如果所有任务都接近满分并且人工抽检的解题过程确实符合规则那可信度会高很多。第四步人工盲测。拿 20 个模型没有见过的、由人类新设计的 ARC 类任务让系统在完全 zero-shot 条件下做一遍。如果它在官方测试集上 100%但新题只有 30%基本可以判断“背题”而不是“会学习”。第五步查看完整推理日志而不仅是答案。很多爆高分系统会附带每道题的推理步骤、搜索轨迹或代码你可以检查这些过程是否逻辑自洽有没有“凑答案”的痕迹。这类审计不需要很高级的工具写几个 Python 脚本就能完成。关键是从一开始就不要无条件信任任何分数尤其是“从1%飙升到100%”这种异常曲线。2.4 我的测量经验分数方差比平均值更重要关于基准测试我想分享一个常被新入行的人忽略的经验只看平均分或者只看最高分很容易被骗。真正的判断要看多次运行之间的方差。ARC-AGI 这类任务有一个特点同一个模型在不同随机种子、不同示例排列、不同推理预算下分数波动可能非常大。有的任务用某种顺序的 few-shot 能得到 100%换个顺序就是 0%。如果报告里只给你一个“最优配置下的分数”你根本无法判断这个系统稳不稳定。我在内部评测时习惯至少跑 5 个随机种子同时记录推理时间、成功率和置信度分布。如果某个模型虽然平均分不高但方差很小那说明它的行为更可控如果另一个模型平均分高但方差巨大那可能只是“运气好”。Chollet 说“校准无误”但校准只保证了测试流程公平并不能抹掉模型本身的随机性。所以看到高分先别急着发朋友圈先把分数分布和运行日志拿出来看看。3. 性能从 1% 到 100% 的技术真相3.1 半年里可能的三种技术路线假设 ARC-AGI-3 的测试分数真的是 100%我们需要认真思考一下什么样的技术路线可以让一个系统在半年内从几乎不会做题变成全部满分我大致梳理了三种可能的路线不一定互斥但它们指向完全不同的结论。第一种纯模型能力飞跃。深度学习模型在架构、训练数据、推理方法上出现突破使大模型真正学会了抽象归纳。这条路最让人兴奋但目前公开证据太少也不足以解释“半年内从1%到100%”这种接近量子跃迁的变化。除非哪个团队对模型架构做了颠覆性调整否则我不太敢信。第二种外部程序合成路线。ARC 任务本身可以用“规则枚举”的方式解决输入输出网格都是小尺寸颜色种类有限可能的变换也有限。模型可以先把每个任务转成一个 DSL领域特定语言程序然后通过搜索算法枚举候选程序再用所有输入输出示例做验证。这种技术在 ARC-AGI-1 上已经被证明有效到了 ARC-AGI-3 如果配合更强的代码模型搜索效率也可以大幅提升。从1%到100%可能不是模型更聪明而是“搜索”这一步终于能在合理时间内覆盖更多任务空间。第三种混合架构大模型负责“翻译”外部验证器负责“检查”。这种路线下大模型不直接输出答案而是生成一组可能的规则描述再由一个传统算法根据规则生成输出并用示例做一致性检查。如果规则有限可以做到“题目全会”。但关键问题是这种系统换个任务分布还能不能保持 100%如果答案能我觉得很有价值如果只在 ARC 任务格式上有效那更像一个专门的 ARC 求解器。我在做类似“让模型做数独”的项目时遇到过一模一样的分水岭。有些系统靠穷举能解出所有数独但你把格子里的数字换成符号它就完全不会了。ARC-AGI-3 的高分也可能存在同样的问题它不是理解了抽象的“规则”而是学会了在 ARC 的格子世界里高效搜索。这两者在 AGI 讨论里的意义完全不同。3.2 泛化还是背题两个判别实验如果你只关心“AI 是不是真的会推理了”我建议做两个判别实验非常简单但非常有效。第一个实验叫“旋转测试”。把 ARC-AGI-3 测试集里的输入网格整体旋转 90 度或者左右翻转然后让模型重新做一遍。如果模型真的理解规则这种几何变换不会显著影响正确率如果模型只是背下了坐标模式和颜色组合旋转后立刻会露馅。很多评测报告为了避免这种问题会在校准阶段特意检查这类变换。但如果官方没有公布这些测试结果我们仍然可以自己验证。第二个实验叫“新规则测试”。从 ARC 任务生成器中随机创造一批新任务这些任务严格遵循 ARC 的风格但绝不在任何公开数据集中出现。让模型在 zero-shot 条件下推理。如果一个系统只在官方测试集上 100%、在新题上却跌到 20%那这个 100% 的价值就得打五折。这两个实验不只是为了质疑别人也是我平时自己评测模型时的标准流程。每当我看到“某个任务 100% 通过”的报告我都会问换一种网格尺寸换一种颜色换一种规则表达它还能 100% 吗如果答案不确定那这个高分只能算作“测试集上的状态”不能算作“AGI 出现”。3.3 AGI 已经来了先别急着下结论最近关于 AGI 的讨论非常多很多人看到“OpenAI 总裁宣布 AGI 到来”之类的标题就开始紧张。但如果仔细看 ARC-AGI-3 这次事件Chollet 本人都没有把“高分”直接等同于“AGI”。他更关注的是“普适的、高效的抽象推理能力”而 ARC 只是这种能力的一个子集。AGI 是一张复杂的能力拼图持续学习、世界建模、长程规划、元认知、工具使用、多模态理解、价值对齐等等抽象推理是其中很重要的一块但不是全部。一个系统就算在 ARC-AGI-3 上拿满分它可能依然不会开车、不会写长篇小说、不会在真实世界做实验。反过来说一个模型如果在 ARC 上只有 30%它也可能在特定工程领域表现得非常出色。所以我不建议用一场基准测试的胜负来定义 AGI 的“生日”。ARC-AGI-3 的分数更像一张“体检报告”里的某一项指标它告诉我们模型在某类认知任务上的表现有提升但离完整意义上的 AGI 还有很大距离。我们应该把注意力放在“这个分数是怎么来的”“它能不能在更多样化的任务上重复”上这比急着宣布“AGI 时代来了”更有价值。4. 自己动手跑 ARC-AGI-3 的完整避坑指南4.1 环境准备与数据格式说明写到这里我相信有不少人想自己动手跑一跑 ARC-AGI-3验证一下“校准无误”到底是什么意思。下面我按自己实际操作的经验给出一套比较稳妥的流程。首先是最基础的环境Python 3.10 以上建议用虚拟环境管理项目。ARC-AGI 官方仓库里通常包含训练集和评估集的 JSON 文件每个任务的格式大致是{ train: [ {input: [[...]], output: [[...]]}, {input: [[...]], output: [[...]]} ], test: [ {input: [[...]], output: [[...]]} ] }其中 input 和 output 都是二维数组数组里的数字表示颜色编号。训练部分提供若干组示例测试部分给出一个新的 input你需要输出对应的 output 网格。模型要做的事情就是根据 train 里的示例推断规则然后生成 test input 对应的 output。我建议先把数据下载下来写一个简单的可视化脚本把网格渲染成彩色图片。这样你能直观感受题目难度也能更容易发现 bug。很多新手直接对着 JSON 看经常看错网格尺寸导致程序处理维度时全部报错。4.2 最小评估脚本跑通一个任务评估脚本的核心逻辑并不复杂读取任务把 train 示例作为上下文让模型预测 test output然后和标准答案比对。下面是一个最小可用的伪代码展示了完整流程import json def load_arc_data(json_path): with open(json_path, r) as f: return json.load(f) def predict(task): # 这里是你的模型或推理逻辑 # 输入 task[train]输出一个二维网格 # 示例直接返回训练集最后一个 output仅作演示 return task[train][-1][output] def evaluate(json_path): tasks load_arc_data(json_path) correct 0 total 0 for task_id, task in tasks.items(): true_output task[test][0][output] pred_output predict(task) if pred_output true_output: correct 1 total 1 return correct / total score evaluate(arc-agi-3_test.json) print(fAccuracy: {score:.2%})这个脚本唯一的硬逻辑是“判断两个二维数组是否完全相等”。ARC-AGI-3 的计分通常要求输出网格和标准答案完全一致有一个格子不一样都算错。这意味着模型不能只输出“大概对的形状”必须是精确的网格。跑通这个脚本之后你再把 predict 函数替换成自己的模型或者调用 API。注意输入输出网格的尺寸可能各不相同有的 3x3有的 9x9所以模型要具备处理可变长二维数组的能力不能写死。4.3 常见问题速查为什么你的分数“炸”了我在跑 ARC 类任务时见过很多重复出现的问题这里整理成一张速查表。问题现象最可能的原因排查建议分数一直是 0%预测输出是空数组或尺寸不对检查 predict 返回的数组维度先打印出来看一眼分数突然 100%可能直接用训练集 answer 当作预测检查模型是否“读”了 test output 文件分数浮动很大随机种子影响模型生成固定随机种子多次运行取平均某个任务反复报错输入网格包含非默认颜色值检查颜色数字是否超出 0-9 范围评分标准不明确可能官方要求“部分匹配”而不是完整匹配仔细看官方评估代码确认是否允许部分正确最常见的坑不是模型不行而是数据读取阶段就出了问题。JSON 文件里有些任务的 input 可能是 List 类型有些又可能是 tuple 序列化后的格式如果没有统一转换直接比较两个数组会得到 False分数自然低得离谱。4.4 保证结果可信的六个注意事项如果你想把 ARC-AGI-3 的跑分结果当作一个可以对外汇报的指标下面六个注意事项是我的个人心得。永远不要用测试集调参。ARC 的训练集或公开样例可以用来做模型选择但最终分数必须来自官方保留的私有测试集。如果你用自己的测试集调参后再去跑公开测试分数会虚高。固定推理预算。ARC 任务没有硬性时间限制但系统可以无限重试直到找到正确答案。如果模型可以试 1000 次高分就失去意义。报告里应写明“单任务最多推理次数”或“时间预算”。记录模型版本和环境。换一个库版本、换一个随机种子结果都可能变化。可复现是基准测试的底线。不要只报最好的结果。建议至少跑 5 次报告平均值和标准差。如果只有一个分数别人很难判断稳定性。保留完整的中间日志。特别是程序合成方案要记录每次搜索的候选规则、验证过程和失败尝试。这样即便分数不对查起问题来也容易。独立复测新任务样本。在官方测试集之外再准备一组“保留任务”只用于最终验证。这组任务绝不能出现在预训练和调参过程里否则又变成污染测试。按这套流程跑下来得到的结果才是相对可信的。否则你只是在“刷一个好看的数字”这对 AGI 研究没有太大帮助。5. 争议之外我更关心的三件事5.1 高分基准不等于产品可用很多人容易把“在 ARC-AGI-3 上拿高分”和“模型很聪明”画等号但我在实际做项目时发现基准测试的高分和产品落地之间隔着一条很宽的河。举例来说你的模型在考试题上能推理出正确规则不等于它在真实业务里能处理模棱两可的输入。真实世界的任务很少像 ARC 一样有明确规则也不会有干净的输入网格。更多时候你需要从嘈杂的日志、用户反馈、非结构化文档里提取信息并做出判断。这些东西 ARC 测不出来。我见过不少团队拿一个大模型在几个公开基准上刷到前列结果一上生产环境就崩。原因很简单公开基准是“闭卷考试”生产环境是“开卷实战”需要考虑延迟、成本、异常输入、多轮纠错。所以 ARC-AGI-3 的分数可以作为学术讨论的素材但不能直接作为采购技术的指标。5.2 设计一张“好卷子”比刷高分更难这次争议让我想起一个更深层的问题设计一个可靠的评测基准比训练一个高分模型还要难。因为“好卷子”要同时满足区分度、稳定性、抗刷榜、可迁移能力这四点。区分度是指人类能轻松做出来模型很难做出来稳定性是指评分不依赖某个随机种子多跑几次结果相近抗刷榜是指模型无法靠记忆测试集或提示工程取巧可迁移能力是指高分系统换一批新任务依然表现良好。ARC-AGI-3 在“区分度”和“抗刷榜”上做了很多努力但“可迁移能力”这一块还需要社区共同验证。设计评测基准本质上是在定义“什么算智能”。如果你定义一个基准只考数学那 AI 智能就是数学能力如果你考的是对话那 AI 智能就是聊天能力。ARC 的价值在于它把“从少量示例中抽象规则”这件事作为智能的关键这一点我认为很有启发。但也正因为它只测这一个维度它不能回答“AGI 是否全面到来”。5.3 未来这个基准会往哪走我接下来的关注点会放在三个方向。第一ARC-AGI-3 的测试集会不会公开。如果测试集公开社区就能复现和审计如果一直保密那“校准无误”只能靠官方信誉背书。第二CRI 会不会出现新的变体任务比如网格尺寸更大、规则组合更复杂、引入时序关系等。如果模型不能在变体任务上保持高分说明它的 100% 还有水分。第三会不会有团队开源完整的推理日志如果开源技术圈就能判断它到底是真的泛化还是调了一个很强的搜索器。我个人很希望看到“高分系统”背后的细节因为只有细节才能推动整个领域往前走。如果每个突破都只公布一个惊人的分数我们对智能的理解不会有实质提升。最后分享一点我的个人体会。作为常年和评测打交道的人我对“高分”的第一反应永远是怀疑我会先复现再找反例然后再下结论。Chollet 这次回应“校准无误”至少说明卷子本身没出错但卷子之外的“学生到底靠什么答题”这个问题依然值得所有人继续追问。与其急着庆祝 AGI 到来不如多想几个对抗性实验把模型的底裤扒得干净一些。等我们能稳定地在各种新任务上复现这种 100%再讨论 AGI 是否近在咫尺也不迟。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。