《ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge》提出了一种名为ORQA的新框架用于评估大语言模型在职业层面的专业知识。其核心目标是弥补现有基准测试的不足——现有测试要么只评估抽象能力要么依赖昂贵且难以扩展的专家评估无法系统性地衡量模型对具体职业的实际帮助。以下是该研究的主要内容概括1. 研究动机与问题随着LLM成为通用工作工具仅评估抽象能力已不够需要了解模型在具体职业中的实用性。现有劳动力市场研究多关注AI的暴露度或生产率影响而非模型间的职业能力比较现有基准多偏向数字/计算机类工作或依赖专家编写任务如GDPval难以大规模扩展。因此需要一种可扩展、覆盖广泛职业、可溯源的职业知识评估方法。2. ORQA框架的构建方法职业选择基于BLS和O*NET数据按工资总额分配条目覆盖SOC全部21个主要组。权威来源发现为每个职业建立可信来源白名单如监管机构、许可机构、专业协会、政府网站排除研究论文和低质量来源。证据卡提取从文档中提取连续句子作为来源引用并关联任务和职业。问题生成将证据卡转化为六选项多项选择题必含“以上全部”和“以上都不是”正确答案必须由来源逐字蕴含干扰项来自同一文档。自动化质量过滤包括来源蕴含、问题合理性、干扰项合理性、唯一正确答案、长度一致性、难度预测试三个小模型并行测试、可消除性检查等。人工验证两名标注员检查条目质量人工与自动化“良好”判定一致率约67%。最终题库480个问题来自187个来源主机覆盖116个职业和全部21个SOC主要组。3. 评估实验测试模型15个前沿和开放权重模型如GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、Llama 3.3 70B等。测试方式闭卷多项选择每题3个随机种子开放式回答三人评审团评分按工资总额加权的聚合评分。主要结果总体表现前沿模型Claude Opus 4.662.4%、GPT-5.460.3%、Claude Sonnet 4.658.7%领先开放模型33-41%所有模型均高于随机猜测16.7%但即使最优模型也答错超三分之一。职业异质性不同职业表现差异巨大。医疗健康从业者达78-80%而安装维修仅44-46%办公行政支持仅36-43%。个别职业如精算师、钣金工、渔猎巡护员前沿模型得分为0%。跨模型差异某些职业上模型间差异可达100个百分点如财务经理。开放式与加权开放式分数略低但排名稳定工资加权不影响总体结论。网络搜索有网络搜索的模型表现显著提升多项选择78-80%开放式71-73%。4. 验证与外部信号与GDPvalSpearman ρ0.90和GDPval-AA Eloρ0.92高度相关。覆盖Anthropic经济指数中高暴露和低暴露职业表明不矛盾于外部经济信号。预训练污染诊断14/15模型在截止日期后来源上表现等于或优于截止日期前表明记忆不是主要因素。5. 主要贡献可扩展系统从权威数据自动创建职业级知识资源。ORQA资源480题、116职业、21 SOC组的基准数据集。十五模型实验闭卷与开放式评估揭示模型、职业和SOC组间的显著差异。外部验证与GDPval、GDPval-AA和Anthropic经济指数比较并探索社区线程版本Reddit扩展。6. 局限与讨论ORQA评估的是可溯源的职业知识报告责任、阈值、程序等而非整体职业能力。覆盖广泛但不均衡部分职业条目少组级结果应谨慎解读。权威来源可能不完整正确答案应视为与特定来源一致而非专业决策正确。存在预训练记忆风险但初步诊断不支持。建议与人在回路、任务型、交互式评估结合使用。ORQA提供了一种低成本、可扩展、可溯源的职业级评估方法能够补充任务型和专家型评估为未来更真实的职业AI评估奠定基础。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要我们提出ORQA一种用于测试大语言模型职业层面知识的方法。既有方法要么通过任务定义将抽象的大语言模型技能映射到职业要么利用难以大规模获取且成本高昂的专家知识。ORQA通过将O*NET职业与可信的职业专属网站如监管机构、许可机构、专业组织及政府出版物相连接并将其转换为可溯源的问题-答案对从而对上述两类方法形成补充。自动化流程与人工审核相结合产出了一组关于职业的高质量问题。通过本方法创建的问题集覆盖了SOC全部21个主要组中的116个职业包含来自187个不同网站的480个问题。每个问题都旨在探查与该职业相关的真实世界技能问题。我们通过该方法测试了15个前沿模型和开放权重模型。Claude Opus 4.6、GPT-5.4和Claude Sonnet 4.6表现最佳约为58-62%而较小的开放权重模型则达到约33-41%的性能。不同职业之间的表现差异显著。医疗健康相关职业表现最高78%而办公与行政支持类职业约为40%。在个别职业上如钣金工和渔猎巡护员表现基本为零。我们还发现开放式问题和按工资总额加权并不会显著影响模型在该基准上的排名。我们认为利用现有的可信职业专属信息来测试大语言模型在专业领域的知识可能是一种可扩展且有用的方法用于在未来评估职业层面的AI表现。结果和数据可在orqabench.org获取。1 引言基准测试一直是衡量和引导人工智能进步的核心。对于语言模型而言MMLU、BIG-bench、HELM、GPQA、ARC和SWE-bench等基准使得以可复现的方式比较系统在推理、知识、编程和问题解决方面的能力成为可能[Hendrycks et al., 2021, BIG-bench authors, 2023, Liang et al., 2023, Rein et al., 2024, Chollet, 2019, Jimenez et al., 2024]。然而随着语言模型成为通用工作工具评估问题发生了变化。我们不再仅仅想知道模型是否具备某种抽象能力。我们想了解其在整个经济中的实际影响。我们想知道它是否能帮助某个特定职业的从业者回答实践中出现的那类问题以及某个模型对该职业是否比另一个模型更有用。现有工作尚未以可扩展的方式提供这种覆盖整个美国经济、跨模型的职业层面模型基准。现有经济学研究衡量的是AI在劳动力市场中的暴露度、采用率或生产率效应[Brynjolfsson et al., 2018, Eloundou et al., 2023, Handa et al., 2025, Chatterji et al., 2025, Brynjolfsson et al., 2025, DellAcqua et al., 2026]。一些关于AI在劳动力市场中应用的论文对于考察AI对劳动力市场的影响很有价值。然而这些通常不是AI系统的性能比较基准。相反这些论文通常估计某个特定AI系统对劳动力市场的总体影响而不是比较一个系统对特定工作的有用性与另一个系统对相同工作的有用性。近期的一些基准开始瞄准更真实的任务。这些包括网页智能体任务[Zhou et al., 2023]、企业工作流[Drouin et al., 2024]、 consequential工作场所任务[Xu et al., 2025]以及软件工程任务[Jimenez et al., 2024]。这些是有前景的发展。然而这些基准相对于劳动力市场而言仍然相当有限。许多基准目前考察的是计算机中介的数字工作。此外近期将智能体基准与职业对齐的尝试发现基准中存在对数学和计算机相关职业的强烈偏向[Wang et al., 2025, 2026]。GDPval代表了一项重要的近期努力旨在考察更具经济相关性的任务。然而GDPval使用专家编写的提示以及专家或模型评估这限制了其扩展到数百个职业的能力[Patwardhan et al., 2025]。也有一些尝试通过专家评估AI在任务层面的表现来弥合这一差距[Shao et al., 2025]。因此差距似乎在于基准测试。我们需要职业层面的评估它应a可扩展b广泛适用于整个经济以及c能够评估职业层面的知识。我们还希望保留当前系统的一些积极方面包括来源可验证性和模型比较同时超越纯粹的任务完成涵盖专业知识。图1ORQA从职业抽样到验证基准问题的构建流程。我们引入职业相关问答Occupation Related Question and AnswerORQA来满足这一需求同时探索自动创建根植于经济的职业层面基准的可行性并比较这种方法与专家创建基准的优缺点。ORQA的创建源于这样一种认识许多职业存在权威文本其中包含与该职业专业人士相关的专业知识。专业人士预期运用的实践知识存在于职业专属文件中包括政府机构、监管机构、许可机构、学术来源、标准组织以及正式和非正式专业协会。这也反映了关于职业通过其创造专业规范并将其编纂为正式和非正式来源的社会学理解[Abbott, 2014]。我们相信此类文件可用于提供可扩展的职业层面比较只要它们能够与O*NET职业相连接并转化为可溯源的问题。我们也清楚ORQA的范围。具体而言ORQA处理的是职业知识中可溯源的部分报告责任、专业建议、阈值、程序和指南而非整体职业能力。此外ORQA设计用于在存在权威信息的若干职业上运行而非覆盖整个劳动力市场。相反我们将ORQA视为一个系统它展示了自动化、可溯源、职业层面比较的可行性并补充了任务型和专家型方法。我们提出一个智能体系统用于大规模创建职业相关问答对。我们从BLS和ONET的职业信息开始[U.S. Bureau of Labor Statistics, 2024, National Center for ONET Development, 2026]创建职业专属的权威来源列表。利用这些列表我们检索与职业相关的文档。然后我们从源文档中创建证据卡。这些卡片作为自动化系统验证信息的标准。我们在证据卡上测试模型的开放式答案并使用相同来源材料测试多项选择题。随后我们通过一系列自动化过滤器确保问题的质量和正确性。我们还加入了人工评估步骤由两名标注员根据质量标准手动检查条目、其来源和答案选项的质量。我们的人工与自动化“良好”判定之间的一致性约为67%。我们将此作为衡量可扩展自动化过滤器相对于专家策展性能的指标。正确性被定义为与源文档中精确蕴含的关系。所有选中的条目也须符合相同的人工确定标准。我们创建了一个经过策展的权威ORQA数据集包含480个问题来自187个来源主机、116个职业以及SOC全部21个主要组。我们在没有检索或浏览能力的情况下测试了15个前沿模型和开放权重模型。我们主要测试闭卷多项选择每个问题使用三个随机种子。我们还测试了一项开放式任务其中模型只看到问题文本必须提供简短的自由回答由三人评审团评分。我们还提供了按工资总额加权的度量该度量使用基于就业人数乘以平均工资的加权职业。我们观察到三个主要结果。其一ORQA在多项选择和开放式任务中都能在一定程度上区分模型。对于闭卷多项选择任务前沿模型Claude Opus 4.6、GPT-5.4和Claude Sonnet 4.6非常接近分别为62.4%、60.3%和58.7%。Gemini 3.1 Pro为56.2%o3为51.7%。中档模型Gemini 2.5 Flash和Claude Haiku 4.5在47-48%范围内较小或较旧的模型为33-41%。绝对分数低于通用知识任务因为这些问题经过人工策展以使其非平凡并经人工验证因此剩下的是对模型而言真正困难的问题。对于开放式任务绝对分数再次略低于闭卷多项选择正如预期。然而前沿排序保持不变GPT-5.4为54.2%Claude Opus 4.6为53.1%Claude Sonnet 4.6为50.6%。工资总额加权不影响总体结论。前沿模型再次位居前列绝对分数也仅显示出适度差异。其二总体分数掩盖了显著的职业与模型交互差异。对于某些职业许多模型表现良好而对于另一些职业即使前沿模型也表现不佳。例如GPT-5.4总体表现为60.3%但在精算师、钣金工和渔猎巡护员上表现为0%在空乘人员上为11%。我们在某些工作中观察到巨大的跨模型差异高达100个百分点。对于财务经理GPT-5.4在所有种子上表现完美而GPT-3.5 Turbo则无一完美。即使在高层次SOC类别层面也观察到异质性。对于代表性最强的类别医疗健康从业者前沿模型表现约为78-80%而对于安装、维护和维修前沿模型仅表现44-46%对于办公和行政支持工作前沿模型表现36-43%。这很有用因为它允许雇主和雇员超越模型的总体表现转而考察某个模型对某类工作的可靠性。其三ORQA观察到一个不同的实体但也追踪外部可用的信号。ORQA与GDPval0.90和GDPval-AA Elo排名0.92在重叠模型上显示出高相关性Spearman。ORQA还显示出在Anthropic经济指数暴露度分箱中对职业的覆盖。这表明ORQA既覆盖了Anthropic经济指数中频繁暴露的职业也覆盖了不频繁暴露的职业并且追踪了外部可用的信号。这意味着ORQA目前似乎不与经济和工作的外部可用信号相矛盾。ORQA还增加了执行来源感知、职业感知和可扩展模型比较的能力。最后我们提出四项贡献。我们的第一项贡献是一个可扩展的系统用于从权威数据创建职业层面知识资源。我们提出了一种通用方法将公共数据转化为可验证的问题以及对此任务重要的质量和平衡考量。我们的第二项贡献是将该系统实例化为ORQA一个包含480个条目的资源涵盖116个职业、SOC全部21个主要组以及数字和非数字职业。我们的第三项贡献是一项十五模型闭卷多项选择和开放回答实验通过聚类自举法提供不确定性并按职业工资总额进行加权聚合。我们观察到模型、职业和SOC主要组之间存在显著差异。我们的第四项贡献是将ORQA与职业相关的外部信号进行比较如GDPval、GDPval-AA以及Anthropic经济指数的暴露度。我们还展示了如何利用社区线程版本利用公共讨论数据例如关于职业的Reddit线程将职业索引系统扩展到权威数据之外。因此ORQA既是一种资源也是一个示例说明利用特定来源数据的自动化可以在多大程度上扩展到职业层面的理解。2 相关工作通用能力指标。通用语言模型基准在追踪编程、科学知识、推理、语言理解及其他领域的进展方面发挥了重要作用[Hendrycks et al., 2021, BIG-bench authors, 2023, Liang et al., 2023, Rein et al., 2024, Chollet, 2019, Jimenez et al., 2024]。虽然这些基准有助于评估能力但它们不适合评估对工作或经济的影响因为它们不是围绕职业构建的。例如在抽象能力基准上得分高并不一定意味着该模型能帮助机械师、场地管理员、会计师、司机或护士处理各自领域中出现的具体问题。相反经济学文献中关于AI对就业市场影响的证据侧重于暴露度、使用情况和领域。许多经济学论文考察了暴露度以识别最易受AI或生成式AI影响的职业或任务[Brynjolfsson et al., 2018, Webb, 2020, Felten et al., 2021, 2023, Eloundou et al., 2023]。近期也有研究考察使用情况[Handa et al., 2025, Appel et al., 2025, Chatterji et al., 2025, ?]。最后实地研究为特定领域如知识和客户服务工作的质量和生产率影响提供了更具体的见解[Brynjolfsson et al., 2025, DellAcqua et al., 2026]。有几种类型的基准与理解AI的经济影响相关。然而与ORQA不同这些通常不提供可重复使用的测试以在相同的职业索引问题上评估多个模型。相反它们通常评估更现实的企业、智能体或工作任务。例如近期基准已从抽象技能转向更现实的工作。WebArena、WorkArena、WorkArena、TheAgentCompany和SWE-bench都针对软件问题、企业流程、 consequential工作场所类任务或智能体或模型的网页任务进行测试[Zhou et al., 2023, Drouin et al., 2024, Boisvert et al., 2024, Xu et al., 2025, Jimenez et al., 2024]。这代表了向更现实评估的转变。尽管如此这些基准往往侧重于数字、计算机中介的工作。近期将智能体基准与职业连接的努力揭示了基准中对计算机和数学类职业的显著偏向以及对就业市场部分的严重代表性不足[Wang et al., 2026, 2025]。知识和经济价值基准。GDPval在性质上与ORQA最为相似。GDPval测试模型在经济上有价值的职业任务上的表现。这些任务由专家创建并由专家或模型评估[Patwardhan et al., 2025]。GDPval的优点是其现实性。然而任务由专家创建这使得反复扩展到数百个职业的成本高昂。另一方面ORQA通过使用权威职业信息为职业任务创建可验证来源来实现扩展。另一项已开始将AI系统与ONET任务连接的努力强调了人-AI协作和人-AI辅助在模型评估中的重要性而不仅仅是端到端任务解决[Shao et al., 2024, Chang et al., 2025]。ORQA并不与这一努力相对立而是评估其中更狭窄和具体的一个方面。ORQA不是衡量端到端任务表现或辅助的价值而是评估模型的输出是否与某个职业的权威知识库相一致。3 方法从探索性到批准的流程我们分两个阶段创建了当前流程。在第一阶段我们创建了一个智能体流程包含多个自动化步骤从职业数据和可信在线来源中生成大量潜在问答对。这个初始阶段的目标不是创建题库本身而是深入了解什么构成一个好的职业问题。两名标注员手动检查了这些生成问题的样本。对于每个问题答案选项、来源和问题都使用相同的质量标准进行评分。标注员随后提供解释说明为什么某个问答对应被拒绝。一个标注仪表板显示了若干常见的问题类型答案未由来源充分蕴含、干扰项可以用一般领域知识回答、使用研究文章而非可信来源以及正确答案被模糊修饰语所掩盖。人工与自动化“良好”标注之间约有67%的一致率。我们将此一致率作为自动化可扩展门控与专家策展之间相似性的指标但不应将自动化视为专家策展的替代品。正确性本身锚定于来源的逐字蕴含并独立于此可扩展门控。在下文中我们描述当前状态的系统。该系统生成的所有条目都经过相同的质量验证步骤过滤。我们不区分早期和后期条目也不追踪每一步被拒绝的候选数量。从职业抽样到平衡池的整个流程总结于图1。获取职业我们从美国劳工统计局职业就业和工资统计的2024年5月全国表开始。对于每个标准职业分类SOC代码我们计算工资总额即全国总就业人数乘以该职业的平均年薪。这代表了流经该职业的年度劳动报酬总额。然后我们根据该组占全国工资总额的比例在SOC主要组之间分配条目。这为广义和狭义职业类别都赋予了经济意义。我们尝试在每个职业类别内按工资总额降序获取职业条目。每个职业的领域白名单如果对某个职业进行一般网络搜索会返回数百万个离题或低质量页面如内容农场、营销页面或博客。相反我们将给定职业的来源搜索限制在从O*NET官方来源信息中策展的可信发布者列表内。例如注册护士可以来自aacn.org美国重症护理护士协会、nursingworld.org美国护士协会、ncsbn.org全国州护理委员会理事会、该州的州护理委员会以及联邦政府来源bls.gov、osha.gov和cdc.gov。每个职业都有适合该职业的白名单。这些白名单是完整的。任何文档都不能来自不在白名单上的域。不存在任何总体允许列表使学术或其他文档能够绕过职业专属白名单。研究论文在来源处过滤而非在门控处过滤研究论文不是专业人士需要负责的内容。相反它报告的是研究结果。因此任何使用此类来源的条目在我们的评分方案中都会因research_paper_source而失败且没有资格获得良好评级。此类条目无论质量如何基本上都无用而且这些来源根本不被流程使用没有任何职业将学术出版商列入白名单也不执行任何学术搜索。在获取之前消除这些来源而不是在生成后拒绝它们更安全从未进入流程的论文不可能在评分者失误中幸存也更成本有效不会在必然被拒绝的条目上浪费提取、生成、评分或获取预算。这种区分是按文档类型而非托管来源进行的。第三方研究通常由权威机构存档。例如托管在.gov域上的会议论文仍被视为研究论文。来源发现和获取发现是通过搜索API进行的单次通用网络轮次限制在该职业的白名单内因此每个候选文档都来自管辖该职业的发布者。不从允许列表之外拉取任何内容。证据卡和内容创建文档被提取然后解析为结构化对象。文档以2.5至4千字节的窗口分块重叠100个token以避免上下文丢失。每个窗口随后通过证据卡提取模型GPT-4o。每张卡将从文档中提取一到三个连续句子作为来源引用。该卡还将提取来源引用中引用的任务或程序以及相应的职业。条目创建每张卡被转换为一个六选项多项选择题。正确答案必须由来源引用蕴含并且可以从来源引用创建。干扰项答案从同一文档内创建。“以上全部”和“以上都不是”保证作为六个答案选项中的两个出现在每个问题中。六个答案选项中只有一个可以是正确的。答案选项还要求长度相似并且没有明显的提示性答案。如果某个条目在任一标准上失败则记录该条目并拒绝该卡。自动化质量和分类条目创建后会经过一系列自动化过滤器。其中一些过滤器是为了防止通过人工测试发现的失败模式而创建的。失败的条目会被发送到特定的重新生成尝试而不是立即拒绝。重新生成尝试产生的条目随后在失败点重新插入流程。检查按以下顺序执行正确回答完全由原始引用蕴含问题完整且合理所有答案选项主题适当且没有明显荒谬没有两个回答是彼此的释义基于原始内容只有一个回答正确回答长度相似且不暗示使用特定来源例如“根据NFPA……”该条目不能由GPT-4o mini、Claude Haiku 4.5和Gemini 2.5 Flash三者在闭卷基础上并行解决如果可以则被视为太容易并拒绝任何答案选项都不能基于一般背景知识被排除由独立LLM评估正确答案不会在模糊术语如“标准”或“适当”下掩盖而其他答案引用具体值或工具。最后一个过滤步骤是与人工标注对齐的步骤。正是这一步使流程能够自动达到人工定义的“良好”答案。A.4节显示了确切的提示和每项检查的失败率。领域再平衡和职业下限再平衡一旦质量检查成功就会根据三条领域规则进行领域平衡以避免任何职业的条目过度集中于单一领域。一条规则确保单一来源的域在该SOC中的条目占比不超过30%。第二条规则允许对职业核心的联邦监管域给予更大比例40-50%并将边缘域控制在较小比例15-20%。第三条规则屏蔽少量低质量域。最后执行职业下限再平衡保留所有至少有一个验证条目的职业同时限制每个职业的条目数量。这避免了高价值职业如cdc.gov中的注册护士主导题库的情况。可用领域如医疗保健存在集中趋势。为解决这一问题我们还对代表性不足的职业进行了重点扩展每个职业至少三个条目。这将至少包含三个条目的职业数量增加到116个中的106个。最终题库最终ORQA题库包含480个条目分布在116个职业中涵盖SOC全部21个主要组来自187个不同来源主机。约43%的条目来自联邦政府来源以.gov结尾。其余来自许可组织和专业组织另有两个条目来自州林业推广服务。osha.gov是最主要的来源主机占题库的9.8%远低于每个职业单一来源30%的上限。覆盖范围广泛但不均衡一些SOC主要组如生产和医疗健康从业者有许多职业而另一些如农业、渔业和林业只有一两个职业。我们在第5节回到这个问题。评估我们在闭卷测试中评估了15个模型。这意味着模型只看到问题文本和六个答案选项。没有浏览或检索。我们测试了以下模型GPT-5.4、GPT-5.3-chat-latest、GPT-5.2、o3、GPT-4o、GPT-4o mini、GPT-3.5 Turbo、Claude Opus 4.6、Claude Sonnet 4.6、Claude Haiku 4.5、Gemini 3.1 Pro、Gemini 2.5 Flash、Llama 3.3 70B、DeepSeek V4 Pro和Qwen 2.5 7B。480个问题中的每一个都在每个模型上独立运行三次使用不同的随机种子。我们报告准确率作为所有问题-模型-种子组合的均值。我们使用聚类自举法估计标准误其中每个聚类对应一个职业。这是正确的聚类层级因为同一职业内的条目具有相似内容不能假设为独立。对于有六个可能答案的多项选择题随机猜测的准确率为1/6≈16.7%。我们将其作为参考线。4 结果条目验证在解释分数之前我们考虑ORQA条目在多大程度上具有职业性质。ORQA主张三个效度来源。第一条目与职业相关联。每个条目都与一个O*NET职业相关联并源自行业协会、机构、标准组织、许可组织、监管组织、学术机构或其他定义或监督该职业工作性质的组织所制作的材料。第二回答正确性来源于来源而非模型推断。也就是说正确回答必须由来源材料中的精确摘录所蕴含。最后条目在加入题库之前要经过第3节详述的自动化验证这些验证使用人工标注进行了调整。图1中的兽医示例就是其中一例。OSHA工作场所暴露指南规定了卤化麻醉剂的绝对水平。ORQA将其转化为一个职业条目正确回答之所以正确是因为它存在于来源中而不是因为模型推断了其合理性。总体表现同一个480条目题库以三种不同方式评估闭卷多项选择、模型评分的开放式回答以及按工资总额加权的闭卷准确率图2。这三种视角产生了相似的可比结果。在闭卷多项选择中Claude Opus 4.6以62.4%位居第一其次是GPT-5.4为60.3%然后是Claude Sonnet 4.6为58.7%。三个前沿模型非常接近彼此相差约4个百分点。接下来是Gemini 3.1 Pro为56.2%GPT-5.3-chat-latest为54.2%GPT-5.2为52.8%o3为51.7%。图2ORQA在多项选择、开放式和工资加权评估中的总体表现。注所有面板评估相同的职业索引题库和模型集合。每个面板为每个模型绘制两个点如适用无工具的闭卷分数以及十个具有原生网络搜索工具的模型的网络搜索分数而五个没有网络搜索的模型仅显示闭卷分数。闭卷多项选择和工资加权分数对每个条目平均三个种子开放式分数使用三人评审团工资加权仅改变聚合权重。条形显示在职业层面重采样的聚类自举标准误。中等模型如Gemini 2.5 Flash为47.0%Claude Haiku 4.5为48.2%约为一半。GPT-4o为43.5%。开放模型范围从33.9%到40.8%。GPT-3.5 Turbo为33.3%。所有十五个模型都高于16.7%的随机猜测分数但由于测试题库的性质仅包含非平凡问题即使表现最好的模型仍然会答错超过三分之一的职业相关问题。在开放式输出中分数降低但前沿排名保持不变。对于开放式输出每个模型只看到问题文本没有选项或来源材料。然后模型生成最多五行的自由形式回答。为帮助缓解单一评审对特定模型的偏见使用了来自不同提供商的三个评审。一个OpenAI GPT评审、一个Claude评审和一个Gemini评审。每个评审获得问题、正确答案和被评估模型的匿名回答。每个模型的最终分数是由三人评审团多数投票决定的二元值。在该集合中GPT-5.4以54.2%位居第一其次是Claude Opus 4.6为53.1%Claude Sonnet 4.6为50.6%。正如对答案生成与识别相比的预期分数比多项选择低约7-9个百分点。然而顺序保持相当相似。能够使用基本网络搜索工具大大提高了两项任务的表现。前沿模型在开放式任务上表现约为71-73%在多项选择上约为78-80%这比闭卷测试的惩罚有显著改善。其他五个没有网络搜索工具的模型仅在闭卷模式下评分。排行榜对经济加权也相当稳健。使用每个职业的全国工资总额Claude Opus 4.6再次以66.8%位居第一其次是GPT-5.4为64.2%然后是Claude Sonnet 4.6为63.4%。多项选择、开放式和经济加权之间结果相似意味着总体排序不是由每个任务的六个选项或未加权职业组合驱动的。职业异质性职业之间存在大量异质性被总体排行榜所掩盖。在SOC主要组层面总体表现水平和跨广泛职业类别的排名都存在显著差异图3。前沿模型在覆盖最全面的组——医疗健康从业者13个职业52个条目上表现78-80%在安装、维护和维修上表现44-46%在办公和行政支持上表现36-43%。不过我们要强调不应过度解读组级结果。当前清单中有许多SOC主要组仅由少数职业覆盖。例如如表3所示食品制备和服务仅贡献一个条目农业、渔业和林业仅一个职业两者都太稀疏而无法绘制并从热图中省略。此类稀疏组的组级结果应被视为暂定而非确定。这在职业层面也更明显见图4。对于有三个或更多条目的职业容易执行的职业如电工、牙医和工业工程师在许多模型上出现在90%范围。然而也有许多职业在前沿模型上接近零。GPT-5.4总体为60.3%但在精算师、钣金工或渔猎巡护员上没有一个种子正确在空乘人员上为11%。还存在非常大的跨模型差异。对于财务经理GPT-5.4所有种子都正确而GPT-3.5 Turbo一个都不正确。这些也是领域特定差异出现的例子排行榜聚合无法捕捉。图3按模型划分的ORQA准确率SOC主要组热图。注SOC行聚合广泛BLS职业组内的条目级准确率。每个单元格平均该组内所有保留条目在模型三个种子上的表现。各组包含的职业数量差异很大覆盖稀薄的组应据此解读。困难条目是什么样的ORQA的好处之一是它可以访问通常不包含在工作评估中的职业因为它们属于物理或非数字世界。此外困难条目可以是具体的而非抽象的。可以指出一些趋势。一是未能准确回忆特定代码和数值。例如在关于屠宰工和切肉工的一个OSHA条目中引用了当设备产生冲击或脉冲噪声时的特定暴露限值。模型在闭卷中似乎不擅长回忆这些具体值。另一个例子是关于工具和模具制造工的条目引用了一份特定的机器安全文档。问题要求在点动冲床的冲头之前必须检查什么。图4职业层面热图显示模型特定的优势和失败。注职业按跨模型平均准确率排序以便在视觉上区分简单和困难领域。单元格值总结职业内的模型准确率应结合条目数量解读。正确答案是具体行动而不是“遵循所有安全程序”之类的内容。第二许多失败是检索型的。问题的正确答案是来自某个权威来源的事实具有网络搜索能力的模型可以检索到但闭卷模型不能。一个空乘人员的例子使用了GoJet集体谈判协议中关于延误后下机再登机航班的登机报酬问题。闭卷模型在这个问题上表现很差但具有网络搜索能力的模型表现良好因为它可以检索集体谈判协议。这些失败既说明了ORQA评估的知识类型目前前沿模型中不具备的专业相关知识也说明了闭卷表现与网络搜索表现之间可能存在巨大差距。验证我们对验证的主张相当保守。我们最强的主张是ORQA的排名不被独立外部证据所矛盾。由于目前没有可用的权威来源索引职业基准我们比较三个外部指标而不是期望与其中任何一个完全一致。第一GDPval报告了在各自职业中针对专业专家的长篇表现。ORQA表现与GDPval胜率之间存在强相关Spearman ρ0.90Pearson r0.89涉及与我们模型集合重叠的五个模型。第二GDPval-AA即GDPval的人工分析版本[?]报告了长篇经济任务上的盲 pairwise Elo。在与我们集合重叠的十一个模型中Spearman ρ0.92Pearson r0.93。在两个排行榜上GPT-5.4、Claude Sonnet 4.6和Claude Opus 4.6的前沿都位居顶部。开放权重模型在两个排行榜上都处于较低位置中间的相对排序基本保持。第三我们将ORQA的覆盖范围与Anthropic经济指数[?]进行比较。我们根据观察到的Claude使用暴露度对职业进行分组。ORQA覆盖了高度使用的职业也覆盖了在职场AI使用度量中因缺失而代表性不足的低使用职业。我们认为这些评估方法相当基础针对跨职业人工编写的黄金答案进行更深入的评估将是有益的。5 讨论ORQA旨在成为一种创建与专业建议/指南相一致的来源 grounded 方法而不是职业AI能力的完整表示。ORQA的关键优势是能够扩展到职业层面。许多职业都有权威材料概述安全、专业标准、报告责任、阈值、程序等方面。这些可以转化为可测试的问题。与仅使用专家创建的工作样本测试相比这使得比较能够覆盖职业版图中大得多的部分。然而这种方法也引入了若干限制。首先应讨论该方法的一些局限性。ORQA使用权威材料作为 ground truth。然而职业的某些方面并不仅存在于这些材料中。由于来源材料的相关性和完整性可能存在差异ORQA的准确答案应被视为与特定权威或专业来源的一致而不是表明模型会在专业情境中做出正确决策。第二覆盖范围广泛但不均衡总覆盖仍然相对有限当前题库覆盖SOC全部21个主要组中的116个职业但每个职业和某些SOC主要组的条目数量相当少一些SOC主要组只有一两个职业。一些职业如生产和医疗保健职业产生许多高质量、可溯源条目而另一些只产生少数条目。少数SOC主要组如农业、渔业和林业也很稀疏因为权威机器可读来源有限。因此对于条目很少的职业的职业层面估计以及对于覆盖稀薄的SOC组的SOC组层面估计应被视为探索性而非确定排名。我们对推广到整个经济的说法也很谨慎ORQA确实覆盖了经济中相当大且不断扩大的份额但不是所有职业和部门。扩展题库以覆盖代表性不足且权威来源较少的职业和部门将是有用的。第三使用我们的来源可能带来记忆问题因为它们可能存在于模型的预训练数据中。我们尝试通过附录A.3中包含的按模型预训练截止日期分层来经验性地解决污染问题。对于来自给定模型训练截止日期之后发布的段落的条目因此对该模型无污染15个分析模型中有14个的表现等于或优于截止日期前段落的表现。这与纯记忆假设下预期的表现相反。我们还通过分析开放式任务以及多项选择任务来提供另一种稳健性测试。这表明排名不仅仅是正确多项选择答案选择的函数。我们可以继续研究污染问题。ORQA也不促进显著的人-LLM来回交互或深度人类协作。因此我们认为ORQA是职业评估的一个要素。它为职业知识提供了有用的信号但在实际使用前应与人在回路、基于任务和交互式评估结合使用。我们的方法也可用于未来使用AI智能体评估端到端职业任务。我们的主要贡献是一种可扩展的职业评估方法。ORQA提供了一种将职业知识与权威在线资源连接起来并将这些资源转化为来源可验证评估任务的方法成本显著低于基于专家的评估。相同方法也可用于非权威资源。作为补充努力我们还探索了一种基于社区线程的方法将职业与Reddit线程连接附录A.8。上述若干问题可以很自然地成为未来研究的对象而不是该方法的固有局限。更多模型和计算将允许探索更多来源、为每个职业产生更多候选条目、测试更多模型并进行更深入的稳健性测试。更多人工策展将允许改善来源质量与现实世界实用性之间的对齐。我们相信这种方法为逐步更现实的职业层面评估提供了可扩展的基础而不是评估现实世界表现的最终解决方案。