尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

ARA 目录 Schema 全字段参考:构建 Agent 原生研究产物的认知层、物理层与证据层规范

发布时间:2026/9/24 3:24:23

资讯中心
01
ARTICLE

ARA 目录 Schema 全字段参考:构建 Agent 原生研究产物的认知层、物理层与证据层规范

ARA 目录 Schema 全字段参考:构建 Agent 原生研究产物的认知层、物理层与证据层规范
AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载本指南完整解析 AI-Research-SKILLs 仓库中 ara-schema.md 定义的 ARAAgent-Native Research ArtifactAgent 原生研究产物目录 Schema它规定了任何研究输入被编译为可被 Agent 遍历、验证和复用的结构化知识包时每个文件应放置在哪一层、包含哪些字段、遵循何种保真度纪律。读完本文你将掌握 ARA 的完整目录骨架、逐文件字段级格式、三层渐进式披露协议以及证据命名、断言-实验-证据跨层绑定的硬性规则并了解这些规范如何被 compiler/SKILL.md 的工作流、exploration-tree-spec.md 与 validation-checklist.md 的 Seal Level 1 校验器共同执行。一、ARA 目录结构总览ARA 是Agent 原生的研究产物不是给人阅读的散文式论文而是按认知层为什么、物理层怎么做、探索图怎么走到这里、证据层凭什么这么说四类职责组织的文件集合。Schema 规定的标准目录如下PAPER.md # Level 1: 根清单 层级索引 logic/ problem.md # 为什么观察 → 缺口 → 关键洞见 claims.md # 可证伪的断言 concepts.md # 全部关键术语每个术语一个 ## 小节 experiments.md # 声明式实验计划非脚本 solution/ architecture.md # 系统设计与组件图 algorithm.md # 数学形式化 伪代码 constraints.md # 边界条件与局限性 heuristics.md # 收敛技巧 理由 related_work.md # 类型化依赖图RDO src/ configs/ training.md # 带理由的训练超参数 model.md # 架构/模型配置 execution/ {module}.py # 最小代码桩仅核心算法 environment.md # 依赖、硬件、随机种子 trace/ exploration_tree.yaml # 研究 DAG嵌套 YAML 树 类型化节点 evidence/ README.md # 每个证据文件到断言的索引 tables/ # 原始结果表精确单元格值 figures/ # 原始图数据提取的数据点 rubric/ # 仅当提供 rubric 时 requirements.md # 叶级 rubric 需求到 ARA 文件的映射Schema 同时明确允许扩展当输入源包含无法自然归入标准层的内容例如来自附录的逐步演算示例、提示词模板或枚举型分类法时可以按需新增文件或子目录放置在其最合适的 ARA 层中——原则是内容决定层级层级不裁剪内容。在 compiler/SKILL.md 中这套结构被定义为编译器的强制性输出契约所有列出的文件必须存在且非平凡non-trivial包括PAPER.md、logic/下全部六个文件、logic/solution/下四个文件、src/三个文件、trace/exploration_tree.yaml、evidence/README.md及证据文件。这保证了任何一次编译产生的 ARA 都具备一致的可遍历形状。二、渐进式披露三层读取协议ARA 针对 Agent 的上下文预算设计了**渐进式披露Progressive Disclosure**机制共三级Level 1 — PAPER.md约 200 tokens仅包含 YAML frontmatter 与层级索引。Agent 只需读取这一份文件即可判断这篇研究是否与我相关无需加载任何细节。Level 2 — 层文件problem.md、claims.md、experiments.md、evidence/README.md判定相关后按需加载提供该层的中等粒度信息。Level 3 — 细节文件algorithm.md、代码桩、单个证据表当需要深入具体实现或精确数据时才读取。这套协议的经济性在于相关性过滤只消耗约 200 tokens而最深层的证据数据始终随取随用。它同时构成了 Agent 遍历 ARA 的标准入口路径——先看PAPER.md的 Layer Index再按需下钻。三、PAPER.md根清单与层级索引PAPER.md是整个 ARA 的入口包含两部分YAML frontmatter 与正文中的 Layer Index。3.1 YAML frontmatter必填字段--- title: {full paper title} authors: [{author list}] year: {year} venue: {venue} doi: {DOI or arXiv ID} ara_version: 1.0 domain: {research domain} keywords: [{5-10 keywords}] claims_summary: - {one-line summary of main claim 1} - {one-line summary of main claim 2} - {one-line summary of main claim 3} abstract: {paper abstract} ---字段要点claims_summary用每条一行的方式浓缩主断言让 Level 1 阅读者Agent 或人在几十个 token 内把握论文的核心贡献keywords约束在 510 个服务于检索与路由ara_version标记 Schema 版本当前为1.0便于未来兼容演进。3.2 正文Layer Indexfrontmatter 之后正文必须以# {Paper Title}开头包含 Overview12 段贡献总结随后是Layer Index——一张按层组织的文件索引表列出每一层的每个文件及其职责描述## Layer Index ### Cognitive Layer (/logic) | File | Description | |------|-------------| | problem.md | Observations → gaps → key insight | | claims.md | {N} falsifiable claims (C01–C{NN}) | | ... | ### Physical Layer (/src) | File | Description | Claims | |------|-------------|--------| | execution/{module}.py | {what} | C{NN} | | ... | ### Exploration Graph (/trace) | File | Description | |------|-------------| | exploration_tree.yaml | {N}-node research DAG | ### Evidence (/evidence) | File | Description | |------|-------------| | [README.md](https://link.gitcode.com/i/9952a51cadc4f1f4926c4f16fd852771) | Full index of {N} tables {N} figures |注意 Physical Layer 的索引表额外带一列Claims把代码桩直接绑定到其支撑的断言上——这是跨层绑定在入口处的第一处体现。Seal Level 1 校验器见 validation-checklist.md会专门检查PAPER.md是否以---开头、frontmatter 是否为合法 YAML 映射且包含title、authors、year三个键以及正文是否包含 Layer Index 小节。四、证据命名与保真度规范证据层包含两类本质不同的对象命名即承诺原始源证据Raw source evidence对源论文某张表或某张图的忠实转录必须保留原始源标识符如Table 3与图注。示例evidence/tables/table3_imagenet_validation.md。派生子集证据Derived subset evidence为某个特定断言而做的过滤或重组视图不得冒充原始源对象。文件名必须包含derived_、subset_或等价标识且必须声明它来自哪份原始源对象。示例evidence/tables/derived_from_table3_residual_depth_slice.md。核心规则只有一条如果文件名包含table3、figure4之类的源标签那么该文件就必须忠实呈现那个确切的源对象而不是一个经过筛选的子集。若要呈现子集就改名并声明父源。这条纪律在编译工作流中由 SKILL.md 的 Stage 1 — Semantic Deconstruction 阶段强制落地编译器在引用任何源表/源图之前先原样捕获其源标识符与图注转录原始表/图内容之后再谈按断言的摘要为某个断言生成过滤视图时一律存为 derived subset任何将子集或合并摘要标为Table N的行为都被视为伪造源标签。五、认知层logic/问题、断言、概念与实验认知层回答这篇研究为什么成立、声称什么、术语怎么定义、如何验证是 ARA 的思想核心。5.1 logic/problem.md从观察到洞见的问题规格# Problem Specification ## Observations ### O{N}: {title} - **Statement**: {precise empirical fact with numbers} - **Evidence**: {source — figure, table, measurement, citation} - **Implication**: {what this means for the problem} ## Gaps ### G{N}: {title} - **Statement**: {whats missing or broken} - **Caused by**: {which observations, e.g., O1, O2} - **Existing attempts**: {whats been tried} - **Why they fail**: {specific failure mode} ## Key Insight - **Insight**: {the creative leap, stated precisely} - **Derived from**: {which observations} - **Enables**: {what solution approach this unlocks} ## Assumptions - A1: {assumption} - A2: {assumption}关键约束Observations的 Statement 必须是带数字的精确经验事实并标注证据来源图/表/测量/引用这是后续一切推导的地基Gaps必须显式声明由哪些观察导致Caused by: O1, O2Key Insight是精确表述的创造性跃迁并指明它解锁了哪种解决方案。Seal Level 1 要求该文件至少包含### O\d观察块、### G\d缺口块以及 Key Insight 小节。5.2 logic/claims.md可证伪断言清单每个断言必须包含全部字段## C{NN}: {Short title} - **Statement**: {Precise, falsifiable assertion} - **Status**: {hypothesis|supported|refuted} - **Falsification criteria**: {What would disprove this} - **Proof**: [{experiment IDs: E01, E02}] - **Evidence basis**: {What the cited evidence directly shows} - **Interpretation**: {Optional broader reading that should not be confused with the raw evidence} - **Dependencies**: {other claim IDs, if any} - **Tags**: {comma-separated keywords}三条硬性规则Proof 必须引用 experiments.md 中的实验 IDE01、E02…而非文件路径每个被引作证明的实验其背后应有证据文件且证据文件中的行/测量值与断言实际匹配Statement 应停留在被引用证据直接支持的最强级别更宽泛的综合判断放进Interpretation——例如证据只显示了验证指标就不能把断言升级为训练动力学或优化质量层面的结论SKILL.md 的 Critical Rule 10 称之为 Evidence-limited wording。Seal Level 1 校验会逐一检查每条断言是否具备Statement、Status、Falsification criteria、Proof、Evidence basis、Interpretation字段并验证Proof中的每个E\d都能在experiments.md中解析到对应实验。5.3 logic/concepts.md术语形式化词典至少 5 个概念每个概念一个##小节## {Term Name} - **Notation**: {LaTeX or symbolic notation} - **Definition**: {Formal definition} - **Boundary conditions**: {When does this concept apply/not apply} - **Related concepts**: {other concept names}概念不是名词解释而是带符号记法、形式定义、适用边界和相关概念关系的可计算术语为algorithm.md的数学表达提供共享词汇表。5.4 logic/experiments.md声明式实验计划非脚本至少 3 个实验。它是声明式计划不是可执行脚本绝不包含精确数值结果——精确数值属于evidence/## E{NN}: {Short title} - **Verifies**: {claim IDs, e.g., C01, C02} - **Setup**: - Model: {model name and size} - Hardware: {GPU type, count, memory} - Dataset: {dataset name, size, source} - System: {system configuration} - **Procedure**: 1. {Step 1} 2. {Step 2} - **Metrics**: {what to measure, with units} - **Expected outcome**: - {directional/relative ONLY, e.g., A outperforms B on metric X} - NEVER exact numbers (those go in evidence/) - **Baselines**: {methods to compare against} - **Dependencies**: {other experiment IDs, or none}这是 ARA 中最反直觉的纪律之一实验计划的 Expected outcome 只允许方向性/相对性表述A 在指标 X 上优于 B严禁任何精确数字。理由很清晰——预期数字会污染后来的实验结果记录而实验的证伪力恰恰来自方向性预期 证据层精确实测的分离。校验器会检查## E\d块数量 ≥3 且包含Verifies、Setup、Procedure、Expected outcome字段并要求Verifies中的每个C\d都能在claims.md中解析。5.5 logic/solution/架构、算法、约束与启发式solution/四件套描述方案本身architecture.md组件图。每个组件给出 name、purpose、inputs、outputs、interactions 与关键设计选择。Seal Level 1 还包含一项模糊检查architecture.md 中##标题里的关键名词应出现在src/execution/的代码桩中保证文档中的组件图与代码中的实现没有漂移。algorithm.md数学形式化LaTeX→ 伪代码 → 逐步解释 → 复杂度分析。constraints.md边界条件、假设、已知局限——把方案不能做什么显式写出来防止下游 Agent 越界使用。heuristics.md收敛技巧与工程窍门每个启发式必须包含全部字段## H{NN}: {Short description} - **Rationale**: {Why this trick is needed} - **Sensitivity**: {low|medium|high} - **Bounds**: {acceptable range or limits} - **Code ref**: [{path to src/execution/ file}] - **Source**: {Section/table in the paper}Code ref必须解析到src/execution/下真实存在的文件——这是另一处跨层绑定启发式与实现代码一一对应读者可以沿着 H01 → 代码桩直接看到技巧的落地。5.6 logic/related_work.md类型化依赖图## RW{NN}: {Author et al., Year} - **DOI**: {DOI or arXiv ID} - **Type**: {imports|bounds|baseline|extends|refutes} - **Delta**: - What changed: {specific technical delta} - Why: {motivation} - **Claims affected**: {claim IDs} - **Adopted elements**: {what was kept}Type五种取值imports、bounds、baseline、extends、refutes把相关工作从参考文献列表升级为带技术差异Delta的依赖图直接回答这篇论文站在谁的肩上、压过了谁、反驳了谁。Schema 特别强调具有具体技术 Delta 的工作写完整 RW 块论文中其余无技术 Delta 的引用背景、历史、基础设施、行内比较也要简要捕获以保留论文的完整引用足迹citation footprint——SKILL.md 在 Stage 2 中同样要求related_work.md反映论文的完整引用邻域而非仅最近的先驱。六、物理层src/可执行的落地细节物理层把方案固化为可复现的配置与代码桩是实验可直接消费的部分。6.1 src/configs/training.md 与 src/configs/model.md两个文件共用同一字段格式前者管训练超参数后者管模型/架构配置## {Parameter name} - **Value**: {exact value} - **Rationale**: {why this value} - **Search range**: {if mentioned} - **Sensitivity**: {low|medium|high} - **Source**: {section/table}每一个参数都要同时回答是多少、为什么是这个值、在什么范围内搜索过、改它影响多大、出处在哪里。Rationale字段把超参数从黑盒数字变成有论证的决策Source字段则保证每个值都能回溯到论文中的小节或表格。6.2 src/execution/{module}.py最小代码桩代码桩的约束直接决定了它的定位——只实现新颖贡献不实现工程外壳类型化函数签名输入/输出类型、张量形状Docstring 说明每个函数做什么实现逻辑聚焦于**新颖贡献NOVEL contribution**本身无脚手架无 argparse、无 logging、无分布式封装只导入标准库 torch/numpy。它是一份算法真身而不是可独立运行的工程。当编译输入包含真实代码仓库时编译器会利用实际代码提升代码桩的精确度SKILL.md Stage 3 明确If repo available: use actual code to improve stub precision。Seal Level 1 要求src/execution/下至少存在 1 个.py文件。6.3 src/environment.md可复现环境清单# Environment - **Python**: {version} - **Framework**: {PyTorch version, etc.} - **Hardware**: {GPU type, count, memory} - **Key dependencies**: {list with versions} - **Random seeds**: {if specified}硬件、框架、依赖版本与随机种子四要素齐备任何 Agent 都能据此判断这个实验在我当前环境能否跑、跑出来是否可比。七、探索图trace/exploration_tree.yaml研究过程的 git logexploration_tree.yaml是研究的 git log——一份结构化、可遍历的、记录塑造最终结果的每一条成功分支、失败尝试与设计决策的记录。Schema 要求每个节点区分直接源支撑与重建推断tree: - id: N01 type: question support_level: explicit | inferred source_refs: [Table 2, §4.1] # 推荐用于 explicit 节点 title: {...} description: {...}核心规则support_level: explicit表示节点直接植根于提供的源材料此类节点应带source_refs表格/图/小节引用support_level: inferred表示节点是对论文逻辑的重建而非逐字会话记录推断节点绝不能被呈现为直接观察到的历史事件——这是防幻觉的硬边界。完整的节点类型与字段契约在 exploration-tree-spec.md 中定义五种节点类型question、experiment、dead_end、decision、pivot各有必填字段dead_end失败路径被明确标注为对下游 Agent 最有价值的节点类型——它没有子节点、恒为叶节点专门用来保存为什么这条路走不通让后来的 Agent 不必重蹈覆辙also_depends_on用于表达 DAG 汇合点多父节点。抽取策略给出了从论文语言到节点类型的对应关系We tried X→experiment、We considered X but chose Y because…→decision、this approach fails because…→dead_end、We initially pursued X but found…→pivot。Seal Level 1 对探索图的检查最为严格YAML 必须可解析、有顶层tree键、递归计数 ≥8 个节点、必须同时包含至少 1 个dead_end和 1 个decision节点、每个节点有id/type/support_level、类型专属字段齐全如dead_end必须有hypothesis/failure_mode/lesson、所有also_depends_on引用都能解析到已有节点 ID。八、证据层evidence/精确数值的唯一归宿8.1 evidence/README.md证据索引README.md是证据层入口用两张表把每个证据文件映射到其支撑的断言## Tables | File | Source | Claims | Description | |------|--------|--------|-------------| | tables/{name}.md | Table N, §X.Y | C01, C02 | {one sentence} | ## Figures | File | Source | Claims | Description | |------|--------|--------|-------------| | figures/{name}.md | Figure N, §X.Y | C03 | {one sentence} |8.2 evidence/tables/{name}.md精确单元格值所有结果表都必须保留精确单元格值# Table N: {Title} - **Source**: Table N, Section X.Y - **Caption**: {caption} | Column1 | Column2 | ... | |---------|---------|-----| | exact | values | ... |原始源表转录模板则额外携带Extraction type: raw_table派生子集则标注Extraction type: derived_subset与Derived from父源详见第四节。三条红线原始表应复现该表的完整相关行集而非某断言的切片删行就必须改名派生子集并声明父源不得在文件名保留单一原始表号的同时混入多张源表的行。8.3 evidence/figures/{name}.md从图到数据点所有定量图非示意图都要把数据点提取为表格并用≈标记近似读数# Figure N: {Title} - **Source**: Figure N, Section X.Y - **Caption**: {caption} - **Axes**: X {label, units}, Y {label, units} | X | Y (Series A) | Y (Series B) | ... | |---|-------------|-------------|-----| | v | v | v | ... |Seal Level 1 的证据质量检查逐文件验证必须含 Markdown 表格、必须含Source字段、文件名中的table{N}/figure{N}必须与Source字段一致、派生子集必须显式声明、原始源表不得静默删行。evidence/tables/或evidence/figures/至少要有 1 个.md文件。九、附录来源内容与 rubric附录内容路由论文附录常携带逐步演算示例、提示词模板、枚举型分类法、标注 Schema、扩展分析与规范性内容。Schema 要求把它们路由到最合适的 ARA 层保留源所使用的粒度例如分类法要保留逐条描述字段而不是坍缩成名称 频次只有当现有层内没有自然归属时才新建文件。校验器的 Appendix Coverage 检查validation-checklist.md 第 5b 节要求当源含附录时每个附录小节都应能追溯到至少一个 ARA 文件。rubric/requirements.md仅当提供 rubric 时生成当编译过程伴随 PaperBench 之类的专家评审 rubric 时生成叶级需求映射# Rubric Requirements — {paper_id} **Source**: PaperBench expert-authored reproduction rubric **Total leaf requirements**: {N} ## {Category Group} ### R{NN}: {Short title} - **Rubric ID**: {uuid} - **Category**: {task_category} / {finegrained_task_category} - **Weight**: {weight} - **Requirement**: {verbatim from rubric} - **ARA coverage**: {path to most specific ARA file, or Not covered} - **Key detail**: {exact value from paper, or Not specified in paper}ARA coverage与Key detail两列是rubric 与 ARA之间的桥梁前者把每条评审要求指向 ARA 中最具体的文件不覆盖则如实写 Not covered后者记录论文中的精确值论文未给出则写 Not specified in paper——把评审要什么与ARA 给了什么的差距显式暴露出来。十、Schema 在编译工作流与校验器中的落地ara-schema.md不是孤立规范它与同一 skill 下的工作流文档闭环运行生成侧compiler/SKILL.md 定义四阶段认知推理链Stage 1 语义解构 → Stage 2 认知映射 → Stage 3 物理桩 → Stage 4 探索图抽取每个阶段的产出目标都精确对应 Schema 的某一层语义解构产出证据捕获认知映射产出logic/六文件物理桩产出src/三文件探索图抽取产出trace/exploration_tree.yaml。完整性侧Coverage Check Loop最多 3 轮在结构校验之前先做语义完备性检查——重读源、diff ARA、补缺口尤其盯住附录与参考文献列表这两个首轮易漏区。校验侧validation-checklist.md 的 Seal Level 1 校验器按目录存在性、强制文件非空10 字节、PAPER.md 结构、逐文件字段正则、数量下限≥5 概念、≥3 实验、≥1 代码桩、≥1 证据文件、证据质量、探索图、跨层绑定九大类执行全部检查验证失败则回到第 6 步修复并重跑通常在 23 轮内收敛。持续运营侧同目录下 research-manager 的 session-protocol.md 展示了同一套结构在进行中的研究场景的用法——实时把决策写入exploration_tree.yaml、失败写 dead_end、断言写claims.md、技巧写heuristics.md并通过 provenance 标签区分user、ai-executed、ai-suggested、user-revised等来源。Schema 因此同时服务于论文编译与研究过程追踪两种生命周期。十项关键纪律速查综合 Schema 与 SKILL.md Critical Rules① 数值一律精确转录、绝不四舍五入② 禁止虚构源中不存在的断言、结果与启发式③ 实验计划禁止精确数值精确数值只在evidence/④ 每个断言必须有指向实验 ID 的 Proof⑤ Claims ↔ Experiments ↔ Evidence ↔ Code refs 四层引用必须全部解析⑥ 死路失败路径必须记录⑦ 信息缺失写 Not specified in paper 而非猜测⑧ 派生子集不得伪装成原始Table N/Figure N⑨ 不虚构探索轨迹推断节点必须标记inferred⑩ 措辞不得超越证据类型直接观察与综合解释分离。至此一份合格的 ARA 便具备了入口经济PAPER.md 三层披露、思想严谨可证伪断言 方向性实验、实现可复现配置 代码桩 环境、过程可审计探索图 证据绑定、质量可机器校验Seal Level 1的全部要素——这正是 Agent 能够独立消费、验证与继续推进研究产物的根本前提。赞分享AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载相关推荐Plate 仓库中的 Agent 研究层docs/research搭建指南从原始证据到编译式知识Plate 仓库中的 Agent 研究层docs/research搭建指南从原始证据到编译式知识 导读 本文围绕 Plate 仓库中一份名为 agent前端富文本UI组件【亲测免费】 sionna下一代物理层研究的开源库sionna下一代物理层研究的开源库 项目介绍 在数字通信系统的研究与开发领域模拟和仿真工具是不可或缺的。sionna 是一个开源的 Python 库旨在通信科研创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。