尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

azure-search-openai-demo RAG 评估对比:非代理检索与 Agentic 检索(minimal 档)的量化对决

发布时间:2026/9/16 16:55:38

资讯中心
01
ARTICLE

azure-search-openai-demo RAG 评估对比:非代理检索与 Agentic 检索(minimal 档)的量化对决

azure-search-openai-demo RAG 评估对比:非代理检索与 Agentic 检索(minimal 档)的量化对决
azure-search-openai-demo RAG 评估对比非代理检索与 Agentic 检索minimal 档的量化对决【免费下载链接】azure-search-openai-demoA sample app for the Retrieval-Augmented Generation pattern running in Azure, using Azure AI Search for retrieval and Azure OpenAI large language models to power ChatGPT-style and QA experiences.项目地址: https://gitcode.com/GitHub_Trending/az/azure-search-openai-demo本篇技术指南围绕 gpt54-nonagentic-vs-minimal.md 这份评估对比报告展开详细拆解 azure-search-openai-demo 项目中「非代理检索non-agentic」与「启用 Azure AI Search Agentic 检索、推理档位设为 minimal」两种检索方案在 50 道 ground truth 问题上的评测结果、统计检验方法及其实际含义。读完本文你将掌握该仓库评估体系的指标定义、Bootstrap 置信区间与配对置换检验的判定逻辑以及如何用 eval_compare.py 自行复现并解读类似的方案对比实验。一、实验背景两种检索方案到底在比什么azure-search-openai-demo 默认的 RAG 流程是「检索—增强—生成」的单轮检索范式将用户问题与对话历史拼装成检索意图从 Azure AI Search 索引中取回 top-K 文档块再交由 Azure OpenAI 大模型生成回答。与之相对仓库在docs/agentic_retrieval.md中提供了可选的Agentic 检索agentic retrieval功能由 LLM 分析对话上下文、生成多个检索查询并在low/medium档位下借助 Azure AI Search 的查询规划能力query expansion、知识源选择寻找最相关内容以改善复杂、多面问题的回答质量。本对比实验正是为了回答一个工程问题把检索从非代理切换为 Agentic 检索并把其内部推理档位调到最低的minimal回答质量是否真的更好代价又是什么需要特别说明的是minimal档位的语义。按 docs/agentic_retrieval.md 的说明minimal会禁用Azure AI Search 的 LLM 查询规划功能改为先把对话改写为单一检索意图并请求extractiveData从而把 token 消耗与延迟降到最低。因此本实验对比的并非「完整版 Agentic 检索」而是「单意图改写版 Agentic 检索」与「传统非代理检索」的等价较量。二、实验设置数据、配置与分组2.1 分组与数据GroupRunsQuestionsConfig consistentTest datanon-agentic150Trueground_truth.jsonlminimal150Trueground_truth.jsonl两组各执行 1 次完整评估运行均覆盖 ground_truth.jsonl 中的 50 道问题Config consistent True表示组内配置一致单次运行时该字段天然为真多运行组中则由配置规范化签名是否唯一决定见下文源码解析。2.2 两组实际生效的运行参数报告中minimal组的实验数据对应 gpt54-agentic-minimal-run2/config.jsonnon-agentic组对应 gpt54-nonagentic-run1/config.json。两份配置的绝大部分参数完全相同仅两处关键差异参数non-agenticminimal说明use_agentic_knowledgebasefalsetrue是否启用 Agentic 检索retrieval_reasoning_effort未设置minimalAgentic 检索的内部推理档位其余共用的检索与生成参数如下来自两份 config.json 的overrides可直接作为实验基线参考top: 5——返回 Top-5 文档块results_merge_strategy: interleaved——多路结果交错合并temperature: 0.3——生成温度minimum_reranker_score: 0、minimum_search_score: 0——不做最低分数过滤retrieval_mode: hybrid——混合检索关键词 向量semantic_ranker: true、semantic_captions: false——启用语义排序、关闭语义摘要query_rewriting: false——关闭基于工具的查询改写reasoning_effort: low——生成侧推理档位 lowsearch_text_embeddings: true、search_image_embeddings: true——同时启用文本与图片向量send_text_sources: true、send_image_sources: true——把文本与图片来源一并下发给模型language: en、seed: 1——语言与随机种子。两组的target_url均为http://localhost:50505/chat答案字段经output_textJMESPath 提取上下文数据点经context.data_points.text提取保证对比口径一致。三、指标全景两组逐项均值与 95% 置信区间报告第二部分对每组每项指标给出均值、95% Bootstrap 置信区间与样本量 nGroupMetricMean95% CInnon-agenticgpt_groundedness.pass_rate0.9600[0.9000, 1.0000]50non-agenticgpt_groundedness.mean_rating4.6800[4.4800, 4.8400]50non-agenticgpt_relevance.pass_rate0.9600[0.9000, 1.0000]50non-agenticgpt_relevance.mean_rating4.2600[4.1200, 4.4000]50non-agenticanswer_length.mean632.8200[555.3600, 712.7000]50non-agenticlatency.mean3.8346[3.3511, 4.5101]50non-agenticcitations_matched.rate0.4700[0.3500, 0.5900]50non-agenticany_citation.rate0.9800[0.9400, 1.0000]50minimalgpt_groundedness.pass_rate0.9600[0.9000, 1.0000]50minimalgpt_groundedness.mean_rating4.6600[4.4600, 4.8400]50minimalgpt_relevance.pass_rate0.9800[0.9400, 1.0000]50minimalgpt_relevance.mean_rating4.2400[4.1000, 4.3800]50minimalanswer_length.mean695.0400[607.3400, 793.8400]50minimallatency.mean3.9298[3.5886, 4.3488]50minimalcitations_matched.rate0.5000[0.3900, 0.6100]50minimalany_citation.rate1.0000[1.0000, 1.0000]50初步读数仅基于均值显著性见下一节忠实度groundedness两组通过率均为 96%48/50均分 4.68 vs 4.66几乎打平相关性relevanceminimal 组通过率 98%49/50略高于 non-agentic 的 96%48/50均分 4.26 vs 4.24差距很小答案长度minimal 组平均 695 字符比 non-agentic 的 633 字符长约 10%95% 置信区间仍有交叠延迟minimal 组均值 3.93 秒 vs 3.83 秒仅慢约 0.1 秒说明minimal档确实没有引入显著的规划开销引用citations_matched命中率 0.50 vs 0.47any_citation命中率 1.00 vs 0.98minimal 组 50/50 全部包含至少一条引用non-agentic 为 49/50。对照同目录下的 gpt54-agentic-vs-baseline.md 可形成重要参照完整版 Agentic 检索非 minimal 档的平均延迟高达 17.47 秒、citations_matched显著下降而本报告中的 minimal 档将延迟压回 3.93 秒说明「降档」对控制代价非常有效。四、成对显著性检验所有差异均不显著报告第三部分是核心结论来源——以 non-agentic 为基准Baseline、minimal 为候选Candidate对 50 道配对问题逐指标计算均值差、95% 置信区间与 p 值CandidateMetricBaseline meanCandidate meanDelta95% CI for deltap-valueSignificantPaired questionsminimalgpt_groundedness.pass_rate0.96000.96000.0000[-0.0800, 0.0800]1.0000False50minimalgpt_groundedness.mean_rating4.68004.6600-0.0200[-0.2800, 0.2000]1.0000False50minimalgpt_relevance.pass_rate0.96000.98000.0200[-0.0400, 0.0800]1.0000False50minimalgpt_relevance.mean_rating4.26004.2400-0.0200[-0.2000, 0.1800]1.0000False50minimalanswer_length.mean632.8200695.040062.2200[-4.2600, 134.3600]0.0794False50minimallatency.mean3.83463.92980.0952[-0.5043, 0.6602]0.7700False50minimalcitations_matched.rate0.47000.50000.0300[-0.0300, 0.0900]0.5034False50minimalany_citation.rate0.98001.00000.0200[0.0000, 0.0600]1.0000False50解读要点全部 8 项指标Significant False在 α 0.05 显著性水平下minimal 与 non-agentic 之间没有任何一项指标呈现出统计上可区分的差异。换句话讲在 50 道样本问题上切换到 minimal 档的 Agentic 检索既没有带来可证明的质量提升也没有带来可证明的质量回退。有趣的接近显著项answer_length.mean的 p 值为 0.0794是全场最低。虽然仍不显著但 delta 62.22 字符与 CI 上界 134.36 表明 minimal 组存在「答案更长」的倾向这与 ground truth 数据集中回答较长有关联的可能值得在更大样本上复核。p 1.0000 的条目如 groundedness 通过率 delta 恰为 0以及 any_citation 通过率98%→100%配对置换检验给出 p 1.0即观测到的差异在随机符号翻转下极易复现几乎可断定无差别。CI 跨越 0所有 delta 的 95% 置信区间都包含 0从区间估计角度同样支持「无显著差异」的结论这是比单纯看 p 值更稳健的判读方式。五、统计方法源码级拆解CI 与置换检验是如何算出来的报告中的置信区间与 p 值并非黑盒产物其完整实现位于 eval_compare.py关键逻辑如下。5.1 指标提取器METRIC_EXTRACTORSeval_compare.py通过METRIC_EXTRACTORS字典把每条 JSONL 结果行映射为指标值eval_compare.pygpt_groundedness.pass_rate评分 ≥PASSING_SCORE4计 1否则计 0见groundedness_pass_valuegpt_groundedness.mean_rating直接取 LLM 评分answer_length.mean、latency.mean取结果行对应字段citations_matched.rate取 0~1 之间的匹配比例any_citation.rate布尔值转 1.0/0.0。注意gpt_前缀字段兼容逻辑row.get(gpt_groundedness, row.get(groundedness))同时支持新旧两种列名。5.2 Bootstrap 置信区间mean_confidence_intervaleval_compare.py对每个指标的 50 个逐题取值执行有放回重采样默认DEFAULT_BOOTSTRAP_ITERATIONS 5000次计算每次抽样的均值后取排序序列的 2.5% 与 97.5% 分位作为 95% CIpercentile_bounds。若样本仅 1 个值则直接返回该值本身。5.3 配对置换检验paired permutation testpaired_permutation_p_valueeval_compare.py回答「两组差异是真实的还是噪声」对每个配对问题计算candidate − baseline的差值 delta小样本≤16 题穷举全部 2^16 65536 种符号翻转组合统计均值绝对值 ≥ 观测值的比例大样本用固定种子DEFAULT_RANDOM_SEED 0随机翻转符号DEFAULT_BOOTSTRAP_ITERATIONS次近似significant p_value alpha默认alpha 0.05见compare_groups。配对设计意味着每个问题充当自己的对照能够吸收「题目难度」这一混杂因素比两组独立均值对比更灵敏——这正是本报告能给出精确到 4 位小数 p 值的原因。六、指标口径这些数字到底衡量什么要正确解读报告必须理解每项指标的精确口径其定义都可在评估工具源码中找到。6.1 LLM 评审指标builtin_metrics.pygpt_groundedness与gpt_relevance由 builtin_metrics.py 映射到azure-ai-evaluation的GroundednessEvaluator与RelevanceEvaluator并以is_reasoning_modelTrue构造使推理模型如 gpt-5 系列能正确发送max_completion_tokens参数pass_rate的通过阈值为评分 ≥ 4满分 5 分制。代码注释同时说明gpt_*注册名是为兼容历史基线而保留实际聚合读取无前缀列如groundedness、relevance。6.2 代码计算指标code_metrics.pycitations_matched 用CITATION_REGEX分别抽取 ground truth 与回答中的全部引用 token形如[Document.pdf#page7]、[Document.pdf#page4(figure4_1.png)]支持 pdf/html/docx/xlsx/csv/txt/json 及常见图片扩展名计算回答中命中 ground truth 引用集合的比例ground truth 无引用时置 -1 并剔除出聚合。any_citation仅判断回答是否包含至少一条引用answer_length取回答字符数latency由 evaluate.py 中r.elapsed.total_seconds()测得。这些口径解释了报告中的一个细节citations_matched.rate明显低于any_citation.rate——因为前者要求引用与标准答案逐一精确匹配标准远高于「只要有引用」。七、如何复现这份对比实验7.1 前置跑出两组结果目录先按 docs/evaluation.md 完成评估环境搭建部署评估模型、pip install -r evals/requirements.txt、生成 ground truth再分别以两套 overrides 运行 run_evaluate.py其入口从环境变量读取AZURE_OPENAI_ENDPOINT、AZURE_OPENAI_EVAL_DEPLOYMENT、AZURE_OPENAI_EVAL_MODEL并默认加载evaluate_config.jsonpython evals/run_evaluate.py --resultsdir evals/results/gpt54-nonagentic-run1 python evals/run_evaluate.py --resultsdir evals/results/gpt54-agentic-minimal-run2其中后一次运行需通过evaluate_config.json或等效方式传入use_agentic_knowledgebase: true、retrieval_reasoning_effort: minimal的 overrides即上文 2.2 节参数。7.2 生成对比报告使用 eval_compare.py 的--group参数把运行目录归入具名分组并用--reference指定基准组python evals/eval_compare.py \ --group non-agenticevals/results/gpt54-nonagentic-run1 \ --group minimalevals/results/gpt54-agentic-minimal-run2 \ --reference non-agentic该脚本默认输出 Markdown 报告--format json可输出机器可读结果--output可写文件支持--bootstrap-iterations、--seed、--alpha调整统计参数。报告中的 Group Summary 表格即由render_markdowneval_compare.py按固定模板生成你看到的这份文档正是该流程的产物。八、结论与工程启示综合三张表格与统计检验可以得出如下经数据支持的结论在 50 道样本题上minimal 档 Agentic 检索与传统非代理检索在质量上无统计显著差异忠实度、相关性、引用命中均打平因此它不构成质量回退minimal 档的代价可忽略延迟仅增加约 0.1 秒3.93s vs 3.83s远低于完整版 Agentic 检索高达十几秒的规划开销验证了minimal档「低 token、低延迟」的设计目标引用完整性略有改善倾向minimal 组any_citation达到 100%、citations_matched均值略高虽不显著但与 minimal 档「先改写为单意图再检索」的机制一致选型建议若你的场景以简单问题为主、对延迟敏感保持use_agentic_knowledgebase: false或选用 minimal 档均合理若需处理复杂多面问题应参考 docs/agentic_retrieval.md 将AZURE_SEARCH_KNOWLEDGEBASE_RETRIEVAL_REASONING_EFFORT提升到low/medium并以本文的方法自行做一次带显著性检验的对比评估来验证收益。最后提醒两点实验卫生其一样本仅 50 题answer_length的 p 值0.0794表明某些差异在大样本下可能浮现复现时可扩大 ground truth 规模建议至少 200 题见 docs/evaluation.md其二比较延迟前务必按文档检查目标部署是否存在隐藏的 429 限流避免把节流等待误读为方案本身的延迟差异。【免费下载链接】azure-search-openai-demoA sample app for the Retrieval-Augmented Generation pattern running in Azure, using Azure AI Search for retrieval and Azure OpenAI large language models to power ChatGPT-style and QA experiences.项目地址: https://gitcode.com/GitHub_Trending/az/azure-search-openai-demo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。