尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

87% 未违约与 13% 违约:投研 AI 的判断会相同吗?

发布时间:2026/9/26 5:27:22

资讯中心
01
ARTICLE

87% 未违约与 13% 违约:投研 AI 的判断会相同吗?

87% 未违约与 13% 违约:投研 AI 的判断会相同吗?
温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。作者丁闪闪 (连享会)邮箱lianxhcn163.comTitle: 87% 未违约与 13% 违约投研 AI 的判断会相同吗Keywords: 表述方式偏差, 表述敏感性压力测试, 投研 Agent, LLM, 行为金融, 模型评估Source: Tait and Pisaneschi (2026),Managing LLM Bias in Investing: From Detection to Mitigation提要: 同一组财务信息如果只是改变表述方式LLM 给出的评分、风险判断和投资建议会不会跟着变化本文介绍一种面向投研 Agent 的表述敏感性压力测试 (framing stress test)。核心做法是构造经济含义完全相同的成对提示词在控制模型、数据和工具环境不变的条件下比较评分、决策、置信度以及 Agent 的证据搜索路径并据此诊断和缓解表述方式偏差 (framing bias也称框架偏差)。1. 同一组数字换个说法判断会不会变假设某公司的客户留存率为 77%。我们可以把这条信息写成过去一年公司保留了 77% 的客户。也可以写成过去一年公司流失了 23% 的客户。在同一期初客户群体、同一时间区间且留存与流失穷尽全部客户状态的口径下两句话在数学上完全等价。对于一个稳定的分析系统如果要求它评价公司的客户关系管理能力最终判断原则上不应该因为这两个表述发生明显变化。图中的评分与投资建议用于示意不是原报告或本文实测结果。但 LLM 未必如此。Tait and Pisaneschi (2026) 在 CFA Institute 发布的一份研究报告中系统测试了多个投资管理场景。作者将经济含义完全相同的信息分别改写为正向和负向表达再让 LLM 对投资决策相关问题进行评价。沿用报告的测试思路可以构造以下互补表述77% 的资本得到保护与 23% 的资本发生损失85% 的债券发行人未违约与 15% 的发行人违约78% 的策略跑赢 benchmark与 22% 的策略未跑赢 benchmark77% 的客户被保留与 23% 的客户流失。实验发现表述方式的变化确实会影响部分模型的评价而且这种影响在回撤管理和客户留存等任务中较为明显。这一现象可以放在经典的框架效应 (framing effect)中理解。Tversky and Kahneman (1981) 指出即使决策问题在实质上完全等价不同的表达方式仍可能改变人的选择。Levin, Schneider, and Gaeth (1998) 后来进一步区分了不同类型的框架效应其中与上述实验最接近的是属性框架效应 (attribute framing)同一个属性分别以正向和负向方式描述从而影响评价结果。把这个问题移到 AI 投研场景中真正需要检查的是一种描述不变性 (description invariance)f(X,P)≈f(X,P−),f(X,P)≈f(X,P−),其中 XX 表示客观经济信息PP 和 P−P− 表示两种经济含义相同、表达方向不同的 prompt。如果 XX 完全相同仅仅改变表述方式模型的投资判断却在重复测试中出现超出随机波动的系统差异就有证据表明系统存在表述方式偏差 (framing bias)也可以说它对表述方式过于敏感。2. 为什么投研 Agent 比普通聊天模型更值得测试普通 LLM 的表述方式偏差通常体现在一次回答中比如评分从 4 分降到 3 分。下面对搜索路径与证据选择的讨论是面向 Agent 的测试设计延伸不是上述报告已经验证的完整工作流结果。投研 Agent 的问题更复杂因为它往往会继续执行后续任务Prompt→Initial judgment→Search→Data retrieval→Evidence selection→Recommendation.Prompt→Initial judgment→Search→Data retrieval→Evidence selection→Recommendation.初始判断一旦受到表述方式影响后续搜索和证据选择也可能发生变化。例如同一家公司的客户留存数据分别以 77% 留存和 23% 流失的方式输入。如果第一个版本让 Agent 倾向于认为客户关系良好它后续搜索时可能更关注复购率、品牌忠诚度和客户生命周期价值。第二个版本如果让 Agent 产生较悲观的先验判断则可能更积极搜索投诉、竞争压力和客户流失原因。最后生成的两份报告可能都事实正确、引用充分甚至逻辑也相当完整但它们使用的证据集合已经不同。因此对 Agent 做表述敏感性压力测试时仅比较最终文本是不够的。至少应同时检查最终评分投资建议判断置信度搜索关键词调用的工具阅读的数据或文档最终引用的证据。对于真正进入投研流程的 Agent后面几项往往比回答措辞本身更有意义。3. 怎样设计一个表述敏感性压力测试实际实施并不复杂。困难主要在实验设计必须确保两个 prompt 在经济含义上真正等价。3.1 Step 1先确定需要保持不变的信息设原始信息为 XX。测试前应明确哪些内容必须固定。通常包括数值本身分母和统计口径时间区间benchmark样本范围市场环境投资约束要求 Agent 完成的任务输出尺度。例如公司过去一年保留了 77% 的客户。对应的负向版本可以写成公司过去一年流失了 23% 的客户。这是一组有效的 prompt pair。但下面这一组就不合适公司保留了 77% 的客户。与23% 的客户对公司服务不满意。因为「客户流失」与「客户不满意」并不是同一个变量。此时即使 Agent 给出不同结论也不能归因于表述方式偏差。3.2 Step 2一个指标设计多个 prompt pair不要只测试一个 77/23 的例子。例如客户留存场景可以构造70% retained / 30% churned77% retained / 23% churned85% retained / 15% churned92% retained / 8% churned。这样可以检查这种表述效应是否只在某一个特殊数字附近出现。进一步还可以在多个投研任务中测试公司基本面客户留存率 / 客户流失率毛利率 / 营业成本占营业收入的比例非不良贷款比例 / 不良贷款比例。固定收益未违约比例 / 违约比例investment grade 比例 / speculative grade 比例。基金评价跑赢 benchmark 的月份比例 / 未跑赢的月份比例最大回撤期间保全比例 / 损失比例。风险管理损失未超过 VaR 阈值的交易日比例 / 损失超过该阈值的交易日比例。上述比例都要使用同一分母、时期和分类口径。例如信用评级比例仅针对已评级样本跑赢与未跑赢将持平结果归入后者。测试场景最好来自 Agent 实际承担的任务。3.3 Step 3冻结模型环境同一组实验中除了表述方式其他条件都应保持一致。至少记录model model_version system_prompt temperature tools retrieval_database data_snapshot memory_setting run_time如果正向 prompt 在周一测试负向 prompt 在两周后测试而模型版本、数据库和新闻信息都已经更新那么两个结果之间的差异不能简单解释为表述效应。对于带 RAG 或联网搜索的 Agent这一点尤其关键。每次运行应重置对话和记忆随机安排正负表述的执行顺序并保留同一表述重复运行的结果作为随机波动基线。温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。