尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Seedance 2.0 Eval Rubric 深度解析:从 0-3 通用评分到 V6 序列门禁与 prompt 架构评审的迁移契约

发布时间:2026/9/29 5:56:37

资讯中心
01
ARTICLE

Seedance 2.0 Eval Rubric 深度解析:从 0-3 通用评分到 V6 序列门禁与 prompt 架构评审的迁移契约

Seedance 2.0 Eval Rubric 深度解析:从 0-3 通用评分到 V6 序列门禁与 prompt 架构评审的迁移契约
AI 技能AI 评测提示工程人工智能媒体生成【免费下载链接】seedance-2.0Comprehensive production pipeline for quad-modal AI filmmaking with Seedance 2.0项目地址https://gitcode.com/gh_mirrors/se/seedance-2.0点击查看免费下载本篇技术指南以仓库 references/eval-rubric.md 为核心骨架系统梳理 Seedance 2.0 四模态 AI 影视制作流水线中的三层评估体系面向全部案例的 0-3 通用评分、面向序列状态评估的 V6 0-4 评分以及 prompt 架构压力测试从architecture-v2-nonlexical迁移到architecture-v3-advisory-length的门禁契约。读者读完将掌握每个评分档位的判定标准、发布阈值、scripts/prompt_architecture_stress.py的 CLI 用法与 JSON 输出字段含义并能准确区分确定性机械门禁与需要人类评审的语言/创意质量主张之间的证据边界。一、评估体系总览每个 eval 案例必须验证的四件事rubric 的第一句话定义了本仓库所有评估案例的统一验收维度激活正确性activation、输出结构output structure、安全行为safety behavior与 prompt 可用性prompt usefulness。也就是说任何一个评估案例都不能只检查模型是否调对了技能还必须同时确认输出的结构是否合格、是否存在安全或合规问题、以及产出是否真的可以直接作为生成 prompt 投入使用。这四个维度共同构成了每次评估的检查清单。在此基础上所有 legacy 案例采用 0-3 四档评分语义如下分数判定0技能调用错误wrong skill或产生不安全输出unsafe output1技能部分命中partial skill match但输出结构差poor structure2结构正确但存在次要遗漏minor omissions3激活正确、输出简洁、安全感知到位、可直接作为 prompt 使用发布门槛当且仅当每一个 legacy 案例得分至少为 2且legacy 案例平均分至少为 2.6时该 release 才算通过。这里有一个必须反复强调的边界该模型评委model-judge分数只是关于抽样响应相对已声明断言的证据不是语言、文化、作者身份、评审人或渲染能力的认证。特别是中文、日文、韩文的语言质量主张必须走 references/multilingual-native-review.md 中定义的独立人类评审协议——机器分数永远不能替代它其规范 fixture 在人类评审完成之前保持pending_native_review状态。二、V6 Sequence Rubric序列状态评估的 0-4 评分与发布门槛当评估对象是**序列状态sequence-state**时评分尺度升级为 0-4 五档覆盖的范围也从单条 prompt 扩展到了整条序列的连续性分数判定0行为失败或造成安全/连续性回归safety/continuity regression1提到了正确的思路但遗漏了操作要求operational requirements2部分满足行为存在重要缺口3满足行为仅有次要遗漏4完全满足行为并保留了所有相关约束V6 序列评分要评估的维度清单共 11 项路由正确性routing correctness、故事架构story architecture、clip 范围控制clip-scope control、实际状态锚定actual-state grounding、连续性完整性continuity integrity、参考绑定reference binding、模式与 surface 选择mode and surface selection、端点质量endpoint quality、prompt 架构prompt architecture、不确定性处理uncertainty handling、安全与权利safety and rights。这些维度与 references/sequence-project-state.md、references/continuation-handoff.md 等序列文档所定义的工程契约一一对应。V6 序列发布门槛更为严格四个条件必须同时满足所有关键延续critical continuation案例得分均为 4没有任何维度得分低于 3总体平均分至少为 3.5既有的 standalone 行为不得发生回归。从源码结构看序列评估相关的约束还与 scripts/sequence_eval_check.py、tests/test_sequence_eval.py 中的行为契约相互印证例如连续性链检查与 take 对账逻辑参见 scripts/continuity_chain_check.py、scripts/project_state_check.py。三、--strict门禁的真实语义逐案例的维度下限而非平均分rubric 专门澄清了一个容易误解的点对于scripts/prompt_architecture_stress.py --strictno dimension below 3 指的是每一个skill_formula案例上的每一个适用阻断维度都必须不低于 3而不是对整条 arm 的维度分数取平均。这意味着即使整条 arm 的平均分很高只要有一个案例在某个阻断维度上掉到 3 以下严格门禁就会失败——tests/test_prompt_architecture_stress.py 中的test_strict_rejects_one_subfloor_case_even_when_averages_pass正是对这一语义的回归测试。v3 门禁还做了两项重要的去压舱处理排除slop_free与length_fit这两个维度既不计入维度下限也不计入 arm 总体平均分保留其分数作为咨询信息词法标记lexical flags与固定长度分段fixed length bands仍被报告但仅作参考。同时arm 平均分仍须保持在 3.5 以上并且当**不同 brief 在实质上不同materially different**时跨案例出现重复或近重复 prompt 将直接判定失败。这一点在测试中有多个对抗性用例验证test_ten_identical_busker_prompts_for_unrelated_briefs_fail同一 prompt 套用到 10 个无关 brief 必失败、test_near_duplicate_with_one_subject_mutation_is_rejected仅替换一个主语也算近重复、test_reordered_duplicate_clauses_are_rejected重排分句仍被识别。需要明确的是这个确定性门禁的能力边界它只捕获结构性失败、相关性失败、显式矛盾失败和重复性失败它不评判创造力和原创性。比较性的创意质量评估必须依赖盲评模型评估blinded model evaluation与母语人类评审native-language human review。四、Advisory Lexical Scoreslop_free的词法代理语义在架构评审报告中lexical_v1列保留了 JSON 维度名slop_free以维持兼容性。需要理解的是它是一个固定的词法代理fixed lexical proxy不是对匹配到的词是废话的判定。其既有公式为max(0, 4 - 1.25 * U - E)其中U 在 prompt 中命中的去重列表词条数distinct listed terms matchedE 这些词中同时出现在 prompt前 25 个词内的词条数。报告中的密度density定义为每 100 个 tokenizer 词中去重匹配词条数而不是词频。前 25 词内的额外扣分被明确标注为历史测试权重historical test weight不是测量的模型 token 重要性——这一点在 scripts/prompt_architecture_stress.py 的lexical_flags与_score_lexical_flags实现中可以看到score 4.0 - 1.25 * len(hits) - 1.0 * len(head_hits)注释明确写着 Historical regression weights, not measured model token importance。每条 JSON 结果会附带lexical_review字段包含metriclegacy-lexical-v1matched_terms命中的词条early_matched_terms前 25 词内命中的词条unique_terms_per_100_words去重密度两个布尔字段的语义必须准确理解否则容易误读报告context_assessed: false表示扫描器没有判断某短语在此 brief 中是否有用rewrite_recommended: false表示扫描器自身不推荐重写但这不等于认证该 prompt 不需要修改空匹配列表只表示列表中的词一个都没匹配到不表示prompt 是原创的或优质的。为何词法扣分不足以做上下文判断rubric 给出了一张关键对照表说明哪些场景下词法扣分是不充分的需要人工审查的上下文词法扣分为何不充分选择了某种 cinematic 或 ultra-realistic 外观风格标签即使出现在列表中也可能承载真实意图包含 beautiful 的精确对白必需台词中的词不一定是多余的溢美之词明确的 8K 交付要求应把目标保持在受支持的设置内或说明差距而不是为了提分而删掉它未指明的 beautiful, cinematic, masterpiece 式赞美命中可提示审查缺失的决策但扫描器无法判断意图也无权替作者补充替换细节因此对标记语言的审查必须对照 brief 与 references/anti-slop-lexicon.md 进行并保留精确台词、参考绑定、有用的风格选择与交付要求。匹配器不会豁免引号内的文本也不会推断意图——单纯的关键词例外机制无法构成一个上下文感知的创意评审器。这一立场在测试LexicalEvidenceTests中被固化对(Chosen cinematic look with the existing locked framing., Make it cinematic.)这类配对两者得到的词法标记完全相同但context_assessed都是 false——扫描器必须诚实地暴露自己无法区分。五、Previous Gatearchitecture-v2-nonlexical理解 v3 之前必须先理解 v2因为 JSON 输出中的previous_gate字段正是对 v2 行为的保留快照。v2 迁移做了以下事情关键词列表、词法公式和每一个独立维度分数全部保持不变JSON 中的overall继续保留包含词法代理在内的 legacy 平均分v2 门禁只排除slop_free因此固定的词条分段fixed word bands仍然影响平均分和维度下限v2 使用非词法下限 3 和 arm 平均 ≥ 3.5重复与近重复检查仍然阻断并且对适用模式纳入了引用完整性reference integrity。rubric 特别指出两个边界感知要点有用的风格标签、带引号的台词或交付目标不能仅仅因为命中词法列表就导致门禁失败——v2 同样如此反之一个结构有效但挂着泛化形容词堆的 brief 可以通过门禁该门禁不评判其创意有用性。不相关、显式矛盾、重复、缺少参考绑定属于独立的失败类别仍然会被拦截。冻结语料库frozen corpus被保留用于前后对比迁移测试覆盖有用的被标记上下文、不变的 legacy 值、剩余的维度下限、不相关或重复的填充、以及真实 CLI 行为。本质上是改变了一个诊断项的角色而不是把它变成语义分类器或渲染质量改善的证据。六、Current Gatearchitecture-v3-advisory-length6.1 冻结的length_fit分段固定长度分段描述的是冻结的回归启发式不是普适的 Seedance prompt 预算也不是完整性测试。legacy 函数的计分规则在 scripts/prompt_architecture_stress.py 的score_length中逐行实现tokenizer 词数区间得分legacy 标签60-1004inside the documented 60-100 band40-593compact, inside the skills 40-110 lane101-1103long but inside the skills lane111-1401.5over budget 401.5under-specified 1400far over budgetunder-specified 和 over budget 是历史标签不是对当前 brief 的发现。因此规则很明确不要为了满足这些分段而去给一个已完整的短 brief 灌水也不要为了过门禁而删掉必需的台词。每条 JSON 结果新增length_review字段metric为legacy-word-bands-v1count与unit分别为计数与单位。计数是按空白切分的它不是模型 token 数也不是多语言单词数——一个不带空格的中文或日文句子计为 1 个 chunk一个连写的参考标签同样计为 1 个 chunk。因此不要用它来比较语言效率或设定本地化长度上限。context_assessed、user_limit_assessed、operation_limit_assessed、dialogue_timing_assessed、rewrite_recommended全部为 false没有执行任何完整性、合规性、时序或重写判断。测试test_report_does_not_certify_limits_timing_or_multilingual_length用(她放下琴弓。, 1)、(彼女は弓を下ろす。, 1)、(그녀는 활을 내린다., 3)、(Keep 图片1 unchanged, 3)分别验证了计数单位的确切语义。6.2 固定分段门禁之外的决策矩阵长度分段门禁覆盖不到的实际情况需要人工决策rubric 给出了处理矩阵固定分段门禁之外的决策必须的处理方式用户要求一个 40 词以内的简短 brief用其声明的单位尊重该请求在不灌水的前提下保留必要的动作与约束精确台词把草稿拉长保留用户要求的台词检查时序与 clip 范围若放不下则讨论拆分或授权编辑所选操作存在文档化的输入上限核对当前操作及其计数单位在提交前解决超限一个完整的 brief 没有声明长度约束审查相关性与清晰度仅凭词条分段得分既不能授权扩写也不能授权删减同时必须明确静态评估器不执行这些用户或平台限制也无法认证生成就绪。通过它不意味着可以无视某个限制、静默缩短台词、上传素材或花费点数credits。6.3 JSON 字段与 CLI 输出的三套平均值迁移后的输出契约如下gate_versionarchitecture-v3-advisory-lengthgate_dimensions除slop_free与length_fit之外的适用维度列表gate_overall这些维度的均值四舍五入到三位小数previous_gate保留 v2 的version、dimensions、overall仅排除slop_freeJSON 中的overall以及所有独立维度分数和备注保留 legacy 含义。CLI 输出中gate_v3、prior_v2与legacy三套平均值分别显示见 scripts/prompt_architecture_stress.py 的main()表格输出。消费方必须检查版本号而不是比较定义不同的均值。6.4 当前门禁条件与迁移测试最终的门禁规则是每个案例与每个适用阻断维度得分至少 3一条 arm 的四舍五入后的案例 gate 分数均值至少 3.5参考reference、相关性relevance、显式矛盾explicit contradiction、结构structure、覆盖coverage、开头opening、重复repetition检查仍然阻断跨 brief 的重复/近重复检查仍然阻断。这些是带自身局限的、未变的启发式。移除长度下限及其对均值的贡献会改变验收行为——即使数值阈值保持不变prior-v2 平均值只是对照物不是第二道门禁。迁移测试的覆盖面包括一个 40 词以下的完整 brief、一个超过 140 词的提供台词标本、不完整的短文本、重复的长填充、冻结分段边界和 CLI 边界。特别注意台词标本是离线回归用例不是平台能在单个 clip 内交付该段落的证据fixtures 与冻结语料库也都不是模型评估、母语评估或渲染评估。七、源码与测试如何固化这份契约7.1 压力测试脚本的三 arm 结构scripts/prompt_architecture_stress.py 对同一批 34 个 brief 评分三个 arm互相比较naive_onlinelisticle 或未受训用户会写的样式quickstart_stylev6.6.x 修复前入门示例教过的形态——作为冻结回归 arm 保留而非当前文档skill_formula严格按照seedance-prompt的 Director Formula 编写。该对比是对手写 fixture 的回归检查不是某一种方式能产出更好视频的证据。脚本离线且无依赖维度与 references/eval-rubric.md 的 V6 尺度一致共 9 个命名维度opening_authority开头权威性主句内的主语/动作或参考绑定、length_fit冻结词条分段、slop_freelegacy 词法代理、coverage机位/有动机的光/声音/可见端点、structure散文式拍摄简报 vs 逗号标签沙拉、否定 slop、ref_integrity参考模式下标签存在且字节精确、brief_traceabilitybrief 特有素材存活进 prompt、coherence显式不兼容的机位/光/声音/动作堆叠、repetition重复 token、重复短语与填充抵抗力。语料库存于 evals/prompt-architecture-stress.json例如同一 brief Woman reads a letter and receives bad news 的三个 arm 呈现了从cinematic shot of a beautiful woman reading a letter, emotional, dramatic lighting, 4K...naive到 skill_formula 的完整可拍摄段落直观展示了各维度的评分对象。7.2 CLI 用法python scripts/prompt_architecture_stress.py # 对发布语料库评分 python scripts/prompt_architecture_stress.py --strict # 若 doctrine arm 回归则失败退出 python scripts/prompt_architecture_stress.py evals/prompt-architecture-stress.json --strict --out scores.jsoncorpusJSON 语料路径默认evals/prompt-architecture-stress.json--out把每条 prompt 的评分写入指定 JSON 文件--strict任一skill_formula案例/维度低于 3、arm 平均低于 3.5、或实质不同 brief 复用同一 prompt 时非零退出v3 排除咨询性词法标记与固定长度分段。main()还会输出按 arm 汇总的gate_v3/prior_v2/legacy表、按 mode 的 skill_formula gate 均值、以及 gate_v3 最弱的 8 条 skill-formula prompt 及其低分维度。CLI 输出中强制包含边界声明文本does not judge creativity or originality、blinded model evaluation、native-language human review由test_cli_states_the_deterministic_gate_boundary断言。7.3 测试如何保护不误报tests/test_prompt_architecture_stress.py 的开头注释点明了设计动机第一版评分器曾把仓库自己的 golden prompts 判为缺陷——一个保留源照明的编辑 prompt 被判没有灯光一个用散文绑定已接受素材的延续被判没有参考绑定。一个乱报警的检查器会被忽视因此公平性规则被固化进测试test_style_dialogue_and_delivery_flags_do_not_fail_otherwise_valid_cases证明合法风格/台词/交付标记不会使原本有效的案例失败test_each_remaining_dimension_still_has_a_blocking_floor证明每个剩余维度仍保有阻断下限test_shipped_doctrine_prompts_are_not_near_duplicate_false_positives证明已发布 doctrine prompt 之间不会互相误判为近重复。从score_prompt的输出结构看每条结果包含id、arm、mode、brief、words、dims各维度 score 与 note、overall、gate_overall、gate_version、gate_dimensions、previous_gate、ref_note、lexical_review、length_review。其中ref_note区分三种参考绑定形态资产标签 角色契约 转移限制4 分、标签 角色但未声明排除3 分、散文式绑定已接受素材3 分、仅提及标签无角色契约2 分、参考模式无任何绑定0 分。7.4 评估模块边界围绕 rubric 的工程落地上docs/EVAL_MODULES.md 界定了模块职责纯文本操作Unicode 校验、稳定排序、Markdown 转义、命令值校验、POSIX/PowerShell 引号归 scripts/eval_ledger_format.py评分、源选择、provider 请求、来源验证与原子 ledger 发布归 scripts/eval_run.py。提取模块不改变输出措辞、转义规则、命令默认值或错误分类且格式化器被显式声明为 evaluator source见 evals/source-manifest.json冻结的 release 检查会把两个评估模块绑定到实际执行的代码对象、路径与源码自摘要。可用python -m unittest tests.test_eval_ledger_format tests.test_eval_run_integrity验证格式化器与 ledger 契约用python scripts/eval_run.py --self-test做离线源码接线检查——两者都不授权付费调用。八、人类评审协议与机器门禁的分界rubric 全文反复强调一条主线模型评委分数只是抽样响应相对已声明断言的证据。具体到中、日、韩语言质量主张references/multilingual-native-review.md 定义了独立的人类评审协议每种语言恰好两名独立评审一名目标语言编辑负责惯用表达、节奏、语域、关系措辞与 calque一名文化/制作评审负责创意镜头假设、可执导性与刻板印象风险评审人必须披露角色、稳定 ID、作者身份与利益冲突。任何材料分歧不得平均成通过必须修订标本、保留双方引证证据、递增fixture_revision与review_round、刷新哈希并开启新一轮独立评审。证据记录中每个关键分都必须引用该标准criterion_evidence_anchors中的本地化候选短语至少 8 个目标文字符并带criterion_id:前缀的理由。该协议还内置了 9 条对抗性攻击清单如把Image1换成Image1、交换三个参考 token 的角色、把一种语言的实现照搬到另一种语言等用于在记录裁决前验证机器门禁是否会先失败。这些主张边界与 docs/VALIDATION.md、validation/authoring-state-provenance-ledger.json 中的溯源约束一脉相承。结语把评估当作证据收集器而非质量认证器从 0-3 通用评分、V6 序列 0-4 门禁到 v2→v3 的迁移Seedance 2.0 的 eval rubric 始终在回答同一个问题机器能确定性地证明什么不能证明什么。prompt_architecture_stress.py能证明结构、相关性、显式矛盾与重复性失败它不能证明创意、原创性、语言母语性、平台交付能力或渲染质量。消费这些分数时务必按版本号读取gate_v3/prior_v2/legacy三套均值把slop_free与length_fit当作咨询性诊断并让语言与文化类主张回到人类评审协议——这才是这份 rubric 真正的工程价值所在。赞分享AI 技能AI 评测提示工程人工智能媒体生成【免费下载链接】seedance-2.0Comprehensive production pipeline for quad-modal AI filmmaking with Seedance 2.0项目地址https://gitcode.com/gh_mirrors/se/seedance-2.0点击查看免费下载相关推荐gbrain eval takes-quality跨模型评审面板与 4-Sha 回执契约构建 Takes 层可复现质量门禁gbrain eval takes quality跨模型评审面板与 4 Sha 回执契约构建 Takes 层可复现质量门禁 gbrain eval take人工智能RAGAgent 记忆MCP 服务知识管理框架迁移架构评审agents24 中 framework-migration 的 architect-review Agent 深度解析框架迁移架构评审agents24 中 framework migration 的 architect review Agent 深度解析 本篇文章聚焦于 agAI 插件AI 技能开发工具Aspire 应用改造评估清单aspireify Eval Rubric 深度解析与实战指南Aspire 应用改造评估清单aspireify Eval Rubric 深度解析与实战指南 导读本文围绕 playground/aspireify eva云原生后端微服务可观测性开发工具上一篇Jest HTML Reporters - 生成美观的Jest测试报告下一篇Far Manager FTP客户端使用指南远程文件管理的完整教程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。