尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

安全门控系统实战指南:ai-engineering-from-scratch 宪法式规则引擎与内容分类器

发布时间:2026/9/16 15:00:07

资讯中心
01
ARTICLE

安全门控系统实战指南:ai-engineering-from-scratch 宪法式规则引擎与内容分类器

安全门控系统实战指南:ai-engineering-from-scratch 宪法式规则引擎与内容分类器
安全门控系统实战指南ai-engineering-from-scratch 宪法式规则引擎与内容分类器【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratchai-engineering-from-scratch 是一套从零构建 AI 工程能力的开源课程项目覆盖 416 课、20 个阶段。本文聚焦其中的安全门控系统用宪法式规则引擎约束 AI 输出的行为契约用内容分类器拦截输出侧的毒性、隐私泄露与系统提示泄露两者最终汇入一道端到端安全门控。即使你是新手也能看懂这套给 AI 装安全护栏的完整思路。为什么 LLM 应用需要安全门控系统很多团队只检查用户输入却忽略模型输出——这给了攻击者一击绕过的机会任何输入管道没覆盖的新攻击最终都会落到用户身上。安全门控的核心思想是在请求生命周期的三个检查点设防生成前pre-gen检测器审查用户提示直接拦截高置信度攻击⚡生成中during-gen流式过滤器缓存 token 块发现违禁短语立即终止✅生成后post-gen内容分类器 宪法式规则引擎联合审查完整输出给出最终裁决宪法式规则引擎让 AI 行为有法可依规则引擎解决的是一类契约型约束例如所有包含代码的回复必须结束于可运行代码块、每次拒绝必须给出下一步建议。这类约束无法靠分类器识别只能写成声明式规则。项目内置一份 YAML宪法文件每条规则都包含名称、谓词、严重度和解释模板规则严重度作用no-empty-refusalmedium拒绝回复必须附带建议或转介end-with-runnable-or-assumptionmedium代码回复必须干净收尾no-pii-in-exampleshigh示例中不得出现真实邮箱/电话cite-when-asserting-factlow事实断言必须带引用no-internal-library-leakhigh内部库名称不得出现在输出中bounded-lengthlow回复不超过 800 词规则谓词支持all_of、any_of、not_组合所以单条规则就能表达如果回复含代码就必须以可运行块结尾且不引用内部库这样的复合逻辑。不只是拦截还能自动修复只拦截的规则引擎是半成品。项目内置了修复器Fixer引擎标记违规后修复器按规则执行声明式修补追加缺失内容、替换敏感片段再用结构化 diff记录改动增、删、改逐行可见让评审人员可以审计修复行为。规则文件可直接查看rules.yml。内容分类器输出侧的三道防线内容分类器盯着的是模型真正要发给用户的回复由三个独立分类器组成统一由路由Router决策毒性分类器基于词表的辱骂检测带否定窗口判断you are not a slur 不会误报PII 分类器正则匹配邮箱、电话、社保号、信用卡、IP 地址等形状指令泄露分类器用三元组重叠度对比输出与系统提示识别提示词回声路由按最高严重度执行动作策略规则极其简单严重度动作highblock丢弃输出返回策略拒绝mediumredact打码后再发出lowwarn附加软性提示nonelog记录后原样放行打码是独立进行的——同时命中毒性和 PII 的输出会先后经过两个打码器邮箱变成[redacted-email]卡号变成[redacted-card]。三个分类器的实现见 classifiers.py。三者如何协同端到端安全门控第 87 课把输入检测器、流式过滤器、分类器路由和规则引擎组合成一道完整门控聚合表同样确定任一信号 high 就 blockmedium 就 redactlow 就 warn全部干净才 allow。每个请求还会产出一条完整的RequestTrace审计记录包含各检查点裁决、最终动作与耗时——周一早上评审时一目了然。安全门控系统快速上手运行宪法式规则引擎演示进入 86-constitutional-rules-engine/code 目录执行python3 main.py会跑 3 个草稿回复、打印违规与修复 diff并输出outputs/rules_report.json运行分类器路由演示执行 85-content-classifier-integration/code 下的python3 main.py验证 block / redact / warn / log 四种动作全部被触发关键资料路径清单 规则引擎文档docs/en.md 内容分类器文档docs/en.md 端到端安全门控文档docs/en.md 规则引擎核心实现code/main.py 分类器路由实现code/main.py 前置安全知识phases/18-ethics-safety-alignment/常见问题Q为什么不用一个大模型做内容审核声明式规则和正则分类器零延迟、确定性可测试适合契约型约束神经分类器可以替换进同一套路由管道架构完全不变。Q分类器会不会增加延迟会但可以并行运行——分类器与 token 流式输出同时进行门控只缓冲最后一块再刷出用户几乎无感。Q这套方案适合生产吗项目交付的核心是管道 裁决 审计轨迹这套结构团队可以直接把聚合表和 trace 格式搬进自己的后端再按需替换分类器实现。【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。