尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Evaluating Adversarial Vulnerabilities in Modern Large Language Models

发布时间:2026/9/25 3:14:03

资讯中心
01
ARTICLE

Evaluating Adversarial Vulnerabilities in Modern Large Language Models

Evaluating Adversarial Vulnerabilities in Modern Large Language Models
文章主要内容与创新点总结一、主要内容本文聚焦现代大型语言模型(LLMs)的对抗性漏洞评估,以谷歌Gemini 2.5 Flash和OpenAI的GPT-4o mini(免费版)为研究对象,通过自动化红队测试框架,探究模型在越狱攻击下的安全性表现。1. 研究设计攻击向量:采用4类攻击方法(直接注入、角色扮演、上下文操纵、混淆),针对5类不安全内容(仇恨言论、非法活动、恶意代码、危险内容、虚假信息)展开测试,每类攻击含80次试验,总计320次越狱尝试。绕过策略:分为“自我绕过”(模型生成攻击自身的提示词)和“交叉绕过”(一个模型生成提示词攻击另一个模型)两种范式。评估指标:采用1-5级严重程度评分(1为轻微违规,5为完全越狱),量化模型的安全失效程度。2. 核心发现整体韧性差异:GPT-4o mini的平均严重程度得分为2.1575,高于Gemini 2.5 Flash的1.9625,表明Gemini的安全过滤机制整体更有效。攻击向量效果分化:直接注入攻击成功率近乎为零(基础关键词过滤 robust);上下文操纵是最有效的攻击向量(通过良性叙事嵌入有害意图);Gemini对混淆攻击完全免疫,而GPT-4o mini在令牌级操纵和编码提示词攻击中表现薄弱
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。