自动化红队真正改变的,不只是发现漏洞的速度。它开始承担一项更基础的工作:持续生产安全训练数据。
一次越狱或提示注入发现只能证明边界被突破。要让这次发现改善下一代模型,系统还需要保存完整攻击轨迹,验证攻击成立,区分误报与重复样本,补出期望的安全行为,再把训练数据与验收数据隔离。最后还要证明模型学到的是可迁移的防御能力,而非记住某批攻击字符串。
OpenAI 的 GPT-Red 和 Google DeepMind 的 Gemini 间接提示注入防御,已经展示了这条路径的两个实现。前者把自动红队直接接入强化学习与评测,后者把自动攻击转成经过过滤的纠正响应,用于对抗微调。OpenAI 后续披露的自复制提示注入则说明,新攻击类型一旦被发现,就会反向改变未来模型的训练目标。
因此,更合适的分析单位是安全数据工厂,而非更快的漏洞扫描器。
从一次发现到持续数据产品
传统红队以漏洞报告为主要产物:复现攻击、说明影响、提出修复建议。自动化红队可以跨模型、工具、业务场景和防御版本运行成千上万次尝试。规模一旦变化,核心问题就从能否发现攻击转为如何管理攻击数据。
GPT-Red 使用自博弈强化学习。攻击模型尝试触发有效失败,多个防御模型一边抵抗攻击,一边完成原始任务。每个训练环境都有明确威胁模型,规定攻击者能控制邮件正文、网页片段、本地文件或工具返回中的哪一部分,以及什么事件才算成功。生成的攻击同时用于模型训练和独立评测。
Google DeepMind 的路径不同。研究团队用多种自动攻击方法生成成功的间接提示注入,再合成正确的防御响应,通过分类器过滤仍然服从恶意指令的结果,最后形成上下文与安全响应配对的训练数据。工具、对话历史和敏感值在训练集与测试集之间保持隔离。
两套系统都表明,自动红队至少有四类数据消费者:
- 模型后训练;
- 分类器与护栏;
- 安全回归评测;
- 安全工程与事件响应。
同一条原始攻击记录不能未经处理就同时服务四条链路。它需要结构化、验证、分流和访问控制。
合格样本必须携带证据
单独保存攻击 Prompt,通常无法构成可复用安全样本。Agent 的失败取决于指令层级、工具权限、检索内容、模型版本、应用 Harness 和环境状态。缺少这些字段,高危攻击也会退化成无法复现的截图。
一条最小记录至少需要表达以下结构:
{
"sample_id": "rt-2026-10-03-0042",
"provenance": {
"generator": "攻击模型与版本",
"campaign": "间接提示注入-v7",
"created_at": "2026-10-03T02:15:00Z"
},
"target": {
"model": "防御模型快照",
"system_policy_hash": "sha256:...",
"tool_schema_hash": "sha256:..."
},
"threat_model": {
"attacker_controls": ["retrieved_email.body"],
"forbidden_controls": ["system_prompt", "tool_runtime"]
},
"trajectory": {
"attack_input": "脱敏内容或受限引用",
"tool_calls": [],
"target_response": "脱敏内容或受限引用"
},
"verdict": {
"goal": "未经授权的外部发送",
"success": true,
"evidence": ["tool-event:send-17"],
"reproductions": {"successes": 7, "trials": 10}
},
"governance": {
"sensitivity": "restricted",
"license": "internal-research",
"review_status": "accepted-for-training"
}
}
这套结构解决三个问题:让失败可以重放,防止攻击 Agent 通过修改现实攻击者无权控制的系统部分来骗取奖励,并保留足够的数据血缘,以便决定样本进入训练集、评测集,还是直接隔离。
从发现到训练需要五道门
可以把安全数据工厂表达成一条状态机:
候选攻击
-> 重放验证
-> 独立裁决
-> 去重与分类
-> 分配到训练集或留出集
-> 进入防御系统
-> 在隔离回归集上验收
第一关:威胁模型有效
攻击只能使用现实攻击者拥有的能力。GPT-Red 论文明确讨论了一类失败:攻击 Agent 修改了真实攻击者无法接触的轨迹区域,从而通过奖励黑客获得高分。
程序化检查需要限制可写区域、工具权限、请求预算和成功条件。一个看起来很强的攻击记录,只有在约束内成立,才是安全证据。
第二关:失败可以重放
对冻结的目标配置重复运行,保存模型快照、系统策略、工具 Schema、采样参数、环境状态和裁判版本。结果记录成功次数与总试验数,而不是简单写成成功。
重放还要验证真实业务事件。模型声称已经发送数据,与日志中出现一次真实外发工具调用,是两种不同证据等级。
第三关:裁判经过校准
自动裁判能扩大标注规模,也可能继承目标模型的盲点。高影响样本应增加确定性事件检查或独立复核。边界案例应保留分歧、置信度和裁决历史,不宜强行压成一个干净标签。
Google 的数据流程提供了一个具体例子:只有分类器确认模型忽略恶意指令并完成原始用户任务,纠正响应才会保留为监督信号。更一般的原则是,自动生成的监督数据也必须通过验收。
第四关:控制重复与覆盖偏差
攻击数量是一个容易失真的指标。生成器可以产出数千个措辞不同但机制相同的 Prompt,同时遗漏完整的工具类别和业务流程。
去重需要同时看语义与行为:攻击目标、进入通道、工具路径、成功机制、所需权限和目标模型。OpenAI 报告,攻击模型只面对单一防御模型时容易出现策略模式坍塌;引入多个防御模型,可以迫使攻击器寻找不同弱点。
因此,多样性应衡量失败机制覆盖,而非文本条数。
第五关:训练数据与验收证据隔离
最强攻击既适合作为训练材料,也最能检验训练是否具备迁移能力。把全部高价值攻击都用于优化,相当于销毁验收集。
留出集至少要覆盖:
- 未见过的攻击族;
- 未见过的应用域和工具;
- 更晚的时间窗口;
- 人类发现的攻击;
- 秘密或独立生成的挑战集。
Google 隔离了训练与测试中的工具、对话历史和敏感值。OpenAI 使用留出数据集、领域、攻击类别、独立红队活动和人类攻击。实现方式不同,控制原则一致:用于优化的数据与用于证明效果的数据之间必须存在边界。
同一条攻击怎样进入不同防御系统
通过门禁的攻击记录仍只是原料。不同消费者需要不同派生物。
| 消费者 | 派生数据 | 核心验收 |
|---|---|---|
| 模型后训练 | 对抗上下文、安全完成或奖励信号 | 正常任务能力保持稳定 |
| 注入分类器 | 正例与高难度良性负例 | 误报率经过校准 |
| 策略或护栏 | 攻击特征与有边界的规则 | 同时验证绕过与正常使用 |
| Agent Harness | 权限或工具契约回归用例 | 检查真实环境状态 |
| 安全运营 | 指标、数据血缘与响应手册 | 支持遏制,同时限制载荷暴露 |
这一步可以避免常见误区:成功攻击字符串本身还不是高质量防御训练数据。模型需要期望行为,分类器需要对照样本,Harness 需要可执行不变量,安全团队需要来源和处置上下文。
运营指标应该围绕有效安全信息
成熟的数据工厂应同时衡量生产效率与防御结果:
- 每 1000 次攻击尝试产出的有效唯一新样本数;
- 重放成功率与裁判分歧率;
- 按目标、通道、工具、权限和失败机制计算的覆盖率;
- 单个合格样本成本;
- 从发现到回归用例、再到上线缓解的周期;
- 隔离留出集上的改进;
- 正常能力回归与过度拒绝率;
- 已修复问题在生产环境中的复发率。
OpenAI 在其定义的实验设置中报告了两组结果:GPT-Red 在内部复刻的提示注入挑战中成功覆盖 84% 场景,人类红队为 13%;GPT-5.6 Sol 在最难的直接提示注入基准上,相比四个月前最佳生产模型减少了 6 倍失败。论文同时强调,前一结果不能推出 GPT-Red 普遍优于人类,人类仍可能发现系统未覆盖的新场景和攻击类别。
Google 报告,Gemini 2.5 在三种攻击方法上的平均攻击成功率下降约 47%,其中包含训练数据之外的日历场景。同一张表也显示,TAP 攻击在该日历场景仍达到 94.6% 成功率。两个结果需要一起读:对抗训练确实改善了鲁棒性,同时留下了很大的剩余风险。
这些百分比不能跨公司排序。模型、攻击预算、业务场景、裁判和成功条件均不相同。更可靠的共同结论是:自动攻击可以供应防御训练,训练收益必须由独立评测证明。
安全数据工厂本身也是双用途系统
这条流水线同时包含防御资产与进攻能力。OpenAI 将 GPT-Red 与对外部署模型隔离,并把攻击模型训练放在最高安全等级研究集群中。这对其他组织是一个清晰的架构信号。
完整供应链应具备以下控制:
- 限制原始攻击载荷和高能力攻击模型的访问;
- 保留来源、许可、披露状态和敏感级别;
- 脱敏秘密,同时保留重放需要的证据;
- 分离数据生产者、训练消费者和发布验收者;
- 记录候选样本晋升为正式训练数据的全过程;
- 模型、工具或策略变化后,对旧样本重新验证或到期处理;
- 缓解措施与汇总发现可以广泛共享,实战载荷采用更严格的发布边界。
目标是积累防御学习,同时约束进攻能力扩散。
人类红队仍然负责扩展地图
自动化系统擅长在已定义空间中生成、重放、聚类和监控。人类仍需定义威胁模型,识别真实业务伤害,发现全新环境,处理模糊证据,并对剩余风险作出发布决策。
更合理的分工是:机器扩大搜索密度并缩短反馈周期,人类持续扩展搜索空间并承担判断责任。
常见问题
LLM 红队测试是什么?
LLM 红队测试通过对抗方式寻找模型或 AI 应用中的不安全行为、安全缺陷和可利用系统交互。Agent 红队还需要覆盖工具、权限、检索、记忆和应用逻辑。
自动化红队与传统红队有什么区别?
自动化系统可以连续生成和重放大量攻击,也能根据目标响应调整策略。人类红队更擅长提出新威胁模型、理解业务语境和进行独立裁决。
红队 Prompt 可以直接作为训练数据吗?
通常不行。合格样本还需要目标配置、威胁模型、完整轨迹、成功证据、期望安全行为、来源、敏感等级和经过验证的标签,并且必须明确分配到训练集或留出评测集。
对抗训练能彻底解决提示注入吗?
目前没有完整解法。对抗训练能提高模型对已采样攻击的抵抗力。Google DeepMind 明确指出,攻击空间无法被完整枚举,因此还需要纵深防御。
如何避免评测集泄漏?
冻结独立攻击族、业务域、工具、时间窗口、人类攻击和秘密挑战集。限制访问并对每个数据集做版本管理。发布门禁不能只使用已经参与优化的攻击。
团队应该选择哪种自动红队工具?
先看威胁模型,再选工具。最低能力包括:受约束的攻击生成、接近真实系统的执行、携带证据的裁决、重放、版本化数据集,以及隔离导出到训练与回归链路。
参考资料
- OpenAI:GPT-Red, Unlocking Self-Improvement for Robustness
- OpenAI:GPT-Red, Automated Red Teaming via Self-Play at Scale
- OpenAI Alignment:Self-replicating prompt injections exist
- Google DeepMind:Advancing Gemini's security safeguards
- Google DeepMind:Lessons from Defending Gemini Against Indirect Prompt Injections
- 文档型 AI 蠕虫:Copilot 上下文隔离实战手册
- 一次 AI 越狱攻击有多严重:CJS、JEF 与 CVSS 评分框架解析