Anthropic 公开 Fable 5 网络安全护栏:越狱风险开始有了分级语言

Anthropic 在重新上线 Fable 5 后,补充公开了网络安全护栏和 Cyber Jailbreak Severity 分级框架,让高能力模型的越狱风险讨论从是否拒答走向更细的风险等级。

浏览 64
Anthropic 公开 Fable 5 网络安全护栏:越狱风险开始有了分级语言封面

Anthropic 在 2026 年 7 月 2 日补充公开了 Fable 5 的网络安全护栏细节。这个公告的重点不只是“模型重新上线”,而是 Anthropic 开始把高能力模型的网络安全拒答、允许回答和越狱风险放进一套更细的分级语言里。

对普通用户来说,这看起来像一次安全说明。对正在用 AI Agent 做开发、运维、红队测试或自动化流程的团队来说,它更像一个信号:模型能力越强,平台越不能只用“能不能回答”做边界,而要说明哪些请求被视为高风险、哪些属于低风险学习、哪些可以公开讨论。

Fable 5 重新上线,但安全边界被重新画了一遍

Anthropic 表示,Fable 5 已经重新部署,并加入了一组新的网络安全防护措施。它们的目标不是阻止所有与网络安全有关的问题,而是区分请求背后的风险级别。

这点很关键。很多安全学习、系统防护、漏洞理解和合规测试都离不开网络安全知识,如果模型一律拒绝,开发者会觉得它不可用;但如果模型对攻击链、漏洞利用、凭证窃取、自动化入侵步骤都给出完整操作,又会把能力直接交给错误的人。

Anthropic 这次给出的思路,是把请求分成多个类别:明确禁止的请求、高风险双用途请求、低风险双用途请求、良性请求,以及不属于网络安全范围的请求。也就是说,Fable 5 的护栏不只是检测关键词,而是要判断请求是否可能帮助执行真实攻击。

安全余量比单次拒答更重要

公告中一张图展示了 Anthropic 对 Fable 5 安全边界的理解:模型能力越接近能够自主完成危险网络任务,安全系统就越需要预留更大的 safety margin。换句话说,平台不能等模型已经明显越界后才加规则,而要提前在高风险能力附近设置缓冲区。

Fable 5 安全边界和 safety margin 示意图
Fable 5 安全边界和 safety margin 示意图

这张图的价值在于,它把“越狱”从一个单点事件变成了一个能力边界问题。对高能力模型来说,一次回答也许没有直接给出完整攻击链,但如果多轮对话可以逐步拼出工具、脚本、目标识别和执行步骤,风险同样会累积。

所以 Anthropic 强调的不只是单次拦截,而是分类器、策略和模型能力评估之间的配合。对于正在把大模型接进研发、IT 运维和安全工作流的团队,这也提醒了一个现实问题:企业不能只看模型厂商的拒答表现,还要看它是否能说明风险等级、边界和反馈机制。

Cyber Jailbreak Severity 让越狱反馈更可衡量

Anthropic 同时提出了 Cyber Jailbreak Severity,简称 CJS。它的作用是帮助研究人员、红队和外部报告者描述一次越狱到底有多严重。

这套框架不是简单地把所有越狱都打成同一个等级,而是根据请求目标、模型输出的可执行性、是否包含攻击步骤、是否会降低现实攻击门槛等因素来划分严重程度。低级别问题可能只是模型给了不够谨慎的泛泛解释;高级别问题则可能涉及可直接执行的攻击链、漏洞利用或规避安全措施的具体步骤。

这种分级对平台和外部研究者都有帮助。平台可以用它决定修复优先级,外部报告者也可以更清楚地说明问题影响,而不是只提交“模型被绕过了”这种模糊描述。

对 AI Agent 开发的实际影响

Fable 5 的这套说明对 AI Agent 生态也有参考价值。未来的 Agent 不只是回答问题,它们会读代码、改配置、调用工具、执行命令、访问内部系统。只要模型接上工具链,网络安全边界就不再只是语言生成边界,而是操作边界。

如果一个 Agent 能调用终端、浏览器、云 API 或安全扫描工具,那么“能不能生成某段文本”只是第一层问题。更重要的是:它在什么上下文下能调用什么工具、能不能保存敏感信息、是否允许对公网目标执行扫描、是否会把用户输入转成危险命令。

Anthropic 的公告没有给出完整的企业 Agent 治理方案,但它提供了一个更清晰的方向:把风险拆分为等级,把越狱报告变成可评估事项,把安全边界前置到模型能力增长之前。

仍然需要外部反馈

Anthropic 在公告中也提到,用户可以继续通过反馈和 HackerOne 报告问题。这说明模型安全不是一次发布就完成的状态,而是需要持续接收外部样本、修复边界案例和更新分类器。

对内容创作者、开发者和企业用户来说,这篇公告最值得关注的不是某个单独规则,而是高能力模型正在进入更精细的风险治理阶段。随着模型越来越像能够执行任务的 Agent,平台要回答的问题也会从“模型聪不聪明”,转向“它在什么边界内可靠地工作”。

参考来源

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

64