Anthropic 称 Opus 5 是旗下最难被提示注入攻击的模型
7 月 25 日,Anthropic 在 Opus 5 系统卡中表示,该模型是其迄今为止最不易被提示注入攻击的模型。根据提示注入评估和红队测试结果,Opus 5 在对抗恶意提示词注入方面表现出更强的抵抗能力。提示注入是 AI 安全领域的核心风险之一,攻击者通过精心设计的输入绕过模型的安全限制,诱导模型执行非预期行为。Anthropic 在系统卡第 73 页公开了相关评估细节。
7 月 25 日,Anthropic 在 Opus 5 系统卡中表示,该模型是其迄今为止最不易被提示注入攻击的模型。根据提示注入评估和红队测试结果,Opus 5 在对抗恶意提示词注入方面表现出更强的抵抗能力。提示注入是 AI 安全领域的核心风险之一,攻击者通过精心设计的输入绕过模型的安全限制,诱导模型执行非预期行为。Anthropic 在系统卡第 73 页公开了相关评估细节。