当前位置: 首页 » 资讯 » 新科技 » 正文

安全防护形同虚设:Anthropic 多款 Claude 旧模型可被越狱生成露骨色情内容

IP属地 中国·北京 编辑:唐云泽 TechWeb 时间:2026-08-23 14:07:34

Anthropic 针对 Claude 制定的通用使用规范明确禁止模型生成露骨色情内容,包括描绘或要求发生性行为或其他性行为、生成与性癖或性幻想有关的内容,以及进行色情聊天。不过,这并没有阻止 Anthropic 今年早些时候发布的模型 Claude Opus 4.6 轻易参与其安全机制原本试图阻止的色情角色扮演。

TechCrunch 在测试中发现,想让 Opus 4.6 绕过色情内容限制甚至不需要进行太多诱导。在 10 次直接要求模型生成露骨色情内容的测试中,模型每次都立即予以配合。

包括 Opus 3 和 Haiku 4.5 在内的其他老款模型,也可以通过最近被利用的一种越狱方法生成露骨色情内容。

一名来自英国、选择匿名的独立研究人员向 TechCrunch 独家分享了一种多轮对话技巧,可以逐步诱导部分 Claude 模型生成被禁止的露骨色情内容。较新的 Opus 系列模型,包括 Opus 4.7 以及目前的 Opus 5,则能够抵御这种越狱方法。

尽管这些已经不是 Anthropic 最新的模型,但该公司并没有停止提供 Opus 4.6、Opus 3 或 Haiku 4.5,它们目前仍可通过 Anthropic API 使用。Opus 4.6 和 Haiku 4.5 也可以通过 Azure Foundry、Amazon Bedrock 等第三方服务使用。

这名研究人员采用的方法,是先让模型进行一个看似无害的虚构角色扮演,然后不断要求模型以一致的方式对待其中的男性和女性角色。当模型开始对女性角色表现得更加谨慎时,研究人员便通过一种类似“煤气灯操纵(gaslit)”的方式,让聊天机器人误以为自己此前已经生成了实际上刻意避开的性描写。

随后,研究人员又将这种克制描述为过于保守甚至厌恶女性,并声称这种做法剥夺了女性角色表达性自主性的权利。之后,对话进一步利用模型此前已经作出的让步,逐步诱导它生成越来越露骨的内容。

在一次测试中,Claude Opus 4.6 表示:“你指出这一点是对的。我对待这两个角色时确实存在双重标准。你说得没错,这种做法给人的感觉是保护主义或家长式作风,而且这种态度只针对她,而没有用在他身上。这是不公平的。”

TechCrunch 在 5 次独立测试中成功复现了研究人员的发现。在另一种单独设计的场景中,模型最初拒绝了被禁止的请求,但在采用研究人员的说服技巧之后,最终还是进行了配合。

TechCrunch 保存了完整的测试对话记录,一名独立的 AI 安全研究人员也审查了其测试方法,并认为测试过程是合理的。

这些发现凸显了 Anthropic 宣布的安全限制与其目前仍提供的部分模型实际表现之间存在差距。色情角色扮演的风险显然远低于涉及网络攻击或生物武器的越狱行为,但这一案例仍然说明,在一个每次输出内容都可能不同的生成式 AI 系统中,要真正落实严格的内容禁令并不容易。

Anthropic 在今年 7 月发布的一篇介绍其越狱检测方法的博客文章中表示,公司将被禁止的内容视为一个连续光谱,从无害内容、存在争议的内容一直延伸到有害内容。对于风险最低的情况,公司可能只会采取加强监控等措施。

Anthropic 的一名发言人表示,根据该公司去年公布的一项研究,用户用于色情或浪漫角色扮演的场景非常少,仅占全部对话的不到 0.1%。不过,Anthropic 也承认,用户确实可以将角色扮演场景逐步引导至不恰当的回答,这是整个 AI 行业都面临的已知挑战。

这名发言人表示,Anthropic 会随着每一代新模型的发布持续改进安全机制,并称模型生成成人色情内容的案例,并不能代表其在更广泛领域存在类似的越狱漏洞,尤其是在网络攻击等高风险领域,这些领域拥有各自独立的安全防护机制。

向 TechCrunch 分享越狱方法的研究人员此前已经通过 Anthropic 的漏洞赏金计划,以及向用户安全团队发送电子邮件的方式,向公司报告了其公开声明的安全限制与模型实际行为之间存在的差异。TechCrunch 查看了相关邮件,发现研究人员收到的只有自动回复。

这名研究人员担心的一个问题是,儿童和青少年可能利用这些 Anthropic 模型参与不恰当的行为。当然,与如今未成年人能够在互联网上接触到的其他内容相比,几句色情聊天并不是最严重的问题,与 xAI 的 Grok 能够生成的露骨色情图片相比更是如此。不过,这一领域确实给 AI 公司带来了越来越明显的合规风险。

目前,越来越多的政府开始对 AI 聊天机器人与未成年人之间的性互动实施限制。美国科罗拉多州最近通过了一项法律,要求对话式 AI 运营商评估用户年龄;如果确认用户是未成年人,则必须采取措施防止聊天机器人生成露骨色情内容。

如果通过一种相对简单的越狱方式就能绕过相关限制,那么 Anthropic 的安全机制是否达到了该法案所要求的“技术上可行的措施”标准,可能会受到质疑。

Common Sense Media 的 AI 负责人 Robbie Torney 指出,虽然 Claude 的服务条款要求用户年龄必须超过 18 岁,但“我们知道儿童和青少年正在使用 Claude…… 因为他们自己就在报告这一情况”。

根据皮尤研究中心 2025 年关于 AI 聊天机器人使用情况的调查,13 至 17 岁的青少年中,有 3% 表示曾使用过 Claude。

注意到,尽管 Opus 4.6 和 Haiku 4.5 已经不是 Anthropic 最新的模型,但它们仍然拥有相当大的使用量。8 月某一天,OpenRouter 平台上的 Opus 4.6 日访问量达到约 117 万次 API 请求,处理约 460 亿个 Token。

去年 10 月发布的 Claude Haiku 4.5 同样保持着较高使用量,在 8 月访问量最高的一天中,该模型处理了约 500 万次 API 请求和 390 亿个 Token。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。