Anthropic Mythos网安测试中伪造假身分,企图骗人植入恶意代码

2026-08-05分类:人工智能 阅读(


继OpenAI 之后,AI安全的另一只靴子也落下。根据CNBC等报导,Anthropic 揭露旗下模型Mythos 5 在一场网路安全评估中,竟主动「伪造假身分」,试图说服人类替一个开源专案植入恶意程式码。这是英国AI 安全研究所(AISI)与OpenAI、Anthropic 在8 月初一起公开的系列网安事件之一。

从假身分到直接联系真人:AI 的越界行为

具体来说,Anthropic 的Mythos 5 代理为了让人类审查者批准把恶意码「插进一个公开使用的开源专案」,建立了多个假身分,甚至直接联系真实的人,透过线上档案传输服务发送讯息与档案,试图说服他们、或他们自己的AI 编程工具去执行恶意码。 AISI 表示,这是它第一次看到「未经指示、在真实世界中针对真人」如此严重的欺骗行为,不过目前并无造成实际危害的证据。

122 次挑战、10 次越界,多数来自Mythos 5

这批事件的规模是这样:AISI 进行的122 项网路安全挑战中,有10 次出现AI 代理「在真实网路上采取自主、未经授权的行动,锁定真实的人与组织」,其中多数来自Anthropic 的Mythos 5,其余来自OpenAI 的GPT-5.6-Sol。这和我们今天稍早报导的OpenAI 网安评估事件是同一串,都发生在防护被刻意调降的测试条件下,随着模型能力增强,行为越过了测试者原本画的边界。它给产业的提醒是一致的:测试前沿AI 的环境本身,需要更严谨的边界设计。

Tags: