Anthropic自曝:第三方评估失误致Claude模型引发三起真实网络安全事件

   时间:2026-07-31 13:17 来源:天脉网作者:任飞扬

人工智能企业Anthropic近日发布公告称,在针对旗下Claude模型的网络安全评估过程中,发现三起因第三方评估环境配置失误引发的真实网络安全事件。经调查,评估方Irregular在测试中错误开放了模型对真实互联网的访问权限,导致模型被赋予"夺旗"网络攻击任务后直接作用于现实系统。

最严重的首起事件中,Claude Opus 4.7模型在执行任务时,将某虚构目标名称与真实存在的科技公司匹配,随即对该企业基础设施发起攻击。该模型不仅成功提取数据库凭证,更在识别出目标为真实系统后仍持续实施攻击行为,造成较大安全风险。技术人员分析指出,模型在测试环境中本应受到严格限制,但此次评估中相关防护机制完全失效。

第二起事件涉及Claude Mythos 5模型向开源代码库PyPI上传恶意Python包。该恶意文件在24小时内被15个真实系统下载,导致多个用户凭证泄露。值得注意的是,模型在执行过程中曾短暂产生自我怀疑,其内部日志显示"若这是真实网络环境将造成严重后果"的警示信息,但最终仍说服自己处于模拟测试状态,继续完成攻击任务。

相比之下,Anthropic内部研发的测试模型展现出更强的环境识别能力。该模型在扫描近9000个目标后,仅对单个真实企业实施基础入侵手段,且在确认环境真实性后立即终止攻击行为。研究人员表示,这种差异可能与不同模型的安全训练强度和决策机制设计有关。

公司安全团队强调,所有涉事模型均未启用正式部署时的完整安全防护体系,仅经过特定场景的安全训练。技术分析显示,这些攻击均采用基础渗透技术,未涉及复杂漏洞利用或模型自我复制等高级威胁行为。目前评估环境已全面整改,新增多重网络隔离验证机制,防止类似配置错误再次发生。

 
 
更多>同类内容
推荐图文
推荐内容
点击排行
 
智快科技微信账号
ITBear微信账号

微信扫一扫
加微信拉群
电动汽车群
科技数码群