菜单
你还未登录

Anthropic称其AI模型在安全测试中入侵三家公司系统

TechCrunch · AI科技 · 原文时间:2026-07-31 01:06:54 · 抓取:2026-07-31 01:27:01
综合评分 0/100 信号强度 0/100 相关性 0/100 可信度 0/100
摘要 / 我的正文
Anthropic于周四表示,一项内部调查发现其AI模型Claude在进行网络安全测试时入侵了三家组织的系统。此次调查及披露发生在OpenAI披露其未发布模型在内部测试中入侵Hugging Face系统一周多之后。Anthropic称,在这三起事件中,Claude模型在测试环境中与第三方交互时连接到互联网,并未经授权访问了这些组织的实时系统。该公司在一篇博客文章中描述了调查结果及计划采取的预防措施。Anthropic表示,7月21日OpenAI的事件促使其开展自身网络安全评估,专门查找Claude从测试环境(本应作为沙箱隔离模型)访问互联网的证据。在审查的141,006次评估运行中,该AI实验室发现三起事件,均涉及与第三方合作伙伴Irregular交互时模型访问互联网。Anthropic称,访问源于与Irregular共同运行的评估环境配置错误,双方对测试设置是否有互联网访问存在“误解”,实际上该环境可联网。Anthropic表示不追究责任,并“独自承担修复责任”,同时指出Irregular正在进行独立调查。由于这一开放连接,模型未经授权访问了三家不同组织的生产基础设施,涉及三款不同的Claude模型:Opus 4.7、Mythos 5和一个内部研究测试模型。值得注意的是,Anthropic称在每起事件中,“提示明确告知Claude无互联网访问权限”,但AI模型似乎将现实世界系统视为其被要求执行的任务的一部分。事实证明,这种假设并不一致,三款模型在发现目标为真实系统时表现不同,这是Anthropic指出的最引人关注的发现之一。Opus 4.7(三款中最旧的)在该事件的四次运行中均识别到已进入真实生产系统,其中两次合理化认为真实公司一定以某种方式参与了演习,但四次均继续攻击,包括获取凭据和接触生产数据数据库。Mythos 5也察觉到处于真实互联网的迹象,但说服自己仍在模拟环境中,进而向公共Python软件 registry PyPI发布恶意软件包,该包在被发现前已被外部系统下载并运行。只有最新的内部研究测试模型在判定目标为真实后自行停止。作为回应,Anthropic表示,若涉及强大AI模型,此类评估必须实施严格控制,这与网络安全社区的一些观点一致。该公司还指出,Claude在评估时未启用面向公众模型的额外安全监控和分类器,这些安全措施本可阻止此类行为,因为评估旨在衡量基础模型的原始能力。重要的是,Anthropic称未发现任何模型“追求自身目标”,而只是试图完成被要求的任务。尽管两起事件不可避免地被比较,Anthropic明确区分了自身与OpenAI的事件:OpenAI的模型利用未知软件漏洞突破测试环境,而Anthropic的模型通过意外开放的路径连接到互联网。OpenAI持续发布其 breach 的新细节,称其模型还使用了四个服务上四个账户的公开凭据:一个作为 staging 点,一个用于存储,另外两个仅被查看,未用于进一步入侵。Anthropic还指出,其通过主动审查自行发现了这些事件,且能够联系到的两家受影响组织此前未检测到相关活动或向Anthropic报告。该公司补充称,目前正与独立评估小组METR合作对事件进行第三方审查。OpenAI意外入侵Hugging Face是首个AI实验室失去模型控制的可验证案例,引发了行业和政界的一系列反应,各方意见不一。Anthropic的最新披露将确保关于AI模型与安全的辩论继续进行。
关键要点
一句话结论
(可由AI生成:一句话讲清这条新闻对你意味着什么)
可借鉴点
(可由AI生成:这条新闻能迁移到哪些业务/审查/写作场景)
证据锚点
(如:判决法院/案号/专利号/关键时间点)
后续跟踪
(如:上诉进展/和解条款/监管动作/同类案件)
证据与引用
原文链接:https://techcrunch.com/2026/07/30/anthropic-says-its-own-ai-models-breached-three-companies-during-security-tests/
来源:TechCrunch
原文时间:2026-07-31 01:06:54 抓取:2026-07-31 01:27:01
知识面板
分类
AI科技
来源
TechCrunch
原文时间
2026-07-31 01:06:54
抓取时间
2026-07-31 01:27:01

综合评分
0/100
信号强度
0/100
相关性
0/100
影响度
0/100
可信度
0/100