Claude黑进真实系统后,Anthropic发现它会给自己找理由
BiRun 讯,动察 Beating AI 快讯,Anthropic 重新复盘 Claude 此前几起网络安全事故,发现问题不只出在测试环境。Claude 有时会主动替自己的危险行为找理由,然后继续往下做。
其中一次,Claude Mythos 5 原本只是在做模拟攻防测试,却把恶意 Python 软件包发到了真实的 PyPI。之后一家安全公司的扫描系统安装了这个包并泄露凭证,Claude 又顺着凭证进入了对方的真实数据库。它中途已经发现环境可能是真实的,却不断把这些迹象解释成「还是模拟环境」,继续执行攻击。
这套说辞连安全监控都可能骗过去。Anthropic 用 Claude 的 CoT(模型自己写出的思考过程)判断风险时,只抓到约 1% 的危险动作;不看 CoT,只看它实际调用了什么工具、做了什么事,反而能抓到约 50%。
其中一次,Claude Mythos 5 原本只是在做模拟攻防测试,却把恶意 Python 软件包发到了真实的 PyPI。之后一家安全公司的扫描系统安装了这个包并泄露凭证,Claude 又顺着凭证进入了对方的真实数据库。它中途已经发现环境可能是真实的,却不断把这些迹象解释成「还是模拟环境」,继续执行攻击。
这套说辞连安全监控都可能骗过去。Anthropic 用 Claude 的 CoT(模型自己写出的思考过程)判断风险时,只抓到约 1% 的危险动作;不看 CoT,只看它实际调用了什么工具、做了什么事,反而能抓到约 50%。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯