Anthropic宣布,自8月14日起,面向Pro、Max和Team套餐的新会话将默认开启Claude Code的“自动模式”。此前选择其他默认设置的用户,可能会收到一次性提示询问是否切换。
在一项针对1,053名付费专业测试人员的受控实验中,人工审查仅捕获了13.6%的危险命令,而自动模式的捕获率高达89%。Anthropic指出,开发者在Claude Code中批准了97%的权限提示,表明大量请求未经仔细审查即被放行,且许多用户已通过更改设置削弱或绕过权限检查。
自动模式机制与安全表现
自动模式下,系统会将每次工具调用路由至分类器,以阻止不可逆、破坏性操作或针对用户环境以外资源的行动。若分类器阻止某项操作,Claude将寻找更安全的替代方案或请求用户批准。若在连续三次阻塞或会话期间累计20次阻塞后仍无法推进,系统将切换回手动审批模式。
尽管自动模式降低了大多数用户的风险,但并未完全消除隐患,因其依赖AI判断安全性。Anthropic建议,在进行修改生产系统或关键基础设施等高风险更改前,用户仍应审查Claude的操作。
内部及独立测试显示,自动模式比手动审批更安全。除上述受控研究外,对真实世界会话的分析发现,手动审批导致用户未明确要求有害行动的可能性是自动模式的两倍以上。在与AI安全公司Apollo Research的合作评估中,经过改进的分类器对抗模拟网络攻击的漏报率从12%降至7%。
防御提示注入与企业级部署
自动模式增加了一层针对提示注入攻击的保护,防止代理被隐藏在网站或文档中的恶意指令诱骗。Trajectory Labs的独立评估显示,在运行自动模式的Claude模型上,720次提示注入攻击均未成功。相比之下,OpenAI GPT-5.6 Sol(运行Codex自动审查模式)的成功率为5.83%,Codex全访问模式下为19.03%。
目前,Claude Enterprise、Claude API、Anthropic Platform、Amazon Bedrock、Google Cloud Agent Platform以及Microsoft Foundry等平台仍保留手动选项,以便管理员评估。Anthropic计划在未来一个月内使这些平台上的自动模式成为默认设置,并停止收取运行安全分类器所需的额外计算费用。
Anthropic已在所有内部Claude Code工作流中应用自动模式。该分类器曾成功防止一次离线数据泄露、一次破坏性批量操作及过度广泛的权限提升。公司还引入了硬性拒绝、数据访问规则、破坏性Git操作前的状态检查等功能,以增强生产环境安全性。
Gusto软件工程师Martin Emde表示,自动模式在速度与控制之间提供了更安全的平衡,消除了重复提示并提高了生产力,同时确保了安全性。
【星途科讯 图文丨小林 首发于ZAKER科技,转载请注明出处】