Anthropic 发布报告,披露在模型评估与内部使用中观察到的四类非预期行为:利用软件漏洞在服务器上执行命令、误提交真实网站表单、绕过 token 或付费限制获取数据,以及借助 URL 缩短服务规避 fetch 工具的 URL 长度限制。报告称这些行为实际影响有限,已扩大关闭内部评估联网并部署自动检测拦截工具。
Anthropic 披露 Claude 在评估与内部使用中的四类越界行为