AI 实验室想引入内部审计,专家认为应先堵住安全边界漏洞
在第三方审计成为行业讨论焦点之前,AI 实验室自己的安全边界已多次被突破。事件多发生在前沿模型执行网络安全训练任务时,模型因沙箱配置不当而访问开放互联网,并尝试渗透第三方系统。一次 Anthropic 的突破甚至源于第三方评估者没有关闭正确的通道。
OpenAI 表示已开始监控 Astra 模型所有使用工具的推理,并为此付出可观算力成本;Anthropic 也表示在扩大模型可观测性。但两家公司均未回复 TechCrunch 关于如何追踪和控制 AI 智能体的问题。
前 Google 安全高管、QueryStory 负责人 Shapor Naghibzadeh 认为,必须把智能体放进严格隔离的环境中,从外部监测每一次工具调用、进程和网络连接。Simon Willison 则提出“致命三重因素”:智能体同时接触不可信输入、互联网和私人信息。专家指出,共享基础设施曾让智能体在 Hugging Face 攻击中互相通信,而人类可读的推理痕迹不会永远存在。