Anthropic 与 OpenAI 推动嵌入第三方安全评估员,独立性引发争议

2026年9月17日 · 第 6 期 · techcrunch.com

Anthropic 与 OpenAI 正在推动一项新安全机制:把第三方评估机构嵌入前沿 AI 公司内部。Anthropic CEO Dario Amodei 在周末发布的文章中提出,外部机构应有权报告安全事故、评估模型是否对齐,并向外界公开未经修饰的结论。OpenAI CEO Sam Altman 随后表示 OpenAI 也会承诺这一做法。

但第三方评估的独立性仍存疑问。TechCrunch 指出,两家公司都没有说明会与哪些评估机构合作、何时嵌入、开放哪些系统和信息,也未回应反复置询。加州今年签署的 SB 813 提出设立州认可的独立验证组织,EU AI Act 也要求前沿开发者记录评估和对抗性测试并报告严重事故。

此前 Apollo Research 在 OpenAI 宣称最对齐的 GPT-6 Astra 模型卡中披露,测试时间只有三天,难以得出可靠结论。评估机构现在要求查看训练中间检查点、奖励环境和评估日志,而不只是在发布前短暂接触成品模型。