Anthropic 请埃森哲进驻评估,独立性要落实到合同里
据 Anthropic与埃森哲 9 月 18 日公告,双方将建立进驻 Anthropic 的评估团队,由埃森哲旗下 Faculty 主导。两家公司分别预计未来五年在相关安全能力上投入至少 10 亿美元;这是预期投入,不是已经花掉的钱,也不是一次已完成的审计。
作者:韩启明|OC 政策与安全编辑
据 Anthropic与埃森哲 9 月 18 日公告,双方将建立进驻 Anthropic 的评估团队,由埃森哲旗下 Faculty 主导。两家公司分别预计未来五年在相关安全能力上投入至少 10 亿美元;这是预期投入,不是已经花掉的钱,也不是一次已完成的审计。
一句话结论:让评估者更早进入研发过程有意义,但“进驻”改善的是可见性,独立性还要靠资金、报告权和处置机制保证。
从发布前考试,走向持续观察
传统外部评估容易集中在模型准备发布时:拿到一个版本,运行测试,然后写出结果。它能发现当下问题,却未必看得到训练中途的变化,以及哪些风险曾经被内部讨论后搁置。
Anthropic 希望进驻评估者获得接近员工的访问条件,观察模型形成和部署决策。这种设计理论上可以把评估前移,不只看最后交出的答卷,也看过程中的取舍。
此前 OC 已在 AI 研发自动化报道中关注模型研发的控制问题。本次新增的是具体外部合作方与实施安排,而非再把同一自动化比例写一遍。
谁出钱,不是唯一问题,但必须说清楚
Anthropic 明确表示当前会直接支付埃森哲的评估工作,并承认信息访问、报告方式和长期筹资尚没有统一标准。它同时提及与其他非营利评估组织探讨不同资金安排。
直接付费不自动证明评估无效,但它构成需要管理的利益关系。所谓独立不能只靠公司名称不同来认定,而要看评估者在发现严重问题时是否可以坚持结论,是否能对外报告,以及合作终止会不会影响已发现问题的披露。
这和“专家有没有能力”也是不同问题。一个团队可以具备出色技术能力,却在权限或合同上无法把发现转化成外部可验证的信息。

三个权利,决定观察有没有后果
OC 认为,首先应看访问权:是只能运行指定测试,还是能查看必要日志、版本与关键决策记录?缺少过程资料,进驻办公室也可能只是换了位置的黑箱测试。
其次是报告权:公司是否可以无限期延后报告,评估者能否向适当外部机构升级问题,争议怎样记录?这些安排可以兼顾商业秘密与敏感信息,但不能让每个不利发现都消失在保密条款里。
最后是响应机制:评估者提出问题之后,谁负责修复、谁确认关闭、未解决事项如何影响上线?进驻团队并不天然拥有停止发布的权力,公告也不能被读成已经建立了这种制度。
投入规模不能替代可核验产出
五年投入说明两家公司愿意给这件事较大资源,但评估是否有效仍要看交付:覆盖了哪些版本、发现了哪些类别的问题、整改用了多久、是否留下独立复核路径。
同时,评估工作也可能与企业落地经验相互补充。真实用户如何配置权限、接入工具和处理数据,往往和实验室基准不同。能把这些场景带回模型评估,是潜在收益;前提是把商业合作、评估职责与结论发布的边界写清楚。
这次宣布适合被视为一项制度试验的起点,而不是给某家公司盖上“现在安全了”的印章。
关键事实
- 牵头团队:埃森哲旗下 Faculty。
- 工作范围:模型评估、红队、对齐评估与防护测试等。
- 资金口径:双方各预计五年投入至少 10 亿美元,不是已确认支出。
- 当前边界:细节和行业标准仍在形成,合作非独家。
OC 判断
韩启明认为,持续评估值得推进,但公众最终需要的不是评估者身处何处,而是他们能看见什么、能说什么,以及问题被发现后会发生什么。责任仍在模型公司,不能转包成一个合作品牌。
为什么重要
- 对开发者:模型供应商安全承诺应有可验证的过程证据。
- 对企业:采购时可以追问评估范围和未解决事项,而非只看合作名单。
- 对公众:独立报告机制比大额投入标题更能支撑问责。
评论
围绕这篇文章补充信息、提出问题或分享观察。