Anthropic 任命 Accenture 为首个嵌入式 AI 安全评估团队
Anthropic 于 2026 年 9 月 18 日宣布,Accenture 的 Faculty 团队将成为首个嵌入式评估者,负责红队、对齐和安全护栏测试,背后伴随十亿美元的五年投资。

2026 年 9 月 18 日,Anthropic 正式宣布,Accenture 旗下的 AI 业务部门 Faculty 的员工将被整合进公司安全实验室,承担嵌入式评估者的角色,这标志着大型 AI 实验室首次把外部咨询公司的专业团队直接嵌入研发流程之中。
这些嵌入式评估者的主要职责被划分为三大核心活动:首先进行模拟对抗攻击的红队演练,以发现系统潜在的安全漏洞;其次评估模型输出与人类意图之间的对齐程度,确保 AI 行为符合预期价值观;最后对 Anthropic 最新发布的 Claude 系列模型内部的安全护栏进行高强度压力测试,检验其在极端情境下的稳健性。
资金承诺与长期融资模式
Anthropic 与 Accenture 联手制定的五年计划中,双方承诺投入至少十亿美元,用于构建和扩展嵌入式评估能力。初期资金由 Anthropic 全额提供,随后计划通过行业合资基金、公共资金以及可能的政府补贴等渠道持续注资,以确保项目的长期可持续性。
值得注意的是,这一合作并非排他性安排。Anthropic 已公开透露,正在与 METR 以及其他多家机构进行洽谈,预计在今年下半年会宣布更多嵌入式评估者,以形成更广泛的安全生态体系。
为何选择 Accenture
Anthropic 之所以将 Accenture 视为首选合作伙伴,主要基于其在大型企业和政府部门部署 AI 解决方案方面积累的丰富经验,这被认为是确保评估过程具备实战背景的关键因素。
同时,Accenture 在业务运作上保持相对独立的功能结构,这有助于降低与传统 AI 咨询公司可能出现的利益冲突风险,从而提升评估结果的客观性和可信度。
当前业界尚未形成统一的标准来界定嵌入式评估者的职责范围、沟通协议以及责任承担方式。Anthropic 表示,在合作深化的过程中,将与 Accenture 共同制定一套系统化的方法论,以填补监管空白并提供可操作的行业指引。
批评与 Anthropic 的回应
部分观察者担忧,将实验室内部的评估工作交由同一方支付费用的外部团队,可能削弱评估的独立性,导致结果出现偏差。对此,Anthropic 强调,财务安排并不影响其对模型安全的最终责任,独立性仍由严格的内部治理机制保障。
公司进一步指出,可信度的核心在于三项实际因素:对内部模型细节的真实访问权、发布不利发现的自由权,以及在安全评估与商业咨询建议之间设置明确防火墙,防止信息交叉影响。
- 红队对抗测试
- 基于人类价值的对齐评分
- 安全护栏压力测试
- 向公共登记处报告不利发现
上述列表概括了 Faculty 团队在项目期间预期交付的核心成果,每一项都将在结构化报告中详细记录,随后 Anthropic 将与独立审计机构共享这些报告,并在必要时提交给监管部门以供审查。
对中国企业而言,这一合作模式意味着在使用 Anthropic 模型时可以获得更透明的安全监管流程。企业能够请求具备深度部署经验的第三方进行独立安全审计,同时受益于嵌入式评估者提供的快速反馈机制。
这种双轨并行的审计方式有望显著缩短模型合规认证的时间,降低潜在安全漏洞的风险,并为企业提供更明确的证据,证明其集成的 AI 系统符合严格的伦理与监管标准。
在北京的 AI 行业研讨会上,Anthropic 的安全主管表示,未来将继续扩大与本地合作伙伴的合作范围,确保在中国市场的安全评估能够本土化、合规化,并与全球安全治理框架保持一致。
信息来源
- Anthropic's first embedded evaluator is … Accenture?TechCrunch · 2026年9月18日
- Anthropic selects Accenture as first embedded evaluator in safety pushCNBC · 2026年9月18日



