Anthropic、アクセンチュアと5年間10億ドル超をかけた「埋め込み型」AI安全性評価で提携
Anthropicはアクセンチュアと提携し、社員レベルのアクセス権を持つ独立評価者を自社内に配置することになりました。CEOのダリオ・アモデイ氏が以前のエッセイで提起していた、フロンティアAI開発への外部監視の必要性というコミットメントを実現するものです。
詳細
- 「埋め込み型」の意味: 従来の外部監査人とは異なり、これらの評価者はAnthropic社内で社員と同等のアクセス権を持って働き、学習中のモデル開発を観察し、展開に関する意思決定を理解し、社員と直接やり取りできる
- 投資規模: Anthropicとアクセンチュアは、この評価体制の構築に向けて5年間で少なくとも10億ドルを投資する計画
- 運営主体: アクセンチュアのAI専門部門「Faculty」が提携を主導する
- 対象範囲: モデル評価、レッドチーミング、アライメント評価、安全対策のテスト
- 説明責任に関する立場: Anthropicは「独立した埋め込み型評価者は、我々の説明責任を軽減するものではなく、それをより検証可能にするものだ。モデルの安全性の責任は引き続き我々にある」としている
- 未解決の課題: 評価者のアクセスレベルや報告の仕組みに関する基準はまだ定まっておらず、両社とも長期的には個社が評価者に直接資金提供するのではなく、業界全体または政府によるプール型の資金モデルが望ましいとの見解を示している
- 非独占的な取り組み: Anthropicは複数の評価者と協力する意向で、既存のMETRとの提携に加え、今後さらなる提携が発表される見込み
その後
単一の評価パートナーシップに5年間で10億ドル超を投じるという規模の大きさは、Anthropicが社員レベルの外部監視を、一度限りの監査ではなく、今後のフロンティアモデル開発における構造的な一部として位置づけていることを示しています。同時に、他の評価者が同様の「埋め込み型」の役割を担う余地も残しています。