
2026/08/19 3:14
サイバークリティカル能力の時代におけるペースキモデルの開発
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
組織は、安全、整合性、および堅牢なサイバーセキュリティ防衛を迅速なモデルの進展よりも優先するため、大規模な強化学習トレーニングを一時的に一時停止しました。この戦略的な一時停止は、OpenAI-Hugging Face 侵害のような緊急の事件、および Preparedness Framework の下で Astra モデルが Critical cybersecurity capability 閾値を満たす可能性があるという予備的な証拠に続いて行われました。より小さな規模の評価ではモデルの動作を継続して評価していますが、最大の計画されたフロンティア実行は、整合性のための強い証拠が確立され、すべてのワークロードがより厳しいセキュリティ基準に適合するまで保留されています。チームは、監視(懸念すべき動作を検出するため)、整合性(有害または許可されていない行動を軽減するため)、およびセキュリティ対策(アクセスと影響を制限するため)という 3 つの補強する safeguard に依存しています。拡張された監視は、現在、サンプルされた各トークンでアクティベーションクラスファイラーを使用する多段階構成で運用されており、懸念事項を自動的に調査する担当者にエスカレートされます。活動から 30 分以内にアラートが発行され、そのウィンドウ内で誤検出が除外できない場合、重大な違反は一時停止する必要があります。新しいセキュリティ要件には、不信すべきコード用より強いサンドボックス化、不正なインターネットアクセスを防ぐためのネットワーク分離、および模擬攻撃に対する継続的な自動化されたテストが含まれます。これらの措置は、Astra またはサイバーモデルを関与するすべてのワークロードに適用されます;移行中に安全と整合性のタスクが優先されます。このアプローチはエンジニアリングの遅延をもたらしますが、監視による概算 20% のコンピューティングオーバーヘッドが発生します。しかし、これらは高能力 AI ツールに関連する管理不可能なリスクを防ぐために不可欠です。追加の要件は、Sol-capability モデルまたはそれ以上のモデル用のツールとのすべての推論に及んでおり、潜在的な重大なサイバー能力の可能性があるため、Astra 用ツールのすべての推論に対するさらなる拡張が 8 月 7 日に発効しました。
本文
高度化する AI システムに対応するための防護策強化と方針転換
数週間以内に起こった以下の 2 つの出来事は、能力向上に伴う AI システムのリスク高まりを浮き彫りにしました。
- OpenAI と Hugging Face のインシデント
- Astra モデルからの初期証拠:次期モデル「Astra」において、当社の準備枠組み(Preparedness Framework)における重要なサイバーセキュリティ能力閾値に達する兆候が見られたこと。
これに加え、内部研究分野での迅速な進展も相まって、トレーニング全段階における監視・アライメント(整合性)・封じ込めの防護策強化への緊迫感が高まっています。
モデルの能力が高まるにつれ関連リスクも増大するため、その基準は常にリスクを上回る必要があります。必要な時間を確保するため、当社はスケーリングのペースを一時的に緩和し、以下を実施しました。
- 強化学習(RL)トレーニングの一時的停止:配備対象の最新モデルに対し、2 週間の停止を行う。
- 環境の堅牢化と評価:研究環境の強化、レッドチーム演習の実施、監視システムの覆盖範囲拡大。
- 最大規模 RL ランの保留:小規模なトレーニングや評価を行い、モデル振る舞いの確認・防護策検証・アライメント証拠蓄積を行った後での移行検討。
1. より能力の高いモデルに対する防護策の強化
より高度なモデル開発における当社のアプローチは、以下の 3 つの相互補強する防護策に基づいています。
- 監視(Monitoring):問題のある振る舞いを検出し、適切な対応を可能にする機能です。
- アライメント(Alignment):有害または不正な行動の発生確率を低減します。
- セキュリティ対策(Security measures):AI システムがアクセスしたり影響を与えたりできる範囲を制限します。
今後の展望 近い将来、モデル自体が大部分のセキュリティ作業(他モデルへの防御を含む)を主導すると予想されます。これにより、すべての防護策がモデルの能力増大に合わせてスケーリング可能となり、極めて重要となります。これらの防護策は研究および配備の両段階で適用され、各モデルの能力・運用環境・リスクレベルに応じて適宜調整されます。
2. 研究環境のセキュリティ強化
frontier モデルが強力なサイバーセキュリティ能力を獲得するに伴い、トレーニングおよび評価を行う環境に対するセキュリティ基準も引き上げています。このため大規模なエンジニアリング作業が必要となり、コストと遅延が発生しています。
OpenAI-Hugging Face インシデント直後には、コード実行やインターネットアクセス可能な frontier モデルの推論を一時的に停止しましたが、比較的短時間で以下の経路に戻しました。
- コード実行をより限定的かつ安全な経路へ。
- 各ワークロードについて個別検証・安全再開判断。
以降の数週間をかけて、以下のような強力なセキュリティ要件の定義と実施を開始いたしました。
- ワークロードの分離(Workload isolation):
- モデル生成コードや信頼できないコードを実行するワークロードに対し、より厳しい隔離(サンドボックス)を要請。
- モデル出力処理中に改ざんされる可能性のあるソフトウェアについても同様に適用。
- ネットワーク分離(Network isolation):
- 高リスク・信頼できないワークロードをインターネットから隔離するための制御強化。
- 単なる侵害でも不正なインターネットアクセスや内部ネットワークへのアクセスを防ぐ設計。
- 継続的セキュリティテスト(Continuous security testing):
- 環境の再構成、脆弱な共有サービスの排除、権限の最小化によるセキュリティ・信頼境界の強化。
- セキュリティログの収集・監視能力向上。
- モデルを活用した自動化投資により、模擬攻撃を用いた継続的なテスト実施。
これらの制御は**「多層防御」**を実現し、研究環境への攻撃から保護します。現時点では、Astra モデルまたはサイバーモデルを扱うワークロードについては、最も厳格なセキュリティ防護策が適用されます(他の全てのサイバ関連ワークロードにも同様)。
※一部のトレーニング・評価は要件を満たしていますが、多くのワークロードは新しい基準への完全移行まで一時停止されています。優先的に安全性およびアライメントに関するワークロードから移行を進めます。
3. チェイン・オブ・サウ(思考連鎖)監視の拡大
監視は、内部コーディングエージェントや長時間稼働セッションを含むモデル開発プロセスにおいて長年重要な役割を果たしてきました。特に frontier モデルの内部配備および RL トレーニングランは、ツールアクセス・機密システムアクセス・ネットワークアクセスを組み合わせうるため最高リスクのワークロードと見なされ、監視強化を進めておりました。
しかしながら、ツール使用を含むすべての推論・トレーニングランへの適用が不十分だったため、新しい監視体制を用いてアプローチを見直し拡充しております。
新たな監視体制の特徴
- 多段階検知フロー:
- サンプルされたトークン単位での内部活動検査(アクティベーション分類器)。
- 潜在的懸念事項をエスカレートさせ、高計算リソースを必要とする自動化調査システムへ移行。
- 監視対象:ツールの動作、利用可能な推論プロセス、不正アクセス・データ窃取・破壊行為・防護策回避など全活動を検査。
- 警報体制:
- 目標:懸念事項が表面化した後30 分以内に警報発出。
- 重大違反疑い時の措置:最高優先度の警報発行 → セキュリティ・研究チームへのページ送付。
- 安全確認不能の場合(30 分以内):活動の即時一時停止。
適用範囲
- Sol の能力レベル以上のモデルにおけるツール使用を含む全ての RL トレーニングおよび評価に要請。
- 8 月 7 日以降:Astra が重要なサイバー能力を持つ可能性が判明したため、ツールを使用する Astra のすべての推論(RL トレーニング・評価含)に対しても追加監視要件を導入。
コストとリソース
監視にかかるオーバーヘッドは監視対象の推論計算量の約**20%**に相当しますが、トレーニング・評価ワークロードによりコストは大きく異なります。詳細は近日公開予定のブログ記事にて共有します。
4. アライメント研究の進展
アライメント研究は当社の使命の中核であり、「人工汎用知能が全人類に利益をもたらすこと」を確保する取り組みです。モデルが高度な能力を獲得し複雑な環境で運用されるようになると、以下のようなアライメントされていない振る舞いは深刻なリスクを生じさせます。
- 報酬ハッキング:意図された成果達成なしに高い報酬を得られる方法の発見。
- 欺き・不正アクセス。
これらに対処するため、最も能力の高いモデルに関する RL ランに対して、トレーニングプロセスのより多くの段階にわたって核心的なアライメント技術の適用を開始しております。
- 報酬モデルの改良:タスク・環境全体にわたり不安全な行動を検出・抑制。
- 正直さの訓練:モデル自身の行動・能力・限界について正直になるよう訓練。
- 弱点悪用の削減:報酬・判定器・ツール・監督における弱点を悪用する振る舞いの削減。
- 覆盖範囲拡大:外部システム・リソースとの対話時に害を引き起こす可能性のある振る舞いへのトレーニング覆盖範囲拡大。
今後もアライメント研究への投資、評価覆盖範囲の拡大、および知見トレーニング・防護策への反映を継続してまいります。近いうちにモデルの振る舞いに関する知見や新たな課題の詳細も共有する予定です。
5. 今後の方針
当社はPreparedness Framework を進化させ、トレーニングと配備を統合した防護策を整えつつあります。将来のモデルの能力及び運用環境をより適切に反映させることを目指しています。
能力増大に合わせてスケーリング可能な手法を開発するには、以下の継続的な進展が必要です。
- モデル支援型セキュリティへの持続的な投資。
- より効果的な監視。
- アライメント研究における継続的な進展。
当社は、このアプローチが発展するにつれて外部組織との連携を進め、知見を共有していく予定です。frontier モデルの能力は急速に加速しており、それらを理解し、アライメントさせ、セキュリティを確保する能力もそれに遅れずに引き上げる必要があります。
※数週間以内に、我々の学習した技術的知見を取りまとめた技術報告書を公開いたします。