
2026/10/06 4:16
Beam:反射の 501B オープンウェイトモデル
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
要約は主なナラティブを十分に捉えていますが、この文脈においてモデルの重要性を規定するハードウェア規模およびデータカurationに関するいくつかの定量的詳細が含まれていません。改良版は、具体的なGPU数、トレーニング環境の性質(サンドボックス)、明示的なデータフィルタリング統計を統合し、それがなぜ効率的かつ強力なのかというより完全な図像を提供する必要があります。
以下に、欠落している要素を取り入れながら流れを維持した改善された要約を示します:
改良された要約: Reflection は、高効率なコーディング、複雑な推論、自律エージェントタスク向けに設計された最初のオープンウェイトスパースミキサー-of-エキスパート(MoE)モデル「Beam」を発表しました。全パラメータ数は Massive な 5010 億ですが、トークンあたり有効なのは 230 億のみであり、Beam は推論コストを劇的に削減しつつ、競合他社である GLM 5.2 と同等かそれ以上の性能を示し、特定のエージェントベンチマークでは Qwen 3.8-Max に迫ります。この効率性は、厳格な事前トレーニング(生データの約 95% が選別された 238 兆トークン)、ならびに 13 億個のサンドボックスを使用した 1 万台超の NVIDIA GB300 GPU クラスタ上で実施した先進的な強化学習によって実現されています。モデルは印象的な汎化性能を示し、ウェブブラウジングなどのツール使用スキルを明示的なトレーニングなしで習得します。来月後期に Apache 2.0 ライセンスの下で公開予定(早期アクセスはウェイトリスト経由)であり、「Reasoning Effort」パラメータを搭載して応答長とタスク複雑性のバランスを最適化しています。特に、トレーニング中での拡張により有効コンテキストを 100 万トークンまで引き上げられ、オープンウェイトモデルの効率性における重要なマイルストーンとなっています。
本文
Reflection 社初のオープン・ウェイトモデル「Beam」導入について
Reflection 社が初めて発表するオープン・ウェイト(開示)モデル**「Beam」**の導入を正式に発表いたします。以下の各セクションで、モデルの概要、性能、技術的特徴、および今後の展望について詳細をご紹介します。
モデル概要
- 基本仕様
- 全パラメータ数:5010 億個。
- アクティブ(稼働)パラメータ数:20 億個(スパースな MiKST・オブ・エキスパート(MoE)構造)。
- 最適化分野:コーディング、推論、エージェンツ(エージェント型)ワークロード向けに特化設計。
- 開発背景とデータセット
- Web と独自ライセンス契約を結んだ高品質なトークン計量から構成され、総トークン数は23.8 兆。
- 事前学習(Pretraining)および強化学習(RL)への主要投資により、既存の同規模オープン・ベースモデルと同等か、それ以上の性能を発揮しています。
- リリーススケジュール
- 現在、最終的なレッドチーム監査および評価を行っております。
- 今月中には、モデル重み、技術レポート、モデルカード、開発者向けアセットを公開予定。
- 早めのアクセス(Early Access)をご希望の場合は、公式サイトよりお申し込みください。
モデルの能力とベンチマーク性能
Beam はコーディング性能とエージェンツ性能に焦点を当ててトレーニングされました。西洋圏におけるオープン・ウェイト分野をリードするモデルです。
- 比較対象との性能差
- GLM 5.2(より大規模なオープンモデル)と比較可能。
- コーディングおよびエージェンツタスクにおいては、Qwen 3.8-Maxに近づく性能を誇ります。
- Kimi K3 などの最先端オープンモデルは依然として生きた能力面で優位である一方で、Beam の強みは推論時の効率性にあります。
- 推論効率の劇的向上
- 高度な推論ベンチマークでは、GLM-5.2 と同等のスコアを取得しつつ、推論に必要な計算リソースを3〜4 倍削減しています。
- Qwen 3.8-Max やパラメータ数 2T(2000 億)以上のクラスに属するモデルとの比較では、その効率性の差がさらに顕著です。
- 具体的なベンチマーク結果(図 2)
- DeepSWE、Humanity's Last Exam (HLE)、Terminal Bench 2.1 の基準において、FLOPs 数もトークン数も含めて最先端レベルの推論効率を示しました。
- トークンあたりの知能が向上し、より低廉なコストで強力なモデル能力を提供します。
- 企業向けのコーディングおよびエージェンツワークロードにおいて、非常に有用な主力モデルとして機能します。
注釈: 推論コストは生成フォワードパス計算量を「FLOPs ≈ 2 × アクティブパラメータ数 × アトtemptあたりの平均生成トークン数」と見積もっており、プロンプトプリフィルや文脈依存なアテンション演算などのオーバーヘッドを除いた大まかな計算量の比較です。
高計算量強化学習(High-Compute RL)
Beam では、高計算量強化学習を中央スケーリング軸の一つと位置づけ、RL サイエンズ、データ、およびインフラへの投資を通じて能力向上を図りました。
- トレーニング規模
- 10.5 千個の NVIDIA GB300 GPUを用いて、4 週間のトレーニング期間中に1 億回以上のロールアウト(シナリオ展開)を行いました。
- トレーニングおよび評価には約13 億個のサンドボックスを使用されました。
- 100 万個の高品質なコーディング、エージェンツ、STEM 分野の環境を開発・調達しました(オープンラボによる実施の中で最大の規模の一つ)。
- 非同期ポリシー勾配法の改良
- 大規模化に伴う「ポリシーの古さ(staleness)」やトレーニング・推論エンジンの数値ミスマッチといった課題に対し、新たなアルゴリズムを開発しました。
- これにより、1 日前に生成されたインタラクションからの学習においても不安定さなく機能する全体的な非同期 RL スケールアップが可能になりました。
- 成果の確認(図 3, 図 4)
- Inkling(3,000 万回ロールアウト)や MiMo(75.3 万回ロールアウト)と比較して、1 億回以上のロールアウトでトレーニングされた Beam のスコアは著しく優れています。
- 時間の経過とともに古さが蓄積されても、学習は安定して続きます。ポリシーから 1 日分遅れ(約 107 バージョン分)の状態でも数値的な安定性は保たれています。
効率的な推論能力の獲得
RL トレーニングにおいて、成功した解答を報酬化し、不要なトークンの生成を抑制する「制御可能な長さペナルティ」を採用しました。
- 学習プロセスの進化
- 初期段階では完了長が短くなるにつれて性能が向上(トークン効率性の学習)。
- その後、より強力なエージェンツ能力を獲得に伴い完了長が増加しましたが、追加トークンはさらなる性能向上を支えました。
- ユーザーコントロールと柔軟性(図 5)
- 「推論努力(reasoning effort)」パラメータを通じて、トークン効率性と高性能とのトレードオフをユーザーが制御できます。
- 設定値を下げると短い回答が可能になり、高く設定すると長いつながりを伴う推論を行い要求の高いタスクの性能向上が可能です。
RL による行動の一般化
トレーニングタスクを超えた範囲で汎化する推論およびエージェンツ能力を開発することを意図して設計されました。
- ドメイン横断的な学習
- ブラウザ関連タスクが含まれていなかったにもかかわらず、閲覧(ブラウジング)能力において一貫した向上が見られました。
- Web アクセスを与えられた際、自発的に他の大規模言語モデルを検索・問い合わせたり、OCR API を利用して文書を読み取ったりする能力を獲得しました。
- 汎用性の高いデモ
- 研究、アプリ開発、ゲームプレイ、機械学習ワークフローなど多岐にわたる分野で活用可能です。
- テキストのみをサポートしますが、情報をテキスト形式として表現できれば、他のモダリティの情報も処理できます。
- 他分布外(OOD)のドメインにおいて、最新の最小サイズの Gemma-4 モデル向けの Text2SQL タスク用のファインチューニングノートブックを自ら作成しました。
強化学習環境のスケーリング
最先端レベルの強化学習は、大量の困難で高品質なタスクを必要とします。
- 環境プールの構築
- 合成データパイプラインを通じて約100 万個の環境プールを構築し、独自ベンダーデータやオープンソースソースで補完しました。
- 厳格なキュレーションプロセス
- 難易度の選定: モデルが一貫して解決できるものも不可能なものであるでもないバランスを保証。
- 品質の確保: 不十分定義化されていない、誤解を招かない、推測できない、ハッキングできない、あるいは壊れていない・ノイズの多いものでないことへの厳格なフィルタリング。
- フィードバックループ: RL を通じてタスクを実際にテストし、さらなる品質や難易度の問題を発見して収集・フィルタリングを最適化。
- データ品質の重要性
- データ品質への妥協は能力の停滞(パレート点)や他の学習問題を招くことを確認しました。体系的な改善により、飽和現象を示すことなく能力向上を達成しています。
最先端レベルの RL インフラストラクチャ
高計算量エージェンツ RL は、ロールアウトの生成、ツールの実行、結果の評価、ならびに大規模でのモデル更新を要求します。
Beam のトレーニング中は、平均して11 万個の同時ロールアウトを持続させるための以下の 7 つの能力を実現しました。
- 完全に非同期の実行
- エージェントがロールアウトを生成する間に、トレーナーは学習を行い新しいモデルバージョンを公開します。ポリシーの古さを考慮した設計により、完了したロールアウトを効果的にトレーニングに入れます。
- 柔軟な計算割当
- ワークロードの変化に合わせて推論とトレーニングのバランスを調整(GPU レーシオ 3.9:1 から 5.4:1 まで変更可能)。
- 同じトレーニング系譜内で 5 つの GPU メッシュ構成間でもトレーナーをリサイズ可能。
- 高速なモデル更新
- 新しい重みは、推論フリートに平均で約12 秒以内で到達します。
- レール間トラフィックを 75% 削減するとともに、フリート全体での新重みの採用速度を2.2 倍に向上させました。
- 推論障害に対する耐性
- キャンペーン期間中に発生した71 の推インシデントは、トレーニングジョブを停止することなく処理されました。
- 損失容量はサージング GPU ミニットに占める割合でわずか**0.02%**にとどまりました。
- 大規模な環境サポート
- キャンペーン中は最大17 万個の同時サンドボックスをサポート。
- 2 クラウド、4 リージョンにまたがり 10 億回以上のサンドボックス作成リクエストを処理し、新規の 90% は 10 秒以内で準備完了しています。
- 効率的なトレーナーパック
- ダイナミックパックによりトレーニングバッチは平均**99.99%**の高フルネスを維持。
- スループット変動を 1.5% 以内にとどめています。
- 可視化と報酬整合性
- トークン単位のレコードにより、各ステップごとの数値整合性を検証可能にしました。
- 検証器エグゾルプタ(verifier exploits)からの再スクリーンによる報酬の透明性を確保しました。
推論のための基盤モデル事前学習
強化学習は堅牢なベースモデルの上に構築されます。Beam の基盤にはコーディングドメインに豊富な知識、増幅可能な天来のエージェンツ能力、ならびに安定した MoE 最適化ダイナミクスを確保しました。
- スケーリングレシピの確立
- 段階的に大規模な一連のモデルを事前学習し、性能を予測可能にしました。
- 慎重にモデルティアを設計し、多様な社内コードおよび Web 検証セットをキュレートするとともに、トレーニングデータに対して激しくデコンタミネーション(汚染除去)を行いました。
- 成果
- 最終的な Beam Base は予測された性能と一致し、アクセス可能な同規模オープンソースベースモデルとも同等かそれ以上の性能を発揮しました。
- 計算資源に対する予測可能性(図 6)
- 4 つの桁にわたって予測可能にスケールし、デコンタミネーション済みコードおよび Web 検証データにおいてパレート最適解を達成しています。
安定したかつバランスのとれた MoE 最適化
Beam のアーキテクチャと最適化レシピは、持続的な下流 RL を支える数値的に健全な基盤を重視しています。
- エキスパート利用率の均一化(図 7)
- DeepSeek-AI 他(2024)による負荷分散手法を基盤とし、トレーニング後期のルーティング扰动を減らすためのコスインデクリートを導入。
- シーケンスレベルのバランス付けにより、事前学習分布外データにおけるエキスパート利用の均衡を促進。
- 最終的なベースにはほぼ完璧な均一利用率が確保され、学習された推論のために全てのエキスパートを使用できるようになりました。
- 残差と信号伝播の安定化(図 8)
- リザルブストリーム: サブレイヤー出力が蓄積する際の活性化成長に逆働する深さベースのスケーリング手法を開発。
- サンウィッチノーム、要素ごとのアテンションゲートイング、FP32 残留積算を組み合わせたことで、全ての層において健全な信号伝播を保証しています。
- 全 52 レヤにわたり事前学習中にリザルブストリーム RMS は有界に保たれ、滑らかな深さ依存軌跡を示しています。
品質重視のデータキュレーション
Beam は Web、公開ソース、ならびに独自ライセンス契約を結んだデータセットから収集された多様で高品質なトークン計量23.8 兆に対し事前学習されました。
- 独自の品質分類器の開発
- Web、コード、STEM コンテンツ用に開発し、データを微細な品質ティアに分割するとともに、より優れた材料へのトレーニング比重を設定しました。
- 最先端 OSS データフレームワークで使用されている従来の Web フィルターを大きく超える精度と recall を実現。
- 約95%の生インターネットトークンはパース、重複除去、およびキュレーションを通じて排除されましたが、高品質トークン計量約1.8 兆(うちキュレーション済み Web コードトークンの 87%)を保持しました。
- コードモデリングへの最適化
- 各言語に対して個別にチューニングされたフィルタを適用し、低品質な自動生成および学習不可能なコンテンツを取り除きました。
- 過剰表現された言語やファイルタイプは再均衡化され、さらなる曝露の拡大を実現しました。
- STEM ドメインへの強化
- PDF アーティファクト処理向けの高スループットパイプラインを開発し、幅広い STEM 分野の知識を持たせることを確保しました。
- ビジョン・ランゲージ OCR モデルと独自品質分類器を統合し、ペタバイト規模の技術データを処理します。
最先端グレードの事前学習インフラ
Beam は6,144 個の NVIDIA GB300 NVL72 GPUからなるクラスタ上で、約 4 週間以内のエンドツーエンドトレーニングを実施しました。
- 自社構築のインフラスタック
- 新型トポロジー認識 Kubernetes ベーススケジューラ、継続的なヘルスモニタリングシステム、半自律的な SDC(サイレントデータ破損)検出システムなどを自社開発。
- 高品質な実行完了
- 不安定さまたは大きな回復不能スパイクを観察しませんでした。
- チェックポインティングやノードヘルス管理の向上により、グッドプット(最終モデルに含まれるトレーニングステップ比率)は終了時点で**92.3%**に達しました。
ミドルトレーニング段階での強力な事前知識の構築
高計算量 RL のための基盤として設計され、より要求の高いタスクから学習するための知識、推論、およびツール使用能力を開発します。
- 多段階データキュレーションパイプライン
- 現実世界のタスクの構造と複雑性を捉えつつ、生データ単独では困難な学習対象となる能力の範囲を拡大しました。
- 長大な推論に富んだドキュメントを用い、モデルに論理連鎖の拡張を提示します。
- 有効コンテキスト長の拡張
- 有効コンテキスト長を100 万トークンまで拡張。
- 構造化コードリポジトリや高品質の長文ドキュメントを組み合わせて、モデルに長序列にわたり関連情報の特定、保持、および接続を教えました。
セーフティとアライメント
事前学習済みチェックポイントからの第 2 のモデルをトレーニングし、マルチ・ティーチャーオンポリシー蒸留(MOPD)により大規模 RL テACHER モデルと専用セーフティ・アライメント教師モデルの能力を統合しました。
- 3 つの階層に整理された原則
- 守るべき規則: 安全ポリシーへの準拠と AI エージェントとしてのアイデンティティ維持。
- 満たすべき質的要素: 与えられた文脈の利用、正確な主張の提示、不確実性の認め方、透明性のある追随など。
- デフォルトスタイル: 直接的で徹底的であり、効率的かつ能動的にユーザーの次のニーズを予測する姿勢。
- 予報可能な行動形成(図 10)
- アライメントおよびセーフティ RL は、検証不可能なドメインにおいても予測可能に Beam の行動を形成します。
- ハルシネーションや過度なフォーマットなどの行動の抑制ならびに全体的なインタラクション品質の改善が達成されました(RL ゲイン r=0.79 対 r=0.46)。
- Deliberative Alignment
- 安全ポリシーをモデルの推論自体に組み込み、敵対的かつ反復的に構築されたデータセットを用いて訓練しました。
- 単ターンからエージェンツシナリオまで、ツールを使用するモデルに不審な行動をとらせるシミュレーションを通じて、過剰拒否と有害コンプライアンスの双方を削減しました。
今後の展望
- Early Access の登録
- この初期バージョンを特定のユーザーグループに提供しており、待機リストへの登録はこちらから可能です。
- オープンソース化計画
- 今月中には、Apache 2.0 ライセンス下でモデル重み、ならびに実行・評価・ファインチューニングのためのフルスタックドキュメントを公開いたします。
- 分散パートナーのエコシステムとの連携および広範なオープンソースライブラリとの統合を開始します。
- 「オープン知能」への歩み
- Beam はシリーズ初となるモデルであり、当チームが取り組む「オープン知能」の初の実証です。
- 既に次のモデルをトレーニングしており、リリースごとにオープンフロンティアをインテリジェンスフロンティアに近づけていくことを目指しています。