Beam:反射の 501B オープンウェイトモデル

2026/10/06 4:16

Beam:反射の 501B オープンウェイトモデル

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

要約は主なナラティブを十分に捉えていますが、この文脈においてモデルの重要性を規定するハードウェア規模およびデータカurationに関するいくつかの定量的詳細が含まれていません。改良版は、具体的なGPU数、トレーニング環境の性質(サンドボックス)、明示的なデータフィルタリング統計を統合し、それがなぜ効率的かつ強力なのかというより完全な図像を提供する必要があります。

以下に、欠落している要素を取り入れながら流れを維持した改善された要約を示します:

改良された要約: Reflection は、高効率なコーディング、複雑な推論、自律エージェントタスク向けに設計された最初のオープンウェイトスパースミキサー-of-エキスパート(MoE)モデル「Beam」を発表しました。全パラメータ数は Massive な 5010 億ですが、トークンあたり有効なのは 230 億のみであり、Beam は推論コストを劇的に削減しつつ、競合他社である GLM 5.2 と同等かそれ以上の性能を示し、特定のエージェントベンチマークでは Qwen 3.8-Max に迫ります。この効率性は、厳格な事前トレーニング(生データの約 95% が選別された 238 兆トークン)、ならびに 13 億個のサンドボックスを使用した 1 万台超の NVIDIA GB300 GPU クラスタ上で実施した先進的な強化学習によって実現されています。モデルは印象的な汎化性能を示し、ウェブブラウジングなどのツール使用スキルを明示的なトレーニングなしで習得します。来月後期に Apache 2.0 ライセンスの下で公開予定(早期アクセスはウェイトリスト経由)であり、「Reasoning Effort」パラメータを搭載して応答長とタスク複雑性のバランスを最適化しています。特に、トレーニング中での拡張により有効コンテキストを 100 万トークンまで引き上げられ、オープンウェイトモデルの効率性における重要なマイルストーンとなっています。

本文

Reflection 社初のオープン・ウェイトモデル「Beam」導入について

Reflection 社が初めて発表するオープン・ウェイト(開示)モデル**「Beam」**の導入を正式に発表いたします。以下の各セクションで、モデルの概要、性能、技術的特徴、および今後の展望について詳細をご紹介します。

モデル概要

  • 基本仕様
    • 全パラメータ数:5010 億個。
    • アクティブ(稼働)パラメータ数:20 億個(スパースな MiKST・オブ・エキスパート(MoE)構造)。
    • 最適化分野:コーディング、推論、エージェンツ(エージェント型)ワークロード向けに特化設計。
  • 開発背景とデータセット
    • Web と独自ライセンス契約を結んだ高品質なトークン計量から構成され、総トークン数は23.8 兆。
    • 事前学習(Pretraining)および強化学習(RL)への主要投資により、既存の同規模オープン・ベースモデルと同等か、それ以上の性能を発揮しています。
  • リリーススケジュール
    • 現在、最終的なレッドチーム監査および評価を行っております。
    • 今月中には、モデル重み、技術レポート、モデルカード、開発者向けアセットを公開予定。
    • 早めのアクセス(Early Access)をご希望の場合は、公式サイトよりお申し込みください。

モデルの能力とベンチマーク性能

Beam はコーディング性能とエージェンツ性能に焦点を当ててトレーニングされました。西洋圏におけるオープン・ウェイト分野をリードするモデルです。

  • 比較対象との性能差
    • GLM 5.2(より大規模なオープンモデル)と比較可能。
    • コーディングおよびエージェンツタスクにおいては、Qwen 3.8-Maxに近づく性能を誇ります。
    • Kimi K3 などの最先端オープンモデルは依然として生きた能力面で優位である一方で、Beam の強みは推論時の効率性にあります。
  • 推論効率の劇的向上
    • 高度な推論ベンチマークでは、GLM-5.2 と同等のスコアを取得しつつ、推論に必要な計算リソースを3〜4 倍削減しています。
    • Qwen 3.8-Max やパラメータ数 2T(2000 億)以上のクラスに属するモデルとの比較では、その効率性の差がさらに顕著です。
  • 具体的なベンチマーク結果(図 2)
    • DeepSWE、Humanity's Last Exam (HLE)、Terminal Bench 2.1 の基準において、FLOPs 数もトークン数も含めて最先端レベルの推論効率を示しました。
    • トークンあたりの知能が向上し、より低廉なコストで強力なモデル能力を提供します。
    • 企業向けのコーディングおよびエージェンツワークロードにおいて、非常に有用な主力モデルとして機能します。

注釈: 推論コストは生成フォワードパス計算量を「FLOPs ≈ 2 × アクティブパラメータ数 × アトtemptあたりの平均生成トークン数」と見積もっており、プロンプトプリフィルや文脈依存なアテンション演算などのオーバーヘッドを除いた大まかな計算量の比較です。

高計算量強化学習(High-Compute RL)

Beam では、高計算量強化学習を中央スケーリング軸の一つと位置づけ、RL サイエンズ、データ、およびインフラへの投資を通じて能力向上を図りました。

  • トレーニング規模
    • 10.5 千個の NVIDIA GB300 GPUを用いて、4 週間のトレーニング期間中に1 億回以上のロールアウト(シナリオ展開)を行いました。
    • トレーニングおよび評価には約13 億個のサンドボックスを使用されました。
    • 100 万個の高品質なコーディング、エージェンツ、STEM 分野の環境を開発・調達しました(オープンラボによる実施の中で最大の規模の一つ)。
  • 非同期ポリシー勾配法の改良
    • 大規模化に伴う「ポリシーの古さ(staleness)」やトレーニング・推論エンジンの数値ミスマッチといった課題に対し、新たなアルゴリズムを開発しました。
    • これにより、1 日前に生成されたインタラクションからの学習においても不安定さなく機能する全体的な非同期 RL スケールアップが可能になりました。
  • 成果の確認(図 3, 図 4)
    • Inkling(3,000 万回ロールアウト)や MiMo(75.3 万回ロールアウト)と比較して、1 億回以上のロールアウトでトレーニングされた Beam のスコアは著しく優れています。
    • 時間の経過とともに古さが蓄積されても、学習は安定して続きます。ポリシーから 1 日分遅れ(約 107 バージョン分)の状態でも数値的な安定性は保たれています。

効率的な推論能力の獲得

RL トレーニングにおいて、成功した解答を報酬化し、不要なトークンの生成を抑制する「制御可能な長さペナルティ」を採用しました。

  • 学習プロセスの進化
    • 初期段階では完了長が短くなるにつれて性能が向上(トークン効率性の学習)。
    • その後、より強力なエージェンツ能力を獲得に伴い完了長が増加しましたが、追加トークンはさらなる性能向上を支えました。
  • ユーザーコントロールと柔軟性(図 5)
    • 「推論努力(reasoning effort)」パラメータを通じて、トークン効率性と高性能とのトレードオフをユーザーが制御できます。
    • 設定値を下げると短い回答が可能になり、高く設定すると長いつながりを伴う推論を行い要求の高いタスクの性能向上が可能です。

RL による行動の一般化

トレーニングタスクを超えた範囲で汎化する推論およびエージェンツ能力を開発することを意図して設計されました。

  • ドメイン横断的な学習
    • ブラウザ関連タスクが含まれていなかったにもかかわらず、閲覧(ブラウジング)能力において一貫した向上が見られました。
    • Web アクセスを与えられた際、自発的に他の大規模言語モデルを検索・問い合わせたり、OCR API を利用して文書を読み取ったりする能力を獲得しました。
  • 汎用性の高いデモ
    • 研究、アプリ開発、ゲームプレイ、機械学習ワークフローなど多岐にわたる分野で活用可能です。
    • テキストのみをサポートしますが、情報をテキスト形式として表現できれば、他のモダリティの情報も処理できます。
    • 他分布外(OOD)のドメインにおいて、最新の最小サイズの Gemma-4 モデル向けの Text2SQL タスク用のファインチューニングノートブックを自ら作成しました。

強化学習環境のスケーリング

最先端レベルの強化学習は、大量の困難で高品質なタスクを必要とします。

  • 環境プールの構築
    • 合成データパイプラインを通じて約100 万個の環境プールを構築し、独自ベンダーデータやオープンソースソースで補完しました。
  • 厳格なキュレーションプロセス
    • 難易度の選定: モデルが一貫して解決できるものも不可能なものであるでもないバランスを保証。
    • 品質の確保: 不十分定義化されていない、誤解を招かない、推測できない、ハッキングできない、あるいは壊れていない・ノイズの多いものでないことへの厳格なフィルタリング。
    • フィードバックループ: RL を通じてタスクを実際にテストし、さらなる品質や難易度の問題を発見して収集・フィルタリングを最適化。
  • データ品質の重要性
    • データ品質への妥協は能力の停滞(パレート点)や他の学習問題を招くことを確認しました。体系的な改善により、飽和現象を示すことなく能力向上を達成しています。

最先端レベルの RL インフラストラクチャ

高計算量エージェンツ RL は、ロールアウトの生成、ツールの実行、結果の評価、ならびに大規模でのモデル更新を要求します。

Beam のトレーニング中は、平均して11 万個の同時ロールアウトを持続させるための以下の 7 つの能力を実現しました。

  • 完全に非同期の実行
    • エージェントがロールアウトを生成する間に、トレーナーは学習を行い新しいモデルバージョンを公開します。ポリシーの古さを考慮した設計により、完了したロールアウトを効果的にトレーニングに入れます。
  • 柔軟な計算割当
    • ワークロードの変化に合わせて推論とトレーニングのバランスを調整(GPU レーシオ 3.9:1 から 5.4:1 まで変更可能)。
    • 同じトレーニング系譜内で 5 つの GPU メッシュ構成間でもトレーナーをリサイズ可能。
  • 高速なモデル更新
    • 新しい重みは、推論フリートに平均で約12 秒以内で到達します。
    • レール間トラフィックを 75% 削減するとともに、フリート全体での新重みの採用速度を2.2 倍に向上させました。
  • 推論障害に対する耐性
    • キャンペーン期間中に発生した71 の推インシデントは、トレーニングジョブを停止することなく処理されました。
    • 損失容量はサージング GPU ミニットに占める割合でわずか**0.02%**にとどまりました。
  • 大規模な環境サポート
    • キャンペーン中は最大17 万個の同時サンドボックスをサポート。
    • 2 クラウド、4 リージョンにまたがり 10 億回以上のサンドボックス作成リクエストを処理し、新規の 90% は 10 秒以内で準備完了しています。
  • 効率的なトレーナーパック
    • ダイナミックパックによりトレーニングバッチは平均**99.99%**の高フルネスを維持。
    • スループット変動を 1.5% 以内にとどめています。
  • 可視化と報酬整合性
    • トークン単位のレコードにより、各ステップごとの数値整合性を検証可能にしました。
    • 検証器エグゾルプタ(verifier exploits)からの再スクリーンによる報酬の透明性を確保しました。

推論のための基盤モデル事前学習

強化学習は堅牢なベースモデルの上に構築されます。Beam の基盤にはコーディングドメインに豊富な知識、増幅可能な天来のエージェンツ能力、ならびに安定した MoE 最適化ダイナミクスを確保しました。

  • スケーリングレシピの確立
    • 段階的に大規模な一連のモデルを事前学習し、性能を予測可能にしました。
    • 慎重にモデルティアを設計し、多様な社内コードおよび Web 検証セットをキュレートするとともに、トレーニングデータに対して激しくデコンタミネーション(汚染除去)を行いました。
  • 成果
    • 最終的な Beam Base は予測された性能と一致し、アクセス可能な同規模オープンソースベースモデルとも同等かそれ以上の性能を発揮しました。
  • 計算資源に対する予測可能性(図 6)
    • 4 つの桁にわたって予測可能にスケールし、デコンタミネーション済みコードおよび Web 検証データにおいてパレート最適解を達成しています。

安定したかつバランスのとれた MoE 最適化

Beam のアーキテクチャと最適化レシピは、持続的な下流 RL を支える数値的に健全な基盤を重視しています。

  • エキスパート利用率の均一化(図 7)
    • DeepSeek-AI 他(2024)による負荷分散手法を基盤とし、トレーニング後期のルーティング扰动を減らすためのコスインデクリートを導入。
    • シーケンスレベルのバランス付けにより、事前学習分布外データにおけるエキスパート利用の均衡を促進。
    • 最終的なベースにはほぼ完璧な均一利用率が確保され、学習された推論のために全てのエキスパートを使用できるようになりました。
  • 残差と信号伝播の安定化(図 8)
    • リザルブストリーム: サブレイヤー出力が蓄積する際の活性化成長に逆働する深さベースのスケーリング手法を開発。
    • サンウィッチノーム、要素ごとのアテンションゲートイング、FP32 残留積算を組み合わせたことで、全ての層において健全な信号伝播を保証しています。
    • 全 52 レヤにわたり事前学習中にリザルブストリーム RMS は有界に保たれ、滑らかな深さ依存軌跡を示しています。

品質重視のデータキュレーション

Beam は Web、公開ソース、ならびに独自ライセンス契約を結んだデータセットから収集された多様で高品質なトークン計量23.8 兆に対し事前学習されました。

  • 独自の品質分類器の開発
    • Web、コード、STEM コンテンツ用に開発し、データを微細な品質ティアに分割するとともに、より優れた材料へのトレーニング比重を設定しました。
    • 最先端 OSS データフレームワークで使用されている従来の Web フィルターを大きく超える精度と recall を実現。
    • 約95%の生インターネットトークンはパース、重複除去、およびキュレーションを通じて排除されましたが、高品質トークン計量約1.8 兆(うちキュレーション済み Web コードトークンの 87%)を保持しました。
  • コードモデリングへの最適化
    • 各言語に対して個別にチューニングされたフィルタを適用し、低品質な自動生成および学習不可能なコンテンツを取り除きました。
    • 過剰表現された言語やファイルタイプは再均衡化され、さらなる曝露の拡大を実現しました。
  • STEM ドメインへの強化
    • PDF アーティファクト処理向けの高スループットパイプラインを開発し、幅広い STEM 分野の知識を持たせることを確保しました。
    • ビジョン・ランゲージ OCR モデルと独自品質分類器を統合し、ペタバイト規模の技術データを処理します。

最先端グレードの事前学習インフラ

Beam は6,144 個の NVIDIA GB300 NVL72 GPUからなるクラスタ上で、約 4 週間以内のエンドツーエンドトレーニングを実施しました。

  • 自社構築のインフラスタック
    • 新型トポロジー認識 Kubernetes ベーススケジューラ、継続的なヘルスモニタリングシステム、半自律的な SDC(サイレントデータ破損)検出システムなどを自社開発。
  • 高品質な実行完了
    • 不安定さまたは大きな回復不能スパイクを観察しませんでした。
    • チェックポインティングやノードヘルス管理の向上により、グッドプット(最終モデルに含まれるトレーニングステップ比率)は終了時点で**92.3%**に達しました。

ミドルトレーニング段階での強力な事前知識の構築

高計算量 RL のための基盤として設計され、より要求の高いタスクから学習するための知識、推論、およびツール使用能力を開発します。

  • 多段階データキュレーションパイプライン
    • 現実世界のタスクの構造と複雑性を捉えつつ、生データ単独では困難な学習対象となる能力の範囲を拡大しました。
    • 長大な推論に富んだドキュメントを用い、モデルに論理連鎖の拡張を提示します。
  • 有効コンテキスト長の拡張
    • 有効コンテキスト長を100 万トークンまで拡張。
    • 構造化コードリポジトリや高品質の長文ドキュメントを組み合わせて、モデルに長序列にわたり関連情報の特定、保持、および接続を教えました。

セーフティとアライメント

事前学習済みチェックポイントからの第 2 のモデルをトレーニングし、マルチ・ティーチャーオンポリシー蒸留(MOPD)により大規模 RL テACHER モデルと専用セーフティ・アライメント教師モデルの能力を統合しました。

  • 3 つの階層に整理された原則
    1. 守るべき規則: 安全ポリシーへの準拠と AI エージェントとしてのアイデンティティ維持。
    2. 満たすべき質的要素: 与えられた文脈の利用、正確な主張の提示、不確実性の認め方、透明性のある追随など。
    3. デフォルトスタイル: 直接的で徹底的であり、効率的かつ能動的にユーザーの次のニーズを予測する姿勢。
  • 予報可能な行動形成(図 10)
    • アライメントおよびセーフティ RL は、検証不可能なドメインにおいても予測可能に Beam の行動を形成します。
    • ハルシネーションや過度なフォーマットなどの行動の抑制ならびに全体的なインタラクション品質の改善が達成されました(RL ゲイン r=0.79 対 r=0.46)。
  • Deliberative Alignment
    • 安全ポリシーをモデルの推論自体に組み込み、敵対的かつ反復的に構築されたデータセットを用いて訓練しました。
    • 単ターンからエージェンツシナリオまで、ツールを使用するモデルに不審な行動をとらせるシミュレーションを通じて、過剰拒否と有害コンプライアンスの双方を削減しました。

今後の展望

  • Early Access の登録
    • この初期バージョンを特定のユーザーグループに提供しており、待機リストへの登録はこちらから可能です。
  • オープンソース化計画
    • 今月中には、Apache 2.0 ライセンス下でモデル重み、ならびに実行・評価・ファインチューニングのためのフルスタックドキュメントを公開いたします。
    • 分散パートナーのエコシステムとの連携および広範なオープンソースライブラリとの統合を開始します。
  • 「オープン知能」への歩み
    • Beam はシリーズ初となるモデルであり、当チームが取り組む「オープン知能」の初の実証です。
    • 既に次のモデルをトレーニングしており、リリースごとにオープンフロンティアをインテリジェンスフロンティアに近づけていくことを目指しています。

同じ日のほかのニュース

一覧に戻る →

2026/10/06 6:00

Opus 5.5 エージェントが室温で機能する磁性半導体の候補物質 2 つを発見

## Japanese Translation: 研究者らは、反強磁性とスピンソート機能を統合する有望なルティンガー補償磁性体の候補を 2 つ同定した。これらは外部磁場なしで高密度メモリに既に利用可能な次世代スピントロニクス材料の存在を示唆している。候補 1 の YBaMnFeO₅ は AI エージェントによって設計されたものであり、イットリウム、バリウム、マンガン、鉄、酸素の 5 つの元素からなる化合物である。予測されるバンドギャップは 2.35 eV、正孔のスピンウィンドウは 1.0 eV、電子のスピンウィンドウは 1.4 eV であった。シミュレーションでは磁性が約 490 K に及ぶと予測されるが、原子チェッカーボード構造が高熱合成(900–1300 °C)において不安定化しうるため、特別な手法なしでこの温度域での標準的な高温合成を困難にしている。候補 2 の KV[Cr(CN)₆] は、1999 年に最初に見出されたプルussian ブルー族に属する既存化合物であり、半導体としてのスピン特性が以前見過ごされていた。クロムはシアン化物基(炭素で終端しており、バナジウムは窒素で終端する)に結合している。予測されるバンドギャップは 2.1 eV、正孔のスピンウィンドウは 2.6 eV、電子のスピンウィンドウは 1.6 eV であった。完全な結晶ではゼロの全スピンモーメントを持つと予測されるが、1999 年の粉体試料は閉じ込められた水の影響により約 365 K まで磁気秩序を保持しつつも、わずかな残留モーメント(0.125 ボアマグネトン)を示した。密度汎関数理論を用いた量子力学シミュレーションにより、両材料のこれらの特性が確認された。今後の研究では、KV[Cr(CN)₆] の純度を向上させて水起因のアーティファクトを排除し、YBaMnFeO₅ の脆い格子構造を安定化させる合成戦略の改善に焦点を当て、実用的かつ効率的な磁気メモリソリューションへの明確な経路を提供する。

2026/10/06 6:15

Dust:バックプロパゲーションなしでトランスフォーマーを事前学習する手法

## Japanese Translation: Dust は、Transformer リンゲージモデルの事前学習において逆伝播と競合するゼロ次最適化手法です。重みそのものを更新する代わりに、Dust はすべてのトークンごとに活性化空間への擾乱を適用し、「仮想集団」を生成します。これにより、単一の順方向パス内で数千の仮想モデルを並列評価でき、モデル重みの複雑な変化を実体化する必要がありません。EGGROLL-Transformer といった基準手法と比較して、100 万トークンのトークン予算以上においては、1,000 倍から 10,000 倍の効率向上を実現します。従来の常識とは対照的に、大規模モデル(最大 2.43 億パラメータ)は小規模モデルよりも集団効率が良く、2.43 億パラメータを持つモデルは、多くの集団サイズにおいて 120 倍小さいモデルを上回ります。Dust の勾配推定値は逆伝播と良好に一致し、集団サイズが増加するにつれて改善され、10 億トークンに至るまで強い一貫性を保ちます。この手法は、順方向パス間でレイヤ種をジッターさせ、また出力勾配の推定値を用いて直接のトークン損失ではなく注意内部をスコアリングすることで、擾乱間の相互干渉を低減します。ノイズスケールやクレジット減衰などの超パラメータは、学習なしで逆伝播勾配への余弦類似度を最大化するようにグリッド検索によってチューニング可能であり、トークン予算と集団サイズを跨いで汎化します。10 万から 2,000 万トークン、集団サイズ 64 から 1.6 万にわたる実験において、Dust は大規模のトークン予算下で集団サイズが増加するに伴い逆伝播とのギャップを縮めていることが示されています。Adam オプティマイザ(すべての手法向けに再チューニング)を用いても Dust は有効であり、低数のトークンでは理論的な限界が逆伝播を下回るものの、規模が大きくなるにつれて競合可能な性能を発揮します。大規模モデルは、より大きな探索空間とより良好な条件の損失地形幾何学により、集団サイズの増加からより多くの恩恵を受けます。Dust の推定値と逆伝播勾配の間の余弦類似度は、低 RMSE(< 0.06)で複数のレイヤ種に適合するべき乗律に従います。これらの進展は、高度な事前学習技術をよりアクセスしやすくし、専門的な訓練手順を必要としないまま大規模 AI 開発の民主化を促進します。

2026/10/06 6:40

SFの2点間で最も平坦なルートを特定してください

## 日本語翻訳: 本アプリケーションは、サンフランシスコ向けの強力なオフラインナビゲーションソリューションを提供し、160,000 のストリートセグメント、USGS 1 メートル LiDAR 標高データ、および Overture/OpenStreetMap グラフを含むローカルマッピングデータを利用します。その核心的な革新点は、全距離と登坂量のトレードオフを可視化し選択できるようにするインタラクティブなスライダーです。これにより、最短経路から最も平坦な経路に至るまでの範囲でユーザーがオプションを選定できます。ルート受容には特定の有効性閾値が決まっています:累積昇降量(総上昇分として測定され、ネット差分ではありません)が、歩行距離の約 200 フィートにつき登坂量が 1 フィートの比率内に留まる場合にのみルートは有効とされます。システムは、歩行者ルートでは階段を含む一方、サイクリストルートではそれらを除外することで、移動モード間の違いを区別します。さらに、ツールはオフラインでの場所検索機能を備え、主要経路の傍らに代替経路を示す薄い線を表示します。スライダーを右側に動かすと、ユーザーには平坦な地形を優先する、または距離は短縮せずに登坂量を加えない意外な短縮のない選択肢が保証されます。このアプローチにより、サンフランシスコ独自の都市地形の中で、個人の特定の移動要件と身体的限界に完璧に適合する経路を選択できるようになります。

Beam:反射の 501B オープンウェイトモデル | そっか~ニュース