兆パラメータモデルへの計算効率型事前学習とスケーリング

2026/09/09 1:59

兆パラメータモデルへの計算効率型事前学習とスケーリング

RSS: https://news.ycombinator.com/rss

要約

日本語訳:

核心的な画期は、先端的な事前学習がこれまでよりもはるかに効率的に行えるようになったことであり、計算資源を大幅に削減しつつも大規模な AI パフォーマンスを実現できる点です。この新たなアプローチは、単にハードウェアを追加するのではなくトレーニングプロセス自体を最適化することで、主要なオープンモデルと比較して 10 倍以上の高い計算効率を達成しています。特に重要なのは、生成されたモデルが DeepSeek V4 Pro Base の能力と同等でありながら、約 50 倍少ない浮動小数点演算(FLOPs)で動作し、GPT-3 の事前学習に必要な計算量のおよそ半分または GB200 ハードウェアでの約 50 万ドルに相当するという点です。

公平な比較を確保するために、研究者らは私的代码リポジトリを活用し、トレーニングデータと類似度が高い(96 文字以上のウィンドウまたは Jaccard 基準)OSS コードやドキュメントを含む厳格なデータセットクリーニングを実施しました。評価手法としては、トークナイザーの違いを正常化するために保持アウトデータ上でバイト当たりビット(bpb)損失を測定し、複雑な数学、科学論文、コンピューターサイエンス論文、エンジニアリング論文など 167 の領域にわたる評価を行いました。以前の大規模な監督付き微調整に依存した手法とは異なり、この戦略は事前の SFT または蒸留なしでの探索、クレジット割り当て、潜在知識の引き出しに焦点を当てた長期的視野を持つ強化学習とアラインメントトレーニングを重視しています。

今後の展開として、チームは RL トレーニング中のデプロイメントゲートおよび安全性要件に関する改訂された安全ポリシーを発表する計画です。今後も数ヶ月ごとにモデルバージョンをスケーリングアップし、「ヒーローラン」サイクルを続けながら、NanoGPT を用いたスピードランニングにより迅速なフィードバックを得る活動を継続します。究極的には、この効率性の向上は、研究者らが業界標準のコストのFraction で多様なアーキテクチャを実験することを可能にし、大規模なインフラストラクチャなしで高度な推論能力へのアクセスを実現することになります。

本文

計算効率化と兆パラメータ規模モデルへスケーリング:DeepSeek V4 Pro の研究成果

1. 背景と目標

  • 現状の課題: Frontier レベルの事前学習は、大規模なハードウェア資源(例:10 万個のチップ)を有しない限り不可能とされていた。
  • 解決策: アルゴリズム効率性の向上のみによるアプローチ。
  • 達成成果: 現在の事前学習レシピにより、主要なオープンウェイトベースモデルとの計算コストを約 1/10 に削減
    • DeepSeek V4 Pro Base モデルは、同等の性能を約50 倍少ない FLOPs(浮動小数点演算量)で達成。
    • GPT-3 の事前学習に必要な計算資源の半分相当。
    • GB200 クラスハードウェアでのコストは約50 万ドル

2. スケーリング法則と性能比較

モデルの能力(Perplexity など)を維持・向上させるために必要な計算リソースに対するスケーリング法則が確立されました。

事前学習のスケーリング倍率(総合評価)

モデルBits per Byte (bpb) ※低いほど良いV4 Flash に対するスケーリング倍率
DeepSeek V4 Flash0.206 bpb1 倍
DeepSeek V4 Pro0.202 bpb29 倍
Kimi K20.205 bpb48 倍
Nemotron 3 Ultra0.203 bpb31 倍
V5 e240.194 bpb- (内部開発)

注釈:

Bits per Byte (bpb)
はトレーニング効率の指標です。値が小さいほど計算資源の使用効率が良く、コストパフォーマンスが高いことを意味します。

評価データ別の詳細比較

  • 保持アウトデータ(一般化能力): DeepSeek V4 Pro は Kimi K2 の 0.415 bpb に対して0.404 bpb(約 24 倍のスケーリング効率)を達成。
  • 数学問題推論: Kimi K2 が 0.695 bpb、DeepSeek V4 Pro は0.678 bpb(約 72 倍のスケーリング効率)で高い性能を示した。

ドメイン別評価結果

分野ごとの「有効計算リソース倍率」において、当社レシピ(V4 Pro)が他社モデルに対して顕著な優位性を示しています。

ドメイン主要競合との比較傾向V4 Flash に対するスケーリング効率
SWE / AI 研究開発当社レシピに有利(0.1〜100 倍の差)62 倍 (対比: Kimi K2)
コンピュータサイエンス論文当社レシピに有利62 倍
数学論文当社レシピに有利12 倍
工学系論文当社レシピに有利26 倍
物理学論文当社レシピに有利16 倍

3. 一般化能力と評価手法

評価データの整備

  • 独自構築: トレーニング用パーサーの特徴を学習しないよう、事前学習パイプラインとは別のパーサー/OCR を使用したデータセットを作成。
  • フィルタリング:
    • トレーニングデータに含まれるオープンソース(OSS)コードを除外。
    • テキストウィンドウ(96 文字)が一致するか、Jaccard 類似度が閾値を超える文書を排除。
    • アライメント研究の主要論文など、過学習を防ぐため第三者 LLM で言い換え・要約処理を施した。

評価指標と対象分野

  • 一般化能力: コードベース(私有含む)、低被引用論文、新規作成の数学問題などを使用。
  • 知識領域: 研究テキスト、自然科学、社会科学、法学など多岐にわたり評価。
  • 評価アプローチ: 「Bits per Byte」を保持アウトデータで測定し、プロンプト感応性を排除した滑らかな能力測定を実施。

4. 研究方法論と計算コストの算出

コスト算出方式 ($6 \cdot N \cdot D$)

厳密な FLOPs の代わりに、以下の近似式を用いて計算リソースを報告しています。 $$ \text{Cost} = 6 \cdot N \cdot D $$

  • $N$: アクティブ化されたパラメータ数
  • $D$: 事前学習トークン数
  • $6$: コスト係数($(add+mul) * (fwd+bwd*2)$ の簡略化)
    • : シーケンス次元(アテンション機構など)のコストは、この式の一部しか含まず、実際の使用されるシーケンス長に依存します。

各モデルの $6 \cdot N \cdot D$ 値と計算コスト目安

モデルパラメータ数 ($N$)トークン数 ($D$)計算リソース指標 ($6 \cdot N \cdot D$)
DeepSeek V4 Pro48,852,265,05433 T (10^12)9.67e24
DeepSeek V4 Flash13,270,025,81032 T2.55e24
Kimi K231,687,072,76815.5 T2.95e24
Nemotron 3 Ultra54,985,076,73620 T6.60e24

コストの具体例: DeepSeek V4 Pro を訓練するには、GPT-3 の半分程度の計算資源(約50 万ドル相当)で済み、10 倍スケールアップしてもコストは約400 万ドルに抑えられます。これに対し、同様の性能を目指す場合は計算コストが 1 億ドルを超えると推計されます(利用可能なデータ量の限界を無視した試算)。

評価データの信頼性について

  • 汚染除去の限界: 自社モデルはデータデコンタミネーション(汚染除去)が可能ですが、オープンウェイトモデルについては不可能です。これは、他社が公開していないトレーニングデータを自然に含む可能性があるためです。
  • アウタライア(外れ値)への対応: ソース文書からの単純な暗記(例:医療分野の数値)を検知し、その影響をプロットに含まれていますが、あくまで極端なケースとして扱っています。
  • 数学問題の評価: AIME よりも困難な私有競技数学問題(400 問)における通過率を測定。e24 モデルではトレーニング予算の約**0.2%**で pass@1 が 90% を超えました。

5. 開発プロセスと未来展望

安定した基盤構築の重要性

  • 過去の教訓: 初期のスケーリング試みは多岐にわたる形で失敗しました。「安定した基盤」の構築が最優先です。
    • 滑らかな収束、FP32 と同等の低精度トレーニング品質、迅速かつ安定したインフラ。
    • 正しいハイパーパラメータのスケーリングルール。
    • 「バグを追跡し続けること」(これが最も重要)。

進歩の要因

  • モデルアーキテクチャ、옵ティマイザ、トレーニング目的関数、データキュレーションなど、数十のポイントにおける変化が相乗効果を発揮。
  • NanoGPT などでのスピードランニングによる新アイデアの迅速な検証。
  • パワーロウ法則: 2 つ桁(2 乗)の計算規模にわたるモデル訓練を行い、有益な変化のみを採用。

今後のロードマップ

  • RL スケーリング: 長期的な視野を持つ強化学習(RL)のスケーリングと、デプロイ後の継続的学習エージェントの構築。
  • アライメント手法: 理論的に堅牢な性質を持つアライメントトレーニング手法の開発。
  • 製品化: ついに製品としてのリリースに向けて準備を進めています。

私たちが挑む課題

  • 長期的視野を持つ RL における探索とクレジット割り当て(システム作動へのスケールアップ)。
  • 限定的に引き出された潜在的知識に対するアライメントトレーニング。
  • 事前学習に関するさらなる改善。

メッセージ: 兆パラメータ規模モデルを世界最小規模のチームで訓練しました。鋭い判断力を持つ単一の個人の影響力はかつてないほど高まっています。アライメントされたスーパーインテリジェンス構築にご協力いただければ幸いです。

同じ日のほかのニュース

一覧に戻る →

2026/09/11 0:29

Cognition が新たな SWE-2 モデルを発表。Fable 5.1 や GPT-Astra と競合する性能を誇ります。

## Japanese Translation: Cognition は、Fable 5.1 や GPT-5.6 Sol といったトップクラス競合に匹敵する最新コーディングモデルである SWE-2 を発表しました。SWE-2 は、大規模な Kimi K3 ベースモデル(パラメータ数 2.8 兆)での後学習により実現され、コストペナルティ付き報酬とファーストプリンシプルに基づくアプローチ、そして長さに基づく報酬ベースラインを採用してトレーニングを安定化させながら、多兆パラメータ領域への強化学習のスケーリングを達成しました。FrontierCode 1.1 Main では 50.0% のスコア(Fable 5.1 より僅か 1 ポイント下)を記録しながらコストは 64% 削減され、DeepSWE 1.1 では 73.0% を達成しました。単なるスコアを超え、SWE-2 は「エンジニアリング的判断」の優位性も示し、不要な迂回を避けることで初期コードエディットの中央値ステップ数を 48 から 18 に削減しました。また、モデルは安全性と信頼性を最優先しており、プロパガンダおよび検閲テストのうち 98% をパスしています。Devin Desktop と CLI 経由で即時利用可能(Web および Fusion では段階的展開中)の SWE-2 は、高パフォーマンス AI をアクセス可能な価格点で提供し、信頼性や安定性を損なうことなくソフトウェア開発サイクルの効率化を目的としています。 ## Text to translate: Cognition has introduced SWE-2, its most advanced coding model, which rivals top competitors like Fable 5.1 and GPT-5.6 Sol while offering significant efficiency gains. Achieved through post-training on the massive 2.8 trillion-parameter Kimi K3 base model, SWE-2 scales Reinforcement Learning to a multi-trillion parameter regime using cost-penalized rewards derived from first principles and a length-weighted reward baseline to stabilize training. On FrontierCode 1.1 Main, it scores 50.0% (just one point behind Fable 5.1) while being 64% cheaper; on DeepSWE 1.1, it achieves 73.0%. Beyond raw scores, SWE-2 demonstrates superior "engineering judgment," reducing the median steps to an initial code edit from 48 down to 18 by avoiding unnecessary detours. The model also prioritizes safety and reliability, passing 98% of propaganda and censorship tests. Available immediately via Devin Desktop and CLI (with rolling deployments on Web and Fusion), SWE-2 is designed to streamline software development cycles by delivering high-performance AI at an accessible price point without compromising trustworthiness or stability.

2026/09/11 6:30

米運輸安全委員会、マイアミでのボーイング767滑走路逸脱事故調査結果更新発表

## Japanese Translation: 9月6日のマイアミ国際空港におけるランウェイ逸脱事故に巻き込まれたボーイング7598貨物機からフライトレコーダーが回収され、正常に読み出されたことが、2026年9月9日に国立輸送安全委員会(NTSB)によって確認されました。アクロン航空社(Acron Aviation)のCVRからの高品質な音声および54時間以上にも及ぶフライトデータレコーダーのデータ——400以上のパラメータを記録——が確保されました。予備的分析によると、飛行機は conflicting なパイロットによる離陸再行(ゴーアラウンド)指令を受けながら、危険に甚だしい速度(ノーズギア158ノット)で接地しており、スピードブレーキやスラストリバーサの展開はされていなかったとのことです。現時点での記録は同期されていませんが、ワシントンDCのNTSBチームによって書面による要約が作成され、フラップ調整、オートパイロットの離脱、地形警告など特定の行動を含む事件の経過を明確にします。詳細なコックピット会話とデータパラメータのタイムラインは、専用調査ウェブページで確認できます。あるいは24時間365日の対応オペレーションセンター(1-844-373-9922)にお問い合わせいただくことも可能です。すべての所見は、公式要約が確定するまで予備的なものとされています。

2026/09/11 0:29

火星用に開発されたNASAの色彩トリックが、今や地球で岩壁画を解読する役割を果たすことになった

## Japanese Translation: 考古学者のジョン・ハーマンは、NASA の decorrelation stretch 手法を応用して古代岩絵の研究を行ないました。この手法は当初、JPL で 1978 年にジム・ソーハによってリモートセンシング画像の強化のために開発され、後にロナルド・アレイによって速度と精度の向上を目的として 1996 年に改良されました。ハーマンはこの研究成果に基づき、数学および医療イメージングの背景を応用し、Karhunen–Loève 変換定理に基づく Dstretch プラグインを開発しました。このソフトウェアは単なるコントラストの引き上げではなく、色彩を拡張された範囲へマッピングします。Dstretch を用いることで、研究者たちは複数の遺跡において以前は目に見えなかった図像を発見しました:カリフォルニア州バイアのカベ・デ・サン・ボルヒタスで新たな黄色の図像が確認され、カンボジアのアングルワット周辺で 200 点以上の色あせた絵画が発見されています。エジプトのベニハッサンではコウモリや豚の画像が、カナダ・アルバーツアのライティングオンストーン州立公園ではクロ族の戦士による初期のグラフィティと解釈される馬と騎士を描いたピクトグラフが、ノルウェーのアールサンド 1 遺跡では新たに約 15 点の図像に加え、28 点で新たな詳細が浮き彫りになりました。このプラグインのカスタムカラー空間は岩絵のイメージングに特に有用であることが実証されています。火星イメージングの強化に元々使用された既確立のリモートセンシング手法を適用することで、Dstretch は低コントラストの写真に対して侵襲のないデジタルアクセスを提供し、世界中の隠れた芸術作品の解明に貢献しています。