
2026/08/23 7:14
NanoGPT スピードランの最前線
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Fable 5 は、効率的に大量のコンテンツを生成する自律型コーディングスピードランの現在のリーダーとして浮上しています。その理由は、8.7 日の元の期間の僅かな分(分数)で、人間ベースラインである 3,010 トークンの 81.7% に相当する記録的な 2,726 トークンを生産した点にあります。一方、他のモデルは多様な強みを示しています。Grok 4.6 は、0.6 日で 3,220 トークンを達成することで原始速度において優位を確立し(ギャップの 90% を埋める)、Fable 5 に比べて時間を大幅に短縮しましたが、わずかに大きな総量を生産しました。その他にも高いパフォーマンスを発揮するモデルとして、Sonnet 5(2.0 日で 3,105 トークン)、GPT-5.6 Sol Pro および GPT-5.6 Sol、Opus 4.8、Kimi K3、そして Opus 5 が挙げられます。これらの知見は、18 つのフロンティアモデルにわたる 153 の独立した実行、ならびに 3,290 トークンのベースラインを使用した「平等な予算」評価に基づく分析により得られおり、自律型コーディングエージェントの最適化を行う開発者にとって、速度、総出力量、効率性の間のトレードオフを明確にしています。
本文
NanoGPT オプティマイザーによる速記録挑戦:18 つの最先端モデルを制覇
NanoGPT オプティマイザーを用いた自律的な試行において、18 の最先端 AI モデルに対して合計 153 回の試行を実施しました。詳細な結果は ブログ記事 を参照してください。
ヒューマン記録との乖離を縮めた割合
各モデルのベストバリデート結果(トーク数)と、ヒューマン記録への埋められた割合、使用されたエージェント、および実行時間を以下に整理します。
| ランク | モデル | ベストバリデート結果(トーク数) | 埋められた割合 | エージェント・トレース情報 | 実行時間 |
|---|---|---|---|---|---|
| 1 | Fable 5 | 2,726 | 81.7% | | 3,010(約 8.7 日) |
| 2 | Opus 5 | 2,920 | 53.6% | | 3,045(約 2.9 日) |
| 3 | Kimi K3 | 2,930 | 52.2% | | 3,125(約 3.6 日) |
| 4 | Kimi K3 | 2,974 | 45.8% | | 3,135(約 5.1 日) |
| 5 | Opus 4.8 | 3,018 | 39.4% | | 3,180(約 3.0 日) |
| 6 | GPT-5.6 Sol | 3,042 | 35.9% | | 3,160(約 6.1 日) |
| 7 | GPT-5.6 Sol Pro | 3,058 | 33.6% | | 3,100(約 3.4 日) |
| 8 | Sonnet 5 | 3,105 | 26.8% | | 3,120(約 2.0 日) |
| 9 | GPT-5.6 Luna | 3,110 | 26.1% | | 3,170(約 1.9 日) |
| 10 | Grok 4.5 | 3,120 | 24.6% | | 3,160(約 2.7 日) |
| 11 | Qwen3.8 Max | 3,120 | 24.6% | | 3,225(約 1.9 日) |
| 12 | GLM 5.2 | 3,150 | 20.3% | | 3,200(約 1.8 日) |
| 13 | DeepSeek V4 Pro | 3,205 | 12.3% | | 3,205(約 1.1 日) |
| 14 | GPT-5.6 Terra | 3,214 | 11.0% | | 3,214(約 1.1 日) |
| 15 | Grok 4.6 | 3,220 | 10.1% | | 3,220(約 0.6 日)* |
| 16 | Muse Spark 1.2 | 3,230 | 8.7% | | 3,230(約 0.6 日)* |
| 17 | Muse Spark 1.1 | 3,232 | 8.4% | | 3,240(約 3.7 日) |
| 18 | GPT-5.5 | 3,234 | 8.1% | | 3,234(約 1.1 日) |
| — | Kimi K2.7 | 3,240 | 7.2% | | 3,240(約 1.6 日) |
| — | GLM 5.3 | — | レコードなし | | — |
注釈: 元のデータにおいて、順位 15 および 16 の項目に「0.6 日」という値が含まれていましたが、これが外れ値か特定の指標か不明確でした。文脈に基づき、これをエージェント実行時間として解釈・記載しております。
同等リソース予算での比較
各モデルについて、最良の結果を得た最終試行に対して同一のリソース予算を割り当て、当該予算内で達成された最良のバリデート記録を以下に示します。
| 予算期間 | モデル記録 | ヒューマンベースライン | 選定予算より前に終了したグレー・ランの数 |
|---|---|---|---|
| 6 時間 | (元データに含まれていない) | 2,600 | — |
| 24 時間 | (元データに含まれていない) | 3,290 | 「Open Traces」により、ツール呼び出し、サブエージェント、スケラップを含む41 の厳選されたフル・エージェント軌跡を探求可能。 |
| 9 日 | (元データに含まれていない) | (元データに含まれていない) | — |
注釈: 元の入力データでは、「同等リソース予算での比較」というセクションの記述が混在しておりました(説明部分が 24 時間行に追加されていた)。明瞭さを図るため、ここでは整理して分離しております。