NanoGPT スピードランの最前線

2026/08/23 7:14

NanoGPT スピードランの最前線

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Fable 5 は、効率的に大量のコンテンツを生成する自律型コーディングスピードランの現在のリーダーとして浮上しています。その理由は、8.7 日の元の期間の僅かな分(分数)で、人間ベースラインである 3,010 トークンの 81.7% に相当する記録的な 2,726 トークンを生産した点にあります。一方、他のモデルは多様な強みを示しています。Grok 4.6 は、0.6 日で 3,220 トークンを達成することで原始速度において優位を確立し(ギャップの 90% を埋める)、Fable 5 に比べて時間を大幅に短縮しましたが、わずかに大きな総量を生産しました。その他にも高いパフォーマンスを発揮するモデルとして、Sonnet 5(2.0 日で 3,105 トークン)、GPT-5.6 Sol Pro および GPT-5.6 Sol、Opus 4.8、Kimi K3、そして Opus 5 が挙げられます。これらの知見は、18 つのフロンティアモデルにわたる 153 の独立した実行、ならびに 3,290 トークンのベースラインを使用した「平等な予算」評価に基づく分析により得られおり、自律型コーディングエージェントの最適化を行う開発者にとって、速度、総出力量、効率性の間のトレードオフを明確にしています。

本文

NanoGPT オプティマイザーによる速記録挑戦:18 つの最先端モデルを制覇

NanoGPT オプティマイザーを用いた自律的な試行において、18 の最先端 AI モデルに対して合計 153 回の試行を実施しました。詳細な結果は ブログ記事 を参照してください。

ヒューマン記録との乖離を縮めた割合

各モデルのベストバリデート結果(トーク数)と、ヒューマン記録への埋められた割合、使用されたエージェント、および実行時間を以下に整理します。

ランクモデルベストバリデート結果(トーク数)埋められた割合エージェント・トレース情報実行時間
1Fable 52,72681.7%
claude-code · high@24H
3,010(約 8.7 日)
2Opus 52,92053.6%
claude-code · max@24H
3,045(約 2.9 日)
3Kimi K32,93052.2%
prime-agent · max@24H
3,125(約 3.6 日)
4Kimi K32,97445.8%
kimi-code · max@24H
3,135(約 5.1 日)
5Opus 4.83,01839.4%
claude-code · max@24H
3,180(約 3.0 日)
6GPT-5.6 Sol3,04235.9%
codex · xhigh@24H
3,160(約 6.1 日)
7GPT-5.6 Sol Pro3,05833.6%
codex · xhigh@24H
3,100(約 3.4 日)
8Sonnet 53,10526.8%
claude-code · max@24H
3,120(約 2.0 日)
9GPT-5.6 Luna3,11026.1%
codex · xhigh@24H
3,170(約 1.9 日)
10Grok 4.53,12024.6%
grok-cli · xhigh@24H
3,160(約 2.7 日)
11Qwen3.8 Max3,12024.6%
qwen-code · max@24H
3,225(約 1.9 日)
12GLM 5.23,15020.3%
pi · high@24H
3,200(約 1.8 日)
13DeepSeek V4 Pro3,20512.3%
claude-code · max@24H
3,205(約 1.1 日)
14GPT-5.6 Terra3,21411.0%
codex · xhigh@24H
3,214(約 1.1 日)
15Grok 4.63,22010.1%
grok-cli · xhigh
3,220(約 0.6 日)*
16Muse Spark 1.23,2308.7%
muse-code · xhigh
3,230(約 0.6 日)*
17Muse Spark 1.13,2328.4%
pi · max@24H
3,240(約 3.7 日)
18GPT-5.53,2348.1%
codex · xhigh@24H
3,234(約 1.1 日)
Kimi K2.73,2407.2%
kimi-code · max@24H
3,240(約 1.6 日)
GLM 5.3レコードなし
claude-code · xhigh

注釈: 元のデータにおいて、順位 15 および 16 の項目に「0.6 日」という値が含まれていましたが、これが外れ値か特定の指標か不明確でした。文脈に基づき、これをエージェント実行時間として解釈・記載しております。

同等リソース予算での比較

各モデルについて、最良の結果を得た最終試行に対して同一のリソース予算を割り当て、当該予算内で達成された最良のバリデート記録を以下に示します。

予算期間モデル記録ヒューマンベースライン選定予算より前に終了したグレー・ランの数
6 時間(元データに含まれていない)2,600
24 時間(元データに含まれていない)3,290「Open Traces」により、ツール呼び出し、サブエージェント、スケラップを含む41 の厳選されたフル・エージェント軌跡を探求可能。
9 日(元データに含まれていない)(元データに含まれていない)

注釈: 元の入力データでは、「同等リソース予算での比較」というセクションの記述が混在しておりました(説明部分が 24 時間行に追加されていた)。明瞭さを図るため、ここでは整理して分離しております。

同じ日のほかのニュース

一覧に戻る →

2026/08/23 3:14

なぜあなたのローカル LLM は実際より知的に見えなくなるのか

## Japanese Translation: 本稿は、標準的なベンチマークが大型言語モデル(LLM)の性能を正確に測定できないことへの警告を示しています。推論中のロジット計算における実装固有のリスク、特に nightly バルドを利用するユーザー構成などが原因で重大な出力エラーが生じる可能性があるためです。ロジットの微小なシフトが結果の乖離を引き起こし、単純な精度指標を誤導的なものに変えてしまいます。さらに、数百のパッケージを含む NVIDIA nightly イメージなど、複雑な構成は推論パスに影響を与える隠れたバグをもたらします。KL ダイバージェンスなどの指標に基づき低誤差率を主張する一部の量化手法については、ロジット計算に用いられる CUDA カーネルやテスト手法に関する完全な透明性が欠ける限り、その主張は欺瞞的であり得ます。Qwen3.6-27B モデルに対して FlashAttention 2、Flash Inference、Triton Attention の 3 つの注意力バックエンドを実践的に比較した実験では、初期トークンの一致は見られましたが、量化テストの基準として Triton を用いた際には後に不一致が生じました。KV カッシュを quantize(int4/int8)としつつ重みを BF16 で維持する構成ではツール呼び出しエラーが発生し、int4 では乖離から回復できませんでした。5 つの構成に対する評価の結果、INT8 バージョンが他のどの構成よりも優れており、約 5% のトークンフリップしか起こさずに 88,000 トークンのコンテキストを処理し、コマンドを正しく実行することができました。一方、NVIDIA の NVFP4 および AWQ W4A16 バージョンは高いトークンフリップ率(NVFP4 では約 50%)を示し、特定の命令実行に失敗しました(例:Cisco コマンド)。したがって、正確なコマンド実行を必要とする生産環境負荷においては、曖昧な精度主張やドキュメント化されていないリスクに曝露されやすいデフォルト構成に頼るのではなく、実証された安定性を有する特定のハードウェア構成に依存することが不可欠です。

2026/08/23 4:07

NetBSD と私の人生(2005 年)

## 日本語訳: 要約:2年間にわたり、英国の企業が不安定だった Windows サーバーから NetBSD に移行することに成功し、顕著な安定性を達成し、かつて家族がアルトン・タワーズへの旅行という重要なイベントを妨害したような高価なダウンタイムを排除しました。リーダーシップはインフラ切り替えから2時間以内で移行の検証を行いました。現在のネットワークには、MySQL、Apache(重い PHP サイトを含む)、メール向けの Postfix、Linux ファイルサーバーとの NFS 接続向けの Samba を採用した、29 台の高機能なサーバーが稼働しており、1 日あたりのデータ処理量は 870GB 超です。当初、管理者はオープンソースの経験を持たなかったものの、システムの設定、カーネルのコンパイル、SSH を通じた環境の遠隔管理を短期間で習得し、ストレスに満ちた週末のオンコールシフトを終えました。この移行は、障害を防ぐことで大幅なコスト削減を実現し、スタッフには技術的な中断 없이家族と過ごす uninterrupted な時間を可能にしました。

2026/08/22 23:54

ElevenLabs、TwelveLabs、ThirteenLabs

## 日本語翻訳: 元のサマリーは明確であり、簡潔で、主要な論点を一貫した物語に効果的に統合しています。それは Sevenytonelab.com が、レトロなデザインと旧来の Web 技術(Netscape 4 または IE 5.0+ など)への依存により、AI スタートアップにおいて独特の異例として浮き彫りにされるという主なメッセージを成功裡に伝えています。多くの近代 AI 企業は、数字を"labs"という言葉と組み合わせた命名トレンドに従っていますが、これは ElevenLabs, TwelveLabs, ThirteenLabs(3D シーン), FourteenLabs のようなwell-known エンティティが示す例であり、Sevenytonelab はこの慣習に背いています。著者は、特定の基準に基づいてこの独特のケースを特定しました:オンラインでのアクティブな存在、「labs」が含まれた名称、人工知能との関連性(.ai ドメインまたは主要製品において AI が核心となることによる定義)。現在のサイトとは異なり、Sevenytonelab は 2000 年代初期の Web ポートフォリオや IDM アルバムカバーに見られるデザインスタイルを想起させ、「vectorheart」というグラフィック要素を特徴としています。この視覚的および技術的な区別は、それが現在の命名進化の一部ではなく異常な存在であることを示します。本文は完全には、七十七トンラボの陳腐化したデジタルアイデンティティが近代人工知能同僚と鮮明に対照となるように、既存の比較のみを強調し、未来のトレンドへの言及や業界全体の影響についての議論を行わず、Sevenytonelab のこの点だけを明らかにしています。 ## 原文: The original summary is clear, concise, and effectively integrates all key points into a coherent narrative. It successfully conveys the main message: that Seventyonelab.com is a unique anomaly among AI startups due to its retro design and reliance on legacy web technologies, contrasting sharply with modern naming trends and digital identities. No improvements are necessary; the summary remains as is. ## 日本語翻訳: 元のサマリーは明確であり、簡潔で、主要な論点を一貫した物語に効果的に統合しています。それは Sevenytonelab.com が、レトロなデザインと旧来の Web 技術(Netscape 4 または IE 5.0+ など)への依存により、AI スタートアップにおいて独特の異例として浮き彫りにされるという主なメッセージを成功裡に伝えています。多くの近代 AI 企業は、数字を"labs"という言葉と組み合わせた命名トレンドに従っていますが、これは ElevenLabs, TwelveLabs, ThirteenLabs(3D シーン), FourteenLabs のような well-known エンティティが示す例であり、Sevenytonelab はこの慣習に背いています。著者は、特定の基準に基づいてこの独特のケースを特定しました:オンラインでのアクティブな存在、「labs」が含まれた名称、人工知能との関連性(.ai ドメインまたは主要製品において AI が核心となることによる定義)。現在のサイトとは異なり、Sevenytonelab は 2000 年代初期の Web ポートフォリオや IDM アルバムカバーに見られるデザインスタイルを想起させ、「vectorheart」というグラフィック要素を特徴としています。この視覚的および技術的な区別は、それが現在の命名進化の一部ではなく異常な存在であることを示します。本文は完全には、七十七トンラボの陳腐化したデジタルアイデンティティが近代人工知能同僚と鮮明に対照となるように、既存の比較のみを強調し、未来のトレンドへの言及や業界全体の影響についての議論を行わず、Sevenytonelab のこの点だけを明らかにしています。 ## 原文: The most significant observation is that Seventyonelab.com stands out as a unique outlier among AI startups due to its retro aesthetic and reliance on legacy web technologies like Netscape 4 or IE 5.0+. While many modern AI companies follow a naming trend by combining numbers with the word "labs"—exemplified by well-known entities such as ElevenLabs, TwelveLabs, ThirteenLabs (3D scenery), and FourteenLabs—Seventyonelab defies this convention. The author identified this distinct case based on specific criteria: an active online presence, the inclusion of "labs" in the name, and a connection to artificial intelligence (defined by either an .ai domain or AI central to main products). Unlike contemporary sites, Seventyonelab evokes the design style of early 2000s web portfolios and IDM album covers featuring a "vectorheart" graphic element. This visual and technical distinction marks it as an anomaly rather than part of the current naming evolution. The text focuses entirely on this existing comparison without projecting future trends or discussing broader industry impacts, simply highlighting how Seventyonelab's outdated digital identity contrasts sharply with its modern artificial intelligence peers.