
2026/09/23 18:21
メーター代わりにもなりすぎているような安すぎるトークン
RSS: https://news.ycombinator.com/rss
要約▶
日本語翻訳:
機械学習のコストは、ハードウェアおよびソフトウェアのブレークスルーによる組み合わせが slowing の兆候を見せず、年率で桁違いに低下しています。ハードウェアの効率性は、現在 GPU パフォーマンスを約 2 年に 1 回倍増しており、これはムーアの法則と同等のパースです。具体的な利点としては、NVIDIA の MLPerf スタック(バージョン 2.0–2.1)で最大 50% の改善、Intel で 6.0–6.1 バージョン間で 2.4 倍のスループット増があるなどです。ソフトウェアスタックもパフォーマンスをさらに加速しており、vLLM は 2024 年 9 月と 2025 年 12 月の間に約 40% の効率向上をもたらしています。Mixture-of-Experts などのアーキテクチャ革新により、Nemotron-H-47B などの大規模モデルは、わずか 32 GB の VRAM で 100 万件以上のトークンを保持できるようになり、「Mamba」ハイブリッドアーキテクチャは必要な RAM を最大 5 倍削減します。これらの進歩により、大規模言語モデルは巨大なデータセンターを必要とするスタンドアロン製品から、1〜2 年で標準的な計算インフラストラクチャの統合されたコンポーネントへと移行し、3〜6 年の間にフロンティア品質の知性を消費デバイス上でローカルに実行できるようになります。したがって、AI の利用における主な制限要因はトークンの総量ではなく、質とアクセシビリティになります。企業は高価な GPU クラスターを賃貸する方式から、TypeSafe AI の「Jev」や「Laya」のような専用モデルを展開する方向へと転換しており、10 億トークンあたり $0.042 という低いコストで高い知性を提供し、単純な問い合わせへの回答など milliseconds 単位の速いローカルタスクを実現しています。この進化は、業界の焦点が生処理能力からモデルの利用可能性と機能性の最適化へと移行する根本的な転換を示しています。
本文
機械学習による知能利用コストの劇的低下と未来の計算システム
1. 概況:AI 統合と制約要因の移行
-
利用コストの低下
- 機械学習による知能の利用コストは、年間に**数桁のオーダー(桁)**低下し続ける傾向にあります。
- この低下トレンドが緩む兆候は見られません。
-
LLM の役割の変化(今後 1〜2 年)
- LLM は単なる製品から、計算システム全体のインフラストラクチャとしてあらゆる分野に統合される可能性が高まっています。
-
ローカル動作の普及(今後 3〜6 年)
- コモディティ化されたハードウェア上で、現在の最先端品質を備えた LLM がローカル環境で動作できるようになります。
-
制約要因の移行
- AI の利用におけるボトルネックは、「トークンの総数」から**「品質やアクセシビリティ」**へ移行すると思われます。
2. 特異な主張への証拠:AI の進化と改良点
「特異な主張には特異な証拠が必要」という言葉通り、以下のような具体的な技術的改良点が確認されています。AI はプロプライエタリ(所有権あり)モデルとオープン・ウェイト(重み開放)モデルの 2 種類に分類されます。
2.1 すべての AI に影響を与える改良点
GPU の効率化
- 指数関数的な性能向上
- GPU は世代が進むにつれて、対数スケールで底数 1.3(約 2 年ごとに効率が倍)のペースで電力効率を向上させています。
- これは 1960 年代のムーアの法則以来に見たこともないほどの効率化です。
モデルのコスト低下
-
コストと品質のトレードオフ
- 「タスク単価」観点でのコストは劇的に低下しています。
- 小型モデルはトークン単価は安いものの、同じタスクをこなすために大型モデルより多くのトークンを消費することがあります(思考量や修正回数が多いため)。
-
2026 年時点のパレト frontier(効率の最善点)
- 縦軸:モデルの品質(ベンチマーク)
- 横軸:コスト
- 2025 年初・年中・年末の変化を見ると、「タスク単価」においてモデルはより賢く安価に機能することが確認できます。
- 2026 年のグラフと比較すると、縦軸(知能)は同等ですが、横軸(コスト)で**2 つの桁分(100 倍)**もの低減が見られます。
インフェレンス・エンジン (Inference Engines)
学習済みのモデルと入力テキストを受け取り、GPU で動作させるソフトウェアパッケージです。年間効率向上率は**10%〜50%**程度です。特に「サービング(ユーザーからの予測不可能な入力の即時応答)」では劇的な改善が見られます。
-
vLLM
- オープンソースエンジンで、バージョンアップごとに性能が急激に向上しています。
- vLLM 0.5.4(2023 年 9 月)から 0.6.2(2024 年 12 月)の 15 ヶ月間で約40% の効率向上を達成しました。
-
NVIDIA と Intel の進化
- NVIDIA: MLPerf スタックのアップグレードで最大50% の効率改善を達成しています。
- Intel: MLPerf 6.0 から 6.1 へのアップデートだけで、ソフトウェア変化により約2.4 倍のスループット向上を達成しました。
2.2 ホスティング型 AI に影響を与える改良点
専門家混合 (Mixture-of-Experts, MoE)
-
アーキテクチャの効率化
- 初期の「高密度モデル」ではなく、不要な専門家は非活化させることで計算量を削減する方式です。
- モデルを7 倍小さくしても(パラメータ数 6B ➝ 0.8B)、ベンチマークでの性能は同等に保たれています。
-
効率の質的変化
- ジュールあたりのトークン効率は横ばいですが、ジュールあたりの「品質」効率は急速に向上しています。
- 注記: ローカルマシンでは専門家層をメモリ上保持する必要があるため、MoE はあまり役に立たない傾向にあります。
2.3 ローカル AI に影響を与える改良点
Mamba アーキテクチャ
-
RAM の削減
- 圧倒的に大量の RAM が求められる問題を解決します。必要な RAM 量を約 5 倍削減しています。
- 「トランスフォーマー」は入力の全情報を記憶しますが、「Mamba」は損失を許容したサマリー(要約)のみを記憶します。
-
具体的な性能比較 (quantized 3bit/4bit 重み使用時)
- Nemotron-H-47B: 32 GB の VRAM で 100 万個以上のトークンを保持可能。
- Llama-3.1 60B: 同じトークン数を処理するには約120 GB必要(quantization なしではさらに悪化)。
2.4 特殊用途に影響を与える改良点
Jev と Laya
AI を「はい/いいえ」や確率値の出力に限定することで、コストを**2 つの桁分(100 倍)**削減できます。
-
既存 LLM vs System One + Jev のコスト比較
- 既存 LLM: 入力トークン $0.20〜$10/百万、出力は入力の約 5 倍のコスト。
- System One + Jev: 入力トークン $0.042/百万(10 億トークンで$42)、出力トークン無料。
-
Jev の実用例:jgrep
というツールが開発されており、LLM を直接呼び出す開発ツールとして利用可能です。jgrep- コストは電気代のコストよりも低く、以下のコマンドを実行できます:
$ jgrep -o "announces or releases a new AI model" titles.txt | sort -rn | head -3 0.980 PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet 0.970 Alibaba Releases Qwen2.5-Omni-Flash 0.940 Google announces new experimental "CC" AI agent for families- 性能: 約1 千分の 1 セントで約 200msで確率値を返し、パイプラインに組み込むのに十分な速度です。
- Jev triage: プルリクエストの優先度を決定するための TUI(ターミナルユーザーインターフェース)を提供します。
-
Laya の特徴
- オープン・ウェイトでローカル実行可能な小型モデル。
- ファインチューニングにより Jev よりも速く正確に動作しますが、設定作業や機械学習知識が必要という欠点があります(最大コンテキスト 512K)。
-
見通し
- アーキテクチャ的な改良余地が多く、近いうちに ML のスケーリング限界には達しないと思われます。
3. 統合された結果とコストの再定義
過去 1 年間のトータスクスト低下要因
- モデル: タスク当たりで約100 倍のコスト効率向上。
- ハードウェア: トークン当たりで約1.3 倍のエネルギー効率向上。
- エンジン: トークン当たりで約1.4 倍のエネルギー効率向上。
総合的な進歩
単なる「生トークンコスト」だけでなく、他のベンチマークも考慮すると以下のような進化が見られます:
- 新しいアーキテクチャにより、同じ量の RAM に5 倍またはそれ以上のトークンを収めることが可能になり、より高度なモデルをローカルで動作させるようになります。
- Jev や Laya のような特殊用途モデルが、さらに1〜2 つの桁分のコスト削減をもたらします。
これらは未熟な段階であり、今後さらに良くなる可能性が高いです。
4. 次に起こることは?:計算コストの変換効果
工具呼び出し vs モデル呼び出し
モデルのコストがツール(システムコマンドなど)のコストを下回ると、モデルをツールに埋め込むことが魅力的になります。
| ツール | 消費電力 (W) | 時間 (秒) | 費用 (セント) | Luna ターンに対する桁数の差 |
|---|---|---|---|---|
| grep | 10 | 0.1 | 0.000074 | 4.5 |
| HTML パース | 10 | 10.0 | 0.00073 | 3.5 |
| cargo build | 30 | 300 | 0.00625 | 1.5 |
- これらのコスト差は今後数年間で「全く考えられないこと」になりません。 -将来的には、機械学習を用いた適応型ビルドスケジューラーなど、汎用的なモデルで埋め込んだ計算インフラストラクチャが普及する可能性があります。
ジェヴォンズののパラドックス:サプライサイドと需要サイド
-
サプライサイド
- 効率化により企業はより多くの計算リソースを構築します(投資額 1 ドルあたりの収益増)。
- OpenAI や Anthropic のような大手プロバイダーが依然として上回っていますが、オープン・ウェイトモデルとの価格競争も熾烈になります。
-
需要サイドのシナリオ
-
コストが下がると人々は計算リソースを何に使うのでしょうか?
-
サイバーセキュリティの悪化: 企業がクラウドサービスへの依存度を高めざるを得ず、ハッキングリスクが増加する可能性。
-
生の計算リソースへの優位性の向上: Oxide や AWS, Cloudflare などのハイパースケール企業が恩恵を受け、推論に最適化された GPU レンタルが拡大します。
-
ソフトウェア開発の焦点の変化: アルゴリズムではなく、製品要件、テスト、ユーザーインターフェースデザイン、QA の重要性が増します。労働市場においてこれらの職種が再興する可能性があります。
-
ソフトウェアのレンタル希少化: ソフトウェアコードベース自体が防御手段(moat)としての役割を失い、運用やセキュリティが実質的な価値の源泉となります。
-
オプションリティの変化:第 4 の選択肢
かつてソフトウェア選択は「使用・不使用・他社製品」の 3 つでしたが、LLM により**「作成させよ」という第 4 の選択肢**が生まれました。
- これにより、利用者ごとに最適化された柔軟なソフトウェアを容易に創造できるようになります。
- 企業間競争は単なる機能の有無ではなく、「質」で争われるようになり、規制された業界での既存企業の優位性が保たれます。
5. まとめ
未来を計画するにあたり、単に安価な計算だけでなく、安価な知能が存在する世界を意識する必要があります。次に何が起きるか不明ですが、技術的展望は以下のようにまとまります:
- インフラの普及: LLM はあらゆる分野の計算システム全体のインフラになる。
- ローカライズ: コモディティ化されたハードウェア上で最先端モデルがローカル動作可能になる。
- コスト構造の変容: トークン単価よりも品質やアクセシビリティ、そしてツール呼び出しとの相対コストが重要になる。
- 産業の再編: サイバーセキュリティや UI/UX、ソフトウェア運用の重要性が高まり、新たな労働市場が創出される。
付記・用語解説
- 用語について: この記事では意図的に「LLM」ではなく「AI」という表現を使用しています。Jev などの新しい機械学習分類器は LLM と同等の能力を持つものの、厳密には異なるカテゴリです。
- ベンチマークの除外: 特定の禁止事項(例:台湾の首都を答えるなど)や、中国・米国モデルによって制限される特定のタスクの結果は含まない場合があります。
- 量子化 (Quantization): モデル内部の詳細度を指す大まかな表現です。デフォルトの 16 ビット浮動小数点数から、品質を中程度に失うだけで 8 ビットや 4 ビットへ量子化でき、モデルは大幅に小型かつ高速になります。
- 価格の持続性: TypeSafe は「価格の下落継続性を証明するが、価格上昇の可能性については言及していない」としています(補助金依存など)。
- サーバーソフトウェアの効率: ハードウェアは効率的ですが、サーバーソフトウェアはスループット最適化のため調整されており、ツール実行には約 1 つの桁分多い電力がかかる可能性があります。
- 医療記録サービスの例: 電子医療記録サービスが使いにくい要因の一つは、法的な保持義務や切り替えコストによる寡占状態です。
- 例外事項: Apple Shortcuts や Salesforce、Excel スプレッドシートなどの非常に限られたニッチな用途を除きます。