メーター代わりにもなりすぎているような安すぎるトークン

2026/09/23 18:21

メーター代わりにもなりすぎているような安すぎるトークン

RSS: https://news.ycombinator.com/rss

要約▶

日本語翻訳:

機械学習のコストは、ハードウェアおよびソフトウェアのブレークスルーによる組み合わせが slowing の兆候を見せず、年率で桁違いに低下しています。ハードウェアの効率性は、現在 GPU パフォーマンスを約 2 年に 1 回倍増しており、これはムーアの法則と同等のパースです。具体的な利点としては、NVIDIA の MLPerf スタック(バージョン 2.0–2.1)で最大 50% の改善、Intel で 6.0–6.1 バージョン間で 2.4 倍のスループット増があるなどです。ソフトウェアスタックもパフォーマンスをさらに加速しており、vLLM は 2024 年 9 月と 2025 年 12 月の間に約 40% の効率向上をもたらしています。Mixture-of-Experts などのアーキテクチャ革新により、Nemotron-H-47B などの大規模モデルは、わずか 32 GB の VRAM で 100 万件以上のトークンを保持できるようになり、「Mamba」ハイブリッドアーキテクチャは必要な RAM を最大 5 倍削減します。これらの進歩により、大規模言語モデルは巨大なデータセンターを必要とするスタンドアロン製品から、1〜2 年で標準的な計算インフラストラクチャの統合されたコンポーネントへと移行し、3〜6 年の間にフロンティア品質の知性を消費デバイス上でローカルに実行できるようになります。したがって、AI の利用における主な制限要因はトークンの総量ではなく、質とアクセシビリティになります。企業は高価な GPU クラスターを賃貸する方式から、TypeSafe AI の「Jev」や「Laya」のような専用モデルを展開する方向へと転換しており、10 億トークンあたり $0.042 という低いコストで高い知性を提供し、単純な問い合わせへの回答など milliseconds 単位の速いローカルタスクを実現しています。この進化は、業界の焦点が生処理能力からモデルの利用可能性と機能性の最適化へと移行する根本的な転換を示しています。

本文

機械学習による知能利用コストの劇的低下と未来の計算システム

1. 概況:AI 統合と制約要因の移行

  • 利用コストの低下

    • 機械学習による知能の利用コストは、年間に**数桁のオーダー(桁)**低下し続ける傾向にあります。
    • この低下トレンドが緩む兆候は見られません。
  • LLM の役割の変化(今後 1〜2 年)

    • LLM は単なる製品から、計算システム全体のインフラストラクチャとしてあらゆる分野に統合される可能性が高まっています。
  • ローカル動作の普及(今後 3〜6 年)

    • コモディティ化されたハードウェア上で、現在の最先端品質を備えた LLM がローカル環境で動作できるようになります。
  • 制約要因の移行

    • AI の利用におけるボトルネックは、「トークンの総数」から**「品質やアクセシビリティ」**へ移行すると思われます。

2. 特異な主張への証拠:AI の進化と改良点

「特異な主張には特異な証拠が必要」という言葉通り、以下のような具体的な技術的改良点が確認されています。AI はプロプライエタリ(所有権あり)モデルとオープン・ウェイト(重み開放)モデルの 2 種類に分類されます。

2.1 すべての AI に影響を与える改良点

GPU の効率化

  • 指数関数的な性能向上
    • GPU は世代が進むにつれて、対数スケールで底数 1.3(約 2 年ごとに効率が倍)のペースで電力効率を向上させています。
    • これは 1960 年代のムーアの法則以来に見たこともないほどの効率化です。

モデルのコスト低下

  • コストと品質のトレードオフ

    • 「タスク単価」観点でのコストは劇的に低下しています。
    • 小型モデルはトークン単価は安いものの、同じタスクをこなすために大型モデルより多くのトークンを消費することがあります(思考量や修正回数が多いため)。
  • 2026 年時点のパレト frontier(効率の最善点)

    • 縦軸:モデルの品質(ベンチマーク)
    • 横軸:コスト
    • 2025 年初・年中・年末の変化を見ると、「タスク単価」においてモデルはより賢く安価に機能することが確認できます。
    • 2026 年のグラフと比較すると、縦軸(知能)は同等ですが、横軸(コスト)で**2 つの桁分(100 倍)**もの低減が見られます。

インフェレンス・エンジン (Inference Engines)

学習済みのモデルと入力テキストを受け取り、GPU で動作させるソフトウェアパッケージです。年間効率向上率は**10%〜50%**程度です。特に「サービング(ユーザーからの予測不可能な入力の即時応答)」では劇的な改善が見られます。

  • vLLM

    • オープンソースエンジンで、バージョンアップごとに性能が急激に向上しています。
    • vLLM 0.5.4(2023 年 9 月)から 0.6.2(2024 年 12 月)の 15 ヶ月間で約40% の効率向上を達成しました。
  • NVIDIA と Intel の進化

    • NVIDIA: MLPerf スタックのアップグレードで最大50% の効率改善を達成しています。
    • Intel: MLPerf 6.0 から 6.1 へのアップデートだけで、ソフトウェア変化により約2.4 倍のスループット向上を達成しました。

2.2 ホスティング型 AI に影響を与える改良点

専門家混合 (Mixture-of-Experts, MoE)

  • アーキテクチャの効率化

    • 初期の「高密度モデル」ではなく、不要な専門家は非活化させることで計算量を削減する方式です。
    • モデルを7 倍小さくしても(パラメータ数 6B ➝ 0.8B)、ベンチマークでの性能は同等に保たれています。
  • 効率の質的変化

    • ジュールあたりのトークン効率は横ばいですが、ジュールあたりの「品質」効率は急速に向上しています。
    • 注記: ローカルマシンでは専門家層をメモリ上保持する必要があるため、MoE はあまり役に立たない傾向にあります。

2.3 ローカル AI に影響を与える改良点

Mamba アーキテクチャ

  • RAM の削減

    • 圧倒的に大量の RAM が求められる問題を解決します。必要な RAM 量を約 5 倍削減しています。
    • 「トランスフォーマー」は入力の全情報を記憶しますが、「Mamba」は損失を許容したサマリー(要約)のみを記憶します。
  • 具体的な性能比較 (quantized 3bit/4bit 重み使用時)

    • Nemotron-H-47B: 32 GB の VRAM で 100 万個以上のトークンを保持可能。
    • Llama-3.1 60B: 同じトークン数を処理するには約120 GB必要(quantization なしではさらに悪化)。

2.4 特殊用途に影響を与える改良点

Jev と Laya

AI を「はい/いいえ」や確率値の出力に限定することで、コストを**2 つの桁分(100 倍)**削減できます。

  • 既存 LLM vs System One + Jev のコスト比較

    • 既存 LLM: 入力トークン $0.20〜$10/百万、出力は入力の約 5 倍のコスト。
    • System One + Jev: 入力トークン $0.042/百万(10 億トークンで$42)、出力トークン無料。
  • Jev の実用例:jgrep

    • jgrep
      というツールが開発されており、LLM を直接呼び出す開発ツールとして利用可能です。
    • コストは電気代のコストよりも低く、以下のコマンドを実行できます:
    $ jgrep -o "announces or releases a new AI model" titles.txt | sort -rn | head -3
    0.980 PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet
    0.970 Alibaba Releases Qwen2.5-Omni-Flash
    0.940 Google announces new experimental "CC" AI agent for families
    
    • 性能: 約1 千分の 1 セントで約 200msで確率値を返し、パイプラインに組み込むのに十分な速度です。
    • Jev triage: プルリクエストの優先度を決定するための TUI(ターミナルユーザーインターフェース)を提供します。
  • Laya の特徴

    • オープン・ウェイトでローカル実行可能な小型モデル。
    • ファインチューニングにより Jev よりも速く正確に動作しますが、設定作業や機械学習知識が必要という欠点があります(最大コンテキスト 512K)。
  • 見通し

    • アーキテクチャ的な改良余地が多く、近いうちに ML のスケーリング限界には達しないと思われます。

3. 統合された結果とコストの再定義

過去 1 年間のトータスクスト低下要因

  • モデル: タスク当たりで約100 倍のコスト効率向上。
  • ハードウェア: トークン当たりで約1.3 倍のエネルギー効率向上。
  • エンジン: トークン当たりで約1.4 倍のエネルギー効率向上。

総合的な進歩

単なる「生トークンコスト」だけでなく、他のベンチマークも考慮すると以下のような進化が見られます:

  • 新しいアーキテクチャにより、同じ量の RAM に5 倍またはそれ以上のトークンを収めることが可能になり、より高度なモデルをローカルで動作させるようになります。
  • Jev や Laya のような特殊用途モデルが、さらに1〜2 つの桁分のコスト削減をもたらします。

これらは未熟な段階であり、今後さらに良くなる可能性が高いです。


4. 次に起こることは?:計算コストの変換効果

工具呼び出し vs モデル呼び出し

モデルのコストがツール(システムコマンドなど)のコストを下回ると、モデルをツールに埋め込むことが魅力的になります。

ツール消費電力 (W)時間 (秒)費用 (セント)Luna ターンに対する桁数の差
grep100.10.0000744.5
HTML パース1010.00.000733.5
cargo build303000.006251.5
  • これらのコスト差は今後数年間で「全く考えられないこと」になりません。 -将来的には、機械学習を用いた適応型ビルドスケジューラーなど、汎用的なモデルで埋め込んだ計算インフラストラクチャが普及する可能性があります。

ジェヴォンズののパラドックス:サプライサイドと需要サイド

  • サプライサイド

    • 効率化により企業はより多くの計算リソースを構築します(投資額 1 ドルあたりの収益増)。
    • OpenAI や Anthropic のような大手プロバイダーが依然として上回っていますが、オープン・ウェイトモデルとの価格競争も熾烈になります。
  • 需要サイドのシナリオ

    • コストが下がると人々は計算リソースを何に使うのでしょうか?

    • サイバーセキュリティの悪化: 企業がクラウドサービスへの依存度を高めざるを得ず、ハッキングリスクが増加する可能性。

    • 生の計算リソースへの優位性の向上: Oxide や AWS, Cloudflare などのハイパースケール企業が恩恵を受け、推論に最適化された GPU レンタルが拡大します。

    • ソフトウェア開発の焦点の変化: アルゴリズムではなく、製品要件、テスト、ユーザーインターフェースデザイン、QA の重要性が増します。労働市場においてこれらの職種が再興する可能性があります。

    • ソフトウェアのレンタル希少化: ソフトウェアコードベース自体が防御手段(moat)としての役割を失い、運用やセキュリティが実質的な価値の源泉となります。

オプションリティの変化:第 4 の選択肢

かつてソフトウェア選択は「使用・不使用・他社製品」の 3 つでしたが、LLM により**「作成させよ」という第 4 の選択肢**が生まれました。

  • これにより、利用者ごとに最適化された柔軟なソフトウェアを容易に創造できるようになります。
  • 企業間競争は単なる機能の有無ではなく、「質」で争われるようになり、規制された業界での既存企業の優位性が保たれます。

5. まとめ

未来を計画するにあたり、単に安価な計算だけでなく、安価な知能が存在する世界を意識する必要があります。次に何が起きるか不明ですが、技術的展望は以下のようにまとまります:

  1. インフラの普及: LLM はあらゆる分野の計算システム全体のインフラになる。
  2. ローカライズ: コモディティ化されたハードウェア上で最先端モデルがローカル動作可能になる。
  3. コスト構造の変容: トークン単価よりも品質やアクセシビリティ、そしてツール呼び出しとの相対コストが重要になる。
  4. 産業の再編: サイバーセキュリティや UI/UX、ソフトウェア運用の重要性が高まり、新たな労働市場が創出される。

付記・用語解説

  1. 用語について: この記事では意図的に「LLM」ではなく「AI」という表現を使用しています。Jev などの新しい機械学習分類器は LLM と同等の能力を持つものの、厳密には異なるカテゴリです。
  2. ベンチマークの除外: 特定の禁止事項(例:台湾の首都を答えるなど)や、中国・米国モデルによって制限される特定のタスクの結果は含まない場合があります。
  3. 量子化 (Quantization): モデル内部の詳細度を指す大まかな表現です。デフォルトの 16 ビット浮動小数点数から、品質を中程度に失うだけで 8 ビットや 4 ビットへ量子化でき、モデルは大幅に小型かつ高速になります。
  4. 価格の持続性: TypeSafe は「価格の下落継続性を証明するが、価格上昇の可能性については言及していない」としています(補助金依存など)。
  5. サーバーソフトウェアの効率: ハードウェアは効率的ですが、サーバーソフトウェアはスループット最適化のため調整されており、ツール実行には約 1 つの桁分多い電力がかかる可能性があります。
  6. 医療記録サービスの例: 電子医療記録サービスが使いにくい要因の一つは、法的な保持義務や切り替えコストによる寡占状態です。
  7. 例外事項: Apple Shortcuts や Salesforce、Excel スプレッドシートなどの非常に限られたニッチな用途を除きます。

同じ日のほかのニュース

一覧に戻る →

2026/09/24 3:06

クローデが CRISPR 様反復構造を持つ新たな酵素系を発見した

## Japanese Translation: Anthropic は、基礎生物学に特化した新たな Life Sciences 研究グループを立ち上げ、Claude エージェントを使用して DNA データセットを探査し、人間の科学者とともに物理実験室で仮説を検証する取り組みを開始しました。2026 年春、チームはベイエリアに自社工場を建設し、BSL-1/BSL-2 の安全制限下で低リスクの実験のみを行い、すべての実験作業は人間が行う体制を整えました。約 21 時間にわたって約 2 億 1,000 万トークンを処理する約 950 台の自律型 Claude エージェントが、大規模な遺伝子データベースを走査して興味深い逆転写酵素の例を探しました。1 つのエージェントは、RT ゼーン近傍にあるタンデムリピートアレイを発見し、CRISPR 技術に類似していることに着目することで、「配列関連型逆転写酵素(ART)」システムを特定しました。ART システムは 3 つの部分で構成されており、巨大なファージ由来の逆転写酵素、隣接するパートナー遺伝子、ならびに短い RNA として発現する非コード DNA のリピート配列が均等間隔で並ぶ長アレイからなります。CRISPR 先駆者である Feng Zhang 氏による見解を得たうえ、Anthropic の異種タンパク質に関する専門知識を背景に、プロジェクトは一般公開用のプレプリント技術報告書を発行し、物理実験における本質的な人間の監督下で実行されるスケーラブルな AI 主導の仮説検証において新たな先例を確立しました。

2026/09/24 6:01

VSCode の SSH アгентは素晴らしいです

## Japanese Translation: セキュリティ研究者のトーマス・プタチェクは、Visual Studio Code の SSH 遠隔編集機能はシステム整合性に対して深刻な脅威をもたらすと警告しており、Emacs Tramp といった代替手段の安全限界をはるかに超えていると指摘している。Tramp がリモート接続上でローカルに動作する一方、VSCode は Bash スニペット的なステーガーを実行し、エージェントをダウンロードして Node.js バイナリをインストールすることで、「フルスケールの侵入」を行う点で異なる。このダウンロードされたエージェントは、ローカルの VSCode フロントエンドとの間で永続的な WebSocket 接続を維持し、ファイルシステムを探索したり、任意のファイルを編集したり、独自のシェル PTY プロセスを開始したり、リモートシステム上にて自身を持続化したりする能力を有している。プタチェクは、LLM の「幻覚」はエージェントを通じて LLM と実行環境の間でループを閉じることで軽減できると認めつつも、そのようなプロセスは開発用ラップトップにおいては境界上の問題により実施すべきではないと指摘する。理想的には、LLM エージェントを用いた反復開発は、ホストシステム構成を変更できず瞬時に起動されるクリーンスレート Linux インスタンス上で行われるべきである。プタチェクは、この機能を開発サーバーで使用する際に懸念を覚えるだろうし、本番システムでのインシデント中に発生すれば怒り狂うだろうと警告している。また、Fly Machine のカスタム接続はこの懸念を回避可能だが、彼のブログの主な目的はこのセキュリティ洞察を読者に共有することにあることを明記している。

2026/09/24 6:31

クレードの荷重支持継ぎ目

## Japanese Translation: 核心的な論点とは、荷重支持接合部(load-bearing seams)が偶発的な詳細ではなく、重要な構造的要素であるというものであり、状況の理解方法を本質的に変えるものである。表面的な問題と深層的な構造的な問題の間に違いが存在し、元の結論は提示された質問に答えつつも、その証拠が実際に接合部について問いかけていたことを扱わなかった。状況を単一のバイナリ(二値)に還元することはニュアンスを失わせ、代わりに複数の真理を生産的な緊張関係の中で保持すべきである。重要な過ちの一つは、単に記述する証拠と実際の構造的作業を行う証拠の区別を行わなかった点にある。不確実性はノイズを排除すべきものではなく、複数の解釈を可能にするモデルの限界を示しており、分析は複雑性を増しつつ、外観・支持された主張・整合性にとって必要な真理の間の関係を明確化している。今後には、初期の仮見直しを行い、証拠を荷重支持接合部に直接的に対置して再評価することが必要であり、新しい結論に急ぐこと 대신 収束(convergence)を目指すべきである。最も高いレバレッジを持つ行動は、記述的な外観から構造的現実がどの点で乖離しているかを特定し、特に接合部を中心に例外、パターン、カテゴリーエラーを把握することにある。この転換により証明責任の枠組みが再定義され、元の結論が接合部を回避するのではなくそれを考慮するようになり、結果的に組織が表面の詳細と本質的な構造的制約との関係をどのように変革するかを示す。

メーター代わりにもなりすぎているような安すぎるトークン | そっか~ニュース