
2026/07/30 0:55
HN ランチ:Tokenless(YC S26)-コスト削減のための自動モデル切替
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Tokenless は、パフォーマンスを損なわずに AI の運用コストを大幅削減しようとしている企業に対し、画期的な解決策を提供します。これはリクエストを最も最適なモデルに知的にルーティングするシームレスな API 代替品として機能し、品質を維持しながら最大で 52% の費用削減を実現します。この効率性は、「tokenless fanout」というユニークなメカニズムによって達成されており、タスクを分散させながら低性能なモデルの試行を即時にキャンセルすることでリソースを節約します。Google DeepMind、プリンストン大学、UC Berkeley の研究者が開発し、Y Combinator が後援するこのシステムは、既存のワークフローへの無難な統合を実現するため、OpenAI および Anthropic 互換のエンドポイントを公開しています。ベンチマークからの証拠はその莫大な可能性を示しており、例えば、Tokenless Pro コンフィギュレーションは GPT-5.6 Sol などのトップティアモデルを使用するケースと比較して、月額約 14,000 ドルを削減します。さらに、「Ultra Saver」セットアップ(Gemini 3.6 Flash を活用)は、単一の年内に 34 万ドル以上の費用削減を達成すると試算されています。この機能は現在、従業員一人当たりの AI 支出が著しく増加見込みである市場トレンドを考慮すれば特に重要であり、組織がインフラコストを大幅に低下させ、業界全体での支出が増加する中でも効果的に AI の利用規模を拡大することを可能にします。
本文
トークンレス:API コストを半額に、品質は維持する最適化ソリューション
OpenAI および Anthropic と互換性のあるエンドポイントを提供します。すぐにモデルを接続し、今日から活用してください!
仕組みとコスト効率
既存の API 呼び出しをそのまま利用可能であり、常に最適なモデルへ自動ルーティングされます。 多くのリクエストには最先端モデルが不要なため、「トークンレス」では以下のプロセスでコスト削減を実現します。
- グループ分散: リクエストを一時的に複数のモデルに分散させ、それぞれの思考プロセスを観察します。
- 動的切り替え: いずれかのモデルが明確に軌道に乗ると、そのモデルを選択し続けます。
- 不要な処理の終了: 他のモデルは即座にキャンセルされ、必要分のみを課金されます。
コスト比較例(リファクタリング済み)
CLI オプションを列挙型(Enum)へ、時間ベースから「信頼度(モデル別)」への計測へ変更。
| 項目 | 従来のコスト | トークンレスの追加コスト |
|---|---|---|
| このリクエスト | $0.00 | $0.00 |
| Fable 5 に送信 | $0.00 | $0.00 |
| 合計削減効果 | - | -52% ($0.11 が請求されず) |
パフォーマンスとベンチマーク
「マーケティング」ではなく**「実証」**データに基づきます。公開されているエージェント型ベンチマークにおいて、各最先端モデルの最優秀な実績と比較し、以下の指標を測定します。
- 解像度(Solve Rate): タスク解決率
- コスト効率: 1 タスクあたりの費用
モデル別 コストパフォーマンス比較表
| モデル | 平均$/タスク | コスト効率 |
|---|---|---|
| Gemini 3.6 Flash | $0.00 | - |
| Claude Opus 5 | $0.11 | 基準 |
| Tokenless Ultra Saver | $0.02 | ⭐ 最安値 |
| Tokenless ProGPT-5.6 Sol | $0.04 | 高効率 |
| Claude Fable 5 | $0.03 | 高効率 |
具体的な節約実績
あなたが今、どのくらい節約できているかをご覧ください。
あなたの月間 LLM 支出シミュレーション
- 現状の支払い額:
/ 月$26K - 節約効果:
/ 月(約 54% の削減)$14K - 今日の請求額予測:
/ 月への転換$40K
今後 12 ヶ月の予測トレンド
Ramp AI インデックスは**月間 +11.0%**の成長を示しています。このトレンドに基づいた試算です。
- 現状の軌跡: 来年には $344K を節約予定
- 支出シミュレーション(今日 vs 今後 12 ヶ月):
- 今日:
→$20K
→$40K
→$60K
→$80K
→$100K$120K
- 今日:
注記: 推計値は、公表されているトークン単価(キャッシュ込み)およびソース内の編集可能なルーティング仮定に基づいています。実際のレートはあなたのトラフィック量によって異なります。
データ出典:Ramp AI インデックス — 従業員あたりの AI 支出額(2025 年 6 月~2026 年 6 月)。該当する支出コホートに一致させ、直近 12 ヶ月の成長率で外挿したものです。
信頼性とデモ体験
開発は Google DeepMind、プリンストン大学、カリフォルニア大学バークレー校の AI リサーチャーにより行われ、Y Combinator の支援を受けています。
- 基本理念: 「請求額を削減し、品質は維持します」
- デモでの確認方法:
- ご自身の実際のトラフィックに基づいて数値シミュレーションを行います。
- または、2 つの行を入れ替えて実際に動作を確認することも可能です。