HN ランチ:Tokenless(YC S26)-コスト削減のための自動モデル切替

2026/07/30 0:55

HN ランチ:Tokenless(YC S26)-コスト削減のための自動モデル切替

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Tokenless は、パフォーマンスを損なわずに AI の運用コストを大幅削減しようとしている企業に対し、画期的な解決策を提供します。これはリクエストを最も最適なモデルに知的にルーティングするシームレスな API 代替品として機能し、品質を維持しながら最大で 52% の費用削減を実現します。この効率性は、「tokenless fanout」というユニークなメカニズムによって達成されており、タスクを分散させながら低性能なモデルの試行を即時にキャンセルすることでリソースを節約します。Google DeepMind、プリンストン大学、UC Berkeley の研究者が開発し、Y Combinator が後援するこのシステムは、既存のワークフローへの無難な統合を実現するため、OpenAI および Anthropic 互換のエンドポイントを公開しています。ベンチマークからの証拠はその莫大な可能性を示しており、例えば、Tokenless Pro コンフィギュレーションは GPT-5.6 Sol などのトップティアモデルを使用するケースと比較して、月額約 14,000 ドルを削減します。さらに、「Ultra Saver」セットアップ(Gemini 3.6 Flash を活用)は、単一の年内に 34 万ドル以上の費用削減を達成すると試算されています。この機能は現在、従業員一人当たりの AI 支出が著しく増加見込みである市場トレンドを考慮すれば特に重要であり、組織がインフラコストを大幅に低下させ、業界全体での支出が増加する中でも効果的に AI の利用規模を拡大することを可能にします。

本文

トークンレス:API コストを半額に、品質は維持する最適化ソリューション

OpenAI および Anthropic と互換性のあるエンドポイントを提供します。すぐにモデルを接続し、今日から活用してください!

仕組みとコスト効率

既存の API 呼び出しをそのまま利用可能であり、常に最適なモデルへ自動ルーティングされます。 多くのリクエストには最先端モデルが不要なため、「トークンレス」では以下のプロセスでコスト削減を実現します

  • グループ分散: リクエストを一時的に複数のモデルに分散させ、それぞれの思考プロセスを観察します。
  • 動的切り替え: いずれかのモデルが明確に軌道に乗ると、そのモデルを選択し続けます。
  • 不要な処理の終了: 他のモデルは即座にキャンセルされ、必要分のみを課金されます。

コスト比較例(リファクタリング済み)

CLI オプションを列挙型(Enum)へ、時間ベースから「信頼度(モデル別)」への計測へ変更。

項目従来のコストトークンレスの追加コスト
このリクエスト$0.00$0.00
Fable 5 に送信$0.00$0.00
合計削減効果--52% ($0.11 が請求されず)

パフォーマンスとベンチマーク

「マーケティング」ではなく**「実証」**データに基づきます。公開されているエージェント型ベンチマークにおいて、各最先端モデルの最優秀な実績と比較し、以下の指標を測定します。

  • 解像度(Solve Rate): タスク解決率
  • コスト効率: 1 タスクあたりの費用

モデル別 コストパフォーマンス比較表

モデル平均$/タスクコスト効率
Gemini 3.6 Flash$0.00-
Claude Opus 5$0.11基準
Tokenless Ultra Saver$0.02⭐ 最安値
Tokenless ProGPT-5.6 Sol$0.04高効率
Claude Fable 5$0.03高効率

具体的な節約実績

あなたが今、どのくらい節約できているかをご覧ください。

あなたの月間 LLM 支出シミュレーション

  • 現状の支払い額:
    $26K
    / 月
  • 節約効果:
    $14K
    / 月(約 54% の削減)
  • 今日の請求額予測:
    $40K
    / 月への転換

今後 12 ヶ月の予測トレンド

Ramp AI インデックスは**月間 +11.0%**の成長を示しています。このトレンドに基づいた試算です。

  • 現状の軌跡: 来年には $344K を節約予定
  • 支出シミュレーション(今日 vs 今後 12 ヶ月):
    • 今日:
      $20K
      $40K
      $60K
      $80K
      $100K
      $120K

注記: 推計値は、公表されているトークン単価(キャッシュ込み)およびソース内の編集可能なルーティング仮定に基づいています。実際のレートはあなたのトラフィック量によって異なります。

データ出典:Ramp AI インデックス — 従業員あたりの AI 支出額(2025 年 6 月~2026 年 6 月)。該当する支出コホートに一致させ、直近 12 ヶ月の成長率で外挿したものです。

信頼性とデモ体験

開発は Google DeepMindプリンストン大学カリフォルニア大学バークレー校の AI リサーチャーにより行われ、Y Combinator の支援を受けています。

  • 基本理念: 「請求額を削減し、品質は維持します」
  • デモでの確認方法:
    1. ご自身の実際のトラフィックに基づいて数値シミュレーションを行います。
    2. または、2 つの行を入れ替えて実際に動作を確認することも可能です。

同じ日のほかのニュース

一覧に戻る →

2026/07/30 5:39

Vision Pro の最もクールな活用法

## Japanese Translation: 著者は、無料ツールと AI を活用し、標準的な建築設計ソフトを凌駕するために Apple Vision Pro 上で 2D の住宅施工図面を VR で視覚化するための DIY ワークフローの詳細を提供している。このプロセスでは、Fusion 360 を用いて PDF 図面を高精度な 3D モデルに変換し( Appearance パネルを通じて木材、石材、ガラスなどのテクスチャを追加)、家具は GLB または USDZ ファイルを OBJ フォーマットへ変換して読み込む(Tampermonkey スクリプトを用いるか、代替的な iOS AirDrop ワークフローを使用する)ことで行う。さらに、AI を活用した「vibe coding」により、1 つの朝に独自のカスタムビューアアプリ「Prospector」を開発し、コントローラーサポート、フライトモード、6 倍速度モード、森の天空ボックスのような没入型環境などの機能を付与している。生成されたコードは不完全であること(「janky」と表現)も認められているが、完全に機能する。このアプローチは、建築家から通常提供される Revit ウォークスルー unfavorably に比較できるような、個別の建設者に向けた浸透的な視点を可能にしている。

2026/07/30 0:05

Show HN: 任意の M シリーズ Mac で、Gemma 4 26B を 2 GB のメモリで動かすオープンソースエンジン

## Japanese Translation: TurboFieldfare は、macOS 26 (arm64)、Metal 4 および Swift 6.2 を想定した独立系 Apache 2.0 ライセンス下のプロジェクトであり、Apple Silicon搭載の Mac で指令チューニング済みの Gemma 4 26B-A4B モデル(~14.3 GB の共有コア)を動作することを可能にします。本プロジェクトは、SSD からオンデマンドでルーターの判断に基づいて追加の「エキスパート」ブロックをストリーミングする仕組みを採用し、共有重みと 1.35 GB の FP16 KV キャッシュをメモリ上に保持することで、利用可能な RAM が~2 GBしかないデバイスでも実行できるようにしています。MLX または llama.cpp を使用せず、独自のスウィフト+メタルランタイムによりこれを実現します。ベンチマークでは、8 GB M2 MacBook Air でデコード速度が 5.1~6.3 トークン/秒、24 GB M5 Pro では 31~35 トークン/秒を記録しました。インストールには、ピン付けされた~15 GB のモデルをダウンロードし、完全なソースチェックポイントを物質化することなく、~14.3 GB の.gturboディレクトリに再パッケージする必要があります。スイートには、テキストのみ推論で自動チャットフォーマットを持つ TurboFieldfareMac、TurboFieldfareCLI、機能ツール付きの OpenAI 互換ループバックサーバー(ただしクライアント側での認証が必要)、TurboFieldfareRepack およびサポートライブラリ・サービスが含まれます。生成デフォルトは温度 0.2、Top-K 64、Top-P 0.95 であり、確定的出力(温度 0)およびその他のサンプリングパラメータのオプションも用意されています。今後の作業としては、iPhone/iPad ネイティブアプリの開発と base 16 GB M4 Mac miniなど他のモデルでのさらなるベンチマークが対象です。本プロジェクトは Google によるアフィリエイトまたは推奨ではなく、モデル重みは Hugging Face から別途入手します。

2026/07/30 0:41

スーパーロジカル

## Japanese Translation: 本プロジェクトは、インタラクティブ、自動、および運用ワークフローを単一の堅牢なセッション層に統合し、「すべての作業用のマルチプレキサー」を実質的に創出することを目的としています。このシステムは、完全にソフトウェア主導である一方で、デフォルトのコンテキストの提供、構造化されたデータへのアクセス、履歴の保存、そして完全な人間の制御を最優先します。ターミナルは開発者、エージェント、ツール、およびインフラストラクチャを本質的に効果的に接続するため、理想的な基盤となります。複数のターミナルブロックを長寿セッションとして組織化することで、デバイス間でのシームレスな再接続と、スクロールや選択機能に対するネイティブなサポートを提供します。 チームは HashiCorp や Vercel といった主要企業の広範な経験を持ち、Mitchell Hashimoto(Ghostty の創始者)、Jack Pearkes、Alasdair Monk、Hector Simpson を含む主要な人物によって率いられています。本製品は最初にはるかに素晴らしいマルチプレキサーを構築することに焦点を当て、その後で構造化可能なアーキテクチャと運用安全性を優先します。ベータ版利用の告知が後日に予定されており、将来的にオープンソースリリースも行われる見込みです。ユーザーは、Web とネイティブ macOS/iOS プラットフォーム間でライブセッションを共有できる統合されたワークスペースを利用できるようになります。このアプローチは、追加のソフトウェア層が必要なく、自動化と直接的な人間のインタラクションの双方をサポートする単一のシステムを提供することで、開発者がツールを管理する方法を変革します。**プロジェクトは現在資金調達が完了しています。**

HN ランチ:Tokenless(YC S26)-コスト削減のための自動モデル切替 | そっか~ニュース