
2026/09/09 5:14
マーキュリー 2.5
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Cohere は Mercury 2.5 を発表しました。これは、これまでの最も能力が高く、大規模な拡散ベースの言語モデルであり、巨大な 260K のコンテキストウィンドウと、広く利用可能な NVIDIA GPU における大幅な速度向上(最大 1,107 トークン/秒)を特徴としています。このモデルは Mercury 2 に比べて知能面で 40% の飛躍を示し、GPT-5.6 Luna、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 のようなコスト最適化された最先端モデルと有利な競争力を持っています。主な機能には、調整可能な推論、並列ツール呼び出し、スキーマに準拠した JSON 生成があり、これにより単一のインタラクション内で計画、再書き換え、再ランク付け、事実構造化、要約、回答チェックといった複雑でレイテンシ感度の高い検索ワークロードを処理することができます。パフォーマンスベンチマークにおいて、パートナーである OpenCall は音声応答の遅延が 1 秒未満(P99 でほぼ 170 ms)、P50 で 0.2 秒未満まで削減されたことを報告しており、コーディングパートナーの Augment Code ではコンテキスト圧縮とモデルルーティングにより遅延が 82%(150 秒から 27 秒へ)削減され、コストは 90% 削減されました。新しいプレビューには、Mercury Voice(ファーストトークンまでの時間を 170 ms 未満)および Mercury Router が含まれており、これは品質、速度、コストに基づいてプロンプトをオープンモデルとクローズドモデル間で動的にルーティングする dLLM です。料金は標準プランで入力/出力トークンあたり 100 万につき $0.20/$0.75、ローンチ特別価格では 80% オフ($0.04/$0.15)です。モデルは Inception API、Baseten、OpenRouter を経由して利用可能で、エンタープライズチャンネルでは専用容量、自動スケーリング、コンプライアンス、データ保持を提供しています。Cohere は導入割引として 80% の値引きを行っており、Y Combinator 所属の企業は $500K の導入特典と 1 億トークンの無料利用が対象です。今後、Cohere はさらに能力の飛躍を実現しつつ拡散ベースの速度とトークン効率を維持した上で、より大規模なモデルのトレーニングを計画しています。
本文
Mercury 2.5 リリース:高性能・低遅延を実現する次世代生運用モデル
本日、Mercury 2.5 をリリースいたします。これまでの最も高性能な生運用モデルであり、Mercury 2 に比べて質的な飛躍の向上を遂げたものです。同時に、低レイテンシーかつ低コストという従来からのサービス特性を維持しております。
Mercury 2 が一般公開されて以来、何千人もの開発者がこれを活用し、数十の企業が本運用環境へ導入するに至っています。利用規模は桁違いに成長しており、検索・音声・コーディング製品などレイテンシー感度の高いワークロードを支えています。これらの実稼働における成果こそが、ベンチマーク結果のみでは得られなかったより明確なシグナルを提供してくれました。
顧客のフィードバックや本運用環境で発生した障害事例を分析し、評価指標(evals)を精査し、学習に注力いたしました。Mercury 2.5 は、その強化サイクルからの最初の成果です。
何が変わったのか
Mercury 2.5 は現在市場に出回っている拡散型言語モデルの中で最も高性能で、これがこれまでに行われた最大の拡散系言語モデルであると考えられています。
- 品質: Mercury 2 に比べて知能レベルが40% 向上。コスト最適化を重視した最先端モデル(GPT-5.6 Luna、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 など)と同等の性能を示します。
- 速度: 広く入手可能な NVIDIA GPU を使用した場合、1 秒当たり1,107 トークンの処理能力を発揮します。
- コンテキスト: 260K トークンに対応可能。
- 価格:
- 定価:入力あたり $0.20 / 百万件、出力あたり $0.75 / 百万件
- リリース特別価格(80% オフ):入力 $0.04 / 百万件、出力 $0.15 / 百万件
- 機能: 調整可能な推論能力、並列ツール呼出、スキーマに準拠した JSON 生成など。
Mercury 2 の公開以来、我々は NVIDIA AI インフラストラクチャ上で Inception 社が拡散ベースの言語モデルをさらに進歩させる様子を見守ってまいりました。知能レベルの飛躍と、持続的な高速性能・低コストの併存は、新たなアーキテクチャがいかに迅速に NVIDIA プラットフォーム上で実運用可能なシステムへと成熟するかを示しています。
Shruti Koparkar(NVIDIA アクセラレーションドコンピューティンググループ プロダクトシニアマネージャー)
実運用における Mercury
🔍 検索エージェントと RAG パイプライン
単一の検索リクエストが複数のモデル呼び出しをトリガーします(検索計画、クエリ再構成、結果の再ランク付け、事象の構造化など)。Mercury はこれらの呼び出しを十分に高速に処理し、ユーザーとの 1 つの相互作用内を維持することができます。すでに主要な検索インフラ企業で実運用が開始されています。
📞 音声エージェントとインタラクティブアプリケーション
音声分野においてレイテンシーは単なるインフラの詳細ではなく、通話者が感じる「静寂」そのものです。OpenCall は AI 搭載の電話エージェントを構築し、リアルタイムのカスタマー対応電話を処理します。Mercury を導入した結果、実運用ワークロードにおけるモデル応答の中央値が約170 ミリ秒に近づきました。
- P99 レイテンシー: 数分からわずか1 秒へ
- P50 レイテンシー: 0.4 秒未満から0.2 秒未満へ短縮
- 他社と比較しても非常に高速であり、推論機能を含むモデルとしても同様です。
Oliver Silverstein(OpenCall コーファウンダー兼 CEO)
💻 コーディングサブエージェントとアシスタント
コーディングエージェントは既に複数のモデル間でタスクを分割しています。あるモデルがコードの計画を行いながら、他のモデルが検索やツール実行、状態サマライゼーションなどを担当します。これらサポート系の呼び出しは反復して発生するため、レイテンシーとコストは急速に累積します。
Augment Code は Mercury をコンテキスト圧縮、モデルルーティング、MCP ツール検索に活用しています。
- レイテンシー削減: 約150 秒から 27 秒へ82% 削減
- コスト削減: 品質維持下で90% 削減
- ツール検索サマリー: 1 秒未満で返却
同様の高速性は Web アプリケーションの開発にも適用可能です。以下のデモにて、数回のプロンプトから Mercury 2.5 が動作可能な音楽発見用ログ Web アプリを生成する様子をご覧ください。
Mercury Voice と Mercury Router のプレビュー
Mercury 2.5 とともに、Mercury VoiceおよびMercury Routerのプレビュー版も発表します。
- Mercury Voice:
- トークンUntilFirst(TTFT)が170 ミリ秒未満を実現し、音声エージェント向けの dLLM です。
- 特に厳しいレイテンシー制約を備えたアプリケーションで最適化されています。
- Mercury Router:
- 入ってくるプロンプトを dLLM で理解し、品質・速度・コストのバランスが最も優れたモデル(オープンソースおよびクローズドモデル)へルーティングします。
ご利用方法
Mercury モデルは、当社のInception API、Baseten、OpenRouterを通じてご利用いただけます。エンタープライズ向けデプロイメントでは、専用キャパシティ、自動スケーリング、コンプライアンス制御、設定可能なデータ保持期間をサポートしております。
今すぐお試しください
- チャット: Mercury 2.5 を無料でお試し
- API: 1 億トークン無料でお試し
- ドキュメント: API ドキュメントをご覧ください
プラットフォーム別特典
- Baseten のお客様: 既存のセットアップを通じて Mercury 2.5 をデプロイいただけます。
- Y Combinator 企業様: $500,000 分のデプロイメント特典をご利用いただけます。
次に何があるか
次期モデルの学習を開始してございます。これはこれまで最大のモデルであり、今後数ヶ月以内にリリースを予定しております。
次期モデルは、拡散法の高速性とトークン効率を維持しつつも、能力面で大きな飛躍を実現するものです。これには、モデル学習、推論、評価(evals)、インフラストラクチャにおける進展が必要です。
このような課題に取り組んでみたいとお考えであれば、ぜひお声を聞きたいと考えております。さらに近いうちに情報をお伝えいたします。