マーキュリー 2.5

2026/09/09 5:14

マーキュリー 2.5

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Cohere は Mercury 2.5 を発表しました。これは、これまでの最も能力が高く、大規模な拡散ベースの言語モデルであり、巨大な 260K のコンテキストウィンドウと、広く利用可能な NVIDIA GPU における大幅な速度向上(最大 1,107 トークン/秒)を特徴としています。このモデルは Mercury 2 に比べて知能面で 40% の飛躍を示し、GPT-5.6 Luna、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 のようなコスト最適化された最先端モデルと有利な競争力を持っています。主な機能には、調整可能な推論、並列ツール呼び出し、スキーマに準拠した JSON 生成があり、これにより単一のインタラクション内で計画、再書き換え、再ランク付け、事実構造化、要約、回答チェックといった複雑でレイテンシ感度の高い検索ワークロードを処理することができます。パフォーマンスベンチマークにおいて、パートナーである OpenCall は音声応答の遅延が 1 秒未満(P99 でほぼ 170 ms)、P50 で 0.2 秒未満まで削減されたことを報告しており、コーディングパートナーの Augment Code ではコンテキスト圧縮とモデルルーティングにより遅延が 82%(150 秒から 27 秒へ)削減され、コストは 90% 削減されました。新しいプレビューには、Mercury Voice(ファーストトークンまでの時間を 170 ms 未満)および Mercury Router が含まれており、これは品質、速度、コストに基づいてプロンプトをオープンモデルとクローズドモデル間で動的にルーティングする dLLM です。料金は標準プランで入力/出力トークンあたり 100 万につき $0.20/$0.75、ローンチ特別価格では 80% オフ($0.04/$0.15)です。モデルは Inception API、Baseten、OpenRouter を経由して利用可能で、エンタープライズチャンネルでは専用容量、自動スケーリング、コンプライアンス、データ保持を提供しています。Cohere は導入割引として 80% の値引きを行っており、Y Combinator 所属の企業は $500K の導入特典と 1 億トークンの無料利用が対象です。今後、Cohere はさらに能力の飛躍を実現しつつ拡散ベースの速度とトークン効率を維持した上で、より大規模なモデルのトレーニングを計画しています。

本文

Mercury 2.5 リリース:高性能・低遅延を実現する次世代生運用モデル

本日、Mercury 2.5 をリリースいたします。これまでの最も高性能な生運用モデルであり、Mercury 2 に比べて質的な飛躍の向上を遂げたものです。同時に、低レイテンシーかつ低コストという従来からのサービス特性を維持しております。

Mercury 2 が一般公開されて以来、何千人もの開発者がこれを活用し、数十の企業が本運用環境へ導入するに至っています。利用規模は桁違いに成長しており、検索・音声・コーディング製品などレイテンシー感度の高いワークロードを支えています。これらの実稼働における成果こそが、ベンチマーク結果のみでは得られなかったより明確なシグナルを提供してくれました。

顧客のフィードバックや本運用環境で発生した障害事例を分析し、評価指標(evals)を精査し、学習に注力いたしました。Mercury 2.5 は、その強化サイクルからの最初の成果です。


何が変わったのか

Mercury 2.5 は現在市場に出回っている拡散型言語モデルの中で最も高性能で、これがこれまでに行われた最大の拡散系言語モデルであると考えられています。

  • 品質: Mercury 2 に比べて知能レベルが40% 向上。コスト最適化を重視した最先端モデル(GPT-5.6 Luna、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 など)と同等の性能を示します。
  • 速度: 広く入手可能な NVIDIA GPU を使用した場合、1 秒当たり1,107 トークンの処理能力を発揮します。
  • コンテキスト: 260K トークンに対応可能。
  • 価格:
    • 定価:入力あたり $0.20 / 百万件、出力あたり $0.75 / 百万件
    • リリース特別価格(80% オフ):入力 $0.04 / 百万件、出力 $0.15 / 百万件
  • 機能: 調整可能な推論能力、並列ツール呼出、スキーマに準拠した JSON 生成など。

Mercury 2 の公開以来、我々は NVIDIA AI インフラストラクチャ上で Inception 社が拡散ベースの言語モデルをさらに進歩させる様子を見守ってまいりました。知能レベルの飛躍と、持続的な高速性能・低コストの併存は、新たなアーキテクチャがいかに迅速に NVIDIA プラットフォーム上で実運用可能なシステムへと成熟するかを示しています。

Shruti Koparkar(NVIDIA アクセラレーションドコンピューティンググループ プロダクトシニアマネージャー)


実運用における Mercury

🔍 検索エージェントと RAG パイプライン

単一の検索リクエストが複数のモデル呼び出しをトリガーします(検索計画、クエリ再構成、結果の再ランク付け、事象の構造化など)。Mercury はこれらの呼び出しを十分に高速に処理し、ユーザーとの 1 つの相互作用内を維持することができます。すでに主要な検索インフラ企業で実運用が開始されています。

📞 音声エージェントとインタラクティブアプリケーション

音声分野においてレイテンシーは単なるインフラの詳細ではなく、通話者が感じる「静寂」そのものです。OpenCall は AI 搭載の電話エージェントを構築し、リアルタイムのカスタマー対応電話を処理します。Mercury を導入した結果、実運用ワークロードにおけるモデル応答の中央値が約170 ミリ秒に近づきました。

  • P99 レイテンシー: 数分からわずか1 秒
  • P50 レイテンシー: 0.4 秒未満から0.2 秒未満へ短縮
  • 他社と比較しても非常に高速であり、推論機能を含むモデルとしても同様です。

Oliver Silverstein(OpenCall コーファウンダー兼 CEO)

💻 コーディングサブエージェントとアシスタント

コーディングエージェントは既に複数のモデル間でタスクを分割しています。あるモデルがコードの計画を行いながら、他のモデルが検索やツール実行、状態サマライゼーションなどを担当します。これらサポート系の呼び出しは反復して発生するため、レイテンシーとコストは急速に累積します。

Augment Code は Mercury をコンテキスト圧縮、モデルルーティング、MCP ツール検索に活用しています。

  • レイテンシー削減: 約150 秒から 27 秒82% 削減
  • コスト削減: 品質維持下で90% 削減
  • ツール検索サマリー: 1 秒未満で返却

同様の高速性は Web アプリケーションの開発にも適用可能です。以下のデモにて、数回のプロンプトから Mercury 2.5 が動作可能な音楽発見用ログ Web アプリを生成する様子をご覧ください。


Mercury Voice と Mercury Router のプレビュー

Mercury 2.5 とともに、Mercury VoiceおよびMercury Routerのプレビュー版も発表します。

  • Mercury Voice:
    • トークンUntilFirst(TTFT)が170 ミリ秒未満を実現し、音声エージェント向けの dLLM です。
    • 特に厳しいレイテンシー制約を備えたアプリケーションで最適化されています。
  • Mercury Router:
    • 入ってくるプロンプトを dLLM で理解し、品質・速度・コストのバランスが最も優れたモデル(オープンソースおよびクローズドモデル)へルーティングします。

ご利用方法

Mercury モデルは、当社のInception APIBasetenOpenRouterを通じてご利用いただけます。エンタープライズ向けデプロイメントでは、専用キャパシティ、自動スケーリング、コンプライアンス制御、設定可能なデータ保持期間をサポートしております。

今すぐお試しください

  • チャット: Mercury 2.5 を無料でお試し
  • API: 1 億トークン無料でお試し
  • ドキュメント: API ドキュメントをご覧ください

プラットフォーム別特典

  • Baseten のお客様: 既存のセットアップを通じて Mercury 2.5 をデプロイいただけます。
  • Y Combinator 企業様: $500,000 分のデプロイメント特典をご利用いただけます。

次に何があるか

次期モデルの学習を開始してございます。これはこれまで最大のモデルであり、今後数ヶ月以内にリリースを予定しております。

次期モデルは、拡散法の高速性とトークン効率を維持しつつも、能力面で大きな飛躍を実現するものです。これには、モデル学習、推論、評価(evals)、インフラストラクチャにおける進展が必要です。

このような課題に取り組んでみたいとお考えであれば、ぜひお声を聞きたいと考えております。さらに近いうちに情報をお伝えいたします。

同じ日のほかのニュース

一覧に戻る →

2026/09/08 23:55

Google DeepMind、AlphaGenome アトラスをリリース

## Japanese Translation: ## サマリー: Google DeepMind は、ヒトゲノムにおけるあらゆる可能な単一ヌクレオチド変異の影響を予測することを目的とした画期的なツール「AlphaGenome Atlas」を導入しました。この 1 ペタバイト規模の巨大データセットは、全ての 90 億個の可能性のある変化について事前に影響を計算しており、「AVI スコア」というスコアを用いてどの遺伝的変異が最も重要かを瞬時に優先順位付けします。この革新は、稀少疾患の原因特定という重要な課題に対処しており、例えば広域研究所(Broad Institute)で同定された *DNM1* 遺伝子の特定の突然変異によって誤ったスプライスサイトが作成される問題に対処しています。さらに、54,000 人以上の UK Biobank 参加者のデータに適用した際、アトラスは非コード領域と身体質量指数(BMI)との新しい関連性を発見しました。予測された分子効果に基づいて変異をグループ化することで、従来の手法よりも 22% も多くの関連性を明らかにし、BMI に関連する 19 の遺伝的領域を同定しました。複雑で高度なプログラミングスキルを必要とする以前の手法とは対照的に、このツールは直感的なウェブサイトポータルを通じてアクセス可能となり、世界の臨床研究者へのアクセスを民主化しています。結局のところ、アトラスは科学者が膨大な技術的専門知識を必要とせずに最も有望な遺伝的なリードにリソースを集中させることを可能にし、発見のスピードを加速させています。

2026/09/09 5:07

MacBook Pro で 4 つの SSD からストリーミングし、トークン速度が 1 トークン/秒の Kimi K3(2.8T)

## 日本語翻訳: 元のサマリーは読みやすいですが、Key Points List に含まれる数量的な深みに欠け、欠落している指標なしでは具体的なパフォーマンスに関する主張を評価することが困難です。以下の改良版は、重要なデータポイントを取り入れつつ文脈の流れを維持したものです: ## サマリー このプロジェクトは、ARGODRIVE の Deltafin フォークを使用して、アップストリーム仕様に従い(専門家プリューニングやウェイトの減少など、品質を犠牲にするショートカットを導入しない)、Apple M5 Max MacBook Pro(128 GB RAM)上で 2.8T パラメータの Kimi K3 MoE モデルをフルスケールで展開することを実証しています。**パフォーマンス分析**によると、デコードスループットはプロンプト長に応じて約 0.96〜1.13 tokens/s(アップストリームの約 0.68 tokens/s)と安定しています。しかし、このセットアップには 512 トークンのプロンプトに対する「最初のトークンまでの時間」(Time to First Token)の遅延が約 375 秒と大きく、これはプリフィル中に特定のメモリ専門家を読み直す効率が悪い(具体的には各レイヤーの専門家を 8 倍読み返す)ことが原因です。SSD スケールは対数曲線に従い、最も低速なレイヤーがペースを規定します。ドライブを追加しても収益性が低下し、1 ドライブがベースラインである 4 ドライブの約 52%、2 つのミラーリングが約 73%、3 ドライブが約 90% を提供します。このプロジェクトは、精度を犠牲にして(例えば専門家のウェイトを約 3 bit に減少させるなど)人工的に速度を上げる他のイニシアチブと区別されます。ユーザーは `--full` モード(1.7 TB のローカルダウンロード)または `--stream`(オンデマンドキャッシング)のいずれかを選択できます。デフォルトでは Inferact の Kimi-K3-DSpark が含まれており、生テキストタスク用にはオプションの Qwen アクセラレーラーが用意されています(チャット速度ではありません)。コードは MIT ライセンスで公開され、Moonshot AI と何らの関係もありません。アップグレードには `cargo build` を通じた手動メンテナンスが必要であり、アップストリームのライセンス条項に従っています。将来の計画は、プリフィルの読み直し問題を解決して起動遅延を排除することに焦点が当てられています。

2026/09/09 6:47

大規模言語モデルが適応的探索によって新たな社会的バイアスを発明する

## Japanese Translation: OpenReview にアクセスする前に、新規ユーザーは作業を続行するには強制のセキュリティ検証手順を完了する必要があります。既存のアカウント保有者は直接ログインすることでこの要件を回避でき、これにより自動的にメインインターフェースに遅延なくリダイレクトされます。その結果、新規ユーザーはチェックを完了させるまでワークフローを一時的に停止する必要があり、登録済みアカウント向けの免除を利用しない限りです。組織が新しい人材オンボーディングを行う場合、これらの個人が認証を完了する間、一時的な摩擦が発生する可能性があります。したがって、このプラットフォームは新規参入者に対して厳格な入場を強制し、一方で検証済みのユーザーにはシームレスなアクセスを維持します。

マーキュリー 2.5 | そっか~ニュース