
2026/09/15 1:07
Show HN:Nari Qwen3 TTS と Qwen3 ASR の高精度、低遅延・コスト効率
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Nari Labs は、現時点で公開されているモデルの中で TTS(音声合成)および STT(音声認識)の Coval 音声 AI ベンチマークにおいて主導的な位置を占めており、品質、レイテンシ、コストのパレートフロンティアで最良の性能を実現しています。ベンチマークは 30 分ごとに実行され、その結果には公開エンドポイントのみが含まれ、専用推論エンドポイントは含められていません。
2026 年 9 月中旬時点では:
- STT: Nari の Qwen3-ASR Fast モデルが、p50 Time-to-Final-Segment (TTFS) を 44 ms、Word Error Rate (WER) を 3.6% に達成し、全体で TTFS において 1 位(AssemblyAI の Universal 3.5 Pro で 3.5% WER の場合の 2 位に次ぐ)、コストは Fast エンドポイントが$0.12/時間(2 番目に低い価格と並み)、Standard が$0.06/時間で、競合他社である AssemblyAI (Universal 3.5 Pro で約 3.75 倍のコストが高い) や Deepgram Nova 3 (約 2.4 倍高い) よりも優れています。
- TTS: Nari の Qwen3-TTS Fast モデルが、WER を 3.8%(全体で 1 位)、p50 Time-to-First-Audio (TTFA) を 63 ms に達成し、レイテンシでは Fluxions vui(49 ms)の次に 2 位にランクインしています。コストは Fast エンドポイントが$10/100 万文字(最安値と並み)、Standard が$5/100 万文字で、競合他社である ElevenLabs(約 5 倍高い)や Cartesia(約 6.5 倍高い)よりも価格を抑えています。Nari の TTS は公式の Qwen3 TTS Flash Realtime モデルと一致しており、Coval ではそのエンドポイントを WER 8.8%、TTFA 692 ms で示しています。これに対し、Baseten の専用 Qwen3-TTS エンドポイント(WER 6.0%、TTFA 101 ms)よりも性能が優れています。
これらの結果は、業界標準に対する厳格な Coval 評価に基づくものです。Nari Labs は、General Availability への移行の前の Public Beta API 期間中に、ユーザーが STT および TTS モデルを無料で試用できるようにしています。既存のアカウント保有者は、アップグレード時に$20 のクレジットを受領します。ベンチマーク値は、WER をデータセット全体でプールした状態での Coval の 1 日ビューに基づいており、これは 2026 年 9 月 14 日 15:00 UTC 時点のものであります。
本文
Nari Labs:音声 AI ベンチマークで「遅延」と「コスト」のパレートフロンティアを突破
業界における圧倒的な性能とコスト効率
Nari Labs は、Text-to-Speech(TTS)および Speech-to-Text(STT)の両分野において、品質・遅延パレートのフロンティアを独占しています。Coval の最新のベンチマークでは、すべての公開モデルの中で「遅延・コスト」と「品質・コスト」のパレート最適解も同時に達成し、業界トップクラスの実績を示しました。
- 評価基準:
- STT (音声認識): 「完了指示から出力までの遅延 (TTFS)」と「単語誤字率 (WER)」を評価対象とする。
- TTS (音声合成): 「テキスト入力から最初の音響再生までの遅延 (TTFA)」と「単語誤字率 (WER)」を評価対象とする。
- 重要性:
- 音声エージェントにおける応答性を決定づける極めて重要な指標である。
- 低 WER はモデル性能の明確な鍵となる要素である。
2026 年 9 月中旬時点の基準では、Nari Labs は両分野でトップクラスを記録しています(※ランキングは公開エンドポイントのみ対象)。
Speech-to-Text (STT):第 1 位の実績と圧倒的なコスト競争力
自社開発モデル「Qwen3-ASR Fast」が STT ベンチマークにおいて遅延 (TTFS) で第 1 位、WER で第 2 位を記録しました。価格設定においても業界最下層に位置し、コスト効率で他社を大きく引き離しています。
主要ベンチマーク結果
- 遅延 (中央値 p50): 44 ms(業界最低水準)
- 単語誤字率 (WER): 3.6%(高精度)
- 順位: TTFS 第 1 位、WER 第 2 位
コストパフォーマンス比較
Nari Labs はプライシング・ディレクトリ公称価格の中で2 番目に低いタイアワーストップを達成しています。
| モデル | 遅延 (TTFS) / WER | 時価 ($/hour) | Nari Labs 相対価格比 |
|---|---|---|---|
| Nari Qwen3-ASR Fast | 44ms / 3.6% | $0.12 | 基準 (最安級) |
| AssemblyAI Universal 3.5 Pro | - / 3.5% | $0.15 (3.75 倍高価) | |
| Deepgram Nova 3 | - | $0.24 (2.4 倍高価) |
注目: Nari の「Standard」エンドポイントでは、時価 $0.06/hour と業界最安値での提供が可能であり、さらに価格競争力を強化しています。
Text-to-Speech (TTS):小型化と高性能の両立
自社開発モデル「Qwen3-TTS Fast」は TTS ベンチマークで遅延 (TTFA) で第 2 位を記録し、コスト面でも最安価格モデルと並走するタイアワーストップを達成しました。
主要ベンチマーク結果
- 遅延 (中央値 p50): 63 ms(実装の上限に迫る超低遅延)
- ※唯一これを下回るのは Fluxions の vui(49ms) だけであり、規模が桁違いです。
- 単語誤字率 (WER): 3.8%
- モデル規模: 17 億パラメータ (1.7B)
- 高性能を実現しつつも、競合他社の小型モデル(例:vui の 3 億パラメータ)と同等の速度性能を達成。
コストパフォーマンス比較
月額 $10/100 万文字で提供され、Coval プライシング・ディレクトリ上の最安価格帯を維持しています。
| モデル | 遅延 (TTFA) / WER | 月額費用 ($/10 万文字) | Nari Labs 相対価格比 |
|---|---|---|---|
| Nari Qwen3-TTS Fast | 63ms / 3.8% | $10 (最安級相当) | 基準 (最安値) |
| ElevenLabs Eleven v3 Conv. | - | $50 (5 倍高価) | |
| Cartesia Sonic 3.6 | - | $65 (6.5 倍高価) |
注目: 「Standard」エンドポイントでは、月額 $5/100 万文字という業界最安値での提供が可能です。
【重要】公式エンドポイントとカスタムエンドポイントの性能差
同じ「Qwen3-TTS」モデルでも、提供プラットフォームや最適化度合いによって劇的な性能差が生じています。
| エンドポイント | WER | 遅延 (中央値) | 備考 |
|---|---|---|---|
| Baseten 専用エンドポイント | 6.0% | 101 ms | Nari Labs の公式 Flash エンドポイントを上回る性能 |
| Nari Qwen3 TTS Flash Realtime | 8.8% | 692 ms | 公式公開エントロイでの数値(実運用では未最適化の可能性) |
| Nari Qwen3-TTS Fast (本記事推奨) | 3.8% | 63 ms | 最適化済み・実装の限界に迫る高性能 |
お試し開始:今すぐ無料で体験しよう
Speech-to-Text および Text-to-Speech モデルを無料でご体験できます。
- 無料トライアル期間: 今限り
- 次のステップ: 来週中に公開ベータ版 API を有料の**GA(一般利用版)**へ移行予定
- 特別優遇条件: GA 移行時点でアカウント作成済みの方全員に、$20 クレジットをお贈りします。
お問い合わせ
音声アプリケーションの開発において、遅延要件やスケーラビリティに関するご質問がある場合は、エンジニアチームまでお気軽にお問い合わせください。
※注釈: 本記事の数値は、Coval の 2026 年 9 月 14 日(UTC 15:00)時点の 1 日分ビューに基づくものです。WER は複数データセット統合計算、ランキングは専用推論エンドポイントを除外し、価格比較は Nari 公表価格対照です。