
2026/08/12 4:35
Nvidia Nemotron 3.5 Lightning および NeMo Switchyard
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
NVIDIA は、マルチエージェントシステム内の長期間にわたるエージェント型 AI ワークロードおよび専門的なタスク向けに設計された、300 億パラメータを持つ混合物専門家(MoE)オープンモデル「Nemotron 3.5 Lightning」を発表しました。本モデルは最先端レベルの精度を提供するとともに、出力速度が最大で 4 倍高速化し、エージェント型タスクの完了速度も約 30% 向上しています。これにより、大量の実装が可能になりつつ運用コストを削減できます。本モデルは、NVIDIA NeMo を用いて組織固有のデータを用いた後学習が可能であり、Nemotron Coalitions の貢献に基づいています。また、データのプライバシーと制御を維持するため、ローカル AI システム(NVIDIA RTX PC、DGX Spark、DGX Station、Jetson)、エッジデバイス、ワークステーション、データセンター、クラウド環境への展開をサポートしています。
効率を最大化するため、NVIDIA は開発者がアプリケーションを書き直す必要なく、品質、遅延、予算に基づいて自動的にリクエストを開封モデル、プロプライエタリモデル、または NVIDIA の混合モデルの最も適したものへ導くオープンソースのインテリジェントルーティングライブラリ「NeMo Switchyard」を発表しました。パートナー企業は既に Switchyard を統合し、精度を維持しつつコスト削減を実現しています。具体的な事例としては、Boomi(ドメインルーティング精度 100%)、Ramp(コスト削減 58%)、Classmethod(コスト削減 27%)、Cognition(Devin Desktop のコスト削減 28%)があり、Kong、LangChain、LiteLLM、Nous Research、Siemens による統合も進んでいます。
業界での採用は加速しており、組織はセキュリティ対策(CrowdStrike)、法務サービス、コードレビュー、ソフトウェア開発(Harvey との Trajectory、CodeRabbit との Baseten、Lila Sciences、Fastino Labs など)といったドメイン特化のエージェント型タスクに Nemotron 3.5 Lightning をカスタマイズしています。Nemotron 3.5 Lightning は Hugging Face、ModelScope、OpenRouter、build.nvidia.com(NVIDIA NIM マイクロサービスとして)、ならびに幅広い NVIDIA クラウドパートナーのエコシステムを通じて提供可能です。一方、NeMo Switchyard は GitHub で利用可能で、近々パートナープラットフォームにも展開されます。
本文
NVIDIA による自律型 AI エージェントの進化:「Nemotron 3.5 Lightning」と「NeMo Switchyard」のリリース
AI がチャットボットから自律型エージェントへと進化する過程において、オープンソースモデルは市場ニーズを充足する重要な役割を果たしています。本日、NVIDIA は以下の新技術を発表しました。
- Nemotron 3.5 Lightning: 長時運行型の自律型 AI ワークロードでクラス内最高効率を実現する大規模モデル
- NeMo Switchyard: オープンソースライブラリとして発表される、エージェントツール内部のインテリジェントなルーティング機能
これにより、企業は AI の展開場所、稼働方法、そして進化に対する完全な制御を手に入れることができます。
1. Nemotron 3.5 Lightning:専用タスク向け大規模モデル
「Nemotron 3.5 Lightning」は、常時稼働エージェントを駆動するための大規模なタスクに最適化された、完全にカスタマイズ可能なオープンソースモデルです。
メイン特徴と性能
- アーキテクチャ: 300 億パラメータを持つエキスパート混合(MoE)構成を採用しています。
- スピード向上: 同クラスのモデルと比較して最大4 倍高速な出力速度を実現。自律型タスクの完了時間を約30% 短縮します。
- 精度維持: 「PinchBench」ベンチマークの結果、最先端レベルの精度を保ちつつ高速化を達成しました。
- 柔軟性: オープンかつカスタマイズ可能であり、組織固有のデータやワークフローを用いて NVIDIA NeMo でポストトレーニング(追加学習)が容易です。
活用事例と業界への貢献
業界を超えた AI リーダーたちは各自のワークロード向けにカスタマイズを行っており、以下のような成果を上げています。
- CrowdStrike (サイバーセキュリティ): ドメイン特化型自律型タスクの精度向上。
- Harvey (法律サービス) と CodeRabbit: 専用のルーターを組み合わせてドメイン特化型タスクを実現。
- Lila Sciences (物理・生命科学): 自律型タスクの推論能力向上。
- Fastino Labs: ソフトウェア開発、金融、ヘルスケアなどで業界最高クラスの精度を達成。
プライバシーと展開の柔軟性
- 組織固有の制御: ユーザーは既存のインフラ投資を最大化でき、エッジ AI デバイスからデータセンター、クラウド環境まで状況に応じてスケール可能です。
- オンプレミス動作: 高ボリュームかつ専用性の高いタスクで迅速なレスポンスが必要な場合、ローカルまたはオンプレミス環境でも動作します。
- 実行可能ハードウェア: NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station、および NVIDIA Jetson などで動作します。
オープンソースへのコミットメント
- 毎回のリリースにおいて、ライセンス条件の範囲内でトレーニングデータや技術を公開し、トレイサビリティ(追跡可能性)監査と再学習を可能にしています。
- 「Nemotron-RL-Agentic-Terminal-Pivot」という自律型強化学習データセットも同時に公開されており、コーディングエージェント能力の追加トレーニングに使用されます。
入手方法: Hugging Face、ModelScope、OpenRouter、および build.nvidia.com(NVIDIA NIM マイクロサービス経由)で利用可能です。
2. NeMo Switchyard:インテリジェントなモデルルーティングライブラリ
「NeMo Switchyard」は、異なる特性を持つモデルを自動的に最適なタスクへと誘導するオープンソースライブラリです。これにより、コストの過剰発生や品質低下を防ぎつつ、導入スピードを向上させます。
仕組みと利点
- 自動ルーティング: エージェントワークフローの各ステップで、プロンプトを最も能力が高く効率的なモデルへ自動的に導きます。
- カスタマイズ性: 開発者は自社優先事項(品質、レイテンシ、コストなど)に合わせてルーターを調整できます。
- トークノミクス改善: モデルシステムの環境下で、改善されたトークノミクスを持つ強力な AI エージェントを構築可能です。
内部ベンチマーク結果
- 最先端レベルの精度を維持しつつ、タスク完了コストを単一のモデル(Opus 4.8)使用時の約1/3に削減しました。
3. パートナーエコシステムでの実績
NVIDIA は AI エコシステム全体でパートナーと連携し、既存ツールへインテリジェントなルーティング機能を導入しています。具体的な成果例は以下の通りです。
- Boomi: トラフィックの59%を高速モデルへ送り、後続ターンにおけるレイテンシを21%削減。
- Cadence: ChipStack AI Super Agent の効率性を9.9%向上。
- Classmethod: コストを27%削減し品質は維持。
- Cognition: 単一モデル使用時と比較して平均コストを28%削減。
- Kong: Kong AI Gateway へネイティブなルーティング機能を提供。
- LangChain: 総コストを74%削減し、精度トレードオフは最小限(6%)に抑えた。
- LiteLLM: プログキシ層へプラグインとして追加され、既存スタック変更なしでの利用を実現。
- Nous Research: Hermes に統合し、設定が容易なルーティングシステムを提供。
- Ramp: SWE-Bench におけるコストを58%、実行時間を**33%**削減。
- Siemens: Fuse EDA AI Agent の効率性改善に向けたベンチマーク実施中。
4. 今後の展開
これらの技術は、パーソナルコンピュータからデータセンターまでのあらゆる環境に対応可能です。
- 「Nemotron 3.5 Lightning」: Hugging Face、ModelScope、OpenRouter、および build.nvidia.com で利用開始。
- 「NeMo Switchyard」: GitHub で提供開始済みで、まもなくパートナープラットフォームへの登場予定です。
このリリースにより、企業は精度と速度を両立しつつ、自律型 AI アプリケーションに対する完全な制御を獲得できます。