Nvidia Nemotron 3.5 Lightning および NeMo Switchyard

2026/08/12 4:35

Nvidia Nemotron 3.5 Lightning および NeMo Switchyard

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

NVIDIA は、マルチエージェントシステム内の長期間にわたるエージェント型 AI ワークロードおよび専門的なタスク向けに設計された、300 億パラメータを持つ混合物専門家(MoE)オープンモデル「Nemotron 3.5 Lightning」を発表しました。本モデルは最先端レベルの精度を提供するとともに、出力速度が最大で 4 倍高速化し、エージェント型タスクの完了速度も約 30% 向上しています。これにより、大量の実装が可能になりつつ運用コストを削減できます。本モデルは、NVIDIA NeMo を用いて組織固有のデータを用いた後学習が可能であり、Nemotron Coalitions の貢献に基づいています。また、データのプライバシーと制御を維持するため、ローカル AI システム(NVIDIA RTX PC、DGX Spark、DGX Station、Jetson)、エッジデバイス、ワークステーション、データセンター、クラウド環境への展開をサポートしています。

効率を最大化するため、NVIDIA は開発者がアプリケーションを書き直す必要なく、品質、遅延、予算に基づいて自動的にリクエストを開封モデル、プロプライエタリモデル、または NVIDIA の混合モデルの最も適したものへ導くオープンソースのインテリジェントルーティングライブラリ「NeMo Switchyard」を発表しました。パートナー企業は既に Switchyard を統合し、精度を維持しつつコスト削減を実現しています。具体的な事例としては、Boomi(ドメインルーティング精度 100%)、Ramp(コスト削減 58%)、Classmethod(コスト削減 27%)、Cognition(Devin Desktop のコスト削減 28%)があり、Kong、LangChain、LiteLLM、Nous Research、Siemens による統合も進んでいます。

業界での採用は加速しており、組織はセキュリティ対策(CrowdStrike)、法務サービス、コードレビュー、ソフトウェア開発(Harvey との Trajectory、CodeRabbit との Baseten、Lila Sciences、Fastino Labs など)といったドメイン特化のエージェント型タスクに Nemotron 3.5 Lightning をカスタマイズしています。Nemotron 3.5 Lightning は Hugging Face、ModelScope、OpenRouter、build.nvidia.com(NVIDIA NIM マイクロサービスとして)、ならびに幅広い NVIDIA クラウドパートナーのエコシステムを通じて提供可能です。一方、NeMo Switchyard は GitHub で利用可能で、近々パートナープラットフォームにも展開されます。

本文

NVIDIA による自律型 AI エージェントの進化:「Nemotron 3.5 Lightning」と「NeMo Switchyard」のリリース

AI がチャットボットから自律型エージェントへと進化する過程において、オープンソースモデルは市場ニーズを充足する重要な役割を果たしています。本日、NVIDIA は以下の新技術を発表しました。

  • Nemotron 3.5 Lightning: 長時運行型の自律型 AI ワークロードでクラス内最高効率を実現する大規模モデル
  • NeMo Switchyard: オープンソースライブラリとして発表される、エージェントツール内部のインテリジェントなルーティング機能

これにより、企業は AI の展開場所、稼働方法、そして進化に対する完全な制御を手に入れることができます。


1. Nemotron 3.5 Lightning:専用タスク向け大規模モデル

「Nemotron 3.5 Lightning」は、常時稼働エージェントを駆動するための大規模なタスクに最適化された、完全にカスタマイズ可能なオープンソースモデルです。

メイン特徴と性能

  • アーキテクチャ: 300 億パラメータを持つエキスパート混合(MoE)構成を採用しています。
  • スピード向上: 同クラスのモデルと比較して最大4 倍高速な出力速度を実現。自律型タスクの完了時間を約30% 短縮します。
  • 精度維持: 「PinchBench」ベンチマークの結果、最先端レベルの精度を保ちつつ高速化を達成しました。
  • 柔軟性: オープンかつカスタマイズ可能であり、組織固有のデータやワークフローを用いて NVIDIA NeMo でポストトレーニング(追加学習)が容易です。

活用事例と業界への貢献

業界を超えた AI リーダーたちは各自のワークロード向けにカスタマイズを行っており、以下のような成果を上げています。

  • CrowdStrike (サイバーセキュリティ): ドメイン特化型自律型タスクの精度向上。
  • Harvey (法律サービス) と CodeRabbit: 専用のルーターを組み合わせてドメイン特化型タスクを実現。
  • Lila Sciences (物理・生命科学): 自律型タスクの推論能力向上。
  • Fastino Labs: ソフトウェア開発、金融、ヘルスケアなどで業界最高クラスの精度を達成。

プライバシーと展開の柔軟性

  • 組織固有の制御: ユーザーは既存のインフラ投資を最大化でき、エッジ AI デバイスからデータセンター、クラウド環境まで状況に応じてスケール可能です。
  • オンプレミス動作: 高ボリュームかつ専用性の高いタスクで迅速なレスポンスが必要な場合、ローカルまたはオンプレミス環境でも動作します。
  • 実行可能ハードウェア: NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station、および NVIDIA Jetson などで動作します。

オープンソースへのコミットメント

  • 毎回のリリースにおいて、ライセンス条件の範囲内でトレーニングデータや技術を公開し、トレイサビリティ(追跡可能性)監査と再学習を可能にしています。
  • 「Nemotron-RL-Agentic-Terminal-Pivot」という自律型強化学習データセットも同時に公開されており、コーディングエージェント能力の追加トレーニングに使用されます。

入手方法: Hugging Face、ModelScope、OpenRouter、および build.nvidia.com(NVIDIA NIM マイクロサービス経由)で利用可能です。


2. NeMo Switchyard:インテリジェントなモデルルーティングライブラリ

「NeMo Switchyard」は、異なる特性を持つモデルを自動的に最適なタスクへと誘導するオープンソースライブラリです。これにより、コストの過剰発生や品質低下を防ぎつつ、導入スピードを向上させます。

仕組みと利点

  • 自動ルーティング: エージェントワークフローの各ステップで、プロンプトを最も能力が高く効率的なモデルへ自動的に導きます。
  • カスタマイズ性: 開発者は自社優先事項(品質、レイテンシ、コストなど)に合わせてルーターを調整できます。
  • トークノミクス改善: モデルシステムの環境下で、改善されたトークノミクスを持つ強力な AI エージェントを構築可能です。

内部ベンチマーク結果

  • 最先端レベルの精度を維持しつつ、タスク完了コストを単一のモデル(Opus 4.8)使用時の約1/3に削減しました。

3. パートナーエコシステムでの実績

NVIDIA は AI エコシステム全体でパートナーと連携し、既存ツールへインテリジェントなルーティング機能を導入しています。具体的な成果例は以下の通りです。

  • Boomi: トラフィックの59%を高速モデルへ送り、後続ターンにおけるレイテンシを21%削減
  • Cadence: ChipStack AI Super Agent の効率性を9.9%向上
  • Classmethod: コストを27%削減し品質は維持。
  • Cognition: 単一モデル使用時と比較して平均コストを28%削減
  • Kong: Kong AI Gateway へネイティブなルーティング機能を提供。
  • LangChain: 総コストを74%削減し、精度トレードオフは最小限(6%)に抑えた。
  • LiteLLM: プログキシ層へプラグインとして追加され、既存スタック変更なしでの利用を実現。
  • Nous Research: Hermes に統合し、設定が容易なルーティングシステムを提供。
  • Ramp: SWE-Bench におけるコストを58%、実行時間を**33%**削減。
  • Siemens: Fuse EDA AI Agent の効率性改善に向けたベンチマーク実施中。

4. 今後の展開

これらの技術は、パーソナルコンピュータからデータセンターまでのあらゆる環境に対応可能です。

  • 「Nemotron 3.5 Lightning」: Hugging Face、ModelScope、OpenRouter、および build.nvidia.com で利用開始。
  • 「NeMo Switchyard」: GitHub で提供開始済みで、まもなくパートナープラットフォームへの登場予定です。

このリリースにより、企業は精度と速度を両立しつつ、自律型 AI アプリケーションに対する完全な制御を獲得できます。

同じ日のほかのニュース

一覧に戻る →

2026/08/12 4:49

圧縮とは予測である

## Japanese Translation: ## 概要: Annie Sexton は ngrok で開発者教育担当として在籍し、Heroku、Render、Fly.io など PaaS 企業にて 10 年以上にわたって経験を持つ人物です。彼女は、「nerd-sniping」と呼ばれる遊び心のある用語で表される開発者への情熱——すなわち共有する技術的熱情を即座に惹きつけ、彼らを魅了する能力——によって際立っています。彼女の主な価値は、複雑なクラウドインフラストラクチャとそれを構築する人間クリエイターの間を取り持つことにあります。この深い歴史的文脈とエンジニアリングの craft に対する真摯な共感を活用することで、Annie は抽象的な技術概念をアクセスしやすく魅力的な学習体験へと転換させます。これにより開発者が支えられていると感じることが保証され、混同ではなくつながりを通じて革新が育まられるエコシステムが醸成されます。

2026/08/12 1:56

Mojo 1.0

## Japanese Translation: Mojo言語のバージョン1.0がリリースされ、2023年の初リリース以来確立された安定した、プロダクション対応の基盤へと、急激な実験段階からの移行を象徴しています。1.xシリーズではC++などの成熟した言語の標準に従い、破損を引き起こすシフトを避けるために追加的な変更を優先します。約20万人のコードラインと、ほぼ200人の貢献者から寄せられた1,100以上のプルリクエストを基盤としており、一貫性のある`var`を用いた変数宣言、統合されたクロージャ、単一のPointerType、そして正確な語彙再命名といった主要な簡素化がリリースに含まれています。新しい機能には、Python風のラムダ構文、参照無効化に対する改良されたメモリ安全性診断、より優れた`where`節、VS Code向けのより安定したLSPサーバーが含まれます。開発者は今や、信頼性の高い「1.0対応」のAIスキルを使用でき、`uv pip install --upgrade mojo`または`uv pip install max[all]`などのコマンドでインストールできます。MAXの強化(GLM-5.2およびNemotron-Hへのサポートなど)は`max["serve"]`を通じて利用可能で、skills.shを通じてオープンソースのエージェントスキル7,200以上がダウンロードされ、モデル全体のライフサイクル導入を加速しています。不安定なモジュール化パッケージはバージョン26.6で廃止予定となっており、長期的耐久性に向けた完全なアーキテクチャシフトを示しています。今後の投資には非同期プログラミングモデル、パターンマッチング、ユニオンが含まれ、また2026年までにMojoコンパイラとツールチェーンの段階的なオープンソース化も進められます。Mojo、MAX、オープンソースに関する詳細および計画については、8月18日にサンフランシスコで開催されるModConにて共有され、完全な変更ログの詳細はmojolang.orgおよびGitHubリポジトリで入手可能です。

2026/08/11 22:22

専用LLM API から推論トレースを盗む

## Japanese Translation: 以下の改良版は、主要な点をすべて保存しつつ、若干の明瞭性と正確性を加えています: ## サマリー: 2026 年の研究論文には、Anthropic、OpenAI、および Google が提供する専有型大規模言語モデル(LLM)API の重大な脆弱性が詳述されており、攻撃者がプライベートな推論データを盗むことを可能にしています。著者らは MATS Research、ELLIS Institute Tübingen、マックス・プランク知能システム研究所、AI Sequrity Company、Snyk、およびチュービンゲン大学の研究者によっており、「MATS」という技術を提案し、セキュリティ対策を回避して暗号化される予定の内部論理ブロックである「hidden thinking tokens(隠された思考トークン)」を抽出できるようにしました。この攻撃は、強力な Frontier モデル(例:claude-opus-4-8)からこれらの暗号化ブロックを再演奏し、それをより弱い、Jailbroken サブモデル(例:claude-haiku-4-5-20251001)に転送することで実装され、反蒸留防御トリガーなしで強力のモデルの平文推論を再構築します。Claude、GPT、Gemini での公開されているエージェント軌跡 6,708 の分析により、31 万を超える再構築された推論ブロックが得られました。これらのトレースには、API キー、パスワード、アクセストークン、個人メール、パスポート、クレジットカードの数字、フライト情報を含む 704 の異なるプライバシーアーティファクトが含まれており、そのうち 64 は推論ブロック内にのみ現れ、可視セッションデータ中には存在しません。この研究は、暗号化された内部思考が高度な抽出攻撃に対して依然として脆弱であることを強調しています。今後の安全性は、提供者がそのような露出を防ぐために暗号化プロトコルを見直すことに依存します。

Nvidia Nemotron 3.5 Lightning および NeMo Switchyard | そっか~ニュース