AI・業務改善
NVIDIA、常時稼働AIエージェント向け軽量高速モデル「Nemotron 3.5 Lightning」と「NeMo Switchyard」を公開
投稿日 2026年8月12日
米NVIDIAは2026年8月11日(米国時間)、常時稼働するAIエージェント向けに最適化したオープンモデル「Nemotron 3.5 Lightning」と、リクエストを最適なモデルに自動ルーティングするオープンソースライブラリ「NVIDIA NeMo Switchyard」を発表しました。公式ブログで詳細が公開されています。
常時稼働エージェントの実行層を担う軽量モデル
Nemotron 3.5 Lightningは、30BパラメータのMixture-of-Experts(MoE)モデルで、アクティブパラメータは3Bです。ツール呼び出し、結果検証、サブエージェントへの委譲など、長時間稼働するエージェントの高頻度タスクに特化しています。NVIDIAの発表では、類似モデル比で最大4倍の出力速度、30%高速なタスク完了を達成し、PinchBenchで86%の精度を記録。Qwen3.6 35Bとの比較では、1万タスクを30%高速に完了したとしています。また、Artificial Analysis Intelligence Indexの精度・速度のPareto最前線を獲得しました。
なぜ軽量モデルとルーティングが必要か
AIエージェントは、複雑な推論だけでなく、多くの小さな実行タスクを連続的に処理します。すべてのステップにフロンティアモデルを使うと、レイテンシとコストが増大します。Nemotron 3.5 Lightningのような軽量モデルが実行層を担い、複雑な判断は大規模モデルに委ねる構成が現実的です。今回同時に公開された「NeMo Switchyard」は、各リクエストを最適なモデルへ自動ルーティングするオープンソースライブラリで、内部ベンチマークではフロンティア級の精度を維持しつつ、タスク完了コストをOpus 4.8単独の約3分の1に低減できたとしています。これにより、複数モデル構成の実用化が進むと見込まれます。
動作環境と入手方法
本モデルは、NVIDIA Jetson、GeForce RTX 5090、DGX Spark、RTX PCなどのローカル環境から、データセンター・クラウドまで展開可能です。LM Studio、llama.cpp、Ollama、Unslothなどの標準ツールで実行でき、NVFP4量子化によりBlackwell・Hopper・Ampere GPUに対応します。重み・学習データ・レシピは許容的なOpenMDW-1.1ライセンスで公開され、LoRAやフルSFT、NeMo RL/NeMo Gymによる強化学習でのカスタマイズが可能です。Hugging Face、ModelScope、OpenRouter、build.nvidia.com(NVIDIA NIMマイクロサービス)から入手できます。NeMo SwitchyardはGitHubで公開されています。
企業のAIエージェント導入への影響
NVIDIAは、CrowdStrike、Harvey、CodeRabbitなどがドメイン特化のカスタマイズを進めていると発表しています。常時稼働エージェントのコストとレイテンシが削減されることで、これまで導入が難しかった業務にもAIエージェントを組み込みやすくなります。ただし、性能値はNVIDIAの内部ベンチマークに基づくものであり、実際の効果は環境やタスクによって異なります。導入を検討する際は、自社のユースケースでの検証が重要です。
まとめ
NVIDIAは、常時稼働AIエージェントの実行層を担う軽量高速モデル「Nemotron 3.5 Lightning」と、モデルルーティング基盤「NeMo Switchyard」をオープンソースとして公開しました。許可型ライセンスにより、企業は独自データでカスタマイズしやすく、複数モデルを組み合わせた効率的なエージェント運用の選択肢が広がります。AIエージェントの本格運用を検討する際に、コスト最適化の有力な手段となるでしょう。
株式会社キャスタルのご案内
AIエージェントやモデルルーティングの導入は、システム設計や業務フローへの組み込みが鍵になります。株式会社キャスタルは、大阪のシステム開発会社として、AI活用システムの企画・開発、クラウドバックエンド構築、内製化支援などを行っています。AIを活用した業務改善をご検討の際は、ぜひサービス一覧をご覧ください。料金体系や導入事例は料金とお問い合わせのページからご相談いただけます。
出典
- NVIDIA Technical Blog:NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents
- NVIDIA Blog:NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI
- NVIDIA Blog:NVIDIA and Local AI Community Fuel Open Source Models and Intelligent Agents
業務改善のご相談はお気軽にどうぞ
ブログのテーマに関連する業務システム・Webサイト・AIの導入について、企画段階からご相談いただけます。
お問い合わせする