· CSO Diana 事業戦略 · 7 min read
NVIDIAが30Bのオープンモデルとルーターを公開——半導体企業がモデルを配る理由
NVIDIAは2026年8月11日、30BのMoEモデル「Nemotron 3.5 Lightning」と、モデル選択を自動化する「NeMo Switchyard」を公開しました。手元のPCやJetsonでも動きます。ハードウェア企業がモデルを開放する戦略の意図を読み解きます。
※ 本記事は2026年8月18日時点の公開情報に基づきます。仕様・提供状況は変化するため、最新情報は各社公式発表等をご参照ください。
NVIDIAは2026年8月11日、**300億パラメータのMixture-of-Expertsモデル「Nemotron 3.5 Lightning」**と、リクエストを最適なモデルへ振り分けるライブラリ「NeMo Switchyard」を公開しました。モデルの重みはHugging Face、ModelScope、OpenRouter、build.nvidia.comで配布され、訓練データや手法も「ライセンスが許す限り」公開されています。動作環境はRTX搭載PC、DGX Spark、DGX Station、Jetsonといった手元の機器から、データセンター、クラウドまで及びます(出典: NVIDIA 公式ブログ)。
半導体企業が「モデルを無料で配る」構図
戦略として読むと、この発表の構図は明快です。モデルはNVIDIAの製品ではなく、ハードウェアの需要を生む補完財です。優れたモデルが自由に手に入るほど、それを動かす機器が売れる。しかもNemotron 3.5 Lightningは、データセンターだけでなく手元のPCやJetsonで動くよう設計されています。
競合が「最上位モデルへの課金」で収益を得ようとするのに対し、NVIDIAはモデルの価格を下げることで自社の主戦場を広げる側に立っています。同じ市場に、収益の取り方が正反対のプレイヤーが並存している。これが2026年のAI市場の構造です。
「速さ」を売りにした設計
性能の主張も、この戦略と一貫しています。NVIDIAは同クラスの他モデルと比べて「最大4倍の出力速度」を示し、それが「エージェント的タスクの30%速い完了」につながるとしています(出典: 同上)。
大きく賢いモデルを1つ用意するのではなく、大量に呼び出される実行層を速く安くするという方向です。エージェントが10工程、20工程と回る使い方が広がるほど、1呼び出しあたりの速度と単価が総コストを決めます。ここを取りに行く設計だと読めます。
ルーターという「もう一つの争点」
同時に公開されたNeMo Switchyardは、より戦略的な意味を持ちます。NVIDIAはこれを「開発者が自ら組み合わせたオープン・プロプライエタリ・NVIDIAのモデル群にまたがって、各リクエストを最も適したモデルへ賢く振り分ける。しかもアプリケーションを書き換えることなく」と説明しています。NVIDIAの内部ベンチマークでは、Switchyardを併用した場合、フロンティア級の精度を保ちながら、タスク完了コストを「Opus 4.8単体のほぼ3分の1」にまで下げられるとしています(出典: 同上)。なお、NeMo SwitchyardはGitHubで公開されています(出典: 同上)。
どのモデルを呼ぶかを決める層は、この1年で急速に価値を持ち始めた領域です。ここを押さえれば、モデルの覇権が誰に移っても、選択の入口を握り続けられます。
中小企業への翻訳——「手元で動く」が選択肢に入った
自社でモデルを訓練する話ではありません。読み取るべきは、選択肢の増え方です。
社外に出せないデータの処理は、手元で完結できる可能性がある。 顧客名簿、給与、契約書。クラウドに送らずに処理できるなら、稟議の難易度は大きく下がります。
「1つのモデルに全部やらせる」設計をやめる。 定型処理は軽いモデル、判断が要る工程だけ上位モデル。振り分けを前提にすると、費用は数分の一になり得ます。
入口を1か所に集約しておく。 どのモデルを使うかを業務ロジックに散らばらせない。差し替えられる形にしておくことが、この速度の市場では最大の防御になります。
まとめ
- NVIDIAは2026年8月11日、300億パラメータのMoEモデル「Nemotron 3.5 Lightning」とモデル振り分けライブラリ「NeMo Switchyard」を公開。重みはHugging Face・ModelScope・OpenRouter・build.nvidia.comで配布される
- 訓練データや手法も「ライセンスが許す限り」公開され、コーディング能力の事後学習用データセット「Nemotron-RL-Agentic-Terminal-Pivot」も含まれる
- 性能面では同クラス比で最大4倍の出力速度、エージェント的タスクの完了が30%速いとされる。動作環境はRTX PC・DGX Spark・DGX Station・Jetsonからデータセンター・クラウドまで
- GitHubで公開されたNeMo Switchyardは、オープン・プロプライエタリ・NVIDIAのモデルをまたいで最適なモデルへ振り分ける。NVIDIAの内部ベンチマークでは、併用時のタスク完了コストがOpus 4.8単体のほぼ3分の1になるとされる
モデルが無料で配られる市場では、価値は別の場所に移ります。今回で言えば、それを動かす機器と、どのモデルを呼ぶかを決める層です。自社の立ち位置を考えるときも同じ問いが有効です。無料になっていくものは何で、それでも残る価値はどこにあるのか。この問いに答えを持っている会社が、価格競争の外側に立てると私たちは考えます。
※ 本記事は一般的な情報提供を目的としており、個別の法的・財務的・経営的助言ではありません。具体的な課題については専門家にご相談ください。