AIツール2026年10月更新

NVIDIA Nemotron VoiceChat 11Bとは?ツール呼び出し対応初のオープン全二重音声モデルの仕組み・遅延450ms・使い方を解説

公開日: 2026/10/06
NVIDIA Nemotron VoiceChat 11Bとは?ツール呼び出し対応初のオープン全二重音声モデルの仕組み・遅延450ms・使い方を解説

この記事のポイント

NVIDIA Nemotron VoiceChat 11Bは、ツール呼び出しに対応した初のオープンな全二重音声モデルです。遅延約450ms、Mamba/Transformerハイブリッドの仕組み、英語のみ・80GB GPU必須などの制約、使い方、GPT-Live-1やGemini 3.8 Liveとの違いを公式情報で解説します。

NVIDIA Nemotron VoiceChat 11B(正式名: NVIDIA NemotronLabs VoiceChat 11B)は、聞き取りと発話を同時に行う全二重(フルデュプレックス)の音声対話モデルで、2026年8月3日にHugging Faceで重みが公開されました。公式によると、会話を止めずに外部ツールを呼び出せるオープンな全二重モデルとしては初めてで、ターンテイキングの応答遅延は約450ms(448ms)です。

ただし現時点では英語のみ対応で、80GB以上のメモリを持つGPUが必要です。日本語の音声ボットをすぐに作りたい場合は、ホスト型APIのGPT-LiveやGemini 3.8 Liveのほうが現実的です。

この記事でわかること

  • Nemotron VoiceChat 11Bの正体と、「初のオープン全二重モデル」という表現の正しい意味
  • Mamba/Transformerハイブリッドを含むアーキテクチャと、ツール呼び出しの仕組み
  • 公式ベンチマークと第三者評価の数値、そして既知の制約
  • ライセンス・料金(実質コスト)・動作環境・導入手順
  • GPT-Live-1、Gemini 3.8 Live、PersonaPlex、Moshiとの違いと選び方

こんな方向けの記事です: 音声AIエージェントを自社インフラで動かしたい開発者・研究者、ボイスボット導入でAPI以外の選択肢を探しているIT担当者、オープンな音声モデルの動向を追っている方。

Nemotron VoiceChat 11Bはどんなモデルか

Nemotron VoiceChat 11Bは、「音声理解→思考→ツール実行→音声生成」を1つのモデルでストリーミング処理する、英語専用・自前ホスト前提のオープンウェイト音声エージェント基盤です。

  1. ツール呼び出しに対応したオープン全二重モデル: 会話中にAPIを呼び、待ち時間は「保留メッセージ」を話してつなげる。オープンな全二重モデルでツール呼び出しに対応したのは、公式発表時点でこのモデルが最初です
  2. 低遅延だが精度はまだ発展途上: 応答遅延は約450msと速い一方、ツール引数の正解率は42.2%、ツール実行の成功率(Pass@1)は33%にとどまります
  3. 導入のハードルは高め: 英語のみ・声は1種類・会話の文脈は約2分まで・80GB級GPUが必要という制約があります

研究開発やPoC、データを外部APIに出せない英語圏向けサービスには有力な選択肢ですが、日本語のコールセンター自動化にそのまま使うことはできません。

「初のオープンウェイト全二重音声モデル」は正確ではない

一部で「初のオープンウェイト全二重音声モデル」と紹介されることがありますが、これは誤りです。オープンな全二重音声モデルとしては、Kyutaiの「Moshi」や、NVIDIA自身の「PersonaPlex」(7B)、Freeze-Omni、FLM-Audioなどがすでに公開されています。

公式モデルカードの表現は「the first open full-duplex model to support tool calling(ツール呼び出しに対応した初のオープン全二重モデル)」です。新しいのは「全二重であること」ではなく、「全二重のまま会話を止めずにツールを呼べること」です。

NVIDIA Nemotron VoiceChat 11Bの基本情報

Hugging Faceで公開されているNVIDIA Nemotron VoiceChat 11Bの公式モデルページ

出典:Hugging Face(NVIDIA公式モデルカード)

Nemotron VoiceChat 11Bは、NVIDIAのNeMo Speechチームが開発した11Bパラメータのエンドツーエンド音声対話モデルです。Hugging Face上のリポジトリ名は nvidia/NVIDIA-NemotronLabs-VoiceChat-11B です。

項目

内容

正式名称

NVIDIA NemotronLabs VoiceChat 11B

開発元

NVIDIA(NeMo Speechチーム)

公開日

2026年8月3日(Hugging Faceで重みを公開)

パラメータ数

約11B

種類

エンドツーエンドのリアルタイム全二重音声対話モデル(Speech-to-Speech)

入力

テキスト(プロンプト)+音声(16kHz)

出力

テキスト・音声(22.05kHz)・書き起こし

対応言語

英語のみ

声

固定の1種類(ボイスクローン非対応)

会話の文脈

学習時の音声コンテキストは最大2分

ライセンス

OpenMDW License Agreement v1.1

動作環境

Linux、80GB以上のメモリを持つNVIDIA GPU

論文

arXiv:2609.21967(2026年9月18日 v1、10月1日 v2)

学習には約55万時間の音声データが使われています。Fisher、LibriVox、社内のスタジオ収録といった実音声と、LibriTTS、HiFi-TTS、VCTKなどから作った合成音声の組み合わせです。テキスト側はNemotron系のデータやUltraChatに加え、独自に用意した関数呼び出し・ペルソナ用のデータで学習しています。

「Nemotron 3 VoiceChat(12B)」との関係

2026年3月には、前身とみられる「Nemotron 3 VoiceChat」(12B)がEarly Access(先行提供)として公開され、Artificial Analysisなどで評価されていました。NVIDIA開発者サイトでは、サブ秒で応答し割り込みも可能な、エンタープライズ向けのオープンな重みを持つ全二重モデルと説明されています。

今回の「NemotronLabs VoiceChat 11B」との正確な関係(同じ系統の改名なのか、別バージョンなのか)は、現時点で公式には明示されていません。パラメータ数の表記(11B/12B)もソースによって異なるため、評価記事を読む際はどちらのモデルの数値なのかに注意してください。

従来の音声AIとの違い:カスケード型ではなく統合型

Nemotron VoiceChat 11Bの最大の特徴は、音声認識(ASR)→大規模言語モデル(LLM)→音声合成(TTS)という3つのモデルを直列につなぐ「カスケード型」ではなく、1つのモデルで処理する点です。

カスケード型のボイスボットでは、ユーザーが話し終わるのを待ってから書き起こし、LLMで回答を作り、TTSで読み上げます。モデル間の受け渡しやAPIの往復が積み重なるため、どうしても「間」が生まれます。また、ユーザーが途中で口を挟んだときの扱いも別途作り込む必要があります。

比較項目

カスケード型(ASR→LLM→TTS)

Nemotron VoiceChat 11B(統合型・全二重)

構成

3つのモデル・サービスを連結

1つのモデル

聞く・話す

交互(半二重が基本)

同時(全二重)

割り込み(バージイン)

別途実装が必要

モデル自体が対応

遅延

各段の処理時間が積み上がる

約450ms(公式ベンチマーク)

部品の差し替え

各モデルを個別に交換できる

モデル全体で入れ替え

日本語対応

日本語対応の部品を選べば可能

非対応(英語のみ)

ただし、カスケード型にも「日本語対応の部品を自由に組み合わせられる」「LLMを最新の高性能モデルに差し替えやすい」という利点があります。統合型が常に優れているわけではなく、遅延と自然さを取るか、柔軟性と賢さを取るかのトレードオフです。音声合成単体の選択肢についてはElevenLabs v3とはも参考になります。

アーキテクチャ:Mamba/Transformerハイブリッドの意味

NVIDIA Nemotronモデルファミリーの公式イメージ

出典:NVIDIA公式サイト(Nemotron)

公式はNemotron VoiceChat 11Bのアーキテクチャを「Hybrid Mamba/Transformer」と説明しています。ただし、この「ハイブリッド」はLLMバックボーン(頭脳部分)の構造を指しており、モデル全体がMambaでできているわけではありません。

モデルは大きく4つの部品で構成されています。

部品

中身

役割

音声エンコーダ

Fast Conformer(Nemotron-Speech-Streaming-En-0.6b由来)

16kHzの音声をストリーミングで読み取る

LLMバックボーン

Nemotron Nano v2 9B(Mamba/Transformerハイブリッド)

発話内容の理解・応答の生成・ツール呼び出しの判断

音声出力

NVIDIA TTSデコーダ+ストリーミングコーデック

22.05kHzの音声として応答を話す

ツール呼び出し用チャネル

発話とは別の専用出力ストリーム

ツール呼び出しの文字列を出力する(発話に混ざらない)

論文では、この構成を「ストリーミング音声エンコーダ+デコーダオンリーLLM+並列の専用出力ストリーム」と表現しており、聞く・書き起こす・考える・ツールを呼ぶ・話すを同時に行う設計になっています。

MambaとTransformerを組み合わせる理由

Mambaは「状態空間モデル」と呼ばれる系列処理の仕組みで、入力が長くなっても計算量やメモリが急増しにくいのが特徴です。音声のように途切れなく流れ込むデータを、少しずつ読み進めながら処理するストリーミング用途と相性が良いとされています。

一方、Transformerの注意機構(アテンション)は、文脈の中の離れた位置にある情報を正確に参照するのが得意です。一般的にハイブリッド構成は、大部分をMambaにして処理を軽くしつつ、要所にアテンション層を残して精度を保つ狙いで採用されます。NVIDIAは同じ考え方をNemotron 3 Nano Omniなど他のNemotron系モデルにも採用しています。

論文によると、単一のH100で4本の会話ストリームを同時に処理した場合、160msの音声チャンクあたりのp95推論遅延は118msで、リアルタイムの1.36倍の処理スループットを確保できたと報告されています。

Nemotron VoiceChat 11Bでできること

薬局・コールセンター・金融窓口などでの音声エージェント活用イメージ(NVIDIA NGC)

出典:NVIDIA NGC Catalog

Nemotron VoiceChat 11Bでできることは、自然なリアルタイム会話と会話を止めないツール呼び出しの2つに集約されます。

全二重の自然な会話と割り込み対応

ユーザーの声を聞きながら同時に話せるため、人間同士の会話に近いターンテイキング(話者交代)ができます。ユーザーがAIの発話中に割り込む「バージイン」にも対応しており、公式ベンチマークでは割り込み時の応答遅延が480msと報告されています。

論文では、評価したオープンウェイト系モデルの中で「ユーザーの言葉の間(ポーズ)で不要に割り込む」率が最も低かったとされています。割り込まれた後に応答を引き継ぐ率は100%、割り込み後の応答品質は5点満点で4.33でした。

会話を止めずに外部ツールを呼び出す

もう1つの柱が、会話中のライブなツール呼び出し(Function Calling)です。たとえば「明日のニューヨークの天気は?」と聞かれたとき、モデルは天気APIを呼び出し、結果を受け取って音声で答えます。

ツール呼び出しは、次の3つの仕組みで動いています。

  • 専用チャネルで出力: ツール呼び出しの文字列は発話用とは別のストリームに出力されるため、{"name": ...} のような文字列が読み上げられてしまうことがありません
  • 保留メッセージ(on-hold message): ツールごとに「確認しますので少々お待ちください」のような保留メッセージを定義できます。LLMがツール呼び出しのきっかけとなるテキストを生成した時点でエージェントがこのメッセージを話し始め、API実行中の無音を埋めます
  • 決まった書式でやり取り: ツール定義はシステムプロンプト内の <AVAILABLE_TOOLS> にJSONで記述し、呼び出しは <TOOLCALL>[...]</TOOLCALL>、結果は <TOOL_RESPONSE>[...]</TOOL_RESPONSE> で返します

従来の音声エージェントでは、ツールを呼ぶたびに会話が止まり、数秒の沈黙が生まれがちでした。保留メッセージでその「間」を埋める設計は、電話応対のように沈黙が不安につながる場面で効いてきます。

公式ベンチマークと第三者評価

Nemotron VoiceChat 11Bは、会話の速さ・自然さでは強い一方、ツールの引数抽出や推論力にはまだ課題があるというのが、公式値と第三者評価から読み取れる全体像です。

公式ベンチマーク

評価項目

結果(公式)

ターンテイキングの応答遅延(Full-Duplex-Bench 1.0)

448ms(スコア0.82)

ユーザー割り込み時の応答遅延

480ms

VoiceBench

オープン全二重モデル中2位

ツール選択(Full-Duplex-Bench v3)

82.5%

ツール引数の正解率(同上)

42.2%

ツール実行の成功率 Pass@1(同上)

33%

関数呼び出しのベンチマークAU Harness BFCL-v3では、次の結果が公表されています。

BFCL-v3の項目

スコア

Simple(単一ツール)

58.5%

Multiple(複数候補から選択)

62.5%

Parallel(並列呼び出し)

42.5%

Parallel Multiple

27.5%

Irrelevance(呼ぶべきでない場面の判定)

89.6%

平均

56.1%

論文でも「ツールの振り分け(どのツールを呼ぶか)は、引数の抽出やエンドツーエンドの実行よりはるかに強い」と述べられています。つまり、どのツールを使うべきかはかなり当たるが、正しい引数でツールを実行しきれるのは3回に1回程度というのが現状です。

なお「遅延450ms」は、Full-Duplex-Bench 1.0という評価環境での測定値です。実際のサービスでは、ネットワークの往復やGPUの混み具合によって体感遅延は変わります。

第三者評価(Artificial Analysis)

独立評価機関のArtificial Analysisは、前身とみられるNemotron 3 VoiceChat(12B、Early Access版)を2026年3月に評価し、会話ダイナミクス(Full Duplex Bench)77.8%、音声推論(Big Bench Audio)29.2%で、「オープンウェイトで両指標のトップ3に入る唯一のモデル」と位置づけました。

一方、2026年10月7日時点のArtificial AnalysisのSpeech-to-Speechリーダーボードでは、「NVIDIA Nemotron Voicechat」はBig Bench Audio 27%、会話ダイナミクス52.9%と表示されています。同じリーダーボード上のGPT-Live-1(89%/97.3%)やGemini 3.8 Live Extended Thinking(High)(98%/91.9%)と比べると、特に音声での推論力に大きな差があります。

評価の版や時期によって数値が大きく変わっている点には注意が必要ですが、「オープンモデルの中では上位、クローズドなAPIにはまだ届かない」という傾向は一貫しています。

弱み・既知の制約

Nemotron VoiceChat 11Bは、公式のGitHubリポジトリで多くの「既知の制約(Known limitations)」を自ら公開しています。本番導入を考えるなら、性能値よりもこの制約一覧を先に確認すべきです。

分類

主な制約(公式)

実務への影響

言語・声

英語のみ/声は1種類/ボイスクローン不可

日本語サービスには使えない。ブランドボイスを作れない

会話の長さ

学習時の音声コンテキストは最大2分

長い通話では前半の内容を保持できない可能性

知識・推論

バックボーンのNemotron Nano 9B v2より知識・指示追従・安全性が劣る場合がある。多段推論・計算が苦手

複雑な問い合わせ対応には向かない

出力の品質

単語の繰り返し、崩れた断片、単語の連結、発話の途中終了、ループ

ユーザー体験を損なう場面がある

会話制御

話し終えた後に勝手に話し続ける、相づちの扱いが苦手、ユーザーの言葉の間で割り込むことがある

会話の監視・打ち切りロジックが必要

ツール呼び出し

1セッションあたり最大5ツールを推奨/複数ツールの同時呼び出しは不安定/ツール実行中は割り込み不可/引数の捏造や呼び出しのスキップ

引数検証とリトライの仕組みが必須

書き起こし

明瞭な音声でもユーザー発話の一部が欠落することがある

ログを監査用途にそのまま使いにくい

環境

雑音や残響の多い環境、背景で人が話す環境には不向き

コールセンターや店舗では精度が落ちやすい

ハードウェア

80GB以上のメモリを持つGPUが必要

一般的なPCやゲーミングGPUでは動かない

Macやローカル環境で動くか

一般的な家庭用PCでは動きません。Apple Silicon向けにはコミュニティによるMLX変換版(mlx-communityのbf16版など)が公開されていますが、これはNVIDIA公式ではなく、Conformer音声エンコーダと全二重のループ処理に対応していないため、LLM部分とコーデックが動くだけです。実質的な全二重会話はできません。

手元のNVIDIA製マシンでローカルAIを動かす選択肢については、NVIDIA RTX Sparkとはで整理しています。

料金・ライセンス:モデルは無料、実質コストはGPU

Nemotron VoiceChat 11Bのモデル自体は無料で、ライセンス料はかかりません。実際にかかるのは、80GB級GPUを動かすためのインフラ費用です。

ライセンス(OpenMDW 1.1)

Hugging Face上のライセンスは、Linux Foundationが策定した「OpenMDW License Agreement v1.1」(Open Model, Data & Weights)です。OpenMDW-1.1自体は寛容(permissive)型のライセンスで、利用分野・地域を問わず、ロイヤリティなしで商用利用や派生モデルの作成を認めています。ファインチューニング後の重みを公開する義務もありません。再配布する場合は、ライセンス文と表示を残す必要があります。

ただし、NVIDIAのNGCカタログ(NIM向け配布ページ)には「ready for research purposes only(研究目的向け)」という記載もあり、配布ページ間で表現に差があります。商用サービスに組み込む前に、利用する配布元の最新のライセンス表記を必ず確認し、必要に応じて法務担当と相談してください。 同じOpenMDW 1.1を採用したNemotron系モデルの例としては、Nemotron 3.5 Lightningとはも参考になります。

他の音声AIとの料金比較

モデル

提供形態

料金(公式)

Nemotron VoiceChat 11B

オープンウェイト(自前GPU)

無料(GPU費用は別途)

OpenAI GPT-Live-1

API

音声セッション $0.05/分(秒単位課金)。バックエンドモデル・ツール利用は別料金

Google Gemini 3.8 Live

API

音声入力 $3.00/100万トークン、音声出力 $12.00/100万トークン、テキスト入力 $0.75・出力 $4.50/100万トークン。無料枠あり

NVIDIAのbuild.nvidia.comやNIMでホスト型として提供されている形跡はありますが、ホスト型APIの料金や一般提供の状況は、現時点で公式に確認できていません。

API従量課金と自前GPUのどちらが安いか

判断のポイントは同時接続数と稼働率です。GPT-Live-1は1セッションあたり$0.05/分なので、連続通話なら1時間あたり約$3(バックエンド費用は別)です。一方、自前GPUは会話がない待機時間にも費用がかかります。

論文の測定条件(H100 1基で4ストリームを同時処理)を前提にすると、考え方は次のようになります。

  • 自前GPUの1会話あたり時間単価 ≒ GPUの1時間あたり費用 ÷ 同時処理できる会話数 ÷ 稼働率
  • 仮にGPU費用が1時間$4、4会話を同時処理、稼働率50%なら、1会話あたり1時間$2程度

GPUの時間単価はクラウド事業者や契約形態によって大きく変わり、運用・保守の人件費も加わります。通話量が少ない、または時間帯の偏りが大きい場合はAPIのほうが安くなりやすく、24時間大量の英語通話をさばく場合に自前GPUのメリットが出てきます。

使い方:導入の流れとコマンド

Nemotron VoiceChatの推論コードを含むNVIDIA-NeMo/SpeechのGitHubリポジトリ

出典:GitHub(NVIDIA-NeMo/Speech)

Nemotron VoiceChat 11Bの使い方は、オフライン推論で挙動を確かめる方法と、NVIDIAの推論コンテナ(NIM)でリアルタイム会話を動かす方法の2つがあります。どちらもLinuxと80GB以上のGPU(A100/H100/H200/B100/B200/RTX-6000など)が前提です。

方法1:オフライン推論(Conda)

公式リポジトリの手順では、WAVファイルを入力し、応答の音声とテキストを出力します。

git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech && git switch nemotron-labs-voicechat
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
python offline_voicechat_infer.py --checkpoint /path/to/checkpoint --wav sample.wav --output-dir /output

チェックポイントはfloat32で約44GBあります。ディスクの空き容量とダウンロード時間に余裕を持っておきましょう。ライブラリのバージョンは細かく指定されているため、既存環境に混ぜずに専用のConda環境を作るのが安全です。

方法2:NIMコンテナでリアルタイム会話

マイク入力でのリアルタイム会話やツール呼び出しを試すには、NVIDIAの最適化済み推論コンテナ(NIM)を使い、双方向WebSocketでクライアントと接続します。コンテナの取得方法や正式なイメージ名はNGCカタログで最新情報を確認してください。

ツールを定義するときのポイント

ツールはシステムプロンプト内の <AVAILABLE_TOOLS> にJSONで記述します。モデルが呼び出しを決めると <TOOLCALL> で関数名と引数を出力し、アプリ側で実行した結果を <TOOL_RESPONSE> で返します。イメージは次のとおりです(正確なスキーマは公式リポジトリを確認してください)。

<AVAILABLE_TOOLS>
[{"name": "get_weather",
  "description": "Get the weather forecast for a city",
  "parameters": {"city": {"type": "string"}, "date": {"type": "string"}}}]
</AVAILABLE_TOOLS>

モデルの出力:  <TOOLCALL>[{"name": "get_weather", "arguments": {"city": "New York", "date": "tomorrow"}}]</TOOLCALL>
アプリの返答:  <TOOL_RESPONSE>[{"forecast": "Sunny, high of 72 degrees"}]</TOOL_RESPONSE>

設計時に守るべき点は4つです。

  • システムプロンプトとツールの応答はASCII文字のみで書く(TTSで読み上げられる形にする)
  • ツールは1セッション5個以内に絞る
  • 時間のかかるツールには保留メッセージを設定し、処理は非同期化する(ツール実行中はユーザーが割り込めないため)
  • 応答の数値や単位は、読み上げたときに自然な形で返す

本番運用で必要な安全設計

ツール引数の正解率が4割強である以上、モデルの出力をそのまま実行しない設計が欠かせません。

  1. サーバー側で引数を検証する: 型・値の範囲・必須項目をチェックし、不正なら聞き返すかリトライする
  2. 不可逆な操作を直結しない: 決済、予約の確定、データ削除などは、人による確認や二段階の承認を挟む
  3. 会話の打ち切りを用意する: 話し続ける、同じ応答を繰り返すといった異常を検知してセッションを終了させる
  4. 高リスク領域では回答を検証する: ハルシネーションがあるため、医療・金融などで無検証の回答をさせない
  5. データ管理は自社責任: 自前ホスティングなら音声データを外部に出さずに済む一方、録音の同意取得、ログの保存期間、アクセス制御は自社で設計する

NVIDIAも「信頼できるAIは共同責任(Trustworthy AI is a shared responsibility)」として、利用者自身が業界やユースケースに適合するかを検証するよう求めています。AIエージェント全般の安全設計の考え方はAIエージェントとはでも解説しています。

他の音声AIモデルとの違い

オープンかつ自前で動かせてツールも呼べるのはNemotron VoiceChat 11Bの独自の強みですが、日本語対応・賢さ・導入のしやすさではホスト型APIが上回ります。主な選択肢を比較すると次のとおりです。

比較項目

Nemotron VoiceChat 11B

NVIDIA PersonaPlex

Kyutai Moshi

OpenAI GPT-Live-1

Google Gemini 3.8 Live

提供形態

オープンウェイト(自前GPU)

オープンウェイト

オープンウェイト

API

API

パラメータ

約11B

約7B(Moshiベース)

約7B

非公開

非公開

料金

無料(GPU費用別)

無料(GPU費用別)

無料(GPU費用別)

$0.05/分+バックエンド費用

トークン課金・無料枠あり

全二重

対応

対応

対応

対応

リアルタイム対話に対応

ツール呼び出し

対応(会話を止めずに実行)

非対応

非対応

対応(バックエンドのエージェントに委任)

対応

日本語

非対応

英語中心

英語中心

多言語

多言語

声

1種類・クローン不可

音声サンプルで声・ペルソナを変更可

限定的

複数

複数

強み

低遅延・データを外に出さない・ツール対応

声とペルソナの柔軟さ

先駆的な全二重モデル

会話品質・推論力・導入の速さ

推論力・料金の柔軟さ

GPT-Live-1は、全二重の会話はモデルが担当し、推論やツール利用はバックエンドのエージェントに任せる設計です。Nemotron VoiceChat 11Bが1つのモデルの中でツール呼び出しまで済ませるのとは考え方が異なります。各サービスの詳細はGPT-Liveとは、GPT-Realtime-2とは、Gemini 3.8 Liveとは、Microsoftの全二重モデルMAI-Realtimeとはで解説しています。

用途別の選び分け

やりたいこと

おすすめ

日本語のボイスボット・電話応対を早く作りたい

GPT-Live-1 / Gemini 3.8 Live

英語の音声エージェントを自社GPUで動かしたい

Nemotron VoiceChat 11B

音声データを外部APIに送れない(英語)

Nemotron VoiceChat 11B

声やキャラクター設定を柔軟に変えたい(研究用途)

PersonaPlex

全二重会話の研究・比較の土台がほしい

Moshi / PersonaPlex / Nemotron VoiceChat 11B

複雑な質問に正確に答える必要がある

GPT-Live-1 / Gemini 3.8 Live(推論力が高い)

会議・通話のリアルタイム翻訳

Gemini 3.5 Live Translateなどの翻訳特化サービス

導入判断の目安

次の質問に順に答えると、Nemotron VoiceChat 11Bを検討すべきかが絞り込めます。

  1. 会話の言語は英語だけか? → いいえなら、現時点ではホスト型APIを選ぶ
  2. 80GB級GPUを用意できるか(クラウド含む)? → いいえなら、APIを選ぶ
  3. 音声データを外部に出せない、または大量通話でAPI費用が重いか? → はいなら、Nemotron VoiceChat 11Bが有力
  4. 1回の会話は2分程度に収まり、ツールは5個以内か? → はいなら、PoCに進む価値あり
  5. ツールの誤実行を防ぐ検証レイヤーを作れるか? → いいえなら、本番利用はまだ早い

Nemotron VoiceChat 11Bはこんな人におすすめ

おすすめの人

  • 英語の音声エージェントを自社のGPU基盤で動かしたい開発者・研究者
  • 金融・医療・公共など、音声データを外部APIに送れない英語圏向けのサービスを開発しているチーム
  • 全二重会話やツール呼び出しの研究、ファインチューニングの土台となるオープンモデルを探している研究機関
  • 大量の英語通話をさばいており、分単位のAPI課金が重くなっている事業者
  • すでにH100などのGPUを保有しており、遊休リソースを活用したい企業

おすすめしない人

  • 日本語の音声ボット・電話応対を作りたい人
  • 80GB級のGPUを用意できない個人・小規模チーム
  • 複数の声やボイスクローン、ブランド専用の声が必要な人
  • 2分を超える長い通話や、複雑な相談対応を任せたい人
  • 決済や予約確定など、引数の正確さが必須の操作を検証なしで任せたい人
  • 雑音の多いコールセンターや店舗の現場でそのまま使いたい人

日本語のコールセンターでボイスボットを導入する際の進め方は、コールセンターのAI活用で整理しています。

よくある質問(FAQ)

Q. Nemotron VoiceChat 11Bは日本語で使えますか?

使えません。公式のモデルカードとGitHubリポジトリでは対応言語は英語のみとされており、日本語を含む多言語対応の予定も現時点では公式に発表されていません。日本語の音声で試しても、聞き取り・応答ともに実用的な品質にはならないと考えてください。

Q. 無料で試せるWebデモはありますか?

ChatGPTのような一般向けのWebアプリは提供されていません。重みのダウンロードは無料ですが、動かすには80GB以上のGPUを搭載したLinux環境が必要です。手元にGPUがない場合は、クラウドのGPUインスタンスを時間単位で借りて検証するのが現実的です。

Q. 商用サービスに組み込めますか?

Hugging Face上のライセンスOpenMDW 1.1は商用利用を認める寛容なライセンスです。ただしNGCカタログには研究目的向けとの記載もあるため、組み込む前に利用する配布元の最新のライセンス表記を確認してください。英語のみ・ツール実行の成功率33%という性能面の制約も、商用化の判断材料になります。

Q. 「11B」と「12B」はどちらが正しいのですか?

2026年8月にHugging Faceで公開されたのは「NemotronLabs VoiceChat 11B」です。12Bと表記されているのは、2026年3月にEarly Accessとして提供された「Nemotron 3 VoiceChat」です。両者の正確な関係は公式に説明されていないため、ベンチマーク記事を読むときはどちらの評価かを確認するのが確実です。

Q. ファインチューニングして日本語対応にできますか?

ライセンス上は派生モデルの作成が認められていますが、日本語化の手順やレシピは公式から提供されていません。音声エンコーダ・LLM・TTSのすべてを日本語に対応させる必要があり、大量の日本語音声データと計算資源が求められるため、一般企業が独自に取り組むハードルはかなり高いと考えたほうがよいでしょう。

Q. 声を変えたり、自社スタッフの声を再現したりできますか?

できません。Nemotron VoiceChat 11Bの声は固定の1種類で、ボイスクローンにも対応していません。声やペルソナを変えたい研究用途なら同じNVIDIAのPersonaPlexが、商用で複数の声を使いたいならホスト型APIが候補になります。

まとめ

NVIDIA Nemotron VoiceChat 11Bは、全二重の音声会話とライブなツール呼び出しを1つのモデルで実現した、オープンウェイトの音声エージェント基盤です。「初のオープン全二重モデル」ではなく、「ツール呼び出しに対応した初のオープン全二重モデル」である点が正確な位置づけです。

  • 応答遅延は約450msと速く、保留メッセージで沈黙を埋めながら会話中にAPIを呼べる
  • バックボーンはMamba/Transformerハイブリッドのため、ストリーミング処理と相性が良い
  • 一方で英語のみ・声は1種類・会話の文脈は約2分・80GB級GPUが必要
  • ツール選択は82.5%と高精度だが、引数の正解率は42.2%、実行成功率は33%にとどまる
  • ライセンスはOpenMDW 1.1だが、配布元によって研究目的向けの記載もあり、商用利用前の確認が必要

現時点では「英語圏向けに、データを外部に出さない音声エージェントを自前で作りたいチーム」のための研究・PoC向けモデルです。日本語の音声AIを業務に入れたいなら、まずはGPT-LiveやGemini 3.8 Liveを比較検討し、Nemotron VoiceChatは今後の多言語対応や精度向上を見守るのが現実的な選び方です。

要件が固まっていない段階からご相談いただけます(初回相談無料)

開発について相談する

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

経理・事務作業・開発を、AI革命にまとめて任せられます

ご相談は無料です。オンラインで完結します