AIツール2026年9月更新

Gemini 3.8 Liveとは?Extended Thinkingとの違い・音声AI性能82.6の実力・料金・使い方を解説【2026年9月速報】

公開日: 2026/09/24
Gemini 3.8 Liveとは?Extended Thinkingとの違い・音声AI性能82.6の実力・料金・使い方を解説【2026年9月速報】

この記事のポイント

Gemini 3.8 Liveは、Googleが2026年9月15日に発表したリアルタイム音声対話モデルです。上位版Extended Thinkingとの違い、82.6というスコアの正しい読み方、API料金の円換算、日本で使える場所、開発時の制約まで公式情報をもとに整理します。

Gemini 3.8 Liveは、Googleが2026年9月15日(米国時間)に発表した、声で聞いて声で返すリアルタイム音声対話用のAIモデルです。 同時に出た「Gemini 3.8 Live Extended Thinking」は考えながら話す上位版で、話題の「82.6」はこの上位版(High設定)のスコアです。無印の3.8 Liveは76.0なので、同じ数字として扱わないよう注意してください。

この記事でわかること

  • Gemini 3.8 Live と 3.8 Live Extended Thinking の違いと使い分け
  • 「音声AI性能82.6」が何を意味し、競合とどれくらい差があるのか
  • API料金(円換算の試算つき)と、Geminiアプリ・Gmailなどで使うときのプラン条件
  • 日本から使える場所・使えない場所
  • 開発者が知っておくべき制約と、Gemini 3.1 Flash Liveからの移行時の注意点

この記事の対象読者

  • Geminiアプリの音声会話(Gemini Live)が新しくなって気になっている人
  • 音声ボット・コールセンター・音声アシスタントの開発や導入を検討している企業や開発者
  • GPT-Live-1やGPT-Realtime-2など、他社の音声モデルと比べたい人

Gemini全体の概要を先に押さえたい場合は、Geminiとは?機能・料金・使い方もあわせて参照してください。


Gemini 3.8 Liveとは?リアルタイム音声対話向けの「音声→音声」モデル

Gemini 3.8 Liveは、音声をいったん文字に起こさずに直接理解し、そのまま音声で返すネイティブな音声→音声(speech-to-speech)モデルです。Googleは「規模とコスト効率を重視し、会話の知能・流れるような対話・視覚的な文脈理解を組み合わせたモデル」と説明しています。

基本情報は次のとおりです。

項目

内容

発表日

2026年9月15日(米国時間)

開発元

Google(Google DeepMind)

モデルファミリー

Gemini 3.8 Audio(Live / Live Extended Thinking / Flash TTS / Flash-Lite TTS の4種)

ベース

Gemini 3 Pro から派生(モデルカードより)

モデルID

gemini-3.8-live / gemini-3.8-live-extended-thinking

APIのステータス

両モデルとも Stable(一般提供)

入力

テキスト・画像・音声・動画(カメラ映像や画面共有)

出力

テキスト・音声(Live Avatar利用時は映像も)

コンテキスト

入力 約13万トークン(131,072)/ 出力 約6.5万トークン(65,536)

対応言語

発表時点で97言語(日本語を含む)・自動言語検出

ナレッジカットオフ

2025年1月

前モデル

Gemini 3.1 Flash Live(2026年3月リリースのプレビュー版)

Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingの発表ビジュアル

出典: Google公式ブログ(Gemini 3.8 Live 発表記事)

前モデルのGemini 3.1 Flash Liveについて、Googleの公式モデルページは「ほとんどの低遅延音声エージェントではGemini 3.8 Liveへの移行を推奨」と明記しています。つまり、GoogleのリアルタイムAPIで音声対話を作るなら、現時点ではこの3.8 Liveが標準の選択肢です。

なお、同日には文字起こし専用のGemini 3.5 Transcribeも発表されています。会話ではなく「録音をテキストにしたい」用途ならそちらが候補になります。テキスト中心の作業には同世代のGemini 3.8 Flashが向いています。


Gemini 3.8 Live と Extended Thinking の違い

Gemini 3.8 Audio(Live・Live Extended Thinking)のモデルカード

出典: Google DeepMind 公式モデルカード(Gemini 3.8 Audio)

3.8 Liveは「速くて安い標準モデル」、Extended Thinkingは「考えながら話す推論強化版」です。API料金は同じなので、選ぶ基準は料金ではなく「会話の速さを取るか、複雑な作業の正確さを取るか」になります。

比較項目

Gemini 3.8 Live

Gemini 3.8 Live Extended Thinking

位置づけ

低遅延・コスト効率重視の標準モデル

複雑・多段階タスク向けの推論強化版

モデルID

gemini-3.8-live

gemini-3.8-live-extended-thinking

思考レベルの指定

非対応(指定しない)

low / medium / high を指定可能

関数呼び出し

非同期(既定)・同期の両方

非同期のみ(同期指定はエラー)

API料金

同額

同額

品質指数(Artificial Analysis)

76.0

82.6(1位) ※High設定

応答開始までの時間(同計測)

約1.18秒

約1.35秒

入力音声1時間あたりのコスト目安(同計測)

約$0.84

約$3.50(High)

Google製品での搭載先

Search Live(Google検索のAIモード)

Gemini Live(Geminiアプリ)、Gmail / Docs / KeepのLive機能

Gemini Enterpriseでの提供

Live Avatarとあわせて一般提供(2026年9月下旬)

プライベートプレビュー

※品質指数・遅延・1時間あたりコストは第三者評価機関 Artificial Analysis の計測値(2026年9月25日時点)。

Extended Thinkingの「考えながら話す」とは

Extended Thinkingは、推論の処理と発話を並行して走らせるのが特徴です。たとえば「予約を確認しますね…空きがあるのは木曜の15時です」のように、作業の途中経過を声で伝えながら多段階の処理を進めます。従来の推論モデルのように、長い沈黙のあとで一気に答えるのとは体験が異なります。

同じ料金でも1時間あたりのコスト目安が約4倍になるのは、推論に使うトークンが増えるためと考えられます。単価が同じでも、使えば使うほど差がつく点は押さえておきましょう。

どっちを選ぶ?用途別の目安

用途

おすすめ

理由

受付・一次対応・FAQ応答

3.8 Live

応答が速く、コストが低い

雑談・語学の会話練習

3.8 Live

自然なテンポが重要。人による好み評価でも無印が上

リアルタイム通訳の補助

3.8 Live

速さ優先。専用ならGemini 3.5 Live Translateも候補

予約変更・手続き・本人確認を伴う案内

Extended Thinking

複数のツールを順番に使う作業で成功率が高い

社内システムを調べながら答えるヘルプデスク

Extended Thinking

検索や照会を挟みつつ筋道立てて回答できる

画面を見せながらの技術サポート

Extended Thinking

画面の内容と手順を組み合わせた推論が必要

判断に迷ったら、「会話のテンポが命なら無印、作業の完了が命ならExtended Thinking」と覚えておくと選びやすいです。


音声AI性能「82.6」の実力|何のスコアで、どれくらいすごいのか

82.6は、Artificial Analysisが公開している「Speech to Speech Quality Index(音声→音声 品質指数)」でExtended Thinking(High設定)が記録したスコアで、2026年9月25日時点で同指標の1位です。ただし2位との差は1.1ポイントの僅差で、「圧倒的な1位」ではありません。

82.6は「正答率82.6%」ではない

この指数は、音声での推論力・エージェントとしての作業性能・人が聞き比べたときの好まれ度・タスク成功率などを重み付けして合成した値です。100問中82.6問正解という意味ではないため、「82.6%」と書かれている記事は正確ではありません。

主要音声モデルとの比較(Artificial Analysis、2026年9月25日時点)

モデル

提供元

品質指数

音声推論

応答開始(秒)

入力音声1時間あたり

Gemini 3.8 Live Extended Thinking(High)

Google

82.6

98%

1.35

$3.50

GPT-Live-1(Astra, medium)

OpenAI

81.5

90%

1.34

$5.83

Grok Voice Think Fast 2.0 High

SpaceXAI

81.3

97%

0.70

$4.80

GPT-Live-1(Sol, low)

OpenAI

80.1

89%

1.24

$4.47

Gemini 3.8 Live

Google

76.0

92%

1.18

$0.84

GPT-Realtime-2(High)

OpenAI

73.6

97%

1.14

$4.14

Gemini 3.1 Flash Live High

Google

71.5

97%

2.99

$1.75

※リーダーボードは随時更新されます。最新値はArtificial Analysis 公式で確認してください。

品質・速さ・コストのどれを重視するかで、選ぶべきモデルははっきり分かれます。

  1. 品質の首位はExtended Thinkingだが、上位3モデルはほぼ横並び。差より、自社の用途での聞こえ方や応答の正確さを試すほうが重要です。
  2. 速さではGrok Voiceが突出。応答開始が約0.7秒と、Geminiの約半分です。
  3. コストでは無印の3.8 Liveが圧倒的に安い。1時間あたり約$0.84は、上位モデルの4分の1〜7分の1程度です。品質76.0はGPT-Realtime-2(73.6)より高く、コストパフォーマンスは突出しています。

OpenAIの音声モデルについてはGPT-Realtime-2とはで詳しく解説しています。

公式ブログが示したその他のベンチマーク

ベンチマーク

Extended Thinkingのスコア

何を測るか

τ-Voice(エージェントタスク完了率)

68.6%

音声で依頼された業務タスクを最後までやり切れるか

Sierra τ-Voice-banking

35.1%

銀行業務を想定した難度の高いタスク

Big Bench Audio

97.7%

音声で出された問題への推論力

Speech Agent Arena

2位

人による音声エージェントの比較評価(9to5Google報道)

注意:無印の3.8 Liveは「作業」では旧モデルに負ける場面がある

見落とされがちなのが、無印3.8 Liveのエージェント性能です。DataCampの整理によると、τ-Voiceのタスク完了率は無印3.8 Liveが30.1%、前モデルの3.1 Flash Liveが37.7%で、無印は旧モデルを下回っています。

一方で、人による好まれ度(Arena Elo)では無印が1083、Extended Thinkingが990と、会話の心地よさでは無印のほうが高評価です(Developers Digest調べ)。「無印=会話向け、Extended Thinking=作業向け」という使い分けは、数字の面からも裏付けられています。

また、日本語の音声品質を個別に示す公式データは現時点で公開されていません。ベンチマークは主に英語での評価と考え、日本語で使う場合は必ず実際に試してから判断してください。


Gemini 3.8 Liveでできること

Gemini 3.8 Live with Live Avatarの発表ビジュアル

出典: Google公式ブログ(Live Avatar 発表記事)

3.8 Liveの目玉は、会話を止めずに裏でツールを動かせる「非同期関数呼び出し」です。これに加えて、多言語対応・映像の理解・生成音声への透かしなど、音声エージェントを作るための機能がそろっています。

機能

内容

実務での使いどころ

非同期関数呼び出し

会話を続けながら裏でAPIや検索を実行し、結果が出たら会話に反映

在庫照会や予約確認中も「少々お待ちください」で無音にならない

考えながら話す(Extended Thinkingのみ)

推論と発話を並行し、途中経過を声で伝える

多段階の手続き案内、トラブルシューティング

97言語対応・自動言語検出

会話の途中で言語が切り替わっても追従

訪日客対応、多言語コールセンター

視覚的な文脈理解

カメラ映像や画面共有をほぼリアルタイムに理解

画面を見ながらの操作サポート、現場作業の支援

英数字の聞き取り精度

コード・番号・技術データを正確に扱う

注文番号・型番・郵便番号の確認

Google検索グラウンディング

検索結果をもとに回答

ナレッジカットオフ(2025年1月)以降の情報を補う

能動的な音声応答

話しかけられた内容が自分宛てかを判断して応答(常時有効)

周囲の雑音や独り言への誤反応を抑える

SynthID透かし

生成した音声(Live Avatarでは映像も)に不可視の透かしを埋め込む

なりすまし・ディープフェイク対策

Live Avatar(Enterprise)

口の動きを合わせたアバター映像を24FPSで生成

顔の見える接客・受付・案内

発表時のデモでは、手書きのスケッチを見せながら会話し、そのままコードを生成する使い方も紹介されました(GIGAZINE等の報道より)。

企業での導入事例(Google Cloud公式ブログより)

  • Cox Automotive:自動車販売サイトAutotraderの買い物アシスタントに採用。画面上の該当箇所をハイライトしながら、車両検索ツールと連携して案内
  • Equal AI:インドの9言語で、1日100万件を超える通話を処理
  • Salesforce:Agentforceとの連携
  • Specs:発話区間の検出と応答遅延の改善に活用

音声で動く「AIエージェント」の考え方そのものを知りたい場合は、AIエージェントとはが参考になります。


Gemini 3.8 Liveの強み

強みは「低コスト」「応答の速さ」「2モデルの使い分け」「Google製品との統合」の4点です。

1. 圧倒的なコストパフォーマンス

入力音声1時間あたり約$0.84(Artificial Analysis計測)は、主要な音声モデルの中で最安クラスです。品質指数76.0を確保しながらこの価格なので、1日に大量の通話をさばく用途では有力な選択肢になります。

2. 前モデルから大幅に速くなった

応答開始までの時間は、3.1 Flash Live(High)の約2.99秒から約1.18秒へと、約6割短縮されました(Artificial Analysis計測、Developers Digest集計)。2秒以上の沈黙は電話応対では「つながっていない」と感じられやすいため、実用性が大きく変わる改善です。

3. 用途に応じて2モデルを同じ料金で使い分けられる

同じAPI・同じ料金で、速さ重視の無印と推論重視のExtended Thinkingを切り替えられます。受付は無印、手続きはExtended Thinkingのように、ひとつのサービス内で使い分ける設計も可能です。

4. Googleのサービスにすでに組み込まれている

Geminiアプリ、Google検索、Gmail、Docs、Keepと、普段使うサービスに組み込まれ始めています。開発者でなくても、スマホから新モデルの会話を体験できます。


Gemini 3.8 Liveの弱み・制約

弱みは「セッション時間の短さ」「API機能の制限」「日本語での提供範囲の狭さ」です。導入前に必ず確認してください。

API側の制約

制約

内容

セッションの上限

音声のみ15分、音声+映像は2分。1接続あたり約10分

長時間化の方法

コンテキストウィンドウ圧縮とセッション再開(再開トークンは終了後2時間有効)を組み合わせる

非対応機能(両モデル)

コンテキストキャッシュ、コード実行、File Search、画像生成、構造化出力、URL context、Googleマップ グラウンディング、Batch API

Extended Thinkingの関数呼び出し

非同期のみ。同期(BLOCKING)を指定するとエラー

感情に合わせた対話

前モデルにあったAffective dialogは削除

Live Avatar

連続対話は「数分程度」が想定。カスタムアバターは許可リスト制で審査あり

特に構造化出力とBatch APIが使えない点は要注意です。通話内容をJSONで整理して社内システムに流す、といった処理は、別のモデル(Gemini 3.8 Flashなど)で後処理する構成が必要になります。

品質面・利用面の制約

  • 無印はエージェント作業が苦手:τ-Voiceで旧モデルを下回るため、手続き系には向きません
  • Extended Thinkingはやや遅い:応答開始は無印より約0.17秒遅く、人による好まれ度も無印より低めです
  • ナレッジが古い:学習データは2025年1月までのため、最新情報には検索グラウンディングが必要です
  • 既知の限界:モデルカードでは、ハルシネーション(事実と異なる回答)、脱獄への耐性がまだ改善途上であること、ときどき応答が遅い・タイムアウトすることが明記されています
  • 言語数の表記ゆれ:発表では97言語ですが、Live APIの概要ページには「70言語」表記が残っています(2026年9月25日時点)
  • Gmail Liveは英語のみ:公式ヘルプに明記されています

Gemini 3.8 Liveの料金・プラン

API料金は2モデルとも同じで、音声入力は約$0.005/分、音声出力は約$0.018/分です。GeminiアプリのGemini LiveやGoogle検索のSearch Liveは、一般ユーザーなら追加料金なしで使えると報じられています(ITmedia NEWS)。

Gemini APIの料金(従量課金・2モデル共通)

区分

入力(100万トークンあたり)

出力(100万トークンあたり)

テキスト

$0.75

$4.50

音声

$3.00(約$0.005/分)

$12.00(約$0.018/分)

画像・動画

$1.00(約$0.002/分)

—

出典:Gemini API 料金ページ(2026年9月25日確認)

Gemini APIの料金ページ

出典: Google AI for Developers 公式サイト

公式の料金ページでは、両モデルとも無料枠(Free tier)ありと記載されています。ただし無料枠のレート制限の具体値は確認できなかったため、Google AI Studioで試しながら確認してください。

円換算の試算(1ドル=150円で計算)

ケース

ドル

円換算の目安

入力音声1時間(3.8 Live、AA計測)

約$0.84

約126円

入力音声1時間(Extended Thinking High、AA計測)

約$3.50

約525円

参考:入力音声1時間(GPT-Live-1 Astra、AA計測)

約$5.83

約875円

10分の通話1件(3.8 Live、Developers Digest試算)

約$0.23

約35円

10分の通話を月1,000件(同試算ベース)

約$230

約3.5万円

※為替レートは試算用の仮定値です。実際の請求額は、会話の長さ・発話の比率・会話履歴の蓄積量・思考レベルの設定によって変わります。10分通話の金額は第三者(Developers Digest)による試算例です。

なお、「前モデルの3.1 Flash Liveと同価格」とする報道もありますが、3.1 Flash Liveの単価は公式ページで直接確認できていません。Artificial Analysisの1時間あたりコストでも両者に差(3.1 Flash Live 約$1.75、3.8 Live 約$0.84)があるため、移行時は自社の実際の通話で費用を比較するのが確実です。

企業向けのGemini Enterprise Agent Platform経由の料金はGoogle Cloudの料金ページで確認でき、プロビジョンドスループット(処理枠の予約)は営業への問い合わせとなっています。

Googleのサービスで使う場合のプラン条件

サービス

搭載モデル

必要なプラン

日本語

Gemini Live(Geminiアプリ)

Extended Thinking(順次展開)

一般ユーザーは追加料金なし(ITmedia報道)。Extended Thinkingに有料プランが必要かは公式で未確認

対応

Search Live(Google検索のAIモード)

3.8 Live

追加料金なし(ITmedia報道)

日本でもSearch Live自体は提供中との報道あり。3.8 Liveへの切替時期は未公表

Gmail Live

Extended Thinking

個人はGoogle AI Plus / Pro / Ultra。仕事・学校アカウントは対象Workspaceプラン+管理者によるGemini Betaの有効化

英語のみ(公式ヘルプ)

DocsのLive機能

Extended Thinking

Google AI Pro / Ultra

未確認

KeepのLive機能

Extended Thinking

Google AIの有料プラン(Plus以上との報道。公式で最終確認できず)

未確認

Gemini Enterprise

3.8 Live+Live Avatar

企業契約

要確認(日本リージョンの有無も未確認)

Gmail LiveはAndroidスマホとiPhoneのみの対応で、Androidタブレットでは使えません。WorkspaceのGemini機能の全体像はGemini Workspace Intelligenceとはで整理しています。


Gemini 3.8 Liveの使い方

一般ユーザーはGeminiアプリから、開発者はGoogle AI StudioとLive APIから使い始めるのが基本です。

一般ユーザー:GeminiアプリのGemini Liveで話す

  1. スマホのGeminiアプリを最新版に更新する
  2. 入力欄の横にあるLiveボタン(音声波形のアイコン)をタップする
  3. そのまま話しかける。カメラや画面共有をオンにすれば、見せたものについて質問できる
Google Gemini公式サイトのビジュアル

出典: Google Gemini 公式サイト

Extended Thinkingは段階的に展開中のため、同じアプリでも利用者によって反映時期が異なります。Google検索のAIモードからSearch Liveを使う方法もあります。

開発者:Google AI Studioで試してからLive APIへ

  1. Google AI Studioで試す:ai.studio/live を開き、モデルに gemini-3.8-live または gemini-3.8-live-extended-thinking を選んでマイクで会話する
  2. APIキーを発行する:Google AI StudioでAPIキーを作成する
  3. SDKで接続する:Python / JavaScriptのSDKからLive API(WebSocket通信)に接続する。音声は入力16bit PCM・16kHz、出力16bit PCM・24kHz。画像入力はJPEGで最大毎秒1枚
  4. ツールを登録する:関数呼び出し用のツール(在庫照会、予約APIなど)を定義する。既定は非同期実行
  5. Extended Thinkingを使う場合:thinking_config で思考レベル(low / medium / high)を指定する
Google AI StudioのGemini Audio(ai.studio/live)告知ビジュアル

出典: Google公式ブログ(開発者向け Gemini Audio 記事)

公式ブログでは、Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel、Vision Agentsといった外部フレームワークとの連携が紹介されています。Google Cloud側ではADK(Agent Development Kit)を使えます。GitHubの公式サンプルや、AIコーディングエージェント向けの「Live API skill」も公開されています。

企業:Gemini Enterprise Agent Platformで導入する

企業向けには、Gemini Enterprise Agent PlatformのAgent Platform Studioからマルチモーダルな音声対話を構築できます。2026年9月下旬(Google公式ブログは24日、Cloud Blogは25日付)には、3.8 LiveとLive Avatarの組み合わせがGemini Enterpriseで一般提供になりました。US / EUのエンドポイントとプロビジョンドスループットに対応しています。Extended Thinkingは企業向けではまだプライベートプレビューです。

基盤の詳細はGemini Enterprise Agent Platformとはを参照してください。

Gemini 3.1 Flash Liveからの移行チェックリスト

前モデルから切り替える場合、設定をそのまま流用すると動かない箇所があります。

  • ☐ モデル文字列を gemini-3.8-live(または gemini-3.8-live-extended-thinking)に変更した
  • ☐ 無印3.8 Liveには thinking_level / thinking_config を渡していない
  • ☐ Extended Thinkingの思考レベルは low / medium / high のいずれか(MINIMALは使えない)
  • ☐ enable_affective_dialog と proactivity のパラメータを削除した
  • ☐ Extended Thinkingでは関数呼び出しを同期(BLOCKING)にしていない
  • ☐ 1回のリクエスト中にモデルが複数回話す前提で、ターン終了の判定ロジックを見直した(turnComplete だけで待機状態と判断しない)
  • ☐ セッション上限(音声15分・映像2分)に備え、圧縮とセッション再開を実装した

旧モデルの gemini-3.1-flash-live-preview と gemini-2.5-flash-native-audio-preview-12-2025 は廃止日が未発表ですが、置き換え先は gemini-3.8-live とされています。最新の廃止スケジュールは公式の非推奨ページで確認してください。


安全に使うための注意点

音声AIは、テキストのチャットよりも「聞き間違い」と「なりすまし」のリスクが大きくなります。導入時は次の点を押さえておきましょう。

  • APIキーをアプリに埋め込まない:ブラウザやスマホアプリからLive APIに直接つなぐ構成では、公式が推奨するエフェメラルトークン(短時間だけ有効なトークン)を使う
  • 決済・解約など取り消せない操作には確認を挟む:非同期関数呼び出しは会話と並行して処理が走るため、「この内容で確定してよろしいですか」と声で確認してから実行する設計にする
  • 番号・固有名詞は復唱する:英数字の精度は向上していますが、電話番号や注文番号は復唱して確認する
  • 通話の録音・AI対応を利用者に伝える:録音やAIによる応対であることを事前に案内する
  • SynthIDを活用する:生成された音声には不可視の透かしが入るため、自社の音声がなりすましに悪用された際の判定材料になる
  • Gmail Liveの設定を確認する:利用には「Google Workspaceのスマート機能」「他のGoogleサービスのスマート機能」の有効化が必要です。メールの内容をAIが扱う前提なので、業務アカウントでは社内の情報管理ルールを確認してください

なお、GoogleはフロンティアAIの安全性評価について、今回のモデルは危険な能力の基準(Critical Capability Level)には達しない見込みとしています。


他の音声AIとの違い

コストの安さならGemini 3.8 Live、品質の首位はExtended Thinking、速さならGrok Voice、OpenAIの環境に合わせるならGPT-Live-1という棲み分けです。

比較項目

Gemini 3.8 Live

Gemini 3.8 Live Extended Thinking

Gemini 3.1 Flash Live

GPT-Live-1(Astra)

Grok Voice Think Fast 2.0

品質指数

76.0

82.6

71.5

81.5

81.3

応答開始

約1.18秒

約1.35秒

約2.99秒

約1.34秒

約0.70秒

1時間あたり

約$0.84

約$3.50

約$1.75

約$5.83

約$4.80

強み

低コスト・会話の自然さ

推論・作業の完了率

—

品質が首位と僅差

圧倒的な応答の速さ

選ぶ場面

大量の通話・一次対応

手続き・複雑な案内

新規採用は非推奨(移行推奨)

OpenAI中心の開発環境

速さ最優先の対話

※数値はArtificial Analysis計測(2026年9月25日時点)。各社の公式料金は各社サイトで確認してください。

ChatGPTとGeminiのサービス全体の違いはChatGPTとGeminiの違いで比較しています。


Gemini 3.8 Liveはこんな人におすすめ

こんな人におすすめ

おすすめしない人

音声ボット・コールセンター・音声アシスタントを開発している

15分を超える連続セッションを、再接続処理なしで単純に作りたい

低コストで大量の通話をさばきたい企業

構造化出力やBatch APIが必須の業務(別モデルでの後処理が必要)

多言語の電話・窓口対応を自動化したい

日本語でGmail Liveを使いたい人(現時点で英語のみ)

Geminiアプリで自然な音声会話を試したい個人

文章作成や資料作りなどテキスト中心の用途(→ Gemini 3.8 Flash向き)

画面や映像を見せながらサポートするサービスを作りたい

日本語品質の公式保証が必要な、失敗が許されない業務にいきなり本番投入したい

3.1 Flash Liveを使っていて、遅延に不満がある

1秒未満の応答速度が絶対条件(→ Grok Voiceなども比較対象)


よくある質問(FAQ)

Q. Gemini 3.8 Liveは日本語で使えますか?

はい。発表では日本語を含む97言語に対応し、会話の途中で言語が変わっても自動で追従するとされています。GeminiアプリのGemini Liveは日本語で利用できます。ただし、Gmail Liveは公式ヘルプで英語のみと明記されており、Docs・KeepのLive機能の日本語対応は未確認です。

Q. 無料で使えますか?

GeminiアプリのGemini LiveとGoogle検索のSearch Liveは、一般ユーザーなら追加料金なしで使えると報じられています。APIも料金ページ上は無料枠ありですが、本番運用ではレート制限の確認と従量課金の設定が必要です。

Q. 自分のGeminiアプリがExtended Thinkingになっているか分かりますか?

Googleは段階的にロールアウトしているため、反映時期は利用者ごとに異なります。アプリを最新版に更新したうえで、多段階の質問をしたときに「確認しますね」など途中経過を話しながら答えるかどうかが一つの目安になります。

Q. 3.1 Flash Liveはいつ使えなくなりますか?

2026年9月25日時点で廃止日は発表されていません。ただし公式はほとんどの用途で3.8 Liveへの移行を推奨しているため、新規開発では3.8 Liveを選ぶのが無難です。

Q. 生成された音声がAIだと判別できますか?

Gemini 3.8 Liveが生成した音声には、GoogleのSynthIDによる不可視の透かしが埋め込まれます。耳では区別できませんが、検出ツールで判別できる仕組みです。

Q. 日本の企業がLive Avatarを使えますか?

Live AvatarはGemini Enterpriseで一般提供されていますが、エンドポイントはUS / EUです。日本リージョンの有無やデータの保存場所は公式に確認できていないため、個人情報を扱う場合はGoogle Cloudの営業窓口で要件を確認してください。


まとめ

  • Gemini 3.8 Liveは、2026年9月15日にGoogleが発表したリアルタイム音声対話モデル。速さと低コストが持ち味で、品質指数は76.0
  • Extended Thinkingは考えながら話す上位版。「82.6」はこちらのHigh設定のスコアで、2位とは1.1ポイント差の僅差の首位
  • API料金は2モデル共通で、音声入力約$0.005/分・出力約$0.018/分。入力音声1時間あたりの目安は無印で約126円(1ドル150円換算)
  • 使い分けは「会話のテンポなら無印、作業の完了ならExtended Thinking」。無印はエージェント作業で旧モデルを下回る点に注意
  • セッションは音声15分・映像2分が上限。構造化出力やBatch APIは使えない
  • 日本語はGemini Liveで利用可能。Gmail Liveは英語のみ。企業向けにはLive AvatarとあわせてGemini Enterpriseで一般提供が始まった

まずはGoogle AI Studioで両モデルを日本語で話し比べ、自社の用途で「速さ」と「作業の正確さ」のどちらが重要かを確かめるのがおすすめです。Geminiシリーズ全体の中での位置づけを知りたい場合は、Geminiとはもあわせてご覧ください。

このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します

業務を1つ送る

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

経理・事務作業・開発を、AI革命にまとめて任せられます

ご相談は無料です。オンラインで完結します