Gemini 3.8 Flash TTSとは?30秒で声をクローン・2,000種の音声・料金・日本語対応・使い方【2026年9月】

この記事のポイント
Gemini 3.8 Flash TTSは、Googleが2026年9月に公開したテキスト読み上げ専用AIモデルです。30秒前後の音声から作る声のクローン、2,000種以上の音声ライブラリ、2027年に2倍になる料金、日本語対応、AI Studioでの使い方、ElevenLabsとの違いまで、導入判断に必要な情報をまとめました。
Gemini 3.8 Flash TTSは、Google DeepMindが2026年9月23日(米国時間)に発表したテキスト読み上げ(TTS)専用のAIモデルです。入力したテキストを、スタジオ品質のナレーションや2人の掛け合い音声にしてくれます。声は既製の音声から選ぶほか、文章で説明して新しく作ったり、本人の同意を得たうえで短い録音から声を再現(クローン)したりできます。
無料枠があり、有料でも2026年内は1時間の音声あたり約0.8ドル(目安)で使えますが、2027年1月1日から料金は2倍になります。日本語にも対応しており、Google AI Studioからすぐに試せます。
ナレーション制作・オーディオブック・ゲームの音声・電話の自動応答などでAI音声を使いたい開発者、クリエイター、企業の担当者に向けて、同時に出たFlash-Lite TTSとの違い、料金の試算、声のクローン手順、ElevenLabs・OpenAIとの違い、権利面の注意点までまとめました。
ポイント | 要点 |
|---|---|
何か | Googleのテキスト→音声専用モデル。Gemini API / Google AI Studioで提供中 |
目玉機能 | 10〜30秒の本人音声+同意録音で声を再現できる「ボイスレプリケーション」、文章から声を作る「ボイスデザイン」 |
料金 | 無料枠あり。有料は音声出力100万トークンあたり$9(2026年内)→$18(2027年1月〜) |
日本語 | 対応。日本語の同意文も用意されている |
おすすめな人 | 長尺ナレーション、キャラクター音声、多言語コンテンツを低コストで作りたい人 |
おすすめしない人 | リアルタイム音声会話が作りたい人、Google Cloud(Vertex AI)経由での利用が前提の企業 |
Gemini 3.8 Flash TTSとは|Googleのテキスト読み上げ専用モデル

Gemini 3.8 Flash TTSは、テキストだけを入力として受け取り、音声だけを出力する読み上げ専用モデルです。チャットやコード生成をするGeminiとは別系統で、「台本を人間らしく演じて読む」ことに特化しています。
同じ日に、軽量版のGemini 3.8 Flash-Lite TTSも発表されました。2つのモデルの関係は次のとおりです。
項目 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
モデルコード |
|
|
位置づけ | 最上位。スタジオ品質・演技表現・長尺での安定性重視 | 高スループット・低遅延・低コスト重視 |
公式が挙げる用途 | オーディオブック、ナレーション、複雑な掛け合い、ゲーム、ポッドキャスト | 大量生成、リアルタイム音声エージェント、吹き替え |
対応言語 | 130言語(日本語含む) | 101言語(日本語含む) |
旧モデルとの関係 | 新設の最上位ティア |
|
入力上限 / 出力上限 | 8,192トークン / 16,384トークン | 8,192トークン / 16,384トークン |
公式ブログでは総称として「100以上の言語と方言」に対応すると説明されています。モデルごとの対応言語数は、Gemini APIのモデルページの記載(Flash 130言語、Flash-Lite 101言語)を参照するのが確実です。
どこで使えるか
現時点(2026年9月28日)の提供先は、利用者のタイプによって分かれます。
利用者 | 提供先 | 状況 |
|---|---|---|
開発者 | Gemini API / Google AI Studio | 提供中。AI Studioの音声生成画面で試せる |
一般ユーザー | Gemini Notebook(Flash TTS)、Google Vids(Flash-Lite TTS) | 順次展開中 |
企業 | Gemini Enterprise | 公式では「近日提供」 |
外部プラットフォーム | Vercel AI Gateway、OpenRouter など | 提供開始 |
Google Cloud | Cloud Text-to-Speech(Vertex AI) | 公式ドキュメントに3.8はまだ掲載されていない |
公式ブログでは、Figma、HeyGen、Wondercraft、LiveKit、Pipecat、Agoraなどのパートナーも紹介されています。音声エージェント基盤やクリエイティブツール経由で、間接的に使う機会も増えていく見込みです。
同世代のテキスト生成モデルについてはGemini 3.8 Flashとは、Gemini全体の位置づけはGeminiとはで整理しています。
Gemini 3.8 Flash TTSでできること
主にできることは、「声を選ぶ・作る」「演技を細かく指示する」「長い音声を安定して作る」の3つです。
声の選び方は4種類
これまでのGemini TTSとの一番の違いは、声の選択肢が大きく広がった点です。
声の選び方 | 内容 | 向いている用途 |
|---|---|---|
プリビルト音声 | Kore、Puck、Charon、Zephyr、Fenrirなど30種類の名前付き音声 | すぐ試したい、2人の掛け合いを1回で作りたい |
拡張ボイスライブラリ | 公式発表で2,000種以上。言語・地域・性別・ピッチ・ペルソナ・用途で絞り込める | ナレーター役やキャラクター役を大量の候補から探したい |
ボイスデザイン | 「落ち着いた30代の関西弁の女性ナレーター」のような文章から新しい声を作る。IDとサンプル音声が返り、再利用できる | ブランド専用の声、ゲームのキャラクター |
ボイスレプリケーション(声のクローン) | 話者本人の短い録音から声質を再現する | 自分の声でのナレーション、本人公認の声の量産 |
「2,000種以上」は公式ブログでの表現です。APIドキュメントでは拡張ライブラリについて「数百の追加音声」という書き方もされているため、言語によって選べる数には差があると考えておくのが無難です。
1行ごとの演技指示と音声タグ
台本の1行ごとに、話すペース・感情・アクセント・方言の切り替えを指示できます。さらに文中に次のようなタグを入れると、笑い声やため息などの非言語音も入れられます。
<laugh>(笑い)、<chuckle>(含み笑い)、<sigh>(ため息)<breath>(息づかい)、<gasp>(息をのむ)、<cough>(咳)<short pause>/<long pause>(間)<growl>(うなり声)、<scream>(叫び)
相づち(バックチャネル)も台本で指定できるため、ポッドキャスト風の自然な会話が作りやすくなっています。
2人の掛け合いと長尺ナレーション
プリビルト音声を使う場合、1回のリクエストで最大2人の掛け合いを生成できます。また、数分〜数時間のナレーションでも、声の同一性・音色・音量・部屋鳴りが途中で崩れにくい(ボイスドリフトが起きにくい)点が強調されています。オーディオブックのような長尺用途を意識した設計です。
出力フォーマット
通常のリクエストではWAV(24kHz・モノラル・16bit PCM)が既定です。ストリーミング時はヘッダなしのLinear PCMで返り、電話向けのmu-law / A-lawにも対応しています。IVR(電話の自動音声応答)の音声素材を作る用途でも扱いやすい仕様です。
できないこと
一方で、次のことはできません。
- 音声の入力・リアルタイム会話:Live APIには非対応です。ユーザーと声でやり取りするAIを作るなら、Gemini 3.8 Liveのような別モデルを使います
- 関数呼び出し・検索・Thinking・構造化出力:いずれも非対応です
- 音声→テキスト:文字起こしはGemini 3.5 Transcribe、音声翻訳はGemini 3.5 Live Translateの担当です
- ボイスリミックス:音色・ピッチ・話速・アクセントを後から調整する機能は「近日提供」で、現時点では使えません
30秒で声をクローンする「ボイスレプリケーション」の仕組み
声のクローンは、10〜30秒の本人の音声と、同じ人が読み上げた「同意文」の録音の2つがそろって初めて作れます。「30秒あれば誰の声でもコピーできる」機能ではありません。
公式ブログでは「30秒の音声サンプル」と説明されていますが、公式ドキュメント上の参照音声の目安は10〜30秒です。必要なものは次の2点です。
素材 | 内容 | ポイント |
|---|---|---|
参照音声 | 話者本人の自然な発話 10〜30秒 | 雑音の少ない環境で録る。推奨は24kHz・モノラル・16bit WAV |
同意音声 | 同じ話者が所定の同意文を読み上げた録音 | システムが参照音声と同一人物かを照合する |
日本語の同意文は、公式ドキュメントで次のように定められています。
私はこの音声の所有者であり、Googleがこの音声を使用して音声合成モデルを作成することを承認します。
同意文は日本語を含む30言語で用意されています。報道では、参照音声と同意音声の話者が一致しないとクローンを作成できない仕組みだと説明されています。
作った声の保存方法と期限
作成した声は、保存方法によって扱いが変わります。運用設計に直結するため、導入前に把握しておきたい項目です。
保存方式 | 返ってくるもの | 上限・期限 |
|---|---|---|
ステートフル(既定) | 永続的な | 1プロジェクトあたり最大200音声、保持期間1年 |
ステートレス | 暗号化された | 有効期限7日 |
「1年で失効する」点は見落としやすいポイントです。ナレーターの声を長期で使う場合は、参照音声と同意音声の元データを自社で保管し、作り直せる状態にしておくと安心です。
日本から使えるか
AI Studioでのボイスレプリケーションは、米イリノイ州・テキサス州、EEA(欧州経済領域)、英国、スイス、インドでは利用できないと複数のメディアが報じています。日本は制限対象として報じられていません。ただし公式ドキュメント上で地域一覧を確認できていないため、海外拠点を含めて使う企業は、事前に各拠点から動作を確かめてください。
Gemini 3.8 Flash TTSの強み
特に評価されているのは、声づくりの自由度・演技表現・価格の3方面です。具体的には次の6点が挙げられます。
- 声をセルフサービスで作れる:ボイスデザインと声のクローンを、営業窓口を通さずAPIとAI Studioから使えます。海外メディアのThe New Stackは、OpenAIのカスタム音声が営業経由であるのに対し、Googleはセルフサービスにしたと対比しています
- 演技の指示が細かい:1行ごとの感情・ペース指示と音声タグで、朗読ではなく「演じる」音声を作れます
- 長尺でも声がぶれにくい:オーディオブックや長い研修動画で、途中から別人のような声になるリスクを抑えています
- 2026年内は価格が安い:音声出力の単価は100万トークンあたり$9で、前世代の3.1 Flash TTS Preview($20)の半分以下です
- 評価指標で上位:Google発表では、Hume AI Voice Design Benchmarkで総合1位(71.4)。Voice Arenaでも日本語を含む複数言語で上位に入ったとされています。いずれもGoogle側の発表値である点には注意が必要です
- 透かしが標準で入る:生成音声にはSynthIDの電子透かしとC2PAのコンテンツ認証情報が付与されます
Gemini 3.8 Flash TTSの弱み・注意点

弱みは、「提供範囲がまだ限られている」ことと「2027年に料金が上がる」ことです。
- Google Cloud(Vertex AI)では未提供:2026年9月28日時点で、Cloud Text-to-SpeechのGemini-TTSページに3.8は掲載されていません。Gemini Enterpriseも「近日提供」です
- 2027年1月1日から料金が2倍:2026年内は導入価格です
- 同時に話せるのは2人まで:カスタム音声同士の掛け合いは、話者ごとに別々に生成して結合する必要があります
- 1リクエストの入力は8,192トークンまで:長い原稿は章や段落単位で分割して生成します
- 読み間違いがある:難読の人名や数字は誤読することがあります。また、本文中に書いた演出指示まで読み上げてしまうケースがあるとの検証報告もあり、台本と指示は分けて書くのが安全です
- ボイスリミックスは未提供:生成後に声を微調整したい場合は、現時点では作り直しが必要です
Gemini 3.8 Flash TTSの料金

無料枠で試せて、有料でも1時間の音声あたり1ドル前後(2026年内)が目安です。ただし2027年1月1日から全レートが2倍になります。
公式料金(100万トークンあたり・USD)
Gemini API公式料金ページ(2026年9月28日確認)の内容です。
モデル | 無料枠 | 入力(テキスト) | 出力(音声) | Batch 入力 / 出力 | Priority 入力 / 出力 |
|---|---|---|---|---|---|
3.8 Flash TTS(〜2026/12/31) | あり | $0.50 | $9.00 | $0.25 / $4.50 | $0.90 / $16.20 |
3.8 Flash TTS(2027/1/1〜) | あり | $1.00 | $18.00 | 2026年価格の2倍 | 2026年価格の2倍 |
3.8 Flash-Lite TTS(〜2026/12/31) | あり | $0.50 | $6.00 | $0.25 / $3.00 | $0.90 / $10.80 |
3.8 Flash-Lite TTS(2027/1/1〜) | あり | $1.00 | $12.00 | 2026年価格の2倍 | 2026年価格の2倍 |
参考:3.1 Flash TTS Preview | あり | $1.00 | $20.00 | $0.50 / $10.00 | - |
参考:2.5 Flash Preview TTS | あり | $0.50 | $10.00 | $0.25 / $5.00 | - |
2027年の2倍価格になっても、3.8 Flash TTSの出力単価($18)は3.1 Flash TTS Preview($20)を下回ります。3.1 Previewから移行する場合、コスト面での不利はありません。
ボイスデザインやボイスレプリケーションの追加料金は、公式料金ページに記載がありません。「追加料金なし」と決めつけず、利用前に最新の料金ページを確認してください。レート制限の具体値も、公式では「AI Studioのダッシュボードで確認」とされています。
1分・1時間・オーディオブック1冊あたりの目安
音声出力は1秒あたり約25トークン(1分あたり約1,500トークン)で数えられる、と複数の海外メディアが説明しています。公式ページでこのレートを直接確認できていないため、次の表は目安の試算です。入力テキスト分の料金は含んでいません。
生成する音声の長さ | 3.8 Flash TTS(2026年内) | 3.8 Flash TTS(2027年〜) | 3.8 Flash-Lite TTS(2026年内) | 3.8 Flash-Lite TTS(2027年〜) |
|---|---|---|---|---|
1分 | 約$0.0135 | 約$0.027 | 約$0.009 | 約$0.018 |
1時間 | 約$0.81 | 約$1.62 | 約$0.54 | 約$1.08 |
8時間(オーディオブック1冊相当) | 約$6.5 | 約$13 | 約$4.3 | 約$8.6 |
急ぎでない大量生成はBatch APIを使うと、出力単価が半額になります。たとえば3.8 Flash TTSのBatch(2026年内)なら、1時間あたり約$0.41が目安です。
無料枠を業務で使うときの注意
Gemini APIの一般的な規約では、無料枠の入出力データがGoogleのサービス改善に使われる可能性があります。本モデル固有の記載や、クローン用の参照音声・同意音声の保存・学習利用の扱いは、現時点で公式に明示されたものを確認できていません。社内の未公開原稿や、声優・ナレーターの音声を扱う場合は、有料枠での利用と規約の確認をおすすめします。
一般ユーザー向けのGemini Notebook・Google Vidsで使う場合の料金やプラン条件は、現時点で公式に明示されていません。
日本語対応の状況
日本語は、Flash TTS・Flash-Lite TTSの両方で対応言語として明記されています。声のクローンに必要な同意文にも日本語版(ja-JP)が用意されており、日本語話者が自分の声でクローンを作るまでの流れはひと通りそろっています。
言語は自動で判定されるため、日本語の台本をそのまま入れれば日本語で読み上げます。ボイスデザインでは「関西弁」のような方言の指定も可能です。Google発表では、Voice Arenaの日本語部門でも上位に入っています。
実務で気をつけたいのは読み間違いです。固有名詞・社名・数字・単位は、ひらがなや読みやすい表記に置き換えた「読み上げ用台本」を別に用意すると、修正の手間が減ります。
Gemini 3.8 Flash TTSの使い方

使い方は、「ノーコードで試す(AI Studio)」「APIで組み込む」「一般向けアプリで使う」の3パターンです。まずはAI Studioで声と演技を確かめてから、APIに移るのが効率的です。
Google AI Studioで試す手順
- GoogleアカウントでGoogle AI Studioにログインする
- 音声生成(Generate speech)の画面を開く
- モデルで
Gemini 3.8 Flash TTS(または Flash-Lite TTS)を選ぶ - 声を選ぶ(プリビルト音声・ライブラリから選択、またはボイスデザインで作成)
- 台本を入力し、必要に応じて感情の指示や
<laugh>などのタグを入れる - 生成して試聴し、気に入ったらWAVでダウンロードする
声のクローンを作る手順
- 静かな部屋で、自分の自然な話し声を10〜30秒録音する(原稿の朗読より、普段の話し方のほうが自然に再現されやすい)
- 同じマイク・同じ部屋で、日本語の同意文を読み上げて録音する
- AI Studioの画面、またはVoices API(
POST /v1beta/voices)に2つの音声をアップロードする - 作成された声のID(
voice_id)を保存し、以降の音声生成で指定する
体験報告では、「参照音声と同意音声を同じ環境で録る」ことが照合を通すコツとされています。
APIで組み込む場合の流れ
公式ドキュメントのサンプルでは、Python SDKから次のような流れで呼び出します。パラメータ名はSDKの更新で変わる可能性があるため、実装時はText-to-speech generationの公式ドキュメントを確認してください。
# 概略(公式ドキュメントのサンプルを簡略化したもの)
interaction = client.interactions.create(
model="gemini-3.8-flash-tts",
input="こんにちは。本日のニュースをお伝えします。",
generation_config={
"speech_config": {
# プリビルト音声名、またはボイスデザイン/クローンで作った voice_id を指定
}
},
)
audio_base64 = interaction.output_audio.data # base64の音声データ拡張ボイスライブラリは client.voices.list() で言語・性別・用途などを条件に一覧を取得できます。長い原稿は8,192トークン以内に分割し、生成した音声をつなげる構成にします。
一般ユーザーが使う場合
プログラミングをしない人は、Gemini Notebook(Flash TTS)やGoogle Vids(Flash-Lite TTS)経由で新しい音声を使えるようになります。いずれも順次展開中で、日本での提供時期や必要なプランは現時点では明示されていません。
他の音声生成AIとの違い
Gemini 3.8 Flash TTSの特徴は、声づくり(デザイン・クローン)をセルフサービスで提供し、価格を低めに設定している点です。他社の料金は改定が多いため、表では数値を載せず、各公式ページでの確認を前提にしています。
比較項目 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS | ElevenLabs | OpenAI(GPT-Realtime系など) |
|---|---|---|---|---|
主な用途 | 高品質ナレーション、ゲーム、オーディオブック | 大量生成、吹き替え、音声エージェント | ナレーション、キャラクター音声、吹き替え | リアルタイム音声対話 |
文章から声を作る | 対応(ボイスデザイン) | 対応 | 対応(Voice Design) | 公式で要確認 |
声のクローン | 本人の同意録音つきでセルフサービス | 対応 | 対応 | カスタム音声は営業経由と報道 |
リアルタイム会話 | 非対応(Liveは別モデル) | 非対応 | 別製品で対応 | 得意分野 |
日本語 | 対応 | 対応 | 対応 | 対応 |
透かし | SynthID+C2PA | SynthID+C2PA | 公式で要確認 | 公式で要確認 |
料金 | 出力100万トークン$9(2026年内) | 出力100万トークン$6(2026年内) | 公式サイト参照 | 公式サイト参照 |
各ツールの詳細は、ElevenLabs Voice Design v3とは、GPT-Realtime-2とはで解説しています。
用途別の選び方
やりたいこと | おすすめ |
|---|---|
オーディオブック・長尺ナレーション | Gemini 3.8 Flash TTS |
ゲームやアニメのキャラクター音声 | Gemini 3.8 Flash TTS(ボイスデザイン) |
動画の多言語吹き替え・大量生成 | Gemini 3.8 Flash-Lite TTS(+Batch API) |
IVRの音声素材・電話向け定型音声 | Gemini 3.8 Flash-Lite TTS(mu-law/A-law出力) |
ユーザーと声で会話するAIエージェント | Gemini 3.8 Live、OpenAIのリアルタイム系モデル |
声の細かな後編集や成熟した制作UIが必要 | ElevenLabsなど制作ツール型のサービスも比較対象に |
セキュリティと権利の注意点
声のクローンは、自分の声か、利用する権利を持つ声にしか使えません。技術的な安全策は用意されていますが、使う側の権利確認も欠かせません。
Googleが用意している主な安全策は次のとおりです。
- 本人の口頭同意の録音が必須:他人の声を無断で登録しにくい仕組みです
- SynthID:Geminiの音声モデルで生成したすべての音声に、聞き取れない電子透かしが埋め込まれます
- C2PA:AI生成であることを示すコンテンツ認証情報が付与されます
一方で、次のようなリスクは使う側で管理する必要があります。
- 声優・ナレーター・社員の声を使う場合の契約(利用範囲・期間・報酬・削除条件)
- 生成音声が本人の発言と誤解されるリスク(なりすまし・詐欺への悪用)
- 退職者や契約終了者の声データの扱い(保存音声の削除、1年の保持期限との関係)
日本では、法務省が声の権利(パブリシティ権)に関する考え方を示しています。業務で声のクローンを使う前に、法務省「声の権利」指針の解説もあわせて確認しておくと、契約書に盛り込むべき項目を整理しやすくなります。
Gemini 3.8 Flash TTSはこんな人におすすめ
おすすめな人
- オーディオブック・研修動画・ポッドキャストを作る人:長尺でも声が崩れにくく、1時間あたり1ドル前後(2026年内の目安)で作れます
- ゲーム・アニメ・広告で個性のある声が欲しいクリエイター:文章から声を作れるため、声のイメージを言語化できればすぐ試せます
- 自分の声でナレーションを量産したい発信者・講師:本人の同意録音つきで、自分の声のクローンを作れます
- 多言語展開をしたい企業:日本語を含む100以上の言語に対応し、Flash-Liteなら大量生成のコストも抑えられます
- 3.1 Flash TTS Previewを使っている開発者:2027年の値上げ後でも出力単価は3.1 Previewより低く、移行しやすい状況です
おすすめしない人
- ユーザーと声でリアルタイムに会話するAIを作りたい人:Live API非対応のため、Gemini 3.8 Liveなどを選ぶべきです
- Vertex AI / Google Cloudの契約・データ管理の枠組みで使う必要がある企業:現時点で3.8はGoogle Cloud側に掲載されていません
- EEA・英国・インドなどの拠点で声のクローンを使いたい企業:報道ベースでは、これらの地域では利用できません
- 3人以上が同時に話す音声を1回で作りたい人:同時話者は2人までです
- 権利関係を確認できない声を再現したい人:本人同意のない声は作れず、作るべきでもありません
よくある質問
Q. 本当に30秒の録音だけで声をクローンできますか?
A. 声質の再現に使う参照音声は10〜30秒が目安ですが、それとは別に、同じ本人が同意文を読み上げた録音が必要です。つまり「30秒の音声+同意の録音」の2つが条件です。本人以外の録音から勝手にクローンを作ることは想定されていません。
Q. 無料で使えますか?
A. Gemini APIには無料枠があり、Google AI Studioでも試せます。ただし回数などのレート制限があり、具体的な上限はAI Studioのダッシュボードで確認する形です。本格的な業務利用やデータの扱いを重視する場合は、有料枠を検討してください。
Q. 2027年1月以降に生成した音声は、それまでの価格で使えますか?
A. 公式料金ページでは2027年1月1日から新価格になると示されているため、それ以降のリクエストには2倍の料金がかかると考えておくのが安全です。2026年内に作った音声ファイル自体は、そのまま使い続けられます。大量の音声を作る計画がある場合は、年内に生成しておくのも1つの方法です。
Q. 作った声はずっと使えますか?
A. 既定の保存方式では、声のIDは1年で失効します。ステートレス方式で発行されるキーは7日で失効します。長期間同じ声を使う場合は、元の録音データを手元に残し、期限前に作り直せるようにしておきましょう。
Q. 生成した音声を商用利用できますか?
A. 業務での利用可否は、Gemini APIの利用規約とGoogleの利用ポリシーに従います。利用前に最新の規約を確認してください。特に、他人の声を再現した音声や、実在の人物になりすます用途は規約違反や権利侵害につながります。声優・ナレーターの声を使う場合は、別途本人との契約が必要です。
Q. Gemini 3.1 Flash TTS Previewはいつ使えなくなりますか?
A. Gemini 3.8 Flash-Lite TTSが後継と位置づけられていますが、3.1 Flash TTS Previewの提供終了日は現時点で公式に示されていません。プレビュー版は予告後に終了することが多いため、早めに3.8系で動作確認をしておくと安心です。
まとめ
Gemini 3.8 Flash TTSは、テキストを「演じる声」に変えるGoogleの読み上げ専用モデルです。2,000種以上の音声ライブラリ、文章から声を作るボイスデザイン、本人の同意録音つきで作る声のクローンにより、声の選択肢がこれまでより大きく広がりました。
料金は2026年内なら1時間の音声あたり約0.8ドル(目安)と安く、2027年1月1日から2倍になります。日本語にも対応しており、まずはGoogle AI Studioで声と演技の品質を確かめるのがおすすめです。リアルタイム会話が必要な場合はGemini 3.8 Live、Google Cloud経由の利用が前提なら今後の提供拡大を待つ、というように、目的に合わせて選んでください。
このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します
業務を1つ送るこの記事の著者

AI革命
編集部
AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。
最新記事

Claude Opus 4.8とは?Opus 4.7との違い・料金・Dynamic Workflows・努力制御、今も使えるかまで解説【2026年9月最新】
2026/05/29

Meta Muse Charmとは?キーホルダー型AIエージェント端末の機能・発売時期・価格・Meta Connect 2026発表まとめ【2026年9月】
2026/09/27

Cognition(Devin)$25B評価額・$1B調達を完全解説|ARR $492M・月50%成長・Mercedes/NASA/Goldman Sachs採用からSeries E $48Bまで【2026年9月更新】
2026/05/28

Claudeが新しい酵素システム「ART」を発見|CRISPR似の反復配列とは?AI創薬・生命科学研究への影響【2026年9月】
2026/09/27

GitHub MCP Server(github-mcp-server)使い方ガイド【2026年9月最新】|Claude CodeにGitHub直接アクセスを与える完全解説
2026/04/24

Grok 4.7とは?SpaceXAI最新モデルの性能・API料金・Grok 4.6との違い・使い方【2026年9月】
2026/09/27

