AIモデル・生成AIの選び方

Gemini 3.8 Flash TTSとは?音声生成の基本とAPIの使い方

公開日 ・更新日

Gemini 3.8 Flash TTSは、文章を単一話者または複数話者の音声へ変換するGoogleのテキスト読み上げモデルです。まずGoogle AI Studioで短い原稿を試し、APIではモデル名、声、話し方、出力形式を分けて指定します。この記事では、基本の役割と最小構成を整理します。

Gemini 3.8 Flash TTSの役割

Google AI for Developersは、Gemini 3.8 Flash TTSを高い音響忠実度、演技のニュアンス、長い会話での話者の安定性、地域アクセントを重視したモデルと説明しています。入力はテキスト、出力は音声です。日本語を含む130以上の言語に対応し、ポッドキャスト、ナレーション、複数話者の台本など、原稿を正確に読み上げたい場面に向きます。

会話をその場で続けるGemini Liveとは役割が違います。Live APIはインタラクティブな音声対話向けで、TTSは決めた原稿をスタイル付きで音声化する用途向けです。議事録の文字起こしを行うGemini 3.5 Transcribeとも、入力と出力の向きが反対です。

AI Studioで短い原稿を試す

最初はGoogle AI Studioの音声生成画面で、1〜2文の原稿を試します。固有名詞、数字、間の取り方など、実際の用途で間違えると困る箇所を入れると確認しやすくなります。声の印象を比べるときは、同じ原稿と同じ音量で条件をそろえます。

APIではモデルと声を指定する

APIでは、Interactions APIのモデルに「gemini-3.8-flash-tts」を指定し、inputへ読み上げる原文を渡します。response_formatをaudioにし、generation_configのspeech_configで声を選びます。公式のPython例では、音声データはinteraction.output_audio.dataに入り、Base64をデコードしてout.wavへ保存します。JavaScript SDKでも同じ考え方で、output_audio.dataをバッファへ変換してファイルへ書き出します。

原文は読み上げる内容だけにする

Gemini 3.8 TTSでは、inputに渡すテキストを読み上げる原稿として扱います。「明るく話して」のような指示を本文へ混ぜると、その言葉まで読まれることがあります。話し方はspeech_metadataのstyleへ分け、笑い声や短い間など一瞬のイベントだけを、山括弧のインラインタグで表します。複数話者では、各ターンにspeakerを付け、speech_config.speakersで声を対応づけます。会話らしい間を出す場合は、公式例のconversationalモードを使います。

WAVを保存して小さく評価する

単発のリクエストでは、標準の出力形式がWAVです。返った音声データをデコードして、そのまま.wavファイルへ保存できます。以前のTTSモデル向けに手作業でWAVヘッダーを付けていた処理があれば、Gemini 3.8 Flash TTSでは重ねないようにします。まず短い原稿で、発音、固有名詞、間、話者の切り替えを人が確認し、問題がなければナレーションや社内教材へ広げます。

音声生成は、作れたことより使えることが大事です。原稿、声の設定、生成日時、確認者を残し、公開や顧客向け利用の前に権利と同意を確認します。あなたの会社でも、まず一つの台本をAI Studioで試す。それからAPIへ移し、時間、修正、聞き直しの回数を比べれば、導入の判断がしやすくなります。

出典(公式):Google AI for Developers「Text-to-speech generation (TTS)」 https://ai.google.dev/gemini-api/docs/speech-generation

出典(公式):Google AI for Developers「Gemini 3.8 Flash TTS」 https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts

Gemini APIを使った音声生成を小さく試し、確認と運用の境界まで整えたい方は、COZITOへご相談ください。

著者: 松井 勇樹