Gemini 3.8 TTS が私の修論を完成させてくれました
目次
Gemini 3.8 TTSは、TTSの一つの完成形だと思います
Gemini 3.8 TTS、かなり好きです!
私は修論で「自然言語でTTSの演技指導をした~い!」という研究をやっていました。 ただ、いろいろ検討しても結局、修論の最後は 「莫大なコストをかけて大規模なデータセットを用意すればできるよね(誰かやってくれ……!)」 という、学生研究あるあるな結論で締めくくるしかありませんでした。
ですが今回、その当時の自分の理想を、圧倒的な資本力と技術力を持つGoogle様が「本当にやってくれたぞ!!!!」どころか、遥かに上回る形で素敵なTTSモデルを作ってくれました。
何がそんなに良いのかというと、単純に「音質が良い」とか「感情豊かに喋れる」とか、そういう話だけではありません。
Gemini 3.8 TTSでは、
- 何を喋るのか
- 誰が喋るのか
- どういう感情で喋るのか
- どんなテンポ・ピッチ・声量で喋るのか
- どこで笑うのか
- どこで息を吸うのか
- どこでため息をつくのか
- 誰と会話するのか
- どこで相槌を入れるのか
- どこで相手の発話にかぶせるのか
みたいなところまで、とても細か~く人間側から制御できます。これすごく嬉しくないですか!!
いやもちろん、最近のTTSは普通にめちゃくちゃ高性能です。文章を渡したら、文脈を読んで、それっぽい感情をつけて、それっぽい間を入れて、それっぽく読んでくれます。
でも私は、「AIがいい感じにやってくれます!」より、「人間が細かく演出できます!」の方が好きなんですよね。
AIが全部決めてしまうのではなくて、
- 「ここは笑ってください」
- 「この一言だけ少し声を落としてください」
- 「ここではまだ怒らないでください」
- 「この台詞から一気に感情を出してください」
- 「ここで息を飲んでください」
- 「相手の台詞にちょっとかぶせてください!」
みたいに、人間が手綱を握って演技をつけられる。これです!!! 人間が制御できないAIに価値はありません!!!!(個人的思想)そういうとこだぞAIにお任せ系の有象無象の怪しいAI企業たち!
私が生成AIに期待しているのはまさにこの方向で、人間が何もしなくても作品が全自動で完成するのではなく、人間の表現能力を拡張してくれる道具であってほしいのです。
で、これは本当に「TTS」なんでしょうか
Gemini 3.8 TTSは、従来のTTSというよりも、動画生成モデルの「音声だけバージョン」みたいに考えた方が分かりやすそうです。
もちろん、これはかなり雑な例えです。普通の動画生成モデルのように、環境音でも音楽でも何でも自由に生成するモデルという意味ではありません。 ただ、モデルが扱っている単位を考えると、従来のTTSよりも「発話シーン生成」に近づいています。
一番分かりやすいのが、複数話者の会話です。
従来の感覚だと、二人の会話音声を作るなら『話者ごとに個別に音声を生成し、あとからタイムライン上で並べる・重ねる』という構造を想像しがちです。つまり、まず一人ずつ喋らせて、最後に会話にするわけです。
ところがGemini 3.8 TTSでは、二人の会話を一つの音声としてまとめて生成できます。さらに交互発話だけではなく、相槌やoverlap(発話の重なり)まで扱えます。
例えば、
1A「それで昨日さ……」
2 B「うんうん」
3A「学校に行ったら――」
のように、Aが喋っている最中にBが相槌を入れる、というような発話の重なり自体を会話音声としてそのまま生成できるのです。
動画生成モデルが「人物Aを生成して、人物Bを生成して、背景を生成して、最後に全部合成する」のではなく、「一つのシーンとしてまとめて生成する」のと少し似ています。
でも、ちゃんとTTSでもあります
ここまで読むと、「はいはいデータ量データ量モデルサイズモデルサイズおけおけ」てな感じですが、その中のTTS機能もちゃんと充実しています。
Gemini 3.8 TTSは、4つの軸で発話を制御できます。
1. Text:何を喋るか
当然ですが、最初に「何を発声するのか」をテキストで指定します。
今日は本当にありがとう。
ここは従来のTTSと同じです。
2. Tags:テキストだけでは書けない「発声内容」を指定する
そしてTextの延長線上にあるのがTagsです。
<sigh>
<laugh>
<breath>
<gasp>
<short pause>
などを文章の中に直接入れることで、言語として書かれている台詞以外の発声まで指定できます。
例えば、
もういいよ…… <sigh> 私がやるから。
と書けば、「もういいよ」と「私がやるから」の間に、実際にため息を発声させることができます。
Textだけでは、「この位置で息を吸う」「ここで笑う」「ここで言葉を止める」といった非言語的な発声を明示するのが難しい。そこをTagsが補っています。
これ、かなり好きです!!!
感情豊かなTTSって、AIが文脈を読んで勝手に笑ったり、息を入れたり、間を取ったりする方向にも進めます。それももちろん便利です。 でも創作側からすると、「そこは勝手に決めないでほしい!!」という場面が普通にあります。
- ここで笑ってほしい。
- ここではまだ笑わないでほしい。
- この一言を言い終わってから息を吐いてほしい。
- 泣きそうではあるけど、まだ泣いてはいけない。
そういった細かい演出を、発声位置まで含めて人間側から緻密に決められます。
3. Style:それを「どう演じるか」
TextとTagsによって「何を発声するか」を決めた上で、それをどう発声するかを指定するのがStyleです。
例えば、
「少し寂しそうに、でも相手には悟られないように」
のような自然言語で演技を指示できます。 ここでは感情だけではなく、速度、ピッチ、声量、テンション、話し方のニュアンスなども自由に指定できます。
TextとTagsが「発声内容」を決めるものだとすれば、Styleはそれに対する「演技指導」です。
1Text / Tags
2「何を音として出すか」
3 ↓
4Style
5「それをどう演じるか」
という関係です。
「Happy」「Sad」「Angry」みたいな固定された感情ラベルを選ぶのではなく、人間が演技指導するときに使う言葉そのもので発話表現を制御する。良いですね。
4. Voice:誰が発声するか
さらに、これらとは別の軸として「そもそも誰が喋っているのか」があります。これがVoiceです。
Voice Designでは、
「20代くらいの女性で、柔らかく少しハスキーな声」
のような自然言語から、話者のpersonaを作ることができます。
ここでは会話全体を通して不変な属性を指定します。感情は文脈によって刻々と変わりますが、年代や性別、基本的な声質などは途中でブレてはいけません。そうしたキャラクターの根底をここで定義します。
4つの軸のまとめ
ここまでの4つの制御軸を演劇に例えると、以下のように整理できます。
| 軸 | 指定する内容 | 演劇での役割 | 具体例 |
|---|---|---|---|
| Voice | 誰が喋るか(話者の属性) | 役者 | 20代女性、少しハスキーな声 |
| Text | 何を音として出すか | 台詞 | 「今日は本当にありがとう」 |
| Tags | 非言語的な発声 | ト書き | <sigh>(ため息)、<laugh>(笑い) |
| Style | それをどう演じるか | 演技指導 | 「少し寂しそうに、でも悟られないように」 |
最後に:私たちは「音響監督」になった
役者(Voice)をアサインし、台本とト書き(Text / Tags)を渡し、演技指導(Style)を行う。そして必要なら、二人の役者を同じ舞台に立たせて、セリフを被らせながら会話させる。
この音声合成モデルを使うことで、私たちはプログラマーやプロンプトエンジニアというより、まさに「音響監督」「演出家」になれるのだと思います。
「AIにお任せでいい感じにやってくれる」ツールは世の中に溢れていますが、このモデルが突きつけてくるのはむしろ逆です。 「どこで間を取るのか?」「ここで息を吸うのか?」「どんな感情のグラデーションで喋らせるのか?」――人間の側の“演出意図の解像度”が、そのまま作品のクオリティになる。
生成AIとして扱える表現の幅を極限まで広げながら、人間の手綱(コントロール)を決して手放さない。この設計思想こそが、Gemini 3.8 TTSの最も魅力的な部分だと思います。
……と、それっぽい考察を語ってきましたが、最後にタイトルの話を回収させてください。
冒頭でも書いた通り、私の修論は 「今後の課題:高品質な大規模データさえあればできる(誰かやってくれ)」という、よくある結論で締めくくらざるを得ませんでした。
研究者としては並べるのもおこがましいですが、一人のクリエイターとしては 『私の修論を、世界最高峰のチームが代わりに最高の形で成仏させてくれた』という感動と、理想の音声合成の世界へ一歩近づいたことへの感謝しかありません。
このモデルや、そのさらに発展した先に、個人の机の上からどんなとんでもない「舞台」が生まれるようになるのか、今から楽しみで仕方がありません。
……あ、成仏ついでに最後にもう一つだけ言わせてください。
日本語ネイティブモデルを!!!!何卒!!!!!!作ってくださいGoogle様!!!!!!!!!!!!!!!!!(成仏しきれてない)