
日本語のAI音声は、発音が正しいだけでは「自然」と感じにくい。句読点の間、語尾の落とし方、感情の強弱、固有名詞、会話で相手にかぶらない反応速度まで含めて品質が決まる。
ElevenLabsが2026年9月28日に正式提供したEleven v4は、このうち表現力と声の再現性を強化した最新世代だ。同時にv4 Turboも公開され、こちらはリアルタイム会話を想定してモデル推論の中央値を約100msまで短縮している。
両者は「新しい方が全部上」ではない。YouTubeのナレーションと電話AIでは優先順位が違うため、音質・表現力・速度・コストを用途別に見る必要がある。
Eleven v4はElevenLabsが最も高品質で表現力豊かな音声合成モデルと位置づける最新モデルだ。
モデルIDはeleven_v4。90以上の言語をサポートし、日本語も公式の対応言語に含まれる。
長文でのspeaker preservation、つまりクローンした声の特徴を保つ能力が改善され、感情的な会話、キャラクターボイス、オーディオブック、多言語コンテンツなどが主な用途として挙げられている。
制御方法も特徴的だ。[pause]、[whispers]、[excited]、[sighs]など自然言語ベースのaudio tagsを使って演技を指定する。
一方、v4ではSSMLの<break>は使わず、音声タグを使うのが公式の案内だ。
v4ファミリーには品質重視のeleven_v4と、リアルタイム向けのeleven_v4_turboがある。
v3にも通常版とConversational版があり、単純な世代番号だけでは用途を判断できない。
v4 Turboの100msはアプリ全体の応答時間ではない。
ElevenLabsはこの値からアプリケーションとネットワークの遅延を除外しているため、ユーザーが耳で感じる往復時間はSTT、LLM、通信、バッファなどを足して考える。
公式仕様として確実に言えるのは、v4ファミリーが日本語を正式サポートしていることだ。
一方、「日本語最強」「必ずv3より自然」といった評価は、声、文章、アクセント、用途で変わるため仕様表だけでは決められない。
日本語では、漢字の読み、数字・英字混在、固有名詞、助詞の弱め方、文末のピッチ、読点の間を確認したい。
動画ナレーションなら、30秒のデモより数分の原稿で声質が安定するかも重要になる。
方言についても「日本語対応=すべての地域アクセントを高精度再現」とは限らない。
クローンでは参照音声のアクセントが品質へ影響するため、実際に使う話し方に近い録音で比較する方がよい。
Eleven v4 Turboは、ElevenLabsがリアルタイム音声合成向けに設計したモデルだ。
公式のmedian inference latencyは約100msで、v3 Conversationalの約280msよりモデル処理を短縮している。
ただし実際の音声エージェントでは、ユーザーの発話を文字にするSTT、LLMが回答を考える時間、TTSへ文字を渡すバッファ、ネットワークが加わる。
100msだけを見て「0.1秒で返事する」と表現するのは正確ではない。
また、ElevenLabsのレイテンシー資料では音声タイプによっても速度が変わる。
Professional Voice Cloneはデフォルト音声やInstant Voice Cloneより追加のオーバーヘッドがあるため、低遅延を優先するなら声の種類も含めてテストする。
録音済み動画では100msの差より、最終的な音質と演技の安定性の方が重要になる場合が多い。
ElevenLabs自身もコンテンツ制作、オーディオブック、動画ナレーションにはv4を推奨している。
YouTubeなら、感情タグで導入を強くし、解説部分を落ち着かせ、締めだけテンションを上げるといった演技指定を試せる。
複数人物の自然な対話を作る用途にもv4が向く。
一方、ライブ配信キャラクターやユーザー入力へ即応するAIならv4 Turboが候補になる。
完成音声を後編集できるか、会話の待ち時間が体験を壊すかで選択を分けたい。
Instant Voice Cloning(IVC)は短い録音からすぐに声を再現する方法だ。
公式ガイドは最低1分程度、推奨1〜2分のクリアな音声を案内し、2〜3分を超えて増やしても改善が小さい場合があるとしている。
Professional Voice Cloning(PVC)は専用モデルを学習する高忠実度方式で、公式推奨は30〜180分。通常3〜6時間程度のfine-tuningが必要になる。
秒数だけを満たしても品質は保証されない。
背景ノイズ、反響、複数話者、極端な声色を避け、実際に生成したい話し方に近いサンプルを用意する方が結果へ影響する。
動画や音声作品を作るならElevenLabsのCreative画面からv4を選ぶ方法が分かりやすい。
開発者はAPIでmodel_idにeleven_v4またはeleven_v4_turboを指定する。
v4 TurboはText to Dialogue WebSocketに対応し、テキストを逐次送りながら音声を返せる。
公式サンプルでは約40文字かつ8語程度のコンテキストがたまるまでバッファし、その後audio chunkを送る仕組みが説明されている。
ElevenAgentsではv4 Turboを音声エージェントのTTSとして利用できる。
問い合わせ対応や予約受付などでは、TTS単体ではなくSTT、LLM、割り込み処理まで含めた往復遅延を測る。
ElevenLabsのv4製品ページでは、v4は他のTTSモデルと同じcredit pricingを採用し、無料プランを含むすべてのプランで利用できると説明されている。
無料プランには月10,000 creditsが含まれ、公式ページでは音声約10分相当と案内されている。
実際の消費量はモデル、機能、生成方法で確認する必要があるため、「10,000 creditsならどのモデルでも必ず10分」と固定換算しない方がよい。
Agents側には別の料金体系があり、無料枠や通話時間を基準にしたプランが存在する。
Creativeで音声を作る料金と、音声エージェントを運用する料金を混同しないことが重要だ。
ボイスクローンでは技術的に再現できるかより、再現してよい声かを先に確認する必要がある。
ElevenLabsのIVC作成画面でも、ユーザーがその声をクローンする権利と同意を持つことを確認する手順がある。
他人の声、著名人、取引先、出演者の声を無断でクローンして広告や動画へ使うと、利用規約だけでなく肖像・パブリシティ・契約・不正競争など別の問題が生じ得る。
商用制作では同意範囲を記録しておきたい。
また、プランごとの商用ライセンス条件も契約時点で確認する。
無料で生成できることと、その音声を商用コンテンツへ使えることは同じではない。
Eleven v4とv4 Turboは、どちらも90以上の言語に対応する同世代モデルだが、狙っている用途が違う。
完成品の品質と表現力を優先する動画・オーディオブックならv4、会話の待ち時間が体験へ直結する音声エージェントならv4 Turboが比較の起点になる。
日本語も正式対応しているが、自然さはモデル名だけで決まらない。
実際の声、固有名詞、句読点、感情、方言を含む原稿で試し、自分の用途に合うか確認したい。
ボイスクローンではIVCなら1〜2分、PVCなら30〜180分が公式の推奨目安だ。
短いサンプルで作れることを品質保証と捉えず、録音品質と利用権を含めて設計することが、長期利用では重要になる。

