Sunoが10月1日、音声ナレーションと背景音楽を同時生成する新機能「Speech」のパブリックベータを公開した。

何が起きたか

SunoはSpeechを「音声と音楽をひとつのトラックとして同時生成する、初めてのオーディオモデル」と説明している。チーフプロダクトオフィサーのJack Brodyはリリースノートで「音楽は常にSunoの中心にある。しかし私たちのビジョンは、最初から他の表現形式にも及んでいた」と述べた。

機能はSunoのウェブ・モバイルアプリの「Create」タブから利用できる。モードは2種類。

  • Simpleモード: 「海賊船長が乗組員を鼓舞している」のようなプロンプトを入力するだけで、声と音楽が生成される
  • Advancedモード: 自分で書いたスクリプトを貼り付けて使用。声の性別・話し方のスタイル・バリエーション量を細かく設定できる

背景音楽はトグルでオフにでき、ナレーションだけを取り出すことも可能。最大生成時間は約8分。

公式ブログではユースケースとして「子どもへの寝物語」「スポーツ前の鼓舞スピーチ」「詩の朗読」「ASMR」が挙げられている。ベータ版のため精度は発展途上で、「イギリス英語のアクセントがオーストラリアに飛んでいくことがある」とBrodyは率直に認めた。

なぜこれが重要か

Sunoの動きを「TTS(テキスト読み上げ)分野への参入」と見ることもできるが、より正確には「AI音楽プラットフォームの事業領域の拡張」だろう。

背景には、同社が抱える訴訟リスクがある。SONYやUMGとの著作権訴訟、ドイツ・GEMAからの判決、米国でのRIAA提訴と、2026年だけで複数の法的攻勢にさらされている。音楽生成一本足打法のリスクが顕在化するなか、音声コンテンツという隣接市場を押さえることは事業の多角化でもある。

ElevenLabsをはじめTTSの先行プレイヤーは存在するが、「音楽付き音声」という組み合わせに特化した製品は現時点で少ない。寝物語や瞑想コンテンツのように、音声と音楽の同期が体験の核になる用途では、別ツールを組み合わせるより一発生成のほうが圧倒的に早い。

論点・異なる見方

肯定的に見れば、SpeechはSunoが「音楽ツール」から「パーソナル・クリエイティブ・スタジオ」へ進化する一歩だ。ユーザーが自分の詩や日記をBGM付きで聴けるようになる、という体験の拡張は本物だと思う。

一方で懸念もある。現行の訴訟のほとんどは「学習データに無許諾の著作物が含まれていた」という論点で争われている。Speechが新たに学習した音声・ナレーションデータについて、同じ問題が生じないかは注視が必要だ。声優・ナレーターの権利侵害を問う動きが生まれるとすれば、No Fakes Act(米国・2026年成立)との兼ね合いも浮上してくる。

今後どう展開しそうか

SunoはSpeechを「ベータ1.0」と位置づけており、ユーザーフィードバックに基づいて精度を改善していくとしている。短期的には品質の安定化と対応言語・アクセントの拡充が焦点になるだろう。

中期的には、Speechが広告ナレーション・ポッドキャスト・有声読み物などのプロ用途に食い込めるかが試される。ElevenLabsとの競合は不可避で、「音楽付き」という差別化がビジネスとして成立するかどうかは、まだ分からない。

作り手・聴き手への示唆

AI音楽を作っている人にとって、Speechは新しい組み合わせの可能性を開く。歌詞を朗読してBGMを乗せる、インスト曲に語りをつける——そういった実験が、より手軽に、よりコントロールしやすい形でできるようになった。

使ってみる価値はある。ただ、生成された音声と音楽がどのようなデータから学習されたのかを知る術は現時点では限られている。その問いを持ちながら使うことが、今のAI音楽ツールとの向き合い方として正直だと思う。


ソース