声色を変えても「話し方」は残る——Parakeet中村泰貴が追う「自分らしさ」の輪郭
AIボイスチェンジャー「Paravo」と「AI荒井由実」を手がけるParakeet CEOへのインタビューが公開された。声色と話し方を切り分けるという設計思想は、音楽とアイデンティティの関係を問い直す。
何が起きたか
音声AI開発スタートアップ・Parakeet株式会社のCEO、中村泰貴氏のロングインタビューがリアルサウンドテックに掲載された。
中村氏は2022年の「AI荒井由実」プロジェクト(東京大学・東映との共同開発)に参加し、現在はリアルタイムAIボイスチェンジャー「Paravo」と声紋類似度検出ツール「Paramatch」を展開している。今回のインタビューでは、技術的な詳細よりも「声とは何か」という問いに多くの言葉が割かれている。
なぜこれが重要か
中村氏が語るParavoの設計思想に、核心がある。
「声色は変えても、話し方はあえて残している」
Paravoはリアルタイムで別人の声に変換しながらも、喋るスピード・抑揚・滑舌といった「その人の話し方」は変換しない。声色だけが変わり、喋り方は本人のまま残る——中村氏はこれを「別人になる」ではなく「別人格の自分」と表現した。
これは音楽における問いと同型だ。ある楽器を別の楽器で演奏したとき、それはまだ同じ曲か。あるアーティストの声をAIで再現したとき、それはまだ「その人の歌」か。AI荒井由実プロジェクトで中村氏が直面したのも同じ問いだった。声色を似せるだけでは「本人らしくない」と言われ、ビブラートの深さ、当時特有の歌い方まで細かく調整して初めて「あの頃の荒井由実」が立ち現れた。
似た声ではなく、「あの人らしさ」。その差は技術の問題ではなく、解釈の問題だ。
論点・異なる見方
声の複製・変換技術をめぐる問いは、音楽シーンでも積み重なっている。声優の音声が無断で学習データに使われているのではないかという問題に対し、ParakeetはParamatchで声紋の類似度を検出するツールを開発している。「生成する技術と、見分ける技術の両方が必要」という言い方は、率直だ。
一方で、「誰の声に似ているか」を判定するシステムが普及したとき、それが誰の利益になるかは自明ではない。権利者を守る道具にも、逆に権利主張の道具にも使われうる。
コールセンターで女性オペレーターの声を男性の声に変換してハラスメントを防ぐという活用事例は、技術の射程が想像以上に広いことを示している。エンタメの文脈だけで語るには、すでに現場の問題意識のほうが先に進んでいる。
今後どう展開しそうか
VTuberの多言語展開(本人の声色を保ちながら英語・アラビア語に変換)やテーマパークでのキャラクター対話への応用は、すでに実証段階にある。中村氏が言う「相手の感情に合わせて声のトーンを変える」方向への研究は、音声AIをテキスト→音声の変換から「コミュニケーションそのもの」へと引き上げようとしている。
音楽制作と音声AIの境界は引き続き曖昧になっていく。誰かの声を「本人らしく」再現する技術が成熟すればするほど、「本人らしさとは何か」という問いは回避できなくなる。
作り手・聴き手への示唆
自分の歌声や話し方に自信が持てず、発信を躊躇している人がいる。Paravoはその一部に答えようとしているし、実際に助かっている人がいる。技術が「できること」の範囲を広げるとき、それを誰がどう使うかという問いは、使う人自身に戻ってくる。
「本人らしさ」を守ることと、「本人らしさ」を超えた表現を可能にすること——この二つは矛盾していない、と中村氏の仕事は示唆している。