Synthesia、記者の対話型分身を作成

クラウド音声

制作の仕組み

写真と2分間の音声で制作
4種類のモデル連携
回答範囲を記事に限定

事業での用途

企業研修への活用
自社クラウドでの運用

体験で見えた課題

声と外見に残る違和感
報道の信頼性が焦点
詳細を読む

2026年9月、TechCrunchの記者はニューヨークのSynthesia新オフィスで、自身の対話型デジタル分身を制作しました。多数の写真と2分間の音声を収録し、自ら書いたベンチャー企業の不正に関する記事を学習対象に設定。同社が広報責任者以外の人物向けに作った初の事例で、読者は記事について本人の姿と声を模した分身に質問できます。

制作には音声認識、言語モデル、音声合成、映像生成を組み合わせています。音声を文字に変え、言語モデルが内容を解釈して回答を作り、合成音声とSynthesiaの映像モデルで話す姿を動かす仕組みです。完成までは数日かかりました。

対話型アバターは回答範囲を一つの記事に限定した決定論的な設計です。記者の前職や居住地など対象外の質問には答えず、記事の話題へ戻しました。個人情報を勝手に語らない一方、自由な会話はできません。

Synthesiaは、台本を読む従来型アバター、調査やロールプレーで対話する「Sessions」、外部技術と組み合わせるAPIの3系統を提供しています。企業は同社または自社指定のクラウドで運用でき、音声などに他社モデルも選べます。販売練習では受け答えと評価に活用できます。

記者本人は、個人用アバターの声はかなり正確だと感じましたが、友人は対話型の声や外見に本人との差を感じ、興味深さと不気味さの両方を指摘しました。家族が本人しか知らない質問をしても回答せず、範囲制限は機能しました。

今回の体験は、アバターが休暇中の問い合わせ対応などを補助する可能性を示す一方、報道を代替できるかという問いも突きつけます。記者は、取材の中心にある人とのつながりや信頼はAIへ外注できないと結論づけました。また、自由回答型なら利用者が過度に意味を見いだす可能性にも懸念を示しています。