AIで作った音楽は、ここ1年ほどで「素人には聞き分けられない」と言われるところまで来ました。
ところが同じ生成AIで効果音を作ると、なぜか急に嘘くさく聞こえる。
この違和感は耳の問題ではなく、効果音という仕事の「正解の決まり方」が音楽と根本から違うことに原因があります。
この記事では、まず効果音の正解とは何かを現場の常識から確認し、そのうえで、なぜ今のAIがそこに届かないのかを3つの理由で解説します。
読み終わるころには、AI効果音を任せていい場面と、まだ人の手が要る場面の線が引けるはずです。
目次
効果音の正解は「本物の音」ではない
骨はセロリ、蹄はココナッツ
映画やゲームの効果音の多くが、本物の音から作られていないことをご存じでしょうか。
骨が折れる音はセロリを折って作られることがあり、馬の蹄はココナッツの殻を打ち合わせ、雪を踏む音はコーンスターチの袋を握って録ります。
鳥の羽ばたきは革手袋をはためかせた音で、殴打音は肉の塊や皮ジャケットを叩いた音にハイを足したものが定番です。
なぜ本物を使わないのか。本物の音が「本物らしく聞こえない」からです。
実際のパンチはほぼ無音ですし、骨折の音は小さくくぐもっていて、映像に乗せると拍子抜けしてしまう。
観客の頭の中には、映画の積み重ねで作られた「骨が折れるときの音」のイメージがあって、効果音はそのイメージを本物以上の説得力で鳴らすのが仕事です。
つまり効果音の正解は、現実の音ではなく、聴き手の頭の中にある音なんですね。
音楽は「イメージの的確な再現」が求められる
一方で音楽は、発注者や作り手の頭の中にあるイメージを的確に再現しなければならない仕事です。
「80年代のシンセポップで、切なくて、サビで開ける」と言われたら、その像にぴったり合う音を出す必要があります。
ただし音楽のイメージは、ジャンルや年代という共通言語で何百万曲も記録されているので、言葉で伝えてもかなりの精度で共有できます。
ここに音楽と効果音の決定的な差があります。
音楽の「正解の像」は世の中に大量に記録され、言葉と結びついている。
効果音の「正解の像」は、観客の頭の中と、効果音デザイナーの経験や演出意図に大きく左右される。
AIがどちらを得意とするかは、この時点でほぼ決まっているんです。
嘘くさく聞こえてしまう理由
理由1:効果音の「正解」は言葉では伝えにくい
音の研究で最もよく使われるGoogleのAudioSetは、YouTubeから切り出した10秒の音声クリップ約208万本に527種類のラベルを付けたデータセットです。
これが示しているのは、音響AIの研究では長く「何の音が鳴っているか」を識別するための大規模データが整備されてきた、ということです。
犬の吠え声も、ドアの開閉も、ガラスの割れる音も、現実世界で起きるさまざまな音イベントとして収録されています。
ところが先ほど見たとおり、効果音の正解は本物の音ではありません。
「骨が折れる音」と指示しても、AIに伝わるのはまず「骨折」という言葉であって、映画的にどこまで痛く、鋭く、気持ちよく誇張するかまでは自動では決まらないので、観客が期待する「セロリで作った、あの気持ちいいパキッ」には永遠に届きません。
映画やゲームで実際に使われたデザイン済みの効果音には権利管理された素材も多く、現在の商用生成AIがそうした音をどの程度学習しているかは公開情報だけでは分かりません。
さらにAudioSetの中身は「Music」ラベルのクリップが約101万本と半分近くを占める一方、「Bark(犬の吠え声)」は約2,600本、「Applause(拍手)」は約2,200本しかありません。
人が説明文を書いた代表的データセットAudioCapsも、初代は約4万6,000本規模で、2025年にはその約2倍となるAudioCaps 2.0が公開されました。
量が少なく、しかも学ぶべき「正解」が入っていない。これが出発点の差です。
理由2:「誇張の方向」まで言葉では伝えにくい
2つ目の理由は、生成AIの性質そのものにあります。
AIは同じ指示からさまざまな音を生成できますが、短い言葉だけでは「どの方向に誇張するか」まで伝えにくいです。
音楽ならそれで困りません。
ジャンルの平均は「王道」とほぼ同義ですし、イメージの的確な再現という目的には、むしろ平均が味方になるからです。
効果音は正反対で、デザインの本質が「誇張」にあります。革ジャケットを叩いた音に、低音を足し、立ち上がりを鋭くし、わずかに残響をつけて、現実のどこにもない「映画のパンチ」を作る。
この作業は平均から離れる方向にしか進まないので、平均に寄るAIとは相性が最悪なんです。
わたしはここが、音質の問題より根が深い、構造的な壁だと思っています。
理由3:音楽は粗を隠せて、効果音は隠せない
3つ目は、聴かれ方の違いです。音楽ではドラムもベースもコードも歌も同時に鳴っているので、どこか1つが少し変でも他の音が覆い隠してくれて、しかも聴き手の意識は「次のサビ」に向かっています。
AIの粗が目立ちにくいのは、音楽のこの構造に守られているからです。
効果音は単体で、しかも一瞬で聴かれます。パンチの音の情報は最初の0.1秒ほどの「立ち上がり」に集中していて、人間の耳はここに異様に敏感なので、立ち上がりがぼやけただけで「嘘」だと分かってしまう。
デザイナーが革ジャケットの音の立ち上がりだけを何時間も削るのは、この0.1秒が勝負だと知っているからです。
隠してくれる仲間の音がないぶん、AIの滲みがそのまま耳に届いてしまうわけです。
映像に乗せるなら、同期という壁も加わります。
音楽は多少ずれても誰も気づきませんが、拳が当たる瞬間と衝撃音が数十ミリ秒ずれただけで、観客は違和感を覚える。「本物より本物らしい音」を「正確なタイミング」で、この2つを同時に求められるのが効果音の厳しさなんですね。
実務の線引き:環境音は任せられる、「決めの一発」はまだ
ここまでの理由を裏返すと、AI効果音の使いどころも見えてきます。
雨音、街のざわめき、焚き火、エアコンの低い唸りのような「持続する音」は、誇張をほとんど必要とせず、立ち上がりもなく、映像との同期もいりません。
ElevenLabs Sound Effectsは環境音やFoleyだけでなく、Impact、Whoosh、One-shotなど幅広い効果音生成に対応しており、現在の公式ドキュメントでは1回あたり最大30秒まで生成できます。
逆に、殴る・折れる・割れる・撃つといった「観客の頭の中の音」を鳴らす決めの一発は、まだ素材ライブラリやデザイナーの手に分があります。
動画の空気はAIに任せて、決めの一発だけ人が選ぶ。この分業がいちばん現実的で、違和感もかなり減るはずです。
風向きが変わりつつある「映像から音を作る」AI
ただし、この記事の結論が1年後も同じかというと、たぶん違います。
2025年5月に登場したGoogleのVeo 3は、映像と音を別々に作るのではなく1回の生成で同時に作る方式を採り、効果音を映像の動きに合わせて出せるようになりました。
これで同期の壁は解けはじめています。
そしてもう一つ、わたしが注目しているのは学習データの変化です。
映像つきの音をAIが大量に見るようになると、「現実の録音」ではなく「映画の中でパンチに付けられていた音」を学べる可能性が出てくる。
つまり理由1の壁が、映像生成AIの普及によって裏口から崩れるかもしれない。
誇張の問題は残りますが、効果音こそ次に化ける分野だと、わたしは見ています。
まとめ
AI効果音が嘘くさく聞こえるのは、効果音の正解が「本物の音」ではなく「本物より本物らしい音」だからです。
短い言葉から音を作るAIは、セロリで骨を折るデザイナーのような「どこをどう嘘にするか」という演出意図まで汲み取るのがまだ難しく、しかも効果音は粗を隠す仲間の音がなく、一瞬で嘘が見抜かれます。
だからこそ今は、環境音はAI、決めの一発は人、という線引きが実務的です。
ただしその線は、映像から音を作るAIの登場でもう動きはじめているので、来年また引き直すつもりで読んでおいてください。
