AI音楽の次は「リアルタイム生成」——ゲーム音楽はとっくに変化している。ではAIは何を変えるのか

スーパーマリオで残り時間が少なくなると、音楽が急に速くなる。

あの瞬間を覚えている人は多いはずで、実はこれこそ「状況に合わせて変わる音楽」の最も有名な例です。

ゲームの音楽は、プレイヤーの状況を見て姿を変える仕組みを、40年前から持っていました。

だから「AIでゲーム音楽がリアルタイムに変わる時代が来る」という言い方は、現場を知る人から見ると少しずれています。

変わること自体はとっくに実現していて、本当の問いは「AIはそこに何を足すのか」のほうなんです。

この記事では、ゲーム音楽がすでにどこまで変化できているのかを確認したうえで、AIが変える部分、まだ足りない部分、そして作曲家の備えを順に考えていきます。

ゲーム音楽は、とっくに「変わる」のが当たり前

変化する音楽の歴史は、AIより40年古い

ファミコンの音楽は録音ではなく、本体の音源チップがその場で音を鳴らしていたので、残り時間に応じてテンポを変えることは技術的にごく自然でした。

1991年のLucasArtsのiMUSEは、場面の切り替わりに合わせて曲を小節の区切りで滑らかにつなぐ仕組みを実現し、「変化する音楽」を設計として確立しています。

CD-ROMで録音済みの豪華な音源が使えるようになると、一時期は「流すだけ」の音楽が増えました。

ただそれは短い寄り道で、WwiseやFMODといった音の制御ソフト(ミドルウェア)が普及してからは、録音された音楽を部品のように組み替えて鳴らすのが標準になっています。

Wwiseで今できること

いまのゲームでは、作曲家がドラム・ベース・ストリングスといったパーツを分けて納品し、Wwiseが敵の数や体力、場所といったゲーム内の数値に応じて、パーツの足し引き(レイヤー)、曲の区間の並べ替え、テンポや音程の変化、小節や拍の頭に合わせた切り替えをその場で行います。

Mass Effectのように戦闘が激しくなるほど音が厚くなるのも、Witcher 3で環境音の上に戦闘用のレイヤーが重なるのも、この仕組みの上に乗っています。

つまり「曲の長さも音程も展開もリアルタイムで動く」のは、10年以上前から現場の日常です。

ここを「AIで初めて実現する」と書いている記事が多いので、まずはこの現実を押さえておきたいと思います。

ただし、誤解しないでほしいこともあります。

ゲーム1作品に200曲あったとして、こうしてばらばらに組み替えられる曲はそのうちほんの数曲で、作品によっては1曲もありません。

大半の曲は、昔ながらに頭から終わりまで書かれた1曲として鳴っています。

変化する音楽は「できる」けれど、「すべての曲がそうなっている」わけではない。

この現実は、AIの話に進む前に押さえておくべき前提です。

ではAIは何を変えるのか——「作っていない音」を鳴らすこと

Wwiseが動かせるのは、作曲家があらかじめ作って納めた音だけです。

ここに現場の限界があって、変化のパターンを細かくするほど用意すべきパーツは指数的に増え、ある研究者が「なぜアダプティブミュージックはどこにでもあるわけではないのか」と問うほど、作曲家の負担が重い。

先ほどの「200曲中の数曲」という現実も、この負担の重さが理由のひとつです。

戦闘の変化を5段階、10段階と細かくするほど、それに対応できるレイヤーや区間、遷移パターンを人が用意する負担は増えていきます。

AIのリアルタイム生成が変えるのは、この一点です。

Wwiseは「配置」の技術で、AIは「生成」の技術。用意されていない31段階目を、その場で作って鳴らせる。

言い換えると、作曲家の仕事は「すべてのパターンを書くこと」から「音楽の方向性を決めること」に変わる可能性があるわけです。

Googleが作った「演奏できるAI」の現在地

2025年8月、Google DeepMindとMagentaチームは「Live Music Models(ライブ音楽モデル)」という論文を発表し、音楽には録音された完成品としての形と、その場で演奏される生きた形の2つがあると整理しました。

後者をAIで扱うのがLyria RealTime(クラウドAPI)とMagenta RealTime(手元のPCで動くオープンウェイト版)で、途切れない音楽の流れを出し続けながら、途中で指示を変えられるのが特徴です。

Googleの公式ページによると、Lyria RealTimeは操作を変えてから音に反映されるまで最大2秒で、テンポ・明るさ・音の密度・キーといったパラメータを演奏中に動かせます。

Wwiseで作曲家が用意したパーツを動かすのと同じ感覚で、AIに「今ここで作っている音」を動かせるようになったと考えると分かりやすいでしょう。

公開版のMagenta RealTimeは約19万時間のストック音楽(主に欧米の器楽曲)で学習され、制御の遅延はおよそ3秒でした。これだと戦闘開始の瞬間には間に合いません。

2026年6月にGoogle Magentaが公開したMagenta RealTime 2では、制御遅延が約200ミリ秒まで縮まり、MIDI・音声・文章の3種類で操作でき、Apple SiliconのMacで動くDAWプラグインまで用意されています。

200ミリ秒は、テンポ75前後なら16分音符ひとつ分。

わたしはこの数字を見て、初めて「Wwiseの隣に置ける道具になった」と感じました。

心拍連動は「生成」ではなく「配置」で動いている

体の状態に合わせる方向では、Endelというアプリが先を走っています。

2018年に始まったこのサービスは、時刻・天気・位置情報・心拍に反応して集中・リラックス・睡眠用のサウンドスケープを生成し、Apple Watch単体でも動作することで2020年のApple Watch年間最優秀アプリに選ばれました。

ただし中身は、あらかじめ人間が設計した音の要素やルールを、入力に応じてリアルタイムに組み替えていく方式です。

つまり発想としては、ゲームでWwiseがやっている「用意した素材を状況に応じて変化させる」方式に近く、AIが波形そのものを作り続ける「生成」ではありません。

心拍に合わせて音が変わる商品は成立しているけれど、心拍に合わせて、生成AIが波形そのものをゼロから作曲し続ける仕組みは、少なくとも一般的な製品としてはまだ珍しいです。

この2つを混同している記事が多いので、はっきり分けておきます。

技術的に、まだ何が足りないのか

Wwiseが10年以上かけて積み上げてきたものを、生成AIはまだ持っていません。

ひとつは「小節に沿って切り替える作法」です。Wwiseなら、戦闘が始まっても次の小節の頭、あるいはフレーズの切れ目まで待ってから曲を切り替える、という設定を人が作り込めます。

流れ続けるAIにその判断を任せるのはまだ難しく、遅延が0.2秒になっても「音楽的に正しいタイミング」で変わるかどうかは別の問題なんです。

ふたつめは「テーマの記憶」。

ゲーム音楽の感動の多くは、序盤に聴いた主人公のテーマが終盤に姿を変えて戻ってくる構造から生まれますが、リアルタイム生成AIは「今この瞬間に自然な音」を出すのは得意でも、2時間前の旋律を覚えていて再登場させる設計にはなっていません。

みっつめは現実的な話で、家庭用ゲーム機のCPUやGPUは映像で手いっぱいなので、音楽のためにAIを常時動かす余裕がほとんどないこと。

クラウドに投げれば遅延が増え、オフラインでは動かない。学習データが欧米の器楽曲に偏っていることも、和の響きや歌ものを求める日本の現場では無視できません。

「口ずさめない音楽」というリスク

もうひとつ、技術とは別の問題があります。

ドラゴンクエストやファイナルファンタジーの曲は、30年たっても誰もが口ずさめます。

ところが毎回姿を変える生成音楽は、原理的に「あの曲」として記憶に残りません。

Wwiseの時代でも、作曲家が書いたテーマがあるからこそ、どれだけ組み替えても「あの曲」だと分かりました。

生成が進むほど、ゲーム音楽が文化として残らなくなる危険がある。

わたしはここが、技術の遅延より深い問題だと考えています。

便利さの先にあるのが「誰の記憶にも残らない、気持ちいいだけの音」だとしたら、それは進歩と呼べるのか、という問いです。

作曲家は、どう備えるべきか

ここまでを踏まえると、作曲家がすべきことはかなりはっきりしています。

わたし自身、2005年にはもう打ち込みで曲を作っていましたが、当時は音楽が「完成品」であることを疑いもしませんでした。

それがいま、「流れ続ける音楽の方向性を決める」仕事に変わろうとしているのを見ると、戸惑いよりも先に面白さを感じます。

本当に難しいのは、パーツを分けることではなく、どの組み合わせで鳴っても、どの小節で切られても、曲として成立する書き方です。戦闘用のレイヤーが探索用の伴奏の上に乗ったときに和声が濁らないか、曲のどの区間から別の区間へ飛んでも違和感がないか、静かな場面と激しい場面で同じテーマがどちらにも聞こえるか。

1曲を頭から終わりまで書く力とは別の、「ばらばらにされる前提で設計する力」が要求されます。

先ほど書いたとおり、この書き方が求められるのは200曲のうちの数曲ですが、その数曲が作品の顔になることが多いんです。

AIのリアルタイム生成が入ってくると、この力の使いどころが一段上がります。

自分の旋律をAIに素材として渡したとき、どれだけ姿を変えられても「自分の曲」だと分かる強さがテーマにあるか。

「緊張度が上がる」という数値を、自分の音楽の言葉ではどう鳴らすのかを、AIに教えられる形で言語化できるか。

わたしはこの2つが、これからの作曲家の腕の差がいちばん出る場所だと思っています。

だからこそ、テーマを書ける力は手放せません。AIが苦手な「記憶に残る旋律」と「物語との結びつき」こそ、人間の作曲家が最後まで持ち続ける武器になります。

作曲家の仕事は消えるのではなく、川の流れを設計し、その中で光る石を置く人に変わっていく。わたしにはそれが、むしろ腕の見せどころに見えています。

まとめ

ゲーム音楽が状況に合わせて変わるのは、ファミコンの時代から始まり、Wwiseなどのミドルウェアで10年以上前に日常になりました。

ただし実際に組み替えられる曲は作品の中のごく一部で、大半は今も1曲として書かれています。

AIのリアルタイム生成が変えるのは「変化すること」ではなく「用意していない音をその場で作ること」で、Googleのモデルは遅延2秒から0.2秒へ縮まり、Endelは心拍連動を毎日の商品にしています。

一方で、小節に沿った切り替え、テーマの記憶、ゲーム機の計算資源、そして「口ずさめる曲が残るか」という問題は残っています。

ばらばらにされる前提で設計し、人にしか書けない旋律を磨く。固定の1曲を作る競争はAIに任せて、流れる音楽の設計者になる準備を始めておきましょう。