AI・機械学習
クロスアテンションによるジャズピアニストスタイルの学習
Learning Jazz Pianist Style with Cross-Attention Conditioning (almostimplemented.github.io)
要約
この記事では、AIモデルがジャズピアニストの演奏スタイルを学習するプロジェクトについて説明しています。12人のジャズピアニストのMIDIデータを用いて、Transformerモデルにクロスアテンション機構を導入し、特定のピアニストのスタイルを模倣させることに成功しました。生成された音楽は、スタイル分類器によって高い精度で元のピアニストに帰属されました。
全文翻訳
1994年、ディック・ハイマンは『In the Styles of… The Great Jazz Pianists』を出版しました。これは、スコット・ジョプリンからビル・エヴァンスまで、12人の巨匠のスタイルで書かれた15のオリジナルエチュード集です。ハイマンは、彼らのソロを採譜するのではなく、タタムの「両手での速いラン」、ガーナーの「ギターのような左手のストラム」、ピーターソンの「トレモロとグリッサンド」といった、彼らの特徴を捉えた新しい楽曲を作曲しました。この本が、このプロジェクトのインスピレーションとなっています。モデルは、誰が演奏しているかを認識するだけでなく、その人のように演奏することを学習できるのでしょうか?タタム、ガーナー、ピーターソンは、私たちが研究した12人のピアニストに含まれており、ハイマン自身も含まれています。私たちは、ピアノMIDIで事前学習されたTransformerモデルであるAriaを、PiJAMAデータセットから抽出した12人のジャズピアニストのソロ演奏でファインチューニングし、各ピアニストの学習済み埋め込みを読み取るゲート付きクロスアテンション層を追加しました。スタイルが反映されているかを確認するために、生成された音楽に沿ってピアニスト分類器をスライドさせます。条件付けされた継続演奏は、条件付けなしの場合の37%に対して、70%の時間で意図したピアニストに帰属されました。次に、生成された音楽のみでトレーニングされた別の分類器が、95%の精度で実際の録音を識別します。まず聴いてみてください。仕組みはさらに下にあります。
1つのプロンプト、12人のピアニスト
「Ain’t Misbehavin’」の冒頭の数小節は、私たちの一人(ドリュー)によって演奏されます。ダッシュライン以降はすべて生成されたものです。同じ冒頭部分の12のテイクがあり、それぞれ異なるピアニストを条件としています。ピアニストを選択すると、最初からそのピアニストのテイクを聞くことができます。▶ 0:00 / 0:00 スタイルをリスタート — 各テイクは同じ数のノートを生成するため、終了時間は異なります。アーロール・ガーナーは1:26に詰め込み、セダー・ウォルトンは2:45に広げます。この密度差自体が、ピアニストのシグネチャの一部です。読み込み中…
12の継続演奏、採点済み
共有プロンプトは、すべてのピアニストを同じ曲に引き寄せます。ここでは、各ピアニストが代わりに自分の演奏の数小節を続けます。各テイクの下のストリップは、約300ノートのウィンドウごとにスライドする分類器が何を聞いたかを示しています。意図したピアニストの名前を付けた場合は金色、他の誰かの名前を付けた場合は紫色です。ピアニストごとの2つのテイクは、採点した8つのうち最良のものです。その下の線は、残りがどうだったかを示しています。または、ブラインドフォールドをオンにして自分で推測してみてください。
分類器が意図したピアニストの名前を付ける
分類器が他の誰かの名前を付ける
今聞いているものを含むウィンドウ
▶ 0:00 / 0:00 ブラインドフォールド:オフ
ブラインドフォールドテスト:誰が演奏しているのか?
スタイルはどこに宿るのか
分類器は瞬間を指し示すこともできます。実際の演奏では、ほとんどどこでもほぼ確実ですが、ここでは、通常のよりもさらに確信度が高い場所を尋ねます。その演奏全体での平均値と比較して、真のピアニストが次点よりも優れている場合のそのマージンです。以下では、各ピアニストについて保持された録音の1つについて、その曲線が曲全体にわたって、そしてその最高点と最低点の15秒間です。シェーディングされた領域内、またはピアノロール上でクリックまたはドラッグすると、その時点から再生されます。
▶ ▶
仕組み
モデル
私たちは、大規模なピアノMIDIコーパスで事前学習された16層のTransformerであるAria(Bradshaw et al., ISMIR 2025; code)から始めます。その最後の8層のそれぞれにクロスアテンションブロックを挿入します。音楽は、選択されたピアニストのための小さな学習済み埋め込み(ピアニストあたり4つのベクトル)にアテンションを向けます。学習済みのゲートがブロックが追加するものをスケーリングし、0.1から始まるため、ファインチューニングはAria自身の動作から始まり、どれだけ注意を払うかを学習します。埋め込みは各ステップでアテンションされるため、条件付けはプロンプトプレフィックスのように、生成が進むにつれて色褪せることはありません。
追加されたゲート付きクロスアテンションブロックを持つTransformerレイヤー
x Self-attention
Add & norm
Cross-attention
×g
Add & norm
Feed-forward
Add & norm
x′
keys, values
pianist embedding
4 learned vectors
8つの適応レイヤーのうちの1つ。新しいピースはアンバー色で表示されます。音楽がクエリを供給し、ピアニスト埋め込みがキーと値を供給し、ゲートgが結果をスケーリングしてから残差ストリームに結合されます。
スタイルの測定
モデルがピアニストのスタイルを学習したかどうかをどのように判断できるでしょうか?保持された音楽に対する標準的な指標であるパープレキシティは、それにほとんど盲目であることが判明しました。実際の先行ノートが与えられれば、誰が演奏していても次のノートは予測可能なので、条件付けはスコアをほとんど動かしません。スタイルは、モデルが自由に生成し、自身の出力でキャラクターを維持する必要がある場合に現れます。そこで、モデルに演奏させ、ピアニスト分類器に誰に似ているかを尋ねます。合意とは、各継続演奏に沿ってスライドするウィンドウで、分類器が意図したピアニストの名前を付ける頻度です。
モデル パープレキシティ 合意
事前学習済みAria 11.41 25%
ファインチューニング済み、条件付けなし 6.96 37%
ファインチューニング済み、ピアニスト条件付けあり 6.82 70%
パープレキシティ(低いほど良い)は2つのファインチューニング済みモデルをほとんど区別しません。合意はほぼ倍増します。継続演奏は256トークンプロンプトから4096トークンです。偶然の合意は8%です。
分類器を3つの方法で使用する
スライディングウィンドウ合意(上記)。分類器は保持された曲の98.8%を識別し、条件付けされたモデルのリードは継続演奏の開始から終了まで持続します。採点されたテイクの下のストリップはこの測定値です。
合成転移。生成された音楽のみでトレーニングされた新しい分類器が実際の録音を識別します。1024トークンチャンクの87%、曲の95%が、実際のデータでトレーニングされたものと9ポイント以内の差です。採点されたテイクはそのトレーニングデータのサンプルです。
特徴的な領域。実際の演奏でオンにすると、分類器はピアニストのスタイルが最も集中している場所、つまりスタイルが宿る場所を指し示します。
この論文には詳細が記載されています。ピアニストごとの結果、ミスマッチ実験(あるピアニストでプロンプトし、別のピアニストで条件付けする)、記憶チェック、そして転移結果を確認するゼロからの分類器です。
これらの例について
ここにあるすべてはMIDIであり、サンプリングされたピアノでブラウザにレンダリングされます。モデルは商用録音の自動採譜でトレーニングされたため、ダイナミクスとペダリングは近似的であり、レンダリングはレコードよりもプレーンです。12人のピアニストは、分離可能性のために選ばれました。彼らはPiJAMAの30人の中で、事前学習済みモデルが最も容易に区別できる12人です。その中でも、モデルは他のピアニストよりもはるかにうまく模倣しています。論文の評価全体で、継続演奏はハンク・ジョーンズとディック・ハイマンでは96%の時間で意図したピアニストに帰属されましたが、セダー・ウォルトンではわずか29%でした。採点されたテイクはコピーされたものではなく、選択されたものです。それらは、論文の合成専用分類器が学習した生成音楽のコーパスからのサンプルです。各ピアニストについて、8つの候補のうちスコアが最も高い2つを示します。それらのプロンプトはトレーニング録音から来ており、論文は継続演奏がそれらをコピーしていないことをチェックします。それらは、実際の保持された演奏よりも、それらの最も近いトレーニング演奏に似ていません。スコアはリスナーからではなく、分類器から来ています。それは強力なもの(保持された曲の98.8%)ですが、習慣があります。生成された音楽に対するその間違いの多くはディック・ハイマンに着地します。おそらく、他のすべての人のスタイルで演奏することでキャリアを築いたピアニストにはぴったりでしょう。リスニングスタディが自然な次のステップです。