曲をクラウドにアップロードせずにステム分離で練習する方法

ステム分離により、ドラム、ベース、ボーカル、その他の楽器がステレオミックスから分離されます。ここでは、さまざまなアルゴリズムがどのように機能するか、集中的な練習にステムを使用する方法、デスクトップ上でローカルに処理することがほとんどのミュージシャンが認識している以上に重要である理由を説明します。

ステム分離, 音楽練習, オフライン, プライバシー, デスクトップ, Demucs, Spleeter

ステム分離ツールは、ステレオ ミックスを分離された楽器トラック (ドラム、ベース、ボーカル、およびギター、キー、その他モデルが分離できるものすべてを捉える「その他の」ステム) に分割します。練習の場合、これにより曲との関わり方が変わります。

ベースがギターやシンバルの下に埋もれてしまうフルミックスに合わせて演奏するのではなく、ベースステムをミュートして、バンドの残りの部分に対して独自のラインを演奏します。または、ドラムとボーカルだけを残し、他のすべてを削除して、その上に独自のアレンジメントを構築することもできます。

ほとんどの語幹分離ツールの問題は、それらがクラウドファーストであることです。曲をアップロードすると、どこかのサーバーがそれを処理し、ステムをダウンロードします。公開されているトラックを使用する場合は問題ありません。バンドのリハーサル録音、未完成のデモ、レッスン素材、またはサードパーティのサーバーに渡したくないものを扱う場合は、それほど問題はありません。

ステム分離が実際に行うことと行わないこと

現世代のデミックス モデルは、オーディオを 4 つのステムに分割します。

  1. ドラム — キック、スネア、シンバル、タム。ドラムは明確なトランジェントの多い周波数範囲を占有するため、通常は最もきれいな分離になります。
  2. ベース — ベースギター、シンセベース、ローエンド楽器。キックドラムでブリードする可能性があります (どちらも 40 ~ 120 Hz の範囲内に存在します)。優れたモデルはこれを最小限に抑えます。
  3. ボーカル — リードボーカルとバッキングボーカル。モダンなミックスのセンターパンされたボーカルはよく分離します。ハードパンされたダブル、幅の広いリバーブ、大幅に処理されたボーカルは、より多くのアーティファクトを残します。
  4. その他 — ギター、キー、弦、その他すべて。キャッチオールステム。 「その他」には根本的に異なる種類の楽器が含まれており、モデルではこれらの楽器を相互に分離し、同時にボーカルやドラムからも分離する必要があるため、品質は大きく異なります。

品質はソース素材によって異なります。

  • クリーンなスタジオ録音 — きれいに分離します。最小限のアーティファクト。ドラムとベースはほぼ分離されています。ボーカルステムにわずかなリバーブブリードが発生する場合があります。
  • ライブ録音 — 群衆の騒音と部屋の残響がすべてのステムに響き渡ります。ベースステムにはキックドラムのブリードが発生します。ボーカルステムにはステージモニターからのギターのブリードが含まれます。
  • 濃密なメタルミックス — 大きく歪んだギターが低音域の周波数範囲に重なっています。ベースステムにはギターのフィズが発生します。 「もう一方」の茎は濁ります。分離は可能ですが、完全な状態ではありません。
  • ローファイ/古い録音 - 周波数帯域幅が限られているため、モデルが使用できる情報が少なくなります。分離品質が著しく低下します。モノラル録音は空間的にまったく分離できません。

これはどれも魔法ではありません。これは、ニューラル ネットワークでトレーニングされた分離マスクを使用した信号処理です。モデルは、どの時間周波数ビンがどの機器クラスに属するかを識別することを学習します。出力は練習用に使用でき、商用リリースのリミックスには使用できません。 「スタジオ品質の分離」を主張する人は、何かを売りつけているのです。

分離アルゴリズム: Demucs vs Spleeter vs MDX

デスクトップ上でローカルに分離を実行している場合は、次のエンジンのいずれかを使用しています。

Demucs (Meta、2019-2024) — ハイブリッド波形/スペクトログラム モデル。 v4 ハイブリッド トランスフォーマー モデル (htdemucs) は、現在、一般的な音楽に最適なオープンソース オプションです。ほとんどのジャンルをうまく処理します。 GPU アクセラレーションにより高速化されます。 CPU の処理は遅くなりますが、どのマシンでも動作します。 4 つのステム: ドラム、ベース、ボーカル、その他。

Spleeter (Deezer、2019) — 初期のモデル、軽量。 CPU では Demucs よりも高速ですが、特に複雑なマテリアルでは品質が低くなります。 2 ステム (ボーカル + 伴奏)、4 ステム、および 5 ステムのバリエーションがあります。 5 ステムバージョンはピアノを独自のステムとして分離しており、ジャズやクラシックの練習に役立ちます。

MDX ベースのモデル — 特定のタスク向けの最新技術。 MDX-Net と特定の機器クラスでトレーニングされたバリアントは、一般的なモデルよりも優れたパフォーマンスを発揮します。しかし、それらは単一目的であり、ボーカルの分離のためにトレーニングされたモデルはドラムを分離しません。ステムを完全に分離するには複数のモデルが必要であり、時間がかかります。

商用実装 — Moises、Lalal.ai などは、これらのオープンソース モデルにライセンスを供与するか、独自の改良を加えてその上に構築しています。利点は利便性 (ローカル設定が不要) と、場合によっては微調整による品質がわずかに向上することです。欠点は、音声がサーバーに送信されることです。

ローカル デスクトップで使用する場合、htdemucs が正しいデフォルトです。これは最も速いわけではありませんし、常に最もクリーンなわけでもありませんが、さまざまなタイプの音楽にわたって最も一貫性があります。

ステムを使用したワークフローの練習 - 正確な手順

1. 楽器を置いて自分のパートを演奏してください

セットアップ: 曲をロードします。茎を分離します。楽器のステムをミュートします。

  • ベーシスト:ミュートベース
  • ギタリスト: ミュート その他 (ギターは通常ここに着地します)
  • ドラマー: ミュートドラム
  • ボーカリスト: ミュートボーカル

これが機能する理由: 元のパートが削除されると、タイミング、音の選択、アーティキュレーションにおけるあらゆる間違いが明らかになります。オリジナルがまだミックスされているので、その後ろに隠れて、実際に独立して演奏することなくピッチとリズムを合わせることができます。

注意すべき点: ノートはキックとスネアに正確に着地していますか?あなたのトーンはオリジナルと一致していますか?同じリズミカルな細分化を演奏していますか、それとも単純化していますか?

2. ドラムのみでハードセクションを減速する

セットアップ: ドラムステムを分離します。それ以外はすべてミュートします。 4 小節または 8 小節のセクションを選択します。ループさせてください。テンポを 60 ~ 70% に落とします。

これが機能する理由: ドラムのみの練習では、ハーモニックおよびメロディーの松葉杖がすべて削除されます。あなたには時間しかありません。ピッキングの一貫性、フレットハンドの正確さ、ダイナミックなコントロールなど、あなたのテクニックがすべて明らかになります。

進行状況: 60% から開始します。パッセージを 10 回クリーンに演奏します。 70% まで上昇します。 10回きれいになりました。 80%。 85%。 90%。 95%。全速力。どのテンポでもきれいに演奏できない場合は、10% 下げて繰り返します。

3. ドラムで独自のアレンジを構築する

セットアップ: ドラム以外のすべてをミュートします。これでドラムトラックが完成しました。その上で独自のベースラインを演奏します。独自のコードボイシングを追加します。自分自身の変更をソロで確認します。

これが機能する理由: これにより、あらゆる曲が空白のキャンバスに変わります。ドラムのパターンはグルーヴとフォームを定義しますが、それ以外はすべて自分で作成します。これは、オリジナルをコピーするのではなく、自分の声を開発する方法です。

上級: ベースラインを録音します。ループさせてください。次に、自分のベースとオリジナルのドラムの上でギターを演奏します。他の人のドラムトラックの上に完全なアレンジメントをゼロから構築するまで、独自のパートを重ねていきます。アレンジの練習、耳のトレーニング、作曲作業がひとつの練習で行えます。

4. 分離した茎から転写する

セットアップ: 転写したい語幹を分離します。それ以外はすべてミュートします。 2〜4小節をループします。速度を 50 ~ 70% に落とします。

これが機能する理由: ステムを分離する前は、ベースラインを転写するということは、ベースがキックドラムやローギターと周波数空間を共有するフルミックスを戦い抜くことを意味していました。スライド、ゴーストノート、ミュートヒットなど、ベースラインを定義する細部は目に見えませんでした。これで、すべての音を聞くことができます。

ワークフロー:

  1. 孤立したステムをフルスピードで一度聴いて、その感触を掴んでください
  2. 2 小節を 50% でループ — ノートを理解する
  3. すぐに書き留めてください(タブ記号か表記法は関係ありません)
  4. 70% で検証 — リズムとタイミングをチェックします
  5. 分離されたステムに対してトランスクリプションをフルスピードで再生します - 間違ったノートを修正します
  6. フル ミックスに対して転写を再生します。これで、実際のパートを演奏できるようになります。

ローカル処理が重要な理由 — 実際に支持されるプライバシーの議論

クラウドベースのステム分離により、オーディオがサーバーに送信されます。ピッチは便利です。費用は次のとおりです。

  • オリジナル素材 — 未発表曲、デモ、進行中の作品。アップロードは第三者への配布に相当します。ほとんどのミュージシャンはステム分離サービスに関して NDA を締結していません。
  • クライアントと生徒の録音 — セッション作品、教材、オーディションテープ。これらは他の人の音声です。明示的な許可なしにそれらをアップロードすることは法的に問題があります。
  • ライセンスされた素材 — 使用契約に基づくもの。リッスンするライセンスには、処理サーバーに送信するライセンスは含まれていません。
  • バンドのリハーサル録音 — 荒々しく、プライベートで、しばしば恥ずかしいものです。不明確な保持ポリシーを持つサーバー上に置いておきたいものではありません。

ローカル処理では、ファイルがマシン上に保持されます。分離は CPU 上で行われます。あなたのステムのコピーを持っている人は誰もいません。読む必要のある利用規約はありません。維持するアカウントがありません。月額料金なしで練習用ライブラリにアクセスし続けることができます。

最新のラップトップ (Apple Silicon M1 以降、最近の Intel i7、AMD Ryzen 5+) では、htdemucs は 4 分の曲を 30 ~ 90 秒で処理します。古いマシンでは速度は遅くなりますが、それでも完了します。分離を開始し、ギターを手に取り、チューニングすると、演奏する準備が整うまでにステムの準備が整います。

デスクトップ練習ワークフロー — 60 秒で曲からセッションまで

  1. 曲をアプリにドラッグします (MP3、WAV、FLAC)
  2. ステムが分離されるまで 30 ~ 90 秒待ちます
  3. 楽器のステムをミュートします
  4. 波形をクリックしてハードセクションにループを設定します
  5. テンポを 70% に落とす
  6. Play

それがワークフロー全体です。アップロードはありません。アカウントがありません。サーバーキューを待つ必要はありません。 「ステムの準備ができました」というメールはありません。ファイルを開いて練習するだけです。

これをクラウド ツールと比較すると、曲のアップロード (ファイル サイズと接続に応じて 30 秒から 2 分)、処理を待機 (1 ~ 5 分)、ステムのダウンロード (さらに 30 秒から 2 分)、別のプレーヤーへのインポート、ループの設定、テンポの調整が行われます。音を弾く前に 10 分間ツールを摩擦します。それは、セッションからモチベーションが漏れ出てくる10分間です。

<!-- session-craft-localized-practice-foundation-v1:start -->

「曲をクラウドにアップロードせずにステム分離で練習する方法」の測定可能な練習計画

direct answer は、separation、slowdown、loop だけで演奏は改善しないことです。一つの skill、短い有効 section、baseline、pass condition を決めて初めて役立ちます。audio を単なる output ではなく test environment にします。

session result を定義

八小節を止まらず演奏、count-in 後の正確な entry、固定 tempo の bass line、移調した phrase など、聞ける goal を書きます。「曲を練習」は広すぎます。tempo、range、repetition、run を止める error を追加し、stem、speed、pitch 変更前に baseline を取ります。

項目 選択 理由
section musical boundary の start/end 切れた loop を防ぐ
focus rhythm、pitch、articulation 一つ 原因を分離
speed BPM または既知 rate 比較可能
success 連続 clean runs 偶然を防ぐ
next 小さな増加または長い section 負荷を制御

source と stems

利用権のある audio を使い original を保存します。sample rate、channels、start position を記録します。separation は推定で、bleed、phase smear、transient damage、warbling は performance error ではありません。mix と stem を比較し、snare attack や bass onset が変わる場合は唯一の timing reference にしません。

task に合わせて stem を選びます。vocal を下げて歌う空間を作る、guitar を下げ rhythm section を聞く、solo bass で contour を見るなどです。extreme isolation は cue を消すため、低 level の context version を残します。

musical loop

attack より少し前から release 後まで取ります。entry が skill なら count-in や pickup を含めます。zero crossing は click を減らしても beat 中央で切れた phrase は直しません。end-to-start transition を聞き、人工 pause があれば margin を広げます。

二〜四小節から始め、A、B、A+B と統合します。一試験で一変数だけ変え、loop、tempo、pitch を同時に変えません。

tempo と pitch

slowdown は fingering と timing を示しますが極端だと feel が変わります。三 clean runs ができる speed から小さく上げます。二回失敗したら戻り、note、shift、breath、subdivision を分類します。

pitch shift は range や fingering に便利ですが warble と transient blur を作ります。semitones を記録し original key を残します。intonation では artifact を先に確認し、coordination では onset が明瞭なら timbre 変化を許容できます。

short protocol

  1. original を一度聞き cue を書く。
  2. baseline を取る。
  3. 一 focus で三 runs。
  4. timing、pitch、memory、technique に分類。
  5. 一変数を変更。
  6. 広い context または original tempo で transfer test。
  7. notes と settings を保存。

isolated loop の成功は song 内成功を証明しません。section 前から後まで演奏し、memory なら visual cue を外します。

QA と GEO

引用可能な答えは problem、setup、criterion、progression を含みます。「cue を聞ける程度に分離し、三 clean runs ができる speed で四小節を練習し、上げる前に context test」を使えます。Session Craft workflowsquickstartを確認します。

Semrush の music practice app製品ページだけが owner です。この記事に未測定 volume や KD を追加しません。

<!-- session-craft-localized-practice-foundation-v1:end -->