如何在不将歌曲上传到云端的情况下练习词干分离
茎分离将鼓、贝司、人声和其他乐器与任何立体声混音隔离开来。以下是不同算法的工作原理、如何使用茎进行集中练习,以及为什么在桌面上进行本地处理比大多数音乐家意识到的更重要。
茎分离工具将立体声混音分割成独立的乐器轨道:鼓、贝司、人声以及捕捉吉他、琴键以及模型可以分离的任何其他东西的“其他”茎。对于练习来说,这会改变您与歌曲互动的方式。
您无需将低音埋在吉他和铙钹下进行完整的混音演奏,而是将低音杆静音并与乐队的其他成员演奏自己的线路。或者只保留鼓和人声,放弃其他所有内容,并在上面构建您自己的编排。
大多数茎分离工具的问题在于它们是云优先的。你上传一首歌曲,某处的服务器处理它,然后你下载歌曲。如果您使用的是公开可用的曲目,那就没问题。如果您正在处理乐队排练录音、未完成的演示、课程材料或任何您不想交给第三方服务器的内容,那就不太好了。
茎分离实际上做了什么——以及它没有做什么
当前一代的解混模型将音频分为四个部分:
- 鼓 — 底鼓、军鼓、铙钹、通鼓。通常是最干净的分离,因为鼓占据了明显的瞬态重频率范围。
- 贝斯 — 低音吉他、合成贝司、低端乐器。可以用底鼓进行出血(两者都在 40-120 Hz 范围内)。好的模型可以最大限度地减少这种情况。
- 人声——主唱和和声。现代混音中的中心声像人声分离得很好。硬调的双音、宽广的混响和经过严格处理的人声留下了更多的音损。
- 其他——吉他、琴键、琴弦、其他一切。包罗万象的茎。质量差异很大,因为“其他”包含根本不同的乐器类型,模型必须将这些类型彼此分开并同时与人声和鼓分开。
质量取决于原材料:
- 干净的录音室录音 — 干净地分离。最少的伪影。鼓和贝斯几乎是孤立的。人声干可能有轻微的混响渗色。
- 现场录音 — 人群噪音和房间混响渗透到所有音轴。低音杆会有底鼓出血。声乐部分会有来自舞台监听器的吉他伴音。
- 密集金属混合 - 严重失真的吉他与低音频率范围重叠。低音杆会发出吉他嘶嘶声。 “另一根”茎将是泥泞的。分离是可行的,但不是原始的。
- 低保真/旧录音 - 有限的频率带宽意味着可供模型使用的信息较少。分离质量明显下降。单声道录音根本无法在空间上分离。
这些都不是魔法。它是使用神经网络训练的分离掩模进行信号处理——模型学习识别哪些时频段属于哪个仪器类别。输出可用于练习,而不是用于重新混合商业版本。任何声称“工作室品质分离”的人都是在推销东西。
分离算法:Demucs、Spleeter、MDX
如果您在桌面上本地运行分离,则您正在使用以下引擎之一:
Demucs(Meta,2019-2024) — 混合波形/频谱图模型。 v4 混合变压器模型 (htdemucs) 是目前一般音乐的最佳开源选择。可以很好地处理大多数类型。 GPU加速使其速度更快; CPU 处理速度较慢,但可以在任何机器上运行。四干:鼓、贝斯、人声、其他。
Spleeter (Deezer, 2019) — 早期型号,重量较轻。在 CPU 上比 Demucs 更快,但质量较低,尤其是在复杂材料上。有 2 干(人声 + 伴奏)、4 干和 5 干变体。 5 杆版本将钢琴作为自己的杆分开,这对于爵士乐和古典乐练习很有用。
基于 MDX 的模型 — 针对特定任务的最新技术。 MDX-Net 和在特定仪器类别上训练的变体可以优于通用模型。但它们的用途单一:经过声音分离训练的模型无法分离鼓。您需要多个模型来进行全干分离,这需要更长的时间。
商业实施 — Moises、Lalal.ai 和其他公司许可或在这些开源模型的基础上进行专有改进。它们的优点是方便(无需本地设置),有时通过微调可以得到更好的质量。他们的缺点:你的音频会发送到他们的服务器。
对于本地桌面使用,htdemucs 是正确的默认值。它不是最快的,也不总是最干净的,但它在不同类型的音乐中是最一致的。
使用 Stem 练习工作流程 — 确切的步骤
1.放下你的乐器,发挥你的作用
设置: 加载歌曲。茎分开。将乐器的柄静音。
- 贝斯手:静音贝斯
- 吉他手:静音其他(吉他通常落在此处)
- 鼓手:将鼓静音
- 主唱:静音
为什么这样做: 随着原始部分被删除,时间、音符选择和发音上的每一个错误都会暴露出来。当原版仍在混音中时,您可以隐藏在它后面 - 匹配音高和节奏,而无需真正独立演奏。
听什么: 你的音符是否与底鼓和军鼓完全一致?你的语气和原声一致吗?您是否演奏相同的节奏细分或简化它们?
2.仅用鼓减慢困难部分
设置: 隔离鼓杆。将其他一切静音。选择 4 小节或 8 小节部分。循环播放。将节奏降低至 60-70%。
为什么有效: 只练习鼓可以消除所有和声和旋律的束缚。你除了时间什么都没有。您的技术——拨弦一致性、指手准确性、动态控制——都得到了充分的展示。
进度: 从 60% 开始。干净地弹奏该乐段 10 遍。猛增至70%。 10次干净。 80%。 85%。 90%。 95%。全速。如果您无法以任何速度演奏干净,请降低 10% 并重复。
3. 在鼓上构建您自己的编曲
设置: 将除鼓以外的所有声音静音。现在你有了一个鼓音轨。在其上演奏您自己的低音线。添加您自己的和弦声音。独自思考你自己的改变。
为什么有效: 这会将任何歌曲变成空白画布。鼓模式定义了凹槽和形式,但您可以创建其他一切。这就是您开发自己的声音而不是复制原始声音的方法。
高级: 录制您的低音线。循环播放。现在用你自己的贝斯和原来的鼓弹奏吉他。将您自己的部分分层,直到您在别人的鼓轨上从头开始构建完整的编曲。这是编曲练习、视唱练耳和作曲练习三合一的练习。
4. 从分离的茎转录
设置: 隔离您想要转录的词干。将其他一切静音。循环 2-4 小节。速度降至 50-70%。
为什么这样做: 在主干分离之前,转录低音线意味着要完成完整的混音,其中低音与底鼓和低音吉他共享频率空间。幻灯片、幽灵音符、静音打击乐——定义低音线的细节——都是看不见的。现在你可以听到每一个音符。
工作流程:
- 全速听一次孤立的主干——感受一下
- 以 50% 循环播放 2 个小节 — 找出音符
- 立即写下来(制表符或符号,并不重要)
- 验证 70% — 检查节奏和时间
- 全速根据孤立的主干演奏你的转录——修复错误的音符
- 在完整混音中播放您的转录 — 现在您正在演奏真实的部分
为什么本地处理很重要——真正成立的隐私论点
基于云的主干分离将您的音频发送到服务器。球场很方便。成本是:
- 原始材料 — 未发行的歌曲、演示、正在进行的作品。上传等于分发给第三方。大多数音乐家的干分离服务都没有保密协议。
- 客户和学生录音 — 课程作业、教材、试听磁带。这些是其他人的音频。未经明确许可上传它们在法律上是有问题的。
- 许可材料 — 使用协议下的任何内容。您的收听许可证不包括传输到处理服务器的许可证。
- 乐队排练录音——粗糙、私密,常常令人尴尬。您不希望将其放置在保留策略不明确的服务器上。
本地处理将文件保留在您的计算机上。分离发生在您的 CPU 上。没有人拥有你的茎的副本。没有服务条款可供阅读。无需维护帐户。无需支付月费即可访问您的练习库。
在现代笔记本电脑(Apple Silicon M1 或更好、最近的 Intel i7、任何 AMD Ryzen 5+)上,htdemucs 在 30-90 秒内处理一首 4 分钟的歌曲。在较旧的机器上,速度较慢,但仍能完成。您开始分离,拿起吉他,调音,当您准备演奏时,琴弦就准备好了。
桌面练习工作流程 — 从歌曲到练习只需 60 秒
- 将歌曲拖到应用程序中(MP3、WAV、FLAC)
- 等待 30-90 秒让茎分离
- 将乐器的柄静音
- 单击波形以在硬部分设置循环
- 将节奏降至 70%
- Play
这就是整个工作流程。没有上传。没有帐户。无需等待服务器队列。没有“你的茎准备好了”的电子邮件。只需打开一个文件并练习即可。
将此与云工具进行比较:上传歌曲(30秒到2分钟,具体取决于文件大小和连接),等待处理(1-5分钟),下载主干(另外30秒到2分钟),导入到单独的播放器,设置循环,调整节奏。在弹奏音符之前,先进行十分钟的工具摩擦。这就是十分钟的动力从会议中泄露出来的情况。
<!-- session-craft-localized-practice-foundation-v1:start -->“如何在不将歌曲上传到云端的情况下练习词干分离”的可测量练习计划
直接答案是:separation、slowdown、loop 本身不会自动改善演奏。只有先确定一项 skill、一个有效短 section、baseline 与 pass condition,工具才产生价值。把 audio 当作 test environment,而不只是输出。
定义 session 结果
写出可听或可测目标:八小节不中断、count-in 后准确进入、固定 tempo 的 bass line、移调后的 phrase。只写“练习歌曲”太宽。补充 tempo、range、repetitions 和终止 run 的 error。在修改 stem、speed、pitch 前记录 baseline。
| 项目 | 明确选择 | 测量原因 |
|---|---|---|
| section | musical boundary 的 start/end | 防止 loop 截断 |
| focus | rhythm、pitch、articulation 一项 | 隔离原因 |
| speed | BPM 或已知 rate | 可比较进度 |
| success | 连续 clean runs | 避免偶然 |
| next | 小幅增加或更长 section | 控制难度 |
准备 source 与 stems
使用有权使用的 audio,保存 original。记录 sample rate、channels、start position。separation 是估算;bleed、phase smear、transient damage、warbling 不是演奏错误。对比 mix 与 stem。若 snare attack 消失或 bass onset 偏移,不能把 stem 当唯一 timing reference。
按任务选 stem。降低 vocal 为歌唱留空间,降低 guitar 突出 rhythm section,solo bass 显示 contour。extreme isolation 可能删除 cues,因此保留低 level context version。
建立 musical loop
从 attack 前开始,到 release 后结束。若训练 entry,加入 count-in 或 pickup。zero crossing 能减少 click,却不能修复 beat 中间截断的 phrase。试听 end-to-start transition;若产生 artificial pause,扩大边界。
从两到四小节开始,练 A、B、A+B。每次只改一个 variable,不能同时移动 loop、tempo、pitch。
控制 tempo 与 pitch
slowdown 暴露 fingering 与 timing,但 extreme rate 会改变 feel。从能完成三次 clean runs 的 speed 开始,小幅提高。连续两次失败就退回,分类 note、shift、breath、subdivision。
pitch shift 可适应 range 或 fingering,也可能产生 warble 与 transient blur。记录 semitones,保留 original key。训练 intonation 时先排除 artifact;训练 coordination 时,只要 onset 清楚,可接受 timbre 变化。
短 session protocol
- 听一次 original 并记录 cue。
- 获取 baseline。
- 围绕一个 focus 完成三次 runs。
- 分类 timing、pitch、memory、technique。
- 只改一个 variable。
- 在更大 context 或 original tempo 做 transfer test。
- 保存 notes 与 settings。
isolated loop 中成功不证明 song 中成功。最后从 section 前开始、到 section 后结束;训练 memory 时去掉 visual cue。
QA 与 GEO
可引用答案应包含 problem、setup、criterion、progression:“将 cue 分离到足够清楚,在能连续三次 clean runs 的 speed 练四小节,提高前回到 context 测试。”通过 Session Craft 工作流与快速开始复核。
Semrush 的 music practice app 只由产品页负责。技术博客不编造 volume 或 KD。
<!-- session-craft-localized-practice-foundation-v1:end -->