音频工具概述¶
下面这些是进出这两头的辅助工具: 拆伴奏, 抽参考干声, 记谱, 看频谱, 修爆音, 转格式. 它们不替代听感, 只把素材和处理对象准备好.
歌声合成工程里常见顺序:
原曲 / 参考 → 源分离 (伴奏或参考干声) → (可选) 记谱 / 和弦, 对照乐理 → 引擎里调音, 渲干声 → DAW 里 EQ / 压缩 / 空间 → 分析器核对, 导出
源分离¶
把已经缩混的歌曲估成 "人声 / 伴奏" 或 drums / bass / other. 这是模型估计, 不是把混音物理上拆回去: 残响, 齿音, 金属感残留都正常. 输出尽量用 WAV, 再进 AU.
| 用途 | 工具 | 说明 |
|---|---|---|
| 有界面, 先出伴奏 / 干声 | UVR5 | 中文圈翻唱最常用. 伴奏试 UVR-MDX-NET-Inst_HQ_3, 人声试 Kim_Vocal_2 |
| 命令行, 许可证最干净 | Demucs | --two-stems=vocals 只要人声 vs 伴奏; 质量优先 -n htdemucs_ft |
| 批处理 UVR 模型 | audio-separator | 把 UVR 模型变成 CLI / Python 包 |
| 追分离质量 | MSST | 跑 BS-RoFormer 等社区权重; 代码 MIT, 个别 checkpoint 授权要自己看 |
Deezer 的 Spleeter 也开源, 但听感明显落后, 不要当主力.
Demucs 抽伴奏
uv tool install demucs --with numpy
demucs --two-stems=vocals song.wav
分离结果只是素材. 伴奏里常留下人声残影, 干声里常缺空间感 (混响被模型吃掉), 进 AU 仍要 EQ, 去齿音, 补一点混响.
自动记谱¶
音频不会直接变成能练的五线谱. 开源工具的转换链路通常是音频 → MIDI → MusicXML / PDF. 伴奏越复杂, 第一步就越容易出错; 先将不同的乐器拆轨再记, 比换一个更强的记谱模型还重要.
| 用途 | 工具 | 说明 |
|---|---|---|
| 单轨伴奏 → MIDI | Basic Pitch | Spotify, Apache-2.0. 不限乐器, 最好一次只喂一根干轨 |
| 钢琴伴奏 | Transkun / ByteDance 推理包 | 踏板和叠和弦比 Basic Pitch 准; 鼓组和失真吉他不要硬塞 |
| 多乐器一次出分轨 MIDI | MT3 / mt3-infer | 适合问 "这段伴奏里有什么"; 不是出版级分谱 |
| 只要和弦 / 拍 | madmom | 翻唱时常比完整总谱有用 |
| MIDI → 能改的谱 | music21 + MuseScore | MIDI 没有升降记号与声部分组, 自动排出来的谱几乎一定要改 |
Demucs (vocals / drums / bass / other)
→ 钢琴轨: Transkun; 其他单旋律轨: Basic Pitch
→ MuseScore 修谱
开源自动记谱给的是草稿, 仅供调音时的记谱参考, 几乎都需要人工修正. 节奏型越复杂, 效果器越多, 草稿越脏.
DAW与混音宿主¶
混音, 自动化, 挂效果器, 导出成品, 都在这里.
-
Adobe Audition: 波形 / 频谱修复强, 干声 + 伴奏够用; 上限在路由和音乐向工作流, 不在引擎音质.
-
Reaper / Cubase / Pro Tools / Ardour: 总线, VCA, MIDI, 速度图更深. 某件事在 AU 里做不到再换, 还不知道该听什么时换了也会卡住.
插件 (EQ, 压缩, 去齿音, 混响) 是 DAW 里的效果器, 不是另一类独立软件. 格式常见 VST3 / LV2 / CLAP; AU 能加载的以它支持的为准.
分析与计量¶
耳朵决定动多少, 分析器只负责定位. 频谱仪显示的是物理能量, 不是响度; 详见心理声学.
| 看什么 | 典型工具 |
|---|---|
| 频谱 / 波形 | DAW 自带分析器; Spek (文件频谱); Sonic Visualiser |
| 响度 (LUFS) | Youlean Loudness Meter 等; DAW 里的 dBFS 峰值表量的是数字幅度, 不是房间 SPL |
| 相位 / 相关 | DAW 相关表; 单声道检查能立刻暴露被相位吃掉的中频 |
先对参考曲, 再看自己的曲线. 分析器没有 "正确的 EQ 形状".
修复与降噪¶
调音前把气口爆破, 底噪, 齿音炸点清掉, 比事后用 EQ 硬切干净.
-
AU 波形 / 频谱编辑: 对人声干声往往比音乐 DAW 更顺手.
-
开源降噪: RNNoise, DeepFilterNet. 适合对话和底噪, 歌声上容易啃气声和谐波, 要 A/B.
-
棚里常用闭源: iZotope RX. 知道它存在即可.
格式转换¶
数字音频的采样率, 位深度, 声道布局在这一层改. 进 DAW 和分离器之前, 尽量用无损 (WAV / FLAC); 先压成低码率 MP3 再分离, 伪影会更脏.