Skip to content

音频工具概述

调音发生在歌声合成引擎里, 混音发生在DAW里.

下面这些是进出这两头的辅助工具: 拆伴奏, 抽参考干声, 记谱, 看频谱, 修爆音, 转格式. 它们不替代听感, 只把素材和处理对象准备好.

歌声合成工程里常见顺序:

原曲 / 参考 → 源分离 (伴奏或参考干声) → (可选) 记谱 / 和弦, 对照乐理 → 引擎里调音, 渲干声 → DAW 里 EQ / 压缩 / 空间 → 分析器核对, 导出

源分离

把已经缩混的歌曲估成 "人声 / 伴奏" 或 drums / bass / other. 这是模型估计, 不是把混音物理上拆回去: 残响, 齿音, 金属感残留都正常. 输出尽量用 WAV, 再进 AU.

用途 工具 说明
有界面, 先出伴奏 / 干声 UVR5 中文圈翻唱最常用. 伴奏试 UVR-MDX-NET-Inst_HQ_3, 人声试 Kim_Vocal_2
命令行, 许可证最干净 Demucs --two-stems=vocals 只要人声 vs 伴奏; 质量优先 -n htdemucs_ft
批处理 UVR 模型 audio-separator 把 UVR 模型变成 CLI / Python 包
追分离质量 MSST 跑 BS-RoFormer 等社区权重; 代码 MIT, 个别 checkpoint 授权要自己看

Deezer 的 Spleeter 也开源, 但听感明显落后, 不要当主力.

Demucs 抽伴奏

uv tool install demucs --with numpy
demucs --two-stems=vocals song.wav

分离结果只是素材. 伴奏里常留下人声残影, 干声里常缺空间感 (混响被模型吃掉), 进 AU 仍要 EQ, 去齿音, 补一点混响.

自动记谱

音频不会直接变成能练的五线谱. 开源工具的转换链路通常是音频 → MIDI → MusicXML / PDF. 伴奏越复杂, 第一步就越容易出错; 先将不同的乐器拆轨再记, 比换一个更强的记谱模型还重要.

用途 工具 说明
单轨伴奏 → MIDI Basic Pitch Spotify, Apache-2.0. 不限乐器, 最好一次只喂一根干轨
钢琴伴奏 Transkun / ByteDance 推理包 踏板和叠和弦比 Basic Pitch 准; 鼓组和失真吉他不要硬塞
多乐器一次出分轨 MIDI MT3 / mt3-infer 适合问 "这段伴奏里有什么"; 不是出版级分谱
只要和弦 / 拍 madmom 翻唱时常比完整总谱有用
MIDI → 能改的谱 music21 + MuseScore MIDI 没有升降记号与声部分组, 自动排出来的谱几乎一定要改
Demucs (vocals / drums / bass / other)
 → 钢琴轨: Transkun; 其他单旋律轨: Basic Pitch
 → MuseScore 修谱

开源自动记谱给的是草稿, 仅供调音时的记谱参考, 几乎都需要人工修正. 节奏型越复杂, 效果器越多, 草稿越脏.

DAW与混音宿主

混音, 自动化, 挂效果器, 导出成品, 都在这里.

  • Adobe Audition: 波形 / 频谱修复强, 干声 + 伴奏够用; 上限在路由和音乐向工作流, 不在引擎音质.

  • Reaper / Cubase / Pro Tools / Ardour: 总线, VCA, MIDI, 速度图更深. 某件事在 AU 里做不到再换, 还不知道该听什么时换了也会卡住.

插件 (EQ, 压缩, 去齿音, 混响) 是 DAW 里的效果器, 不是另一类独立软件. 格式常见 VST3 / LV2 / CLAP; AU 能加载的以它支持的为准.

分析与计量

耳朵决定动多少, 分析器只负责定位. 频谱仪显示的是物理能量, 不是响度; 详见心理声学.

看什么 典型工具
频谱 / 波形 DAW 自带分析器; Spek (文件频谱); Sonic Visualiser
响度 (LUFS) Youlean Loudness Meter 等; DAW 里的 dBFS 峰值表量的是数字幅度, 不是房间 SPL
相位 / 相关 DAW 相关表; 单声道检查能立刻暴露被相位吃掉的中频

先对参考曲, 再看自己的曲线. 分析器没有 "正确的 EQ 形状".

修复与降噪

调音前把气口爆破, 底噪, 齿音炸点清掉, 比事后用 EQ 硬切干净.

  • AU 波形 / 频谱编辑: 对人声干声往往比音乐 DAW 更顺手.

  • 开源降噪: RNNoise, DeepFilterNet. 适合对话和底噪, 歌声上容易啃气声和谐波, 要 A/B.

  • 棚里常用闭源: iZotope RX. 知道它存在即可.

格式转换

数字音频的采样率, 位深度, 声道布局在这一层改. 进 DAW 和分离器之前, 尽量用无损 (WAV / FLAC); 先压成低码率 MP3 再分离, 伪影会更脏.

  • FFmpeg: 转码, 抽流, 改采样率的默认选择.

  • SoX: 命令行效果与格式, 适合脚本批处理.