核心功能
该技能提供完整的音频转MIDI流水线,集成HPSS音源分离、Spotify Basic Pitch深度学习音高检测、Krumhansl-Kessler调性分析,以及智能量化后处理。核心工作流为:先通过谐波-打击乐分离提取旋律主干,再用神经网络检测音高与起止点,自动判断调性后将音符对齐到可配置的节拍网格,最后执行八度修剪、重叠泛音清除和连音合并等清理操作。
显著优势
- 开箱即用:一键安装脚本自动配置Python环境、依赖与路径
- 专业级音高检测:采用Spotify开源的Basic Pitch模型,支持复音检测
- 音乐智能:自动调性识别与调内音修正,减少手动编辑
- 灵活量化:支持1/4至1/32多种网格精度,可关闭量化保留原始感
- 后处理完善:泛音过滤、音符合并、力度归一化等自动化清理
- 跨格式支持:通过FFmpeg兼容WAV/MP3/M4A等主流音频格式
潜在局限
- 固定BPM输出:始终以120BPM生成,需在DAW中手动调整速度
- 单声部优化:和弦或多乐器同时演奏会产生混乱结果
- 短音符损失:默认过滤<50ms音符,快速音阶可能被合并
- 音高漂移量化:颤音、滑音会被量化为阶梯音高
- 调性检测门槛:需要足够长的 tonal 段落(约8-10小节),半音进行或调性模糊片段可能误判
- 八度误判:偶发将泛音识别为基频,需后期手动移调
适用人群
- 作曲家、编曲人:快速将哼唱动机转为可编辑MIDI草稿
- 电子音乐制作人:采样人声旋律即时生成MIDI clip
- 音乐教育者:学生演唱即时可视化为五线谱/钢琴卷帘
- 移动创作用户:手机语音备忘录导入DAW前的自动转换
常规风险
- 版权注意:处理他人受版权保护的录音需合法授权
- 隐私提示:本地处理不上传云端,但原始音频文件需妥善保管
- 音质依赖:嘈杂环境、混响过重或背景伴奏会显著降低检测精度
- 结果需人工校对:自动量化可能过度修正,破坏原有意图的节奏感或装饰音
技术可靠性
依赖Spotify Basic Pitch(Apache 2.0)与librosa等成熟开源库,本地离线运行无网络依赖,适合对数据敏感的生产环境。