Voice Note To Midi

🎵 哼唱秒变MIDI,灵感零流失

将人声哼唱、录音快速转换为量化MIDI文件,基于Spotify Basic Pitch模型,支持智能调性检测与音符清理,适合音乐创作快速草图。

收藏
5.9k
安装
2.5k
版本
0.1.0
CLS 安全性认证2026-08-05
点击查看完整报告 >

使用说明

核心功能

该技能提供完整的音频转MIDI流水线,集成HPSS音源分离、Spotify Basic Pitch深度学习音高检测、Krumhansl-Kessler调性分析,以及智能量化后处理。核心工作流为:先通过谐波-打击乐分离提取旋律主干,再用神经网络检测音高与起止点,自动判断调性后将音符对齐到可配置的节拍网格,最后执行八度修剪、重叠泛音清除和连音合并等清理操作。

显著优势

  • 开箱即用:一键安装脚本自动配置Python环境、依赖与路径
  • 专业级音高检测:采用Spotify开源的Basic Pitch模型,支持复音检测
  • 音乐智能:自动调性识别与调内音修正,减少手动编辑
  • 灵活量化:支持1/4至1/32多种网格精度,可关闭量化保留原始感
  • 后处理完善:泛音过滤、音符合并、力度归一化等自动化清理
  • 跨格式支持:通过FFmpeg兼容WAV/MP3/M4A等主流音频格式

潜在局限

  • 固定BPM输出:始终以120BPM生成,需在DAW中手动调整速度
  • 单声部优化:和弦或多乐器同时演奏会产生混乱结果
  • 短音符损失:默认过滤<50ms音符,快速音阶可能被合并
  • 音高漂移量化:颤音、滑音会被量化为阶梯音高
  • 调性检测门槛:需要足够长的 tonal 段落(约8-10小节),半音进行或调性模糊片段可能误判
  • 八度误判:偶发将泛音识别为基频,需后期手动移调

适用人群

  • 作曲家、编曲人:快速将哼唱动机转为可编辑MIDI草稿
  • 电子音乐制作人:采样人声旋律即时生成MIDI clip
  • 音乐教育者:学生演唱即时可视化为五线谱/钢琴卷帘
  • 移动创作用户:手机语音备忘录导入DAW前的自动转换

常规风险

  • 版权注意:处理他人受版权保护的录音需合法授权
  • 隐私提示:本地处理不上传云端,但原始音频文件需妥善保管
  • 音质依赖:嘈杂环境、混响过重或背景伴奏会显著降低检测精度
  • 结果需人工校对:自动量化可能过度修正,破坏原有意图的节奏感或装饰音

技术可靠性

依赖Spotify Basic Pitch(Apache 2.0)与librosa等成熟开源库,本地离线运行无网络依赖,适合对数据敏感的生产环境。

安全解读

核心用法

voice-note-to-midi 是一款专为音乐创作者设计的音频转MIDI工具链。用户只需通过命令行执行 ./hum2midi input.wav,即可启动完整的四步处理流程:HPSS声源分离提取旋律声部、Spotify Basic Pitch深度学习模型进行多音高检测、Krumhansl-Kessler算法自动识别调性、最后通过智能量化生成标准MIDI文件。支持灵活的参数调控,包括1/4至1/32拍量化精度、调性感知修正、最小音符时长过滤等,既可直接处理WAV/MP3/M4A等音频格式,也能对现有MIDI文件进行二次量化优化。

显著优点

该技能的核心竞争力在于工业级精度与本地化处理的结合。Spotify开源的Basic Pitch模型经过数百万首歌曲训练,在哼唱识别准确率上显著优于传统FFT算法;HPSS声源分离技术能有效剥离打击乐与环境噪声,大幅提升复杂录音场景下的识别稳定性。调性感知模式(--key-aware)可自动将离调音符修正至目标音阶,减少后期人工校音工作量。整个流程完全离线运行,无需上传音频至云端,保障创作隐私的同时消除网络延迟。安装脚本自动化程度高,从环境搭建到PATH配置一键完成,对非技术背景的音乐人友好。

潜在缺点与局限性

音频质量门槛较高:背景噪音、混响效果、房间反射均会显著降低识别准确率,建议使用干声或近场录音。多声部处理能力有限:HPSS分离主要针对谐波/打击乐二分,无法有效分离交织的多条旋律线,和弦与复音乐段会产生音符堆叠混乱。表现细节丢失:颤音、滑音等演唱技法会被量化为阶梯式音高,120BPM的固定输出 tempo 需要用户在DAW中手动调整以还原原始速度感。极端音域稳定性不足:超低频或超高频可能触发八度误判,快速音阶跑动存在漏检或粘连风险。此外,Python虚拟环境与FFmpeg前置依赖在Windows平台配置复杂度较高。

适合的目标群体

该技能精准服务于三类用户:移动端灵感记录者——习惯用语音备忘录随时捕捉旋律构思的唱作人;MIDI编曲入门者——希望跳过键盘输入环节、直接以人声驱动虚拟乐器音源的电子音乐制作人;批量处理需求者——拥有大量历史录音素材待归档、需要自动化转换工具建立MIDI素材库的内容创作者。对专业视唱练耳能力较弱、但具备DAW后期编辑经验的用户尤为适用,因其输出结果通常需要10-20%的人工微调工作量。

使用风险与注意事项

性能层面:Basic Pitch模型在CPU上处理5分钟音频约需30-60秒,长录音建议分段处理以避免内存峰值占用。依赖项风险:PyTorch与librosa版本迭代可能引入API变更,建议锁定requirements.txt版本或定期跟随官方升级。隐私边界:虽然处理过程完全本地,但用户需注意原始音频文件与输出MIDI的存储位置,避免共享目录意外暴露未发布创作。误操作防护:setup.sh修改shell配置前会请求确认,但用户仍需警惕非官方渠道的修改版脚本。建议定期备份~/.bashrc等配置文件,并在虚拟环境隔离下运行以避免与系统Python冲突。

Voice Note To Midi 内容

手动下载zip · 9.5 kB
QUICKSTART.mdtext/markdown
请选择文件