核心用法
xiaoyuzhou-asr 是一款面向中文播客生态的本地语音识别工具,核心功能是将小宇宙(Xiaoyuzhou FM)平台的播客节目转写为可编辑文本。用户需先部署配套的 xyz API 服务(Go 语言编写的本地代理),通过该服务完成登录认证、节目搜索和音频 URL 获取。转写流程采用通义千问 Qwen3-ASR 0.6B 模型,在本地 GPU(Metal/CUDA)上完成推理,支持将音频自动切分为 3 分钟片段以保障稳定性。CLI 提供关键词搜索、单集转写、批量处理和断点续传等完整功能,输出格式涵盖 Markdown、SRT 字幕、纯文本和 JSON 四种。
显著优点
隐私安全为核心卖点:所有音频处理和模型推理均在本地执行,原始音频流不会上传至任何第三方云服务,仅需从小宇宙服务器下载一次音频文件。对于注重数据隐私的内容创作者、研究人员和企业用户,这一架构彻底规避了传统云端 ASR 服务的数据留存风险。
架构透明可控:依赖项高度透明——Python 端仅使用标准库,无 PyPI 依赖包;ASR 推理基于开源的 qwen3-asr-rs Rust 项目,用户可审计和自行编译;xyz API 服务同样开源且运行在本地,整个链路无黑盒组件。
工程细节完善:自动处理音频格式转换(ffmpeg)、分片策略规避显存溢出、tokenizer 自动生成简化部署、token 自动刷新与断点续传提升可靠性,这些设计显著降低了用户的运维负担。
潜在缺点与局限性
部署门槛较高:完整运行需要 Go、Python、Rust、ffmpeg 四套工具链,以及手动下载 0.6B 参数的 ASR 模型,对非技术用户存在明显障碍。虽然提供了详细文档,但无法做到"一键安装"。
硬件资源要求:本地 GPU 加速是性能前提,纯 CPU 运行会导致转写速度大幅下降;Metal 环境下 3 分钟分片策略虽保稳定,却增加了 I/O 开销和片段拼接复杂度。
功能边界清晰:仅支持小宇宙平台,无法直接处理其他播客源(如 Apple Podcasts、Spotify);依赖 xyz API 的逆向工程实现,存在平台协议变动导致失效的潜在风险;中文手机号登录限制了部分海外用户。
适合的目标群体
- 播客创作者与编辑:需要节目文稿用于剪辑时间轴定位、Shownotes 制作或内容二次分发
- 媒体与研究机构:批量归档播客内容、构建可检索的语音资料库,且需满足数据合规要求
- AI 训练数据准备:需要高质量中文口语语料,且要求数据来源可追溯、处理过程可控
- 技术型效率用户:具备 CLI 使用经验,重视隐私、愿意投入时间换取自主可控的方案
使用风险
性能与稳定性:长音频的片段化处理会增加总处理时间;GPU 显存不足时可能出现 OOM,需手动调整分片时长;Rust ASR 二进制与 Python 脚本的跨进程通信存在潜在 IPC 失败风险。
依赖维护成本:xyz API 作为非官方逆向实现,需关注作者仓库更新以适配小宇宙接口变化;Qwen3-ASR 模型版本迭代时,需手动重新下载或更新本地模型文件。
网络与授权:首次登录和 token 刷新需要国内手机号接收验证码;音频下载依赖小宇宙 CDN 稳定性,大文件可能出现超时,虽已配置 120 秒下载超时和 3 次重试,极端网络环境下仍可能失败。
合规边界:转写内容仅供个人学习、研究或合法授权场景使用,需注意尊重播客创作者的知识产权,避免未经授权的大规模分发或商业化利用。