Xiaoyuzhou Asr

✨ Xiaoyuzhou Asr

Xiaoyuzhou Asr

收藏
1.9k
安装
584
版本
2.0.0
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

安全解读

核心用法

xiaoyuzhou-asr 是一款面向中文播客生态的本地语音识别工具,核心功能是将小宇宙(Xiaoyuzhou FM)平台的播客节目转写为可编辑文本。用户需先部署配套的 xyz API 服务(Go 语言编写的本地代理),通过该服务完成登录认证、节目搜索和音频 URL 获取。转写流程采用通义千问 Qwen3-ASR 0.6B 模型,在本地 GPU(Metal/CUDA)上完成推理,支持将音频自动切分为 3 分钟片段以保障稳定性。CLI 提供关键词搜索、单集转写、批量处理和断点续传等完整功能,输出格式涵盖 Markdown、SRT 字幕、纯文本和 JSON 四种。

显著优点

隐私安全为核心卖点:所有音频处理和模型推理均在本地执行,原始音频流不会上传至任何第三方云服务,仅需从小宇宙服务器下载一次音频文件。对于注重数据隐私的内容创作者、研究人员和企业用户,这一架构彻底规避了传统云端 ASR 服务的数据留存风险。

架构透明可控:依赖项高度透明——Python 端仅使用标准库,无 PyPI 依赖包;ASR 推理基于开源的 qwen3-asr-rs Rust 项目,用户可审计和自行编译;xyz API 服务同样开源且运行在本地,整个链路无黑盒组件。

工程细节完善:自动处理音频格式转换(ffmpeg)、分片策略规避显存溢出、tokenizer 自动生成简化部署、token 自动刷新与断点续传提升可靠性,这些设计显著降低了用户的运维负担。

潜在缺点与局限性

部署门槛较高:完整运行需要 Go、Python、Rust、ffmpeg 四套工具链,以及手动下载 0.6B 参数的 ASR 模型,对非技术用户存在明显障碍。虽然提供了详细文档,但无法做到"一键安装"。

硬件资源要求:本地 GPU 加速是性能前提,纯 CPU 运行会导致转写速度大幅下降;Metal 环境下 3 分钟分片策略虽保稳定,却增加了 I/O 开销和片段拼接复杂度。

功能边界清晰:仅支持小宇宙平台,无法直接处理其他播客源(如 Apple Podcasts、Spotify);依赖 xyz API 的逆向工程实现,存在平台协议变动导致失效的潜在风险;中文手机号登录限制了部分海外用户。

适合的目标群体

  • 播客创作者与编辑:需要节目文稿用于剪辑时间轴定位、Shownotes 制作或内容二次分发
  • 媒体与研究机构:批量归档播客内容、构建可检索的语音资料库,且需满足数据合规要求
  • AI 训练数据准备:需要高质量中文口语语料,且要求数据来源可追溯、处理过程可控
  • 技术型效率用户:具备 CLI 使用经验,重视隐私、愿意投入时间换取自主可控的方案

使用风险

性能与稳定性:长音频的片段化处理会增加总处理时间;GPU 显存不足时可能出现 OOM,需手动调整分片时长;Rust ASR 二进制与 Python 脚本的跨进程通信存在潜在 IPC 失败风险。

依赖维护成本:xyz API 作为非官方逆向实现,需关注作者仓库更新以适配小宇宙接口变化;Qwen3-ASR 模型版本迭代时,需手动重新下载或更新本地模型文件。

网络与授权:首次登录和 token 刷新需要国内手机号接收验证码;音频下载依赖小宇宙 CDN 稳定性,大文件可能出现超时,虽已配置 120 秒下载超时和 3 次重试,极端网络环境下仍可能失败。

合规边界:转写内容仅供个人学习、研究或合法授权场景使用,需注意尊重播客创作者的知识产权,避免未经授权的大规模分发或商业化利用。

Xiaoyuzhou Asr 内容

references文件夹
scripts文件夹
tests文件夹
手动下载zip · 34.2 kB
qwen3-asr.mdtext/markdown
请选择文件