Daily Paper Digest

📚 AI 论文自动聚合推送助手

自动聚合 arXiv/HuggingFace 最新 AI 论文,定时推送到飞书/Slack/Discord,帮助研究者高效追踪前沿动态。

收藏
9.1k
安装
2.4k
版本
1.0.0
CLS 安全性认证2026-08-10
点击查看完整报告 >

使用说明

核心功能

daily-paper-digest 是一款面向 AI 研究者的自动化论文聚合工具,核心功能包括:

  • 双源聚合:同时抓取 arXiv 官方 API 和 HuggingFace Papers 页面的最新论文
  • 智能过滤:支持按学科分类(cs.AI、cs.CL、cs.CV 等)和关键词筛选
  • 格式化输出:生成结构化报告,含标题、作者、摘要、点赞数、PDF 直链
  • 多端推送:适配飞书、Slack、Discord 等主流协作平台

显著优点

1. 开箱即用:提供预置配置文件,涵盖 AI 核心领域分类
2. 低代码扩展:基于 Python 标准工具链(requests/BeautifulSoup/feedparser),二次开发门槛低

3. 调度友好:原生支持 Cron 表达式定时触发,适配 OpenClaw 自动化工作流

4. 输出美观:终端风格排版,信息层级清晰,适合直接粘贴分享

潜在局限

  • 无持久化存储:依赖每次运行时重新抓取,不支持历史检索或增量更新
  • 配置静态化:过滤规则需手动修改 JSON 文件,不支持运行时交互调整
  • HuggingFace 依赖页面解析:若页面结构调整可能导致爬取失效
  • 摘要截断处理:长摘要未做智能压缩,部分场景可读性受限

适合人群

  • AI 实验室/研究组的日常文献管理员
  • 需要向团队定期同步前沿进展的技术负责人
  • 个人研究者希望减少手动刷 arXiv 的时间成本

常规风险提示

| 风险类型 | 说明 |
|---------|------|
| 网络稳定性 | arXiv API 偶有速率限制,高频调用需控制间隔 |
| 内容合规 | 自动抓取摘要需遵守源站 ToS,商用场景建议确认授权 |
| 信息时效 | 依赖源站更新节奏,非实时推送 |

技术栈评估

| 维度 | 评分 | 说明 |
|-----|------|------|
| 可维护性 | ★★★★☆ | 代码结构清晰,模块化设计 |
| 扩展性 | ★★★★☆ | 新增数据源需自行实现 fetcher |
| 部署复杂度 | ★★☆☆ | 纯 Python,无特殊基础设施依赖 |

---

综合评估:该 skill 定位精准,实现轻量,是研究团队自动化文献管理的实用工具,建议结合实际需求评估是否需要追加数据持久化和交互配置能力。

安全解读

核心用法

daily-paper-digest 是一款面向 AI 研究者和开发者的自动化信息聚合 Skill,通过集成 arXiv 官方 API 与 HuggingFace 论文频道,实现每日最新 AI 论文的智能抓取与格式化推送。用户可通过聊天应用(飞书、Slack、Discord 等)触发关键词如"论文速递""今日论文"或指令 /papers 获取当日精选论文列表。

该 Skill 提供三大核心工具:fetch_daily_papers 自动读取配置获取今日论文;search_arxiv_papers 支持按关键词检索特定主题论文;fetch_huggingface_papers 爬取 HuggingFace 热门论文及社区点赞数据。配置层面通过 config/sources.json 灵活定制信息源、学科分类(如 cs.AI、cs.CL、cs.CV、cs.LG 等)及关键词过滤规则,支持最大返回数量、包含/排除关键词等精细控制。

部署方式支持本地 Python 运行与 OpenClaw 定时调度,后者可通过 Cron 表达式(如 0 9 * * *)实现每日自动推送。输出格式经过精心设计,包含论文标题、作者、来源、日期、摘要及直达链接,支持纯文本与富文本展示。

显著优点

权威数据源背书:直接对接 arXiv(全球顶级预印本平台)与 HuggingFace(AI 社区风向标)两大权威来源,确保信息的学术可信度与时效性。arXiv 覆盖计算机科学、统计学等全量 AI 相关学科,HuggingFace 则反映社区热度与工程落地价值。

零配置开箱即用:预设常用 AI 学科分类与合理的默认参数,新用户无需复杂配置即可获取高质量论文推送。同时提供深度定制能力,满足个性化科研跟踪需求。

多平台无缝集成:原生支持主流协作工具推送,适配科研团队的多样化沟通场景。输出格式兼顾信息密度与可读性,摘要截取与链接直达提升阅读效率。

安全架构透明:全链路 HTTPS 加密传输,无用户敏感信息采集,依赖均为知名开源库(arxiv、requests、beautifulsoup4、feedparser),代码结构清晰无混淆。

潜在缺点与局限性

数据源单一性风险:目前仅支持 arXiv 与 HuggingFace 两大平台,未覆盖 ACL Anthology、NeurIPS/ICML 等会议官网、Semantic Scholar、Google Scholar 等多元学术数据库。对于关注特定会议或跨学科研究的用户,信息覆盖存在盲区。

HuggingFace 爬取脆弱性:HuggingFace 模块采用网页爬取而非官方 API,高度依赖目标网站 HTML 结构稳定性。一旦 HuggingFace 改版或加强反爬虫策略,该功能可能突然失效,需维护者持续跟进修复。

配置管理门槛:虽然基础功能开箱即用,但高级定制需手动编辑 JSON 配置文件,对非技术背景的终端用户存在学习成本。缺乏图形化配置界面或交互式引导。

摘要质量不可控:直接展示原始论文摘要,未经过筛选、翻译或质量评级,用户需自行判断论文价值。对于非英语母语用户,缺乏自动翻译支持。

推送频率与噪音平衡:每日固定推送可能在工作日造成信息过载,或节假日推送空白内容,缺乏智能去重与个性化推荐算法支撑。

适合的目标群体

AI 领域科研人员:包括高校研究生、博士生、博士后及研究机构研究员,需要持续跟踪 arXiv 最新进展以把握研究方向、发现合作机会。

算法工程师与 MLE:工业界机器学习工程师,关注 HuggingFace 热门论文以了解技术趋势、寻找可落地的模型与方法。

技术管理者与产品经理:AI 团队负责人通过每日速递快速扫描领域动态,辅助技术路线规划与竞品分析。

科技媒体与投资人:关注 AI 技术演进的垂直媒体编辑、风险投资人,利用该工具建立信息雷达,捕捉潜在热点。

开源社区贡献者:活跃于 HuggingFace 生态的开发者,通过社区热度数据发现值得复现或集成的优秀工作。

使用风险与建议

网络依赖与稳定性:该 Skill 运行时依赖外部 API 可用性,arXiv 偶有维护窗口期,HuggingFace 可能因网络原因访问受限。建议部署时配置代理或备用数据源,并设置合理的超时与重试策略。

反爬虫策略变化:HuggingFace 网页爬取模块存在合规风险,过度频繁的请求可能触发 IP 封禁。建议控制请求频率,考虑申请官方 API 权限替代网页解析。

配置错误导致异常:不当的 max_results 数值(如设置过大)或无效分类代码可能导致请求失败或返回异常数据。建议增加输入校验与边界处理。

依赖库安全更新:requests、beautifulsoup4 等依赖需持续关注 CVE 公告,建议建立自动化依赖扫描机制(如 Dependabot),定期更新至安全版本。

社区项目维护持续性:作为 T3 级别个人/社区项目,长期维护存在不确定性。关键生产环境使用建议 Fork 后自行维护,或关注官方替代方案。

Daily Paper Digest 内容

config文件夹
手动下载zip · 15.2 kB
sources_llm.jsonapplication/json
请选择文件