核心用法
agent-data-cli(简称 ADC)是一个基于 Python 的本地信息中心,采用 source/channel/content 三层模型管理多源内容。核心工作流涵盖五个环节:
1. 发现(Discovery):channel search 和 content search 用于远程探索可用的频道和内容,仅读取不写入
2. 订阅(Subscription):通过 content search 找到目标后,使用 content interact --verb subscribe 建立持续跟踪关系
3. 同步(Sync):content update 是唯一将远程内容写入本地数据库的命令,支持 cron 定时调度
4. 本地查询(Query):content query 完全基于本地 SQLite,可配合 --jsonl 输出与 jq/awk 进行管道处理
5. 远程交互(Interact):content interact 执行明确的远程副作用操作(如点赞、评论),需显式指定 source 和 ref
典型命令链示例:
# 发现 → 订阅 → 同步 → 查询 uv run -m adc channel search --source cryptocompare --query BTC uv run -m adc content search --source cryptocompare --channel BTC --limit 10 uv run -m adc content interact --source cryptocompare --verb subscribe --ref cryptocompare:content/BTC uv run -m adc content update --source cryptocompare uv run -m adc content query --source cryptocompare --channel BTC --limit 50 --jsonl | jq '.price'
显著优点
- 统一抽象:单一 CLI 覆盖新闻、RSS、Twitter/X、小红书、加密货币行情等异构源
- 本地优先:所有内容落地本地数据库,支持离线查询和长期归档
- 管道友好:
--jsonl输出原生适配 Unix 哲学,与jq、awk、sponge等工具无缝衔接 - 配置灵活:支持 source 级和 CLI 级代理配置,可细粒度控制网络行为
- 可扩展:通过
source_workspace机制可接入agent-data-hub生态,安装官方或自定义源
潜在缺点与局限性
- 非即开即用:需要 Python + uv 环境,且需手动配置
source_workspace和代理 - 源质量依赖:内容质量取决于各 source 实现,无内置内容清洗或去重机制
- 无可视化:纯 CLI 工具,无 Web UI 或图形浏览器
- 同步延迟:
content update为拉模式,非实时推送,最小粒度受 cron 限制 - 硬边界约束:
content query绝不触发远程搜索,若本地无数据则返回空集,新手易误解
适合人群
- 需要聚合多平台信息的数据分析师、量化研究员、舆情监测人员
- 偏好本地存储、可编程查询的技术用户
- 已在使用
agent-data-hub生态的进阶玩家 - 不适合:追求开箱即用体验的非技术用户,或需要实时流式数据的场景
常规风险
- 代理泄露风险:
proxy_url可能含敏感凭证,需避免提交至版本控制 - 频率限制:远程
search/update/interact可能触发源站限流,建议配置合理 cron 间隔 - 数据一致性:
content query反映的是上次update的快照,非实时状态 - 第三方源信任:通过
data_hub安装的 source 需审计其网络行为和权限请求