Union Search Skill

🔍 20+平台聚合搜索,一键触达全网

一站式聚合搜索工具,覆盖20+平台,支持GitHub、社交媒体、AI搜索引擎及批量图片下载,无需API密钥即可使用多种通用搜索。

收藏
5.8k
安装
1.2k
版本
0.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

union-search-skill 是一个跨平台统一搜索框架,整合开发者社区、社交媒体、AI搜索引擎及通用搜索共20+数据源。用户可通过标准化CLI接口同时或分别搜索GitHub仓库代码、Reddit讨论、小红书/抖音/Bilibili/YouTube/Twitter内容,以及Google、Tavily、秘塔、火山引擎等AI驱动搜索引擎,还支持DuckDuckGo、Brave等无需API的隐私搜索。

核心模块包括:

  • 联合搜索 (union_search):统一多平台接口,支持分组搜索(如 --group dev 同时检索开发者平台)
  • 图片搜索 (union_image_search):18平台批量下载,保留元数据
  • 各平台独立模块:每个均有详细README,支持 --json/--markdown/--save-raw 等标准输出格式

典型工作流

1. 配置 .env 文件(部分平台需API密钥)
2. 执行 python scripts/union_search/union_search.py "关键词" --group [dev|social|ai|general]

3. 结果以Markdown表格输出,原始JSON存档至 responses/

显著优点

1. 平台覆盖极广:从开发者工具(GitHub/Reddit)到中文社交媒体(小红书/抖音/Bilibili/知乎),再到国际平台(Twitter/YouTube)及专业AI搜索,一站式满足多元需求
2. 统一接口设计:所有脚本遵循相同参数约定(--limit--json--save-raw),学习成本低

3. 零门槛选项丰富:DuckDuckGo、Brave、Wikipedia、Anna's Archive等无需API密钥即可使用

4. 结构化输出与归档:支持JSON/Markdown/文件输出,原始响应自动存档便于二次分析

5. 批量能力:图片搜索支持18平台批量下载,适合数据收集场景

潜在缺点与局限性

1. API密钥依赖不均:部分核心平台(GitHub高级功能、Google Custom Search、Tavily等)仍需独立申请API密钥,配置成本较高
2. 速率限制分散:各平台限制策略不同,需分别查阅 references/rate_limits.md 管理请求频率

3. 反爬风险:社交媒体平台(小红书、抖音、Twitter)可能因无官方API而依赖网页抓取,存在被封禁或结构变更风险

4. 数据一致性挑战:跨平台结果格式虽经统一封装,但字段丰富度差异大,深度对比分析需额外清洗

5. 维护负担:20+平台独立模块,任一平台接口变更可能影响对应脚本

适合人群

  • 市场/竞品研究员:需同时监控多社交媒体平台声量
  • 开发者与技术布道者:追踪GitHub趋势、技术社区讨论
  • 内容创作者/运营:批量收集小红书、抖音、Bilibili素材与热点
  • AI/LLM应用开发者:集成多源搜索数据作为RAG知识库
  • 学术/开源情报(OSINT)人员:利用Anna's Archive、Wikipedia等资源

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 账号封禁 | 高频请求触发平台反爬 | 使用 `--limit` 控制频率,配置代理,查阅 `troubleshooting.md` |
| 数据合规 | 批量下载图片/内容可能触及平台ToS | 遵守各平台robots.txt,仅限个人研究使用 |
| API配额耗尽 | 付费API(如Google、Tavily)用量超限 | 监控 `references/rate_limits.md` 中的配额说明 |
| 数据时效性 | 缓存机制可能导致结果非实时 | 关键场景添加时间过滤器或实时验证 |
| 依赖失效 | 非官方API抓取脚本易失效 | 关注项目更新,优先使用官方API支持的模块 |

安全解读

核心用法

union-search-skill 是一款面向多平台信息检索的聚合型工具技能,支持覆盖开发者社区、社交媒体、搜索引擎及图片资源等四大类共20余个平台。用户可通过标准化接口执行 GitHub 仓库/代码/问题搜索、Reddit 帖子与用户检索、小红书/抖音/Bilibili 等中文内容平台抓取,以及 Google、Tavily、秘塔、火山引擎等AI驱动搜索引擎的调用。图片搜索模块更集成18个平台(含Unsplash、Pixabay、百度、Bing等)的批量下载能力,并保留完整元数据。

技能采用三层配置架构:命令行参数优先于环境变量,环境变量优先于配置文件,确保灵活性与安全性平衡。所有脚本支持统一的输出格式控制(JSON/Markdown/表格),并内置原始响应归档机制,便于后续分析与审计。

显著优点

平台覆盖广度:从传统搜索引擎(DuckDuckGo、Brave、Yahoo)到新兴AI搜索(Tavily、Exa神经搜索、秘塔),从国际开发者社区(GitHub、Reddit)到中文社交生态(小红书、抖音、知乎),形成完整的全球信息网络覆盖。

零门槛设计:DuckDuckGo、Brave、Wikipedia、Anna's Archive等模块无需API密钥即可使用,大幅降低个人研究者与小型团队的接入成本。

结构化输出:统一的数据格式约定与多格式导出能力(JSON/Markdown/表格),使结果可直接对接数据分析流水线或知识库系统。

响应可追溯:自动归档原始API响应至responses/目录,满足学术研究的可复现性要求与企业场景的审计合规需求。

潜在缺点与局限性

认证碎片化:不同平台API密钥获取流程差异较大,GitHub、Google、YouTube等需单独申请,配置复杂度随平台数量线性增长。

速率限制差异:各平台配额策略不统一,TikHub等中文社交平台限制较严,高频调用需配合代理与请求频率控制。

动态适配成本:社交媒体平台接口变更频繁,文档中提示需"定期更新API文档",存在维护滞后导致的功能失效风险。

T3来源限制:技能来源于个人/社区开发者,无企业级SLA保障,生产环境关键业务依赖需谨慎评估。

适合的目标群体

  • 学术研究者:需要跨语言、跨平台检索文献、数据集与开源实现
  • 竞品分析师:追踪多平台舆论动态与产品反馈
  • 内容运营人员:监控小红书、抖音、Bilibili等品牌声量
  • 独立开发者:快速验证技术方案,检索GitHub开源替代实现
  • 数据记者:批量获取多源信息进行交叉验证

使用风险

性能层面:多平台并发搜索可能触发个别平台的风控机制,建议采用分组策略(--group dev)分批次执行。

依赖层面:部分模块依赖TikHub等第三方聚合服务,其稳定性与数据质量不受本技能控制。

合规层面:虽技能本身符合GDPR/CCPA数据最小化原则,但用户仍需确保最终数据使用符合各平台服务条款与目标司法管辖区法规。

安全层面:.env文件中的API密钥需妥善保管,避免提交至版本控制系统;建议使用专用只读密钥并定期轮换。

Union Search Skill 内容

references文件夹
scripts文件夹
bing文件夹
brave文件夹
douyin文件夹
duckduckgo文件夹
exa_search文件夹
github文件夹
google_search文件夹
metaso文件夹
reddit文件夹
rss_search文件夹
tavily_search文件夹
union_image_search文件夹
volcengine文件夹
wikipedia文件夹
xiaohongshu文件夹
yahoo文件夹
youtube文件夹
手动下载zip · 43.9 kB
api_credentials.mdtext/markdown
请选择文件