XCrawl Map

🗺️ 智能站点测绘与爬取规划工具

XCrawl 官方站点地图发现工具,支持正则过滤、子域包含、查询参数控制,适合全站爬取前的URL规划与范围评估。新用户可获1000免费积分。

收藏
5k
安装
1.6k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

xcrawl-map 是 XCrawl 官方提供的站点 URL 发现技能,用于在执行全站爬取前完成站点结构测绘与爬取范围规划。核心工作流程为:明确测绘目标(纯发现、选择性爬取规划或结构分析)→ 构建并执行 POST /v1/map 请求 → 直接返回上游 API 原始响应。

请求需携带从 ~/.xcrawl/config.json 读取的 API Key,支持通过 cURL 或 Node.js 发起调用。关键参数包括:url(入口地址,必填)、filter(正则过滤 URL)、limit(上限 100,000 条,默认 5,000)、include_subdomains(是否含子域,默认 true)、ignore_query_parameters(是否忽略查询参数,默认 true)。

显著优点

  • 官方原生集成:直接调用 XCrawl 官方 /v1/map 端点,数据可信度与实时性有保障
  • 灵活的范围控制:正则过滤、子域开关、查询参数处理三项机制可精确界定爬取边界
  • 按需计费透明:基于实际发现 URL 数量扣减积分,并提供详细的 credits_detail 明细
  • 零环境依赖:仅需 curl 与 node,不强制要求 Python 或其他运行时

潜在缺点与局限性

  • 非免费服务:依赖 XCrawl 账户积分,虽提供 1000 积分试用额度,但大规模测绘需持续充值
  • 无本地缓存机制:每次调用均为实时 API 请求,重复测绘相同站点仍消耗积分
  • 原始数据直出:默认仅返回上游原始 JSON,不生成可读性摘要或 URL 家族归类,需用户自行处理
  • 上限约束:单任务上限 10 万 URL,超大规模站点需分片策略

适合人群

  • 需要在正式爬取前评估站点规模与结构的开发者
  • 希望用正则精确筛选特定路径(如 /docs/.*)进行定向内容采集的用户
  • 已拥有或愿意注册 XCrawl 账户、接受按量计费模式的技术团队

常规风险

  • 积分耗尽导致服务中断:未监控余额时可能在任务执行中途失败
  • 范围估计偏差limit 触顶时不会自动提示"未完整覆盖",需用户主动判断
  • 配置泄露风险:API Key 存储于本地 JSON 文件,共享环境或误提交代码库可能导致密钥泄露
  • 误过滤导致数据缺失:正则表达式编写不当可能意外排除目标 URL

XCrawl Map 内容

手动下载zip · 3.5 kB
skill-card.mdtext/markdown
请选择文件