爬论文与人才触达工作流

🔍 AI 人才发现与智能触达系统

AI/ML 人才搜索与触达工具链,支持会议论文爬取、实验室成员抓取、GitHub 网络挖掘及飞书多维表格集成,可生成个性化招聘邮件。

收藏
4.6k
安装
1k
版本
2.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Mapping-Skill 是一套面向 AI/ML 招聘场景的专业人才发现与触达工具链,主要解决以下痛点:

1. 多源人才发现

  • OpenReview/CVF 会议论文作者抓取(优先 API,支持 PDF 邮箱提取)
  • 实验室成员主页结构化爬取(支持 Hugo Academic 模板、两阶段模式、邮箱反向定位)
  • GitHub following/followers 网络研究者挖掘
  • 任意给定 URL 的全量学者信息抽取

2. 智能信息处理

  • 结构化字段抽取:中英文姓名、机构、研究方向、教育背景、多平台链接(Scholar/GitHub/LinkedIn 等)、邮箱
  • 华人候选人识别(基于姓氏概率模型)
  • 自动分类、去重与研究方向标准化
  • Cloudflare XOR 邮箱解密等反爬对抗能力

3. 个性化触达

  • 基于真实论文/主页内容生成 technical_hook
  • 22 个研究领域对应的邮件模板与 talk track 体系
  • 批量生成非空泛的个性化招聘邮件

4. 飞书生态集成

  • 多维表格自动创建字段、批量导入
  • 表格内批量生成并回写「推荐邮件」字段
  • 支持分页读取、批量更新(每批 500 条上限)

显著优点

  • 场景覆盖完整:从学术会议、实验室主页到 GitHub 社交网络,覆盖 AI/ML 人才主要聚集地
  • 反爬策略成熟:内置 BrightData MCP 集成、多种邮箱提取 fallback、中国高校站点特殊处理
  • 输出高度结构化:标准化 Schema 支持后续自动化流程
  • 邮件质量可控:强制关联候选人真实研究成果,避免模板化垃圾邮件

潜在局限

  • 依赖外部平台 API 稳定性(OpenReview、飞书 API 变更需适配)
  • 部分高防站点(LinkedIn)需降级至 BrightData,成本与延迟增加
  • 邮箱提取成功率受 PDF 解析质量、网页混淆策略影响
  • 飞书批量操作有频率限制,大规模数据集需分批次处理

适合人群

  • AI 公司招聘团队 / 猎头(技术岗位 sourcing)
  • 学术实验室(寻找合作者、博士后、博士生)
  • 投资机构的 AI/ML 赛道研究员(人才mapping)
  • 需将人才库沉淀为结构化数据并持续运营的组织

常规风险

  • 合规风险:需遵守目标网站的 ToS,学术平台通常允许合理抓取但商业平台限制较严
  • 隐私风险:邮箱等联系方式的使用需符合 GDPR、中国个人信息保护法
  • 误识别风险:华人识别基于姓氏概率,存在误判;研究方向标准化依赖关键词映射,需人工抽检
  • 飞书权限:需确保 API Token 有足够的数据读写权限,字段创建需管理员权限

爬论文与人才触达工作流 内容

evals文件夹
references文件夹
scripts文件夹
手动下载zip · 124.4 kB
evals.jsonapplication/json
请选择文件