核心用法
用户发送 recipe <url> 触发技能,系统自动验证链接并立即确认接收,随后通过浏览器自动化逐层解析:① 视频描述/字幕(最高优先级)→ ② 置顶评论 → ③ 热门评论中的菜谱类内容 → ④ 必要时启用网页搜索作为兜底。全程提供进度状态更新,最终输出标准化菜谱结构。
显著优点
信息源分层设计科学:优先抓取创作者主动发布的描述文本,其次利用社区验证的置顶/热门评论,形成多源交叉验证机制,有效降低单点信息失效风险。
工程实现务实:明确采用 Playwright/OpenClaw 浏览器自动化处理动态页面(尤其针对 Instagram 类平台),禁止 yt-dlp 以规避版权风险;同时保留搜索/抓取作为优雅降级方案。
输出质量可控:建立高/中/低三级置信度体系,强制要求至少一个来源包含完整配料+步骤才输出"完整菜谱";冲突时保留多版本标注而非臆测,诚实标记缺失字段。
解析鲁棒性强:内置配料/步骤标题启发式识别、量词单位正则匹配、emoji 噪声清理、结构化编号转换等后处理流程,显著提升非结构化文本的可用性。
潜在缺点与局限性
平台依赖风险:重度依赖浏览器自动化,若目标网站反爬策略升级(如验证码、IP 限流、渲染机制变更),可能导致提取失败或需要频繁维护适配。
多语言支持未明确:菜谱解析的 heuristics(如 "ingredients"/"steps" 标题识别)以英文为主,中文、日文等非拉丁语系视频的字幕/评论解析效果可能下降。
评论质量不可控:热门评论可能包含用户改编版、错误尝试或玩梗内容,依赖模式匹配(量词+祈使动词)筛选存在误报风险,需人工复核高价值菜谱。
版权灰色地带:虽禁用 yt-dlp,但浏览器自动化抓取视频平台内容仍可能触及平台 ToS,存在账号封禁或法律追溯的潜在风险。
适合人群
- 快速收藏短视频平台(TikTok/Reels/YouTube Shorts)菜谱的家庭烹饪爱好者
- 需要批量归档结构化菜谱数据的内容运营/美食编辑
- 希望对比多版本做法、验证网红菜谱可行性的理性尝试者
常规风险
- 信息准确性:网红菜谱常存在"适量""少许"等模糊表述,或步骤跳跃,提取后仍需实践验证
- 食品安全:无法验证食材处理温度、生熟交叉污染等安全关键细节的可靠性
- 平台稳定性:源视频删除、账号私密化、评论区关闭将导致永久提取失败