Clean Skill

🍽️ 双平台交叉验证,过滤刷评陷阱

跨平台餐厅推荐验证工具,通过交叉比对大众点评和小红书数据,生成可信度评分与一致性分析,过滤刷评噪音

收藏
3.6k
安装
1.1k
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

该工具专为解决中文餐饮平台信息碎片化、评价可信度参差的问题而设计。用户输入地理位置(城市/行政区)和 cuisine 类型后,系统自动并行抓取大众点评和小红书的餐厅数据,通过模糊匹配算法识别同一餐厅在不同平台的记录,最终输出带有"置信度评分"的推荐列表。

典型工作流程:
1. 双源数据采集:大众点评侧重结构化评分(星级、人均、地址标签),小红书侧重UGC内容(笔记热度、情感倾向、关键词云)

2. 智能匹配对齐:基于Levenshtein距离和地址相似度,处理连锁分店命名差异(如"海底捞"vs"海底捞静安店")

3. 一致性校验引擎:计算三大维度的相关系数——评分相关性、热度-评分吻合度、情感对齐度,生成0-1区间的一致性分数

4. 加权推荐排序:综合大众点评评分(40%)、小红书热度(30%)、跨平台一致性(30%),输出0-10分的最终推荐指数

输出特色: 除常规信息外,特别标注"平台对比标签"(大众点评官方标签 vs 小红书热词)和"风险提示"(评分与热度背离、异常刷评嫌疑等),帮助用户识别"高分低质"或"网红滤镜"陷阱。

显著优点

  • 降噪能力强:通过双源交叉验证,显著降低单一平台刷单/刷评导致的误判
  • 中文场景优化:针对大众点评和小红书的反爬机制、命名习惯、标签体系深度定制
  • 可解释性输出:不仅给分数,更说明"为什么推荐/不推荐"(一致性高/低的具体原因)
  • 灵活阈值配置:支持按餐厅等级( minimum rating)、热度门槛( minimum reviews)、结果数量自定义筛选

潜在局限与风险

| 维度 | 具体说明 |
|------|---------|
| **合规灰色地带** | 依赖网页抓取(web scraping)获取数据,违反平台ToS;大众点评明确标注"需商业合作"才能使用官方API |
| **技术脆弱性** | 反爬机制升级可能导致高频失效;需持续维护代理池、Cookie轮换、请求频率策略 |
| **数据时效性** | 抓取结果存在滞后(小时级),无法反映实时排队/停业状态 |
| **匹配误差** | 模糊匹配在极端情况下可能误联(如不同商圈的同名分店),建议 consistency < 0.5 的结果人工复核 |
| **区域覆盖** | 小红书笔记密度在三四线城市显著低于一二线城市,可能导致数据源失衡 |

适合人群

  • 美食探店博主/本地生活创作者:快速筛选值得探访的选题
  • 商务宴请/约会场景决策者:需要高置信度推荐降低踩雷风险
  • 餐饮投资人/竞品分析师:追踪区域热门品类与消费者口碑趋势
  • 对"网红滤镜"持警惕态度的普通消费者:希望获得相对客观的决策参考

常规风险提示

  • 法律合规:该技能在中国大陆运行存在明确法律风险,可能构成《反不正当竞争法》第十二条规制的"妨碍、破坏其他经营者合法提供的网络产品或者服务正常运行";建议使用前评估法律后果
  • 数据隐私:抓取过程中可能获取用户昵称、头像等个人信息,需遵守《个人信息保护法》最小必要原则
  • 结果审慎性:即使 consistency > 0.7,仍建议结合最新实地评价或电话确认营业时间后再前往

Clean Skill 内容

examples文件夹
references文件夹
scripts文件夹
手动下载zip · 36.4 kB
example_usage.pytext/plain
请选择文件