核心用法
India Location Normalizer 是一款专用于印度房地产市场的数据清洗技能,核心任务是将线索中提取的原始位置文本(包含大量别名、缩写和非标准写法)映射为规范化的城市-区域结构。该技能作为中间处理节点,接收来自 lead-extractor 的输出,输出结构化位置数据供下游评分使用。
处理流程:
1. 验证输入格式是否符合 schema 规范
2. 按三级匹配策略解析位置:精确匹配(忽略大小写)→ 标准化令牌匹配(去标点、压缩空格)→ 保守模糊匹配(仅限明确无歧义场景)
3. 输出包含 city、locality_canonical、micro_market、confidence、unresolved_flag 的标准化记录
显著优点:
- 针对性设计:专为 Mumbai 和 Pune 两大核心房地产市场优化,内置 v1 版权威别名映射表
- 防错优先:采用"宁可漏判、不错判"策略,模糊匹配仅限高置信度场景,显著降低错误归因风险
- 零副作用:纯读取/转换操作,不写数据库、不发消息、不触发外部通道,数据安全可控
- 链式友好:明确推荐在 lead-extractor 之后、sentiment-priority-scorer 之前使用,形成标准化流水线
潜在局限:
- 地理覆盖有限:当前仅支持 Mumbai 和 Pune v1,对 Delhi NCR、Bangalore 等其他印度主要城市未覆盖
- 依赖静态映射表:
india-location-aliases-v1.json的更新频率决定别名识别能力,动态新兴区域名可能无法识别 - 模糊匹配保守:可能导致部分合理别名被标记为 unresolved,需人工复核比例
- 无自学习机制:无法根据历史匹配结果自动优化映射表
适合人群:
- 印度房地产 CRM/线索管理平台的产品团队
- 需要标准化 Mumbai/Pune 房源位置数据的数据工程师
- 构建线索优先级评分系统的机器学习团队
常规风险:
- 输入数据质量差(如极端拼写错误、混合多语言)时 unresolved_flag 率升高,影响下游处理效率
- 版本更新滞后可能导致新区域别名无法识别,建议建立映射表定期更新机制
- 跨城市边界别名(如"Navi Mumbai"与"Mumbai"界限模糊场景)可能引发分类争议