India Location Normalizer RE-India

📍 印度地名智能标准化引擎

将印度房地产线索中的非标准地名(如Goregaon、PCMC、Hinjewadi等)标准化为规范的城市-区域字段,支持模糊匹配并标记低置信度结果,仅限Mumbai和Pune v1覆盖范围。

收藏
3k
安装
1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

India Location Normalizer 是一款专用于印度房地产市场的数据清洗技能,核心任务是将线索中提取的原始位置文本(包含大量别名、缩写和非标准写法)映射为规范化的城市-区域结构。该技能作为中间处理节点,接收来自 lead-extractor 的输出,输出结构化位置数据供下游评分使用。

处理流程
1. 验证输入格式是否符合 schema 规范

2. 按三级匹配策略解析位置:精确匹配(忽略大小写)→ 标准化令牌匹配(去标点、压缩空格)→ 保守模糊匹配(仅限明确无歧义场景)

3. 输出包含 city、locality_canonical、micro_market、confidence、unresolved_flag 的标准化记录

显著优点

  • 针对性设计:专为 Mumbai 和 Pune 两大核心房地产市场优化,内置 v1 版权威别名映射表
  • 防错优先:采用"宁可漏判、不错判"策略,模糊匹配仅限高置信度场景,显著降低错误归因风险
  • 零副作用:纯读取/转换操作,不写数据库、不发消息、不触发外部通道,数据安全可控
  • 链式友好:明确推荐在 lead-extractor 之后、sentiment-priority-scorer 之前使用,形成标准化流水线

潜在局限

  • 地理覆盖有限:当前仅支持 Mumbai 和 Pune v1,对 Delhi NCR、Bangalore 等其他印度主要城市未覆盖
  • 依赖静态映射表india-location-aliases-v1.json 的更新频率决定别名识别能力,动态新兴区域名可能无法识别
  • 模糊匹配保守:可能导致部分合理别名被标记为 unresolved,需人工复核比例
  • 无自学习机制:无法根据历史匹配结果自动优化映射表

适合人群

  • 印度房地产 CRM/线索管理平台的产品团队
  • 需要标准化 Mumbai/Pune 房源位置数据的数据工程师
  • 构建线索优先级评分系统的机器学习团队

常规风险

  • 输入数据质量差(如极端拼写错误、混合多语言)时 unresolved_flag 率升高,影响下游处理效率
  • 版本更新滞后可能导致新区域别名无法识别,建议建立映射表定期更新机制
  • 跨城市边界别名(如"Navi Mumbai"与"Mumbai"界限模糊场景)可能引发分类争议

India Location Normalizer RE-India 内容

agents文件夹
references文件夹
手动下载zip · 4.1 kB
openai.yamltext/plain
请选择文件