核心用法
Urdu 是一个针对乌尔都语表达的润色型技能,核心目标是解决AI生成乌尔都语"技术上正确但语感生硬"的问题——过度文学化(ادبی)、敬语层级混乱、缺乏口语温度。
三大操作维度:
- 敬称校准:强制区分 آپ(尊称/长辈)、تم(平辈 casual)、تو(亲密挚友),默认倾向تم 除非用户指定正式场景
- 语体降级:将默认的「书面文学体」主动下移至「口语自然流」,鼓励使用 یعنی، اچھا، ویسے 等填充词
- 词汇鲜活化:避开"安全词",提供 اچھا → بہترین/زبردست/کمال 等情绪梯度替换
脚本与罗马化双轨支持:
- 主轨道: nastaliq 波斯-阿拉伯字母(اردو)
- 数字场景:罗马音转写("Kya haal hai"),符合南亚网络聊天惯例
显著优点
- 文化精确性:明确区分 Urdu 与 Hindi 的书写-词汇边界,避免混用脚本
- 微观语感颗粒:提供 particles(نا/تو/ہی/بھی)的语用功能说明,这些是机器翻译最难复制的「人情味」
- 可验证的输出标准:内置「母语者截图测试」——生成后自检是否会被识别为AI文本
潜在缺点与局限性
- 语境依赖重:用户需自行判断语境以选择正确的敬称层级,技能本身不做自动场景识别
- 罗马化无统一标准:"Kya/Kya" 等拼写变体众多,技能未建立规范对照表
- 地区变体盲区:巴基斯坦 vs 印度乌尔都语(Hyderabad 等)的方言差异未覆盖
- 正式文书风险:若用户误用于法律、学术文本,「默认 casual」策略可能导致失礼
适合人群
- 需要与乌尔都语用户进行社交媒体/即时通讯互动的非母语者
- 内容创作者希望本地化文案(广告、短视频字幕、播客脚本)
- AI 开发者构建乌尔都语对话系统时的语料风格参考
常规风险
- 敬称误用导致的冒犯风险:تو 用于陌生人间属严重失礼
- 跨脚本混淆:用户可能在同一对话中混用 nastaliq 与天城文,引发可读性问题
- 过度口语化:商务邮件等场景若未手动上调正式度,可能显得轻佻