核心功能
HaluCatch(捕幻)是专为AI Skill设计的执行可靠性审查工具,解决AI代理执行Skill时常见的幻觉、不可复现、业务逻辑歧义等问题。它通过系统性四维评估,在Skill部署前发现潜在风险。
显著优点
评估维度全面:覆盖地基(数据管道完整性)、代码(执行风险)、规则(业务口径清晰度)、护栏(解读约束)四大维度,针对AI执行特性设计检查项,如统计函数篡改风险、裸except处理、因果语言禁令等。
输出体系完善:自动生成标准版(业务友好)、专业版(技术细节)、行动版(修复指令)三份报告,满足不同受众需求,避免信息过载。
执行模式高效:完全离线运行,无需API调用;单次命令完成全流程(L1扫描+L2评估+L3报告),通常几秒到几十秒完成;脚本承担确定性任务,AI专注语义补充,分工明确。
安全边界清晰:明确声明不擅长网络安全、合规审查、性能优化;写入操作仅限于报告目录,修复需用户确认;单文件10MB上限、不支持二进制文件等硬性约束防止滥用。
潜在局限
适用范围受限:仅限Skill审计场景,不替代通用代码审查工具;对纯方法论型Skill评估深度较浅;无法判断业务逻辑本身是否正确(只检查描述是否清晰)。
技术依赖明显:需Python 3.8+环境;对非UTF-8编码、超大目录等边缘情况需手动处理;部分检查项依赖启发式规则,存在误报可能。
修复环节半自动:行动版报告提供修复方案,但执行仍需用户确认并另启AI会话应用,未实现闭环自动化。
适合人群
- Skill开发者:部署前自检、版本迭代验证
- AI平台运营者:入库审核、质量分级
- 业务负责人:评估外部引入Skill的可靠性
- 数据/工程团队:协同审查含数据处理逻辑的Skill
常规风险
- 配置风险:
skills_is_external标记若配置错误,可能误审外部依赖 - 误报风险:正则匹配类检查可能将合理代码标记为风险
- 修复风险:自动生成的修复方案可能改变原Skill语义,必须人工确认
- 时效风险:基于快照审查,不追溯历史版本,修改后需重新运行