improvement-learner 是一套面向 Agent Skill 的自动化质量评估与优化系统,核心理念源自 Andrej Karpathy 提出的自我改进循环(evaluate → modify → re-evaluate → keep/revert → repeat)。该技能采用9维度正交评估框架,涵盖 accuracy(内容准确性)、coverage(文件覆盖度)、reliability(代码可靠性)、efficiency(执行效率)、security(安全合规)、trigger_quality(触发器质量)、leakage(信息泄露风险)、knowledge_density(知识密度)及综合评分,彻底解决了早期单一加权分导致的"偏科高分"问题。
核心用法上,用户可通过 CLI 执行三种模式:纯评估模式(--max-iterations 1)快速获取9维分数及详细扣分清单;自动改进循环(--max-iterations 5)在 Pareto 前沿约束下迭代优化,确保任何维度不后退;历史追踪模式可视化分数变化趋势。系统创新性地引入三层记忆架构——HOT 层缓存高频失败模式(如"缺少 Output Artifacts")、WARM 层存储全量评估历史、COLD 层规划用于长期归档——使改进建议具备上下文感知能力。
显著优点体现在三方面:一是评估精度,LLM Judge 对 accuracy 维度的语义判断与人工评估一致率达85%,远超 regex 的随机水平(R²≈0.00);二是改进安全性,Pareto 保护机制杜绝了"牺牲 security 换取 accuracy"的退化风险;三是诊断效率,每个维度的 checklist 失败项直接映射到具体修复动作,如 accuracy 0.83 明确指向 Output Artifacts 或 Related Skills 缺失。
潜在局限包括:LLM Judge 单次评估消耗约3000 tokens($0.01-0.02),成本高于纯规则方案;--mock 模式虽零成本,但 accuracy 相关性从85%降至30%,仅适合调试场景;依赖本地 claude CLI 和 pytest 环境,跨平台部署需额外配置;三层记忆中的 COLD 层尚处规划阶段,长期趋势分析能力受限。
目标用户群体明确:Skill 平台维护者需批量监控技能质量分数、自动化改进开发者追求持续集成中的质量门禁、技术写作专家希望量化评估文档深度。对于仅需单次文件修改或语义候选打分的场景,应转用 improvement-executor 或 improvement-discriminator。
使用风险方面,子进程调用(subprocess.run)虽经安全认证为低风险,但需确保 claude CLI 来源可信;文件系统操作涉及读写 SKILL.md,建议对外部传入的 skill_path 做严格输入验证以防路径遍历;T3 来源等级意味着无 GitHub 组织背书,企业用户应结合内部安全策略审查代码。总体而言,该技能在代码结构清晰度、依赖纯净度(零外部依赖)和功能透明性上表现优异,是构建可自我进化 Skill 生态系统的关键基础设施。