核心机制
Self-Learn 是一套双循环持续改进系统,专为长期个性化服务设计。它通过两条路径积累知识:
1. 被动学习——用户纠正触发
当检测到特定话术("No, that's wrong"、"Actually..."、"Stop doing X"、"I told you before..."等),立即执行四步流程:简短确认→写入memory/corrections.md→调用memory_store(category: preference/decision, importance: 0.85)→验证存储。所有纠正条目标注日期,格式为[CORRECTION] <错误行为> → <正确行为>。
2. 主动学习——任务完成自评
每完成一项任务后,Agent进行1-3句内省:输出是否契合意图?下次如何改进?是否值得存储为可复用模式?若判定有价值,则记录CONTEXT+REFLECTION+LESSON三段式日志,并同步至LanceDB(category: decision, importance: 0.75)。常规无瑕疵任务跳过记录,避免日志膨胀。
显著优点
- 双向反馈闭环:既捕获显性纠正(用户指令),也挖掘隐性优化(自我反思)
- 分层存储架构:Markdown文件供人工审阅,向量数据库支持语义检索与跨会话召回
- 智能去重机制:通过"routine skip"规则与原子化条目(<100词)控制噪音
- 隐私安全内建:明确禁止记录凭证、个人数据等敏感信息
局限与风险
- 触发依赖用户表达:若用户纠正方式不规范(如仅沉默或放弃),可能漏捕信号
- 自评主观性:Agent对自身输出的判断可能存在盲区,需人工定期审阅
corrections.md - 存储膨胀风险:虽有过滤规则,高频使用场景下仍需定期归档旧条目
- 跨会话一致性:依赖LanceDB召回质量,关键词标注不当会导致"学了但想不起来"
适合人群
- 需要长期协作关系的深度用户(写作助手、编程伙伴、研究助理)
- 对AI输出风格/格式有明确偏好的专业用户
- 多轮复杂项目管理者,需要Agent记忆上下文决策
安全等级说明
- S级:无代码执行、无外部网络调用、无敏感数据硬编码
- 潜在风险点:用户可能在纠正过程中无意中泄露敏感信息,需依赖"No secrets"规则过滤
- 存储路径
memory/corrections.md为本地文件,建议配合访问控制