核心功能与架构
NeverForget 1.0.3 是一套完整的主权本地向量记忆(Sovereign Local Vector Memory)解决方案,专为追求数据隐私与离线能力的AI Agent设计。其核心采用 node-llama-cpp 引擎驱动 Gemma-300M-Q8_0 量化嵌入模型,所有文本向量化与相似性搜索均在本地完成,彻底摆脱对外部API的依赖。
显著优势
| 维度 | 特性 |
|------|------|
| **隐私主权** | 全本地推理,敏感数据永不离开设备 |
| **成本归零** | 无Token消耗,适合高频索引场景 |
| **模型质量** | Gemma-300M在MTEB基准表现优异,8bit量化平衡精度与效率 |
| **智能防护** | 1.0.3核心升级:递归循环保护,自动排除自身数据库路径避免自噬 |
| **幂等部署** | 安装脚本具备状态检测,重复执行安全无冗余 |
技术实现要点
系统通过四层架构实现稳健运行:
1. 引擎层:node-llama-cpp 提供跨平台LLM推理能力
2. 模型层:Hugging Face直连下载Gemma-300M GGUF格式权重
3. 配置层:openclaw CLI统一管理provider、模型路径与排除规则
4. 监控层:HEARTBEAT.md注入式健康检查,含磁盘状态监测
关键安全配置(自动写入):
# 阻断递归索引死循环 openclaw config set agents.defaults.memorySearch.exclude '["**/.openclaw/memory/**", "**/node_modules/**"]'
局限性与风险
| 风险类型 | 具体表现 | 缓解措施 |
|---------|---------|---------|
| **硬件门槛** | Gemma-300M需~600MB显存/内存,低配设备推理延迟显著 | 推荐WSL2+CUDA或Apple Silicon环境 |
| **首次冷启动** | 模型下载与全量索引耗时较长 | 利用幂等脚本分阶段执行,支持断点续传 |
| **模型单一性** | 仅支持Gemma-300M,多语言/代码场景表现弱于商用API | 未来版本或支持模型热切换 |
| **沙箱逃逸** | broad `~/` 权限理论上可触及敏感文件 | 通过`package.json`精细化`filesystem`白名单 |
适用人群
- 隐私优先用户:法律、医疗、金融等敏感领域从业者
- 离线场景开发者:断网环境、边缘计算、气隙网络部署
- 高频索引需求:RAG系统需持续更新大量文档的知识库构建者
- 成本敏感团队:希望消除OpenAI/Cohere等API持续支出的组织
部署建议
建议在WSL2 Ubuntu或macOS 14+环境运行,确保Node.js 18+与充足磁盘空间(模型+索引约需2-3GB)。首次执行后通过 openclaw memory status --json 验证分块数量,正常索引后应保持非零值。
> ⚠️ 注意:本技能修改全局OpenClaw配置,多Agent环境需评估配置冲突风险。