Soul Archive

🧬 打造你的数字灵魂副本

本地明文 JSON 构建数字人格克隆,支持跨会话记忆、主动上下文注入与失败模式预警,隐私优先无云端依赖。

收藏
3.2k
安装
992
版本
3.0.0
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

Soul Archive 是一款基于日常 AI 对话构建数字人格持久化系统的工具,核心目标是通过持续采集用户的语言习惯、性格特征、知识观点、工作偏好及理想抱负等七维数据,生成可复用的「数字灵魂副本」。v3.0 版本移除了加密层与难以采集的 Voice/Relationships 维度,新增 Workflow 与 Aspirations 维度,并引入主动 Agent Memory 机制,支持跨会话召回、失败模式预警和行为模式蒸馏。数据全部以明文 JSON 存储于本地 ~/.skills_data/soul-archive/,通过 .gitignore 避免版本控制泄露,隐私策略依赖本地隔离而非加密复杂度。

核心用法:用户可通过触发词(如「灵魂沉淀」「soul extract」)或开启 auto_extract 自动采集对话中的高置信度信息;soul context 在对话开始时输出 ≤800 token 的人格摘要,供其他 AI Agent 注入系统提示;soul recallsoul warn 支持任务前的模式检索与风险预警;soul report 生成交互式 HTML 人格画像,含雷达图、时间线与冲突检测。

显著优点:架构清晰(Skill 与数据分离)、零第三方依赖、去重合并机制(bigram-Jaccard 相似度)、渐进式完整度评分(log10 饱和曲线)、细粒度隐私配置(可按维度开关采集)。主动上下文注入与 Agent Memory 机制在同类工具中较为罕见,能显著提升多轮对话的连贯性与个性化程度。

潜在局限:明文存储虽简化密钥管理,但依赖用户本地环境安全(文件权限、设备物理安全);auto_extract 开启时存在信息过度采集风险,需用户主动审阅 config.json;Big Five/MBTI 等性格推断缺乏标准化测评,仅基于对话推理,权威性有限;长期数据积累后,JSON 文件的读写性能与查询效率可能成为瓶颈。

适合人群:高频使用 AI 对话、希望建立个性化 AI 助手的深度用户;注重数据主权、拒绝云同步的隐私敏感者;多 AI 工具/Workspace 切换、需要统一人格上下文的极客用户;对「数字遗产」或情感陪伴有需求的长期主义者。

常规风险:本地明文 JSON 若设备丢失或被恶意程序读取,可能导致敏感信息泄露;auto_extract 可能误采健康、财务等敏感话题(虽默认需确认);AI 生成的性格标签与行为模式存在自我强化偏见,长期可能形成「信息茧房」式的数字人格;跨平台迁移时需手动处理数据目录路径差异。

安全解读

核心用法

Soul Archive v3.0 是一款「数字人格持久化 + 主动智能体记忆」系统,通过六大工作模式实现人格数据的采集、存储与复用:

Soul Extract(灵魂沉淀):在对话中自动或手动触发,从 7 个维度(身份、性格、语言风格、知识观点、记忆、工作偏好、理想抱负)提取高置信度信息,经去重合并后写入本地 JSON 档案。

Soul Chat(灵魂对话):加载完整档案生成角色扮演 Prompt,让数字克隆体以用户风格进行回应,实现"让 AI 替你说话"或"与数字自我对话"。

Soul Report(灵魂报告):生成交互式 HTML 可视化画像,包含七维雷达图、MBTI 推断、灵魂演变时间线、档案冲突检测等。

Soul Context Inject(主动上下文注入):在任意 AI 对话开始时输出 ≤800 token 的人格摘要,使外部 Agent 瞬间理解用户偏好与背景。

Agent Memory Recall(智能体记忆召回):任务执行前主动检索相关行为模式、过往失误预警,避免重复犯错。

AI Self-Improvement(自我反思):自动记录任务反思、用户纠正,经蒸馏形成可复用的行为模式库。

显著优点

极致隐私架构:数据完全本地存储于 ~/.skills_data/soul-archive/,零网络传输、零云端依赖,通过 .gitignore 防止意外提交,用户拥有绝对数据主权。

零依赖轻量化:仅依赖 Python 3.10+ 标准库,无第三方包引入供应链攻击风险,部署成本极低。

主动 Agent 能力:突破传统被动记忆,实现「对话前自动注入上下文」「任务前失败预警」「行为模式自学习」三层主动智能。

科学完整度评估:采用 log10 渐进饱和曲线量化档案完整度,七维加权体系避免单一维度膨胀,冷启动惩罚机制鼓励持续积累。

高可配置性:细粒度控制各维度开关、敏感话题确认机制、自动提取阈值,用户可按场景定制隐私暴露边界。

潜在缺点与局限性

明文存储风险:v3.0 移除 AES-256-GCM 加密层以避免密钥丢失灾难,数据以明文 JSON 存储。若设备被物理访问或目录权限配置不当,敏感信息可能泄露。需用户自行承担数据目录保护责任。

T3 来源可信度:由个人开发者维护,无企业级 SLA 承诺与长期支持保障,代码质量依赖社区监督,关键业务场景建议自行审计或 fork 维护。

采集质量波动:高置信度阈值(>0.6)可能遗漏有价值信息,低阈值则引入噪声;自动提取模式可能在用户无意识时持续记录,存在"监控感"心理负担。

跨设备同步缺失:数据绑定单机本地路径,多设备使用需手动迁移,无内置加密同步机制。

AI 幻觉边界:Soul Chat 模式需严格约束不虚构档案外记忆,实际效果依赖外部 LLM 的指令遵循能力。

适合的目标群体

  • 高频 AI 协作者:长期与 AI 对话、希望建立"默契"的知识工作者与创作者。
  • 多 Agent 用户:同时使用多个 AI 工具,需要统一人格上下文减少重复介绍的效率追求者。
  • 数字遗产规划者:希望为亲友留存可交互数字记忆的情感记录者。
  • Agent 开发者:需要为自研 AI 快速注入用户画像、减少冷启动成本的开发者。
  • 隐私敏感型用户:拒绝云端人格数据、坚持本地优先的极端隐私主义者。

使用风险

性能风险:档案规模增长后,完整档案加载与相似度去重计算可能产生延迟;大 JSON 文件读写存在 I/O 瓶颈。

数据持久化风险:明文 JSON 易受误删、磁盘损坏、版本迁移错误影响,需建立定期备份习惯。

权限配置风险:默认目录权限可能因系统 umask 宽松而暴露,需手动加固为 700/600。

语义漂移风险:长期未复核的档案可能与真实自我产生偏差,建议定期生成报告人工校验。

过度依赖风险:深度个性化后切换环境可能导致体验断崖,存在技术锁定效应。

Soul Archive 内容

references文件夹
scripts文件夹
tools文件夹
手动下载zip · 77.4 kB
extraction_prompts.mdtext/markdown
请选择文件