核心用法
PBE Extractor 采用基于原则的蒸馏(Principle-Based Distillation, PBD)方法论,从任意文本中提取"不变性原则"——即那些能够经受重述考验的核心思想。用户只需提供文本内容(建议200-3000词),可选补充领域上下文和目标压缩级别,系统将自动执行三步流程:Bootstrap(无偏见阅读)、Learn(识别模式并测试不变性)、Enforce(通过重述验证)。
关键操作是重述测试:一个原则必须能用完全不同的语言表达而不改变含义。通过此测试的原则会被分配高/中/低三个置信等级,并生成标准化形式(如"I always tell the truth"→"Values truthfulness over comfort"),最终输出结构化的JSON结果,包含压缩率、原则清单及后续验证建议。
显著优点
1. 方法论严谨性:区别于简单摘要,PBD要求原则能通过"重述再生"验证,确保提取的是结构性认知而非关键词堆砌
2. 置信透明机制:显式标注证据强度(高/中/低),诚实承认不确定性,避免过度承诺
3. 知识管理友好:标准化归一形式支持跨文档比较,N≥2验证机制鼓励持续迭代
4. 完全本地处理:无外部API调用,数据仅在用户代理的模型信任边界内处理
5. 输出可审计:保留原始语句、来源证据、语义标记,支持回溯验证
潜在局限
- N=1起点限制:单源提取的原则仅为"观察",未经交叉验证,不能视为确认真理
- 压缩损失风险:目标压缩率>85%时需人工复核,高抽象可能牺牲领域特异性
- 内容密度依赖:50词以下输入效果极差,结构化较差的内容(如纯叙事)提取率低
- 归一化边界:上下文绑定原则(如"周五不发布")和数值阈值无法标准化,需人工判断
- 无真伪判断:系统只识别"模式"而非"正确性",提取的谬误会被忠实地结构化呈现
适合人群
- 知识工作者:需要从技术文档、方法论材料中提炼可复用原则
- 研究者/分析师:处理多源文本时需结构化比较框架
- 开发者/技术写作者:维护代码注释、架构决策记录(ADRs)或最佳实践文档
- 学习者:希望通过"压缩即理解"深化对复杂材料的掌握
不适合:寻求客观真理验证、期望完全自动化决策、或处理高度敏感需绝对保密内容的场景。
常规风险
1. 认知锚定风险:系统化的JSON输出可能让用户过度信任低置信度推断
2. 语义漂移:归一化过程中可能丢失文化语境或情感色彩(如"honesty"vs"truthfulness"的细微差别)
3. 单点故障依赖:若底层LLM产生幻觉,提取的原则将继承其偏见
4. 验证惰性:明确建议"需N≥2验证",但用户可能忽略next_steps中的比较建议直接应用结果
5. 领域误用:将适用于技术文档的方法套用于法律/医疗等强合规领域时,可能因"模式≠真理"的免责声明不足而触雷