Low Token Usage

🗜️ 智能压缩输出,高效节省 token

三级自适应 token 节约系统,在推理配额受限时自动压缩输出长度,兼顾效率与准确性。

收藏
4.6k
安装
1k
版本
2.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Low-Token Mode 是一套分三级的自适应 token 节约框架,通过 /token-mode 命令或系统自动检测触发。三级递进策略如下:

| 级别 | 触发条件 | 核心策略 |
|:---|:---|:---|
| **LOW** | 默认状态 | 精简回答、去除冗余叙述、单工具调用、禁用非必要 Markdown |
| **MEDIUM** | 剩余 token < 50% | 单句回答、无前后缀、合并工具调用、优先文件编辑而非读取 |
| **EXTREME** | 剩余 token < 25% | 绝对极简、无解释、纯动作、批量编辑、禁用格式、单字/词响应 |

系统自动升级场景包括:用户提及 token 限制、多次请求失败(速率限制)、显式预算警告、配额周期末期等。

显著优点

  • 分级精细:三级递进避免"一刀切",在约束与可用性间取得平衡
  • 零牺牲原则:明确规则禁止以牺牲准确性换取简洁,安全校验(guardian skill)始终完整执行
  • 智能检测:自动识别需要节约 token 的场景,降低用户认知负担
  • 集成友好:与 guardian、operator、self-improvement 等 skill 协同,内部日志保持详细仅压缩输出

潜在缺点与局限性

  • 学习曲线:EXTREME 模式的极简输出(如"Killed.")可能造成用户困惑,需适应
  • 上下文风险:过度压缩可能导致关键信息遗漏,尤其跨轮对话时
  • 边界模糊:"必要时""内容已知"等判定标准依赖实现,一致性存疑
  • 人工干预:复杂任务强制完整处理,可能与用户期望的节约冲突

适合人群

  • API 配额紧张的个人开发者或小型团队
  • 高频自动化调用场景(CI/CD、批处理脚本)
  • 成本敏感的生产环境运维
  • 需快速获取执行结果、无需解释性内容的专家用户

常规风险

  • 误触发升级:自动检测机制可能在不必要场景切入高压缩模式
  • 模式残留:状态持久化至主动变更,用户可能忘记已处于 EXTREME 模式
  • 安全信息截断:虽 guardian 保持详细,但操作反馈极简可能掩盖警告信号
  • 协作摩擦:团队环境中不同成员模式不一致导致沟通成本上升

Low Token Usage 内容

手动下载zip · 2.2 kB
skill-card.mdtext/markdown
请选择文件