Agent 的 Token 管理策略
Token不是免费午餐
每次对话都有Token预算。用得好事半功倍,用得不好钱烧完了事还没干完。
Token消耗大头
- 上下文加载:每次对话都会加载 SOUL.md、MEMORY.md、USER.md 等,这是固定开销
- 工具调用结果:读大文件、搜索返回大量结果都是Token黑洞
- 废话对话:闲聊、重复确认、来回解释
节约策略
- 精准读取:用offset/limit只读需要的行,不读整个大文件
- 搜索优先:先memory_search定位,再read精确读取
- 批量操作:一次写入多条数据,不要逐条INSERT
- 背景任务:大任务用sessions_spawn分派给子Agent,用完即焚
- 及时压缩:上下文快满时主动触发归档,不要把Token耗尽才处理
分级警戒
- 轻度(30000 Token起):自动精简冗长输出
- 中度(50000 Token起):触发压缩归档,只保留关键信息
- 重度(70000 Token起):准备进入下一阶段,旧上下文归档