📝 长对话与长期记忆
# 长对话与长期记忆
长对话默认自动压缩,不需要开启额外功能。自建模型容量无法识别时,在模型 Spec 上设置 .contextWindow(实际Token上限)。
普通续聊会自动保存。需要额外提取用户偏好、稳定事实等长期记忆时,可开启:
liteflow.agent.harness.memory.flush-mode=THROTTLED
liteflow.agent.harness.memory.flush-min-gap=5m
NEVER 是默认值,不在每轮结束后额外提取;ALWAYS 每轮提取;THROTTLED 按最小间隔控制提取频率。提取会增加模型调用。长期记忆写入工作区,由所选存储保存;它与前端展示的聊天记录分开。
# 压缩与记忆提取的区别
长对话压缩用于让输入适应模型上下文窗口;长期记忆提取用于保存用户偏好、稳定事实等可复用内容。默认不逐轮提取长期记忆,但普通续聊状态仍会保存。
liteflow.agent.harness.compaction-threshold=0.8
liteflow.agent.harness.compaction-fallback-context-window=524288
liteflow.agent.harness.compaction-fallback-threshold=0.9
已知模型容量时使用 compaction-threshold;无法识别时使用后两项估值配置。框架会为输出预留空间,比例按可用输入预算计算。自建模型应优先提供真实 contextWindow(...),不要通过提高阈值绕过模型容量限制。
长期记忆保存在工作区。备份和切换存储时,应同时保留会话状态与工作区数据,详见会话存储。
帮助我们改善此文档 (opens new window)
上次更新: 2026/09/20, 11:49:27



