让 Agent 自己验收、自己整理记忆
Outcomes 让一个看不到写手思路的独立评审按评分标准逐条验收,不合格就返工;Dreaming 在会话之间读旧记忆和历史会话,另外生成一份整理好的记忆库,原库不动。本文从第一性原理推出这两个机制为什么必要,给出完整的请求与事件、一个真实的三轮返工案例,并把它们翻译成能搬到任何 Agent 技术栈的两份契约。
分类 · 9
Outcomes 让一个看不到写手思路的独立评审按评分标准逐条验收,不合格就返工;Dreaming 在会话之间读旧记忆和历史会话,另外生成一份整理好的记忆库,原库不动。本文从第一性原理推出这两个机制为什么必要,给出完整的请求与事件、一个真实的三轮返工案例,并把它们翻译成能搬到任何 Agent 技术栈的两份契约。
基于 Codex rust-v0.147.0 源码,用大白话解释工具为什么要按需加载、BM25 如何从大量工具中排出最相关的几个,以及怎样把同一设计搬到 Python、Go 和其他模型。
基于 openai/codex 源码,拆解选择性并行、Unified Exec、ExecCell、Skills 渐进上下文、Goal 自动续跑,以及如何通过 App Server 嵌入同一套 Runtime。
OpenClaw 的 daily-ai-news 定时任务连续超时。根因不是模型不够强、不是 prompt 太长、不是上游 API 挂了——是 SKILL.md 里少写了一行绝对路径,导致 Agent 每次执行花 15 次 exec 调用搜索一个 skill 的位置。消息数从 54 膨胀到 165,工具调用结果从 204KB 暴涨到 1.1MB。这篇记录完整的排障过程和修复方法。
OpenClaw 记忆系统的向量检索默认不可用——但 BM25 文本搜索兜底让系统照常运转。当你发现「不配 embedding 也能跑」,到底要不要修?怎么用 NVIDIA 免费 embedding API 零成本补上?这是一篇生产环境的真实记录。
Anthropic 在 Claude 平台推出的 Programmatic Tool Calling 和 Dynamic Filtering 不仅是功能增强,更代表了一种 Agent 架构范式的转移——从自然语言编排转向代码编排,从全量上下文注入转向按需过滤。本文综合多篇非 AI 撰写的深度技术文章,从架构原理、性能数据到生产实践,全面解读这场 Outer Loop 的进化。
从部署到排障,记录 OpenClaw 从启动失败、飞书消息静默吞回复到 production 稳定的全链路实战经验——compaction safeguard、五层排查法、model-harness-fit 与记忆系统对比。
Agent 流水线不是普通的异步任务——它有状态、会卡住、需要重放排障、单条失败不能拖垮整批。Celery 每一条都踩坑后才明白 Temporal 不是"另一个任务队列",而是在解决不同层级的问题。
RAG、结构化知识库、纯文本上下文记忆——三种 Agent 长期记忆方案的成本、延迟、精度和可维护性对比,附决策树。