Skip to main content
· 9 min read

DeepSeek Harness 把 AI 编程工具的每个组件都做成可插拔插件——模型适配器、工具注册、日志,连 AI 循环本身都能换。

  1. 定位:可拆装重组的 Agent 平台骨架,"成品车" vs "开源引擎 + 配件市场"
  2. 核心:连 AI 循环都是插件,4 层可替换 + seam 设计一处替换全局生效
  3. 标志:日志即真相,AI 看到的字节从账本重算,runtime 断言强制
  4. 适合:平台团队 / 合规重行业 / 多模型 A/B 测试;普通用户用 Codex / Claude Code 扩展够用
  5. 现状:0.1.0-rc.5 Preview,可接入绝大数模型,第三方插件鱼龙混杂,权限过大
  6. 设计模式:可逆副作用 / 类型化事件 / 文档生成 + 完整性守卫 / 防御式加载 / UI 订阅事件
· 7 min read

Claude Code 跨会话消息把多 Agent 协作从「手动搬运上下文」推进到「自动通知对方」。

  1. 核心能力:一个会话可把文字摘要发给另一个会话,接收方在原任务里继续处理
  2. 三种模式互发摘要 / 双向问答 / Claude 主动通知 改动影响
  3. 关键约束:只传文字摘要,不传完整历史,也不传文件
  4. 使用姿势ListAgents 列出可达会话,SendMessage 按名称发送,prompt 触发即可
  5. 硬门槛:Claude Code v2.1.224+,支持 macOS 与 Linux
  6. 跨机器边界:跨机器或网页会话只能回复,不能主动发起对话
  7. 关键边界这不是会话迁移,要搬完整上下文仍需恢复原会话
  8. 方向意义:多 Agent 协作从「手动衔接」走向「自动通知」,是 Agent 协作从单点走向网络的关键一步
· 8 min read

Agent 提前停下来的本质,是把「一轮回答结束」错认成「整个任务完成」。Pi 的 /goal 扩展把这层混淆拆开。

  1. 核心问题:一轮回答结束 ≠ 任务完成,普通 Agent 缺少独立完成判断机制。
  2. 目标弱化:长上下文里,初始目标被中间产物稀释,模型围绕当前成果回复。
  3. Goal 四步循环:保存完整目标 → 每轮重读提示词 → 必须调用 goal_complete → 未完成自动续跑。
  4. 两种判断方式Codex 工作模型自查 + 完成工具;Claude Code 独立评估模型判断。
  5. 适用任务四特征:结果明确、可验证、逐步收敛、不需要频繁人工决策。
  6. 任务描述四要素:结果、范围、验收方式、禁止操作。
  7. 能力边界:Goal 是持续执行保障层,正确性最终仍取决于模型和验证方法。
· 8 min read

企业级 Agent 落地,关键是「它能不能被改造」,不是功能多不多。

  1. 市场风向:底层接 Pi 的 Agent 产品越来越多,如 OpenClaw,MinimaxCode 等项目。
  2. 极简内核:4 工具(read / write 创建或覆盖 / edit 替换片段 / bash 执行)。
  3. 系统提示~370 token(约 150 行),主流最短。
  4. 企业扩展全生命周期都是可改写钩子。
  5. 可移植:插件本地到生产无缝,TS/Python SDK + RPC。
  6. 透明可审计:系统提示完全开放,能看清行为边界。
  7. 结论极简 = 透明 = 可控,是落地前提。
· 7 min read

Claude Code 2.0.74 加了 LSP(Language Server Protocol)支持,表面看只是多装几个插件,实际上是 AI 编程 Agent 第一次吃上了 IDE 沉淀了多年的语言理解能力

  1. 痛点:没 LSP 时,Claude Code 只能「全文搜索 + 模型逐处判断」——慢、错、烧 token
  2. 调用定位:从「grep 后让模型猜」变成「直接问 LSP 拿结构化结果
  3. 结构体方法:模型不必再读整个类型定义文件,LSP 一次性返回方法列表和签名
  4. 实时诊断:从「全量 build 才能知道哪里错」变成「输入即检查」,延迟从分钟级降到秒级
  5. 当前局限模型仍不主动调用 LSP,prompt 需显式触发
  6. 方向意义:Coding Agent 与 Language Server 之间,未来需要一个面向 Agent 的新协议层
· 9 min read

Skill 维护的核心是钉住 5 件事:成功标准、失败点、测试集、进化、版本。少一类,评估是空的。

  • 成功结果 / 过程 / 风格 / 效率,缺一类评估就漏
  • 失败:触发 / 环境 / 执行 3 类,每类独立观察、独立维护
  • 测试集:显式 / 隐式 / 上下文 / 副测试集,10-20 条就够
  • 进化:失败信号 → 候选补丁 → 新能力验证 → 基线回归 → 灰度
  • 版本:git 单一来源——commit / tag / push 三件套,不另起基础设施
  • 结论:Skill 进生产就是工作流资产——靠体感维护必然崩,按这 5 件事维护才能稳
· 10 min read

产品思维是把视角从"我有什么"换到"用户要什么",从卖货转向卖解决方案。

  • 本质:从功能/参数出发 → 从用户/场景出发,最终交付的是"解决麻烦的能力"而不是"货"。
  • 懂货 ≠ 懂产品:老板眼里的"参数堆砌"和产品人眼里的"解决方案",差的就是用户视角。
  • 质量是及格线:参数/成本/工艺只决定能否入场,不是护城河——消费品卖的是利益/感受/方案。
  • 长在场景里:脱离场景的参数毫无意义——火车上的充电宝和打游戏时的充电宝,是两件产品。
  • 靠减法:选定一个核心用户、一个核心痛点,敢于放弃 90% 的次要需求。
  • 服务延伸:付款那一刻关系才刚开始,多想一步的赠品比多花一块钱的功能更让人记住你。
  • 自带传播:好产品本身就是内容,PLG 把"产品即增长"做成了商业模型。
  • 底层是同理心:去感受焦虑、体验麻烦、理解渴望,别再自嗨。
  • 一句话:你卖的不是货,是解决问题的方案,以及背后"用户离不开你"的那一层。
· 9 min read

Electron 的渲染层不是"一个浏览器",是 Chromium + 多层抽象。

  1. Chromium 是底座:每个 Electron 版本绑定一个 Chromium 稳定版
  2. webContents 是核心抽象:每个渲染页面背后都有一个 webContents 实例
  3. <webview> 标签:在 renderer 里嵌入另一个 webContents
  4. webContentsView 是新版抽象:替代已废弃的 BrowserView
  5. webPreferences 是渲染配置:preload / contextIsolation / sandbox 等开关
  6. 系统 WebView 完全不同:WKWebView / WebView2 是 OS 提供的
· 8 min read

两种 agent 表面都"循环",但决定"什么时候退出循环"的主体完全不同——这才是它们真正的分野。

  1. 决策主体:ReAct 退出由 LLM 自己判断,Loop 退出由外部规则验证。
  2. 适用场景:ReAct 适合查天气这类 3 步内 完成的轻量任务,Loop 适合老代码升级这类需要客观验证的工程任务。
  3. 工程难点:Loop 每轮会清上下文重建 prompt,反馈机制与状态持久化是真正的门槛。
  4. 真实案例Claude Code 是 ReAct 框架 + Loop 思维的混合体——LLM 驱动主循环,但把判官能力下放给 Bash 工具的 exit code。
  5. 思想定位:Loop Agent 不是新模型,是承认 LLM 会幻觉出错,结合软件工程验证与 AI 生成能力的务实架构。
· 6 min read

Claude Code 连续工作几个小时不爆 context,不是因为「记性好」,是因为 它同时维护三个版本的历史,每次只把最该看的那一份喂给模型。

  1. 核心观点:成熟的 Agent 不止有「聊天记录」,而是把 UI 历史 / 接口视图 / 磁盘会话链 分成三层
  2. UI 历史:用户在终端看到的精简版,只保留关键节点。
  3. 接口视图:实际发给模型的那一份,叠加了 Prompt Cache 与压缩投影。
  4. 磁盘会话链:完整事实记录,永远不修改,恢复靠「投影」而不是「改写」。
  5. Resume 不是回放:恢复会话 = 在磁盘链上选投影策略重新生成接口视图。
  6. 压缩的本质:从无损丢消息升级为「按当前任务相关性重新切片」。
发文趋势
近 12 个月 · 共 181
10111212345678109