Skip to main content

106 posts tagged with "AI Agent"

View All Tags
· 6 min read

2026 年 AI Agent 的真正主战场不在 ChatGPT 这种对话框里,而在用户的桌面端 —— 直接接管点击、视觉验证、本地长 workflow 的能力,云端 Agent 暂时做不到。

  1. 方向转向:桌面端 Agent 率先爆发,2C 侧先于 2B,传统桌面软件进入"回光返照"窗口期。
  2. 核心优势:千人千面 + 极低使用成本 + 极低试错成本,云端 SaaS 不具备这种灵活度。
  3. 战场转移:Agent 取代的第一步是人在桌面的操作:点击、视觉验证、多软件长 workflow。
  4. 演进优先级:先跑通本地流程,云端 SaaS 那些传统优势后做再说;本地 + token key 已足够跑 MVP。
  5. 结论:个人 PC + AI 是 2026 年最被低估的应用形态,性价比远超云端订阅。
· 8 min read

Anthropic 的真正危机不是模型能力,而是商业模式——一手收客户的钱、一手偷客户的数据和 IP,等模型足够好那天,企业就会发现这是一笔血亏的交易。

  1. 指控核心:提供模型的公司会变成你的竞争对手,Figma、Cursor 都被吃过了
  2. 老剧本重现:微软靠 Windows 垄断吃掉合作伙伴、Google 用搜索流量做自家页面、OpenAI 在 YC 撒钱偷创新。
  3. 成本测算:实测用最强开源模型替代 Anthropic,成本降 90%+,代价只是慢 3 倍。
  4. 关键窗口6~12 个月,开源模型一旦越过能干活的门槛,闭源巨头就被绕开。
  5. NVIDIA 转向:英伟达模型免费送、靠芯片赚钱,帕兰提尔 + 英伟达 = "主权 AI" 已经在跑了。
· 8 min read

Graph Engineering 是 Loop Engineering 之后冒出来的下一个 AI Agent 工程热词——70% 是新瓶装旧酒,30% 是真东西

  1. 真变化:单 Agent 自迭代(Loop)升级为多 Agent 协同 + 治理(Graph),前者解决收敛,后者解决分工
  2. 关键术语:节点 + 边 + 状态,再叠加节点契约、调度、持久化、并发、恢复、权限、评估
  3. 触发事件:Peter Steinberger 7 月 18 日"还搞 Loop?该 Graph 了"推文两天 200 万浏览
  4. 三层架构:Harness(运行躯干)→ Loop(收敛循环)→ Graph(编排网络),90% 的 Agent 死在 1-2 层
  5. 踩坑提醒:单 Agent 任务硬上多节点是过度设计,先把 Loop 跑稳
  6. 判断标准:单 Agent 自我迭代无法收敛时加 Loop;多个 Loop 互相打架时再加 Graph
· 9 min read

Skill 存流程,Memory 存经历,事实没人存——这就是 Knowledge 必须单独留一层的原因。

  1. 层分工:Skill 管怎么做,Memory 管发生过什么,Knowledge 管事实是什么。
  2. 事实写进 Skill 会腐坏:流程半年一改,价目表一周一改,两者不能同一个生命周期。
  3. 事实写进 Memory 会被污染:一次错误结论会被当成「我记得」反复引用。
  4. Graph 不是没前途,是被误当成通用记忆层:独占场景只剩多跳关系和时序失效。
  5. 大多数公司不需要再抽一张图——业务库外键、CMDB、数据血缘早就是图。
  6. grep 替代 RAG 有三个前提:在文件系统上、目录有语义、术语是稳定字面量。
  7. 结论:知识组织的成本从检索侧前移到了写作侧。
· 7 min read

MCP 接 OAuth 2.1 不是"为了安全"四个字能打发的,它是 AI Agent 进企业生产环境的准入门槛。

  • 原生隐患:静态 API key 写死在配置文件里,大模型等于顶着管理员权限在跑。
  • 三宗罪:权限失控、提示词套话吐令牌、所有操作审计不到具体人。
  • 为什么是 2.1:砍掉隐式授权和密码模式,PKCE 从可选变强制。
  • 关键设计:令牌只活在客户端传输层,绝不进大模型上下文
  • 最大难点:Agent 推理跑到一半令牌过期,靠 401 静默刷新兜住思考链。
  • 规模化:DCR 让企业内上千个 MCP server 免手工注册凭证
· 6 min read

OpenAI 把 Codex 编排做成了语言无关的规范。

  1. 大要素:SPEC.md(规范) + elixir/(参考实现) + WORKFLOW.md(仓内配置)
  2. 定位升级:从「管 agent」升级到「管工单」
  3. 主循环:拉 tracker → 建 per-issue workspace → 跑 Codex app-server
  4. 边界:低密预览版,只跑受信环境,无内置沙箱
  5. 设计巧思:host 侧注入 tracker 凭据,主动从 Codex 子进程剔除
  6. License:Apache-2.0,可绕过 Elixir 按规范自实现
· 6 min read

长对话的 Agent Memory 不是「压缩就行」,是分层管理。

  1. 问题核心:summary 平等压缩所有内容,用户核心目标和硬性偏好被一起稀释
  2. Working Memory:类似 system prompt 的常驻字段,永久不参与压缩,守住硬性约束。
  3. 分段增量摘要:滚动窗口分段保存,每段打时间戳 + 优先级标签,不合并。
  4. 向量数据库兜底:摘要丢细节没关系,原文存向量库按需召回。
  5. 多 Agent 方案:Coordinator + Observer + Reflect + Retriever 四角色分工。
  6. 场景选型:几十轮轻量对话 / 中长期 / 超长期多工具三档,对号入座。
· 7 min read

Prompt 注入是 LLM 时代的新型安全威胁。

  • 本质:把恶意指令塞进用户输入,劫持 AI 的决策逻辑
  • 核心原理:指令优先级劫持 — 模型分不清系统规则和攻击代码
  • 三步攻击:识别 prompt 结构 → 构造 payload → 触发执行
  • 与 SQL 注入对比:同样利用边界混淆,攻击目标是 AI 语义,防御成熟度差 20
  • 防御要纵深:输入过滤 + prompt 分层 + 最小权限 + 上下文沙箱 + 输出检测 + 日志监控
  • 反直觉:AI 越智能,被攻破后破坏力越大
· 6 min read

AI 写 UI 最大问题是都长一个样。两个 skill 解。

  1. 问题:默认审美"通用 slop"(AI 批量产的劣质模板)。
  2. taste-skill67.5k stars,"反 slop" 框架,风格库一键装。
  3. Impeccable:49.9k stars,23 个命令 + 7 大模块知识库精细打磨。
  4. 配合:风格约束 + 渐进打磨可叠加使用。
  5. 安装:一行 npx skills add 即装即用。
  6. 背景:都源自 Anthropic 官方 frontend-design skill。
· 8 min read

多 Agent 协作系统设计有 8 个核心问题,一次讲透。

  1. 角色拆分:决策 / 协调 / 执行三层,权限等级分开
  2. 上下文传递:选择性注入 + 笔记本模式,避开上下文膨胀
  3. 冲突仲裁:分类 + 证据链验证 + 置信度加权升级
  4. 死循环破解:状态机 + 令牌桶 + 仲裁 agent
  5. 共享记忆:共识 / 私有分层 + 命名空间隔离
  6. 可观测性:监控 + 追踪 + 日志 + 全链路 trace
  7. 效果评估:完成度 / 效率 / 经济性,必须 AB 对标
  8. 错误恢复:澄清 → 规划校验 → 反思 → 仲裁兜底

多 Agent 不是 1+1>2,先看值不值再上。