Glean 拾遗
← 所有期号
#013 8/17–8/23 8 月 23 日发布

Agent 的工程化拐点

本周十四篇文章有一个共同背景:Agent 不再只是能跑通的 demo,而是真实进入代码库、账单与团队协作的工程实体。两条线索交错:一条把工作流从线性 prompt 重构为图,删掉不读上游结果的假边,让并行真正发生;另一条为 Agent 补上基础设施——跨会话归纳的记忆、稳定命中缓存的上下文、可休眠的运行时,以及与人共享的浏览器和编辑界面。当 Claude 一周开出数百个 PR,质量与判断力成为新的稀缺资源:确定性扫描、独立验证器、工程师的基本功,反而比任何时候都重要。每一篇都在回答同一个问题:如何让 Agent 在真实系统里可靠、可控、可维护地工作。

14 篇 4 章 约 3 小时
章节 01

把工作流画成图:从线性 Prompt 到可组合架构

4 / 14
x.com · 10 min
01

删掉不存在的箭头:从 1 条 prompt 到 100 个 agent 的图工程八步Graph Engineering: from 1 prompt to 100 agents in one system

这篇文章主张把 agent 工作流本身当作一个工程对象:在 prompt/context/harness/loop 之外,增加“图工程”层。作者的核心观察是,默认线性编排把“顺序”误当成“依赖”,大量箭头并不读上游输出,删除这些假依赖后才能真正并行;所谓 100 个 agent,不是 100 个角色,而是同一角色带各自的上下文窗口实例化 100 次。全篇给出八步方法,覆盖节点契约、四种拓扑、join 时机、分类器与路由表分离、验证节点、持久化状态,并给出“什么时候不该用图”的判断清单。作者坦诚并行广度是有代价的,引用了 Anthropic 多智能体研究的 token 消耗数据。适合正在把单 agent 原型演进为多 agent 生产系统的工程师;没有运行代码,结尾有课程引流。

x.com · 24 min
02

图工程入门:为 AI 工作流建模,该并行时就并行Graph Engineering explained: what it is, when to use, when not to

作者把多 Agent 工作流设计归纳为“图工程”:节点承担单一任务并约定输入输出,边传递真实数据,再用“假边测试”筛掉无意义的顺序等待。核心模式是菱形:fan out 并行调研、reduce 用纯代码压缩、synthesize 由单个 agent 汇总,且验证器必须用全新 context 独立质疑工人的产出。文章给出 Claude Code 用 “workflow” 触发词构建动态工作流的方法,以及市场扫描、SEO 草稿、代码审计等可粘贴模板;同时承认三种失效模式——上下文坍缩、伪独立、静默节点失败。成本部分引用了 Bun 重写案例:约 50 个工作流、64 个并发 agent、11 天花费约 16.5 万美元。适合想从线性提示转向并行编排的 AI 工程师,是一份偏入门的实操指南。

github.com · 1 min
03

基于时空可组合性的插件化元框架Cordis: A Meta-Framework for Spatiotemporal Composability

一个名为 Cordis 的元框架,提出“时空可组合性”(Spatiotemporal Composability)编程范式,让系统在空间(分布式部署)与时间(事件/状态演进)两个维度上都能统一组合与编排。基于 TypeScript 与插件机制构建,支持模块化扩展。当前处于活跃开发期,API 尚未稳定,官方提供配套论文与入门文档。适合关注函数式编程、模块化架构与前沿编程范式的一线工程师。

github.com · 2 min
04

DeepSeek 开源的 Agent 运行容器:一切皆插件DeepSeek Harness: A Plugin-Centric Runtime for AI Agents

DeepSeek Harness(dsh)是 DeepSeek AI 开源的智能体运行框架(agent harness),核心设计是“一切皆插件”:整个 harness 的能力都通过插件组装,底层由 Cordis 驱动,强调时空可组合性。当前处于 developer preview 阶段,迭代频繁且可能有不兼容变更。提供本地 Web UI(默认 127.0.0.1:3080),可从 npm 安装或从源码构建运行,适合需要自托管、可扩展 agent 运行环境的工程师评估试用。

章节 02

上下文即账单:记忆、缓存与 token 经济学

3 / 14
x.com · 13 min
05

记忆不等于理解:Agent 缺少的跨会话归纳层Your Agent Remembers Everything and Understands Nothing

文章批评当前 Agent 记忆系统仍停留在“存事实、取事实”阶段:能准确返回检索结果,却无法发现隐藏在多个会话之间的结构性依赖。以项目管理助手为例,三位工程师各自上报阻塞,分开看是三个问题,本质上都指向同一个未完成的后端任务;而纯检索无论怎么调 reranker 都找不出这根依赖链。解法是 Zep 的 Observations:先用确定性算法把每条事实压缩成 (实体A, 实体B, 关系) 的签名,再以会话为节点、共享签名为边构建会话图,把跨会话的传递依赖连成连通分量;最后只让 LLM 把算法选定的结构写成可读摘要,模型不参与分组。作者强调这套方法不用 embedding、不用语义相似度、不用 ML 模型,纯粹靠图拓扑。面向做 Agent 记忆、知识图谱与上下文工程的工程师。注意:内容为 Zep 赞助的深度技术解说,理性看待其定位。

claude.com · 13 min
06

把 Claude Code 的每一分钱花在刀刃上:token、缓存与会话管理Maximizing the value of your Claude Code sessions

Claude Code 的账单由 prefill 与 decode 两个阶段决定:输入 token 一次读完,输出 token 逐字生成,因此输出定价约为输入的 5 倍。prompt caching 自动开启,共享前缀从缓存读取只需 0.1x,但切换 /model、/effort、fast mode 或使用 /compact 都会破坏缓存,导致整个对话重新按全价 prefill。会话成本取决于进入上下文的 token 数量、它们存活的轮数以及并发运行的上下文数。文章给出大量可执行建议:用 @ 引用文件省掉 Read 调用、把常用命令的安静参数写进 CLAUDE.md、让超过 30,000 字符的命令输出落盘、用 /rewind 而非 /compact 裁剪错误分支、把噪音任务交给子代理并指定 haiku 模型。也明确缓存过期时间:订阅 1 小时,API key 5 分钟(可用 ENABLE_PROMPT_CACHING_1H=1 延长)。适合重度 Claude Code 用户控制成本与上下文。

www.infoq.cn · 6 min
07

同一模型换 Harness 成功率从 46.7% 升至 66.7%,缓存命中率 99.93% 的成本账Harness Swap Lifts Same Model from 46.7% to 66.7% Success

Composio 用同一模型 DeepSeek V4 Flash 对比 8 种 Agent Harness,在 30 项高难度任务中 Pi 通过 20 项(66.7%),Claude Code、Codex、Deep Agents 均只通过 16 项。成本差距更大:Pi 每成功任务仅 0.028 美元,约为 Claude Code 的七分之一。社区数据还显示,Pi 配合 DeepSeek 缓存命中率可达 99.93%,处理近 10 亿输入 Token 只花 2.65 美元,未命中则需约 132 美元。文章剖析了 DeepSeek 前缀缓存机制:匹配必须从第一个 Token 开始,因此 Harness 必须保持上下文前缀稳定。Reasonix 与 pi-deepseek-cache 为此采用冻结环境摘要、追加而非改写、独立会话分离执行/规划模型、确定性摘要哈希等手段,把输入成本降幅做到 98%~99%。适合关注 Agent 工具链选型与 LLM API 成本优化的工程师。

章节 03

Agent 的生存环境:运行时、浏览器与协作空间

4 / 14
blog.cloudflare.com · 12 min
08

不做容器化,给 Agent 一台会休眠的电脑:Cloudflare 开源 @cloudflare/computerAgents need a computer, not a container: @cloudflare/computer

Cloudflare 发布 @cloudflare/computer 早期预览:一个面向 agent 的开源运行库,直接反对“给每个 agent 一个容器”的主流做法。核心理念是给 agent 一台“电脑”,由平台决定代码跑在 isolate、容器沙箱还是浏览器里。包的核心是 workspace——由 SQLite 支撑的持久化虚拟文件系统,可声明式初始化并附加不同执行后端。内置两种后端:isolate 后端用 just-bash 把 shell 翻译成 JavaScript,在 worker 里执行,文件通过绑定直接访问;容器后端用 FUSE 挂载文件系统并回写更改。两者共享同一份文件,agent 通过统一的 exec(string, options) 接口按需选择快的 worker 还是完整 Linux 容器,示例代码展示如何把 workspace 挂进 Durable Object 上的 @cloudflare/think agent,完成 bug 分诊。适合在 Cloudflare 上构建 agent harness 或对执行沙箱抽象感兴趣的工程师;目前是预览版,缺少基准数字和失败案例。

github.com · 10 min
09

为 AI 代理而生的可共享浏览器:并行自动化、共享你的登录态A shared browser for AI agents: parallel automation, shared logins

ego lite 是一款为 AI 代理设计的 macOS 浏览器,核心是让代理与你共享同一个浏览器环境,却不互相打扰。代理在各自的独立 Space 里并行执行浏览器自动化任务,你的标签页和鼠标操作保持不变。与 Browser-use、agent-browser 这类纯自动化框架不同,ego lite 自带完整浏览器并支持一键继承 Chrome 的登录态、Cookie、扩展和书签;它通过 `ego-browser` 技能把浏览器能力封装成 JavaScript 工具集,代理以写代码而非敲命令的方式多步驱动页面,官方称复杂任务比 CLI 方案最多快 2.5 倍并以更低 token 消耗完成。适合正在使用 Claude Code、Codex 等 agent CLI,希望让代理安全上网、复用登录态的一线工程师。

zed.dev · 7 min
10

Zed 推出 Delta:让 Agent 与开发者在同一对话中协作Introducing Delta: a multiplayer environment for coding with agents

Zed 团队发布 Delta,一个面向 Agent 协作的多人编程环境,并开启私有 Beta。核心是 DeltaDB:它将对话和 worktree 实时复制给线程中的所有参与者,同时兼容 Git,所有编辑与对话都记录在 commit 之间,团队外成员看到的仍是普通仓库。评论可锚定在任何代码行上,随代码演进保持位置,agent 与人类评论共存于同一线程。浏览器端并非简化版,而是把同一个 Rust 应用编译成 WebAssembly 并通过 WebGL 渲染。Delta 还接入了 Claude Code 等第三方 agent harness,让终端会话实时同步进线程。界面设计把对话当作可编辑文档,光标可落在 diff 行、计划步骤或思考块上直接批注。适合使用 agent 编程、关注协作工具与 Agent 基础设施的工程师阅读。

github.com · 40 min
11

为 AI 编程助手的编辑级图表设计系统An editorial diagram design system for AI coding agents

Diagram Design 是一套面向 AI 编程助手(Claude Code、Codex、Pi 等)的图表设计技能,内置 38 种编辑级图表类型,以自包含 HTML+SVG 输出零依赖的静态图表。它把一套严格的设计系统——单一强调色、无阴影、4px 网格、三种静态变体——固化进提示与模板,解决 AI 生成图表千篇一律、视觉廉价的问题。你只需给出网址即可在 60 秒内完成品牌匹配;导入 draw.io / Mermaid 文件时可调整格式、尺寸、细节与受众,并在转换后给出取舍账本。适合希望 AI 画图后无需手工返工的工程师、技术作者与产品团队。

章节 04

Agent 写进代码库之后:质量与基本功的回归

3 / 14
x.com · 2 min
12

让 Claude 接管应用日常维护:388 个 PR 的实测Handing Claude daily app maintenance: 388 PRs in weeks

作者近几周做了一个实验:让 Claude 在独立的 Slack 频道里接管 iOS、Android、Desktop、web、CLI 与 Agent SDK 的日常维护。Claude Tag 每天执行崩溃 fuzzer、重复抽象统一、死代码清理、抽象纪律检查等 routine,先自动开 PR,再经 Claude Code Review 和人工复核合并。几周内在各个仓库开出 388 个 PR,其中 180 个被合并。Claude 大多一次通过,出错时作者会让 Claude 调校自身 routines,往往几天内见效。适合正在探索 agent 接管机械性维护工作的工程团队参考。

github.com · 6 min
13

AI agent 写的 React,它来体检:确定性扫描 + Agent 技能 + CI 门禁Deterministic React code scanner that installs as an agent skill

React Doctor 是一个面向 AI 编码代理的 React 代码质量检查工具。它通过 CLI 对代码库做确定性扫描,从 state/effects、性能、架构、安全、可访问性和可维护性六个维度找出问题,并标记过度复杂的函数与可抽取的重复 JSX 树。核心思路是:不用 LLM 猜,先给出可复现的审计结果;再把规则装成 Claude Code、Cursor、Codex 等代理的 skill,让 agent 后续能按同一套标准修复代码。它还支持 GitHub Actions CI 门禁,只报告本次改动引入的新问题,并提供 Chrome 性能 trace 录制能力。适合用 AI agent 写 React 的团队,也适合想在 CI 里加一道 React 质量闸门的工程团队。

rhonabwy.com · 6 min
14

智能体时代,软件工程基本功的价值反而更高Software Engineering Fundamentals Matter More Than Ever

这是一篇个人随笔,作者从冒充者综合征谈起,反思智能体编程热潮中被忽略的软件工程基本功。作者认为 agent harnesses 已经跨过“能不能做到”的门槛,但要写出可调试、可维护、分层且可组合的软件,仍然需要大量细致的人类判断。LLM 并不真正推理,只是在预测压缩后的人类知识,因此关键是给它简洁、及时的数据,并用带有自然语言反馈的确定性验证工具来纠错。文中引用了 The Illusion of Thinking 论文、JEPA 模型与 Yann LeCun 的研究,也提到 Simon Willison 提出的 lethal trifecta,说明模型无法区分好建议与坏建议、难以抵御提示注入。作者强调,无论是否有智能体辅助,评审、规划并修补软件接缝都是核心技能,当下更需要关注这些基本功。适合关注 AI 编程工具与软件工程质量的一线工程师阅读。