Glean 拾遗
← 所有期号
#011 最新 8/3–8/9 8 月 9 日发布

Agent 工程化:从 token 到软件工厂

本周我们看到的不是某个模型的单项突破,而是一整条 Agent 工程化链条的成熟:从 token 与上下文窗口的底层机制,到架构上“谁在控制下一步”的取舍;从 GitHub 与 Claude Code 的实战经验,到 Cloudflare 把沙箱、观测与成本一揽子打包。这些文章共同指向一个趋势——Agent 不再是 demo,而是需要被认真对待的生产系统。读透它们,你会发现“控制权”与“可观测性”是贯穿始终的两条线索:模型写代码的速度越快,我们越需要知道系统在何时、为何做出决策。

20 篇 5 章 约 4 小时
章节 01

Token、上下文与消息协议:Agent 的底层语法

3 / 20
www.aihero.dev · 4 min
01

一文看懂 LLM Token:从拆分、编码到计费What Are Tokens? A Practical Guide to LLM Tokenization

LLM 中 token 的基础概念与工作机制:tokenizer 如何把文本拆成 token、再映射成数字;解码过程如何把数字还原为文本。文章用 'the cat sat on the mat' 的微型语料演示字符级到词组级的词汇表构建,并给出具体数字:词汇表从 1000 到 200000,'understanding' 的词元数从 5 降到 2;生僻词如 'Frabjous' 15 个字符被拆成 7 个 token。同时说明计费同时计入输入与输出 token,输入包含对话历史、system prompt 与工具定义,控制输出长度可直接省钱。适合想理解 token 计费与优化成本的 LLM 应用开发者。

www.aihero.dev · 3 min
02

别只看窗口大小:token 上限与 lost in the middle 才是关键Context Windows Are Not About Size: Tokens, Limits, and Lost in the Middle

上下文窗口由输入 token(system prompt 与 user prompt)和输出 token(模型回复)共同构成,模型能看到的 token 总数存在硬性上限。对话越长,越容易在请求时或生成中途触发 API 错误,而且模型无法自行绕过这一限制。更关键的问题是:上下文窗口越大,lost in the middle 现象越明显,模型对中间部分信息的注意力越低,甚至可能无法从自己的上下文中取回所需内容。因此评估模型时不能只看窗口大小,即使支持超长上下文,使用更少的 token 往往能换来更稳定的结果。本文是 LLM 基础概念的短篇讲解,适合刚开始接触 LLM 或正在设计 Agent 上下文的工程师快速建立全局认识。

www.aihero.dev · 3 min
03

LLM 消息协议入门:系统提示、推理令牌与工具调用Messages, System Prompts and Reasoning Tokens

本文是 AI Hero 系列的基础篇,讲解与大模型对话时消息层的基本协议。作者用简洁图示拆解了几类消息:用户发起的 user message、模型返回的 assistant message,以及位于对话最前、用户通常不可见的 system prompt。关键论断是:当系统提示与用户指令冲突时,模型通常优先服从系统提示,但这一规则可被越狱打破。文章还介绍了属于 assistant message 一部分的 reasoning token,说明消息可包含多部分,例如在图片生成场景中传递文件;最后用一个写 todo.md 的例子解释了工具调用(tool call)与工具结果(tool result)如何通过同一 id 配对,以及这为何能支撑 Claude Code、Cursor 一类的应用在本地系统上操作。适合刚接触 LLM 应用开发、想理清消息结构的工程师快速入门。

章节 02

架构的分岔路:Workflow 与 Agent 的边界

4 / 20
www.aihero.dev · 3 min
04

Agent 还是 Workflow:停止权在代码还是模型?What Is an Agent? Agents vs Workflows

这篇短文用清晰对比解释 Anthropic 提出的 "agents vs workflows" 之分:两者都是多 LLM 调用编排,区别在于控制流的归属。Workflow 的每一步和终止条件由开发者写在代码里,结果可预测,适合固定重复的任务;Agent 把工具集和决策权交给 LLM,由模型自主选择下一步并自行判断何时结束,灵活但不可控。作者特意指出,单次 LLM 调用不算其中任何一种;在任务明确时,Workflow 通常表现更稳,不必盲目追逐 Agent。文章配有多张对比图,适合刚接触 Agent 工程的读者建立基本框架。

www.aihero.dev · 4 min
05

LLM 工具调用底层循环:工具定义、tool call 与结果回传What Are Tools? A Precise Walkthrough of LLM Tool Calling

本文用一个写 .gitignore 文件的例子拆解 LLM 工具调用的真实机制:工具并非独立运行的魔法,而是以 JSON Schema 定义名称、描述和参数后注入系统提示词。LLM 返回的 tool call 仅是一条带 id 和参数的消息,需要开发者在本地执行对应的真实函数,再把成功或失败结果以同一 id 回传,LLM 才能继续生成下一步。作者强调错误信息必须回传,否则模型无法调整行为。适合刚接触 agent 开发、想理解工具循环底层消息流的工程师。

www.kimi.com · 15 min
06

Agent 架构选型指南:七种模式的取舍与判据Agentic AI Architectures: Patterns vs. Trade-offs

这是一篇面向选型决策的 Agent 架构入门指南,用组件分解、模式对比表和带图示例说明单 Agent、顺序/并行、路由、层级、网络/群、生成-评判等常见架构的适用条件与代价。文中最有价值的是两条可操作判据:交接是否改变所需专业或权限集合,以及并行分支是否真正独立。同时列出生产化要点(可观测性、显式终止、共享状态冲突规则、工具失败语义)和常见误用(过早引入多 Agent、并行化有依赖的任务)。适合想为具体工作流设计最小充分架构的工程师。文末为 Kimi Agent 及其 Swarm 能力的产品介绍,属厂商推广部分,核心内容本身相对克制。

www.pingwest.com · 8 min
07

当编码不再是瓶颈:软件自主开发的三级框架与责任转移When Coding Is Not the Bottleneck: Three Levels of Software Autonomy

本文编译自UC Berkeley RDI研究者的立场论文,提出软件自主性的三级框架:代码自主、流程自主、需求自主,并引入规约细节度、时间自主性、监督模式三个正交维度。作者用16个并行Claude代理以不到2万美元构建C编译器的案例说明当前能力边界:独立任务可行,但持续演化基准下仍难保持架构一致性。文章主张按等级设准入门槛,警惕跨级落地;当编码不再稀缺,需求规范、智能体验证与治理责任将成为新核心。适合关注AI工程化、智能体治理与软件工程演进的工程师。

章节 03

AI 编程实战:工作流、技能与事故复盘

6 / 20
github.blog · 16 min
08

GitHub Copilot 高效工作流:少装工具,多用 harnessThe harness is all you need (mostly)

GitHub 开发者布道师 Burke Holland 提出:在 AI 编程中真正拉开效率差距的不是新模型、新 MCP 或奇巧提示词,而是对同一个 harness(Copilot 在 CLI、App、IDE 间共用的交互与执行框架)的掌握。他给出一条可复用的 8 步工作流:先用 GitHub Copilot CLI 或 App,并打开 YOLO mode(免审批)在 Codespaces 沙箱里运行;用单条提示词一次性生成 20 个 date picker mockup 或 Mermaid API 方案图做原型;进入 /plan 模式让模型盘问边界条件;用 Autopilot 让模型按计划实现并自动调度 Explore 等子代理;随后以人工品味逐条迭代;最后用 Rubber Duck review 让另一模型家族交叉审查。文中还提醒:工作期间固定模型与推理档位可吃到 prompt caching 折扣;别接受“差不多”的输出。适合正在使用 GitHub Copilot 但被工具噪音淹没的工程师。

github.blog · 5 min
09

GitHub 堆叠 PR 公开预览:拆小改动、独立评审、一键合入Stacked pull requests are now in public preview

GitHub 正式推出堆叠拉取请求(stacked pull requests)公开预览,将大型改动拆解为有序的小型 PR 层,每层可独立评审与检查,所有层可一键合并。支持通过 gh-stack CLI 扩展、github.com、移动端及 Copilot agent 工作。默认保留现有分支保护与必检检查,合并队列支持将在数周内逐步上线。Vercel、TED、WHOOP 等团队已先行使用。

www.anthropic.com · 11 min
10

Claude Code 质量风波复盘:三个独立事故、两次回退、一个缓存 bugClaude Code regression post-mortem: root causes and fixes

Anthropic 官方回应近一个月“Claude 变笨”的集中反馈,确认 API 和推理层未受影响,问题全部出在 Claude Code 产品链路,并拆成三个独立事故:3 月 4 日将 Claude Code 默认推理强度从 high 调成 medium,以缓解高努力模式下 UI 卡死般的延迟,但这被证明是错误的取舍,4 月 7 日回退,Opus 4.7 现默认 xhigh;3 月 26 日引入的 clear_thinking_20251015 缓存优化有 bug,会话空闲超过一小时后本应只清一次旧思考,实际每轮清空,导致 Claude 失忆、重复、工具调用错乱,并因连续 cache miss 让用量限额异常消耗,4 月 10 日修复;4 月 16 日为 Opus 4.7 准备的 system prompt 限长指令(工具调用间 ≤25 词、最终回复 ≤100 词)与其它改动叠加,消融实验显示带来约 3% 的评估下降,4 月 20 日回退。文章附有明确日期、版本号和内部验证过程,并承诺对 system prompt 变更增加逐模型评估、浸泡期与灰度。适合 Claude Code 深度用户及关心 agent 工程可观测性与回滚机制的人。

www.aihero.dev · 14 min
11

技能包 v1.2:新增 /wait-what 纠偏指令,并兼容 Codex 元数据Skills v1.2: /wait-what, Codex metadata, and a Claude Code plugin

Matt Pocock 将其 AI 编码技能库升级到 v1.2,改以 Claude Code 插件形式发布,并推出 aihero.dev/skills 文档站。每个 SKILL.md 新增 agents/openai.yaml 侧车,携带 Codex UI 元数据;其中的 policy.allow_implicit_invocation: false 将用户调用型技能排除在模型自动上下文外,使两套 harness 行为一致。新技能 /wait-what 用单个引导词重述而不错剪内容,/wizard 在遇到仅人工可执行的步骤时自动生成确定性 bash 向导脚本,/to-questionnaire 将无法独自回答的决策变成异步 Markdown 问卷。/wayfinder 路由器引入相位边界,/handoff 收窄为跨场景转移,/compact 成为默认上下文动作;/write-for-agents 更名 /docs-for-agents,六个技能被并入或移除。适合在 Claude Code 或 Codex 中维护 agent 技能、关注上下文工程细节的工程师。

github.blog · 18 min
12

GitHub 实录:给 Agentic CI 减负,用 CLI 替代 MCP 调用把 token 花销降 62%Improving token efficiency in GitHub Agentic Workflows

GitHub 在自家仓库的上百个 Agentic Workflows 上引入 API 代理,统一记录每次 API 调用的 token 用量并输出 token-usage.jsonl,再用两个自动化 agent(Daily Token Usage Auditor 与 Daily Token Optimizer)审计和修复浪费。主要优化:裁剪未使用的 MCP 工具注册、用 GitHub CLI 的确定性 HTTP 请求替代 LLM 推理循环内的数据抓取、以及把固定数据读取放到 agent 启动前。为跨模型比较成本,文章提出 Effective Tokens 指标:ET = m×(1.0×I + 0.1×C + 4.0×O),输出 token 权重 4,缓存读取权重 0.1,Haiku/Sonnet/Opus 倍率分别为 0.25/1.0/5.0。12 个生产工作流中 9 个接收了优化建议;Auto-Triage Issues 在 109 次运行中降 62%,Security Guard 与 Smoke Claude 分别降 43% 与 59%。Contribution Check 却上涨 5%,原因是大 PR 占比从 39% 升到 65%,说明活仓库上的评估会被工作量漂移干扰。文章还记录了一条 bash allowlist 误配置引发 64 轮回退循环的案例。适合所有在 CI 里跑 agent 并按 token 付费的工程团队。

github.blog · 14 min
13

跨仓库文档自动化:Aspire 团队把文档 PR 中位耗时压到 44.8 小时Automating cross-repo docs with GitHub Agentic Workflows

Aspire 团队用 GitHub Agentic Workflows 在 10 人规模下把跨仓库文档自动化跑通。工作流以单 Markdown 文件定义,agent 先判断是否需要文档并起草内容,仅输出 JSON 意图;真正的写操作由受限的 safe-outputs handler 执行——GitHub App 安装范围只有产品仓库和文档仓库两个 repo,且只能开 PR 到 main 或 release/*。Aspire 13.3/13.4 期间,396 个合并的产品 PR 产生 82 个文档 PR,中位 44.8 小时合并,全部由原功能 PR 的 SME 评审,100% 合并率。关键设计是 milestone 到 release 分支的精确映射,以及 draft-only 流程。文中也坦承 v1 有 13% 误判率、大 diff 撑爆 prompt 预算等失败经验。适合正为“代码和文档分开仓库”头疼的工程团队。

章节 04

Agent 平台化:沙箱、观测与成本工程

5 / 20
claude.com · 5 min
14

Claude Code 新增 routines:云端定时/API/Webhook 触发自动化Introducing routines: scheduled cloud automations in Claude Code

Anthropic 以 research preview 形式给 Claude Code 加入 routines:把提示词、仓库和连接器打包成一个可重复运行的自动化,跑在 Anthropic 云端,不再依赖本地电脑。触发方式有三种——按 schedule 定时(每小时/每晚/每周)、通过每个 routine 独享的 HTTP endpoint 与 auth token 触发、以及订阅 GitHub 仓库事件,对每个匹配的 PR 开一个 session 并持续跟进评论与 CI 失败。文章列举了 backlog 清理、文档漂移、部署验证、告警分诊等使用模式,并给出配额:Pro 每天 5 个、Max 15 个、Team/Enterprise 25 个,超出部分按 extra usage 计费。适合想用 Claude Code 做无人值守自动化、或评估云端 agent 编排的工程师;需注意这是官方发布稿,无真实案例数据。

blog.cloudflare.com · 9 min
15

Cloudflare Agents 上线:先解决 Agent 可观测性Introducing Cloudflare Agents: Agent Tracing and Observability

Cloudflare 宣布推出 Cloudflare Agents,将 Agent 的部署与运维收拢到一个控制台。首项能力是 Agent tracing:记录每次模型调用、工具执行、token 消耗、审批事件与子 Agent 调用,让开发者看清 Agent 行为与成本。默认支持 Think、Flue、AI SDK 等 OpenTelemetry 兼容框架,也可导出到任意 OTLP 目的地。会话回放可重现每轮的完整上下文,帮助定位错误工具参数、陈旧上下文和重试循环。配置只需在 wrangler.jsonc 开启 observability.traces,beta 期免费,2026 年 10 月后并入 Workers Observability 计费。适合在 Cloudflare 上运行 Agent 并需要更细粒度观测的工程团队。

github.com · 5 min
16

给 AI 智能体一台虚拟电脑:Durable Object 上的可插拔文件系统Virtual filesystem and pluggable runtimes for AI agents

Cloudflare Computer 是一个运行在 Durable Object 内的虚拟文件系统:权威状态存于 SQLite,并通过一个插拔式执行接口 workspace.runtime.exec 对外暴露。项目目前提供三种后端——容器后端用 FUSE 把状态挂载成真实目录,可在沙箱内运行完整 Linux 用户态和真实二进制;Isolate shell 在 Dynamic Worker 中执行 bash,通过 Workers RPC 直连权威状态;Isolate JavaScript 则运行 ECMAScript 模块,支持结构化输入输出、持久化相对导入和受限的 node:fs/promises。Workspace 也可以脱离后端单独作为文件系统使用。项目目前是 preview 阶段,明确不适合生产,适合关注 Agent 基础设施、沙箱执行和云端文件系统设计的一线工程师阅读和实验。

x.com · 10 min
17

按需拉起 Linux:Cloudflare Computer 把 Agent 沙箱月成本从 $36.83 降到 $7.53Cloudflare Computer: How to Cut AI Agent Sandboxing Costs by 80%

常规做法为每个 AI agent 常驻完整容器,但 agent 大量时间只是读文件、搜代码或等模型响应。Cloudflare Computer 改变分工:项目状态存于 Workspace Durable Object 的 SQLite VFS,日常读、搜索、小编辑在 Worker isolate 中通过 workspace.fs 和 just-bash 完成,只有 npm install、构建等真正需要 Linux 的操作才按需拉起容器;执行后通过 post-command pull 把变更同步回持久层。文章给出成本模型:容器占空比从 100% 降到 10%,月成本约从 $36.83 降至 $7.53(降 79.6%),且强调成功条件是 exitCode 与 sync.status 双通过,node_modules 默认不持久化。适合构建 coding agent、沙箱与持久工作区的工程师。

blog.cloudflare.com · 14 min
18

Cloudflare 提出 ADLC:把 CI/CD 变成 Workflow,让 Agent 接管软件工厂Cloudflare ADLC: Workflow-based CI/CD for agent software factories

Cloudflare 认为 AI 让软件开发中最慢最贵的“实现”环节变得又快又便宜,瓶颈因此转移到 SDLC 的其余阶段:开源维护者被 PR 淹没,生产工程师疲于应对更快的交付节奏。他们的答案是让 Agent 接管更多环节,并发布了一组配套工具:@cloudflare/ci、本地开发环境的 OpenTelemetry traces、Agent Traces,以及借 Workflows 编排 CI/CD 的完整方案。文章用代码示例展示了如何在 Workflow 中并行执行 lint/test/typecheck/build,并指出 CI/CD pipeline 只是 Workflow 的一种特例——Workflow 还能派生容器、Agent 和浏览器,并持久化状态数小时到数周。针对软件工厂,文章提出平台必须满足的七项要求:程序化、可横向扩展、可复现、实时推送、原子、可升级权限、自改进。适合在 Cloudflare 上构建 Agent 基础设施或探索自主交付管线的工程师。

章节 05

产业拐点:企业采用与下一站

2 / 20
openai.com · 40 min
19

OpenAI企业AI报告:256%增长背后的采用现状与组织差距The State of Enterprise AI: OpenAI's 2025 Report

OpenAI官方报告,基于其超100万企业客户和覆盖近100家企业的9000人调查,总结2025年企业AI采用现状。核心论点包括:采用正从试点转向规模化——ChatGPT企业消息量同比增8倍,API推理token消耗增320倍;收益与使用深度强相关——75%用户报告日省40-60分钟,数据/工程岗达60-80分钟;行业与个体差距在扩大——前沿工作者消息量为中位数6倍,编码任务差距达17倍;组织准备度(数据接入、工作流标准化、管理层支持)成为主要瓶颈,约四分之一企业仍未启用数据连接器。报告还提供Intercom、Lowe's、BBVA、Moderna等案例佐证。适用关注企业AI落地与战略的工程管理者,但需注意其数据来自厂商自身。

www.infoq.cn · 14 min
20

Jeff Dean 离职前最后一谈:低估 AI 速度,给创业者的 0% 生存法则Jeff Dean's Last Interview: AI Speed, the 0% Rule, and His Google Exit

Jeff Dean 在 Google 最后一天前夕接受 YC 访谈,承认一年前对 AI 能力的预测仍偏低:模型处理复杂任务的增长速度快于预期,基于 Agent 的系统已能连续运行数周。他将推理专用硬件比作 2001 年“把搜索索引装进内存”的转折时刻,并给出具体数字:50 倍延迟改善、30-80 倍能效提升;做一次计算约消耗一皮焦耳,而搬运数据的能耗是其 1000 倍,这决定了 batching 的必要性。访谈还讨论了上下文工程取代纯模型缩放成为新前沿、TPU 由“餐巾纸数学”催生的历史,以及给创始人的测试:用当前最强通用模型测目标领域,成功率 0% 或 1% 是好信号,20% 则是危险信号。他认为当 Agent 写完代码后,“品味”(知道该让 Agent 解决什么问题)将成为稀缺技能。适合 AI 基础设施工程师、Agent 开发者和 AI 创业者阅读。