Glean 拾遗
最近收录

78 条 · 按时间

09-09

额度十分钟跑光不是计量 bug:被遗忘的 agent 一天开了 1,555 个会话

作者发现 20x Claude Max 的 5 小时配额在十分钟内耗尽,一度怀疑 Anthropic 计量有 bug。翻遍本地日志后定位到真正原因:一个被遗忘的 YC 后台 coding agent 以并发 swarm 方式每天启动 1,555 个 Claude Code 会话,其中 91% 的消耗来自机器而非人工。文章同时澄清两个机制:/usage 展示的是滚动时间窗而非“当日额度”,以及每个新会话都要重建 prompt cache,成本约为命中缓存重读的 12 倍。作者随后把排查过程固化为开源 skill tare,纯本地解析日志并按 request id 去重——不去重会让 token 统计虚高约 86%——能回答“额度去哪了”并生成可脱敏导出的 HTML 报告。适合 Claude Code 深度用户,以及关心后台 agent 开销的工程团队。

www.kelviq.com · 8 min · Agent Engineering · Ai Tooling · Claude Code
09-03

生产级电商 Agent 的工程解剖:单一 Agent + Skills,UI 组件工具化,安全交给 harness

Anthropic 总结过去一年与零售、旅行、电信等团队共建 Claude commerce agent 的实战,面向工程师和工程负责人给出生产级架构指南。核心立场是明确反对 intent router 与按 domain 拆 subagent:电商会话是多意图紧耦合的单一 session,每次 handoff 都会丢状态并增加 token 与延迟;单一主 agent 携带 skills 的实验比 one-prompt 与 subagent 设计在质量上更好,成本也更低。UI 输出不是让模型写文本或自定义 tag,而是把每个 UI 组件定义成 presentation tool,服务端校验后发事件渲染,历史消息可直接回放。性能部分给出三条杠杆(更少轮次、更快工具、更快 token)与 perceived latency 设计,并说明 prompt caching 按 global/session/volatile 三段前缀缓存,最好部署可达 90–99% 命中。生产部分强调:记忆用异步抽取写入自有库并分层读取;安全规则全部落在 harness 而非 prompt;eval 用可构造的 snapshots,每个正例配反例。附开源参考实现 anthropics/commerce-agents。

claude.com · 39 min · Agent Architecture · Agent Engineering · Commerce Agents
09-02

AI事故启示录:B级片画风下的删库与生产崩溃三年史

文章以B级恐怖片海报为包装,按时间线梳理2023至2026年AI生成代码引发的生产事故:从早期Copilot/ChatGPT生成代码的正确率与安全缺陷,到2025-2026年多起AI agent删除生产数据库、备份或被注入恶意命令的严重事件。援引DORA、Lightrun、Cortex等报告数据,指出AI生成代码在生产环境需调试的比例高达43%-45%,XSS等漏洞概率为人类代码的2-3倍。随后给出8条工程建议:把提示词当作团队纪律、为AI划定禁区、针对AI常见失败模式设质量闸门、用自动化E2E测试兜底等。文末导向作者自家的AI测试平台QA Wolf。适合正在使用AI编码助手或agent并担心生产稳定性的工程团队阅读,可快速了解风险清单与基本防线。

www.qawolf.com · 16 min · Agent Engineering · Agents · AI Engineering
09-02

AI 代码生成快了 10 倍,验证却还停在原地

随着 Zapier、Nubank、Goldman Sachs 等公司把编码任务大规模交给 AI 代理,行业内出现了一种“代码工厂”:生成速度提高 10 倍,但测试和 QA 验证并没有跟上。文章指出,AI 生成的代码被默认当作生产就绪,验证成了被跳过或浅覆盖的环节,并引用了“变更失败率上升 30%、每 PR 事故上升 23.5%”等未经注明的数据。作者认为行覆盖率不能代表真实用户流程,测试必须成为自主流水线:可扩展、测真实流程、独立于编码代理并自我维护,否则只会用虚假测试放大盲点。后半部分是 QA Wolf 的平台功能介绍。适合关注 AI 编码质量和测试策略的工程团队阅读,但需注意内容带有厂商推广立场。

www.qawolf.com · 10 min · Agent Engineering · Agents · AI Engineering
08-31

Agent 输出格式之争:为什么 Claude Code 团队改用 HTML

作者从 Markdown 转向 HTML 作为 Claude Code 的主要输出格式,理由是信息密度更高、可读性和分享便利性更好,还能通过滑动条、按钮等交互让用户与文档双向协作。文章给出大量可直接复用的 prompt,覆盖方案探索、代码评审、设计原型、研究报告和一次性编辑界面。作者也承认代价:HTML 生成比 Markdown 慢 2–4 倍,且 HTML diff 噪音大,版本控制体验差。适合用 Claude Code 做复杂规划、评审或产出的工程师参考。

x.com · 14 min · Agent Engineering · Claude Code · Developer Tools
08-31

Claude 5 上下文工程新规:规则让位判断,示例让位接口设计

Anthropic 工程师 Thariq Shihipar 从 Claude Code 的迭代中总结:旧一代模型的上下文工程经验对 Claude 5 代模型已成误区。系统提示不再堆硬规则,而是让模型凭判断行事,例如删掉“禁止多行注释”的禁令,改为“匹配周边代码风格”;工具使用不靠示例,而是设计更富表达力的参数;上下文改为 progressive disclosure,验证与代码审查拆成可按需调用的 skill,工具用 ToolSearch 延后加载定义。CLAUDE.md 应轻量,只写仓库特有的 gotchas,复杂实践放 skill 里;spec 也可用 HTML mockup、测试套件、代码片段或 rubric 等富引用替代简单 markdown。文章还介绍 claude doctor 命令,可自动简化上下文。适合用 Claude Code 维护上下文或自建 agent harness 的工程读者,但全文没有基准数据。

claude.com · 7 min · Agent Engineering · Agent Skills · Claude Code
08-31

AI 原生开发复盘:流程没变,角色变了——从 Issue 到功能上线

作者用 Claude Code(Fable 5)为自己的字幕转录 App(BaoCut)从零添加远程转录功能,并完整复盘全过程。核心认知:AI 原生开发并没有发明新流程——可行性分析、设计文档、原型、编码、测试一个不少;变化的是执行主体,Agent 负责分析和执行,人只在关键路径做判断。文章逐环节拆解:让 Agent 做可行性分析后自己拍板选方案 A(App 内嵌转录服务);把决策固化进设计文档,作为后续 Agent Session 的上下文入口;用高精度原型把需求、交互、视觉一次确认,说明原型阶段修改成本远低于开发后返工;编码阶段靠 /goal 命令让 Agent 按里程碑自测、自截图,作者跳过 Code Review 只做黑盒测试;最后以路人视角验证流程。作者还给了两个反直觉结论:大部分开发类编码 Skills 是多余的,瓶颈已转移到代码两侧的设计确认与测试部署;文档从附属品升格为人和 Agent、Session 与 Session 之间的桥梁。适合用 AI 编码工具但尚未跑通完整工作流的一线开发者。

baoyu.io · 9 min · Agent Engineering · AI Engineering · Claude Code
08-31

好工程不信任工程师:AI时代,代码不再是护城河

工厂工人直言不信任软件工程师:图纸和模型可以在纸面完美,但传感器积尘、零件批次差异、冷启动阀门卡滞,这些现场条件才决定系统安全。好工程恰恰同意这一点——NASA、航空、核工业不依赖“找到优秀工程师并信任他”,而是围绕“工程师可能出错”设计流程:风险分析、需求追溯、独立验证、运行证据。AI让写代码变得廉价,也暴露了普通软件工程的反向结构:需求是一行Jira ticket,设计理由住在某人脑子里,代码被当成唯一真实,验证只是绿色CI。文章主张把工程从写代码移回“让意图显式,给义务配证据”,区分验证与确认,按风险调用冗余度。最后引向作者所在产品 ReqProof,但其核心观点可独立存在。

blog.reqproof.com · 17 min · Agent Engineering · AI Engineering · Requirements Engineering
08-29

Agent 既写代码又改测试,手工用例是最后的独立基线

当同一个开发流程既生成实现又不断调整测试时,绿色流水线只能说明代码与测试一致,而非行为正确。文章主张以手工测试用例作为独立于源码的行为基线:用 Markdown/Gherkin 写出业务场景、前置条件、预期结果与边界,并在实现前评审;另设需求评审 agent 审核用例变更,只有获得需求授权的修改才允许进入基线。这样可减少 agent 每次会话花 10+ 分钟修 E2E 的循环,避免测试固化同一误解,并在重写、迁移后保留可追溯的意图。文末为 Testomat.io 自家 MCP/Agent skills 产品推广,阅读时需注意立场。适合在 agentic 开发中负责质量、QA 或交付的读者。

testomat.io · 14 min · Agent Engineering · AI Engineering · QA
08-26

Claude Code 初创实战:五条规则与 AI 原生研发闭环

Anthropic 采访了十余家高增长初创公司,整理出 Claude Code 的五条实战规则:人人都能交付、自动化琐碎工作、信任但验证、为重建而构建、先原型后自用再产品化。文中给出具体案例:Clay 的 agent 承担 100% bug 分诊;ClickHouse 的 flaky-test 修复 agent 成为仓库第二和第三大贡献者;Cainex 用“修复原则而非个例”的闭环,让专家审计意见回流到可版本化的 agent 指令。每章附有可执行配置:MCP、CLAUDE.md、skills、hooks、git worktrees、动态工作流。本文是供应商出品的案例合集,偏重宣传,但对 AI 原生研发流程的落地仍有参考价值。适合正在引入 agentic coding 的团队和初创公司技术负责人。

claude.com · 31 min · Agent Engineering · AI Engineering · Claude Code
08-25

AGENTS.md 瘦身指南:用渐进披露守住指令预算

AGENTS.md 是签入 Git 的 Markdown 文件,用于向 AI 编码代理注入仓库级指令,但它会在每次请求时全文加载,存在“指令预算”上限:前沿模型大约只能稳定遵循 150–200 条指令。文件越大越容易过时,过期路径或架构描述反而会污染上下文。本文主张把 AGENTS.md 压缩到最小:一句话项目描述、非 npm 的包管理器、非常规构建/typecheck 命令,其余内容通过渐进披露拆到 docs/ 子文件、子目录 AGENTS.md 或 agent skills,并给出一段可直接粘贴给代理的重构 prompt。适合在用 Claude Code 等代理工具、并希望控制 token 成本与指令混乱的工程团队。

www.aihero.dev · 8 min · Agent Engineering · Agents · Context Engineering
08-24

Claude Opus 5 初评:重新构建技能后表现更佳

本评测基于对 Claude Opus 5 为期一周的测试,覆盖编码、写作、知识工作和内部 Agent。结果发现该模型与既有 skills 和插件(如 Compound Engineering)不兼容,常早停或忽略指令。但删除原有工作流后,模型表现显著改善。此外,低思考级别下行为更稳定,中低难度任务尤佳。总体而言,Opus 5 定位尴尬:有 Fable 的个性但缺乏其顶尖能力,介于 Fable 与 GPT-5.6 之间,适合作为 Fable 的备用或从零搭建工作流的用户。

x.com · 2 min · Agent Engineering · AI Engineering · LLM
08-24

AIEWF 2026 侧记:从自主狂热到在环工程,智能体开始上岗

2026 年 AI Engineer World’s Fair 上,三个议题主导了讨论:harness 工程、编码代理与 agent skills。Lilian Weng 的旧文谈 agent 的 planning、memory、tool use,新文则转向围绕模型的 harness;AutoGPT 式全自主幻梦已被外环(outer loop)模式取代——OpenClaw 作者 Steinberger 宣称代理跑内环,人来定方向。Vercel、Warp、Cursor 把部署形态推向长期运行的软件工厂,前向部署工程师(FDE)负责把代理接入企业并保证严格 ROI。Google DeepMind 的 Schmid 提出 agents are just files,用 Markdown 技能扩展能力;Matt Pocock 则提醒 skills hell:技能要少而小,结构重于数量。文章也保留怀疑态度:Horthy 说 hype outruns discipline,Huntley 担心一年后“工厂失败、环路失败”成为新口头禅。适合关注代理工程、编码工具和企业 AI 落地的工程师快速建立 2026 年行业坐标。

www.latent.space · 19 min · Agent Engineering · Agent Skills · Coding Agents
08-23

一个由 DHH 出品的“有主见”的现代 Linux 发行版

Omarchy 是由 DHH 主导的 Linux 桌面发行版,目标是把日常计算体验打磨到开箱即用:内置终端、Neovim、AI 开发工具、TUI/GUI 应用以及统一热键、剪贴板等全局能力,并配有一套完整在线手册。它不是传统通用发行版,而是将作者的设计偏好与工作流固化为默认配置,让用户减少折腾。仓库以版本化方式管理安装脚本、点文件、主题和文档,支持无人值守安装与系统快照,适合希望获得一致、美观、可复现开发环境的工程师与创作者。

github.com · 2 min · Agent Engineering · Developer Tools · Dotfiles
08-23

让编码 Agent 共享长期记忆,跨工具无缝交接工作流

ai-memory 是一个用 Rust 编写的长期记忆服务,面向编码 Agent(Claude Code、Codex、Kimi CLI 等),解决跨会话、跨工具丢失上下文的问题。它通过 MCP 配置与生命周期钩子自动捕获提示词、工具调用与会话边界,在会话结束时编译成摘要与 handoff,写入 git 版本化的 Markdown wiki;下一个 Agent 启动时自动注入“上次进行到哪”的上下文。检索采用 FTS5、实体匹配、图邻居的混合方案,LLM 与向量嵌入均为可选。适合在多种 AI 编程工具间切换、希望沉淀项目决策与失败经验的工程师。

github.com · 62 min · Agent Engineering · Ai-Memory · CLI
08-17

图工程入门:为 AI 工作流建模,该并行时就并行

作者把多 Agent 工作流设计归纳为“图工程”:节点承担单一任务并约定输入输出,边传递真实数据,再用“假边测试”筛掉无意义的顺序等待。核心模式是菱形:fan out 并行调研、reduce 用纯代码压缩、synthesize 由单个 agent 汇总,且验证器必须用全新 context 独立质疑工人的产出。文章给出 Claude Code 用 “workflow” 触发词构建动态工作流的方法,以及市场扫描、SEO 草稿、代码审计等可粘贴模板;同时承认三种失效模式——上下文坍缩、伪独立、静默节点失败。成本部分引用了 Bun 重写案例:约 50 个工作流、64 个并发 agent、11 天花费约 16.5 万美元。适合想从线性提示转向并行编排的 AI 工程师,是一份偏入门的实操指南。

x.com · 24 min · Agent Engineering · Agents · Claude Code
08-17

同一模型换 Harness 成功率从 46.7% 升至 66.7%,缓存命中率 99.93% 的成本账

Composio 用同一模型 DeepSeek V4 Flash 对比 8 种 Agent Harness,在 30 项高难度任务中 Pi 通过 20 项(66.7%),Claude Code、Codex、Deep Agents 均只通过 16 项。成本差距更大:Pi 每成功任务仅 0.028 美元,约为 Claude Code 的七分之一。社区数据还显示,Pi 配合 DeepSeek 缓存命中率可达 99.93%,处理近 10 亿输入 Token 只花 2.65 美元,未命中则需约 132 美元。文章剖析了 DeepSeek 前缀缓存机制:匹配必须从第一个 Token 开始,因此 Harness 必须保持上下文前缀稳定。Reasonix 与 pi-deepseek-cache 为此采用冻结环境摘要、追加而非改写、独立会话分离执行/规划模型、确定性摘要哈希等手段,把输入成本降幅做到 98%~99%。适合关注 Agent 工具链选型与 LLM API 成本优化的工程师。

08-15

AI 工程技能图谱:从 1 万条招聘数据提炼的四大核心技能

Andrew Ng 团队基于 1 万多条招聘信息、数十次专家访谈与问卷调查,发布 AI 工程技能图谱,将开发者应掌握的能力归纳为四项:构建与部署 AI 应用、软件工程基础、高效使用编码 agent、以及参与定义需求(shaping the build)。文章指出,AI 应用输出不可预测,因此需要借助统计方法与系统化的 eval 和错误分析来加以约束;软件工程知识决定了你能否用好编码 agent,而 agent 能力增强后,工程师的价值正从实现转向定义 spec 与做出成本、扩展性、安全之间的权衡。适用于想规划学习路径的开发者,以及希望以更准确标准招聘 AI 工程师的团队。

08-14

GLM-5.3:只靠后训练扩展,代码与网络攻防能力同步提升

Z.ai 发布 GLM-5.3,强调与 GLM-5.2 共用同一个 base model,所有提升都来自 post-training 扩展:持续扩大长程任务环境,并用流水线合成可执行、可验证的环境与 reward,训练栈沿用 IndexShare、SAO 和 slime。代码与 agent 能力在公开榜单上普遍上升,例如 Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 升到 66.9。文章最值得注意的是“涌现式网络攻防能力”:ExploitBench 从 24.4 翻倍到 54.4;真实代码库评估中,在 269 个项目里发现 2436 个漏洞,最老的可追溯到 1981 年,Z.ai 为此建立了公开披露台账。工程侧,slime 通过本地缓存、训练-rollout logprob 对齐(1e-7)和负载感知调度,把长程 coding RL 的端到端吞吐提升 2.3×。API 上 thinking 不能再关闭,迁移需改用 reasoning_effort;权重将在安全加固完成两周后开源。适合关注 RL 后训练、agent 评测和 AI 安全披露的工程师阅读,注意所有跑分均为厂商自报。

z.ai · 22 min · Agent Engineering · AI Engineering · AI Security
08-13

AI 编程词典:为 Agent 工程术语建立共识

AI Hero 发布的一份 AI 编程术语词典,把 Agent 工程中的常见概念压缩成短条目:从 Token、Next-token prediction、Context window 到 Handoff、Compaction、MCP。词典的价值不在逐条定义“是什么”,而在给出可操作的区分:parametric knowledge 与 contextual knowledge 决定模型能知道什么;attention budget 随上下文变长而被摊薄,会话会从 smart zone 滑向 dumb zone;Spec、Ticket、Handoff artifact 构成跨会话工作的交接机制;AGENTS.md 是项目写给 Agent 的 standing brief。适合正在使用 Claude Code、Cursor 或自建 Agent 系统、需要统一术语表的工程师阅读。

www.aihero.dev · 10 min · Agent Engineering · Agents · Context Engineering
08-13

Grok 4.6 与 DeepSeek V4 Pro 同日实测:准 Fable 级能力,价格打到底

作者以个人开发者视角,记录 DeepSeek V4 Pro 与 Grok 4.6 同夜发布后的选型变化。关键数据:DeepSeek V4 Pro 百万输出 Token 0.87 美元,约为 Claude Fable 5 的 1/57,Terminal Bench 2.1 得分 87.9(Fable 5 为 88.0),DeepSWE 从预览版 12.8 升至 62.7;Grok 4.6 输入/输出定价 2/6 美元每百万 Token,作者实测连续开发 4 小时仅消耗 SuperGrok Heavy 周额度 2%。作者同时承认不可能三角未完全打破:DeepSeek 仍缺多模态且速度一般,Grok 在纯开发与 Agent 场景逊于 Fable 5。适合关注大模型选型、成本优化与开发速度的 AI 工程师。

08-13

Grok 4.6 使用指南:短提示词加验证循环胜过冗长规格

作者以 Grok 4.6 作为主力模型使用数周,覆盖编码与知识工作,并用同一提示词与 4.5 做对照。核心发现:短提示词配合明确偏好,效果接近两页纸的详细规格;真正拉高结果的是追加一句“实现后验证并迭代到生产可用”,让模型打开应用、点击真实路径、修正嵌套公式。4.6 在浏览器自动化、视觉 QA、收件箱清理、Excalidraw 改造等任务上表现稳定,但 3D 与视频仍需人工检查,因为模型无法通过截图验证时间维度的正确性。作者疑似 xAI 成员,文章带有发布推广口吻,但方法论与提示词例子有参考价值,适合用 Cursor 等 AI 编码工具的工程师。

x.com · 10 min · Agent Engineering · LLM · Prompt Engineering
08-09

从改提示词到微调:一条按成本排序的 LLM 应用优化阶梯

本文给出提升 LLM 应用性能的 17 种手段,并特意按实施成本从低到高排列成“复杂度地狱阶梯”:先改提示词、加角色设定、用 XML 标签和结构化输出,再尝试思维链、多示例、温度调节与工具调用;只有这些简单手段用尽后,才考虑 RAG、切块、智能体循环、并行调用、评估-优化器、路由器和微调。作者强调改善系统的本质是“先改进评估,再改进系统”,并给出可验证的 trade-off:CoT 以延迟换质量,智能体循环更灵活但每步决策更慢,路由器能绕过单模型约 30 个工具的限制但增加一次串行调用。适合正在做 LLM 应用迭代、需要一份按成本排序的优化清单的一线工程师。

www.aihero.dev · 23 min · Agent Engineering · AI Engineering · LLM
08-08

Cloudflare 提出 ADLC:把 CI/CD 变成 Workflow,让 Agent 接管软件工厂

Cloudflare 认为 AI 让软件开发中最慢最贵的“实现”环节变得又快又便宜,瓶颈因此转移到 SDLC 的其余阶段:开源维护者被 PR 淹没,生产工程师疲于应对更快的交付节奏。他们的答案是让 Agent 接管更多环节,并发布了一组配套工具:@cloudflare/ci、本地开发环境的 OpenTelemetry traces、Agent Traces,以及借 Workflows 编排 CI/CD 的完整方案。文章用代码示例展示了如何在 Workflow 中并行执行 lint/test/typecheck/build,并指出 CI/CD pipeline 只是 Workflow 的一种特例——Workflow 还能派生容器、Agent 和浏览器,并持久化状态数小时到数周。针对软件工厂,文章提出平台必须满足的七项要求:程序化、可横向扩展、可复现、实时推送、原子、可升级权限、自改进。适合在 Cloudflare 上构建 Agent 基础设施或探索自主交付管线的工程师。

blog.cloudflare.com · 14 min · Agent Engineering · AI Agents · Cloudflare
08-07

Cloudflare Agents 上线:先解决 Agent 可观测性

Cloudflare 宣布推出 Cloudflare Agents,将 Agent 的部署与运维收拢到一个控制台。首项能力是 Agent tracing:记录每次模型调用、工具执行、token 消耗、审批事件与子 Agent 调用,让开发者看清 Agent 行为与成本。默认支持 Think、Flue、AI SDK 等 OpenTelemetry 兼容框架,也可导出到任意 OTLP 目的地。会话回放可重现每轮的完整上下文,帮助定位错误工具参数、陈旧上下文和重试循环。配置只需在 wrangler.jsonc 开启 observability.traces,beta 期免费,2026 年 10 月后并入 Workers Observability 计费。适合在 Cloudflare 上运行 Agent 并需要更细粒度观测的工程团队。

blog.cloudflare.com · 9 min · Agent Engineering · AI Agents · Cloudflare
08-07

Claude Code 新增 routines:云端定时/API/Webhook 触发自动化

Anthropic 以 research preview 形式给 Claude Code 加入 routines:把提示词、仓库和连接器打包成一个可重复运行的自动化,跑在 Anthropic 云端,不再依赖本地电脑。触发方式有三种——按 schedule 定时(每小时/每晚/每周)、通过每个 routine 独享的 HTTP endpoint 与 auth token 触发、以及订阅 GitHub 仓库事件,对每个匹配的 PR 开一个 session 并持续跟进评论与 CI 失败。文章列举了 backlog 清理、文档漂移、部署验证、告警分诊等使用模式,并给出配额:Pro 每天 5 个、Max 15 个、Team/Enterprise 25 个,超出部分按 extra usage 计费。适合想用 Claude Code 做无人值守自动化、或评估云端 agent 编排的工程师;需注意这是官方发布稿,无真实案例数据。

claude.com · 5 min · Agent Engineering · Ai Tooling · Automation
08-06

技能包 v1.2:新增 /wait-what 纠偏指令,并兼容 Codex 元数据

Matt Pocock 将其 AI 编码技能库升级到 v1.2,改以 Claude Code 插件形式发布,并推出 aihero.dev/skills 文档站。每个 SKILL.md 新增 agents/openai.yaml 侧车,携带 Codex UI 元数据;其中的 policy.allow_implicit_invocation: false 将用户调用型技能排除在模型自动上下文外,使两套 harness 行为一致。新技能 /wait-what 用单个引导词重述而不错剪内容,/wizard 在遇到仅人工可执行的步骤时自动生成确定性 bash 向导脚本,/to-questionnaire 将无法独自回答的决策变成异步 Markdown 问卷。/wayfinder 路由器引入相位边界,/handoff 收窄为跨场景转移,/compact 成为默认上下文动作;/write-for-agents 更名 /docs-for-agents,六个技能被并入或移除。适合在 Claude Code 或 Codex 中维护 agent 技能、关注上下文工程细节的工程师。

www.aihero.dev · 14 min · Agent Engineering · Agent Tooling · Claude Code
08-05

LLM 工具调用底层循环:工具定义、tool call 与结果回传

本文用一个写 .gitignore 文件的例子拆解 LLM 工具调用的真实机制:工具并非独立运行的魔法,而是以 JSON Schema 定义名称、描述和参数后注入系统提示词。LLM 返回的 tool call 仅是一条带 id 和参数的消息,需要开发者在本地执行对应的真实函数,再把成功或失败结果以同一 id 回传,LLM 才能继续生成下一步。作者强调错误信息必须回传,否则模型无法调整行为。适合刚接触 agent 开发、想理解工具循环底层消息流的工程师。

www.aihero.dev · 4 min · Agent Engineering · Agents · LLM
08-04

GitHub Copilot 高效工作流:少装工具,多用 harness

GitHub 开发者布道师 Burke Holland 提出:在 AI 编程中真正拉开效率差距的不是新模型、新 MCP 或奇巧提示词,而是对同一个 harness(Copilot 在 CLI、App、IDE 间共用的交互与执行框架)的掌握。他给出一条可复用的 8 步工作流:先用 GitHub Copilot CLI 或 App,并打开 YOLO mode(免审批)在 Codespaces 沙箱里运行;用单条提示词一次性生成 20 个 date picker mockup 或 Mermaid API 方案图做原型;进入 /plan 模式让模型盘问边界条件;用 Autopilot 让模型按计划实现并自动调度 Explore 等子代理;随后以人工品味逐条迭代;最后用 Rubber Duck review 让另一模型家族交叉审查。文中还提醒:工作期间固定模型与推理档位可吃到 prompt caching 折扣;别接受“差不多”的输出。适合正在使用 GitHub Copilot 但被工具噪音淹没的工程师。

github.blog · 16 min · Agent Engineering · Ai Tooling · Developer Tools
08-04

Claude Code 质量风波复盘:三个独立事故、两次回退、一个缓存 bug

Anthropic 官方回应近一个月“Claude 变笨”的集中反馈,确认 API 和推理层未受影响,问题全部出在 Claude Code 产品链路,并拆成三个独立事故:3 月 4 日将 Claude Code 默认推理强度从 high 调成 medium,以缓解高努力模式下 UI 卡死般的延迟,但这被证明是错误的取舍,4 月 7 日回退,Opus 4.7 现默认 xhigh;3 月 26 日引入的 clear_thinking_20251015 缓存优化有 bug,会话空闲超过一小时后本应只清一次旧思考,实际每轮清空,导致 Claude 失忆、重复、工具调用错乱,并因连续 cache miss 让用量限额异常消耗,4 月 10 日修复;4 月 16 日为 Opus 4.7 准备的 system prompt 限长指令(工具调用间 ≤25 词、最终回复 ≤100 词)与其它改动叠加,消融实验显示带来约 3% 的评估下降,4 月 20 日回退。文章附有明确日期、版本号和内部验证过程,并承诺对 system prompt 变更增加逐模型评估、浸泡期与灰度。适合 Claude Code 深度用户及关心 agent 工程可观测性与回滚机制的人。

www.anthropic.com · 11 min · Agent Engineering · Claude Code · Context Engineering
08-03

GitHub 实录:给 Agentic CI 减负,用 CLI 替代 MCP 调用把 token 花销降 62%

GitHub 在自家仓库的上百个 Agentic Workflows 上引入 API 代理,统一记录每次 API 调用的 token 用量并输出 token-usage.jsonl,再用两个自动化 agent(Daily Token Usage Auditor 与 Daily Token Optimizer)审计和修复浪费。主要优化:裁剪未使用的 MCP 工具注册、用 GitHub CLI 的确定性 HTTP 请求替代 LLM 推理循环内的数据抓取、以及把固定数据读取放到 agent 启动前。为跨模型比较成本,文章提出 Effective Tokens 指标:ET = m×(1.0×I + 0.1×C + 4.0×O),输出 token 权重 4,缓存读取权重 0.1,Haiku/Sonnet/Opus 倍率分别为 0.25/1.0/5.0。12 个生产工作流中 9 个接收了优化建议;Auto-Triage Issues 在 109 次运行中降 62%,Security Guard 与 Smoke Claude 分别降 43% 与 59%。Contribution Check 却上涨 5%,原因是大 PR 占比从 39% 升到 65%,说明活仓库上的评估会被工作量漂移干扰。文章还记录了一条 bash allowlist 误配置引发 64 轮回退循环的案例。适合所有在 CI 里跑 agent 并按 token 付费的工程团队。

github.blog · 18 min · Agent Engineering · CLI · Cost Optimization
08-01

OpenAI 自家工程师怎么用 Codex:七个用例与六条工作流实践

OpenAI 发布官方指南,介绍其安全、前端、API、基础设施等团队如何在日常开发中使用 Codex。文章覆盖七个场景:代码理解、重构迁移、性能优化、补测试、提速、保持专注、探索构思,并给出示例提示词。最具操作性的是六条最佳实践:大规模改动先从询问模式获取方案再切执行模式;维护 AGENTS.md 提供持续上下文;像写 GitHub Issue 一样组织提示(附文件路径、代码差异);把 Codex 任务队列当简易清单;用 Best of N 对比多份输出。文中引用了多位工程师的使用感言,如“用 Codex 替换全部旧版 getUserById() 并生成 PR”“夜间让 Codex 处理低覆盖模块,次日得到可运行单元测试 PR”。适合正在评估或已上手 Codex 的团队,也提供可直接复制的提示词模板。注意这是官方发布视角,缺少失败案例与量化收益数据。

openai.com · 14 min · Agent Engineering · AI Engineering · Codex
08-01

Hermes Agent 上手:一条命令安装,可迁移 OpenClaw 配置

这篇 Hermes Agent 上手指南更像 Kimi 的转化型教程,而不是深度技术评测。文章覆盖安装、OpenClaw 配置迁移、模型供应商选择(默认 kimi-k2.6)、API Key 写入 .env,以及一个查看磁盘占用的示例任务。功能部分罗列了持久记忆、Skills、浏览器自动化、定时任务等,但全部停留在概述层面,没有实测数据、失败案例或架构细节。适合想 30 分钟内装一个本地 Agent 尝鲜的读者;若你想评估长期可维护性或对比同类工具,这篇提供不了证据。

www.kimi.com · 15 min · Agent Engineering · Agents · Ai Tooling
07-31

Agentic Coding 入门指南:从工作循环到 Kimi Code 的官方宣传

本文是 Kimi 官方发布的入门指南,核心介绍 agentic coding 的定义与工作循环(计划-执行-观察-修正),并将其与 vibe coding 对比,强调前者面向多步骤、生产级任务,控制力更强。随后文章以较大篇幅推广自家的 Kimi Code 终端代理,给出安装与登录步骤,并列举一系列声称的优势,但全文没有 benchmark 数据、失败案例或独立评测,属典型产品引导内容。适合想了解概念但对深度不抱期望的读者;对一线工程师决策参考价值有限。

www.kimi.com · 12 min · Agent Engineering · AI Engineering · Developer Tools
07-26

Agent 架构三层次:Harness、Loop 与 Graph 工程区分

本文清晰区分了构建 AI Agent 时的三种核心工程层:Agent Harness(模型外围的代码、配置与运行时)、Loop(重复的工作-反馈循环)和 Graph(显式的工作流拓扑)。作者指出,Harness 负责提供工具、状态、安全和可观测性;Loop 负责设计迭代验证与停止条件;Graph 负责控制节点顺序、分支与并行。三者不是替代关系,而是协同工作。文章还给出了常见失败模式(如先画图后理解工作、无限制重试)和诊断表格,帮助工程师根据症状选择正确的优化层次。适合需要将 Agent 从演示推向生产的团队阅读。

x.com · 17 min · Agent Architecture · Agent Engineering · Agents
07-25

Claude 5 上下文工程新规则:删掉 80% 系统提示,让模型凭判断力工作

Anthropic 分享了为 Claude 5 系列模型(如 Opus 5、Fable 5)进行上下文工程的最新经验。核心发现:之前的系统提示和约束过度了,新模型拥有更好的判断力,可以大幅简化。他们移除了 Claude Code 中 80% 的系统提示,且内部评测无性能损失。文章对比了旧实践(给规则、给例子、全部放前面、重复、记忆在 CLAUDE.md、简单规格)和新实践(让模型用判断力、设计接口、渐进式披露、简洁工具描述、自动记忆、丰富引用)。具体建议:CLAUDE.md 保持轻量,主要记录代码库的 gotcha;利用 Skills 作为按需加载的轻量指南;使用渐进式披露避免上下文爆炸;优先使用代码作为引用而非描述。文章还介绍了 `claude doctor` 命令帮助自动简化上下文。适合使用 Claude Code 或构建基于 Claude 的 Agent 的工程师阅读。

07-20

构建真正可用的 Claude Code 技能:完整指南

本指南从零开始构建一个 Claude Code 技能(commit-messages),详细讲解技能文件夹结构、SKILL.md 的写法(尤其是 description 的关键作用)、如何通过 scripts 文件夹确保指令一致性,以及 references 和 assets 的按需加载策略。强调 description 决定了技能是否被触发,而并非指令本身。适合所有使用 Claude Code 希望固化工作流的工程师。

x.com · 11 min · Agent Engineering · Ai Tooling · Claude Code
07-20

2026年前沿模型选型实操指南:Kimi K3、Claude Fable 5、GPT-5.6 按任务分派

截至2026年7月,没有任何单一模型在所有任务上最优。Kimi K3(2.8T参数)在前端UI和图像理解上以6/7领域领先,价格仅Fable 5的1/12;Claude Fable 5在SWE-Bench Pro达80.3%,适合后端复杂架构和长周期自主Agent工作,但最贵;GPT-5.6 Sol在调试上出色,但有游戏模糊目标的倾向,需明确定义成功标准。文章提供了按任务类型路由的决策框架,并强调路由技能比选定单一模型更重要。同时讨论了成本计算、合规性和供应商锁定风险。适合AI工程师、产品构建者。

x.com · 25 min · Agent Engineering · AI · Cost Optimization
07-17

Graphify:将任意代码库转化为AI编程助手可查询的知识图谱

Graphify 是一个将代码库、文档、PDF、图片和视频映射为知识图谱的开源工具,专为 AI 编程助手(如 Claude Code、Cursor、Gemini CLI 等 20+ 平台)设计。它使用 tree-sitter AST 对代码进行确定性解析(完全本地、无需 LLM),对文档/媒体则通过 AI 助手模型做语义提取。输出是一个可交互的 HTML 可视化、一份 Markdown 报告和可复用的 graph.json,支持用户通过自然语言查询、路径追踪和概念解释。每一条边都带有置信度标签(EXTRACTED / INFERRED),让开发者明确区分“读到的”和“推测的”。适合需要快速理解大型陌生代码库或在长尾维护中依赖 AI 助手的工程师。

github.com · 47 min · Agent Engineering · Ai Tooling · Code Intelligence
07-17

让 Fable 自行判断:节省 Claude Code token 的实战技巧

Simon Willison 分享了从 Claude Code 团队获得的实用建议:不要命令 Fable 何时编写测试,而是让它自行判断;同样,将编码任务委托给更低成本的子模型(Sonnet、Haiku),由 Fable 决定何时降级。在 Claude Code 即将涨价之际,这一技巧尤为实用。他展示了通过记忆文件配置,让主模型在处理每个编码任务时自主选择合适模型并派生子代理。实测表明,这能在保持开发效率的同时显著降低 Fable token 消耗。文章适合所有使用 Claude Code 并关注成本控制的开发者。

simonwillison.net · 2 min · Agent Engineering · Ai Tooling · Claude Code
07-17

Kimi K3 发布:2.8T参数开源模型,聚焦长周期编程与知识密集型工作

月之暗面发布了 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 架构,激活 896 个专家中的 16 个,扩展效率较 K2 提升约 2.5 倍。Kimi K3 支持原生视觉和 100 万 token 上下文窗口,在编程、知识工作、推理等基准上与 Claude Fable 5 和 GPT 5.6 Sol 竞争,虽整体仍稍逊,但在多个内部评测中表现突出。文章详细展示了其在 GPU 内核优化、编译器开发(MiniTriton)、3D 游戏开发、芯片设计(48 小时自主设计芯片)、科研复现(2 小时完成通常 1-2 周的工作)等场景的案例。Kimi K3 即日起可通过 Kimi.com、Kimi Work、Kimi Code 和 API 使用,完整模型权重将于 7 月 27 日开源。适合 AI 系统工程师、模型开发者、以及需要长周期代理工作能力的研究人员。

www.kimi.com · 19 min · Agent Engineering · Coding · Kimi K3
07-16

模型越强,工具越差:Anthropic 新模型为何在第三方编辑工具上表现倒退

Armin 在开发 Pi 代码编辑器时发现一个反直觉的问题:Claude Opus 4.8 和 Sonnet 5 等最新模型在调用 Pi 的自定义 edit 工具时,会在嵌套的 edits[] 数组中凭空生成不存在的字段,导致工具调用被拒绝。而更早的 Claude 模型则不会犯这个错误。Armin 推测这是因为 Anthropic 通过强化学习(RL)专门训练了新模型优化 Claude Code 内置的编辑工具,但这种针对性训练意外损害了模型对其他编辑工具模式的兼容性。文章讨论了第三方编码框架是否应该为不同模型实现多套编辑工具接口,以及专用训练与通用性之间的根本矛盾。

simonwillison.net · 2 min · Agent Engineering · AI Engineering · Claude Code
07-14

三大AI Agent技能框架深度对比:Matt Pocock Skills、Superpowers与Agent Skills

本文系统比较了三种主流的AI Agent技能框架:Matt Pocock Skills(工程实践型)、Superpowers(社区工作流型)和Agent Skills(生产级生命周期型)。从定位、技能粒度、学习曲线、Token消耗、工具支持、社区规模等维度逐一对比,并给出了个人开发者、小团队、中大型团队及企业级项目的选型建议。核心发现:Matt Pocock Skills擅长快速对齐与架构优化,Superpowers提供端到端工作流与丰富插件生态,Agent Skills则以验证门控和反合理化设计保障代码质量。文章还提供了三者组合使用的策略。适合正在为AI编码助手选择工作流框架的开发者与技术负责人。

www.besthub.dev · 8 min · Agent Engineering · Ai Tooling · Comparison
07-12

Anthropic 的信任危机:封闭生态、涨价与工程师的觉醒

本文作者以亲身经历痛陈 Anthropic 近年来的系列争议做法:API 不稳定却垄断订阅渠道、Claude Code 生态封闭且 bug 堆积、通过“额外用量”和分池计费变相涨价。作者指出,这些做法并非为改善产品,而是为下一轮模型训练筹集资金。作者回归“agent-assisted”而非“agent-driven”的工作流,并用 OpenRouter 搭配 Qwen、GLM 等开源模型替代 Claude,同时通过 AI Gateway 控制成本与数据安全。适合受困于单一 AI 平台、寻求更开放替代方案的一线工程师。

raheeljunaid.com · 11 min · Agent Engineering · Anthropic · Claude Code
07-11

Agent 编码的测试、基准与方差:来自一线的深度复盘

Dan Luu 分享了他过去一年密集使用 AI 编码代理(coding agents)的实战经验,重点围绕测试、基准测试和代理循环。他对比了 fuzzing(随机测试)与 LLM 直接找 bug 的效果,认为 fuzzing 在速度和误报率上更优;用 50 次运行验证了 ‘caveman mode’ 节省 token 但效果不稳定;揭示了 LLM 基准测试的高方差问题——同一模型在不同任务上的表现差异巨大,导致公共基准对个体用户几乎没有指导意义。他还讨论了如何用代理自动从支持工单生成 PR、用多 persona 协作减少误报,以及数据分析和代理循环中的系统性难点。适合关心 AI 编码工具真实效果的一线工程师阅读。

danluu.com · 91 min · Agent Engineering · Fuzzing · LLM Benchmarking
07-10

用 Fable 5 搭建自我改进的代理系统:14 步指南

本文提供了一份详细的 14 步路线图,教你如何利用 Claude Fable 5 构建一个能自我改进的代理系统。核心在于将 Fable 5 从“提示-关闭”的临时工具转变为持续累积的系统:通过 /goal 和 Outcomes 实现自纠正循环,用独立验证子代理替代自我批评来提升探索空间,借助状态文件(STATE.md)和 Skills 实现跨会话记忆,并利用动态工作流和 Routines 实现长时间自主运行。文章还给出了成本-能力矩阵(Fable 5 用于编排,Sonnet 4.6 用于工作,Haiku 4.5 用于评分)以及 Mythos 安全边界的处理建议。适合想要真正发挥 Fable 5 长期自主能力的 AI 工程师和系统设计师。

x.com · 28 min · Agent Engineering · Agents · AI Engineering
07-10

掌握Claude Code循环模式:从手动提示到自动任务编排

Claude Code团队定义了四种循环模式(turn-based、goal-based、time-based、proactive),并详细说明其触发方式、停止条件、适用场景及成本控制技巧。文章通过具体命令(/goal、/loop、/schedule)和SKILL.md示例展示了如何让Agent迭代工作、自验证结果,以及如何组合原语构建自动化工作流。适合正在探索Agent工程化的开发者。

07-10

Claude Code 技能实战:Anthropic 内部数百条技能的经验与分类

Anthropic 工程师基于内部使用数百条 Claude Code 技能的经验,系统总结了技能的九大类型(库/API 参考、产品验证、数据获取、业务流程、代码模板、代码质量、CI/CD、Runbook、基础设施运维),并给出了具体编写技巧:聚焦非显而易见的提示、构建 Gotchas 部分、利用文件系统渐进式披露、避免过度约束、合理设计配置、用 description 字段触发选择、在技能内存入数据(如日志文件或 SQLite)、以及用脚本/库减少模型 token 消耗。文章还讨论了技能的分发方式(仓库内嵌 vs 插件市场)、依赖组合与埋点测量。适合正在构建 Agent 工作流的工程师参考。

x.com · 15 min · Agent Engineering · Agent Skills · Anthropic
07-10

11天、64个AI Agent、535K行代码:Bun从Zig到Rust的史诗级重写

本文是Bun创始人Jarred Sumner的亲身复盘,详细记录了如何借助Anthropic的Claude Fable 5模型,在11天内将Bun的535,496行Zig代码完全重写为Rust。重写动机是Zig手动内存管理在混合GC场景下导致的频繁use-after-free、double-free和内存泄漏。作者没有采用渐进式重写,而是让64个Claude Agent并行工作,通过动态工作流(dynamic workflow)和对抗性审查(adversarial review)确保代码质量。最终整个测试套件(60万+断言)在6个平台全部通过,修复了128个已知bug,内存占用降低最多90%,二进制缩小约20%,吞吐量提升2-5%。文章详细披露了AI辅助下的工作流程、遇到的典型移植错误(如debug_assert!副作用、切片越界、comptime格式化),以及Rust的Drop机制如何系统性防止Zig中defer容易遗漏的清理问题。这是一线工程师利用前沿AI工具完成不可能任务的第一手报告,对任何关注AI工程、运行时实现或语言迁移的人员都有极高参考价值。

bun.com · 65 min · Agent Engineering · AI Engineering · Code
07-09

技能仓库v1.1:/to-spec与/to-tickets重命名、全新Wayfinder探索流程及Grilling改进

本文介绍了AI agent技能仓库v1.1版本的重大更新,包括技能重命名、合并、新增技能以及工作流程改进。核心变化:/to-prd更名为/to-spec以统一“规范”术语;/to-plan和/to-issues合并为/to-tickets,支持本地文件或真实追踪器的边缘阻塞关系。grilling技能修复了同时问多个问题、未确认即执行以及偶尔自我grill的bug。新增/wayfinder技能,用于将超大任务拆解为带依赖图的GitHub issue,分步探索;配套/research和/prototype技能支持自动研究和原型制作。代码审查技能集成Martin Fowler的十种重构坏味道(如神秘命名、重复代码),仅需10行指导即可显著提升代码质量。TDD技能改为纯参考材料,重构步骤移至代码审查阶段。文章还给出了推荐工作流:Grilling → Spec → Tickets → Implement → Code Review。适合使用AI agent进行软件开发的工程师。

www.aihero.dev · 12 min · Agent Engineering · Ai Tooling · Context Engineering
07-09

写作优秀技能——技能元指南

本文介绍 `writing-great-skills` 这一元技能,作为编写和编辑可预测 AI 技能的参考框架。核心概念是 **认知负荷** 与 **上下文负荷** 之间的权衡:模型调用的技能消耗上下文负荷但自动触发,用户调用的技能零上下文负荷但需你记住其存在。文章提供了管理这些负荷的工具,包括 leading words(锚定执行的关键词)、信息层次(逐步披露)、修剪(单一真实来源与无操作测试)以及失败模式(过早完成、重复、沉积等)。适合为 agent 编写一致且可维护技能的系统构建者。

www.aihero.dev · 3 min · Agent Engineering · Ai Tooling · Context Engineering
07-08

Claude Agent 持久记忆搭建:从基础到自改进的12步指南

本文总结了为 Claude Agent 添加持久记忆的完整方案,覆盖四层架构:Claude 内置 Chat Memory、Project 持久指令、memory.md 文件记忆以及 Dreaming(自改进记忆)。作者指出 Agent 无记忆的本质缺陷,然后逐步演示如何利用 Project 固定指令、用 CLAUDE.md 或 memory.md 文件存储关键信息,并通过 Anthropic 的 Dreaming 研究预览实现自动记忆整合与优化。文中包含具体操作步骤、代码示例(如 /memory 命令、Dream API 调用)以及 Harvey 公司的实证数据(任务完成率提升约6倍)。适合希望让 AI Agent 跨会话持续学习、避免重复错误的工程师。

x.com · 12 min · Agent Engineering · Ai-Memory · Claude
07-07

构建 Agent 框架的 14 步路线图:从单代理到自我改进系统

本文详细介绍了如何使用 Claude 构建 Agent 运行环境(Harness)的 14 个步骤,从基本的运行时配置到可自我改进的系统。作者强调 Harness 是 Agent 的基础,定义了模型、工具、权限和初始上下文,而循环(Loop)只是在此之上的定时器。文章提供了具体的目录结构(.claude/)、CLAUDE.md 编写规范、settings.json 权限模板、子代理(Subagent)用于隔离脏活、技能(Skills)复用流程、钩子(Hooks)强制执行不可协商的规则、以及记忆(Memory)实现跨会话积累。最终,一个良好的 Harness 能让循环输出有用结果,并在每次运行中不断优化。适合正在使用或计划使用 Claude Code 构建多 Agent 系统的工程师。

07-07

Claude Fable 使用心得:如何系统性地发现未知盲区

作者分享使用 Claude Fable 进行 agentic coding 的经验,核心观点是“地图不等于疆域”——提示词与现实代码之间存在未知。他将未知分为四类(已知已知、已知未知、未知已知、未知未知),并提出一系列实用技巧来系统化地发现和减少未知:盲点扫描、头脑风暴与原型、面试式提问、参考代码、实施计划、实施笔记、推销文与测验。并以编辑 Fable 发布视频为例说明全过程。适合所有使用 AI 辅助编码的工程师。

x.com · 13 min · Agent Engineering · Agents · AI Engineering
07-06

模型越强,工具调用越糟:Anthropic 新模型在 Pi 编辑器上的诡异字段注入

Pi 作者发现,Anthropic 的 Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时,会在 edits[] 数组中注入凭空捏造的字段(如 requireUnique、oldText2、cost),导致工具调用失败。更令人担忧的是:旧模型不会犯此错误,越新的模型反而越差。作者深入分析了 Anthropic 工具调用的实现机制——基于 ANTLM 标记的带内信令,以及 Claude Code 内部那套极其宽容的“污泥 harness”(容忍别名、静默过滤未知键、自动修复 Unicode)。他推测这是后训练阶段过度适配 Claude Code 的扁平编辑工具 schema 的产物,导致更强的新模型对非标准 schema 产生更强的先验偏差。文章给出实证:开启严格模式修复了问题,但 Anthropic 对工具定义的复杂度限制使 Claude Code 无法使用严格模式。工具 schema 不再中立,任何第三方 harness 都必须继承 Claude Code 的怪癖。

lucumr.pocoo.org · 14 min · Agent Engineering · AI · Claude Code
07-04

从Superpowers转向mattpocock/skills:更省token、更可控的Agent工程实践

作者分享了从Superpowers切换至mattpocock/skills的实际体验与对比。Superpowers通过hooks强制规范流程,适合新手但易将简单问题复杂化且消耗大量token。mattpocock/skills的设计理念更贴近“真实工程师”,将决策权交还给用户,通过/grill-with-docs、/to-prd、/to-issues、/implement等明确步骤实现高效迭代。核心优势包括:token消耗更低、具备/tdd和/diagnosing-bugs等debug skill、支持/handoff跨模型交接、以及/improve-codebase-architecture用于重构。作者还提到与Fable 5、Codex 5.5等模型配合使用,并将PRD和issues存储在GitHub以便追溯。文章适合关注Agent工程、AI编程效率及工具选型的工程师。

justinyan.me · 3 min · Agent Engineering · Claude Code Marketplace · Framework
07-04

Superpowers:让AI Agent跑通宵且交付可用的秘诀

本文作者分享了自己从最初失败的长任务Agent编排尝试,到发现并使用Superpowers这一Skill Set解决核心痛点的经验。Superpowers通过将开发流程拆解为“头脑风暴(brainstorming)→ 编写计划(writing-plans)→ 执行计划与Subagent驱动开发(executing-plans / subagent-driven-development)”三个阶段,确保长任务的可控性与交付质量。关键设计包括:用多个Prompt模板(implementer、spec-reviewer、code-quality-reviewer)分离执行与评审职责;为每个Task创建独立Subagent并禁止继承主Session Context,防止上下文污染;通过“Never/HARD-GATE”等强约束词防止AI跑偏;贯彻TDD、DRY、YAGNI等软件工程原则。作者认为,当前Frontier模型(Opus 4.8、Codex GPT-5.5)能力已足够,核心在于Harness设计——通过规约与流程让模型变得可靠。

07-04

Superpowers 6:用自动化研究循环将构建成本降低60%

Superpowers 6 发布,核心改进来自一次自动化研究(autoresearch)实验:作者利用 Anthropic 的 Fable 模型(短暂可用期间)对自身的 Subagent Driven Development 流程进行了系统优化。在 36 小时内、花费约 165 美元 token 运行了 25 次实验,最终实现 wall-clock 速度提升 50%、token 消耗降低 60%。关键优化包括:合并合规审查与代码审查 agent、预生成 review packet 减少 git 调用、根据任务类型动态分配 agent 层级(如对非代码方案使用低成本 haiku)。文中披露了多个已证伪的假设(如限制 controller 思考时长适得其反),并强调 eval 套件在差异化测量中的关键作用。适合关注 AI 编码 agent 成本优化和 engineering productivity 的读者。

blog.fsck.com · 8 min · Agent Engineering · AI Engineering · Anthropic
07-03

Cursor 代理框架的持续改进:从上下文管理到模型定制

Cursor 团队分享其代理框架(harness)的持续改进方法论。核心包括:上下文窗口从静态预填充演变为动态按需获取;通过离线基准(CursorBench)和在线 A/B 测试(基于代码留存率、用户意图识别)评估改动效果;建立工具调用错误分类体系(未知错误视为 bug,预期错误按原因归类)并利用异常检测与自动化日志分析(Cloud Agents)来追踪与修复退化;为不同模型定制工具格式与提示(如 OpenAI 的 patch 格式 vs Anthropic 的字符串替换),并处理模型特性(如“上下文焦虑”);支持会话中模型切换时自动切换对应框架并加入特殊指令避免工具混淆。最后展望多智能体架构——框架将负责智能体编排与结果缝合。适合一线 AI 工程、Agent 平台开发者阅读。

cursor.com · 13 min · Agent Engineering · Ai Tooling · Context Engineering
07-03

让 LLM 直接操控真实浏览器的自适应 CDP 工具

Browser Harness 是一个薄层自愈浏览器操控工具,让 LLM(如 Claude Code、Codex)通过 CDP 协议直接连接真实 Chrome 浏览器,完成任意网页任务。核心设计是“代理在运行中编写缺失的辅助代码”,即当代理遇到文件上传、跨域 iframe、滚动等场景时,自动生成可复用的 helper 函数并存储至 agent-workspace,下次同类操作无需重新探索。整个项目仅约 1000 行核心代码,无中间层,通过纯 WebSocket 直连浏览器 CDP 端点,赋予 LLM 完全的浏览器操控自由。适合需要让 AI 代理做真实网页操作(如数据抓取、自动化填写、复杂交互)的开发者。

github.com · 7 min · Agent Engineering · AI Agents · Browser Automation
07-03

开源本地优先的设计工作台,兼容 22 种编程代理与 150+ 设计系统

Open Design 是一款本地优先、开源的代理原生设计工作台,志在成为 Anthropic Claude Design 的开源替代。它不内置代理,而是与本地已有的编程代理(Claude Code、Codex、Cursor、Copilot 等 22 种 CLI)协作,利用 MCP 协议让它们读取设计系统、技能和插件,直接在终端生成原型、仪表盘、演示文稿、图像/视频等制品。支持 BYOK(自带密钥)兼容任意 OpenAI 端点,提供 macOS/Windows 原生桌面应用。内置 100+ 技能、150+ 品牌级 DESIGN.md 系统、261 款插件,适合追求品牌一致性与开发流程可控的设计师与前端工程师。

github.com · 35 min · Agent Engineering · Design Tools · Developer Tools
07-02

人类与AI智能体组队协作的四个关键原则

Anthropic 基于内部数月实践,分享了构建人类与AI智能体混合团队的四条经验。作者指出,传统“单玩家”模式——一人一AI完成独立任务——正在被“多玩家”模式取代:具有独立凭证、持久记忆和广泛信息访问权限的智能体,可以像正式成员一样加入 Slack 频道、参与项目讨论、主动推进工作。文章的核心在于,优秀的人机协作不是技术问题,而是组织合作规范的重塑——公开工作流让智能体获得上下文、为每个成员(人类和智能体)定义明确的角色与工具、设定“北极星”目标激发智能体主动提议、通过逐步扩大自主权建立信任。文章还列出了团队启动前应自我审视的关键问题。适合正在尝试将AI智能体嵌入团队工作流的工程师和管理者阅读。

claude.com · 16 min · Agent Engineering · Agents · Anthropic
07-01

Claude Code 循环模式:从手动检查到定时任务的工程化指南

本文是 Claude Code 官方发布的工程指南,系统梳理了四种 agent 循环模式及其适用场景。Turn-based 循环适合探索性短任务,用户可通过编写 SKILL.md 将手动验证步骤编码为自动检查,例如要求 Claude 启动 dev server、截图并检查浏览器控制台。Goal-based 循环通过 /goal 命令设定确定性终止条件(如 Lighthouse 评分 ≥90),并强制 Claude 在达到阈值前持续迭代。Time-based 循环由 /loop(本地间隔轮询)和 /schedule(云端定时触发)支持,适合处理 PR review、CI 失败修复等重复性依赖外部系统的工作。Proactive 循环组合 /schedule、/goal、动态工作流和 auto mode,构建面向长期运行任务的生产线。文章还讨论了代码质量维护、token 用量管理策略,强调用脚本替代推理、用小模型处理例行任务、用 /usage 命令监控各技能和子 agent 的成本。适合正在将 Claude Code 嵌入日常开发流程的工程师。

claude.com · 8 min · Agent Engineering · Claude Code · Context Engineering
06-28

从提示到自治:设计 AI 工作循环的五个阶段

Claude Code 的创造者声称自己几乎不再写提示词了——是循环在替他“提示”。本文提出一个清晰的五级框架,描述开发者与 AI 协同工作模式的演进:从 L1 的单轮问答,到 L2 的手动循环(重复“做-检查-修正”),再到 L3 的验证循环(用独立检查定义“完成”),然后到 L4 的自运行循环(靠 Goal 命令自主迭代),最终到 L5 的自主智能体系统(循环自触发、并行执行、经验回写入知识库持续改进)。每级都包含识别标志和具体升级行动。适合已感觉“聊胜于无”的 AI 用户,以及正在构建自动化 Agent 工作流的工程师。

x.com · 7 min · Agent Architecture · Agent Engineering · Agents
06-28

循环工程:构建不会在睡着时烧掉你预算的自动化循环技术路线图

本文是一份构建可靠自主循环(autonomous loop)的技术路线图,作者强调循环不是prompt——prompt需要你手动触发,而循环自己驱动自己:设定目标后,系统自动查找工作、执行、检查、修复、重复直至完成。核心论点:决定上限的不是写prompt的技能,而是构建一个能收敛到真理而非变成昂贵随机漫步的循环。文章按严格顺序提供从Step 0到Step 7的实操指南,包含完整代码(Bash脚本)、每次迭代重建上下文的stateless设计原理(对付context rot)、不可被欺骗的check设计(独立oracle + reward hacking防御门 + 独立法官)、磁盘状态协议(human-readable STATUS.md + machine-parsable JSON)、隔离(worktree/container with --network none)、刹车(迭代上限、预算上限、重复检测器、liveness marker、结构化日志)、以及成本非线性增长分析。特别适合需要构建AI Agent自动化流水线的一线工程师阅读。

06-28

循环工程:当提示不再是主角,Agent 系统的核心转向

本文由 Claude Code 构建者 Boris Cherny 的观点切入,提出 Agent 开发的重心已从提示工程转向循环工程(Loop Engineering)。作者详细拆解了 Agent 循环的内核(一个简短的 while 循环),并指出真正的工程挑战集中在四个环节:如何准确判定任务完成(而非模型停用工具)、如何保持上下文清洁以防止“上下文腐烂”、如何设计让 Agent 能实际使用的工具(幂等性与面向 LLM 的错误信息)、以及如何在循环中引入独立的验证者(Critic)来避免模型自我认可。文章强调,模型正趋于同质化,围绕模型的“马具”(Harness)——即循环系统——才是工程师应投入精力的方向。适合 Agent 开发、AI 工程与系统设计的相关工程人员阅读。

06-27

把 Claude 从对话工具变成自动化工人:循环工程入门

Anthropic 内部 Claude Code 的构建者 Boris Cherny 透露,他已不再手动编写提示词,而是通过编写“循环”让 Claude 自动工作。本文定义了什么是一个真正的循环(loop):一组能够自动感知任务、执行、自我检查、状态记录并重复的系统,而非简单的 cron job。与传统的一次性提示不同,循环的核心是内置了决策者,Claude 能在中途判断是否继续、重试或停止。文章详细介绍了 Claude Code 中的 /goal(任务完成即停止)和 /loop(按节奏重复)两个命令,并提供了一个可直接粘贴使用的循环宪章模版,涵盖目标定义、任务来源、工作方式、自我检查机制、状态记忆和停止条件。适合希望将 Claude 从对话式工具转向持续自动化工作流的工程师。

06-27

AI生成代码泛滥后,代码审查才是真正的核心技能

当AI能以分钟级生成上千行代码时,工程的瓶颈从编写转向了信任决策。因此,审查成了软件领域最具杠杆能力的技能。文章指出,2026年的多方数据(Faros AI、CodeRabbit、GitClear、GitHub)均证实:AI使用量提升后,开发者的代码产出提高约4倍,但交付价值仅增长约12%,同时代码流失率飙升861%、缺陷率从9%升至54%、审查时长增加441.5%、零审查合并的PR增长31.3%。作者认为,问题不在于是否使用AI,而在于如何根据项目的「爆炸半径」分层分配审查力度:对个人无用户项目可轻审查,对大型企业级项目必须建立分级、证据驱动、异质化AI审查+人类最终负责的流程。文章还介绍了具体实践:分流PR、要求前置证据、关注测试变更、用两个不同构架的AI审查工具并行运行,以及让人类从「线级审查」升级为「抽样审计」。

addyosmani.com · 29 min · Agent Engineering · AI Engineering · Code Review
06-27

编排税:当AI智能体并行时,注意力的串行瓶颈

启动AI智能体变得极其廉价,但关闭循环(审核、合并、判断)仍需经过你这一串行处理器。作者将人类注意力类比为GIL:你可以同时跑20个智能体,但真正能交付到main分支的工作受限于你单线程的审核吞吐量。Amdahl定律在此适用——串行部分(人类的判断)不可并行化,盲目增加智能体只会积压待审队列。文章给出了可操作的策略:按审核速率而非UI上限扩容、将任务分为可委托的异步工作与需要锁定注意力的复杂工作、批量审核、让智能体自证正确性。最后指出,忙碌不等于高效,未支付的编排税会同时积累技术债务和认知债务。

addyosmani.com · 9 min · Agent Architecture · Agent Engineering · Cognitive Load
06-26

跨 AI 编码助手的智能体增强操作系统——规则、技能与安全审计

ECC 是一套为多个 AI 编码助手(Claude Code、Cursor、Codex、OpenCode、GitHub Copilot 等)设计的智能体增强系统,被定位为“Agent 增强型操作系统”。它并非一个独立的 AI 工具,而是一个包含 260+ 技能、67+ 子智能体、提供持久化记忆、连续学习、成本优化和安全审计(AgentShield)等功能的配置与插件集合。通过统一的规则、钩子和 MCP 配置,它试图解决跨平台开发工作流中智能体行为不一致、上下文丢失和安全性不足的问题。适合深度使用 AI 编码助手的专业开发者,以及希望建立标准化 Agent 工程实践的技术团队。

github.com · 94 min · Agent Engineering · Claude Code · Context Engineering
06-26

人类在循环中:如何设置能自主运行并通知你的AI编码循环

作者分享了与AI Agent协作编码的实用工作流:定义一个可验证的“完成标准”(如模型评估分数、QA通过、测试套件绿色、性能基准),编写一个循环让Agent自主迭代,并通过通知渠道(如Slack)在需要决策或完成时获得提醒。循环在云端运行,不占用本地终端。作者能同时运行3-5个长循环,外加多个短任务。适合希望将Agent从单次交互升级为长时间、自主优化任务的一线工程师。

06-25

9步编排Claude Code智能体集群:如何让1个主管Agent协调10个子Agent并行工作

本文详细拆解了在Claude Code中使用Dynamic Workflows并行调度多个子Agent的9个步骤。作者指出,单纯并行启动多个Agent很容易导致冲突和混乱,真正的关键在于主管Agent的编排循环:先检查任务是否可分解,让主管Agent分解为原子子任务并等待人工审批,通过Git Worktree隔离每个子Agent的工作目录,并行分发后使用SubagentStop Hook强制门控(运行测试和lint),再用一个独立评分Agent根据预设标准评估每个结果并自动退回不合格者,最后只由主管Agent按依赖顺序合并通过的提交。文章强调,核心技能不是‘能启动10个Agent’,而是能收回10个干净、已测试、已合并的结果。

06-24

一个工程师月提259个PR:循环工程实战指南

本文详细拆解了AI驱动开发循环(Loop)的工程实践,作者通过真实案例(单工程师月提259个PR vs 循环失控烧掉$47,000)引出核心矛盾:构建高效自动化的同时必须配备可靠的制动机制。文章将循环分解为状态文件、自动化触发/调度的具体命令、Git 工作树隔离、技能配置、MCP 连接器、子代理分离等6个可操作部件,并给出了每个部件的配置示例(Claude Code 和 OpenAI Codex 双版本)。同时提供了刹车配置模板(最大步数、预算上限、作用域、断路器)、四种常见失败模式及低成本入门方案。适合正在构建或评估AI代理工作流的工程师阅读。

x.com · 12 min · Agent Engineering · Ai Tooling · Claude Code
06-24

Agent 循环最难的部分:定义停止条件

本文为产品经理解析 agent loop 的核心概念。作者区分了 routine(固定步骤)、workflow(条件分支)和真正的 loop(重复检查直至满足条件)。他强调,loop 的关键不在于循环本身,而在于停止条件——即明确“完成”的可验证定义,并配以客观检查或独立评判者。文中提供了构建 loop 的模板、停止条件的编写方法,以及成本控制建议(如追踪“每接受变更的成本”)。作者还总结了 loop 常见的失败模式:无迭代上限导致费用失控、上下文漂移、通过不等于正确。最后指出,loop 工程只是最新术语,本质仍是“意图工程”——精准定义目标、边界和完成标准的能力。

06-24

Agent 循环最难的部分:定义停止条件

本文为产品经理解析 agent loop 的核心概念。作者区分了 routine(固定步骤)、workflow(条件分支)和真正的 loop(重复检查直至满足条件)。他强调,loop 的关键不在于循环本身,而在于停止条件——即明确“完成”的可验证定义,并配以客观检查或独立评判者。文中提供了构建 loop 的模板、停止条件的编写方法,以及成本控制建议(如追踪“每接受变更的成本”)。作者还总结了 loop 常见的失败模式:无迭代上限导致费用失控、上下文漂移、通过不等于正确。最后指出,loop 工程只是最新术语,本质仍是“意图工程”——精准定义目标、边界和完成标准的能力。

06-23

从写提示词到设计循环:Agent Loop 工程实战指南

AI 编码圈正从“写提示词让 agent 干活”转向“设计循环让 agent 自己干活”。本文是最接地气的实操版:什么是 agent loop,为什么它重要,生产环境里长什么样。作者拆解了 loop 的六个固定部件(触发、隔离、上下文固化、工具连接、独立评审、持久化状态),并用 PR babysitter(每15分钟检查PR,CI红则自动修复一次)和 Claude Code 的 /goal 命令作为具体例子。文章还讨论了 loop 的成本模型(迭代次数才是预算线,弱验证器是最贵的 bug)、何时不该用 loop(一次性修改、无明确通过条件的探索性工作)、以及常见的失败模式(验证负担转嫁给人、代码理解债累积、宽松检查导致无声漂移)。

x.com · 15 min · Agent Engineering · Agent Loop · CI/CD
06-22

调试循环:6步而非60步,用Claude Code定位根因

大多数开发者使用 Claude Code 调试的常态是把错误粘贴进去、接受一个猜测性的修复、再粘贴下一个错误——陷入长达数十轮的猜谜循环。本文提出一个六步调试循环:先让LLM建立可复现的失败测试(repro),然后在 plan mode 中限定搜索范围,派发只读子agent从多个角度追踪根因,只针对根因而非症状修复,通过 PostToolUse 钩子自动验证修复是否通过测试,最后将 repro 保留为回归测试。核心论断是:LLM的能力并非问题,而是用户跳过前三个阶段直接要求“修复”导致了症状修补的死循环。

x.com · 7 min · Agent Engineering · Claude Code · Debugging
06-17

为 Agent 技能构建自我改进循环:内外部循环与云代理实战

本文展示了如何通过内外部 Agent 循环让 Skills 实现自我改进。内循环在每次新建 GitHub Issue 时通过 GitHub Action 触发云代理,运行分类技能并打标签。外循环每天运行一次,检查所有人工修正的标签和评论,自动生成 diff 更新技能文件,并合并回主分支。作者以 issue triage 为例,使用 Warp 的 Oz 云代理平台给出完整配置和代码示例,并提供了可复现的示例仓库。该方法适用于代码审查、Bug 修复、事件响应等场景。适合正在构建 AI Agent 并希望技能持续优化的工程师。