Glean 拾遗
最近收录

51 条 · 按时间

09-03

生成代码太容易,真正的成本是读懂它

作者结合多年外包经验论证:软件开发的最大成本不是写出代码,而是把系统装进脑袋——即建立心智模型(mental model)。理解 getUserPreferences(userId) 这样的函数,往往要沿着数据库 schema、API 定义、缓存层、错误处理和调用点反复跳转;新代码和 AI 生成的代码都不免这一步。LLM 把生成成本压到极低,也把阅读负担推到更大的规模,甚至出现律师提交 ChatGPT 虚构判例这类事故——不是不愿读,是读太贵。文章因此建议:把 AI 用在解释既有代码、加快建模,而不是产生更多代码;团队效率也不该按生成行数衡量,而应按建立准确心智模型的速度衡量。适合以 AI 辅助编程却怀疑“产出量”指标的工程读者。

idiallo.com · 6 min · AI Engineering · Developer Tools · LLM
09-01

Zod 4.5:z.compile 预编译解析提速达 9 倍,单实例内存降 9.8 倍

Zod 4.5 正式发布,核心是新的 AOT 预编译 API z.compile(),可将任意 schema 预编译为更快的解析函数,对象、数组、联合类型解析提速约 3–9 倍;配合不再构造 ZodError 的 z.validate(),无效输入路径比 safeParse 快约 16 倍。基准数据显示,在 Moltar parseSafe 上达到 47.5M ops/s,超过 typia 的 45.3M。同时通过将方法迁移到原型并延迟绑定,单个 schema 实例内存占用最高减少 9.8 倍。新版带来多项破坏性变更:字符串长度改按 Unicode 码点计算、z.iso.datetime() 强制要求秒、记录键和交叉类型对齐 TypeScript 语义、全链路剥离 __proto__。适合在服务端校验、表单和数据管道中重度使用 Zod 的 TypeScript 工程团队。

zod.dev · 26 min · Developer Tools · Open Source · Performance
09-01

以提交为中心的 Git 兼容版本控制工具

Jujutsu(jj)是一个用 Rust 实现的开源版本控制系统,目标是在兼容 Git 生态的同时,把常见版本控制操作变得简单直接。它以“工作副本即提交”为核心设计:文件一旦改动,系统就会自动生成提交快照,配合操作日志可以对任意操作进行撤销/重做。合并冲突也被建模成一级对象,不再只是文本标记,从而让冲突解决与历史改写更可控。项目可直接在现有 Git 仓库中使用,也支持独立运行。适合想了解新一代 VCS 设计、Git 替代方案与 Rust 工具链的工程师阅读。

github.com · 2 min · CLI · Developer Tools · Rust
08-31

Agent 输出格式之争:为什么 Claude Code 团队改用 HTML

作者从 Markdown 转向 HTML 作为 Claude Code 的主要输出格式,理由是信息密度更高、可读性和分享便利性更好,还能通过滑动条、按钮等交互让用户与文档双向协作。文章给出大量可直接复用的 prompt,覆盖方案探索、代码评审、设计原型、研究报告和一次性编辑界面。作者也承认代价:HTML 生成比 Markdown 慢 2–4 倍,且 HTML diff 噪音大,版本控制体验差。适合用 Claude Code 做复杂规划、评审或产出的工程师参考。

x.com · 14 min · Agent Engineering · Claude Code · Developer Tools
08-27

可验证的架构图生成 Agent Skill,把代码库变成交互式系统地图

Archify 是一个面向 AI 编码代理(Agent)的图表生成技能:把一段系统描述或一个 GitHub 仓库变成可交互的架构、工作流、时序、数据流和生命周期图。它用带 schema 的类型化 JSON IR 作为事实来源,先校验后交付,失败时返回机器可读的修复码,并支持 Before/Delta/After 架构对比,适合在 PR 审查时使用。最终产物是自包含的单文件 HTML,可导出 PNG、SVG、WebM 与 1200×630 分享卡。适合需要为代码库快速生成可信可视化的工程师、技术文档作者和 AI 工具链使用者。

github.com · 15 min · Agent Skills · AI Engineering · CLI
08-26

Claude Code 初创实战:五条规则与 AI 原生研发闭环

Anthropic 采访了十余家高增长初创公司,整理出 Claude Code 的五条实战规则:人人都能交付、自动化琐碎工作、信任但验证、为重建而构建、先原型后自用再产品化。文中给出具体案例:Clay 的 agent 承担 100% bug 分诊;ClickHouse 的 flaky-test 修复 agent 成为仓库第二和第三大贡献者;Cainex 用“修复原则而非个例”的闭环,让专家审计意见回流到可版本化的 agent 指令。每章附有可执行配置:MCP、CLAUDE.md、skills、hooks、git worktrees、动态工作流。本文是供应商出品的案例合集,偏重宣传,但对 AI 原生研发流程的落地仍有参考价值。适合正在引入 agentic coding 的团队和初创公司技术负责人。

claude.com · 31 min · Agent Engineering · AI Engineering · Claude Code
08-26

Mutmut:用变异测试揪出 100% 覆盖率背后的盲区

作者在维护 Python 库时发现,即便测试覆盖率 100%,仍可能漏掉边界条件和异常行为。变异测试通过在源码上做微小改动(如把 < 改成 <=)并运行测试套件,可以暴露出这些盲区。作者调研了 Mutpy 和 Cosmic Ray 后,决定自己实现一个变异测试工具 Mutmut。核心设计是使用 baron(后替换为 parso)实现 AST 无损往返,让变异后的代码可以以原格式落盘,便于审查具体变异。作者尝试用 import hook 在内存中变异模块以支持并行,但受限于 Python 导入系统必须重写全部 loader,最终放弃并退化为基于磁盘的串行变异,换来简单性和对不同测试运行器的兼容性。在 tri.declarative 和 tri.struct 上运行时,虽未发现 bug,却找到了未充分测试的边界和死代码,实际改善了测试套件。适合对 Python 测试工具链和变异测试感兴趣的工程师阅读。

kodare.net · 7 min · Developer Tools · Mutation Testing · Python
08-23

一个由 DHH 出品的“有主见”的现代 Linux 发行版

Omarchy 是由 DHH 主导的 Linux 桌面发行版,目标是把日常计算体验打磨到开箱即用:内置终端、Neovim、AI 开发工具、TUI/GUI 应用以及统一热键、剪贴板等全局能力,并配有一套完整在线手册。它不是传统通用发行版,而是将作者的设计偏好与工作流固化为默认配置,让用户减少折腾。仓库以版本化方式管理安装脚本、点文件、主题和文档,支持无人值守安装与系统快照,适合希望获得一致、美观、可复现开发环境的工程师与创作者。

github.com · 2 min · Agent Engineering · Developer Tools · Dotfiles
08-22

AI agent 写的 React,它来体检:确定性扫描 + Agent 技能 + CI 门禁

React Doctor 是一个面向 AI 编码代理的 React 代码质量检查工具。它通过 CLI 对代码库做确定性扫描,从 state/effects、性能、架构、安全、可访问性和可维护性六个维度找出问题,并标记过度复杂的函数与可抽取的重复 JSX 树。核心思路是:不用 LLM 猜,先给出可复现的审计结果;再把规则装成 Claude Code、Cursor、Codex 等代理的 skill,让 agent 后续能按同一套标准修复代码。它还支持 GitHub Actions CI 门禁,只报告本次改动引入的新问题,并提供 Chrome 性能 trace 录制能力。适合用 AI agent 写 React 的团队,也适合想在 CI 里加一道 React 质量闸门的工程团队。

github.com · 6 min · Agents · Code Review · Developer Tools
08-22

Zed 推出 Delta:让 Agent 与开发者在同一对话中协作

Zed 团队发布 Delta,一个面向 Agent 协作的多人编程环境,并开启私有 Beta。核心是 DeltaDB:它将对话和 worktree 实时复制给线程中的所有参与者,同时兼容 Git,所有编辑与对话都记录在 commit 之间,团队外成员看到的仍是普通仓库。评论可锚定在任何代码行上,随代码演进保持位置,agent 与人类评论共存于同一线程。浏览器端并非简化版,而是把同一个 Rust 应用编译成 WebAssembly 并通过 WebGL 渲染。Delta 还接入了 Claude Code 等第三方 agent harness,让终端会话实时同步进线程。界面设计把对话当作可编辑文档,光标可落在 diff 行、计划步骤或思考块上直接批注。适合使用 agent 编程、关注协作工具与 Agent 基础设施的工程师阅读。

zed.dev · 7 min · Agent Tooling · Agentic Coding · Code Review
08-18

让 Claude 接管应用日常维护:388 个 PR 的实测

作者近几周做了一个实验:让 Claude 在独立的 Slack 频道里接管 iOS、Android、Desktop、web、CLI 与 Agent SDK 的日常维护。Claude Tag 每天执行崩溃 fuzzer、重复抽象统一、死代码清理、抽象纪律检查等 routine,先自动开 PR,再经 Claude Code Review 和人工复核合并。几周内在各个仓库开出 388 个 PR,其中 180 个被合并。Claude 大多一次通过,出错时作者会让 Claude 调校自身 routines,往往几天内见效。适合正在探索 agent 接管机械性维护工作的工程团队参考。

x.com · 2 min · Agent Workflows · Automation · Claude Code
08-07

Claude Code 新增 routines:云端定时/API/Webhook 触发自动化

Anthropic 以 research preview 形式给 Claude Code 加入 routines:把提示词、仓库和连接器打包成一个可重复运行的自动化,跑在 Anthropic 云端,不再依赖本地电脑。触发方式有三种——按 schedule 定时(每小时/每晚/每周)、通过每个 routine 独享的 HTTP endpoint 与 auth token 触发、以及订阅 GitHub 仓库事件,对每个匹配的 PR 开一个 session 并持续跟进评论与 CI 失败。文章列举了 backlog 清理、文档漂移、部署验证、告警分诊等使用模式,并给出配额:Pro 每天 5 个、Max 15 个、Team/Enterprise 25 个,超出部分按 extra usage 计费。适合想用 Claude Code 做无人值守自动化、或评估云端 agent 编排的工程师;需注意这是官方发布稿,无真实案例数据。

claude.com · 5 min · Agent Engineering · Ai Tooling · Automation
08-04

GitHub Copilot 高效工作流:少装工具,多用 harness

GitHub 开发者布道师 Burke Holland 提出:在 AI 编程中真正拉开效率差距的不是新模型、新 MCP 或奇巧提示词,而是对同一个 harness(Copilot 在 CLI、App、IDE 间共用的交互与执行框架)的掌握。他给出一条可复用的 8 步工作流:先用 GitHub Copilot CLI 或 App,并打开 YOLO mode(免审批)在 Codespaces 沙箱里运行;用单条提示词一次性生成 20 个 date picker mockup 或 Mermaid API 方案图做原型;进入 /plan 模式让模型盘问边界条件;用 Autopilot 让模型按计划实现并自动调度 Explore 等子代理;随后以人工品味逐条迭代;最后用 Rubber Duck review 让另一模型家族交叉审查。文中还提醒:工作期间固定模型与推理档位可吃到 prompt caching 折扣;别接受“差不多”的输出。适合正在使用 GitHub Copilot 但被工具噪音淹没的工程师。

github.blog · 16 min · Agent Engineering · Ai Tooling · Developer Tools
08-03

GitHub 堆叠 PR 公开预览:拆小改动、独立评审、一键合入

GitHub 正式推出堆叠拉取请求(stacked pull requests)公开预览,将大型改动拆解为有序的小型 PR 层,每层可独立评审与检查,所有层可一键合并。支持通过 gh-stack CLI 扩展、github.com、移动端及 Copilot agent 工作。默认保留现有分支保护与必检检查,合并队列支持将在数周内逐步上线。Vercel、TED、WHOOP 等团队已先行使用。

github.blog · 5 min · Code Review · Developer Tools
08-01

OpenAI 自家工程师怎么用 Codex:七个用例与六条工作流实践

OpenAI 发布官方指南,介绍其安全、前端、API、基础设施等团队如何在日常开发中使用 Codex。文章覆盖七个场景:代码理解、重构迁移、性能优化、补测试、提速、保持专注、探索构思,并给出示例提示词。最具操作性的是六条最佳实践:大规模改动先从询问模式获取方案再切执行模式;维护 AGENTS.md 提供持续上下文;像写 GitHub Issue 一样组织提示(附文件路径、代码差异);把 Codex 任务队列当简易清单;用 Best of N 对比多份输出。文中引用了多位工程师的使用感言,如“用 Codex 替换全部旧版 getUserById() 并生成 PR”“夜间让 Codex 处理低覆盖模块,次日得到可运行单元测试 PR”。适合正在评估或已上手 Codex 的团队,也提供可直接复制的提示词模板。注意这是官方发布视角,缺少失败案例与量化收益数据。

openai.com · 14 min · Agent Engineering · AI Engineering · Codex
07-31

Vibe Coding 概念、案例与 Kimi 工具链全解析

月之暗面在自家官网发布 Vibe Coding 入门指南,前半部分介绍概念、与传统开发的差异、五个自述案例,后半部分转为 Kimi Websites 与 Kimi Code 两款产品的教程:含 curl/PowerShell 安装命令、/init 与 /login 命令、示例提示词和三步流程。文章明确将 vibe coding 定义为「自然语言界面 + LLM 引擎 + 自动测试循环」的框架,并给出优缺点与安全提示。对想快速了解 Kimi 工具链的初级用户有参考价值;但全篇缺少可验证数据与第三方对比,属于产品导向内容,资深工程师可跳过前半部分直接看 CLI 用法。

www.kimi.com · 15 min · AI Engineering · Ai Tooling · CLI
07-31

AI 编程实用指南:四步工作流、工具矩阵与代码验收清单

本文以工程技术视角梳理 AI 编程的定义、工作流与工具分层:补全、助手、代理与审查工具各司其职;并给出跨文件一致性、交接上下文、可复用验证等收益。后半部分转向 Kimi Code 的宣传,介绍 Plan mode、Skills、Hooks、MCP、Swarm 等功能,并附一份接受生成代码前的四道验收清单(需求范围、仓库契合、独立证据、权限控制)。适合刚接触 AI 编程、想建立判断框架的开发者;注意内容有一半是产品宣传,真正可沉淀的是那个验收清单。

www.kimi.com · 11 min · Agents · AI Engineering · Developer Tools
07-31

Agentic Coding 入门指南:从工作循环到 Kimi Code 的官方宣传

本文是 Kimi 官方发布的入门指南,核心介绍 agentic coding 的定义与工作循环(计划-执行-观察-修正),并将其与 vibe coding 对比,强调前者面向多步骤、生产级任务,控制力更强。随后文章以较大篇幅推广自家的 Kimi Code 终端代理,给出安装与登录步骤,并列举一系列声称的优势,但全文没有 benchmark 数据、失败案例或独立评测,属典型产品引导内容。适合想了解概念但对深度不抱期望的读者;对一线工程师决策参考价值有限。

www.kimi.com · 12 min · Agent Engineering · AI Engineering · Developer Tools
07-31

为 AI 编码助手接管 Chrome 的官方 MCP 服务器

chrome-devtools-mcp 是 Chrome 团队官方发布的 MCP 服务器,让 Claude、Cursor、Gemini CLI 等编码 Agent 直接操控真实 Chrome 浏览器。它把 DevTools 能力封装成 50+ 个工具,覆盖输入自动化、导航、网络与性能分析、堆快照、控制台调试等,并通过 Puppeteer 自动等待操作结果。除默认启动独立浏览器外,还可连接正在运行的 Chrome 以复用登录与页面状态。适合做 Agent 浏览器自动化、前端调试或性能分析的一线工程师。

github.com · 46 min · Agents · Browser Automation · Developer Tools
07-29

Pi: 全能 AI Agent 工具包,统一 LLM 与编码代理 CLI

Pi 是一个开源 AI agent 工具包,提供统一的多提供商 LLM 接口(OpenAI、Anthropic、Google 等)、可扩展的 agent 运行时(工具调用、状态管理)、交互式编码代理 CLI 和终端 UI 库。它解决构建 AI agent 时组件碎片化与集成难题,核心理念是模块化 npm 包设计,支持容器化隔离与供应链安全加固。适合需要快速构建、部署或定制 AI agent 的工程师,尤其是编码代理场景。

github.com · 6 min · Agent Architecture · Agents · Ai Tooling
07-27

个人 AI 基础设施构建指南

本文基于 Daniel Miessler 的 Personal AI Infrastructure (PAI) 框架,系统介绍了如何构建以用户为中心的个人 AI 数字助理。核心观点是:不要从工具开始,从自己开始。框架包含 TELOS 身份系统(10 个 Markdown 文件定义使命、目标、信念等)、三层记忆架构(热/温/冷记忆)、决策优先级链(目标 → 代码 → CLI → Prompt → Agent)、用户/系统分离目录设计以及事件钩子系统。文章强调架构比模型更重要,一个好的上下文管理系统搭配普通模型效果优于无上下文的顶级模型。适合希望搭建个性化、持续学习 AI 助理的工程师和知识工作者。

07-26

Ultrareview:Claude Code 远程多 Agent 深度代码审查

Ultrareview 是 Claude Code 提供的一项深度代码审查功能,启动一组远程 reviewer agent 在沙箱中并行审查当前分支或 Pull Request。与本地审查相比,Ultrareview 的每个发现都会独立复现验证,因此更聚焦真实缺陷而非风格建议;覆盖范围更广,能发现本地审查遗漏的问题;且完全在远端运行,不占用终端资源。文章详细介绍了使用方法:通过 /code-review ultra 命令启动,支持指定 base 分支、PR 编号、自然语言描述上下文;提供非交互式子命令 claude ultrareview 用于 CI 集成。定价方面,Pro/Max 用户有 3 次免费额度,之后每轮审查约 $5-$25 按量计费,审查时长约 5-10 分钟。限制包括 diff 大小上限(默认 500 文件/8000 行)、部分平台不可用等。适用于合并前需要更深入检测的场景。

code.claude.com · 9 min · Agents · Claude Code · Code Review
07-26

LLM护套工程为何如此困难——从测试到迭代的真实痛点

本文基于作者五个月的实战经验(104次提交),深入剖析将LLM演示转化为可靠产品时遭遇的结构性困难。核心挑战包括:无法编写确定性测试(相同输入每次输出不同)、模型失败无声且呈渐变(99%正确中隐藏1%错误)、调试对象是自然语言段落而非代码(一个形容词可能成为bug)、添加规则反而陷入困境(prompt从20行膨胀到200行导致模型相互矛盾)、示例的引导力远强于指令、模型基础不稳定(供应商更新悄然改变行为)、反馈循环慢且昂贵以及护套工程工作不可见(外人以为只是写prompt)。文章强调护套工程(prompt、校验、eval、护栏)是真正的护城河,其难度源于概率系统的本质,无法工程化消除,只能构建能吸收这些不确定性的系统。适合LLM应用开发者、AI工程师及对AI工程痛点感兴趣的技术管理者阅读。

x.com · 16 min · AI Engineering · Developer Tools · LLM
07-23

将任意代码库转化为可查询知识图谱,专为AI编码助手设计

Graphify 是一个开源工具,能够将代码、文档、PDF、图片等资源转化为结构化的知识图谱。它使用 tree-sitter 在本地进行确定性 AST 解析,无需 LLM 即可提取代码中的调用、继承、引用等关系;对于非代码文件,则通过 AI 助手进行语义提取。生成的图谱支持交互式可视化(graph.html)、CLI 查询(graphify query/path/explain),并可作为 MCP 服务器供团队共享。所有边均标记为“显式提取”或“推断”,明确区分原始代码中的直接关系与解析生成的间接关系。适合需要在大型代码库中快速定位概念、追溯依赖、理解架构的工程师。

github.com · 59 min · AI Agents · Developer Tools · Knowledge Graph
07-22

本地优先的代码知识图谱,为AI编程工具提供精准上下文

code-review-graph 是一个本地优先的代码智能图项目,基于 Tree-sitter 解析代码结构,通过 MCP 协议为 AI 编程助手(如 Codex、Claude Code、Cursor 等)提供精确的上下文。它解决 AI 在代码审查时重复读取大量 Token 的问题:通过 blast-radius 分析,只输出受变更影响的文件,帮助助手聚焦关键代码。支持 30+ MCP 工具、增量更新(2 秒内重建图)、GitHub Action 风险评分 PR 审查,以及自定义语言扩展。基准测试显示,中位数 Token 减少约 82 倍。适合使用 AI 编程助手的开发者和维护大型仓库的团队。

github.com · 36 min · Ai Tooling · Code Analysis · Code Intelligence
07-22

AI 原生 Markdown 编辑器与 LLM 知识库

Open Knowledge 是一个开源的 AI 原生 Markdown 编辑器,同时也是一个由大语言模型驱动的知识库(LLM Wiki)。它将 Markdown/MDX 编辑、个人知识管理和 AI 代理能力深度融合,支持与 Claude、Codex 等智能体协作,帮助用户构建第二大脑。适合追求智能笔记、文档编写和知识检索的开发者与知识工作者。

github.com · 1 min · Agents · AI Engineering · Developer Tools
07-22

Kimi Code CLI:专为下一代智能体打造的终端AI编码代理

Kimi Code CLI 是一个在终端中运行的 AI 编码代理,能直接读取和编辑代码、执行 shell 命令、搜索文件、抓取网页,并基于反馈自主决策下一步。它默认使用月之暗面 Kimi 模型,也支持其他兼容提供商。核心特色包括单二进制分发(无需 Node.js)、毫秒级启动的专用 TUI、视频输入支持、AI 原生 MCP 配置、丰富的插件生态、子代理并行执行、生命周期钩子,以及通过 ACP 协议与 Zed、JetBrains 等编辑器深度集成。适合希望用 AI 提升编码效率、探索 Agent 工作流的开发者。

github.com · 4 min · AI Agents · CLI · Developer Tools
07-20

构建真正可用的 Claude Code 技能:完整指南

本指南从零开始构建一个 Claude Code 技能(commit-messages),详细讲解技能文件夹结构、SKILL.md 的写法(尤其是 description 的关键作用)、如何通过 scripts 文件夹确保指令一致性,以及 references 和 assets 的按需加载策略。强调 description 决定了技能是否被触发,而并非指令本身。适合所有使用 Claude Code 希望固化工作流的工程师。

x.com · 11 min · Agent Engineering · Ai Tooling · Claude Code
07-19

LangChain 开源软件工程代理工厂

LangChain 团队开源了其内部使用的四个软件工程代理工具:本地编码代理 dcode、云端编码代理 OpenSWE、自动代码审查 OpenSWE Review 以及仓库知识文档 OpenWiki。文章详细介绍了每个工具的设计意图、使用场景和实际数据——OpenSWE 上周仅从 Slack 触发了近 1000 次,OpenSWE Review 在离线代码审查基准中以 47% 的成绩排名开源第一。所有工具基于 Deep Agents 框架,并利用 LangSmith 进行全链路追踪与优化。适合希望构建可控、可观测的软件工程代理流水线的工程师。

x.com · 7 min · Agents · AI Engineering · Code Review
07-17

Graphify:将任意代码库转化为AI编程助手可查询的知识图谱

Graphify 是一个将代码库、文档、PDF、图片和视频映射为知识图谱的开源工具,专为 AI 编程助手(如 Claude Code、Cursor、Gemini CLI 等 20+ 平台)设计。它使用 tree-sitter AST 对代码进行确定性解析(完全本地、无需 LLM),对文档/媒体则通过 AI 助手模型做语义提取。输出是一个可交互的 HTML 可视化、一份 Markdown 报告和可复用的 graph.json,支持用户通过自然语言查询、路径追踪和概念解释。每一条边都带有置信度标签(EXTRACTED / INFERRED),让开发者明确区分“读到的”和“推测的”。适合需要快速理解大型陌生代码库或在长尾维护中依赖 AI 助手的工程师。

github.com · 47 min · Agent Engineering · Ai Tooling · Code Intelligence
07-16

将文本上下文渲染为图片,本地代理为 Claude Code 削减约 60% token 成本

pxpipe 是一个本地代理,拦截 Claude Code API 请求,将系统提示、工具文档和旧历史记录等大块文本渲染为紧凑的 PNG 图片。利用图片 token 按像素尺寸而非字符数计费的特点,将输入 token 量削减约 60%,端到端 API 费用可降低 59–70%。它改写请求负载并保留提示缓存兼容性,默认对 Claude Fable 5 和 GPT-5.6 启用,提供仪表盘实时监控和收益门槛,避免稀疏文本反而增加开销。适合使用 LLM 编程助手的开发者,在保持任务能力的同时大幅降低 API 开销。

github.com · 12 min · Ai Tooling · Anthropic · CLI
07-16

「短绳」编程法:人类把关,AI编码质量胜过Fable

本文总结了一年多来在安全关键系统中使用 AI 代理编码的研究成果。作者提出“短绳法”:只有资深开发者才能使用,全程禁止 YOLO 模式,开发者必须逐 diff 审查 AI 提议的每次改动,及时打断跑偏倾向,每个子任务结束后提交,从而杜绝“氛围编程”带来的代码鬼祟。文章还给出了 AI 辅助代码评审的最佳实践——人类与 AI 共同审查 PR,AI 负责快速扫描常见错误,人类把关方向性决策;并且要求作者在提交 AI 辅助 PR 前必须自我逐行审查并加上 AI 使用声明。该方法即便使用非前沿模型,也能产出胜过 Fable 的高质量代码。适合希望用 AI 提升效能但不牺牲代码质量的资深工程师阅读。

blog.okturtles.org · 7 min · AI Agents · AI Engineering · Code
07-15

从提示词到循环:用Claude构建自动化代理系统

本文提出工程师应从写单次提示词转向设计自动化循环(loop),让AI代理持续工作。核心架构包含六要素:自动化触发器、工作树(git worktree)隔离、技能文件、连接器、子代理和持久化记忆文件(如STATE.md)。关键模式是评估器-优化器:一个代理生成内容,另一个用测试/类型检查等客观标准校验。停止条件必须是可验证的(测试通过、构建成功),不能依赖代理自我声明。通过自主阶梯(建议、草稿、低风险自动、完全自动)逐步提升自动化等级。文中也提醒注意Token成本和命令白名单安全。

x.com · 10 min · Agent Architecture · AI Engineering · Claude Code
07-14

三大AI Agent技能框架深度对比:Matt Pocock Skills、Superpowers与Agent Skills

本文系统比较了三种主流的AI Agent技能框架:Matt Pocock Skills(工程实践型)、Superpowers(社区工作流型)和Agent Skills(生产级生命周期型)。从定位、技能粒度、学习曲线、Token消耗、工具支持、社区规模等维度逐一对比,并给出了个人开发者、小团队、中大型团队及企业级项目的选型建议。核心发现:Matt Pocock Skills擅长快速对齐与架构优化,Superpowers提供端到端工作流与丰富插件生态,Agent Skills则以验证门控和反合理化设计保障代码质量。文章还提供了三者组合使用的策略。适合正在为AI编码助手选择工作流框架的开发者与技术负责人。

www.besthub.dev · 8 min · Agent Engineering · Ai Tooling · Comparison
07-13

轻量级终端编码智能体,本地运行、云端协作

Codex CLI 是 OpenAI 推出的轻量级编程智能体,运行在本地终端,直接利用 ChatGPT 订阅或 API 密钥驱动。它不同于 IDE 插件或桌面应用,而是提供纯粹的 CLI 体验,适合习惯终端工作流的开发者。支持 macOS、Linux 和 Windows 三大平台,可通过 shell 脚本、npm 或 Homebrew 快速安装。项目采用 Rust 和 Bazel 构建,注重性能与可移植性。代码以 Apache-2.0 开源许可发布,适合希望探索命令行 AI 编程助手的开发者和团队。

github.com · 5 min · AI Engineering · CLI · Coding Agent
07-11

智能体编码中的测试哲学:从芯片设计到AI工作流

本文作者以在芯片公司Centaur的测试经验为背景,探讨了LLM驱动的智能体(agent)在软件工程中的测试与编码实践。核心观点包括:Centaur的无代码审查、模糊测试为主的工作流在AI时代依然高效,每年仅出现<1个重大用户可见bug;LLM直接生成的测试质量较差,但通过定向提示进行模糊测试可在数分钟内发现真实漏洞;LLM方差极大,同一模型在不同任务上表现迥异,使得公共基准测试的单一排名缺乏实际指导意义;作者还分享了在构建超人类棋盘游戏AI时的系统性方法——基于数据和分析而非盲目提示。文章适用于对AI辅助软件工程、测试自动化及高效agent工作流感兴趣的工程师。

danluu.com · 91 min · AI Engineering · Benchmarks · Developer Tools
07-10

11天、64个AI Agent、535K行代码:Bun从Zig到Rust的史诗级重写

本文是Bun创始人Jarred Sumner的亲身复盘,详细记录了如何借助Anthropic的Claude Fable 5模型,在11天内将Bun的535,496行Zig代码完全重写为Rust。重写动机是Zig手动内存管理在混合GC场景下导致的频繁use-after-free、double-free和内存泄漏。作者没有采用渐进式重写,而是让64个Claude Agent并行工作,通过动态工作流(dynamic workflow)和对抗性审查(adversarial review)确保代码质量。最终整个测试套件(60万+断言)在6个平台全部通过,修复了128个已知bug,内存占用降低最多90%,二进制缩小约20%,吞吐量提升2-5%。文章详细披露了AI辅助下的工作流程、遇到的典型移植错误(如debug_assert!副作用、切片越界、comptime格式化),以及Rust的Drop机制如何系统性防止Zig中defer容易遗漏的清理问题。这是一线工程师利用前沿AI工具完成不可能任务的第一手报告,对任何关注AI工程、运行时实现或语言迁移的人员都有极高参考价值。

bun.com · 65 min · Agent Engineering · AI Engineering · Code
07-09

/teach 技能:构建持久化学习工作空间

本文介绍了一个名为 /teach 的 AI agent 技能,专为长期、累积式学习设计。与一次性问答不同,/teach 将当前目录变为一个持久的教学空间,通过 MISSION.md 明确学习目标,从高信任资源(如文档、书籍)获取知识并标注出处,而不是依赖模型的参数记忆。它使用 ADR 风格的学习记录追踪进度,并基于“最近发展区”动态调整下一课难度。文章详细阐述了其目录结构(lessons、reference、learning-records 等)以及教学理念:通过“存储强度”(storage strength)对抗“流畅度幻觉”,利用理想困难(desirable difficulty)、检索练习、间隔重复等策略构建长期记忆。适合希望系统学习新技术(如语言、框架、理论)的工程师,尤其适合将学习视为项目而非一次性任务的人。

www.aihero.dev · 3 min · Ai Tooling · Developer Tools · Education
07-03

开源本地优先的设计工作台,兼容 22 种编程代理与 150+ 设计系统

Open Design 是一款本地优先、开源的代理原生设计工作台,志在成为 Anthropic Claude Design 的开源替代。它不内置代理,而是与本地已有的编程代理(Claude Code、Codex、Cursor、Copilot 等 22 种 CLI)协作,利用 MCP 协议让它们读取设计系统、技能和插件,直接在终端生成原型、仪表盘、演示文稿、图像/视频等制品。支持 BYOK(自带密钥)兼容任意 OpenAI 端点,提供 macOS/Windows 原生桌面应用。内置 100+ 技能、150+ 品牌级 DESIGN.md 系统、261 款插件,适合追求品牌一致性与开发流程可控的设计师与前端工程师。

github.com · 35 min · Agent Engineering · Design Tools · Developer Tools
07-02

打造优秀垂直 Agent:用缓存层级组织上下文

本文提出一个核心观点:优秀的垂直 Agent 是对任务分布的有损压缩,其上下文应像 CPU 缓存一样分为 L1/L2/L3 三层。作者以自己构建的 Shortcut 电子表格 Agent 为例,详细展示了如何极度优化高频操作:读取时通过 R1C1 范式化和别名将 500 个公式压缩为一行动态;写入后返回分组、采样、分类的 diff,并将 #REF! 等错误标记为 MUST FIX。第二层是按需拉取的英文规范文档,例如透视表规范教会模型 suspendLayout/resumeLayout 和聚合参数必须传原始整数 8;第三层是完整的原始 API 参考,配一个 100 行的 grep 技能让模型能自行挖出所需签名。整篇文章提供了具体的代码片段、prompt 预算分配和可迁移的设计原则,适合所有需要构建高可靠 Agent 的工程师。

06-27

AI生成代码泛滥后,代码审查才是真正的核心技能

当AI能以分钟级生成上千行代码时,工程的瓶颈从编写转向了信任决策。因此,审查成了软件领域最具杠杆能力的技能。文章指出,2026年的多方数据(Faros AI、CodeRabbit、GitClear、GitHub)均证实:AI使用量提升后,开发者的代码产出提高约4倍,但交付价值仅增长约12%,同时代码流失率飙升861%、缺陷率从9%升至54%、审查时长增加441.5%、零审查合并的PR增长31.3%。作者认为,问题不在于是否使用AI,而在于如何根据项目的「爆炸半径」分层分配审查力度:对个人无用户项目可轻审查,对大型企业级项目必须建立分级、证据驱动、异质化AI审查+人类最终负责的流程。文章还介绍了具体实践:分流PR、要求前置证据、关注测试变更、用两个不同构架的AI审查工具并行运行,以及让人类从「线级审查」升级为「抽样审计」。

addyosmani.com · 29 min · Agent Engineering · AI Engineering · Code Review
06-27

AI 重塑软件生命周期:从编写代码到评判代码的转变

这篇由 Google 工程师撰写的白皮书提炼,核心观点是:AI Agent 的真正价值不在于模型本身,而在于其“载体”(Harness)——即指令、工具、沙箱、编排逻辑和可观测性组成的系统,模型约占 10%,载体占 90%。上下文工程是决定成本的关键,需要区分静态上下文(每次加载,昂贵但可靠)和动态上下文(按需加载,便宜但需谨慎设计)。验证能力是区分“Vibe Coding”和真正的工程化 Agent 的分界线:测试覆盖确定性部分,评估覆盖非确定性输出和轨迹。白皮书提供了具体数据:仅修改载体(不换模型)即可将编码 Agent 在 Terminal Bench 2.0 上从 30 名外提升至前 5;LangChain 的实验中通过修改系统提示、工具和中间件在相同基准上提升了 13.7 分。适用于所有正在或准备将 AI Agent 引入研发流程的工程师和技术管理者。

addyosmani.com · 15 min · Agent Architecture · AI Engineering · Context Engineering
06-26

跨 AI 编码助手的智能体增强操作系统——规则、技能与安全审计

ECC 是一套为多个 AI 编码助手(Claude Code、Cursor、Codex、OpenCode、GitHub Copilot 等)设计的智能体增强系统,被定位为“Agent 增强型操作系统”。它并非一个独立的 AI 工具,而是一个包含 260+ 技能、67+ 子智能体、提供持久化记忆、连续学习、成本优化和安全审计(AgentShield)等功能的配置与插件集合。通过统一的规则、钩子和 MCP 配置,它试图解决跨平台开发工作流中智能体行为不一致、上下文丢失和安全性不足的问题。适合深度使用 AI 编码助手的专业开发者,以及希望建立标准化 Agent 工程实践的技术团队。

github.com · 94 min · Agent Engineering · Claude Code · Context Engineering
06-22

调试循环:6步而非60步,用Claude Code定位根因

大多数开发者使用 Claude Code 调试的常态是把错误粘贴进去、接受一个猜测性的修复、再粘贴下一个错误——陷入长达数十轮的猜谜循环。本文提出一个六步调试循环:先让LLM建立可复现的失败测试(repro),然后在 plan mode 中限定搜索范围,派发只读子agent从多个角度追踪根因,只针对根因而非症状修复,通过 PostToolUse 钩子自动验证修复是否通过测试,最后将 repro 保留为回归测试。核心论断是:LLM的能力并非问题,而是用户跳过前三个阶段直接要求“修复”导致了症状修补的死循环。

x.com · 7 min · Agent Engineering · Claude Code · Debugging
06-22

Vercel 的 AI 设计规范:一份教科书级的参考

本文深度拆解了 Vercel 的 DESIGN.md 文件,展示了如何为 AI 编写一份高效、可执行的设计规范。文章从颜色、间距、字体、动效、文案和无障碍等维度,逐一分析了 Vercel 的做法及其背后的设计思维。例如,颜色系统通过 100-1000 的梯度设计,将交互状态(默认、悬停、点击)与固定数字关联,让 AI 无需猜测;间距体系只提供 9 个基于 4px 倍数的值,强制节奏一致;字体系统采用角色思维(标题/标签/正文/按钮)而非字号思维,减少视觉决策;动效设计则强调“能不动就不动”,并给出了各场景的精确时长。这篇文章适合希望提升 AI 生成界面一致性、或想要建立自身设计规范的产品经理、前端工程师和 AI 工具开发者阅读。

x.com · 4 min · Ai Tooling · Design System · Developer Tools
06-21

AI 代码生成懒人模式:自动砍掉无用代码、缩短输出至原规模一半

Ponytail 是一个为 Claude Code、Codex、Copilot CLI 等 14+ 种 AI 编码代理设计的规则插件。它注入一套“先问必要性”的思维阶梯:代码真的需要存在吗?标准库或平台原生能力能否做到?一行代码能否搞定?—— 全部通过后才生成最小可行实现。基于 12 个真实功能任务、与 FastAPI+React 仓库交互的 benchmark 显示,平均减少 54% 的代码行数、22% 的 token 消耗、20% 的成本和 27% 的耗时,且完全保持原有的安全约束(验证、错误处理、安全、无障碍)。适合追求生成代码简洁、物有所值的开发者,尤其被同一 agent 反复“过度工程”困扰的团队。

github.com · 12 min · Agents · AI Engineering · Code Generation
06-21

本地 HTML 编辑器,专为 Agent 协作设计

Lavish-axi 是一个轻量级 CLI 工具,它将在本地浏览器中打开 AI 生成的 HTML 文件(即 artifact),让你可以直接在界面上圈选元素、标注文本、截图,并向当前 Agent 发送反馈。它通过一个本地服务器提供一个 chrome 风格的编辑界面,支持实时预览、布局审计(检测溢出、文字裁剪等问题)、反馈队列和长轮询,使得人机协作迭代原本静态的 HTML artifact 变得流畅。项目以 AXI 标准封装,通过 npx 即可无安装运行,并可作为 skill 集成到 Claude Code 等支持斜杠命令的 Agent 中。适合需要精细调试 AI 生成页面或可视化方案的工程师。

github.com · 18 min · Agents · Ai Tooling · CLI
06-08

给工程师的 AI 编码工作流:一组可组合的 Agent Skills

Matt Pocock 从自身 .claude 目录公开分享了用于 Claude Code、Codex 等编码智能体的技能集。这些技能并非“写代码”,而是针对 AI 辅助开发中的四大典型失败模式(需求对齐错误、上下文冗长、代码不可用、架构熵增)给出工程化对策。核心包括:通过盘问式对话对齐需求的 /grill-me 与 /grill-with-docs;通过红-绿-重构循环保证代码质量的 /tdd;以及维护领域语言与架构的 /improve-codebase-architecture。项目强调“小、可适配、可组合”,适用于任何模型。适合希望将 AI 编码工具纳入严谨工程实践的一线开发者。

github.com · 14 min · Agents · AI Engineering · Claude Code
06-08

我的 Agentic 工程实战技巧(2026年6月版)

作者分享了在 Claude Code 与 Codex 上进行 Agentic 工程的 22 条实战技巧。核心是“先规划后执行”:用 /ce-plan 生成 plan.md 约束 AI,人只需略读或提问,而非阅读全文。具体包括:以语音(Monologue/Wispr Flow)替代键盘输入,利用 LLM 理解不完美转录;在 cmux 中同时打开 4-6 个标签页,各自运行独立 Agent 任务;设终端默认启动为 Claude Code,跳过所有权限提示并以声音提醒任务完成;通过 AgentMail 为 Claude 配置邮箱,实现远程邮件触发新会话;用 last30days 在规划前并行搜索社区、视频和新闻,获取实时信息;将重复操作封装为可复用 Skill,持续扩展 Agent 能力。此外,他强调人类在循环中的核心价值是提供品味与方向,而非亲自编码,并警示 AI 开发成瘾的风险。全文包含大量可复制的配置片段与具体工具,适合重度使用 AI 辅助开发的工程师。

x.com · 28 min · Agent Infrastructure · Agents · AI Engineering
06-07

2026年6月第一周AI快讯:Claude限额翻倍、SpaceX IPO、微软模型数据翻车

本文汇总了6月第一周10条AI与科技行业动态。MiniMax M3大模型发布,以0.6美元/百万token的价格在编程跑分上超越GPT-5.5,但独立验证尚未出炉。DeepSeek完成约74亿美元首轮外部融资,宇树科技以73天闪电过会。Kimi Work、Coze 3.0与Qwen3.7-Plus在同一周发力Agent领域。豆包宣布收费,基础版永久免费。ChatGPT月活突破10亿,Codex推出Sites和岗位插件。Anthropic将Claude Cowork限额翻倍,并发布了Claude已撰写自家80%代码的报告,同时秘密提交IPO。英伟达在Computex 2026发布集成ARM CPU的RTX Spark超级芯片。SpaceX定于6月12日上市,谷歌披露了一份9.2亿美元/月的算力租用合同。微软自研推理模型MAI-Thinking-1发布仅3天,其声称的“干净数据”便被发现包含242亿页Common Crawl数据,同时GitHub Copilot转为按量计费后,部分开发者月账单飙升至3000美元。文章是典型的行业信息简报,适合需要快速了解一周重大技术动态的工程师和从业者。

mp.weixin.qq.com · 7 min · AI Engineering · AI Industry · Cost Optimization
06-02

多代理并行 IDE:在一个工作区同时调度 Claude Code、Codex 等 AI 编程代理

Orca 是一个桌面和移动端 IDE,专为同时运行多个 AI 编程代理(如 Claude Code、Codex、Grok 等)而设计。它利用 Git 的 worktree 机制,为每个代理任务创建隔离的工作目录,避免 stash 和分支切换的繁琐。用户可以在一个界面里通过标签和窗格并行观察和控制各个代理的进度,内置了差异审查和简单的源代码管理功能,并能直接关联 GitHub Issues 和 PR。适合已经习惯用 CLI 代理辅助编码、需要同时处理多个功能或重构任务的开发者。

github.com · 9 min · Agents · Ai Tooling · CLI