Glean 拾遗
← 所有期号
#014 8/24–8/30 8 月 31 日发布

从自主到可信:Agent 工程化的务实转折

本周的十八篇文章汇聚于同一个转折点:AI Agent 正从演示走向交付,话题从“它能做什么”切换为“怎么让它稳定地做好”。AIEWF 侧记宣告全自主幻梦退场,外环与内环的分工成为共识;OpenViking 与 ai-memory 把记忆锻造成可查询的基础设施,AGENTS.md 瘦身指南则提醒指令预算和 token 一样有限。当实现与测试出自同一双手,绿色流水线只代表代码与测试彼此一致,手工用例、变异测试与视觉定位因此成为新的信任基线。GPT-Live 用全双工语音重写交互链路,SQLite 与 PostgreSQL 的拥护者各自论证“一个组件”的极限。收敛与节制,是贯穿本周的暗线。

18 篇 5 章 约 4 小时
章节 01

从自主狂潮到在环共识

3 / 18
www.latent.space · 19 min
01

AIEWF 2026 侧记:从自主狂热到在环工程,智能体开始上岗At AIEWF, AI Engineer Trends Shift from Autonomy to Harnessed Loops

2026 年 AI Engineer World’s Fair 上,三个议题主导了讨论:harness 工程、编码代理与 agent skills。Lilian Weng 的旧文谈 agent 的 planning、memory、tool use,新文则转向围绕模型的 harness;AutoGPT 式全自主幻梦已被外环(outer loop)模式取代——OpenClaw 作者 Steinberger 宣称代理跑内环,人来定方向。Vercel、Warp、Cursor 把部署形态推向长期运行的软件工厂,前向部署工程师(FDE)负责把代理接入企业并保证严格 ROI。Google DeepMind 的 Schmid 提出 agents are just files,用 Markdown 技能扩展能力;Matt Pocock 则提醒 skills hell:技能要少而小,结构重于数量。文章也保留怀疑态度:Horthy 说 hype outruns discipline,Huntley 担心一年后“工厂失败、环路失败”成为新口头禅。适合关注代理工程、编码工具和企业 AI 落地的工程师快速建立 2026 年行业坐标。

x.com · 2 min
02

Claude Opus 5 初评:重新构建技能后表现更佳Claude Opus 5 First Look: Hard to Love, Better from Scratch

本评测基于对 Claude Opus 5 为期一周的测试,覆盖编码、写作、知识工作和内部 Agent。结果发现该模型与既有 skills 和插件(如 Compound Engineering)不兼容,常早停或忽略指令。但删除原有工作流后,模型表现显著改善。此外,低思考级别下行为更稳定,中低难度任务尤佳。总体而言,Opus 5 定位尴尬:有 Fable 的个性但缺乏其顶尖能力,介于 Fable 与 GPT-5.6 之间,适合作为 Fable 的备用或从零搭建工作流的用户。

mp.weixin.qq.com · 9 min
03

AI 提效神话 vs 员工更累:一份职场遥测报告的硬核拆解AI Amplifies Work, Not Reduces It: 2026 Workplace Report

这份对 ActivTrak《2026 职场现状报告》的深度研读,用来自全球数千家组织的超 4.43 亿小时行为数据反驳了“AI 减负”的流行叙事:AI 采用率已达 80%,企业平均部署 7 个工具,但员工日均专注时间从 14:23 缩至 13:07,专注效率跌至 60% 的三年新低。报告指出 AI 是“放大器”而非“替代者”——邮件耗时增加 104%、即时通讯增加 145%,协作时间上升 34%,而仅有 3% 的员工处于 7%-10% AI 使用占比的“生产力甜蜜点”。更值得警惕的是,员工风险正从倦怠转向“疏离感”(长期未充分利用),中市值企业每年因此损失 2.28-3.55 亿美元。适用于正在评估 AI 投资回报的管理者、AI 产品负责人及关注组织效能的一线工程师。

章节 02

上下文即基础设施:记忆、文件与技能

5 / 18
www.aihero.dev · 8 min
04

AGENTS.md 瘦身指南:用渐进披露守住指令预算A Complete Guide to AGENTS.md

AGENTS.md 是签入 Git 的 Markdown 文件,用于向 AI 编码代理注入仓库级指令,但它会在每次请求时全文加载,存在“指令预算”上限:前沿模型大约只能稳定遵循 150–200 条指令。文件越大越容易过时,过期路径或架构描述反而会污染上下文。本文主张把 AGENTS.md 压缩到最小:一句话项目描述、非 npm 的包管理器、非常规构建/typecheck 命令,其余内容通过渐进披露拆到 docs/ 子文件、子目录 AGENTS.md 或 agent skills,并给出一段可直接粘贴给代理的重构 prompt。适合在用 Claude Code 等代理工具、并希望控制 token 成本与指令混乱的工程团队。

github.com · 19 min
05

为 AI Agent 设计的自演进上下文数据库Self-evolving context database for AI agents

OpenViking 是面向 AI Agent 的开源上下文数据库,把记忆、知识资源与技能统一挂载到 viking:// 虚拟文件系统,让 Agent 用 ls/tree/find 这类文件操作浏览上下文,而不是查询黑盒向量库。写入时内容会被加工成 L0 摘要、L1 概览、L2 详情三层,按需加载以节省 token;检索采用目录递归下钻,并保留完整浏览轨迹供排查。适合正在构建 Agent 记忆、Agentic RAG 或上下文管线的工程师参考或直接集成。

github.com · 62 min
06

让编码 Agent 共享长期记忆,跨工具无缝交接工作流Long-term memory for coding agents with cross-vendor handoffs

ai-memory 是一个用 Rust 编写的长期记忆服务,面向编码 Agent(Claude Code、Codex、Kimi CLI 等),解决跨会话、跨工具丢失上下文的问题。它通过 MCP 配置与生命周期钩子自动捕获提示词、工具调用与会话边界,在会话结束时编译成摘要与 handoff,写入 git 版本化的 Markdown wiki;下一个 Agent 启动时自动注入“上次进行到哪”的上下文。检索采用 FTS5、实体匹配、图邻居的混合方案,LLM 与向量嵌入均为可选。适合在多种 AI 编程工具间切换、希望沉淀项目决策与失败经验的工程师。

x.com · 1 min
07

Anthropic 内部高频使用的 ELI5 命令:先画大图,再讲细节Anthropic's internal ELI5 skill: explain like I'm five, with HTML visuals

Anthropic 内部近期高频使用一个 ELI5 Skill,调用方式为 /eli5 <topic>。它要求 Agent 以完全不懂背景的用户为对象解释主题:少用术语、用大图和少量文字,并通过 HTML Artifact 呈现复杂概念。作者指出,这个 Skill 的真正价值不在于把回答写得更简单,而是强制 Agent 重新组织知识——先建立整体认知,再展开细节与边界,从而暴露理解盲区。该技巧源自 Reddit 的 ELI5 文化,在 Agent 场景下变成一种可复用的输出结构约束,不依赖特定模型,任何支持斜杠命令或自定义 Skill 的工具都可复刻。适合正在调校 Claude 或其他 Agent 输出格式的工程师。

github.com · 15 min
08

可验证的架构图生成 Agent Skill,把代码库变成交互式系统地图An agent skill that turns codebases into verifiable, interactive system maps

Archify 是一个面向 AI 编码代理(Agent)的图表生成技能:把一段系统描述或一个 GitHub 仓库变成可交互的架构、工作流、时序、数据流和生命周期图。它用带 schema 的类型化 JSON IR 作为事实来源,先校验后交付,失败时返回机器可读的修复码,并支持 Before/Delta/After 架构对比,适合在 PR 审查时使用。最终产物是自包含的单文件 HTML,可导出 PNG、SVG、WebM 与 1200×630 分享卡。适合需要为代码库快速生成可信可视化的工程师、技术文档作者和 AI 工具链使用者。

章节 03

在环工程:流程、对话与环境

4 / 18
claude.com · 31 min
09

Claude Code 初创实战:五条规则与 AI 原生研发闭环Claude Code for Startups: 5 Rules from AI-Native Teams

Anthropic 采访了十余家高增长初创公司,整理出 Claude Code 的五条实战规则:人人都能交付、自动化琐碎工作、信任但验证、为重建而构建、先原型后自用再产品化。文中给出具体案例:Clay 的 agent 承担 100% bug 分诊;ClickHouse 的 flaky-test 修复 agent 成为仓库第二和第三大贡献者;Cainex 用“修复原则而非个例”的闭环,让专家审计意见回流到可版本化的 agent 指令。每章附有可执行配置:MCP、CLAUDE.md、skills、hooks、git worktrees、动态工作流。本文是供应商出品的案例合集,偏重宣传,但对 AI 原生研发流程的落地仍有参考价值。适合正在引入 agentic coding 的团队和初创公司技术负责人。

openai.com · 16 min
10

拆解 GPT-Live:流式全双工语音架构,把启动从六次往返压到一次Inside GPT-Live: full-duplex voice, one-round-trip startup

GPT-Live 用流式全双工语音模型取代了轮次制语音架构:轮次检测器被移出音频路径,模型可以同时听和说,需要深入推理或工具调用时再异步委派给 GPT-5.5。工程层面的关键动作包括:用 Go 重写媒体前端和推理逻辑,p95 帧传送延迟追平旧系统 p50;构造跨模型实例的有状态交接机制,让上下文压缩以受控切换的方式进行,不打断媒体流;提出 WARP 协议族把 WebRTC 会话启动从六次网络往返降到一次,并用 Instant Connect 把 SDP 信令移出关键路径,客户端发一个 UDP 包即可开聊。静默测试发现真实负载下 CPU 流处理比 GPU 推理更早饱和,容量应按可维持的并发会话数而非推理吞吐衡量。适合正在构建实时语音或智能体交互系统的工程师。

github.com · 2 min
11

一个由 DHH 出品的“有主见”的现代 Linux 发行版A beautiful, modern & opinionated Linux distribution by DHH

Omarchy 是由 DHH 主导的 Linux 桌面发行版,目标是把日常计算体验打磨到开箱即用:内置终端、Neovim、AI 开发工具、TUI/GUI 应用以及统一热键、剪贴板等全局能力,并配有一套完整在线手册。它不是传统通用发行版,而是将作者的设计偏好与工作流固化为默认配置,让用户减少折腾。仓库以版本化方式管理安装脚本、点文件、主题和文档,支持无人值守安装与系统快照,适合希望获得一致、美观、可复现开发环境的工程师与创作者。

xiangyangqiaomu.feishu.cn · 2 min
12

Omarchy 全景实操手册:从 macOS 迁移到 Arch + Hyprland 的完整路径Omarchy Field Guide: From macOS to Arch + Hyprland in 12 Chapters

Omarchy 是 DHH(Ruby on Rails 与 37signals 创始人)于 2025 年推出的 Linux 发行版,基于 Arch Linux 与 Hyprland 平铺窗口管理器,以 omakase 理念替用户预置软件选择与交互逻辑,主打键盘驱动、开箱即用。本文是一份全场景操作手册,从安装、首次交互、快捷键、软件安装,到屏幕录制、内置 AI Agent、系统维护、跨平台迁移、进阶定制与故障排除,共十二章加两个附录,并附 CLI 命令速查和常见问题。内容面向从 Windows/macOS 迁移的开发者,含中文输入法和代理等本地化配置说明,适合希望获得 Arch 能力但不愿从头 DIY 的用户。文章立场正面,缺少失败案例和 trade-off 讨论,适合作为上手参考而非中立评测。

章节 04

当测试与实现同源:建立独立基线

4 / 18
testomat.io · 14 min
13

Agent 既写代码又改测试,手工用例是最后的独立基线Manual Test Cases Are the Baseline AI Agents Need

当同一个开发流程既生成实现又不断调整测试时,绿色流水线只能说明代码与测试一致,而非行为正确。文章主张以手工测试用例作为独立于源码的行为基线:用 Markdown/Gherkin 写出业务场景、前置条件、预期结果与边界,并在实现前评审;另设需求评审 agent 审核用例变更,只有获得需求授权的修改才允许进入基线。这样可减少 agent 每次会话花 10+ 分钟修 E2E 的循环,避免测试固化同一误解,并在重写、迁移后保留可追溯的意图。文末为 Testomat.io 自家 MCP/Agent skills 产品推广,阅读时需注意立场。适合在 agentic 开发中负责质量、QA 或交付的读者。

kodare.net · 7 min
14

Mutmut:用变异测试揪出 100% 覆盖率背后的盲区Mutmut: A Python Mutation Testing System

作者在维护 Python 库时发现,即便测试覆盖率 100%,仍可能漏掉边界条件和异常行为。变异测试通过在源码上做微小改动(如把 < 改成 <=)并运行测试套件,可以暴露出这些盲区。作者调研了 Mutpy 和 Cosmic Ray 后,决定自己实现一个变异测试工具 Mutmut。核心设计是使用 baron(后替换为 parso)实现 AST 无损往返,让变异后的代码可以以原格式落盘,便于审查具体变异。作者尝试用 import hook 在内存中变异模块以支持并行,但受限于 Python 导入系统必须重写全部 loader,最终放弃并退化为基于磁盘的串行变异,换来简单性和对不同测试运行器的兼容性。在 tri.declarative 和 tri.struct 上运行时,虽未发现 bug,却找到了未充分测试的边界和死代码,实际改善了测试套件。适合对 Python 测试工具链和变异测试感兴趣的工程师阅读。

shopify.engineering · 8 min
15

用视觉定位替换 Test ID:Shopify 将移动 E2E 稳定性拉到 98%How Shopify pushed mobile E2E test stability to 98%

Shopify 最大的移动应用曾因 E2E 测试大面积 flaky 而被迫将测试从 PR 阻塞中移除。团队在旧 Appium 栈上看到问题不在测试代码而在框架本身:Test ID 查找元素允许在界面未渲染时就点击,pause(1000) 之类的捷径层层积累。他们放弃修补 Appium,改为在其上封装一个强约束框架:builder API 强制每个操作附带断言,操作词汇表刻意收窄,逃逸口统一命名为 UNSAFE_;识别层改用计算机视觉,通过 PaddleOCR 识别文本、OpenCV 对灰度多尺寸匹配 Polaris 图标,重复元素用相邻关系消歧,Test ID 被降级为需显式选择的 fallback。每轮运行生成带标注的视频,失败可自诊。迁移后测试稳定性从 50% 升至 98%,剩余失败多为网络与模拟器启动问题。文章还给出普适建议:将 API 收窄到几个核心命令、每个动作强制断言且验证断言的前后状态、合并前先跑多轮稳定性门槛。适合受 flaky E2E 困扰的移动端、QA 基础设施与测试工具链工程师。

testcontainers.com · 6 min
16

Testcontainers 入门:用真实服务容器解决集成测试的环境与数据污染Testcontainers: real-service integration testing, no in-memory fakes

文章是 Testcontainers 官方入门指南,先梳理传统集成测试的两类痛点:预置环境难以维护、并行管道互相污染。作者指出,用 H2 这类内存库或 mock 替代真实服务会丢失生产特性并延迟反馈,SQL 可能在部署后才暴露兼容问题,从而让测试失去意义。随后介绍 Testcontainers 的工作方式:在测试前后用 Docker-API 兼容运行时拉起和销毁真实数据库、消息系统等容器,基础设施定义与测试代码放在一起,可在 IDE 直接运行,也天然隔离并行执行。全文适合刚接触集成测试、想绕开 mock 替代方案的工程师;但没有任何代码示例和性能数据,也未提及 Testcontainers 自身的 Docker 依赖与启动开销。

章节 05

基础设施的减法:一个组件走多远

2 / 18
www.raphaelbauer.com · 13 min
17

一个数据库打天下?PostgreSQL 取代搜索、队列、图库的实践与边界PostgreSQL for Everything

作者以多年 CTO 经验主张用 PostgreSQL 统一技术栈,认为它不仅能当关系数据库,还能替代全文检索、文档库、消息队列、时序库、向量库、缓存乃至图数据库。文中引用 Contentful、Instacart、Guardian 的迁移案例,并列出具体机制:tsvector/tsquery 全文检索、GIN 索引、SELECT ... SKIP LOCKED 实现队列、UNLOGGED 表模拟缓存、TimescaleDB 处理时序、pgvector 做向量检索、Apache AGE 提供 openCypher 图查询。适合正在考虑精简基础设施的工程师阅读,但文中缺少基准数字,需自行验证性能边界。

joecode.com · 16 min
18

SQLite 万能论:它凭什么把搜索、队列、缓存和向量库都收进一个文件SQLite for Everything: Cut Your Stack Down to One File

作者借回应《PostgreSQL for Everything》的机会,提出更极端的组合:SQLite 不是玩具,而是把 RDBMS、全文检索、文档存储、队列、时序数据、向量库和缓存合并成一个文件与一次函数调用。文章给出多个可直接照搬的做法:用 BEGIN IMMEDIATE 配合 RETURNING 把表当持久化队列;用 JSON 生成列索引无模式字段;用 sqlite-vec 让混合检索退化成同一个事务里的 JOIN;用 WAL 加 synchronous=OFF 把缓存延迟压到约 1 微秒,低于本地 Redis 的约 100 微秒。它也列出了诚实的边界:SQLite 只有单写者,几十万行/秒的写入和每秒百万点级的时序场景应另选专业系统。适合想减少基础设施组件、重新评估依赖边界的后端与基础设施工程师。