Glean 拾遗
← 所有期号
#010 7/27–8/2 8 月 8 日发布

把魔术变成工程:Agent 的成人礼

这一期藏着一个共同的潜台词:Agent 正经历一场成人礼。Anthropic 用两周完成百万行代码迁移,OpenAI 工程师公开自己的 Codex 工作流,四 Agent 流水线与 token 成本工程相继落地——行业重心已从'模型有多聪明'转向'系统有多可靠',围绕概率模型搭建的 Harness、审查、护栏与安全工具,正取代炫技成为主战场。Google 把 AI 推进到症状问诊与天气预报,必须直面不确定性量化;Hassabis 则提议为前沿模型设立标准机构。与此同时,Kimi 与 Higgsfield 的密集宣发提醒我们:概念泡沫正与工程现实赛跑,而这份合辑,就是分辨二者的地图。

21 篇 4 章 约 5 小时
章节 01

概率的底色:模型不是程序

3 / 21
x.com · 12 min
01

LLM 如何在底层运作——从预测下一个词开始的新手拆解How LLMs Actually Work — A Beginner's Guide to Next-Word Prediction

本文用类比和概率分布图,把大语言模型拆解为“超大自动补全系统”。作者从 token 切分讲起,说明模型如何把文本切块并编号,进而解释预训练、有监督微调、人类反馈强化学习三阶段如何把原始统计机器打磨成助手。文章还剖析了“幻觉”的本质:不是 bug,而是模型只会生成符合概率分布、但未必符合事实的文本。最后给出实用 prompt 原则:提供丰富上下文、指定输出格式、迭代修改、重要信息必须验证。适合想理解 LLM 底层直觉、又想马上用好的非算法工程师。

x.com · 27 min
02

从GPT-2到KimiK3:七年规模增长22,580倍的架构演进全解析From GPT2 to Kimi3: A 22,580x Scale-Up with Architectural Evolution

本文以代码和架构图为线索,系统回顾了从GPT-2(2019)到KimiK3(2026)的七年LLM架构演进。核心论点:进步不只是规模扩大,更是状态管理与检索机制的不断创新。文章依次讲解了标准Transformer的KV缓存瓶颈、线性注意力以固定状态交换精确检索、DeltaNet通过delta规则实现精确擦写、Gated DeltaNet结合衰减机制、KDA/Kimi Linear引入细粒度通道级门控,最终KimiK3通过混合KDA与MLA层、MoE、SiTU激活、以及块级Attention Residual(AttnRes)实现深度残差选择。适合对LLM内核架构感兴趣的一线工程师。

x.com · 16 min
03

LLM护套工程为何如此困难——从测试到迭代的真实痛点Why Harness Engineering Is So Hard

本文基于作者五个月的实战经验(104次提交),深入剖析将LLM演示转化为可靠产品时遭遇的结构性困难。核心挑战包括:无法编写确定性测试(相同输入每次输出不同)、模型失败无声且呈渐变(99%正确中隐藏1%错误)、调试对象是自然语言段落而非代码(一个形容词可能成为bug)、添加规则反而陷入困境(prompt从20行膨胀到200行导致模型相互矛盾)、示例的引导力远强于指令、模型基础不稳定(供应商更新悄然改变行为)、反馈循环慢且昂贵以及护套工程工作不可见(外人以为只是写prompt)。文章强调护套工程(prompt、校验、eval、护栏)是真正的护城河,其难度源于概率系统的本质,无法工程化消除,只能构建能吸收这些不确定性的系统。适合LLM应用开发者、AI工程师及对AI工程痛点感兴趣的技术管理者阅读。

章节 02

从演示到生产线:Agent 工程的实战全景

10 / 21
x.com · 17 min
04

Agent 架构三层次:Harness、Loop 与 Graph 工程区分Agent Harness Engineering vs. Loop Engineering vs. Graph Engineering

本文清晰区分了构建 AI Agent 时的三种核心工程层:Agent Harness(模型外围的代码、配置与运行时)、Loop(重复的工作-反馈循环)和 Graph(显式的工作流拓扑)。作者指出,Harness 负责提供工具、状态、安全和可观测性;Loop 负责设计迭代验证与停止条件;Graph 负责控制节点顺序、分支与并行。三者不是替代关系,而是协同工作。文章还给出了常见失败模式(如先画图后理解工作、无限制重试)和诊断表格,帮助工程师根据症状选择正确的优化层次。适合需要将 Agent 从演示推向生产的团队阅读。

x.com · 5 min
05

个人 AI 基础设施构建指南A Guide to Building Personal AI Infrastructure

本文基于 Daniel Miessler 的 Personal AI Infrastructure (PAI) 框架,系统介绍了如何构建以用户为中心的个人 AI 数字助理。核心观点是:不要从工具开始,从自己开始。框架包含 TELOS 身份系统(10 个 Markdown 文件定义使命、目标、信念等)、三层记忆架构(热/温/冷记忆)、决策优先级链(目标 → 代码 → CLI → Prompt → Agent)、用户/系统分离目录设计以及事件钩子系统。文章强调架构比模型更重要,一个好的上下文管理系统搭配普通模型效果优于无上下文的顶级模型。适合希望搭建个性化、持续学习 AI 助理的工程师和知识工作者。

x.com · 15 min
06

Anthropic 用 Claude Code 实战百万行代码迁移:6 步流程与关键教训How Anthropic runs large-scale code migrations with Claude Code

Anthropic 工程师使用 Claude Code(Fable 5 和 Opus 4.8)在两周内将 Bun 从 Zig 迁移到 Rust,产出百万行代码,测试通过率 100%;另一名工程师周末将 Python 代码库转换为 16.5 万行 TypeScript。本文总结了六步迁移流程:创建规则手册与依赖映射→压力测试规则→并行翻译→编译→运行→行为匹配。核心思路是不直接修复代码,而是修复产生代码的循环。文章还讨论了何时值得迁移、AI 改变迁移经济学的四个原因(并行性、上下文明确、内置裁判、队列自生成),以及多个最佳实践(如使用小模型做实现、大模型做审查)。文中给出了具体 token 消耗和成本数据(Bun 迁移消耗约 59 亿输入 token 和 6.9 亿输出 token,约 16.5 万美元)。

x.com · 10 min
07

4 个 Agent 串成一条流水线,让你睡醒就能收功能How to build a 4-agent team that ships a feature while you sleep

作者用 Claude Code 的子代理(planner → coder → tester → reviewer)搭配 `.pipeline/` 共享目录做交接文件,把所有步骤串成一条 `/ship` 命令。Planner 用 Opus 写 spec,Coder 按 spec 实现并产 changes.md,Tester 只测不改码、失败就停,Reviewer 只读不写、给出 SHIP / NEEDS WORK / BLOCK 三种判决。全链路无人工干预,适合想在睡前启动、早上看结论的个人开发者。文中也提到了 Teamly 这个托管平台的内置编排能力,但主体是可复制的本地配置。

openai.com · 14 min
08

OpenAI 自家工程师怎么用 Codex:七个用例与六条工作流实践How OpenAI Engineers Use Codex: 7 Use Cases, 6 Workflow Practices

OpenAI 发布官方指南,介绍其安全、前端、API、基础设施等团队如何在日常开发中使用 Codex。文章覆盖七个场景:代码理解、重构迁移、性能优化、补测试、提速、保持专注、探索构思,并给出示例提示词。最具操作性的是六条最佳实践:大规模改动先从询问模式获取方案再切执行模式;维护 AGENTS.md 提供持续上下文;像写 GitHub Issue 一样组织提示(附文件路径、代码差异);把 Codex 任务队列当简易清单;用 Best of N 对比多份输出。文中引用了多位工程师的使用感言,如“用 Codex 替换全部旧版 getUserById() 并生成 PR”“夜间让 Codex 处理低覆盖模块,次日得到可运行单元测试 PR”。适合正在评估或已上手 Codex 的团队,也提供可直接复制的提示词模板。注意这是官方发布视角,缺少失败案例与量化收益数据。

x.com · 10 min
09

如何用 5 个工具 + 自定义 Hooks 把 Claude Code Token 消耗砍掉 90%+How 5 Tools + Custom Hooks Cut Claude Code Token Usage by 90%+

本文介绍一套五层工具与自定义 Hook 配合的分层 token 节省方案:用 CBM 知识图谱替代文件检索(可省 99% token),以 context-mode 管理大输出延长会话 6 倍,RTK 压缩 shell 输出,Headroom 在 API 边界再次压缩,Caveman 限制模型回复冗长度。整套方案通过 Pre/PostToolUse 等 Hook 实现强制执行,最终将代码探索 token 从 ~400K 降至 ~3.4K,会话时长从 30 分钟延至 3 小时以上。

code.claude.com · 9 min
10

Ultrareview:Claude Code 远程多 Agent 深度代码审查Ultrareview: Deep code review with remote sandbox agents

Ultrareview 是 Claude Code 提供的一项深度代码审查功能,启动一组远程 reviewer agent 在沙箱中并行审查当前分支或 Pull Request。与本地审查相比,Ultrareview 的每个发现都会独立复现验证,因此更聚焦真实缺陷而非风格建议;覆盖范围更广,能发现本地审查遗漏的问题;且完全在远端运行,不占用终端资源。文章详细介绍了使用方法:通过 /code-review ultra 命令启动,支持指定 base 分支、PR 编号、自然语言描述上下文;提供非交互式子命令 claude ultrareview 用于 CI 集成。定价方面,Pro/Max 用户有 3 次免费额度,之后每轮审查约 $5-$25 按量计费,审查时长约 5-10 分钟。限制包括 diff 大小上限(默认 500 文件/8000 行)、部分平台不可用等。适用于合并前需要更深入检测的场景。

github.com · 2 min
11

OpenAI 推出 AI 代码安全扫描 CLI/SDK,集检测、验证与修复于一体OpenAI's AI-Powered Code Security Scanner CLI and SDK

Codex Security 是 OpenAI 推出的命令行工具和 TypeScript SDK,利用大语言模型(如 GPT-5.6-terra)扫描代码中的安全漏洞,并通过验证流程过滤误报,同时提供修复建议。它支持多种模型配置与努力等级,可集成至 CI/CD 流程,并按需使用 ChatGPT 登录或 API Key 认证。适合在开发阶段或部署前自动检测安全风险,降低人工审计成本。

github.com · 46 min
12

为 AI 编码助手接管 Chrome 的官方 MCP 服务器Official MCP server giving coding agents live Chrome DevTools control

chrome-devtools-mcp 是 Chrome 团队官方发布的 MCP 服务器,让 Claude、Cursor、Gemini CLI 等编码 Agent 直接操控真实 Chrome 浏览器。它把 DevTools 能力封装成 50+ 个工具,覆盖输入自动化、导航、网络与性能分析、堆快照、控制台调试等,并通过 Puppeteer 自动等待操作结果。除默认启动独立浏览器外,还可连接正在运行的 Chrome 以复用登录与页面状态。适合做 Agent 浏览器自动化、前端调试或性能分析的一线工程师。

github.com · 6 min
13

Pi: 全能 AI Agent 工具包,统一 LLM 与编码代理 CLIPi: All-in-One AI Agent Toolkit with Unified LLM API and Coding Agent CLI

Pi 是一个开源 AI agent 工具包,提供统一的多提供商 LLM 接口(OpenAI、Anthropic、Google 等)、可扩展的 agent 运行时(工具调用、状态管理)、交互式编码代理 CLI 和终端 UI 库。它解决构建 AI agent 时组件碎片化与集成难题,核心理念是模块化 npm 包设计,支持容器化隔离与供应链安全加固。适合需要快速构建、部署或定制 AI agent 的工程师,尤其是编码代理场景。

章节 03

走出聊天窗:现实世界的验证与治理

3 / 21
research.google · 11 min
14

SymptomAI:Google大规模对照研究显示AI对话问诊准确率不逊于医生SymptomAI: Towards a conversational AI agent for everyday symptom assessment

Google Research 与 DeepMind 联合发布 SymptomAI,一个基于 Gemini Flash 2.0 的对话式症状评估代理。研究在 13,917 名美国参与者中开展随机对照试验,设计了五种提问策略(动态追问、固定规范问题、无引导基线),并与真实医生的诊断进行对比。主要发现:临床专家偏好 SymptomAI 生成的鉴别诊断(DDx)超过其他医生(>50% 情况);所有主动追问策略的 top-5 准确率均显著优于无引导基线;在医生低信心病例上 AI 提升最明显。此外,AI 诊断结果与 Fitbit 生物信号(心率、皮温、睡眠)变化趋势一致,尤其是在呼吸道感染病例中。该研究展示了对话式 AI 在真实世界症状评估中的潜力,但强调所有诊断均为研究用途,非临床诊断。

research.google · 11 min
15

用扩散模型高效生成天气预报集合:Google SEEDSGenerative AI to Quantify Uncertainty in Weather Forecasting

Google Research 在《科学进展》上发表了 SEEDS(可扩展集合包络扩散采样器),这是一种基于去噪扩散概率模型的生成式 AI 技术,用于高效生成天气预报集合。传统物理模型需在超级计算机上运行数小时才能产生 10-50 个集合成员,而 SEEDS 仅需 1-2 个初始预报作为条件,即可在 3 分钟内生成 256 个成员(TPUv3-32),成本极低。生成的集合在秩直方图、均方根误差和连续排位概率评分等指标上媲美甚至超越物理集合,尤其能更准确地捕捉 ±2σ 和 ±3σ 极端事件的尾部概率。实验表明,对于 2022 年欧洲热浪等罕见事件,SEEDS 的 16384 成员集合能够覆盖传统 31 成员集合完全漏报的极端状态。该方法为混合预报范式提供了新思路:将节省的计算资源用于提高物理模型分辨率或增加预报频次。适合关注 AI 在科学计算、气候风险分析、概率建模的工程师和研究者。

x.com · 9 min
16

Demis Hassabis:建立前沿AI标准机构以迎接AGI时代A Framework for Frontier AI and the Dawning of a New Age

DeepMind创始人德米斯·哈萨比斯发表长文,认为AGI(通用人工智能)可能将在几年内到来,其影响力将十倍于工业革命。为应对前沿AI带来的安全挑战,他提议美国建立一个类似FINRA(金融业监管局)的前沿AI标准机构,负责制定评估协议、测试模型能力(重点包括网络安全、生物威胁、agent欺骗等),并要求前沿模型在发布前30天提交测试。框架初期自愿,后期可强制执行。文章呼吁国际社会协同制定共享标准,以确保AGI安全、普惠地造福人类。

章节 04

当营销开始写教程:厂商叙事的甄别

5 / 21
www.kimi.com · 15 min
17

Vibe Coding 概念、案例与 Kimi 工具链全解析Vibe Coding Explained: Concepts, Examples, and Kimi's Tools

月之暗面在自家官网发布 Vibe Coding 入门指南,前半部分介绍概念、与传统开发的差异、五个自述案例,后半部分转为 Kimi Websites 与 Kimi Code 两款产品的教程:含 curl/PowerShell 安装命令、/init 与 /login 命令、示例提示词和三步流程。文章明确将 vibe coding 定义为「自然语言界面 + LLM 引擎 + 自动测试循环」的框架,并给出优缺点与安全提示。对想快速了解 Kimi 工具链的初级用户有参考价值;但全篇缺少可验证数据与第三方对比,属于产品导向内容,资深工程师可跳过前半部分直接看 CLI 用法。

www.kimi.com · 12 min
18

Agentic Coding 入门指南:从工作循环到 Kimi Code 的官方宣传Agentic Coding, Explained: A Beginner's Guide With a Kimi Code Pitch

本文是 Kimi 官方发布的入门指南,核心介绍 agentic coding 的定义与工作循环(计划-执行-观察-修正),并将其与 vibe coding 对比,强调前者面向多步骤、生产级任务,控制力更强。随后文章以较大篇幅推广自家的 Kimi Code 终端代理,给出安装与登录步骤,并列举一系列声称的优势,但全文没有 benchmark 数据、失败案例或独立评测,属典型产品引导内容。适合想了解概念但对深度不抱期望的读者;对一线工程师决策参考价值有限。

www.kimi.com · 11 min
19

AI 编程实用指南:四步工作流、工具矩阵与代码验收清单AI Programming: Workflows, Tool Types, and Review Checklist

本文以工程技术视角梳理 AI 编程的定义、工作流与工具分层:补全、助手、代理与审查工具各司其职;并给出跨文件一致性、交接上下文、可复用验证等收益。后半部分转向 Kimi Code 的宣传,介绍 Plan mode、Skills、Hooks、MCP、Swarm 等功能,并附一份接受生成代码前的四道验收清单(需求范围、仓库契合、独立证据、权限控制)。适合刚接触 AI 编程、想建立判断框架的开发者;注意内容有一半是产品宣传,真正可沉淀的是那个验收清单。

www.kimi.com · 15 min
20

Hermes Agent 上手:一条命令安装,可迁移 OpenClaw 配置Hermes Agent Guide: Install, Import OpenClaw, Run with Kimi

这篇 Hermes Agent 上手指南更像 Kimi 的转化型教程,而不是深度技术评测。文章覆盖安装、OpenClaw 配置迁移、模型供应商选择(默认 kimi-k2.6)、API Key 写入 .env,以及一个查看磁盘占用的示例任务。功能部分罗列了持久记忆、Skills、浏览器自动化、定时任务等,但全部停留在概述层面,没有实测数据、失败案例或架构细节。适合想 30 分钟内装一个本地 Agent 尝鲜的读者;若你想评估长期可维护性或对比同类工具,这篇提供不了证据。

x.com · 20 min
21

把 Claude、GPT、Grok 放进同一个聊天窗:Higgsfield Supercomputer 玩法清单Run Claude, GPT & Grok in One Window: Higgsfield Supercomputer Prompt Guide

这是一篇由 Higgsfield 赞助的操作指南,介绍其 Supercomputer 多模型聚合产品:在一个聊天窗口内同时调度 Claude、GPT、Gemini 与 Grok,按任务自动选择模型,并提供规划/研究/草稿免费、最终渲染计费的免费档。文中给出三种接入方式:网页、Claude 的 Connector(MCP https://mcp.higgsfield.ai/mcp)、以及 npm CLI(@higgsfield/cli),并附 18 条可直接复制的提示词模板,覆盖建站、CRM、UGC 视频、定时任务、多智能体 graph engineering 等场景。需要注意,全文没有任何模型路由的技术细节或基准数据,'只付最终输出'、'能自动选最优模型' 等说法均未得到验证,且文末明确标注为赞助内容。适合想快速收集多模型聚合类产品提示词模板的读者,不适合期望看到工程原理的人。