Glean 拾遗
日刊 · 时间线

每天拾几条。

2026-07-27 · 周一 3 条
← 07-26
日历 ▾
2026 · 07
有日刊 今天
06:00

Ultrareview:Claude Code 远程多 Agent 深度代码审查

Ultrareview: Deep code review with remote sandbox agents

Ultrareview 是 Claude Code 提供的一项深度代码审查功能,启动一组远程 reviewer agent 在沙箱中并行审查当前分支或 Pull Request。与本地审查相比,Ultrareview 的每个发现都会独立复现验证,因此更聚焦真实缺陷而非风格建议;覆盖范围更广,能发现本地审查遗漏的问题;且完全在远端运行,不占用终端资源。文章详细介绍了使用方法:通过 /code-review ultra 命令启动,支持指定 base 分支、PR 编号、自然语言描述上下文;提供非交互式子命令 claude ultrareview 用于 CI 集成。定价方面,Pro/Max 用户有 3 次免费额度,之后每轮审查约 $5-$25 按量计费,审查时长约 5-10 分钟。限制包括 diff 大小上限(默认 500 文件/8000 行)、部分平台不可用等。适用于合并前需要更深入检测的场景。

code.claude.com · 9 min · Agents · Claude Code · Code Review · Developer Tools
06:00

LLM护套工程为何如此困难——从测试到迭代的真实痛点

Why Harness Engineering Is So Hard

本文基于作者五个月的实战经验(104次提交),深入剖析将LLM演示转化为可靠产品时遭遇的结构性困难。核心挑战包括:无法编写确定性测试(相同输入每次输出不同)、模型失败无声且呈渐变(99%正确中隐藏1%错误)、调试对象是自然语言段落而非代码(一个形容词可能成为bug)、添加规则反而陷入困境(prompt从20行膨胀到200行导致模型相互矛盾)、示例的引导力远强于指令、模型基础不稳定(供应商更新悄然改变行为)、反馈循环慢且昂贵以及护套工程工作不可见(外人以为只是写prompt)。文章强调护套工程(prompt、校验、eval、护栏)是真正的护城河,其难度源于概率系统的本质,无法工程化消除,只能构建能吸收这些不确定性的系统。适合LLM应用开发者、AI工程师及对AI工程痛点感兴趣的技术管理者阅读。

06:00

Agent 架构三层次:Harness、Loop 与 Graph 工程区分

Agent Harness Engineering vs. Loop Engineering vs. Graph Engineering

本文清晰区分了构建 AI Agent 时的三种核心工程层:Agent Harness(模型外围的代码、配置与运行时)、Loop(重复的工作-反馈循环)和 Graph(显式的工作流拓扑)。作者指出,Harness 负责提供工具、状态、安全和可观测性;Loop 负责设计迭代验证与停止条件;Graph 负责控制节点顺序、分支与并行。三者不是替代关系,而是协同工作。文章还给出了常见失败模式(如先画图后理解工作、无限制重试)和诊断表格,帮助工程师根据症状选择正确的优化层次。适合需要将 Agent 从演示推向生产的团队阅读。