Glean 拾遗
最近收录

24 条 · 按时间

09-09

额度十分钟跑光不是计量 bug:被遗忘的 agent 一天开了 1,555 个会话

作者发现 20x Claude Max 的 5 小时配额在十分钟内耗尽,一度怀疑 Anthropic 计量有 bug。翻遍本地日志后定位到真正原因:一个被遗忘的 YC 后台 coding agent 以并发 swarm 方式每天启动 1,555 个 Claude Code 会话,其中 91% 的消耗来自机器而非人工。文章同时澄清两个机制:/usage 展示的是滚动时间窗而非“当日额度”,以及每个新会话都要重建 prompt cache,成本约为命中缓存重读的 12 倍。作者随后把排查过程固化为开源 skill tare,纯本地解析日志并按 request id 去重——不去重会让 token 统计虚高约 86%——能回答“额度去哪了”并生成可脱敏导出的 HTML 报告。适合 Claude Code 深度用户,以及关心后台 agent 开销的工程团队。

www.kelviq.com · 8 min · Agent Engineering · Ai Tooling · Claude Code
08-17

同一模型换 Harness 成功率从 46.7% 升至 66.7%,缓存命中率 99.93% 的成本账

Composio 用同一模型 DeepSeek V4 Flash 对比 8 种 Agent Harness,在 30 项高难度任务中 Pi 通过 20 项(66.7%),Claude Code、Codex、Deep Agents 均只通过 16 项。成本差距更大:Pi 每成功任务仅 0.028 美元,约为 Claude Code 的七分之一。社区数据还显示,Pi 配合 DeepSeek 缓存命中率可达 99.93%,处理近 10 亿输入 Token 只花 2.65 美元,未命中则需约 132 美元。文章剖析了 DeepSeek 前缀缓存机制:匹配必须从第一个 Token 开始,因此 Harness 必须保持上下文前缀稳定。Reasonix 与 pi-deepseek-cache 为此采用冻结环境摘要、追加而非改写、独立会话分离执行/规划模型、确定性摘要哈希等手段,把输入成本降幅做到 98%~99%。适合关注 Agent 工具链选型与 LLM API 成本优化的工程师。

08-16

把 Claude Code 的每一分钱花在刀刃上:token、缓存与会话管理

Claude Code 的账单由 prefill 与 decode 两个阶段决定:输入 token 一次读完,输出 token 逐字生成,因此输出定价约为输入的 5 倍。prompt caching 自动开启,共享前缀从缓存读取只需 0.1x,但切换 /model、/effort、fast mode 或使用 /compact 都会破坏缓存,导致整个对话重新按全价 prefill。会话成本取决于进入上下文的 token 数量、它们存活的轮数以及并发运行的上下文数。文章给出大量可执行建议:用 @ 引用文件省掉 Read 调用、把常用命令的安静参数写进 CLAUDE.md、让超过 30,000 字符的命令输出落盘、用 /rewind 而非 /compact 裁剪错误分支、把噪音任务交给子代理并指定 haiku 模型。也明确缓存过期时间:订阅 1 小时,API key 5 分钟(可用 ENABLE_PROMPT_CACHING_1H=1 延长)。适合重度 Claude Code 用户控制成本与上下文。

claude.com · 13 min · Claude Code · Context Engineering · Cost Optimization
08-16

删掉不存在的箭头:从 1 条 prompt 到 100 个 agent 的图工程八步

这篇文章主张把 agent 工作流本身当作一个工程对象:在 prompt/context/harness/loop 之外,增加“图工程”层。作者的核心观察是,默认线性编排把“顺序”误当成“依赖”,大量箭头并不读上游输出,删除这些假依赖后才能真正并行;所谓 100 个 agent,不是 100 个角色,而是同一角色带各自的上下文窗口实例化 100 次。全篇给出八步方法,覆盖节点契约、四种拓扑、join 时机、分类器与路由表分离、验证节点、持久化状态,并给出“什么时候不该用图”的判断清单。作者坦诚并行广度是有代价的,引用了 Anthropic 多智能体研究的 token 消耗数据。适合正在把单 agent 原型演进为多 agent 生产系统的工程师;没有运行代码,结尾有课程引流。

x.com · 10 min · Agent Architecture · Agents · Context Engineering
08-13

Grok 4.6 与 DeepSeek V4 Pro 同日实测:准 Fable 级能力,价格打到底

作者以个人开发者视角,记录 DeepSeek V4 Pro 与 Grok 4.6 同夜发布后的选型变化。关键数据:DeepSeek V4 Pro 百万输出 Token 0.87 美元,约为 Claude Fable 5 的 1/57,Terminal Bench 2.1 得分 87.9(Fable 5 为 88.0),DeepSWE 从预览版 12.8 升至 62.7;Grok 4.6 输入/输出定价 2/6 美元每百万 Token,作者实测连续开发 4 小时仅消耗 SuperGrok Heavy 周额度 2%。作者同时承认不可能三角未完全打破:DeepSeek 仍缺多模态且速度一般,Grok 在纯开发与 Agent 场景逊于 Fable 5。适合关注大模型选型、成本优化与开发速度的 AI 工程师。

08-10

模型选型五问:开源与闭源、Token 成本、延迟、上下文窗口怎么权衡

选 LLM 看起来是单次决定,实则要随新模型和产品演化反复重做。本文把选型拆成五个问题:开源还是闭源、成本、延迟、性能、上下文窗口。开源模型需要自行托管或走 API 供应商(Hugging Face、Groq),闭源模型由模型厂商托管,按 token 计费,价格战愈演愈烈。延迟的测量要看 TTFT 和 TPOT;性能先参考公开榜单(Chatbot Arena、Open LLM Leaderboard),但榜单存在过拟合风险,真正的验证只能在应用内用自建 evals 进行。推理模型(如 o1)在编程和数学上更强,但要付出更高的 token 成本和更长响应时间。上下文窗口同时计入输入与输出 token,RAG 中的 chunking 等模式就是在有限的窗口里塞进更多信息。适合刚开始做模型选型的 AI 应用开发者。

www.aihero.dev · 8 min · AI Engineering · Context Engineering · Cost Optimization
08-08

按需拉起 Linux:Cloudflare Computer 把 Agent 沙箱月成本从 $36.83 降到 $7.53

常规做法为每个 AI agent 常驻完整容器,但 agent 大量时间只是读文件、搜代码或等模型响应。Cloudflare Computer 改变分工:项目状态存于 Workspace Durable Object 的 SQLite VFS,日常读、搜索、小编辑在 Worker isolate 中通过 workspace.fs 和 just-bash 完成,只有 npm install、构建等真正需要 Linux 的操作才按需拉起容器;执行后通过 post-command pull 把变更同步回持久层。文章给出成本模型:容器占空比从 100% 降到 10%,月成本约从 $36.83 降至 $7.53(降 79.6%),且强调成功条件是 exitCode 与 sync.status 双通过,node_modules 默认不持久化。适合构建 coding agent、沙箱与持久工作区的工程师。

08-03

GitHub 实录:给 Agentic CI 减负,用 CLI 替代 MCP 调用把 token 花销降 62%

GitHub 在自家仓库的上百个 Agentic Workflows 上引入 API 代理,统一记录每次 API 调用的 token 用量并输出 token-usage.jsonl,再用两个自动化 agent(Daily Token Usage Auditor 与 Daily Token Optimizer)审计和修复浪费。主要优化:裁剪未使用的 MCP 工具注册、用 GitHub CLI 的确定性 HTTP 请求替代 LLM 推理循环内的数据抓取、以及把固定数据读取放到 agent 启动前。为跨模型比较成本,文章提出 Effective Tokens 指标:ET = m×(1.0×I + 0.1×C + 4.0×O),输出 token 权重 4,缓存读取权重 0.1,Haiku/Sonnet/Opus 倍率分别为 0.25/1.0/5.0。12 个生产工作流中 9 个接收了优化建议;Auto-Triage Issues 在 109 次运行中降 62%,Security Guard 与 Smoke Claude 分别降 43% 与 59%。Contribution Check 却上涨 5%,原因是大 PR 占比从 39% 升到 65%,说明活仓库上的评估会被工作量漂移干扰。文章还记录了一条 bash allowlist 误配置引发 64 轮回退循环的案例。适合所有在 CI 里跑 agent 并按 token 付费的工程团队。

github.blog · 18 min · Agent Engineering · CLI · Cost Optimization
07-25

Claude Opus 5 发布:接近 Fable 5 性能,成本减半

Anthropic 发布 Claude Opus 5,性能接近最强模型 Fable 5 但价格减半。在编码(Frontier-Bench v0.1 超越所有模型,性能是 Opus 4.8 的两倍以上)和知识工作(ARC-AGI 3 得分是次优模型的 3 倍)上达到新 SOTA,但网络安全任务仍落后于 Mythos 5。模型支持 effortless 设置以平衡成本与智能,客户反馈在软件开发、金融、法律等领域表现显著提升。安全对齐更好,但故意未训练网络攻击能力,且安全拦截比 Fable 5 减少约 85%。定价与 Opus 4.8 相同,提供 Fast 模式。

www.anthropic.com · 20 min · AI Engineering · Anthropic · Cost Optimization
07-20

2026年前沿模型选型实操指南:Kimi K3、Claude Fable 5、GPT-5.6 按任务分派

截至2026年7月,没有任何单一模型在所有任务上最优。Kimi K3(2.8T参数)在前端UI和图像理解上以6/7领域领先,价格仅Fable 5的1/12;Claude Fable 5在SWE-Bench Pro达80.3%,适合后端复杂架构和长周期自主Agent工作,但最贵;GPT-5.6 Sol在调试上出色,但有游戏模糊目标的倾向,需明确定义成功标准。文章提供了按任务类型路由的决策框架,并强调路由技能比选定单一模型更重要。同时讨论了成本计算、合规性和供应商锁定风险。适合AI工程师、产品构建者。

x.com · 25 min · Agent Engineering · AI · Cost Optimization
07-17

让 Fable 自行判断:节省 Claude Code token 的实战技巧

Simon Willison 分享了从 Claude Code 团队获得的实用建议:不要命令 Fable 何时编写测试,而是让它自行判断;同样,将编码任务委托给更低成本的子模型(Sonnet、Haiku),由 Fable 决定何时降级。在 Claude Code 即将涨价之际,这一技巧尤为实用。他展示了通过记忆文件配置,让主模型在处理每个编码任务时自主选择合适模型并派生子代理。实测表明,这能在保持开发效率的同时显著降低 Fable token 消耗。文章适合所有使用 Claude Code 并关注成本控制的开发者。

simonwillison.net · 2 min · Agent Engineering · Ai Tooling · Claude Code
07-12

Anthropic 的信任危机:封闭生态、涨价与工程师的觉醒

本文作者以亲身经历痛陈 Anthropic 近年来的系列争议做法:API 不稳定却垄断订阅渠道、Claude Code 生态封闭且 bug 堆积、通过“额外用量”和分池计费变相涨价。作者指出,这些做法并非为改善产品,而是为下一轮模型训练筹集资金。作者回归“agent-assisted”而非“agent-driven”的工作流,并用 OpenRouter 搭配 Qwen、GLM 等开源模型替代 Claude,同时通过 AI Gateway 控制成本与数据安全。适合受困于单一 AI 平台、寻求更开放替代方案的一线工程师。

raheeljunaid.com · 11 min · Agent Engineering · Anthropic · Claude Code
07-04

Superpowers 6:用自动化研究循环将构建成本降低60%

Superpowers 6 发布,核心改进来自一次自动化研究(autoresearch)实验:作者利用 Anthropic 的 Fable 模型(短暂可用期间)对自身的 Subagent Driven Development 流程进行了系统优化。在 36 小时内、花费约 165 美元 token 运行了 25 次实验,最终实现 wall-clock 速度提升 50%、token 消耗降低 60%。关键优化包括:合并合规审查与代码审查 agent、预生成 review packet 减少 git 调用、根据任务类型动态分配 agent 层级(如对非代码方案使用低成本 haiku)。文中披露了多个已证伪的假设(如限制 controller 思考时长适得其反),并强调 eval 套件在差异化测量中的关键作用。适合关注 AI 编码 agent 成本优化和 engineering productivity 的读者。

blog.fsck.com · 8 min · Agent Engineering · AI Engineering · Anthropic
07-03

Claude Opus 4.8 配置指南:投入产出比的精确控制

作者在 Claude Opus 4.8 发布次日撰写了这份配置指南,重点不在模型本身的基准提升(SWE-bench 从 87.6% 到 88.6%),而是伴随发布的三项操作特性:Effort Control 允许按任务设置思考深度(Low/Medium/High/Max/Ultracode),Fast Mode 以原先 1/3 的价格提供 2.5 倍速度,Dynamic Workflows 支持单次会话并行调用最多 1000 个子 agent。文章给出了一个完整的成本优化矩阵,按任务类型将请求路由到 Haiku、Sonnet、Opus 及不同 effort 等级,宣称可将重度用户的月成本从 $400-600 降至约 $205。文末提供了可直接复制使用的环境变量和 settings.json 配置,内容偏向实用操作手册,适合已在使用 Claude Code 并希望控制成本的开发者。

x.com · 9 min · Agents · Ai Tooling · Claude Code
07-01

微代理:在模型API层内协作,超越前沿模型

vLLM Semantic Router 提出了一个不同寻常的视角:路由器不只是请求分发器,更是模型能力的放大器。其核心思想是将多个模型的协作封装在同一个模型 API 调用内,用户看到的仍然是一个普通模型端点(vllm-sr/auto),但背后路由器可以根据任务自动选择协作模式——从成本感知的串行升级(Confidence)、并行聚合(Ratings),到多轮推理合成(ReMoM)、分歧发现(Fusion),乃至带资源预算的微代理工作流(Workflows)。这些模式都是可控、可配、可观测的运行时,而非应用层胶水代码。评测显示,在 LiveCodeBench、GPQA-Diamond、Humanity's Last Exam 三个硬基准上,这套闭源模型协作方案(VSR Closed)分别达到 92.6%、96.0%、50.0%,持平或超过了 Fugu Ultra、GPT-5.5 等单一前沿模型。这篇博文的价值在于,它首次把“多模型协作”从产品端或应用端下沉到了 serving 基础设施层,并且坚持以一个模型身份暴露,极大降低了接入成本。适合正在构建推理路由、多模型策略或成本优化方案的工程师阅读。

vllm.ai · 14 min · AI Engineering · Cost Optimization · LLM
06-27

AI 重塑软件生命周期:从编写代码到评判代码的转变

这篇由 Google 工程师撰写的白皮书提炼,核心观点是:AI Agent 的真正价值不在于模型本身,而在于其“载体”(Harness)——即指令、工具、沙箱、编排逻辑和可观测性组成的系统,模型约占 10%,载体占 90%。上下文工程是决定成本的关键,需要区分静态上下文(每次加载,昂贵但可靠)和动态上下文(按需加载,便宜但需谨慎设计)。验证能力是区分“Vibe Coding”和真正的工程化 Agent 的分界线:测试覆盖确定性部分,评估覆盖非确定性输出和轨迹。白皮书提供了具体数据:仅修改载体(不换模型)即可将编码 Agent 在 Terminal Bench 2.0 上从 30 名外提升至前 5;LangChain 的实验中通过修改系统提示、工具和中间件在相同基准上提升了 13.7 分。适用于所有正在或准备将 AI Agent 引入研发流程的工程师和技术管理者。

addyosmani.com · 15 min · Agent Architecture · AI Engineering · Context Engineering
06-24

一个工程师月提259个PR:循环工程实战指南

本文详细拆解了AI驱动开发循环(Loop)的工程实践,作者通过真实案例(单工程师月提259个PR vs 循环失控烧掉$47,000)引出核心矛盾:构建高效自动化的同时必须配备可靠的制动机制。文章将循环分解为状态文件、自动化触发/调度的具体命令、Git 工作树隔离、技能配置、MCP 连接器、子代理分离等6个可操作部件,并给出了每个部件的配置示例(Claude Code 和 OpenAI Codex 双版本)。同时提供了刹车配置模板(最大步数、预算上限、作用域、断路器)、四种常见失败模式及低成本入门方案。适合正在构建或评估AI代理工作流的工程师阅读。

x.com · 12 min · Agent Engineering · Ai Tooling · Claude Code
06-24

Agent 循环最难的部分:定义停止条件

本文为产品经理解析 agent loop 的核心概念。作者区分了 routine(固定步骤)、workflow(条件分支)和真正的 loop(重复检查直至满足条件)。他强调,loop 的关键不在于循环本身,而在于停止条件——即明确“完成”的可验证定义,并配以客观检查或独立评判者。文中提供了构建 loop 的模板、停止条件的编写方法,以及成本控制建议(如追踪“每接受变更的成本”)。作者还总结了 loop 常见的失败模式:无迭代上限导致费用失控、上下文漂移、通过不等于正确。最后指出,loop 工程只是最新术语,本质仍是“意图工程”——精准定义目标、边界和完成标准的能力。

06-24

Agent 循环最难的部分:定义停止条件

本文为产品经理解析 agent loop 的核心概念。作者区分了 routine(固定步骤)、workflow(条件分支)和真正的 loop(重复检查直至满足条件)。他强调,loop 的关键不在于循环本身,而在于停止条件——即明确“完成”的可验证定义,并配以客观检查或独立评判者。文中提供了构建 loop 的模板、停止条件的编写方法,以及成本控制建议(如追踪“每接受变更的成本”)。作者还总结了 loop 常见的失败模式:无迭代上限导致费用失控、上下文漂移、通过不等于正确。最后指出,loop 工程只是最新术语,本质仍是“意图工程”——精准定义目标、边界和完成标准的能力。

06-23

旧软件跑得飞快,因为它别无选择

这篇文章反思了现代软件为什么在硬件飞速进步的时代反而变得臃肿缓慢。作者以 Java 组件启动 Spark 集群为例指出,工程师习惯性地给内存和 CPU 加上“以防万一”的缓冲,而这些临时补丁很快固化成了默认配置。JVM 会读取容器分配的空闲空间自动扩大堆大小,GC 也随之变得懒惰,资源就这样被浪费掉了。作者认为,硬件变得便宜且容易预配,让“加机器”成了解决问题的默认动作,但真正的问题在于——我们不再追问“这笔开销到底买了什么”。文章提出“资源预算”的思路:为每个组件设定明确的内存、启动时间、容器大小上限,一旦超限就必须解释具体换了什么、换来什么。核心不是让大家穷着过日子,而是让每个 trade-off 显式化,告别“迷信式分配”。推荐给所有在云上跑服务的后端工程师、SRE 和平台工程团队。

yusufaytas.com · 9 min · Cloud Native · Cost Optimization · Java
06-20

别再为你的 AI Agent 建造富士康工厂了

本文是 Garry Tan 对自己构建 54 万行 Rails 代码的深刻反思。他用富士康工厂比喻当前 AI Agent 开发的主流模式:用海量代码、测试和重试逻辑去过度束缚和控制一个本已高度智能的模型。他提出核心论点:模型调用成本急剧下降,智能程度大幅提升,旧的经济学已经反转。新的范式是“即时软件”和“技能包”,用精简的 markdown 指令和少量 TypeScript 代码替代厚重的工程框架,让 Agent 在自由中发挥最大价值。文章提供了具体案例——一个黑客松评审 Agent 如何在一个下午内用极少的代码完成了从前需要整个软件项目才能实现的功能。文章适合那些正在用 AI 编程但仍在沿用传统软件工程量度(代码行数)和架构思维的工程师阅读,它挑战了根深蒂固的“不信任模型”的本能,并指明了“代币最大最优”的先发优势。

x.com · 14 min · Agents · Ai Tooling · Code
06-16

AI 代理上下文压缩层:60%-95% Token 削减,不丢失关键信息

Headroom 是一个本地运行的 AI 代理上下文压缩工具,旨在显著降低 LLM 使用成本与延迟。它在工具输出、日志、RAG 数据块及对话历史到达大模型前进行智能压缩,支持 JSON、代码和自然语言等多类内容。项目提供库、代理、MCP 服务器和代理包装器四种集成模式,通过内容路由选择最优压缩算法,并具备可逆压缩(CCR)机制确保原始数据不被丢弃。它还包含跨代理记忆共享和从失败会话中学习的 `headroom learn` 命令,适合每天高强度使用编程代理的工程师和任何需要优化 LLM Token 消耗的系统。

github.com · 18 min · Agent Architecture · Ai-Memory · Context Engineering
06-09

设计一个自行驱动 Agent 的多步任务循环

本文提出了一个让 AI Agent 自主完成多步任务的循环架构,核心在于用代码构建一个自动化的提示生成系统,而非手动编写单个提示。文章详细拆解了该循环的五个组成部分:定义验收标准(done check)、从状态构建上下文而非每次手写指令、执行操作并捕获所有输出、将失败结果作为反馈闭合到下一轮提示中,以及设置硬性停止条件(最大轮次、成本上限)。作者通过一个修复登录Bug的实例展示了循环如何运行,并指出实际开销来自多轮调用,而非单次代码生成,因此止损条件至关重要。此外,将反复出现的操作封装为可复用技能是提升长期价值的关键,而初学者常犯的错误包括缺乏退出条件、手动干预提示和丢弃失败输出。适合希望从单次提示工程转向构建Agent控制流的开发者阅读。

x.com · 18 min · Agent Architecture · Agents · AI Engineering
06-07

2026年6月第一周AI快讯:Claude限额翻倍、SpaceX IPO、微软模型数据翻车

本文汇总了6月第一周10条AI与科技行业动态。MiniMax M3大模型发布,以0.6美元/百万token的价格在编程跑分上超越GPT-5.5,但独立验证尚未出炉。DeepSeek完成约74亿美元首轮外部融资,宇树科技以73天闪电过会。Kimi Work、Coze 3.0与Qwen3.7-Plus在同一周发力Agent领域。豆包宣布收费,基础版永久免费。ChatGPT月活突破10亿,Codex推出Sites和岗位插件。Anthropic将Claude Cowork限额翻倍,并发布了Claude已撰写自家80%代码的报告,同时秘密提交IPO。英伟达在Computex 2026发布集成ARM CPU的RTX Spark超级芯片。SpaceX定于6月12日上市,谷歌披露了一份9.2亿美元/月的算力租用合同。微软自研推理模型MAI-Thinking-1发布仅3天,其声称的“干净数据”便被发现包含242亿页Common Crawl数据,同时GitHub Copilot转为按量计费后,部分开发者月账单飙升至3000美元。文章是典型的行业信息简报,适合需要快速了解一周重大技术动态的工程师和从业者。

mp.weixin.qq.com · 7 min · AI Engineering · AI Industry · Cost Optimization