Glean 拾遗
日刊 · 时间线

每天拾几条。

2026-09-04 · 周五 3 条
← 09-03
日历 ▾
2026 · 09
MoTuWeThFrSaSu ·123456789101112131415161718192021222324252627282930
有日刊 今天
09-07 →
06:00

生产级电商 Agent 的工程解剖:单一 Agent + Skills,UI 组件工具化,安全交给 harness

Anatomy of Effective Commerce Agents: A Production Guide

Anthropic 总结过去一年与零售、旅行、电信等团队共建 Claude commerce agent 的实战,面向工程师和工程负责人给出生产级架构指南。核心立场是明确反对 intent router 与按 domain 拆 subagent:电商会话是多意图紧耦合的单一 session,每次 handoff 都会丢状态并增加 token 与延迟;单一主 agent 携带 skills 的实验比 one-prompt 与 subagent 设计在质量上更好,成本也更低。UI 输出不是让模型写文本或自定义 tag,而是把每个 UI 组件定义成 presentation tool,服务端校验后发事件渲染,历史消息可直接回放。性能部分给出三条杠杆(更少轮次、更快工具、更快 token)与 perceived latency 设计,并说明 prompt caching 按 global/session/volatile 三段前缀缓存,最好部署可达 90–99% 命中。生产部分强调:记忆用异步抽取写入自有库并分层读取;安全规则全部落在 harness 而非 prompt;eval 用可构造的 snapshots,每个正例配反例。附开源参考实现 anthropics/commerce-agents。

06:00

管理是新的 AI 超能力:写清目标,剩下交给 Agent

Management Is the AI Superpower: Know What to Ask For

作者在宾大 EMBA 课堂上做了一个实验:让几乎不会写代码的高管学生用 Claude Code 和 Google Antigravity,在四天内从零做出可演示的创业原型,并借助 ChatGPT、Claude、Gemini 完成市场分析、商业计划与财务模型。作者判断,这批学生的成果比 AI 出现前完整一学期的平均进度领先约一个数量级。他认为关键不在提示词技巧,而是“告诉 AI 你想要什么”的委托能力,并提出一个可计算的决策模型:比较人工基准耗时、AI 单次成功率与 AI 流程耗时(提问、等待、评估)。引用 OpenAI GDPval 的数据:专家平均 7 小时的任务,GPT-5.2 在 72% 的评审中打平或胜过人类;按“让 AI 先做、人工检查一小时、不行再自己做”的策略,平均能省约 3 小时。文中还建议把 PRD、五段式命令等既有管理文档直接改造成 agent 指令。适合想用 Agent 提效的团队负责人与领域专家阅读。

www.oneusefulthing.org · 13 min · Agents · AI · Management · Productivity
06:00

生成代码太容易,真正的成本是读懂它

Writing Code Is Easy. Reading It Isn't.

作者结合多年外包经验论证:软件开发的最大成本不是写出代码,而是把系统装进脑袋——即建立心智模型(mental model)。理解 getUserPreferences(userId) 这样的函数,往往要沿着数据库 schema、API 定义、缓存层、错误处理和调用点反复跳转;新代码和 AI 生成的代码都不免这一步。LLM 把生成成本压到极低,也把阅读负担推到更大的规模,甚至出现律师提交 ChatGPT 虚构判例这类事故——不是不愿读,是读太贵。文章因此建议:把 AI 用在解释既有代码、加快建模,而不是产生更多代码;团队效率也不该按生成行数衡量,而应按建立准确心智模型的速度衡量。适合以 AI 辅助编程却怀疑“产出量”指标的工程读者。

idiallo.com · 6 min · AI Engineering · Developer Tools · LLM · Software Engineering