生产级电商 Agent 的工程解剖:单一 Agent + Skills,UI 组件工具化,安全交给 harness
Anthropic 总结过去一年与零售、旅行、电信等团队共建 Claude commerce agent 的实战,面向工程师和工程负责人给出生产级架构指南。核心立场是明确反对 intent router 与按 domain 拆 subagent:电商会话是多意图紧耦合的单一 session,每次 handoff 都会丢状态并增加 token 与延迟;单一主 agent 携带 skills 的实验比 one-prompt 与 subagent 设计在质量上更好,成本也更低。UI 输出不是让模型写文本或自定义 tag,而是把每个 UI 组件定义成 presentation tool,服务端校验后发事件渲染,历史消息可直接回放。性能部分给出三条杠杆(更少轮次、更快工具、更快 token)与 perceived latency 设计,并说明 prompt caching 按 global/session/volatile 三段前缀缓存,最好部署可达 90–99% 命中。生产部分强调:记忆用异步抽取写入自有库并分层读取;安全规则全部落在 harness 而非 prompt;eval 用可构造的 snapshots,每个正例配反例。附开源参考实现 anthropics/commerce-agents。