Glean 拾遗
← 所有期号
#012 最新 8/10–8/16 8 月 16 日发布

从感觉到系统:AI 工程的价值转移

本周的十五篇选文指向同一条主线:AI 工程正从“看效果”走向“建系统”。一边是方法论的重申——用 eval、数据飞轮与统计思维驯服概率模型,把“感觉还行”变成可量化的成功标准;另一边是基础设施的猛进——Cloudflare OS 与 DeepSeek Harness 都在重新定义 Agent 的运行环境,让每个应用成为可被 AI 修改的私有沙箱。与此同时,多款模型的同日发布与激进定价,让模型选型从一次性决策变成常态化的成本与能力权衡。把这些放在一起,能读出正在成形的共识:模型能力只是入场券,围绕不确定性建造的评测、权限与架构,才是下一代工程师真正的护城河。

15 篇 4 章 约 3 小时
章节 01

重新定义工程:AI 工程师的认知与技能地基

4 / 15
www.aihero.dev · 4 min
01

AI 工程师≠提示词工程师:一份面向 Web 开发者的入门路线图What Is an AI Engineer?

本文是一篇 AI 工程师的角色入门导读,基于 Latent Space 的《The Rise of the AI Engineer》展开。核心论点是用 API 边界区分 AI 工程师与 ML 工程师:前者调用模型构建应用,后者构建模型服务本身。文章明确 AI 工程师不需要线性代数或从零训练模型,但需要扎实的软件工程基础、评测体系与反馈回路设计;它同时澄清 AI 工程师与使用 Copilot/Cursor 的 AI 辅助开发者的区别,并认为 Web 开发者的交付导向习惯可直接迁移。文中还插入了 AI Hero 技能包的推广块,内容整体偏定义介绍而非实操细节。

www.aihero.dev · 5 min
02

LLM 扫盲:参数、采样与 200 万美元的训练成本What Is an LLM? Parameters, Sampling, and Training Costs

本文是一篇面向初学者的 LLM 概览,将大模型比作一份用 16-bit 浮点数编码的压缩文件,参数就是模型的“大脑”。文章依次介绍推理(inference)、采样策略(greedy、top-k、top-p、temperature)、tokenization,以及 pre-training 与 post-training 两阶段的训练流程,并给出粗略成本量级:约 10TB 文本、6,000 块 GPU 跑 12 天、花费约 200 万美元,产出 140GB 权重文件。结尾引用 Karpathy 的 LLM 入门视频与 Anthropic 的可解释性研究。内容刻意保持浅显,对熟悉 LLM 的一线工程师几乎没有新信息,适合刚入门的读者建立基本直觉。

www.aihero.dev · 6 min
03

AI 工程师心态:接受概率,用可量化标准替代“感觉”From Vibes to Data-Driven Development: The AI Engineer Mindset

文章指出,构建 LLM 应用需要从确定性系统思维转向概率性系统思维:输入与输出不再一一对应,用户可能以难以预料的方式使用系统。作者用“Vibes-Only Trough”描述 demo 阶段看似可用、但缺乏真实数据支撑的状态,并主张通过“数据驱动斜坡”逐步建立评测体系。核心方法是先定义可量化的成功标准,例如情感分类系统要求 92% 的人工标注一致率、95% 的请求在 500ms 内完成、高置信度预测与人类判断匹配率达到 90%。随后要从每个用户交互中收集数据,从简单的点赞/点踩按钮开始,逐步构建更复杂的数据管道。作者坦言第一版产品通常不会好,因为数据不足,波动是概率系统的固有属性,关键是系统化追踪每次迭代。适合正在把 LLM demo 推向生产的工程师,以及需要建立评测文化的团队。

x.com · 6 min
04

AI 工程技能图谱:从 1 万条招聘数据提炼的四大核心技能The AI Engineering Skills Map

Andrew Ng 团队基于 1 万多条招聘信息、数十次专家访谈与问卷调查,发布 AI 工程技能图谱,将开发者应掌握的能力归纳为四项:构建与部署 AI 应用、软件工程基础、高效使用编码 agent、以及参与定义需求(shaping the build)。文章指出,AI 应用输出不可预测,因此需要借助统计方法与系统化的 eval 和错误分析来加以约束;软件工程知识决定了你能否用好编码 agent,而 agent 能力增强后,工程师的价值正从实现转向定义 spec 与做出成本、扩展性、安全之间的权衡。适用于想规划学习路径的开发者,以及希望以更准确标准招聘 AI 工程师的团队。

章节 02

驯服概率:边界、评测与优化阶梯

3 / 15
www.aihero.dev · 8 min
05

LLM 能做什么:四个用途与一条确定性原则What Can You Use LLMs For? Four Use Cases and a Rule of Thumb

本文是一篇 LLM 工具选型指南。作者梳理了 LLM 目前的四个真实用途:把非结构化数据转成结构化表格、打标签与分类、问答、以及 Agent 化操作。他特别强调不要一上来就做“套壳聊天机器人”,因为护栏永远有漏洞,并举了 Gemini 被越狱要求用户“please die”的例子。文章的核心论断是:只要能确定性实现,就该用确定性系统;LLM 只适合两类任务——雇人做太贵(数据清洗、分类)或确定性系统搞不定(问答、生成、Agent)。适合正在决定哪些模块该上 LLM 的工程师阅读。

www.aihero.dev · 9 min
06

AI 应用的质量上限,取决于你的 EvalsYour App Is Only As Good As Its Evals

在 LLM 应用中,输入与输出不再有确定性映射,任何小改动都可能改变全局行为。本文提出 Evals 是 AI 工程师的单元测试,也是从概率系统中压出可预测性的核心工具。文章拆解了三种评测方式:可写成断言的确定性 Eval、成本高但必要的人工评估,以及用另一个 LLM 打分的 LLM-as-a-Judge,并建议分层运行以控制成本。随后介绍数据飞轮:把用户的负反馈转成新的 eval 用例,形成持续改进循环。工具层面对比了云端平台 Braintrust 与作者维护的本地运行库 Evalite(基于 Vitest)。适合正在把 LLM 原型推向生产的工程师,用于建立可量化的质量反馈体系。

www.aihero.dev · 23 min
07

从改提示词到微调:一条按成本排序的 LLM 应用优化阶梯17 Techniques for Improving Your LLM-Powered App

本文给出提升 LLM 应用性能的 17 种手段,并特意按实施成本从低到高排列成“复杂度地狱阶梯”:先改提示词、加角色设定、用 XML 标签和结构化输出,再尝试思维链、多示例、温度调节与工具调用;只有这些简单手段用尽后,才考虑 RAG、切块、智能体循环、并行调用、评估-优化器、路由器和微调。作者强调改善系统的本质是“先改进评估,再改进系统”,并给出可验证的 trade-off:CoT 以延迟换质量,智能体循环更灵活但每步决策更慢,路由器能绕过单模型约 30 个工具的限制但增加一次串行调用。适合正在做 LLM 应用迭代、需要一份按成本排序的优化清单的一线工程师。

章节 03

模型竞技场:选型框架与本周价格战

4 / 15
www.aihero.dev · 8 min
08

模型选型五问:开源与闭源、Token 成本、延迟、上下文窗口怎么权衡5 Questions to Ask Before Choosing an LLM

选 LLM 看起来是单次决定,实则要随新模型和产品演化反复重做。本文把选型拆成五个问题:开源还是闭源、成本、延迟、性能、上下文窗口。开源模型需要自行托管或走 API 供应商(Hugging Face、Groq),闭源模型由模型厂商托管,按 token 计费,价格战愈演愈烈。延迟的测量要看 TTFT 和 TPOT;性能先参考公开榜单(Chatbot Arena、Open LLM Leaderboard),但榜单存在过拟合风险,真正的验证只能在应用内用自建 evals 进行。推理模型(如 o1)在编程和数学上更强,但要付出更高的 token 成本和更长响应时间。上下文窗口同时计入输入与输出 token,RAG 中的 chunking 等模式就是在有限的窗口里塞进更多信息。适合刚开始做模型选型的 AI 应用开发者。

x.com · 6 min
09

Grok 4.6 与 DeepSeek V4 Pro 同日实测:准 Fable 级能力,价格打到底Grok 4.6 and DeepSeek V4 Pro: near-Fable power, far lower price

作者以个人开发者视角,记录 DeepSeek V4 Pro 与 Grok 4.6 同夜发布后的选型变化。关键数据:DeepSeek V4 Pro 百万输出 Token 0.87 美元,约为 Claude Fable 5 的 1/57,Terminal Bench 2.1 得分 87.9(Fable 5 为 88.0),DeepSWE 从预览版 12.8 升至 62.7;Grok 4.6 输入/输出定价 2/6 美元每百万 Token,作者实测连续开发 4 小时仅消耗 SuperGrok Heavy 周额度 2%。作者同时承认不可能三角未完全打破:DeepSeek 仍缺多模态且速度一般,Grok 在纯开发与 Agent 场景逊于 Fable 5。适合关注大模型选型、成本优化与开发速度的 AI 工程师。

x.com · 10 min
10

Grok 4.6 使用指南:短提示词加验证循环胜过冗长规格Grok 4.6 Field Guide: Verification Loops Beat Long Prompts

作者以 Grok 4.6 作为主力模型使用数周,覆盖编码与知识工作,并用同一提示词与 4.5 做对照。核心发现:短提示词配合明确偏好,效果接近两页纸的详细规格;真正拉高结果的是追加一句“实现后验证并迭代到生产可用”,让模型打开应用、点击真实路径、修正嵌套公式。4.6 在浏览器自动化、视觉 QA、收件箱清理、Excalidraw 改造等任务上表现稳定,但 3D 与视频仍需人工检查,因为模型无法通过截图验证时间维度的正确性。作者疑似 xAI 成员,文章带有发布推广口吻,但方法论与提示词例子有参考价值,适合用 Cursor 等 AI 编码工具的工程师。

z.ai · 22 min
11

GLM-5.3:只靠后训练扩展,代码与网络攻防能力同步提升GLM-5.3: Post-Training Scaling Boosts Coding and Cyber

Z.ai 发布 GLM-5.3,强调与 GLM-5.2 共用同一个 base model,所有提升都来自 post-training 扩展:持续扩大长程任务环境,并用流水线合成可执行、可验证的环境与 reward,训练栈沿用 IndexShare、SAO 和 slime。代码与 agent 能力在公开榜单上普遍上升,例如 Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 升到 66.9。文章最值得注意的是“涌现式网络攻防能力”:ExploitBench 从 24.4 翻倍到 54.4;真实代码库评估中,在 269 个项目里发现 2436 个漏洞,最老的可追溯到 1981 年,Z.ai 为此建立了公开披露台账。工程侧,slime 通过本地缓存、训练-rollout logprob 对齐(1e-7)和负载感知调度,把长程 coding RL 的端到端吞吐提升 2.3×。API 上 thinking 不能再关闭,迁移需改用 reasoning_effort;权重将在安全加固完成两周后开源。适合关注 RL 后训练、agent 评测和 AI 安全披露的工程师阅读,注意所有跑分均为厂商自报。

章节 04

Agent 基础设施的新形态:从术语到工作台

4 / 15
www.aihero.dev · 10 min
12

AI 编程词典:为 Agent 工程术语建立共识AI Coding Dictionary: A Vocabulary for Agent Engineering

AI Hero 发布的一份 AI 编程术语词典,把 Agent 工程中的常见概念压缩成短条目:从 Token、Next-token prediction、Context window 到 Handoff、Compaction、MCP。词典的价值不在逐条定义“是什么”,而在给出可操作的区分:parametric knowledge 与 contextual knowledge 决定模型能知道什么;attention budget 随上下文变长而被摊薄,会话会从 smart zone 滑向 dumb zone;Spec、Ticket、Handoff artifact 构成跨会话工作的交接机制;AGENTS.md 是项目写给 Agent 的 standing brief。适合正在使用 Claude Code、Cursor 或自建 Agent 系统、需要统一术语表的工程师阅读。

github.com · 23 min
13

企业级 AI 工作台:每个应用都是可让 AI 改代码的私有沙箱Cloudflare OS: an AI workspace with per-user sandboxed apps

Cloudflare OS 是 Cloudflare 内部自用、现已开源的企业级 AI 生产力环境,定位是“公司操作系统”兼“AI 工作负载操作系统”。它不是传统 OS,而是一套把办公套件、应用开发与安全管控统一起来的平台:每个文档或工具都是一个由 AI 生成、独立沙箱运行的“Gadget”应用,用户可随时让内置 agent 修改代码;外部服务访问由“Gatekeeper”按能力安全模型逐项授权并审计,还支持把需要人工确认的操作推迟到之后批量审批。整套系统运行在 Cloudflare Workers / workerd 之上,深度使用 Durable Objects、Dynamic Workers 和 Facets,并默认具备实时多人协同。适合关注 AI 智能体基础设施、边缘计算平台与 AI 编程工具的工程师阅读或二次开发。

blog.cloudflare.com · 16 min
14

Cloudflare OS:让每个员工拥有带权限治理的 Agent 工作台,开源可自部署Cloudflare OS: an open source agent workspace with capability-based governance

Cloudflare 开源其内部 AI 工作平台 Cloudflare OS,目标是把 Agent 从程序员扩展给全体成员。核心不是又一个聊天工具,而是一个绑定公司上下文与系统的工作区:Agent 默认零权限,通过 typed binding 拿到受限资源;Gatekeeper 作为外部服务与 Agent 之间的代理,持有凭证、执行策略并记录每次读取。当 Agent 把敏感数据做成仪表盘再共享时,平台会依据观察日志复核查看者权限,防止旁路泄露。应用即 Worker,每个应用拥有自己的 SQLite 状态,Agent 也能调用用户构建的方法。所有模型调用经 AI Gateway 统一控管。适合关注 Agent 基础设施、权限治理与内部工具平台工程的人阅读。

x.com · 7 min
15

DeepSeek Harness 速通:一切皆插件,Agent 在运行中插拔自己DeepSeek Harness: Everything Is a Plugin on the Cordis Kernel

DeepSeek 在 V4 Pro 发布后正式推出自己的 Agent 产品 DeepSeek Harness,核心口号是一切皆插件。它的内核名为 Cordis,只负责插件的加载、卸载与依赖管理,支持在 Agent 运行中热插拔,并用 88 页论文定义了时间/空间可组合性。UI、工具、Skills、存储、Agent 循环全部以插件形式暴露,官方预设 100 多个一方插件,也开放社区插件入口。安装只需一条 `npx @deepseek-ai/dsh web`,且未锁死在自家模型上,可以接入其他厂商的 Base URL 和协议。文章拆解了标准、PTC、极简、创造四种模式,其中创造模式允许 Agent 检查自身运行环境、现场创建并挂载新插件;会话被设计成只追加事件日志,失败后可按来源查看轨迹,便于审计和复现。作者也指出 V4 Pro 涨价明显,缓存命中价涨了 12 倍、高峰输出 27 元,且 Harness 对普通用户门槛高、UX 粗糙,更适合关注 Agent 可组合性与基础设施设计的工程师。