Glean 拾遗
最近收录

1 条 · 按时间

08-09

AI 应用的质量上限,取决于你的 Evals

在 LLM 应用中,输入与输出不再有确定性映射,任何小改动都可能改变全局行为。本文提出 Evals 是 AI 工程师的单元测试,也是从概率系统中压出可预测性的核心工具。文章拆解了三种评测方式:可写成断言的确定性 Eval、成本高但必要的人工评估,以及用另一个 LLM 打分的 LLM-as-a-Judge,并建议分层运行以控制成本。随后介绍数据飞轮:把用户的负反馈转成新的 eval 用例,形成持续改进循环。工具层面对比了云端平台 Braintrust 与作者维护的本地运行库 Evalite(基于 Vitest)。适合正在把 LLM 原型推向生产的工程师,用于建立可量化的质量反馈体系。

www.aihero.dev · 9 min · AI Engineering · Evals · LLM