AI 工程师心态:接受概率,用可量化标准替代“感觉”
文章指出,构建 LLM 应用需要从确定性系统思维转向概率性系统思维:输入与输出不再一一对应,用户可能以难以预料的方式使用系统。作者用“Vibes-Only Trough”描述 demo 阶段看似可用、但缺乏真实数据支撑的状态,并主张通过“数据驱动斜坡”逐步建立评测体系。核心方法是先定义可量化的成功标准,例如情感分类系统要求 92% 的人工标注一致率、95% 的请求在 500ms 内完成、高置信度预测与人类判断匹配率达到 90%。随后要从每个用户交互中收集数据,从简单的点赞/点踩按钮开始,逐步构建更复杂的数据管道。作者坦言第一版产品通常不会好,因为数据不足,波动是概率系统的固有属性,关键是系统化追踪每次迭代。适合正在把 LLM demo 推向生产的工程师,以及需要建立评测文化的团队。