别只看窗口大小:token 上限与 lost in the middle 才是关键
上下文窗口由输入 token(system prompt 与 user prompt)和输出 token(模型回复)共同构成,模型能看到的 token 总数存在硬性上限。对话越长,越容易在请求时或生成中途触发 API 错误,而且模型无法自行绕过这一限制。更关键的问题是:上下文窗口越大,lost in the middle 现象越明显,模型对中间部分信息的注意力越低,甚至可能无法从自己的上下文中取回所需内容。因此评估模型时不能只看窗口大小,即使支持超长上下文,使用更少的 token 往往能换来更稳定的结果。本文是 LLM 基础概念的短篇讲解,适合刚开始接触 LLM 或正在设计 Agent 上下文的工程师快速建立全局认识。