模型选型五问:开源与闭源、Token 成本、延迟、上下文窗口怎么权衡
选 LLM 看起来是单次决定,实则要随新模型和产品演化反复重做。本文把选型拆成五个问题:开源还是闭源、成本、延迟、性能、上下文窗口。开源模型需要自行托管或走 API 供应商(Hugging Face、Groq),闭源模型由模型厂商托管,按 token 计费,价格战愈演愈烈。延迟的测量要看 TTFT 和 TPOT;性能先参考公开榜单(Chatbot Arena、Open LLM Leaderboard),但榜单存在过拟合风险,真正的验证只能在应用内用自建 evals 进行。推理模型(如 o1)在编程和数学上更强,但要付出更高的 token 成本和更长响应时间。上下文窗口同时计入输入与输出 token,RAG 中的 chunking 等模式就是在有限的窗口里塞进更多信息。适合刚开始做模型选型的 AI 应用开发者。