Glean 拾遗
最近收录

2 条 · 按时间

08-11

LLM 扫盲:参数、采样与 200 万美元的训练成本

本文是一篇面向初学者的 LLM 概览,将大模型比作一份用 16-bit 浮点数编码的压缩文件,参数就是模型的“大脑”。文章依次介绍推理(inference)、采样策略(greedy、top-k、top-p、temperature)、tokenization,以及 pre-training 与 post-training 两阶段的训练流程,并给出粗略成本量级:约 10TB 文本、6,000 块 GPU 跑 12 天、花费约 200 万美元,产出 140GB 权重文件。结尾引用 Karpathy 的 LLM 入门视频与 Anthropic 的可解释性研究。内容刻意保持浅显,对熟悉 LLM 的一线工程师几乎没有新信息,适合刚入门的读者建立基本直觉。

www.aihero.dev · 5 min · LLM · LLM Basics · Sampling Strategies
08-06

一文看懂 LLM Token:从拆分、编码到计费

LLM 中 token 的基础概念与工作机制:tokenizer 如何把文本拆成 token、再映射成数字;解码过程如何把数字还原为文本。文章用 'the cat sat on the mat' 的微型语料演示字符级到词组级的词汇表构建,并给出具体数字:词汇表从 1000 到 200000,'understanding' 的词元数从 5 降到 2;生僻词如 'Frabjous' 15 个字符被拆成 7 个 token。同时说明计费同时计入输入与输出 token,输入包含对话历史、system prompt 与工具定义,控制输出长度可直接省钱。适合想理解 token 计费与优化成本的 LLM 应用开发者。

www.aihero.dev · 4 min · AI Engineering · LLM · Token-Optimization