ARCHIVE
文章归档
- 8 分钟阅读
Token 进入模型后经历了什么?本文将从 Embedding 和位置信息开始,逐步拆解 Self-Attention、QKV、多头注意力、MLP、残差连接和 KV Cache,帮助读者理解 Transformer 每一层究竟在计算什么。
- 9 分钟阅读
大模型并不是把互联网内容直接塞进 GPU。本文将沿着数据生产流程,讲清网页解析、质量过滤、内容去重、数据混合和 Tokenization,并解释训练数据与 Tokenizer 如何共同影响模型最终的能力。
- 8 分钟阅读
从 Token、概率分布与训练目标出发,解释大语言模型为什么通过预测下一个 Token 产生知识、推理与生成能力。