LLM 系统课HOW LANGUAGE MODELS WORK

一条连续的信息流 · 两种理解深度

从一句话,到下一个文字小片

这不是概念卡片的集合。我们会一直追踪同一句话,看它怎样被拆开、理解、反复加工,最后产生下一小片;你随时可以在科普与专业之间切换。

学习路线
15 节连续课程
理解深度
科普 / 专业
贯穿案例
同一句话走完全程

CHOOSE A READING MODE

先选一种读法,之后随时切换

两种模式不是同一份文字换几个词。科普只解释“为什么、发生了什么、交给谁”;专业会继续追踪数据形状、公式、实现与研究边界。

COURSE MAP

课程全景

先看到整体,再进入细节。每一节都明确接收什么、改变什么、输出什么,以及下一节为什么需要它。

PART 01

文字怎样进入模型

先把一句人能读懂的话,变成模型可以逐步处理的有序信息。

PART 02

模型怎样回看前文

在重复的理解层里,找线索、整理线索,并保留原先的信息。

PART 03

模型怎样给出下一小片

把最后的理解变成候选,选出下一小片,再接回原句继续生成。

PART 04

模型怎样学会与改进

回到训练、模型图纸、效果评估与尚未解决的问题,补全系统视角。

INTERACTIVE THREE.JS MODEL

一张完整 3D 流水线

拖动旋转,滚轮缩放,点选任意节点阅读解释;也可以播放、暂停或单步跟随一份信息从输入走到输出。专业模式会展开理解层内部结构。

1 / 11

收到一句话:从你写下的一句话开始。

text

把话交给模型

人先写下一句想说的话。

输入
一段文字
处理
保留原来的字符顺序。
输出
待处理的文字
记住
模型从人写的话开始。

01 节 · 文字怎样进入模型

先看清要续写的文字

科普模式

模型收到一句未写完的话时,第一步究竟看到了什么?

这一节在整条链中的位置

接住上一步,交给下一步

收到
一段按顺序排列的文字,以及明确的待续写位置。
本节改变
保留原句中的字、标点、空格与先后顺序。
交出
一份边界明确、等待继续处理的原文。
01

WHY IT EXISTS

为什么需要这一步

输入中一个空格、标点或罕见字的差别,都可能影响后面的切法;先确认原文边界,才能追踪整条流水线。

02

FOLLOW THE FLOW

它具体做了什么

  1. 1

    保留原句中的字、标点、空格与先后顺序。

  2. 2

    确认哪里是已经给出的内容,哪里等待补写。

  3. 3

    把这份原文交给下一步,不先猜空格里是什么。

03

ONE CONTINUOUS EXAMPLE

回到同一句玩具示例

小猫坐在窗边,看着窗外的____
  1. 贯穿案例是“小猫坐在窗边,看着窗外的____”。本课展示的切法、号码、分数和百分比都只是帮助理解的玩具示例,不代表真实系统内部记录。
所有切分、号码、分数和百分比均为玩具示例。
04

COMMON MISCONCEPTION

一个常见误解

误区是认为模型一眼就能像人一样读懂整句话

实际上,原文还要经过一连串转换
带走这三点
  • 输入保留顺序和细节。
  • 待补位置也是上下文的一部分。
  • 此时还没有产生答案。
下一步为什么接得上

下一节会把连续文字切成较小、可反复使用的文字片。

PRIMARY SOURCES

结论回到权威原文

参考网页负责提供清晰路线;关键机制由原始论文、研究机构课程与官方技术资料共同校准。

原始论文 · 2017Attention Is All You Need

Transformer、scaled dot-product attention、multi-head attention、position-wise FFN 与残差连接的原始论文。

阅读原文
原始论文 · 2016Neural Machine Translation of Rare Words with Subword Units

将 BPE 子词单元用于开放词汇神经机器翻译的经典来源。

阅读原文
原始论文 · 2018SentencePiece: A simple and language independent subword tokenizer and detokenizer

SentencePiece 的语言无关原始文本分词方法。

阅读原文
原始论文 · 2021RoFormer: Enhanced Transformer with Rotary Position Embedding

RoPE 的旋转位置表示与相对位置性质。

阅读原文
原始论文 · 2020GLU Variants Improve Transformer

SwiGLU 等门控 FFN 变体的系统比较。

阅读原文
原始论文 · 2022FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

通过 IO-aware tiling 实现精确 attention 的工程基础。

阅读原文
原始论文 · 2022Training Compute-Optimal Large Language Models

训练计算、模型规模与训练 token 数之间的 compute-optimal scaling 研究。

阅读原文
原始论文 · 2021Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity

稀疏专家模型、路由与容量权衡的代表性原始论文。

阅读原文
原始论文 · 2020Language Models are Few-Shot Learners

自回归语言建模、规模化与上下文学习的代表性研究。

阅读原文
官方文档 · 持续更新Hugging Face Transformers Documentation: Tokenizer and Generation

开源库关于 tokenizer、generation configuration、KV cache 和模型接口的官方文档入口。

阅读原文
官方文档 · 持续更新PyTorch Documentation: CrossEntropyLoss and scaled_dot_product_attention

交叉熵、张量形状与高效 attention 实现的官方 API 文档入口。

阅读原文