文字怎样进入模型
先把一句人能读懂的话,变成模型可以逐步处理的有序信息。
一条连续的信息流 · 两种理解深度
这不是概念卡片的集合。我们会一直追踪同一句话,看它怎样被拆开、理解、反复加工,最后产生下一小片;你随时可以在科普与专业之间切换。
CHOOSE A READING MODE
两种模式不是同一份文字换几个词。科普只解释“为什么、发生了什么、交给谁”;专业会继续追踪数据形状、公式、实现与研究边界。
COURSE MAP
先看到整体,再进入细节。每一节都明确接收什么、改变什么、输出什么,以及下一节为什么需要它。
先把一句人能读懂的话,变成模型可以逐步处理的有序信息。
在重复的理解层里,找线索、整理线索,并保留原先的信息。
把最后的理解变成候选,选出下一小片,再接回原句继续生成。
回到训练、模型图纸、效果评估与尚未解决的问题,补全系统视角。
INTERACTIVE THREE.JS MODEL
拖动旋转,滚轮缩放,点选任意节点阅读解释;也可以播放、暂停或单步跟随一份信息从输入走到输出。专业模式会展开理解层内部结构。
收到一句话:从你写下的一句话开始。
text
人先写下一句想说的话。
第 01 节 · 文字怎样进入模型
模型收到一句未写完的话时,第一步究竟看到了什么?
WHY IT EXISTS
输入中一个空格、标点或罕见字的差别,都可能影响后面的切法;先确认原文边界,才能追踪整条流水线。
FOLLOW THE FLOW
保留原句中的字、标点、空格与先后顺序。
确认哪里是已经给出的内容,哪里等待补写。
把这份原文交给下一步,不先猜空格里是什么。
ONE CONTINUOUS EXAMPLE
COMMON MISCONCEPTION
“误区是认为模型一眼就能像人一样读懂整句话”
下一节会把连续文字切成较小、可反复使用的文字片。
PRIMARY SOURCES
参考网页负责提供清晰路线;关键机制由原始论文、研究机构课程与官方技术资料共同校准。
Transformer、scaled dot-product attention、multi-head attention、position-wise FFN 与残差连接的原始论文。
阅读原文原始论文 · 2016Neural Machine Translation of Rare Words with Subword Units将 BPE 子词单元用于开放词汇神经机器翻译的经典来源。
阅读原文原始论文 · 2018SentencePiece: A simple and language independent subword tokenizer and detokenizerSentencePiece 的语言无关原始文本分词方法。
阅读原文原始论文 · 2021RoFormer: Enhanced Transformer with Rotary Position EmbeddingRoPE 的旋转位置表示与相对位置性质。
阅读原文原始论文 · 2020GLU Variants Improve TransformerSwiGLU 等门控 FFN 变体的系统比较。
阅读原文原始论文 · 2022FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness通过 IO-aware tiling 实现精确 attention 的工程基础。
阅读原文原始论文 · 2022Training Compute-Optimal Large Language Models训练计算、模型规模与训练 token 数之间的 compute-optimal scaling 研究。
阅读原文原始论文 · 2021Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity稀疏专家模型、路由与容量权衡的代表性原始论文。
阅读原文原始论文 · 2020Language Models are Few-Shot Learners自回归语言建模、规模化与上下文学习的代表性研究。
阅读原文官方文档 · 持续更新Hugging Face Transformers Documentation: Tokenizer and Generation开源库关于 tokenizer、generation configuration、KV cache 和模型接口的官方文档入口。
阅读原文官方文档 · 持续更新PyTorch Documentation: CrossEntropyLoss and scaled_dot_product_attention交叉熵、张量形状与高效 attention 实现的官方 API 文档入口。
阅读原文