Transformers Explained Visually

发布时间 2026-09-22 9 天前
来源 Hacker首页帖子
字数 195 字
查看原文

AI智能总结

GPT-2(small 版本)在处理输入时,先进行词元嵌入,将词汇表中的每个词元映射为一个 768 维的向量,向量维度由模型决定。这些嵌入向量存放在形状为 (50,257, 768) 的矩阵中,矩阵共包含约 3900 万个参数。

模型借助这一高维空间,为词元提供语义含义:用法或含义相近的词元会在空间中彼此靠近,无关词元则距离更远。

第 2 步:词元嵌入(Token Embedding)

GPT-2(small 版本)会将词汇表中的每个词元表示为一个 768 维的向量;向量维度取决于具体模型。这些嵌入向量存储在一个形状为 (50,257, 768) 的矩阵中,包含大约 3900 万个参数!这个庞大的矩阵使模型能够为每个词元赋予语义含义,也就是说,在语言中具有相似用法或含义的词元在该高维空间中会被放置在彼此相近的位置,而不相似的词元则相距更远。