资讯

一个词进了大模型,到底经历了什么?

bilibili-36·2026/9/6 14:51:06🔗 原文

📋总体概括

这是一篇大模型科普内容,以6分钟视频形式讲解一个词在基于Transformer架构的大模型中的完整处理旅程:先通过几万行的词表映射为向量,再注入位置信息以区分语序,最后通过Query进行注意力交流。文章点明ChatGPT、豆包、Gemini等主流大模型都基于2017年论文《Attention Is All You Need》提出的同一架构,用通俗类比降低了理解门槛,适合想搞懂大模型内部机制的普通读者入门。

关键信息

  • 主流大模型ChatGPT、豆包、Gemini均基于2017年论文《Attention Is All You Need》提出的Transformer架构
  • 词进入模型第一步是查几万行的词表换成向量,意思相近的词对应数字也相近
  • Transformer天生不看顺序,「狗咬人」和「人咬狗」需靠位置信号区分
  • 注意力机制中每个词发出Query寻找信息,按匹配度整合上下文内容
  • 内容以6分钟视频形式,跟随一个词走完在模型内的完整旅程,化繁为简

🔥犀利点评

大模型科普最怕两种人:装神的和哄小孩的。这条内容难得踩在中间——不堆公式也不把Transformer吹成玄学,用一个词的旅程把tokenization、位置编码、注意力串成线,这个叙事骨架选得聪明。短板也明显:六个步骤各讲一段,听众最后多半记住了比喻却没记住机制,好奇心被勾起来却没地方落地。但作为引流入门内容,已经及格线以上了。

本文由本站自动聚合,以下为原始来源:前往 bilibili-36 阅读全文