Posts
阅读原文
Self-Attention 里的匹配核是什么?从公式理解注意力打分机制
如果你已经知道 Self-Attention 的核心任务,是在一个序列内部判断“谁和谁更相关”,那么接下来最重要的问题就是:
这种“相关性”到底是怎么计算出来的?
很多人在第一次看到 Attention 公式时,都会把重点放在 softmax、矩阵乘法或者最后的加权求和上。但从建模角度来看,真正决定“谁该被关注”的,是前面那一步匹配函数(matching function),也可以理解为注意力里的某种匹配核(match kernel)。
本文会先从直觉解释匹配核,再用点积、缩放和 softmax 这三个层次,把 Self-Attention 的打分机制拆开。
Posts
阅读原文
什么是 Transformer 和 Self-Attention 机制?一文读懂其核心原理
如果你最近在关注大模型、ChatGPT、文本生成或者多模态 AI,几乎一定会反复看到两个词:Transformer 和 Self-Attention。
很多人第一次接触这两个概念时,常常会觉得它们非常“学术”,像是只有论文研究者才需要理解的内容。但实际上,今天几乎所有主流大模型——无论是聊天、写作、翻译、代码生成,还是图像与文本结合的多模态系统——背后都深深建立在这套机制之上。
如果说大模型是今天 AI 爆发的结果,那么 Transformer 和 Self-Attention,就是支撑这场爆发最重要的底层方法之一。
本文会先从 Transformer 的整体结构讲起,再把 Self-Attention 机制拆开说明,最后解释它为什么能成为现代大模型的核心基础。