点积与对偶性

一、点积的代数定义

两个同维向量的点积(dot product)对应分量相乘再相加(结果是一个数):

vw=i=1nviwi=v1w1+v2w2++vnwn\mathbf{v} \cdot \mathbf{w} = \sum_{i=1}^{n} v_i w_i = v_1 w_1 + v_2 w_2 + \cdots + v_n w_n
例:v = (2, 3),w = (4, 1)
v·w = 2×4 + 3×1 = 8 + 3 = 11

注意:点积的输入是两个向量,输出是一个标量(数)。

二、点积的几何意义:投影

点积还有一个完全等价的几何解释,用投影来理解:

vw=v×w×cosθ\mathbf{v} \cdot \mathbf{w} = \|\mathbf{v}\| \times \|\mathbf{w}\| \times \cos\theta

其中 θ\theta 是两个向量之间的夹角。

直观理解:把 w\mathbf{w} 投影到 v\mathbf{v} 的方向上(或反过来),点积 = ”v\mathbf{v} 的长度 × w\mathbf{w}v\mathbf{v} 方向上的投影长度”。

        y

        │        ╱ w
        │      ╱│
        │    ╱  │  ← w 在 v 方向上的投影
        │  ╱    │
        │╱θ     │
        ┗━━━━━━━━━━━━━━→ x
        ●───────► v
        投影
夹角 θcos θv·w 的符号含义
θ < 90°两向量大致同向
θ = 90°00两向量垂直(正交)
θ > 90°两向量大致反向

重要结论vw=0    vw\mathbf{v} \cdot \mathbf{w} = 0 \iff \mathbf{v} \perp \mathbf{w}(垂直 ⟺ 点积为零)。

验证垂直:
v = (1, 0),w = (0, 1)
v·w = 1×0 + 0×1 = 0  ✓ 两轴互相垂直

三、对偶性:点积的另一面

现在揭示一个深刻的事实:点积与线性变换是同一回事

从”数 → 向量”的线性变换

考虑一个从二维空间到数轴的线性变换 T:R2RT: \mathbb{R}^2 \to \mathbb{R}(输出是标量)。它的矩阵是 1×2 的行向量

T(xy)=(ab)(xy)=ax+byT\begin{pmatrix} x \\ y \end{pmatrix} = \begin{pmatrix} a & b \end{pmatrix}\begin{pmatrix} x \\ y \end{pmatrix} = ax + by

关键洞察:这个变换的结果,恰好等于一个向量与 (x,y)(x,y) 的点积

ax+byT(x,y)=(ab)一个向量(xy)\underbrace{ax + by}_{T(x,y)} = \underbrace{\begin{pmatrix} a \\ b \end{pmatrix}}_{\text{一个向量}} \cdot \begin{pmatrix} x \\ y \end{pmatrix}

为什么这对点积重要

这解释了为什么点积是对称的(vw=wvv \cdot w = w \cdot v)且可以互换投影方向——因为投影本质上是一个线性变换,而这个变换可以用一个向量编码。点积和线性变换是同一枚硬币的两面

四、点积在机器学习中的意义

相似度度量:两个向量点积越大,表示它们”越同向”(越相似)。

应用用法
余弦相似度cosθ=vwvw\cos\theta = \frac{\mathbf{v}\cdot\mathbf{w}}{\|\mathbf{v}\|\|\mathbf{w}\|},衡量两向量方向一致性
推荐系统用户向量与物品向量的点积 = 匹配度
神经网络线性层 Wx+bW\mathbf{x} + \mathbf{b} 的每个输出神经元 = 输入与权重向量的点积
注意力机制Query 与 Key 的点积决定关注强度

注意力机制的例子QKTQ \cdot K^T 正是点积——它衡量”查询”与”键”的相似度,相似度越高,注意力权重越大。这与”投影长度 = 相似度”的几何直觉完全一致。

五、点积运算的性质

性质公式
对称性vw=wv\mathbf{v}\cdot\mathbf{w} = \mathbf{w}\cdot\mathbf{v}
分配律u(v+w)=uv+uw\mathbf{u}\cdot(\mathbf{v}+\mathbf{w}) = \mathbf{u}\cdot\mathbf{v} + \mathbf{u}\cdot\mathbf{w}
与数乘(cv)w=c(vw)(c\mathbf{v})\cdot\mathbf{w} = c(\mathbf{v}\cdot\mathbf{w})
与模vv=v2\mathbf{v}\cdot\mathbf{v} = \|\mathbf{v}\|^2

小结

  • 点积:vw=viwiv\cdot w = \sum v_i w_i(输出标量)
  • 几何:vwcosθ\|v\|\|w\|\cos\theta(投影)
  • vw    vw=0v \perp w \iff v \cdot w = 0
  • 对偶性:线性泛函(向量→数)= 某个向量的点积
  • 点积是相似度度量,广泛用于 ML、注意力机制

下一节:叉积,另一种向量乘法。