向量表征与逻辑回归的分类原理
statistic
本文字数:2.2k 字 | 阅读时长 ≈ 9 min

向量表征与逻辑回归的分类原理

statistic
本文字数:2.2k 字 | 阅读时长 ≈ 9 min

本文介绍一种通用的向量分类方案:先把样本转换为固定维度的向量,再使用逻辑回归学习分类边界,最后把模型输出转换为概率并与阈值比较。这与 ResNet-50 等图像分类模型的思路相似:先将图片编码为特征向量,再通过分类头输出结果。不同之处在于,本文直接使用编码后的固定维向量训练逻辑回归分类器。

1. 问题定义

用二分类来举例,假设里面的每个样本都可以表示成一个 \(d\) 维向量 \(x=[x_1,x_2,\ldots,x_d]\in\mathbb{R}^d\),标签 \(y=1\) 表示属于目标类别,\(y=0\) 表示不属于目标类别。模型需要学习一个函数 \(f(x)\),输出样本属于目标类别的分数或概率。最后,将 \(f(x)\) 与阈值比较:若 \(f(x)\geq\text{threshold}\),则判定为正类,否则判定为负类。

整个过程可以分为四个核心阶段:

  1. 向量化:把样本(图片、视频、文本或其他对象)转换为数值向量。
  2. 训练:通过正负样本学习线性分类边界。
  3. 阈值选择:根据 Precision、Recall 等目标确定判断门槛。
  4. 推理:对新来的样本计算概率,输出命中的类别。

2. 预备知识:向量表征

单路向量:最简单的情况是每个样本只有一个 embedding \(x\in\mathbb{R}^d\)。通过这一个 embedding 来描述样本,假设这是一个抖音投稿视频,他可能有 ocr,title,asr,frame等信息,讲这些所有信息编码为一个 embedding,当然也可以根据自己的实际需求来编码样本对应的特征,核心就是输出一个 embedding。

多路向量拼接:如果一个样本有两路 embedding(比如图像文本的 embedding 分开提取),分别为 \(x_a\in\mathbb{R}^{d_1}\) 和 \(x_b\in\mathbb{R}^{d_2}\),可以按固定顺序拼接为 \(x=\operatorname{concat}(x_a,x_b)\in\mathbb{R}^{d_1+d_2}\)。拼接的本质是让逻辑回归同时学习两路特征的权重 \(W=\operatorname{concat}(W_a,W_b)\),于是 \(x\cdot W=x_a\cdot W_a+x_b\cdot W_b\)。模型可以自动决定两路信息各自的重要程度。

L2 范数:在后面要用到向量范数,这里先做定义,向量 \(x\) 的 L2 范数定义为 \(\lVert x\rVert_2=\sqrt{x_1^2 + x_2^2 + \cdots + x_d^2}\),它可以理解为向量的长度。如果两路向量分别是单位向量,即 \(\lVert x_a\rVert_2=\lVert x_b\rVert_2=1\),拼接后则有 \(\lVert\operatorname{concat}(x_a,x_b)\rVert_2=\sqrt{1^2 + 1^2}=\sqrt{2}\)。因此“每一段都归一化”不等于“拼接后的完整向量也归一化”。但是要注意拼接后是否重新 L2 归一化没有统一答案,训练和测试保持一致即可。

3. 训练数据构造

训练模型的第一步就是构造数据,用视频二分类举例,假设我们要找到包含皮卡丘的视频,我们要找正例/负例样本。如下

正例:正例是确认属于目标类别的样本包含皮卡丘的视频,即 \(y=1\)。正例应尽量覆盖类别内部的多样性,例如:皮卡丘的不同形态,不同姿态,不同背景,不同拍摄方式,不同内容来源,容易漏判的边界模式等等。只使用高度相似的正例,容易让模型记住单一模式,导致实际召回不足

负例:负例是确认不属于目标类别的样本,即 \(y=0\)。常见负例可以分为以下几种

负例类型 作用
通用负例 学习目标类别与普通背景的区别
相邻类别负例 学习容易混淆的类别边界
困难负例 压制模型当前最容易误判的样本
随机负例 提供整体分布覆盖

注意:高质量困难负例通常比大量简单负例更有价值。

数据划分:推荐划分如下,如果数据具有明显的时间变化,最好按时间划分测试集,以评估模型对未来数据的泛化能力。

数据集 用途
训练集 拟合 StandardScaler 和模型参数
验证集 选择超参数、模型分支和阈值
测试集 最终一次独立评估

注意:训练的时候一定不能碰测试数据。

4. 逻辑回归算法

简单划分一下,逻辑回归算法一共分为三步,第一步计算逻辑回归分数,第二步计算 sigmoid,第三步计算 loss 优化参数。

1. 线性分数:逻辑回归首先计算线性分数 \(z=W\cdot x+b\),即\(z=W_1x_1+W_2x_2+\cdots+W_dx_d+b\)。其中:

2. Sigmoid:接下来使用 sigmoid 把任意实数 logit 转换到 \((0,1)\):\(p=\operatorname{sigmoid}(z)=1/(1+e^{-z})\)。sigmoid 是严格单调递增函数,logit 越大,模型输出概率越大。

3. 二分类交叉熵 loss:对于第 \(i\) 个样本,得到上面的预测概率后,对应的二分类交叉熵为 \(L_i=-[y_i\log p_i+(1-y_i)\log(1-p_i)]\)。当真实标签 y_i = 1 时,模型希望 p_i 接近 1;当 y_i = 0 时,模型希望 p_i 接近 0。

5. 三种推理方式对比

在模型上线的时候,有的平台可能会默认提供三种向量对比方式,这时候如果你是用我们上述内积 \(x\cdot W\) 来进行计算的话,可能需要进行转化。下面介绍三个常用的向量计算方式:内积、余弦相似度和欧氏距离

Inner Product

内积分数为 \(\text{score}=x\cdot W\)。逻辑回归本身就是 \(\text{logit}=\text{score}+b\),然后计算 \(p=\operatorname{sigmoid}(\text{logit})\),这里的 \(b\) 就是偏置量。因此 Inner Product 是逻辑回归最直接、最自然的向量计算方式。

Cosine Similarity

余弦相似度为 \(\cos(x,W)=(x\cdot W)/(\lVert x\rVert_2\lVert W\rVert_2)\)。它只衡量两个向量的方向是否一致,不关心向量长度。其取值范围通常为 \([-1,1]\)。

从 Cosine 恢复内积:由定义可得 \(x\cdot W=\cos(x,W)\lVert x\rVert_2\lVert W\rVert_2\)。因此逻辑回归可以写成 \(\text{logit}=s_{\mathrm{cos}}\times\lVert x\rVert_2\lVert W\rVert_2+b\),其中 \(s_{\mathrm{cos}}\) 表示余弦相似度,然后通过计算 \(p=\operatorname{sigmoid}(\text{logit})\) 获取概率。

Euclidean Distance

欧氏距离为 \(d=\lVert x-W\rVert_2\)。距离越小,两个向量在欧氏空间中越接近。平方展开后:

\[ d^2=\lVert x-W\rVert_2^2=\lVert x\rVert_2^2+\lVert W\rVert_2^2-2x\cdot W \]

因此 \(x\cdot W=(\lVert x\rVert_2^2 + \lVert W\rVert_2^2 - d^2)/2\),逻辑回归可以写成 \(\text{logit}=(\lVert x\rVert_2^2 + \lVert W\rVert_2^2 - d^2)/2+b\),然后通过计算 \(p=\operatorname{sigmoid}(\text{logit})\) 获取概率。

三种方式之间的关系

对比方式 原始量 是否受向量长度影响 恢复 \(x\cdot W\) 的公式
Inner Product \(x\cdot W\) 结果本身就是 \(x\cdot W\)
Cosine \(\dfrac{x\cdot W}{\lVert x\rVert_2\lVert W\rVert_2}\) \(\cos(x,W)\lVert x\rVert_2\lVert W\rVert_2\)
Euclidean \(\lVert x-W\rVert_2\) \(\dfrac{\lVert x\rVert_2^2 + \lVert W\rVert_2^2 - d^2}{2}\)

三种比对方式的统一数值例子

假设 \(x=[3,4]\)、\(W=[1,2]\)、\(b=-2\)、阈值 \(t=0.90\)。

先计算基础量:\(\lVert x\rVert_2=\sqrt{3^2 + 4^2}=5.00\),\(\lVert W\rVert_2=\sqrt{1^2 + 2^2}=\sqrt{5}\approx2.24\),\(x\cdot W=3\times1+4\times2=11.00\)。原始逻辑回归的 logit 为 \(x\cdot W+b=11.00-2=9.00\)。概率为 \(p=\operatorname{sigmoid}(9.00)\approx1.00\)。由于 \(1.00\geq0.90\),因此判定为正类。

方法 中间结果 恢复的 logit 最终概率 是否命中
Inner Product 11.00 9.00 1.00
Cosine 0.98 9.00 1.00
Euclidean 2.83 9.00 1.00

这说明三种方法的原始分数不同,但只要正确恢复 x · W,最终逻辑回归结果可以完全一致。

Aug 01, 2026
Mar 13, 2026
ufw
Mar 13, 2026
ufw
Dec 14, 2025