Skip to content
Tse的笔记
Go back

向量数据库复习四

Edit page

向量距离与相似度:四种常见度量

在机器学习与信息检索中,“距离(distance)”通常表示不相似程度,“相似度(similarity)”表示相似程度。下面是四种最常用的度量方式。


1. 欧氏距离(Euclidean Distance)

定义

欧氏距离是空间中的直线距离,对应“几何直觉中的最短路径”。

对于向量 (x, y \in \mathbb{R}^n):

[ d(x,y) = \sqrt{\sum_{i=1}^{n}(x_i - y_i)^2} ]

原理直觉

特点


2. 点积相似度(Dot Product Similarity)

定义

点积衡量两个向量的“方向一致程度 + 规模影响”:

[ s(x,y) = \sum_{i=1}^{n} x_i y_i ]

几何意义

[ x \cdot y = |x||y|\cos\theta ]

因此:

直觉解释

特点


3. 曼哈顿距离(Manhattan Distance)

定义

也叫 L1 距离,表示“沿坐标轴逐步移动的距离”:

[ d(x,y) = \sum_{i=1}^{n} |x_i - y_i| ]

直觉解释

像在城市网格中走路(只能走横竖街道):

特点


4. 杰卡德相似度(Jaccard Similarity)

定义

用于集合或二值向量,衡量“交集 / 并集”:

[ J(A,B) = \frac{|A \cap B|}{|A \cup B|} ]

如果是二值向量:

[ J(x,y) = \frac{\text{共同为1的维度}}{\text{至少一个为1的维度}} ]

直觉解释

特点


总结对比

方法类型核心思想是否受尺度影响
欧氏距离距离直线几何距离
点积相似度方向 + 规模
曼哈顿距离距离绝对差累加是(较稳定)
杰卡德相似度集合重合比例否(只看0/1)

一句话理解

多维度条件组合检索

多维度条件组合检索是实现复杂查询需求的关键技术,能够将向量相似性计算与多个元数据条件结合起来,提供精细化的结果筛选。例如,在电商场景中,不仅需要基于用户输入的文本描述进行语义相似性计算,还需要同时考虑价格、品牌、评分等多个条件的约束。通过逻辑组合(如与、或、不等操作),可以灵活定义复杂查询条件。

基于元数据优先级的排序算法

基于元数据优先级的排序算法是一种综合利用多个维度数据进行结果排序的技术。其核心思想是为不同的元数据属性赋予权重,根据用户需求的优先级动态调整排序规则。例如,在商品检索场景中,可以根据用户更关注的价格、品牌或评分对结果进行综合排序。通过分配优先级权重,让语义相似性与元数据属性共同参与排序计算,最终输出符合用户偏好的排序结果。


Edit page
Share this post:

Previous Post
向量数据库复习五(完结)
Next Post
向量数据库复习三