AI Agents · 课时

用于检索的余弦相似度

余弦相似度衡量两个向量之间的夹角,是语义搜索的标准距离指标。

第 3 / 4 课13 个步骤

用于检索的余弦相似度 是 CoddyKit 上的免费 AI Agents 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

本课时的部分内容尚未翻译,以英文显示。

衡量相似度

两个向量有多接近?三种常见的距离指标:

  • 余弦相似度——向量之间的夹角
  • 点积——投影
  • 欧几里得(L2)距离——直线距离

对于文本嵌入,默认使用余弦相似度。

余弦相似度公式

对于向量 A 和 B:

cos(A, B) = (A . B) / (|A| * |B|)

结果介于 -1 和 1 之间:

  • 1 = 方向相同
  • 0 = 正交(不相关)
  • -1 = 方向相反

使用 NumPy 的 Python 实现

直接实现:

import numpy as np

def cosine_similarity(a, b):
    a = np.array(a)
    b = np.array(b)
    return np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))

print(cosine_similarity(vec_apple, vec_orange))   # high
print(cosine_similarity(vec_apple, vec_car))      # low

预归一化向量

如果您的嵌入向量已经归一化(OpenAI 的嵌入向量就是如此),余弦相似度就等于点积,因此可以跳过除法:

def cosine_normalized(a, b):
    return np.dot(a, b)   # faster

前 K 项检索

要找出与查询最相似的 K 个文档,请计算查询与每个文档的相似度,然后排序:

def topk(query_vec, doc_vecs, k=5):
    scores = [(np.dot(query_vec, v), i) for i, v in enumerate(doc_vecs)]
    scores.sort(reverse=True)
    return scores[:k]

扩展规模

朴素的前 K 项检索每次查询的复杂度为 O(N)——处理 1 万个文档没有问题,但处理 1000 万个文档就会很慢。对于大型语料库,请使用近似最近邻(ANN)索引:HNSW、IVF、FAISS。

为什么不用欧氏距离

L2 距离会将向量的 LENGTH 视为有意义的指标。对于嵌入向量来说,方向比大小更重要——这就是余弦相似度更合适的原因。

(对于归一化向量,L2 距离和余弦相似度会产生相同的排序结果,因此没有区别。)

点积与余弦相似度

如果向量已经归一化,点积 = 余弦相似度,而且速度更快(无需除法)。大多数生产系统都会对归一化向量使用点积。

A Tiny End-to-End Retrieval

docs = ['Python is a programming language', 'Pizza is Italian food', 'The Eiffel Tower is in Paris']
doc_vecs = [embed(d) for d in docs]

query_vec = embed('What is Python?')
scores = [(cosine_similarity(query_vec, v), d) for v, d in zip(doc_vecs, docs)]
scores.sort(reverse=True)
for s, d in scores:
    print(f'{s:.3f}  {d}')
# 0.83  Python is a programming language
# 0.45  Pizza is Italian food
# 0.41  The Eiffel Tower is in Paris

混合检索

将余弦相似度与关键词搜索(BM25)结合起来,兼顾两者的优势——语义匹配与精确匹配。如今大多数生产系统都使用混合检索。

基于阈值的过滤

丢弃相似度低于阈值的结果,避免向 LLM 提供无关上下文:

results = [r for r in retrieved if r.score > 0.7]

余弦相似度的取值范围

余弦相似度的取值范围是多少?

回顾

余弦相似度是嵌入检索的标准指标。在生产规模的系统中,应将它与混合搜索和 ANN 结合使用。

免费开始

用 AI 导师学习 AI Agents — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
60
课程
239

常见问题解答

「用于检索的余弦相似度」课时是免费的吗?

是的 — 「用于检索的余弦相似度」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「用于检索的余弦相似度」这节课中我会学到什么?

余弦相似度衡量两个向量之间的夹角,是语义搜索的标准距离指标。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。

「用于检索的余弦相似度」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 什么是嵌入(向量表示)
  2. 使用 text-embedding-3 生成嵌入
  3. 用于检索的余弦相似度
  4. 嵌入模型对比(OpenAI、Cohere 与 OSS)
← 返回 AI Agents