用于检索的余弦相似度
余弦相似度衡量两个向量之间的夹角,是语义搜索的标准距离指标。
用于检索的余弦相似度 是 CoddyKit 上的免费 AI Agents 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。
本课时的部分内容尚未翻译,以英文显示。
衡量相似度
两个向量有多接近?三种常见的距离指标:
- 余弦相似度——向量之间的夹角
- 点积——投影
- 欧几里得(L2)距离——直线距离
对于文本嵌入,默认使用余弦相似度。
余弦相似度公式
对于向量 A 和 B:
cos(A, B) = (A . B) / (|A| * |B|)
结果介于 -1 和 1 之间:
- 1 = 方向相同
- 0 = 正交(不相关)
- -1 = 方向相反
使用 NumPy 的 Python 实现
直接实现:
import numpy as np
def cosine_similarity(a, b):
a = np.array(a)
b = np.array(b)
return np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))
print(cosine_similarity(vec_apple, vec_orange)) # high
print(cosine_similarity(vec_apple, vec_car)) # low预归一化向量
如果您的嵌入向量已经归一化(OpenAI 的嵌入向量就是如此),余弦相似度就等于点积,因此可以跳过除法:
def cosine_normalized(a, b):
return np.dot(a, b) # faster前 K 项检索
要找出与查询最相似的 K 个文档,请计算查询与每个文档的相似度,然后排序:
def topk(query_vec, doc_vecs, k=5):
scores = [(np.dot(query_vec, v), i) for i, v in enumerate(doc_vecs)]
scores.sort(reverse=True)
return scores[:k]扩展规模
朴素的前 K 项检索每次查询的复杂度为 O(N)——处理 1 万个文档没有问题,但处理 1000 万个文档就会很慢。对于大型语料库,请使用近似最近邻(ANN)索引:HNSW、IVF、FAISS。
为什么不用欧氏距离
L2 距离会将向量的 LENGTH 视为有意义的指标。对于嵌入向量来说,方向比大小更重要——这就是余弦相似度更合适的原因。
(对于归一化向量,L2 距离和余弦相似度会产生相同的排序结果,因此没有区别。)
点积与余弦相似度
如果向量已经归一化,点积 = 余弦相似度,而且速度更快(无需除法)。大多数生产系统都会对归一化向量使用点积。
A Tiny End-to-End Retrieval
docs = ['Python is a programming language', 'Pizza is Italian food', 'The Eiffel Tower is in Paris']
doc_vecs = [embed(d) for d in docs]
query_vec = embed('What is Python?')
scores = [(cosine_similarity(query_vec, v), d) for v, d in zip(doc_vecs, docs)]
scores.sort(reverse=True)
for s, d in scores:
print(f'{s:.3f} {d}')
# 0.83 Python is a programming language
# 0.45 Pizza is Italian food
# 0.41 The Eiffel Tower is in Paris混合检索
将余弦相似度与关键词搜索(BM25)结合起来,兼顾两者的优势——语义匹配与精确匹配。如今大多数生产系统都使用混合检索。
基于阈值的过滤
丢弃相似度低于阈值的结果,避免向 LLM 提供无关上下文:
results = [r for r in retrieved if r.score > 0.7]余弦相似度的取值范围
余弦相似度的取值范围是多少?
回顾
余弦相似度是嵌入检索的标准指标。在生产规模的系统中,应将它与混合搜索和 ANN 结合使用。
用 AI 导师学习 AI Agents — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 60
- 课程
- 239
常见问题解答
「用于检索的余弦相似度」课时是免费的吗?
是的 — 「用于检索的余弦相似度」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。
「用于检索的余弦相似度」这节课中我会学到什么?
余弦相似度衡量两个向量之间的夹角,是语义搜索的标准距离指标。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Agents 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。
「用于检索的余弦相似度」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Agents 课中编写并运行代码吗?
能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。