0Pricing
AI Agents · 강의

검색을 위한 코사인 유사도

코사인 유사도는 두 벡터 사이의 각도를 측정합니다. 의미 검색에서 표준적으로 사용하는 거리 측정 기준입니다.

검색을 위한 코사인 유사도은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.

유사도 측정

두 벡터는 얼마나 가까울까요? 일반적인 거리 측정 방법은 세 가지입니다:

  • 코사인 유사도 — 벡터 사이의 각도
  • 내적 — 투영
  • 유클리드(L2) 거리 — 직선 거리

텍스트 임베딩에서는 코사인 유사도를 기본으로 사용합니다.

코사인 유사도 공식

벡터 A와 B에 대해:

cos(A, B) = (A . B) / (|A| * |B|)

결과는 -1에서 1 사이입니다:

  • 1 = 동일한 방향
  • 0 = 직교(관련 없음)
  • -1 = 반대 방향

NumPy를 사용한 Python 구현

간단한 구현은 다음과 같습니다:

import numpy as np

def cosine_similarity(a, b):
    a = np.array(a)
    b = np.array(b)
    return np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))

print(cosine_similarity(vec_apple, vec_orange))   # high
print(cosine_similarity(vec_apple, vec_car))      # low

사전 정규화된 벡터

임베딩이 이미 정규화되어 있다면(OpenAI의 임베딩이 그렇습니다), 코사인 유사도는 내적과 같으므로 나눗셈을 생략할 수 있습니다:

def cosine_normalized(a, b):
    return np.dot(a, b)   # faster

상위 K개 검색

질의와 가장 유사한 K개의 문서를 찾으려면 모든 문서와의 유사도를 계산한 다음 정렬합니다:

def topk(query_vec, doc_vecs, k=5):
    scores = [(np.dot(query_vec, v), i) for i, v in enumerate(doc_vecs)]
    scores.sort(reverse=True)
    return scores[:k]

규모 확장

단순한 상위 K개 검색은 질의당 O(N)이므로 문서 1만 개에는 적합하지만 1,000만 개에서는 느립니다. 대규모 말뭉치에는 근사 최근접 이웃(ANN) 색인인 HNSW, IVF, FAISS를 사용합니다.

유클리드 거리를 사용하지 않는 이유

L2 거리는 벡터의 LENGTH를 중요한 값으로 취급합니다. 임베딩에서는 크기보다 방향이 더 중요하므로 코사인 유사도가 더 적합합니다.

(정규화된 벡터에서는 L2와 코사인 유사도가 같은 순위를 제공하므로 어느 쪽을 사용해도 상관없습니다.)

내적과 코사인 유사도

벡터가 이미 정규화되어 있다면 내적은 코사인 유사도와 같고 더 빠릅니다(나눗셈이 필요하지 않습니다). 대부분의 운영 시스템은 정규화된 벡터에 내적을 사용합니다.

A Tiny End-to-End Retrieval

docs = ['Python is a programming language', 'Pizza is Italian food', 'The Eiffel Tower is in Paris']
doc_vecs = [embed(d) for d in docs]

query_vec = embed('What is Python?')
scores = [(cosine_similarity(query_vec, v), d) for v, d in zip(doc_vecs, docs)]
scores.sort(reverse=True)
for s, d in scores:
    print(f'{s:.3f}  {d}')
# 0.83  Python is a programming language
# 0.45  Pizza is Italian food
# 0.41  The Eiffel Tower is in Paris

하이브리드 검색

코사인 유사도와 키워드 검색(BM25)을 결합하면 의미 기반 검색과 정확히 일치하는 검색의 장점을 모두 얻을 수 있습니다. 오늘날 대부분의 운영 시스템은 하이브리드 검색을 사용합니다.

임계값 기반 필터링

LLM에 관련 없는 맥락이 전달되지 않도록 유사도 임계값보다 낮은 결과를 제외합니다:

results = [r for r in retrieved if r.score > 0.7]

코사인 유사도의 범위

코사인 유사도 값의 범위는 어떻게 될까요?

요약

코사인 유사도는 임베딩 검색의 표준 지표입니다. 운영 환경 규모에서는 하이브리드 검색 및 ANN과 결합합니다.

자주 묻는 질문

“검색을 위한 코사인 유사도” 강의는 무료인가요?

네 — “검색을 위한 코사인 유사도” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“검색을 위한 코사인 유사도”에서 뭘 배우나요?

코사인 유사도는 두 벡터 사이의 각도를 측정합니다. 의미 검색에서 표준적으로 사용하는 거리 측정 기준입니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.

“검색을 위한 코사인 유사도” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 임베딩이란 무엇인가(벡터 표현)
  2. text-embedding-3으로 임베딩 생성
  3. 검색을 위한 코사인 유사도
  4. 임베딩 모델 비교(OpenAI, Cohere, OSS)
← AI Agents(으)로 돌아가기