0Pricing
AI Agents · 강의

text-embedding-3으로 임베딩 생성

OpenAI text-embedding-3-small/large를 사용해 문자열을 1536차원 또는 3072차원 벡터로 변환해보세요.

text-embedding-3으로 임베딩 생성은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

OpenAI 임베딩 모델

OpenAI는 프로덕션용 임베딩 모델 두 가지를 제공합니다:

  • text-embedding-3-small — 1536차원, 저렴하고 빠름
  • text-embedding-3-large — 3072차원, 더 높은 품질, 더 느림

대부분의 경우 small을 사용하고, 비용보다 품질이 중요한 경우에만 large를 사용하세요.

첫 임베딩

SDK 코드 한 줄이면 됩니다:

from openai import OpenAI
client = OpenAI()

resp = client.embeddings.create(
    model='text-embedding-3-small',
    input='Hello, world!'
)
vector = resp.data[0].embedding
print(len(vector))      # 1536

임베딩 일괄 처리

API는 목록을 지원하므로 한 번에 하나씩 호출하는 것보다 훨씬 빠릅니다:

texts = ['cat', 'dog', 'pizza', 'sushi']
resp = client.embeddings.create(
    model='text-embedding-3-small',
    input=texts
)
vectors = [d.embedding for d in resp.data]
# vectors[0] is for 'cat', vectors[1] for 'dog', etc.

토큰 한도

각 입력에는 최대 토큰 한도가 있습니다(text-embedding-3의 경우 8192개). 긴 문서는 먼저 청크로 나누어야 합니다.

차원 수 줄이기

더 적은 차원 수를 요청할 수 있습니다(Matryoshka 임베딩). 이는 저장 공간을 줄일 때 유용합니다:

resp = client.embeddings.create(
    model='text-embedding-3-large',
    input='Hello',
    dimensions=512    # default would be 3072
)

비용

작성 시점 기준:

  • text-embedding-3-small: 토큰 1M개당 $0.02
  • text-embedding-3-large: 토큰 1M개당 $0.13

small 모델로 단어 1M개를 임베딩하는 비용은 약 $0.025로, 사실상 무료입니다.

한 번 임베딩하고 영구적으로 재사용하기

임베딩은 다시 임베딩해도 변하지 않으므로 한 번 계산해 저장할 수 있습니다. 모든 프로덕션 시스템에서 캐싱은 필수입니다.

벡터 정규화

OpenAI 임베딩은 이미 L2 정규화되어 있습니다(길이 = 1). 따라서 코사인 유사도 = 내적이 되어 계산량을 줄일 수 있습니다:

import numpy as np
a = np.array(vec_a)
b = np.array(vec_b)
sim = np.dot(a, b)     # since |a| = |b| = 1

비동기 임베딩

높은 처리량이 필요하다면 비동기 클라이언트를 사용하세요:

from openai import AsyncOpenAI
import asyncio

client = AsyncOpenAI()

async def embed_batch(texts):
    resp = await client.embeddings.create(
        model='text-embedding-3-small',
        input=texts
    )
    return [d.embedding for d in resp.data]

vectors = asyncio.run(embed_batch(['a', 'b', 'c']))

실패 시 재시도

임베딩 호출도 다른 HTTP 호출처럼 실패할 수 있습니다. 백오프를 적용한 재시도로 감싸세요:

from tenacity import retry, wait_exponential, stop_after_attempt

@retry(wait=wait_exponential(multiplier=1, max=10), stop=stop_after_attempt(5))
def safe_embed(text):
    return client.embeddings.create(model='text-embedding-3-small', input=text)

임베딩 저장

일반적인 저장 방식은 세 가지입니다:

  • 확장 기능 sqlite-vec을 사용하는 SQLite
  • 확장 기능 pgvector를 사용하는 Postgres
  • 전용 벡터 데이터베이스(Pinecone, Qdrant, Weaviate)

비용 파악

text-embedding-3-small로 단어 100만 개를 임베딩하는 데 드는 비용은 대략 얼마일까요?

복습

text-embedding-3-small을 선택하고, 호출을 일괄 처리하고, 벡터를 저장하면 의미 기반 검색의 기반을 갖추게 됩니다.

자주 묻는 질문

“text-embedding-3으로 임베딩 생성” 강의는 무료인가요?

네 — “text-embedding-3으로 임베딩 생성” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“text-embedding-3으로 임베딩 생성”에서 뭘 배우나요?

OpenAI text-embedding-3-small/large를 사용해 문자열을 1536차원 또는 3072차원 벡터로 변환해보세요. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.

“text-embedding-3으로 임베딩 생성” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 임베딩이란 무엇인가(벡터 표현)
  2. text-embedding-3으로 임베딩 생성
  3. 검색을 위한 코사인 유사도
  4. 임베딩 모델 비교(OpenAI, Cohere, OSS)
← AI Agents(으)로 돌아가기