text-embedding-3으로 임베딩 생성
OpenAI text-embedding-3-small/large를 사용해 문자열을 1536차원 또는 3072차원 벡터로 변환해보세요.
text-embedding-3으로 임베딩 생성은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
OpenAI 임베딩 모델
OpenAI는 프로덕션용 임베딩 모델 두 가지를 제공합니다:
- text-embedding-3-small — 1536차원, 저렴하고 빠름
- text-embedding-3-large — 3072차원, 더 높은 품질, 더 느림
대부분의 경우 small을 사용하고, 비용보다 품질이 중요한 경우에만 large를 사용하세요.
첫 임베딩
SDK 코드 한 줄이면 됩니다:
from openai import OpenAI
client = OpenAI()
resp = client.embeddings.create(
model='text-embedding-3-small',
input='Hello, world!'
)
vector = resp.data[0].embedding
print(len(vector)) # 1536임베딩 일괄 처리
API는 목록을 지원하므로 한 번에 하나씩 호출하는 것보다 훨씬 빠릅니다:
texts = ['cat', 'dog', 'pizza', 'sushi']
resp = client.embeddings.create(
model='text-embedding-3-small',
input=texts
)
vectors = [d.embedding for d in resp.data]
# vectors[0] is for 'cat', vectors[1] for 'dog', etc.토큰 한도
각 입력에는 최대 토큰 한도가 있습니다(text-embedding-3의 경우 8192개). 긴 문서는 먼저 청크로 나누어야 합니다.
차원 수 줄이기
더 적은 차원 수를 요청할 수 있습니다(Matryoshka 임베딩). 이는 저장 공간을 줄일 때 유용합니다:
resp = client.embeddings.create(
model='text-embedding-3-large',
input='Hello',
dimensions=512 # default would be 3072
)비용
작성 시점 기준:
- text-embedding-3-small: 토큰 1M개당 $0.02
- text-embedding-3-large: 토큰 1M개당 $0.13
small 모델로 단어 1M개를 임베딩하는 비용은 약 $0.025로, 사실상 무료입니다.
한 번 임베딩하고 영구적으로 재사용하기
임베딩은 다시 임베딩해도 변하지 않으므로 한 번 계산해 저장할 수 있습니다. 모든 프로덕션 시스템에서 캐싱은 필수입니다.
벡터 정규화
OpenAI 임베딩은 이미 L2 정규화되어 있습니다(길이 = 1). 따라서 코사인 유사도 = 내적이 되어 계산량을 줄일 수 있습니다:
import numpy as np
a = np.array(vec_a)
b = np.array(vec_b)
sim = np.dot(a, b) # since |a| = |b| = 1비동기 임베딩
높은 처리량이 필요하다면 비동기 클라이언트를 사용하세요:
from openai import AsyncOpenAI
import asyncio
client = AsyncOpenAI()
async def embed_batch(texts):
resp = await client.embeddings.create(
model='text-embedding-3-small',
input=texts
)
return [d.embedding for d in resp.data]
vectors = asyncio.run(embed_batch(['a', 'b', 'c']))실패 시 재시도
임베딩 호출도 다른 HTTP 호출처럼 실패할 수 있습니다. 백오프를 적용한 재시도로 감싸세요:
from tenacity import retry, wait_exponential, stop_after_attempt
@retry(wait=wait_exponential(multiplier=1, max=10), stop=stop_after_attempt(5))
def safe_embed(text):
return client.embeddings.create(model='text-embedding-3-small', input=text)임베딩 저장
일반적인 저장 방식은 세 가지입니다:
- 확장 기능
sqlite-vec을 사용하는 SQLite - 확장 기능
pgvector를 사용하는 Postgres - 전용 벡터 데이터베이스(Pinecone, Qdrant, Weaviate)
비용 파악
text-embedding-3-small로 단어 100만 개를 임베딩하는 데 드는 비용은 대략 얼마일까요?
복습
text-embedding-3-small을 선택하고, 호출을 일괄 처리하고, 벡터를 저장하면 의미 기반 검색의 기반을 갖추게 됩니다.
자주 묻는 질문
“text-embedding-3으로 임베딩 생성” 강의는 무료인가요?
네 — “text-embedding-3으로 임베딩 생성” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
“text-embedding-3으로 임베딩 생성”에서 뭘 배우나요?
OpenAI text-embedding-3-small/large를 사용해 문자열을 1536차원 또는 3072차원 벡터로 변환해보세요. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Agents을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.
“text-embedding-3으로 임베딩 생성” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 임베딩이란 무엇인가(벡터 표현)
- text-embedding-3으로 임베딩 생성
- 검색을 위한 코사인 유사도
- 임베딩 모델 비교(OpenAI, Cohere, OSS)