0Pricing
AI Agents · 课时

使用 text-embedding-3 生成嵌入

使用 OpenAI text-embedding-3-small/large 将字符串转换为 1536 维或 3072 维向量。

使用 text-embedding-3 生成嵌入 是 CoddyKit 上的免费 AI Agents 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

OpenAI 嵌入模型

OpenAI 提供两种用于生产环境的嵌入模型:

  • text-embedding-3-small — 1536 维,便宜、快速
  • text-embedding-3-large — 3072 维,质量更高、速度更慢

大多数情况下请使用小模型;只有当质量比成本更重要时,才使用大模型。

您的第一个嵌入

只需一行 SDK 代码:

from openai import OpenAI
client = OpenAI()

resp = client.embeddings.create(
    model='text-embedding-3-small',
    input='Hello, world!'
)
vector = resp.data[0].embedding
print(len(vector))      # 1536

批量嵌入

接口支持列表调用——比逐个调用快得多:

texts = ['cat', 'dog', 'pizza', 'sushi']
resp = client.embeddings.create(
    model='text-embedding-3-small',
    input=texts
)
vectors = [d.embedding for d in resp.data]
# vectors[0] is for 'cat', vectors[1] for 'dog', etc.

令牌限制

每个输入都有最大令牌限制(text-embedding-3 为 8192)。长文档必须先进行分块。

降低维度

您可以请求更少的维度(Matryoshka 嵌入),这对节省存储空间很有用:

resp = client.embeddings.create(
    model='text-embedding-3-large',
    input='Hello',
    dimensions=512    # default would be 3072
)

成本

截至本文撰写时:

  • text-embedding-3-small:每 100 万个令牌 0.02 美元
  • text-embedding-3-large:每 100 万个令牌 0.13 美元

使用小模型嵌入 100 万个单词约需 0.025 美元,基本可以忽略不计。

嵌入一次,永久复用

嵌入在重复生成时不会发生变化,因此您可以计算一次后将其存储起来。缓存对于任何生产系统都至关重要。

向量归一化

OpenAI 嵌入已经经过 L2 归一化(长度 = 1)。这意味着余弦相似度 = 点积,可以节省计算量:

import numpy as np
a = np.array(vec_a)
b = np.array(vec_b)
sim = np.dot(a, b)     # since |a| = |b| = 1

异步嵌入

如需高吞吐量,请使用异步客户端:

from openai import AsyncOpenAI
import asyncio

client = AsyncOpenAI()

async def embed_batch(texts):
    resp = await client.embeddings.create(
        model='text-embedding-3-small',
        input=texts
    )
    return [d.embedding for d in resp.data]

vectors = asyncio.run(embed_batch(['a', 'b', 'c']))

失败时重试

嵌入调用和任何 HTTP 调用一样可能失败。请使用带退避的重试机制进行封装:

from tenacity import retry, wait_exponential, stop_after_attempt

@retry(wait=wait_exponential(multiplier=1, max=10), stop=stop_after_attempt(5))
def safe_embed(text):
    return client.embeddings.create(model='text-embedding-3-small', input=text)

存储嵌入

三种常见的存储选项:

  • 使用 sqlite-vec 扩展的 SQLite
  • 使用 pgvector 扩展的 Postgres
  • 专用向量数据库(Pinecone、Qdrant、Weaviate)

成本意识

使用 text-embedding-3-small 嵌入 100 万个单词,大约需要多少费用?

回顾

选择 text-embedding-3-small,批量调用接口,存储向量,这样您就拥有了语义搜索的基础。

常见问题解答

「使用 text-embedding-3 生成嵌入」课时是免费的吗?

是的 — 「使用 text-embedding-3 生成嵌入」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「使用 text-embedding-3 生成嵌入」这节课中我会学到什么?

使用 OpenAI text-embedding-3-small/large 将字符串转换为 1536 维或 3072 维向量。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。

「使用 text-embedding-3 生成嵌入」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 什么是嵌入(向量表示)
  2. 使用 text-embedding-3 生成嵌入
  3. 用于检索的余弦相似度
  4. 嵌入模型对比(OpenAI、Cohere 与 OSS)
← 返回 AI Agents