AI Agents · 课时

更新和删除向量

让索引与源数据保持同步:文档变更时执行更新插入,删除时移除,并处理重新生成嵌入。

第 3 / 4 课15 个步骤

更新和删除向量 是 CoddyKit 上的免费 AI Agents 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

本课时的部分内容尚未翻译,以英文显示。

索引并非一成不变

真实文档会发生变化。索引必须跟上这些变化:

  • 添加新文档
  • 编辑现有文档
  • 删除或归档旧文档

Upsert(插入或更新)

大多数向量数据库都支持 upsert——使用指定的 ID 写入向量;如果该 ID 已存在,就替换旧向量:

index.upsert([
    ('doc-42', new_vector, {'source': 'a.pdf', 'updated_at': now})
])
# If doc-42 already exists, it is overwritten.

确定性 ID

如果使用内容哈希 ID,“更新”就会自动发生——相同内容 = 相同 ID = 相同位置。

如果使用 UUID,就必须跟踪每个 UUID 对应哪个源文档。

检测变化

要比较语料库的差异,请存储每个分块的哈希值:

old_chunks = load_existing_chunks(source)
new_chunks = chunk_doc(source)

old_hashes = {c.id for c in old_chunks}
new_hashes = {c.id for c in new_chunks}

to_delete = old_hashes - new_hashes
to_add = new_hashes - old_hashes
# Skip unchanged — saves re-embedding

按过滤器删除

大多数数据库都支持按过滤器删除,这对于“删除来自此源的所有内容”很有用:

index.delete(filter={'source': '/old/file.pdf'})

Delete by ID

index.delete(ids=['doc-1', 'doc-2', 'doc-3'])

软删除

有时您希望在不移除内容的情况下将其“隐藏”——设置删除标记,并在执行 query 时将其过滤掉:

index.upsert([('doc-42', vec, {'deleted_at': now})])

# At query time:
results = index.query(vector=query_vec, top_k=5, filter={'deleted_at': {'$exists': False}})

压实

频繁删除会使索引变得稀疏。请定期重建索引以提升性能——大多数数据库会自动执行此操作;请查阅服务商文档。

模型变更时重新生成嵌入

如果升级嵌入模型,所有现有向量都会变得不兼容。策略如下:

  1. 迁移期间同时写入旧集合和新集合
  2. 完成后,将读取流量切换到新集合
  3. 删除旧集合

增量管道

可靠的数据摄取管道:

def sync_doc(source_path):
    new_chunks = chunk_and_hash(load(source_path))
    existing_ids = index.fetch_ids_by_source(source_path)

    new_ids = {c.id for c in new_chunks}
    to_add = [c for c in new_chunks if c.id not in existing_ids]
    to_remove = existing_ids - new_ids

    if to_remove:
        index.delete(ids=list(to_remove))
    if to_add:
        index.upsert([(c.id, embed(c.text), c.metadata) for c in to_add])

审计漂移

定期验证索引是否与事实来源一致。分别统计数据库和向量索引中每个来源的行数;发现不一致时发出警报。

由 Webhook 驱动的更新

对于文档管理系统(Notion、Confluence、GDrive),请使用 Webhook 在发生变化时触发增量同步——这比重新抓取所有内容便宜得多。

使用墓碑处理分布式删除

在分布式索引中,“删除”通常会写入墓碑标记。在压实运行之前,query 可能仍然会看到该墓碑——请保留过滤器。

幂等更新

让数据摄取可以安全地重新运行,最简单的方法是什么?

回顾

从第一天起就规划更新:基于哈希的 ID、基于差异的数据摄取,以及在不中断服务的情况下替换嵌入模型的路径。

免费开始

用 AI 导师学习 AI Agents — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
60
课程
239

常见问题解答

「更新和删除向量」课时是免费的吗?

是的 — 「更新和删除向量」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「更新和删除向量」这节课中我会学到什么?

让索引与源数据保持同步:文档变更时执行更新插入,删除时移除,并处理重新生成嵌入。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。

「更新和删除向量」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. Pinecone、Weaviate、Qdrant:对比
  2. 混合搜索的元数据筛选
  3. 更新和删除向量
  4. 选择距离指标(余弦、L2、点积)
← 返回 AI Agents