更新和删除向量
让索引与源数据保持同步:文档变更时执行更新插入,删除时移除,并处理重新生成嵌入。
更新和删除向量 是 CoddyKit 上的免费 AI Agents 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。
本课时的部分内容尚未翻译,以英文显示。
索引并非一成不变
真实文档会发生变化。索引必须跟上这些变化:
- 添加新文档
- 编辑现有文档
- 删除或归档旧文档
Upsert(插入或更新)
大多数向量数据库都支持 upsert——使用指定的 ID 写入向量;如果该 ID 已存在,就替换旧向量:
index.upsert([
('doc-42', new_vector, {'source': 'a.pdf', 'updated_at': now})
])
# If doc-42 already exists, it is overwritten.确定性 ID
如果使用内容哈希 ID,“更新”就会自动发生——相同内容 = 相同 ID = 相同位置。
如果使用 UUID,就必须跟踪每个 UUID 对应哪个源文档。
检测变化
要比较语料库的差异,请存储每个分块的哈希值:
old_chunks = load_existing_chunks(source)
new_chunks = chunk_doc(source)
old_hashes = {c.id for c in old_chunks}
new_hashes = {c.id for c in new_chunks}
to_delete = old_hashes - new_hashes
to_add = new_hashes - old_hashes
# Skip unchanged — saves re-embedding按过滤器删除
大多数数据库都支持按过滤器删除,这对于“删除来自此源的所有内容”很有用:
index.delete(filter={'source': '/old/file.pdf'})Delete by ID
index.delete(ids=['doc-1', 'doc-2', 'doc-3'])软删除
有时您希望在不移除内容的情况下将其“隐藏”——设置删除标记,并在执行 query 时将其过滤掉:
index.upsert([('doc-42', vec, {'deleted_at': now})])
# At query time:
results = index.query(vector=query_vec, top_k=5, filter={'deleted_at': {'$exists': False}})压实
频繁删除会使索引变得稀疏。请定期重建索引以提升性能——大多数数据库会自动执行此操作;请查阅服务商文档。
模型变更时重新生成嵌入
如果升级嵌入模型,所有现有向量都会变得不兼容。策略如下:
- 迁移期间同时写入旧集合和新集合
- 完成后,将读取流量切换到新集合
- 删除旧集合
增量管道
可靠的数据摄取管道:
def sync_doc(source_path):
new_chunks = chunk_and_hash(load(source_path))
existing_ids = index.fetch_ids_by_source(source_path)
new_ids = {c.id for c in new_chunks}
to_add = [c for c in new_chunks if c.id not in existing_ids]
to_remove = existing_ids - new_ids
if to_remove:
index.delete(ids=list(to_remove))
if to_add:
index.upsert([(c.id, embed(c.text), c.metadata) for c in to_add])审计漂移
定期验证索引是否与事实来源一致。分别统计数据库和向量索引中每个来源的行数;发现不一致时发出警报。
由 Webhook 驱动的更新
对于文档管理系统(Notion、Confluence、GDrive),请使用 Webhook 在发生变化时触发增量同步——这比重新抓取所有内容便宜得多。
使用墓碑处理分布式删除
在分布式索引中,“删除”通常会写入墓碑标记。在压实运行之前,query 可能仍然会看到该墓碑——请保留过滤器。
幂等更新
让数据摄取可以安全地重新运行,最简单的方法是什么?
回顾
从第一天起就规划更新:基于哈希的 ID、基于差异的数据摄取,以及在不中断服务的情况下替换嵌入模型的路径。
用 AI 导师学习 AI Agents — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 60
- 课程
- 239
常见问题解答
「更新和删除向量」课时是免费的吗?
是的 — 「更新和删除向量」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。
「更新和删除向量」这节课中我会学到什么?
让索引与源数据保持同步:文档变更时执行更新插入,删除时移除,并处理重新生成嵌入。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Agents 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。
「更新和删除向量」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Agents 课中编写并运行代码吗?
能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。