ベクトルの更新と削除
インデックスをデータソースと同期します。ドキュメント変更時はupsert、削除時はdeleteを行い、再Embeddingにも対応します。
「ベクトルの更新と削除」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン3/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
このレッスンの一部はまだ翻訳されておらず、英語で表示されています。
インデックスは固定されたものではない
実際のドキュメントは変化します。インデックスもそれに追従しなければなりません。
- 新しいドキュメントが追加される
- 既存のドキュメントが編集される
- 古いドキュメントが削除またはアーカイブされる
Upsert(挿入または更新)
ほとんどのベクトルDBはupsertに対応しています。指定したIDでベクトルを書き込み、すでに存在する場合は古いものを置き換えます。
index.upsert([
('doc-42', new_vector, {'source': 'a.pdf', 'updated_at': now})
])
# If doc-42 already exists, it is overwritten.決定論的なID
コンテンツハッシュIDを使えば、「更新」が自動的に発生します。同じコンテンツ = 同じID = 同じ保存場所となるためです。
UUIDを使う場合は、どのUUIDがどの元ドキュメントに対応するかを追跡する必要があります。
変更の検出
コーパスの差分を取るには、すべてのチャンクのハッシュを保存します。
old_chunks = load_existing_chunks(source)
new_chunks = chunk_doc(source)
old_hashes = {c.id for c in old_chunks}
new_hashes = {c.id for c in new_chunks}
to_delete = old_hashes - new_hashes
to_add = new_hashes - old_hashes
# Skip unchanged — saves re-embeddingフィルターによる削除
ほとんどのDBはフィルターによる削除に対応しており、「このソースに由来するものをすべて削除する」といった用途に便利です。
index.delete(filter={'source': '/old/file.pdf'})Delete by ID
index.delete(ids=['doc-1', 'doc-2', 'doc-3'])論理削除
削除せずに「非表示」にしたい場合もあります。その場合はdeleted_atフラグを設定し、クエリ時にフィルタリングして除外します。
index.upsert([('doc-42', vec, {'deleted_at': now})])
# At query time:
results = index.query(vector=query_vec, top_k=5, filter={'deleted_at': {'$exists': False}})コンパクション
頻繁に削除すると、インデックスが疎になります。性能を保つために定期的に再構築してください。ほとんどのDBでは自動的に行われますが、利用しているプロバイダーのドキュメントを確認してください。
モデル変更時の再埋め込み
埋め込みモデルをアップグレードすると、既存のすべてのベクトルが互換性を失います。方法は次のとおりです。
- 移行中は古いコレクションと新しいコレクションに二重書き込みする
- 完了したら読み取りトラフィックを新しいコレクションへ切り替える
- 古いコレクションを削除する
増分パイプライン
堅牢な取り込みパイプラインは次のようになります。
def sync_doc(source_path):
new_chunks = chunk_and_hash(load(source_path))
existing_ids = index.fetch_ids_by_source(source_path)
new_ids = {c.id for c in new_chunks}
to_add = [c for c in new_chunks if c.id not in existing_ids]
to_remove = existing_ids - new_ids
if to_remove:
index.delete(ids=list(to_remove))
if to_add:
index.upsert([(c.id, embed(c.text), c.metadata) for c in to_add])ドリフトの監査
インデックスが信頼できる情報源と一致していることを定期的に検証します。DBとベクトルインデックスの両方でソースごとの行数を数え、不一致があればアラートを出します。
Webhookによる更新
ドキュメント管理システム(Notion、Confluence、GDrive)では、変更時にWebhookで増分同期を開始します。すべてを再クロールするよりも、はるかに低コストです。
分散削除のためのトゥームストーン
分散インデックスでは、「削除」によってトゥームストーンマーカーが書き込まれることがよくあります。コンパクションが実行されるまでは、クエリからそのトゥームストーンが見える可能性があるため、フィルターを適用し続けてください。
冪等な更新
取り込みを安全に再実行できるようにする最も簡単な方法は何でしょうか。
まとめ
初日から更新に備えてください。ハッシュベースのID、差分ベースの取り込み、そしてダウンタイムなしで埋め込みモデルを切り替える方法を用意します。
AI チューターと学ぶ AI Agents — 無料
ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。
- コース
- 60
- レッスン
- 239
よくある質問
「ベクトルの更新と削除」レッスンは無料ですか?
はい。「ベクトルの更新と削除」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「ベクトルの更新と削除」で何を学びますか?
インデックスをデータソースと同期します。ドキュメント変更時はupsert、削除時はdeleteを行い、再Embeddingにも対応します。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン3/4です。
「ベクトルの更新と削除」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。