0Pricing
AI Agents · Урок

Обновление и удаление векторов

Синхронизируйте индекс с источником: выполняйте upsert при изменении документа, удаляйте данные при его удалении и обрабатывайте повторное создание эмбеддингов.

«Обновление и удаление векторов» — бесплатный урок AI Agents на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Индекс не статичен

Реальные документы меняются. Индекс должен обновляться вслед за ними:

  • Добавление новых документов
  • Редактирование существующих документов
  • Удаление или архивирование старых документов

Upsert (вставка или обновление)

Большинство векторных БД поддерживает upsert — записывает вектор с указанным ID, заменяя старый, если он существует:

index.upsert([
    ('doc-42', new_vector, {'source': 'a.pdf', 'updated_at': now})
])
# If doc-42 already exists, it is overwritten.

Детерминированные идентификаторы

Если вы используете идентификаторы на основе хеша содержимого, «обновление» происходит автоматически — одинаковое содержимое = тот же ID = тот же слот.

Если вы используете UUID, необходимо отслеживать, какому исходному документу соответствует каждый UUID.

Обнаружение изменений

Чтобы определить различия в корпусе, храните хеш каждого фрагмента:

old_chunks = load_existing_chunks(source)
new_chunks = chunk_doc(source)

old_hashes = {c.id for c in old_chunks}
new_hashes = {c.id for c in new_chunks}

to_delete = old_hashes - new_hashes
to_add = new_hashes - old_hashes
# Skip unchanged — saves re-embedding

Удаление по фильтру

Большинство БД поддерживает удаление по фильтру, что удобно для «удалить всё из этого источника»:

index.delete(filter={'source': '/old/file.pdf'})

Delete by ID

index.delete(ids=['doc-1', 'doc-2', 'doc-3'])

Мягкое удаление

Иногда нужно «скрыть» данные, не удаляя их — установите признак времени удаления и отфильтруйте записи во время запроса:

index.upsert([('doc-42', vec, {'deleted_at': now})])

# At query time:
results = index.query(vector=query_vec, top_k=5, filter={'deleted_at': {'$exists': False}})

Уплотнение

Частые удаления делают индекс разреженным. Периодически перестраивайте его для повышения производительности — большинство БД делает это автоматически; ознакомьтесь с документацией вашего поставщика.

Повторное построение эмбеддингов при смене модели

При обновлении модели эмбеддингов каждый существующий вектор становится несовместимым. Стратегии:

  1. Выполнять двойную запись в старую и новую коллекции во время миграции
  2. Переключить чтение на новую коллекцию после завершения
  3. Удалить старую коллекцию

Инкрементальный конвейер

Надёжный конвейер загрузки данных:

def sync_doc(source_path):
    new_chunks = chunk_and_hash(load(source_path))
    existing_ids = index.fetch_ids_by_source(source_path)

    new_ids = {c.id for c in new_chunks}
    to_add = [c for c in new_chunks if c.id not in existing_ids]
    to_remove = existing_ids - new_ids

    if to_remove:
        index.delete(ids=list(to_remove))
    if to_add:
        index.upsert([(c.id, embed(c.text), c.metadata) for c in to_add])

Проверка расхождений

Периодически проверяйте, соответствует ли индекс источнику истины. Подсчитывайте число строк для каждого источника и в вашей БД, и в векторном индексе; при расхождении отправляйте оповещение.

Обновления по вебхукам

Для систем управления документами (Notion, Confluence, GDrive) используйте вебхуки, чтобы при изменении запускать инкрементальную синхронизацию — это гораздо дешевле, чем заново обходить всё содержимое.

Маркеры удаления для распределённых индексов

В распределённых индексах «удаление» часто записывает служебный маркер удаления. Пока не выполнено уплотнение, запросы всё ещё могут видеть этот маркер — не убирайте свои фильтры.

Идемпотентные обновления

Как проще всего сделать повторный запуск загрузки данных безопасным?

Итоги

Планируйте обновления с самого начала: идентификаторы на основе хешей, загрузка с определением различий и возможность заменить модели эмбеддингов без простоя.

Часто задаваемые вопросы

Урок «Обновление и удаление векторов» бесплатный?

Да — полный текст урока «Обновление и удаление векторов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Обновление и удаление векторов»?

Синхронизируйте индекс с источником: выполняйте upsert при изменении документа, удаляйте данные при его удалении и обрабатывайте повторное создание эмбеддингов. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.

Сколько времени занимает урок «Обновление и удаление векторов»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Pinecone, Weaviate, Qdrant: сравнение
  2. Фильтрация метаданных для гибридного поиска
  3. Обновление и удаление векторов
  4. Выбор метрик расстояния (cosine, L2, dot)
← Назад к AI Agents