0Pricing
Cyber Security Academy · Урок

Риски моделей, данных и цепочки поставок

Отравление, утечки и угрозы зависимостей

«Риски моделей, данных и цепочки поставок» — бесплатный урок Cyber Security Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Cyber Security Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Cyber Security Academy содержит 4 уроков всего.

Цепочка поставок машинного обучения

Приложение на базе LLM создается из множества сторонних компонентов: базовых моделей, моделей после дообучения, наборов данных, эмбеддингов, плагинов и обычных программных зависимостей. Каждое звено может стать местом, куда злоумышленник внедрит вредоносные изменения.

В отличие от традиционного программного обеспечения, артефакты машинного обучения часто представляют собой большие непрозрачные двоичные файлы, загружаемые из общедоступных хранилищ с плохо подтвержденным происхождением. Отравленный файл весов или набор данных с внедренной лазейкой трудно обнаружить при проверке.

Защита конвейера означает отслеживание и проверку каждого компонента — от источника до боевой среды.

Отравление данных

Отравление данных изменяет данные для обучения или дообучения, чтобы исказить результирующую модель. Злоумышленник, способный добавить даже небольшую долю обучающих примеров, может заметно изменить поведение модели.

  • Атаки на доступность: снижают общую точность.
  • Целевые атаки: вызывают определенные ошибочные классификации.
  • Атаки с внедрением лазейки: встраивают скрытый триггер (см. следующую сцену).

Данные, собранные из интернета, и предоставленные пользователями документы RAG часто становятся точками входа для отравления, поскольку их много и они проходят лишь поверхностную проверку.

Бэкдоры и триггеры

Бэкдор — это атака с отравлением данных, из-за которой модель ведет себя нормально, кроме случаев, когда во входных данных появляется секретный триггер. Триггером может быть редкая фраза, последовательность токенов или шаблон водяного знака.

Пример: модель автодополнения кода, дообученная на отравленных данных, работает правильно, пока не появляется специальный комментарий, после чего выдает небезопасный код. Бэкдоры трудно обнаружить, поскольку стандартные контрольные наборы выглядят нормально.

Меры защиты: получайте модели только от надежных поставщиков, использующих подписи; выполняйте обнаружение триггеров и сканирование аномалий; проводите дообучение на проверенных данных, находящихся под Вашим контролем.

Небезопасные форматы моделей

Веса моделей — это не просто данные: некоторые форматы выполняют код при загрузке. Python pickle (используемый в старых файлах PyTorch .bin и .pt) может выполнять произвольный код во время десериализации.

Загрузка модели в ненадежном формате сериализации эквивалентна запуску ненадежной программы.

  • Предпочитайте safetensors, который хранит только тензоры и не может выполнять код.
  • Сканируйте или помещайте в песочницу любые данные сериализации, которые необходимо загрузить.
  • Считайте файлы моделей из общедоступных хранилищ ненадежными двоичными файлами.
# Load untrusted weights with a format that cannot run code
from safetensors.torch import load_file
weights = load_file("downloaded_model.safetensors")

# Avoid torch.load on untrusted .bin/.pt (pickle = code exec)

Проверка происхождения

Установите происхождение каждого артефакта и убедитесь, что его не изменяли.

  • Фиксируйте точные версии и редакции моделей и наборов данных, никогда не используйте latest.
  • Проверяйте контрольные суммы или хеши по известному заведомо корректному значению.
  • Предпочитайте подписанные артефакты; проверяйте подписи, если издатель их предоставляет.
  • Ведите перечень компонентов машинного обучения (BOM), содержащий модели, наборы данных и их источники.
# Verify a downloaded model file before use
sha256sum downloaded_model.safetensors
# compare against the publisher's published digest
# abort the pipeline on mismatch

Утечка данных обучения

Модели могут запоминать, а затем воспроизводить части обучающих данных, включая секреты, PII или защищенный авторским правом текст. Злоумышленники используют атаки на извлечение, чтобы побудить модель раскрыть это содержимое.

  • Удаляйте PII и секреты из корпусов для обучения и дообучения.
  • Применяйте дедупликацию: запоминание коррелирует с повторяющимися примерами.
  • Рассмотрите методы дифференциальной конфиденциальности для чувствительных наборов данных.
  • Проверяйте модели с помощью запросов на извлечение до их выпуска.

Атаки на членство и инверсию

Две атаки на конфиденциальность нацелены на развернутые модели:

  • Определение членства: установление того, входила ли конкретная запись в обучающий набор. Само по себе это может быть нарушением конфиденциальности (например, в медицинском наборе данных).
  • Инверсия модели: восстановление характерных входных данных обучения по поведению модели или эмбеддингам.

Снизить риск можно, ограничив раскрытие оценок уверенности, добавив регуляризацию или дифференциальную конфиденциальность и ограничив неограниченный доступ к запросам к особо ценным моделям.

Риски эмбеддингов и векторных хранилищ

Системы RAG хранят эмбеддинги документов в векторной базе данных. Это создает собственные риски:

  • Инверсия эмбеддингов: эмбеддинги могут раскрыть достаточно данных для частичного восстановления исходного текста, поэтому сами являются чувствительными данными.
  • Утечка между арендаторами: извлечение без контроля доступа может показать документы другого арендатора.
  • Отравление индекса: добавленный в индекс вредоносный документ может перехватить последующие операции извлечения (косвенная инъекция).

Обеспечивайте контроль доступа во время извлечения и проверяйте документы до их индексирования.

Риски зависимостей и плагинов

Помимо моделей, приложения на базе LLM зависят от обычной цепочки поставок программного обеспечения, а также от плагинов и соединителей, которые предоставляют модели новые возможности.

  • Вредоносный или скомпрометированный плагин может читать контекст и похищать данные.
  • Пакеты PyPI/npm, имена которых подменены с использованием опечаток, или захваченные пакеты могут внедрить бэкдор в приложение.
  • Уязвимые транзитивные зависимости расширяют поверхность атаки.

Используйте файлы блокировки, сканируйте зависимости с помощью инструментов SCA, проверяйте разрешения плагинов и предпочитайте проверенные источники с цифровыми подписями.

Защита конвейера

Относитесь к конвейеру машинного обучения как к любому другому рабочему пути CI/CD с надежными средствами контроля:

  • Изолируйте среды обучения и дообучения; ограничьте круг лиц, которые могут отправлять данные.
  • Подписывайте и проверяйте артефакты на каждом этапе; отклоняйте неподписанные артефакты и артефакты с несоответствиями.
  • Проверяйте наборы данных с помощью обнаружения аномалий и проверки происхождения.
  • Непрерывно отслеживайте развернутые модели на предмет дрейфа и неожиданного поведения.

Такие платформы, как MITRE ATLAS и NIST RMF для ИИ, помогают структурировать эти средства контроля.

Собираем все вместе

Безопасность моделей, данных и цепочки поставок — это доверие и проверка на протяжении всего жизненного цикла:

  • Знайте свои источники (происхождение, подписи, перечень компонентов машинного обучения).
  • Считайте веса моделей и наборы данных потенциально вредоносными, пока они не проверены.
  • Защищайте конфиденциальность от утечек, определения членства и инверсии.
  • Защищайте зависимости, плагины и векторные хранилища.

Самое дешевое место для остановки отравленного артефакта — до того, как он попадет в Ваш конвейер.

Быстрая проверка

Проверьте, насколько хорошо Вы понимаете безопасность цепочки поставок моделей.

Итоги

Риски моделей, данных и цепочки поставок:

  • Цепочка поставок машинного обучения охватывает базовые модели, модели после дообучения, наборы данных, эмбеддинги, плагины и зависимости.
  • Отравление и бэкдоры искажают обучение; проверяйте источники данных и подписывайте их.
  • Избегайте небезопасных форматов pickle; для ненадежных весов предпочитайте safetensors.
  • Проверяйте происхождение с помощью версий, контрольных сумм, подписей и перечня компонентов машинного обучения.
  • Защищайте конфиденциальность от утечек, определения членства и инверсии; защищайте эмбеддинги и векторные хранилища.
  • Ограничивайте зависимости и плагины; защищайте конвейер от начала до конца, используя ATLAS и NIST RMF для ИИ в качестве руководств.

Часто задаваемые вопросы

Урок «Риски моделей, данных и цепочки поставок» бесплатный?

Да — полный текст урока «Риски моделей, данных и цепочки поставок» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Cyber Security Academy, подпишись на CoddyKit PRO. Курс Cyber Security Academy содержит 4 уроков всего.

Чему я научусь в уроке «Риски моделей, данных и цепочки поставок»?

Отравление, утечки и угрозы зависимостей Ты практикуешь Cyber Security Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Cyber Security Academy?

Предыдущий опыт не требуется. Cyber Security Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Риски моделей, данных и цепочки поставок»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Cyber Security Academy?

Да. Каждый урок Cyber Security Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Инъекция подсказок и джейлбрейки
  2. Топ-10 рисков LLM по версии OWASP
  3. Защита агентов искусственного интеллекта и использования инструментов
  4. Риски моделей, данных и цепочки поставок
← Назад к Cyber Security Academy