Безопасность

Всего 250 документов могут отравить любую модель ИИ

Как 250 документов способны отравить модель ИИ

Отравление модели ИИ оказалось куда доступнее, чем считалось. Исследователи из Anthropic, Института безопасности ИИ Великобритании и Института Алана Тьюринга показали: чтобы внедрить бэкдор в языковую модель, хватает всего 250 вредоносных документов — и это работает что для модели на 600 миллионов параметров, что для модели на 13 миллиардов. Идею о том, что атакующему нужен контроль над процентом обучающих данных, эта работа переворачивает с ног на голову.

Что такое отравление данных

Атака отравлением — это когда злоумышленник намеренно подмешивает вредоносные или искажённые данные в обучающий набор модели, чтобы управлять её поведением. Через отравленные данные внедряют бэкдоры: модель ведёт себя штатно, пока не встретит триггерную фразу, а затем, например, начинает предлагать вредоносный код.

Ключевые результаты исследования

Фиксированное число вместо процента

Исследование ломает распространённое предположение, что атакующим нужно контролировать определённую долю обучающих данных. На деле хватает небольшого фиксированного количества документов — и дальше масштаб датасета уже не имеет значения.

Критические цифры:

  • 250 вредоносных документов — порог, за которым атака срабатывает стабильно
  • 0,00016% — доля этих документов от общего датасета модели с 13 миллиардами параметров
  • 420 000 токенов — суммарный объём данных в 250 документах
  • 100% успех — показатель эффективности при использовании 250+ документов

Размер модели роли не играет

Модель на 13 миллиардов параметров обучается более чем на 20-кратном объёме данных по сравнению с моделью на 600 миллионов, но обе одинаково уязвимы к одному и тому же небольшому числу отравленных документов. То есть атака масштабируется независимо от размера модели, а не пропорционально ему.

Как устроена атака

Исследователи собирали отравленные документы так: начинали с легитимного текста из общедоступных источников, добавляли триггерную фразу <SUDO>, а после неё — от 400 до 900 токенов бессмысленного текста, сэмплированного из словаря модели.

Протестированные модели:

  • Pythia (600M параметров)
  • Различные размеры до 13B параметров
  • Llama 3.1
  • GPT-3.5 Turbo

Масштаб проблемы: цифры для контекста

Современные модели ИИ

Современные модели ИИ:

  • GPT-4 содержит ~1,76 триллиона параметров (по оценкам)
  • Claude 3 Opus содержит сотни миллиардов параметров
  • Средняя современная модель обучается на триллионах токенов

Стоимость обучения:

  • Обучение GPT-4 оценивается в $100+ миллионов
  • Переобучение модели после обнаружения отравления практически невозможно
  • Найти 250 вредоносных документов в датасете из миллиардов — задача сродни поиску иголки в стоге сена

Практические последствия

Особенно это касается компаний, которые строят специализированные модели: берут небольшую базовую модель (часто 13 миллиардов параметров или меньше) и дообучают на собственных документах под свою задачу. Стоит атакующему отравить эти обучающие материалы — и создание специализированных моделей превращается в источник рисков, а не только конкурентное преимущество.

Глобальный контекст безопасности ИИ

Статистика угроз в 2025 году:

  • 80% программ-вымогателей используют элементы ИИ
  • 97% точность обнаружения вредоносных уязвимостей чипов с помощью ИИ
  • Агентские ИИ могут быть скомпрометированы атаками нулевого клика

Аналогия масштаба: сами исследователи сравнили это с чашкой чернил, влитой в водохранилище.

Почему это опасно

Эксперт по безопасности отмечает: «Проблема асимметрии фундаментальна: обучение легко, разобучение невозможно. Мы не можем определить, какие 250 документов вызвали отравление, или устранить их влияние без полного переобучения.»

Потенциальные риски:

  1. Утечка конфиденциальных данных — через скрытые бэкдоры
  2. Генерация вредоносного кода — при определённых триггерах
  3. Обход систем безопасности — встроенные уязвимости
  4. Деградация производительности — систематическое снижение качества ответов

Как защититься от отравления данных

Диана Келли, директор по информационной безопасности Noma Security, считает, что защита строится вокруг всего жизненного цикла ИИ: контроль доступа к источникам данных, к моделям, санитарная обработка данных. «Ограничение того, кто и что может передавать данные в конвейеры, проверка происхождения и постоянная валидация того, что данные остаются чистыми — ключевые элементы.»

Рекомендации по защите:

  1. Отслеживание происхождения данных
  2. Аутентификация источников
  3. Автоматическое сканирование на наличие вредоносных данных
  4. Непрерывная валидация качества данных
  5. Многоуровневая проверка перед включением в обучающий набор — по сути тот же аудит безопасности, только применительно к данным, а не к коду

Ограничения исследования

Работа сфокусирована на узком типе бэкдора — генерации бессмысленного текста, — который вряд ли представляет серьёзную угрозу в передовых моделях. Тем не менее результаты публикуются открыто: они показывают, что атаки отравлением данных практичнее, чем считалось, и должны подстегнуть дальнейшие исследования защиты.

Открытые вопросы:

  • Будет ли тот же паттерн действовать для более крупных «пограничных» моделей?
  • Работает ли фиксированное число для более опасных типов бэкдоров?
  • Можно ли разработать эффективные методы обнаружения отравленных данных?

Что в итоге

Это тревожный сигнал для всей индустрии ИИ. Пока компании стремительно выкатывают всё более мощные языковые модели, безопасность обучающих данных превращается из теоретического вопроса в практический: отравление модели ИИ больше не требует ресурсов крупной группировки, хватит горстки документов.

Anthropic признаёт: публикация этих результатов несёт свои риски, но считает, что открытое обсуждение перевешивает опасения. У атак отравлением есть особенность, играющая на руку защите — атакующий выбирает отравленные образцы до того, как защитник сможет адаптивно проверить датасет, а значит внимание к практичности таких атак способно мотивировать защитников действовать на опережение.


Источники: Anthropic Research, Dark Reading, UK AI Security Institute, The Alan Turing Institute, SecurityLab.Pro

Дата исследования: Октябрь 2025

Протестированные модели: Pythia, Llama 3.1, GPT-3.5 Turbo (от 600M до 13B параметров)

Прокрутить вверх