Всего 250 документов могут отравить любую модель ИИ

Как 250 документов способны отравить модель ИИ
Отравление модели ИИ оказалось куда доступнее, чем считалось. Исследователи из Anthropic, Института безопасности ИИ Великобритании и Института Алана Тьюринга показали: чтобы внедрить бэкдор в языковую модель, хватает всего 250 вредоносных документов — и это работает что для модели на 600 миллионов параметров, что для модели на 13 миллиардов. Идею о том, что атакующему нужен контроль над процентом обучающих данных, эта работа переворачивает с ног на голову.
Что такое отравление данных
Атака отравлением — это когда злоумышленник намеренно подмешивает вредоносные или искажённые данные в обучающий набор модели, чтобы управлять её поведением. Через отравленные данные внедряют бэкдоры: модель ведёт себя штатно, пока не встретит триггерную фразу, а затем, например, начинает предлагать вредоносный код.
Ключевые результаты исследования
Фиксированное число вместо процента
Исследование ломает распространённое предположение, что атакующим нужно контролировать определённую долю обучающих данных. На деле хватает небольшого фиксированного количества документов — и дальше масштаб датасета уже не имеет значения.
Критические цифры:
- 250 вредоносных документов — порог, за которым атака срабатывает стабильно
- 0,00016% — доля этих документов от общего датасета модели с 13 миллиардами параметров
- 420 000 токенов — суммарный объём данных в 250 документах
- 100% успех — показатель эффективности при использовании 250+ документов
Размер модели роли не играет
Модель на 13 миллиардов параметров обучается более чем на 20-кратном объёме данных по сравнению с моделью на 600 миллионов, но обе одинаково уязвимы к одному и тому же небольшому числу отравленных документов. То есть атака масштабируется независимо от размера модели, а не пропорционально ему.
Как устроена атака
Исследователи собирали отравленные документы так: начинали с легитимного текста из общедоступных источников, добавляли триггерную фразу <SUDO>, а после неё — от 400 до 900 токенов бессмысленного текста, сэмплированного из словаря модели.
Протестированные модели:
- Pythia (600M параметров)
- Различные размеры до 13B параметров
- Llama 3.1
- GPT-3.5 Turbo
Масштаб проблемы: цифры для контекста
Современные модели ИИ
Современные модели ИИ:
- GPT-4 содержит ~1,76 триллиона параметров (по оценкам)
- Claude 3 Opus содержит сотни миллиардов параметров
- Средняя современная модель обучается на триллионах токенов
Стоимость обучения:
- Обучение GPT-4 оценивается в $100+ миллионов
- Переобучение модели после обнаружения отравления практически невозможно
- Найти 250 вредоносных документов в датасете из миллиардов — задача сродни поиску иголки в стоге сена
Практические последствия
Особенно это касается компаний, которые строят специализированные модели: берут небольшую базовую модель (часто 13 миллиардов параметров или меньше) и дообучают на собственных документах под свою задачу. Стоит атакующему отравить эти обучающие материалы — и создание специализированных моделей превращается в источник рисков, а не только конкурентное преимущество.
Глобальный контекст безопасности ИИ
Статистика угроз в 2025 году:
- 80% программ-вымогателей используют элементы ИИ
- 97% точность обнаружения вредоносных уязвимостей чипов с помощью ИИ
- Агентские ИИ могут быть скомпрометированы атаками нулевого клика
Аналогия масштаба: сами исследователи сравнили это с чашкой чернил, влитой в водохранилище.
Почему это опасно
Эксперт по безопасности отмечает: «Проблема асимметрии фундаментальна: обучение легко, разобучение невозможно. Мы не можем определить, какие 250 документов вызвали отравление, или устранить их влияние без полного переобучения.»
Потенциальные риски:
- Утечка конфиденциальных данных — через скрытые бэкдоры
- Генерация вредоносного кода — при определённых триггерах
- Обход систем безопасности — встроенные уязвимости
- Деградация производительности — систематическое снижение качества ответов
Как защититься от отравления данных
Диана Келли, директор по информационной безопасности Noma Security, считает, что защита строится вокруг всего жизненного цикла ИИ: контроль доступа к источникам данных, к моделям, санитарная обработка данных. «Ограничение того, кто и что может передавать данные в конвейеры, проверка происхождения и постоянная валидация того, что данные остаются чистыми — ключевые элементы.»
Рекомендации по защите:
- Отслеживание происхождения данных
- Аутентификация источников
- Автоматическое сканирование на наличие вредоносных данных
- Непрерывная валидация качества данных
- Многоуровневая проверка перед включением в обучающий набор — по сути тот же аудит безопасности, только применительно к данным, а не к коду
Ограничения исследования
Работа сфокусирована на узком типе бэкдора — генерации бессмысленного текста, — который вряд ли представляет серьёзную угрозу в передовых моделях. Тем не менее результаты публикуются открыто: они показывают, что атаки отравлением данных практичнее, чем считалось, и должны подстегнуть дальнейшие исследования защиты.
Открытые вопросы:
- Будет ли тот же паттерн действовать для более крупных «пограничных» моделей?
- Работает ли фиксированное число для более опасных типов бэкдоров?
- Можно ли разработать эффективные методы обнаружения отравленных данных?
Что в итоге
Это тревожный сигнал для всей индустрии ИИ. Пока компании стремительно выкатывают всё более мощные языковые модели, безопасность обучающих данных превращается из теоретического вопроса в практический: отравление модели ИИ больше не требует ресурсов крупной группировки, хватит горстки документов.
Anthropic признаёт: публикация этих результатов несёт свои риски, но считает, что открытое обсуждение перевешивает опасения. У атак отравлением есть особенность, играющая на руку защите — атакующий выбирает отравленные образцы до того, как защитник сможет адаптивно проверить датасет, а значит внимание к практичности таких атак способно мотивировать защитников действовать на опережение.
Источники: Anthropic Research, Dark Reading, UK AI Security Institute, The Alan Turing Institute, SecurityLab.Pro
Дата исследования: Октябрь 2025
Протестированные модели: Pythia, Llama 3.1, GPT-3.5 Turbo (от 600M до 13B параметров)