Aardvark — новый агент безопасности на базе GPT-5 от OpenAI
Что такое OpenAI Aardvark
OpenAI Aardvark — так называется новый автономный «агент-исследователь по безопасности» от OpenAI, работающий на модели GPT-5. Инструмент встраивается в процесс разработки, постоянно просматривает кодовую базу, ищет потенциальные уязвимости, проверяет, можно ли их реально эксплуатировать, и предлагает точечные исправления.
Главное отличие от привычных сканеров в том, что Aardvark разбирает код так, как это делал бы человек-исследователь — через логические рассуждения, а не только через сигнатуры и готовые правила.
- Сейчас агент доступен в режиме закрытой беты и умеет подключаться к GitHub и другим CI/CD-системам.
- GPT-5, на котором построен Aardvark, использует архитектуру «router model»: она сама выбирает подходящую под-модель под конкретную задачу.
- Модель поддерживает мультимодальность и расширенное контекстное рассуждение — это позволяет ей прослеживать сложные цепочки уязвимостей, включая логические ошибки, которые обычный сканер просто не увидит.
Почему это важно для команд разработки и безопасности
Уязвимостей с каждым годом находят больше, кодовые базы растут, а релизы выходят чаще. На этом фоне Aardvark меняет саму логику работы: вместо периодических проверок — непрерывный контроль.
Вот что показали исследовательские данные:
| Метрика | Значение |
|---|---|
| Доля найденных известных уязвимостей в тестовых репозиториях | ~92% |
| Тип анализа | не только сигнатуры, но и причинно-следственная логика |
| Формат результата | объяснение, проверка, предложение исправления |
В отличие от SAST/DAST-инструментов, Aardvark учитывает контекст и намерения разработчика, поэтому шума и ложных срабатываний у него заметно меньше.

Как работает агент Aardvark
- Строит модель угроз: разбирает архитектуру приложения и находит, где расположены критичные компоненты.
- Отслеживает коммиты и pull-request — мониторинг изменений идёт в фоне, без участия человека.
- Ищет логические ошибки, небезопасные функции и проблемные зависимости.
- Проверяет находку в песочнице — смотрит, можно ли уязвимость реально эксплуатировать, а не просто предполагает это.
- Формирует исправление: пишет патч, открывает pull-request и оставляет комментарии прямо в коде.
- Последнее слово остаётся за человеком — разработчик и AppSec-команда подтверждают изменения перед мёрджем.
Контекст и комментарии экспертов
Исследования по LLM-агентам фиксируют у них новые типы поведения:
- они умеют координировать использование инструментов между собой;
- способны выполнять многошаговые задачи без прямого контроля человека;
- и могут ошибаться нестандартным образом, если неверно интерпретируют контекст задачи.
В публикациях arXiv на эту тему авторы прямо пишут: такие агенты требуют прозрачности и возможности аудита, особенно если речь о безопасности.
Где Aardvark пригодится
| Сценарий применения | Польза |
|---|---|
| Большие корпоративные кодовые базы | автоматизация рутинных ревью |
| CI/CD и DevOps | уязвимости обнаруживаются до релиза |
| Финансовые и критические системы | снижает операционные риски |
| Open-source проекты | повышает качество безопасности сообщества |
Ограничения и риски
- Агент не заменяет AppSec-специалистов — он снимает с них рутину и усиливает то, что они уже делают.
- Ложные срабатывания и пропуски всё ещё возможны, особенно в сложных архитектурах.
- Решения ИИ должны оставаться прозрачными — причинно-следственные объяснения нужны, чтобы команда им доверяла.
- Доступами и средами исполнения агента нужно управлять внимательно, без поблажек.
Вывод
OpenAI Aardvark — заметный шаг к постоянному, интеллектуальному и автономному контролю безопасности.
Он не просто ищет ошибки, а объясняет их и помогает исправить, приближая команды к модели «безопасность встроена по умолчанию». Разбираться в таких находках и выстраивать процесс вокруг них — отдельная работа, и здесь она всё чаще ложится на плечи команд кибербезопасности, которые умеют читать не только отчёт ИИ, но и код за ним.
Будущее безопасной разработки всё больше зависит от связки человека и ИИ: агент масштабирует экспертизу и берёт на себя рутинный поиск, а человек принимает стратегические решения и отвечает за результат.