ИИ

Aardvark — новый агент безопасности на базе GPT-5 от OpenAI

Что такое OpenAI Aardvark

OpenAI Aardvark — так называется новый автономный «агент-исследователь по безопасности» от OpenAI, работающий на модели GPT-5. Инструмент встраивается в процесс разработки, постоянно просматривает кодовую базу, ищет потенциальные уязвимости, проверяет, можно ли их реально эксплуатировать, и предлагает точечные исправления.

Главное отличие от привычных сканеров в том, что Aardvark разбирает код так, как это делал бы человек-исследователь — через логические рассуждения, а не только через сигнатуры и готовые правила.

  • Сейчас агент доступен в режиме закрытой беты и умеет подключаться к GitHub и другим CI/CD-системам.
  • GPT-5, на котором построен Aardvark, использует архитектуру «router model»: она сама выбирает подходящую под-модель под конкретную задачу.
  • Модель поддерживает мультимодальность и расширенное контекстное рассуждение — это позволяет ей прослеживать сложные цепочки уязвимостей, включая логические ошибки, которые обычный сканер просто не увидит.

Почему это важно для команд разработки и безопасности

Уязвимостей с каждым годом находят больше, кодовые базы растут, а релизы выходят чаще. На этом фоне Aardvark меняет саму логику работы: вместо периодических проверок — непрерывный контроль.

Вот что показали исследовательские данные:

МетрикаЗначение
Доля найденных известных уязвимостей в тестовых репозиториях~92%
Тип анализане только сигнатуры, но и причинно-следственная логика
Формат результатаобъяснение, проверка, предложение исправления

В отличие от SAST/DAST-инструментов, Aardvark учитывает контекст и намерения разработчика, поэтому шума и ложных срабатываний у него заметно меньше.


Как работает агент Aardvark

  1. Строит модель угроз: разбирает архитектуру приложения и находит, где расположены критичные компоненты.
  2. Отслеживает коммиты и pull-request — мониторинг изменений идёт в фоне, без участия человека.
  3. Ищет логические ошибки, небезопасные функции и проблемные зависимости.
  4. Проверяет находку в песочнице — смотрит, можно ли уязвимость реально эксплуатировать, а не просто предполагает это.
  5. Формирует исправление: пишет патч, открывает pull-request и оставляет комментарии прямо в коде.
  6. Последнее слово остаётся за человеком — разработчик и AppSec-команда подтверждают изменения перед мёрджем.

Контекст и комментарии экспертов

Исследования по LLM-агентам фиксируют у них новые типы поведения:

  • они умеют координировать использование инструментов между собой;
  • способны выполнять многошаговые задачи без прямого контроля человека;
  • и могут ошибаться нестандартным образом, если неверно интерпретируют контекст задачи.

В публикациях arXiv на эту тему авторы прямо пишут: такие агенты требуют прозрачности и возможности аудита, особенно если речь о безопасности.


Где Aardvark пригодится

Сценарий примененияПольза
Большие корпоративные кодовые базыавтоматизация рутинных ревью
CI/CD и DevOpsуязвимости обнаруживаются до релиза
Финансовые и критические системыснижает операционные риски
Open-source проектыповышает качество безопасности сообщества

Ограничения и риски

  • Агент не заменяет AppSec-специалистов — он снимает с них рутину и усиливает то, что они уже делают.
  • Ложные срабатывания и пропуски всё ещё возможны, особенно в сложных архитектурах.
  • Решения ИИ должны оставаться прозрачными — причинно-следственные объяснения нужны, чтобы команда им доверяла.
  • Доступами и средами исполнения агента нужно управлять внимательно, без поблажек.

Вывод

OpenAI Aardvark — заметный шаг к постоянному, интеллектуальному и автономному контролю безопасности.
Он не просто ищет ошибки, а объясняет их и помогает исправить, приближая команды к модели «безопасность встроена по умолчанию». Разбираться в таких находках и выстраивать процесс вокруг них — отдельная работа, и здесь она всё чаще ложится на плечи команд кибербезопасности, которые умеют читать не только отчёт ИИ, но и код за ним.

Будущее безопасной разработки всё больше зависит от связки человека и ИИ: агент масштабирует экспертизу и берёт на себя рутинный поиск, а человек принимает стратегические решения и отвечает за результат.

Прокрутить вверх