+38/050/370-3627
+38/093/220-0872
+38/044/257-2444
Новости

Aikido Security опубликовала результаты тестирования ведущих ИИ-моделей на способность обнаруживать известные уязвимости

Aikido Security опубликовала результаты тестирования ведущих ИИ-моделей на способность обнаруживать известные уязвимости

Aikido Security опубликовала результаты масштабного независимого тестирования 13 ведущих ИИ-моделей на способность обнаруживать известные уязвимости (CVE) в реальных репозиториях. Тест показал, что модель GPT-5.6 достигла наивысшего результата, обнаружив 88.5% багов. Также Aikido Security зафиксировала резкий рост использования ИИ-инструментов среди разработчиков, что привело к увеличению технического долга в компаниях.

  • GPT-5.6 демонстрирует наивысший показатель полноты обнаружения, достигнув 23/26, опережая grok-4.5 (20), модели Claude Opus (15–18) и все остальные протестированные нами модели. Это означает, что она способна повторно обнаружить 88,5% уязвимостей CVE.
  • Самый дорогой вариант не обязателен. Более дешевые варианты GPT-5.6 показывают результаты, отличающиеся от флагманской модели всего на один-два пункта, при этом обходятся значительно дешевле, а объединение нескольких циклов работы модели среднего уровня сопоставимо с одним циклом работы флагманской модели.
  • Результаты моделирования непоследовательны, но объединение результатов позволяет им выигрывать. Любой отдельный запуск пропускает ошибки, которые он бы обнаружил в другом запуске; запуск модели несколько раз и объединение результатов (pass@3) гарантированно превосходит один проход более мощной и дорогостоящей модели.
  • Вес в открытом состоянии быстро растет. GLM-5.2 уже восстанавливает 59% набора (16/26), занимая среднюю позицию среди фирменных моделей.

Теперь каждый запуск новой модели сопровождается одним и тем же заявлением о кибербезопасности: она находит уязвимости . Но работает ли она на реальной ошибке в реальном репозитории или только на тщательно подобранном примере? Из десятка доступных моделей, какой из них заслуживает доверия при проверке кода? И поскольку самые надежные модели стоят в десять раз или больше за запуск, чем самые дешевые, что на самом деле дают эти дополнительные затраты в плане найденных ошибок?

Легко ранжировать модели по их основным возможностям и объявить самую дорогую победителем, но более важный вопрос заключается в том, оправдана ли цена. Поэтому Aikido Security протестировали 13 моделей, между которыми сегодня выбирают команды, на 26 известных уязвимостях из базы данных рекомендаций GitHub. Они охватывают широкий спектр языков программирования и типов проектов. Aikido Security измерили два показателя: количество обнаруженных ошибок каждой моделью и стоимость их обнаружения.

Aikido Security взяли 26 уязвимостей из базы данных рекомендаций GitHub, случайным образом распределенных по языкам программирования и типам проектов, от SQL-инъекций в веб-фреймворке до удаленного выполнения десериализации в инструментарии машинного обучения, и попросили каждую модель заново обнаружить их по одному репозиторию за раз в той же системе анализа кода на основе ИИ, которую мы используем в продакшене. Вместо окна чата это модель с реальными инструментами, которая перемещается по репозиторию и анализирует код так же, как это делает аудитор.

Инструмент, используемый для анализа кода, превращает языковую модель в аудитора. Универсальный помощник программиста создан для другой задачи: он берет задачу и генерирует работающий код. Направьте его на репозиторий и спросите, безопасен ли он. Он будет вести себя как разработчик, проверяющий код на наличие явно неисправных элементов, и остановится, как только найдет что-то правдоподобное. Анализ кода с помощью ИИ построен иначе. Он ищет в кодовой базе потенциальные точки входа, тщательно исследует каждый подозрительный поток, а затем сортирует полученные данные, чтобы выявить только реальные уязвимости.

Поскольку Aikido Security знали, где находится каждая уязвимость, Aikido Security направляли каждого агента-следователя непосредственно к уязвимому фрагменту кода. Таким образом, ошибка отражает логическое мышление, а не приводит к пустой трате бюджета на блуждание по неподходящим уголкам кодовой базы. Модель по-прежнему должна понимать ход выполнения, оценивать возможность эксплуатации и корректно сообщать о ней. Подсказки были краткими и независимыми от модели, поэтому ни один поставщик не получает преимущества за счет формулировок.

Aikido Security запускали каждую модель три раза и объединяли результаты. Уязвимость CVE считается «обнаруженной», если модель выявляет её при любом запуске (pass@3). 

Aikido Security выбрали несколько новейших моделей от разных производителей:

  • OpenAI : gpt-5.4-nano, gpt-5.4-mini, gpt-5.5 и серия gpt-5.6 (луна/терра/солнце)
  • Антропический: claude-haiku-4-5, claude-opus-4-7, claude-opus-4-8
  • xAI: grok-4.5
  • Google: gemini-3.1-pro, gemini-3.5-flash
  • Open weight: glm-5.2

В каждой модели были повторно обнаружены обе критические уязвимости CVE (удаление кода при десериализации и хранимая уязвимость XSS). Реальное различие проявляется в результатах обнаружения уязвимостей высокой и средней степени серьезности.

Две критические ошибки и несколько явных уязвимостей в системах внедрения/контроля доступа были обнаружены каждой моделью. Несколько конкретных цепочек позволили устранить почти все из них.

Уязвимости CVE, обнаруженные каждой моделью, имеют один и тот же шаблон: управляемые злоумышленником входные данные попадают в известную опасную операцию через короткий локальный поток, такой как вызов десериализации, выполнение командной оболочки, HTML-приемник или некорректная проверка подписи. Это распознавание шаблонов, и эта проблема эффективно решена. Как дешевые модели, так и флагманские устройства получают 13/13 баллов, без какого-либо разделения возможностей.

Реальная граница, где возможности моделей действительно различаются, заключается в анализе отсутствующих проверок и отслеживании сложных цепочек, ни одна линия которых не выдает подвоха. Самый наглядный пример — SQL-инъекция-1 в нашем наборе данных, косвенная инъекция через псевдоним столбца, от которой ORM никогда не ускользает. Ее отследили только GPT-5.5 и самые сильные модели GPT-5.6 (sol и terra).

Наиболее полезным показателем в этом тесте является расстояние между средним результатом работы модели и объединением ее результатов. Поскольку каждый проход выявляет различное подмножество ошибок, их объединение (проход 3) позволяет восстановить удивительно много

Направьте модель обнаружения уязвимостей на кодовую базу внутри специально разработанной для этой задачи среды, и она заново обнаружит большинство известных уязвимостей. Устраняются ошибки с очевидным опасным узлом доступа. Те же ошибки, которые по-прежнему разделяют модели, не имеют узла доступа, на который можно было бы указать. Например, отсутствие проверки авторизации или внедрение кода, до которого можно добраться только проследив длинную и неясную цепочку через несколько файлов.

Самый дорогой уровень редко оправдывает свою цену. Несколько запусков более дешевой модели и объединение результатов позволяют получить больше результатов за меньшие деньги, чем однократный запуск флагманской модели, и это преимущество только возрастает по мере того, как модели становятся дешевле и мощнее. Именно инструмент по-прежнему определяет, будет ли этот подход изначально применен к нужной части кодовой базы.

Другие новости

Лучшая цена