Claude Mythos подтверждено тестами как лидера по обнаружению уязвимостей, однако он демонстрирует и другие недостатки

Claude Mythos подтверждено тестами как лидера по обнаружению уязвимостей, однако он демонстрирует и другие недостатки

18 hardware

Краткое содержание

Компания XBOW провела независимую оценку ИИ‑модели Mythos Preview от Anthropic. Результаты показали, что модель превосходит существующие аналоги в поиске уязвимостей исходного кода и при работе с нативным кодом и реверс‑инжинирингом, но проявляет слабости в анализе изолированного кода и подтверждении практической применимости найденных эксплойтов. Стоимость работы модели остаётся вопросом: Mythos дороже Opus, однако при ограниченном бюджете токенов она иногда демонстрирует лучшую точность.


1. Что проверяла XBOW

- Объём тестов – серия независимых экспериментов над Mythos Preview.
- Сценарии – аудит работающих систем с доступом к исходному коду, анализ изолированного кода, реверс‑инжиниринг и взаимодействие с графическим интерфейсом.


2. Ключевые выводы

ПоказательMythos PreviewПротивоположные модели
Обнаружение уязвимостейЛучший показатель среди всех моделей, особенно в исходном коде и нативном программировании.Менее точен, но иногда более надёжный при проверке конкретных случаев.
Отсев ложных срабатыванийСнимает больше «ложных» находок, чем предшественники.Часто выдаёт больше фальшивых тревог.
Проблемы в изолированном кодеМодель хуже справляется без контекста системы.Некоторые модели лучше работают с построчным анализом.
Подтверждение эксплойтовСклонна к буквальному подходу, иногда переоценивает практическую ценность находок.Более критичны к реальной применимости.
Реверс‑инжиниринг и нативный кодВыдаёт сильные результаты; хорошо «понимает» логику программы без исходного кода.Меньше точности в этих задачах.
Взаимодействие с UIНе всегда точно находит координаты элементов, но успешно определяет нужные действия в браузере.Некоторые модели более точны в позиционировании.

3. Стоимость и эффективность

- Ценообразование – Anthropic заявила, что Mythos будет стоить в пять раз больше Opus.
- Экономический анализ – XBOW провела эксперименты с «дешёвыми» моделями, предоставив им больше времени работы. Результаты показали, что при нормализации по стоимости работа Mythos Preview не выглядит расточительной для задач высокой точности.
- Бенчмарки – На фиксированном бюджете токенов Mythos превосходит Opus 4.6 в поиске веб‑уязвимостей, но уступает GPT5.5.


4. Итог

Mythos Preview демонстрирует выдающуюся мощь при аудите исходного кода и нативных программ, а также в задачах реверс‑инжиниринга и анализа веб‑приложений. Однако модель иногда недооценивает реальную применимость найденных уязвимостей и проявляет слабости в изолированном анализе кода. При ограниченных ресурсах токенов Mythos может быть более выгодной, чем Opus, но при полном бюджете GPT5.5 остаётся конкурентом.

Вывод XBOW: Mythos Preview – надёжный инструмент для выявления потенциальных уязвимостей в исходном коде и сложных системах, но требует дополнительного подтверждения практической ценности найденных эксплойтов.

Комментарии (0)

Оставьте отзыв — пожалуйста, будьте вежливы и по теме.

Пока нет комментариев. Оставьте комментарий — поделитесь своим мнением!

Чтобы оставить комментарий, войдите в аккаунт.

Войти, чтобы комментировать