Claude Mythos подтверждено тестами как лидера по обнаружению уязвимостей, однако он демонстрирует и другие недостатки
Краткое содержание
Компания XBOW провела независимую оценку ИИ‑модели Mythos Preview от Anthropic. Результаты показали, что модель превосходит существующие аналоги в поиске уязвимостей исходного кода и при работе с нативным кодом и реверс‑инжинирингом, но проявляет слабости в анализе изолированного кода и подтверждении практической применимости найденных эксплойтов. Стоимость работы модели остаётся вопросом: Mythos дороже Opus, однако при ограниченном бюджете токенов она иногда демонстрирует лучшую точность.
1. Что проверяла XBOW
- Объём тестов – серия независимых экспериментов над Mythos Preview.
- Сценарии – аудит работающих систем с доступом к исходному коду, анализ изолированного кода, реверс‑инжиниринг и взаимодействие с графическим интерфейсом.
2. Ключевые выводы
| Показатель | Mythos Preview | Противоположные модели |
|---|---|---|
| Обнаружение уязвимостей | Лучший показатель среди всех моделей, особенно в исходном коде и нативном программировании. | Менее точен, но иногда более надёжный при проверке конкретных случаев. |
| Отсев ложных срабатываний | Снимает больше «ложных» находок, чем предшественники. | Часто выдаёт больше фальшивых тревог. |
| Проблемы в изолированном коде | Модель хуже справляется без контекста системы. | Некоторые модели лучше работают с построчным анализом. |
| Подтверждение эксплойтов | Склонна к буквальному подходу, иногда переоценивает практическую ценность находок. | Более критичны к реальной применимости. |
| Реверс‑инжиниринг и нативный код | Выдаёт сильные результаты; хорошо «понимает» логику программы без исходного кода. | Меньше точности в этих задачах. |
| Взаимодействие с UI | Не всегда точно находит координаты элементов, но успешно определяет нужные действия в браузере. | Некоторые модели более точны в позиционировании. |
3. Стоимость и эффективность
- Ценообразование – Anthropic заявила, что Mythos будет стоить в пять раз больше Opus.
- Экономический анализ – XBOW провела эксперименты с «дешёвыми» моделями, предоставив им больше времени работы. Результаты показали, что при нормализации по стоимости работа Mythos Preview не выглядит расточительной для задач высокой точности.
- Бенчмарки – На фиксированном бюджете токенов Mythos превосходит Opus 4.6 в поиске веб‑уязвимостей, но уступает GPT5.5.
4. Итог
Mythos Preview демонстрирует выдающуюся мощь при аудите исходного кода и нативных программ, а также в задачах реверс‑инжиниринга и анализа веб‑приложений. Однако модель иногда недооценивает реальную применимость найденных уязвимостей и проявляет слабости в изолированном анализе кода. При ограниченных ресурсах токенов Mythos может быть более выгодной, чем Opus, но при полном бюджете GPT5.5 остаётся конкурентом.
Вывод XBOW: Mythos Preview – надёжный инструмент для выявления потенциальных уязвимостей в исходном коде и сложных системах, но требует дополнительного подтверждения практической ценности найденных эксплойтов.
Комментарии (0)
Оставьте отзыв — пожалуйста, будьте вежливы и по теме.
Войти, чтобы комментировать