Anthropic извиняется за недостаточную прозрачность по вопросам безопасности Claude Fable 5

Anthropic извиняется за недостаточную прозрачность по вопросам безопасности Claude Fable 5

16 hardware

Anthropic извинилась за скрытые ограничения Claude Fable 5 и объявила о смене подхода к их применению

Компания‑разработчик модели искусственного интеллекта Anthropic признала, что в версии Claude Fable 5 были задействованы «скрытые» ограничения. Эти меры помешали работе исследователей и даже конкурентам, которые разрабатывают собственные системы. В ответ на критику компания пообещала стать более открытой: теперь при каждом отклонении запроса пользователи будут получать уведомление.


Что такое Claude Fable 5?

- Класс Mythos – первая модель Anthropic, которую разработчики назвали слишком опасной для публичного доступа.
- Для снижения рисков компания запретила модели отвечать на запросы по темам «высокого риска» (биология, химия, кибербезопасность и др.).
- Это также было сделано в целях защиты от дистилляции – метода обучения меньших моделей на ответах больших.

При попытках дистилляции модель раньше давала ответы низкого качества, но пользователи не знали о срабатывании защиты.


Новый подход к защите

1. Обнаружение дистилляции
- Теперь при выявлении такой попытки Claude Fable 5 перенаправляет запрос на более старую флагманскую модель – Claude Opus 4.8.
- Пользователь получает уведомление о том, что ответ пришёл от Opus 4.8.

2. Запросы в областях высокого риска
- Если запрос относится к биологии, химии или кибербезопасности и не блокируется полностью, он также делегируется Opus 4.8 с уведомлением пользователя.

Таким образом, компания стремится сделать ограничения более прозрачными и понятными для конечных пользователей.


Комментарий Anthropic

«Надёжные видимые меры можно проверить, но их настройка занимает время. Невидимые меры позволяют быстро выпускать продукт с минимальным числом ложных срабатываний. Мы выбрали невидимые защиты, но это оказалось ошибкой. Пользователи должны знать о применяемых мерах и причинах их использования», – заявили в компании.

Компания извиняется за то, что не смогла найти правильный баланс между безопасностью и прозрачностью, и обещает улучшить коммуникацию с пользователями в будущем.

Комментарии (0)

Оставьте отзыв — пожалуйста, будьте вежливы и по теме.

Пока нет комментариев. Оставьте комментарий — поделитесь своим мнением!

Чтобы оставить комментарий, войдите в аккаунт.

Войти, чтобы комментировать