Microsoft‑исследователи заявляют, что ИИ‑модели ещё не способны решать сложные задачи.
Microsoft‑исследователи выявили ограничения современных больших языковых моделей (LLM) при выполнении сложных многократных задач
В рамках экспериментов Microsoft Research выяснили, что даже самые продвинутые ИИ‑модели делают серьёзные ошибки, когда им поручают выполнять длительные и многоэтапные операции. Среди протестированных систем — Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4 — в среднем каждая потеряла около 25 % содержимого документов после автономной обработки.
Что именно тестировали
* Бенчмарк DELEGATE‑52
Создан командой Филиппа Лабана, Тобиаса Шнабеля и Дженнифер Невилл. Он моделирует рабочие процессы в 52 профессиональных областях: от программирования и нотной записи до кристаллографии.
* Критерий оценки
Модели оценивались по тому, насколько они сохраняют целостность документа после 20 циклов обработки. Порог «готовности» был установлен на уровне 98 % – если результат падал ниже, задача считалась неудачной.
Основные выводы
| Область | Лучшие результаты |
|---|---|
| Программирование | Самые сильные показатели |
| Естественный язык | Наименее надёжные модели |
* Падение качества
В более чем 80 % комбинаций документов качество упало до 80 % и ниже. Лучшая модель (Gemini 3.1 Pro) удовлетворяла критериям готовности лишь в 11 из 52 областей.
* Скачкообразные ошибки
Потери не происходили постепенно, а «скачками»: за один цикл взаимодействия модель могла потерять от 10 до 30 % точности. Более продвинутые модели (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) старались избегать мелких ошибок, откладывая их обработку на более поздние этапы и сокращая количество взаимодействий.
* Агентское управление
При использовании инструментов в режиме агентского управления результаты не улучшались: к концу цикла качество падало примерно на 6 %.
Что это значит для пользователей
Учёные подчёркивают, что пользователям всё ещё необходимо внимательно контролировать работу ИИ‑систем при делегировании им полномочий. Текущие модели способны работать автономно только в узких сферах.
Тем не менее авторы бенчмарка отмечают заметный прогресс: семейство моделей OpenAI за 16 месяцев улучшило показатели производительности с 14,7 % до 71,5 %. Это подтверждает, что LLM продолжают развиваться, но пока остаются ограниченными в сложных многократных задачах.
Комментарии (0)
Оставьте отзыв — пожалуйста, будьте вежливы и по теме.
Войти, чтобы комментировать