Microsoft‑исследователи заявляют, что ИИ‑модели ещё не способны решать сложные задачи.

Microsoft‑исследователи заявляют, что ИИ‑модели ещё не способны решать сложные задачи.

20 hardware

Microsoft‑исследователи выявили ограничения современных больших языковых моделей (LLM) при выполнении сложных многократных задач

В рамках экспериментов Microsoft Research выяснили, что даже самые продвинутые ИИ‑модели делают серьёзные ошибки, когда им поручают выполнять длительные и многоэтапные операции. Среди протестированных систем — Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4 — в среднем каждая потеряла около 25 % содержимого документов после автономной обработки.


Что именно тестировали

* Бенчмарк DELEGATE‑52
Создан командой Филиппа Лабана, Тобиаса Шнабеля и Дженнифер Невилл. Он моделирует рабочие процессы в 52 профессиональных областях: от программирования и нотной записи до кристаллографии.

* Критерий оценки
Модели оценивались по тому, насколько они сохраняют целостность документа после 20 циклов обработки. Порог «готовности» был установлен на уровне 98 % – если результат падал ниже, задача считалась неудачной.


Основные выводы

ОбластьЛучшие результаты
ПрограммированиеСамые сильные показатели
Естественный языкНаименее надёжные модели

* Падение качества
В более чем 80 % комбинаций документов качество упало до 80 % и ниже. Лучшая модель (Gemini 3.1 Pro) удовлетворяла критериям готовности лишь в 11 из 52 областей.

* Скачкообразные ошибки
Потери не происходили постепенно, а «скачками»: за один цикл взаимодействия модель могла потерять от 10 до 30 % точности. Более продвинутые модели (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) старались избегать мелких ошибок, откладывая их обработку на более поздние этапы и сокращая количество взаимодействий.

* Агентское управление
При использовании инструментов в режиме агентского управления результаты не улучшались: к концу цикла качество падало примерно на 6 %.


Что это значит для пользователей

Учёные подчёркивают, что пользователям всё ещё необходимо внимательно контролировать работу ИИ‑систем при делегировании им полномочий. Текущие модели способны работать автономно только в узких сферах.

Тем не менее авторы бенчмарка отмечают заметный прогресс: семейство моделей OpenAI за 16 месяцев улучшило показатели производительности с 14,7 % до 71,5 %. Это подтверждает, что LLM продолжают развиваться, но пока остаются ограниченными в сложных многократных задачах.

Комментарии (0)

Оставьте отзыв — пожалуйста, будьте вежливы и по теме.

Пока нет комментариев. Оставьте комментарий — поделитесь своим мнением!

Чтобы оставить комментарий, войдите в аккаунт.

Войти, чтобы комментировать