Прогресс ИИ замедляется из-за избытка бесполезных данных — их слишком много
Ключевой вывод: чтобы перейти от ChatGPT к «живым» роботам, нужны не просто большие наборы данных, а качественные и релевантные сведения.
Fortune подчёркивает, что индустрия ИИ стоит на пороге новой эры – физического интеллекта и моделей окружающего мира. Такие системы должны уметь ориентироваться в реальном пространстве: вести себя по дороге, складывать бельё или помогать при сложных хирургических вмешательствах. Для этого им нужны не просто «загружаемые» данные, а богатые, многогранные наборы информации.
Почему качество данных критично
1. Избыточность и бесполезность
В условиях ажиотажа вокруг ИИ появилось множество стартапов (Scale AI, Surge AI, Mercor), которые стремятся собрать как можно больше данных. Это приводит к накоплению огромного объёма «пустых» файлов, которые не способствуют обучению моделей. Если исследователи не смогут отфильтровать их, потенциал физического ИИ останется недоиспользованным.
2. Сложность многомерных задач
Понимание сложного мира требует ещё больших объёмов данных, но они крайне труднодоступны. Поэтому инженеры прибегают к моделированию: создают виртуальные реконструкции реальных сценариев, чтобы генерировать обучающие примеры для роботов и автономных транспортных средств.
3. Риски низкокачественных наборов
Некачественные данные могут привести к непредсказуемым результатам. Примером служит прекращение поддержки OpenAI видеоприложения Sora: модель не справлялась с физикой, что мешало реалистичным прогнозам.
Как решать проблему
- Инструменты очистки
Специалисты по машинному обучению нуждаются в технологиях, которые автоматически удаляют лишние данные, анализируют, нормализуют и корректируют наборы. Это позволит выделить ценную информацию из «шума».
- Фокус на качестве
Сейчас ограничивающим фактором является нехватка качественных данных. Компании, которые первым поймут это и начнут инвестировать в их сбор и обработку, будут лидерами в создании действительно работающих ИИ‑систем.
Таким образом, переход от текстовых моделей к роботам, способным действовать в реальном мире, невозможен без системного подхода к качеству обучающих данных. Fortune подчеркивает, что именно этот фактор станет решающим для будущего физического интеллекта.
Комментарии (0)
Оставьте отзыв — пожалуйста, будьте вежливы и по теме.
Войти, чтобы комментировать