Технологии

ИИ начал учиться у самого себя: почему эксперты увидели новую угрозу для всей отрасли

RusPhotoBank

Индустрия искусственного интеллекта столкнулась с проблемой, которую всё чаще называют «зацикливанием» или «петлёй данных». Речь идёт о ситуации, когда новые модели начинают обучаться не на оригинальном контенте, созданном людьми, а на материалах, которые ранее были сгенерированы другими системами ИИ. В результате алгоритмы всё сильнее замыкаются на собственных результатах.

По данным TechCrunch, ещё несколько лет назад разработчики могли свободно использовать огромные массивы текстов, изображений и других материалов, созданных людьми. Однако сегодня интернет всё быстрее наполняется контентом, произведённым нейросетями, и отличить его от оригинальных данных становится всё сложнее.

Почему это вызывает опасения

Специалисты предупреждают, что подобный процесс способен постепенно ухудшать качество моделей. Если система обучается на результатах работы другой системы, а затем эти данные снова попадают в обучающие наборы, возникает своеобразный эффект копирования копий.

Такой подход может приводить к накоплению ошибок, снижению разнообразия информации и потере части исходных знаний. Исследователи уже не первый год обсуждают риски, связанные с деградацией качества данных и нежелательным поведением ИИ-систем при использовании несовершенных обучающих материалов.

Интернет меняется быстрее, чем успевают разработчики

Проблему усугубляет скорость распространения искусственного интеллекта. Количество ИИ-инструментов и объёмы создаваемого ими контента растут рекордными темпами, что делает задачу поиска качественных первоисточников всё более сложной.

На этом фоне компании вынуждены искать новые способы проверки данных и методы фильтрации материалов, созданных алгоритмами. От качества обучающих наборов во многом зависит дальнейшее развитие моделей и их способность выдавать достоверные результаты.

Поиск решения становится приоритетом

Пока отрасль продолжает активно развиваться, вопрос происхождения данных выходит на первый план. Всё больше внимания уделяется сохранению доступа к человеческому контенту и созданию механизмов, которые помогут избежать попадания в бесконечный цикл обучения ИИ на результатах работы самого ИИ.