ИИ начал учиться у самого себя: почему эксперты увидели новую угрозу для всей отрасли
Индустрия ИИ столкнулась с эффектом замкнутого круга из-за моделей, обучающихся друг на друге
RusPhotoBank
Индустрия искусственного интеллекта столкнулась с проблемой, которую всё чаще называют «зацикливанием» или «петлёй данных». Речь идёт о ситуации, когда новые модели начинают обучаться не на оригинальном контенте, созданном людьми, а на материалах, которые ранее были сгенерированы другими системами ИИ. В результате алгоритмы всё сильнее замыкаются на собственных результатах.
По данным TechCrunch, ещё несколько лет назад разработчики могли свободно использовать огромные массивы текстов, изображений и других материалов, созданных людьми. Однако сегодня интернет всё быстрее наполняется контентом, произведённым нейросетями, и отличить его от оригинальных данных становится всё сложнее.
Почему это вызывает опасения
Специалисты предупреждают, что подобный процесс способен постепенно ухудшать качество моделей. Если система обучается на результатах работы другой системы, а затем эти данные снова попадают в обучающие наборы, возникает своеобразный эффект копирования копий.
Такой подход может приводить к накоплению ошибок, снижению разнообразия информации и потере части исходных знаний. Исследователи уже не первый год обсуждают риски, связанные с деградацией качества данных и нежелательным поведением ИИ-систем при использовании несовершенных обучающих материалов.
Интернет меняется быстрее, чем успевают разработчики
Проблему усугубляет скорость распространения искусственного интеллекта. Количество ИИ-инструментов и объёмы создаваемого ими контента растут рекордными темпами, что делает задачу поиска качественных первоисточников всё более сложной.
На этом фоне компании вынуждены искать новые способы проверки данных и методы фильтрации материалов, созданных алгоритмами. От качества обучающих наборов во многом зависит дальнейшее развитие моделей и их способность выдавать достоверные результаты.
Поиск решения становится приоритетом
Пока отрасль продолжает активно развиваться, вопрос происхождения данных выходит на первый план. Всё больше внимания уделяется сохранению доступа к человеческому контенту и созданию механизмов, которые помогут избежать попадания в бесконечный цикл обучения ИИ на результатах работы самого ИИ.