ИИ может уничтожить сам себя
Ученые Университета Оксфорда провели исследование, в рамках которого выяснили, что чрезмерное использование ИИ-сгенерированного контента может привести к «модельному коллапсу», когда новые модели, обученные на таких данных, начинают генерировать бессмысленные сообщения.
Например, модель, стартовавшая с текста о европейской архитектуре, спустя несколько итераций стала выдавать абсурдные результаты.
Обнаружены и уже запущеные рекурсивные процессы, при которых новые модели уже обучаются на выходных данных старых, что усугубляет проблему, а также массовое отравление данных от «ферм контента», негативно влияющее на качество поисковых результатов.
Авторы исследования подчеркивают необходимость разработки эффективных методов фильтрации данных, чтобы различать контент, сгенерированный LLM, и оригинальные данные.
Среди предложенных решений — использование водяных знаков, однако их защита остается проблемой.
Без адекватной фильтрации доступ к качественным данным для обучения новых моделей будет затруднен, что ставит под угрозу устойчивость и надежность технологий машинного обучения.
Ученые Университета Оксфорда провели исследование, в рамках которого выяснили, что чрезмерное использование ИИ-сгенерированного контента может привести к «модельному коллапсу», когда новые модели, обученные на таких данных, начинают генерировать бессмысленные сообщения.
Обнаружены и уже запущеные рекурсивные процессы, при которых новые модели уже обучаются на выходных данных старых, что усугубляет проблему, а также массовое отравление данных от «ферм контента», негативно влияющее на качество поисковых результатов.
Авторы исследования подчеркивают необходимость разработки эффективных методов фильтрации данных, чтобы различать контент, сгенерированный LLM, и оригинальные данные.
Среди предложенных решений — использование водяных знаков, однако их защита остается проблемой.
Без адекватной фильтрации доступ к качественным данным для обучения новых моделей будет затруднен, что ставит под угрозу устойчивость и надежность технологий машинного обучения.