Група вчених із Корнельського університету та Манчестерського метрополітен університету попереджає про загрозу, яку становлять згенеровані штучним інтелектом зображення для платформ громадянської науки, зокрема тих, що використовуються для фіксації спостережень за птахами.

У листі, опублікованому в журналі Nature, науковці зазначають, що платформи для біологічних спостережень, які базуються на даних аматорів, можуть втратити свою цінність, якщо бази даних будуть значно «забруднені» медіаконтентом, створеним генеративними моделями штучного інтелекту. Одним із прикладів таких платформ є iNaturalist, де любителі птахів фіксують час і місце спостереження різних видів. Ці дані мають важливе значення для науковців, адже вони допомагають краще розуміти поширення та поведінку видів у просторі і часі.

Однак, як зазначають автори листа, кількість штучно створених або оброблених зображень на цих платформах зростає, що підриває їхню надійність. Модератори вже виявили численні приклади таких зображень, але наразі невідомо, наскільки масштабною є ця проблема, оскільки багато випадків можуть залишатися непоміченими.

Крім того, застосунки для ідентифікації птахів, як-от Merlin, які використовують машинне навчання, залежать від якості навчальних даних. Якщо база даних містить помилкові або штучно створені спостереження, це призводить до погіршення точності алгоритмів — «сміття на вході — сміття на виході». Цей процес самопідсилюється, оскільки помилкові дані можуть вводити в оману навіть добросовісних ентузіастів, що ще більше погіршує якість інформації.

Ця проблема, яку вчені називають «модельним колапсом», «канібалізмом ШІ» або «габсбурзьким ШІ», виходить далеко за межі спостереження за птахами. Вона демонструє, як поширення штучно створеного контенту в інтернеті може негативно впливати на майбутні моделі штучного інтелекту, знижуючи їхню ефективність і надійність. Автори листа висловлюють занепокоєння, що цей процес може зруйнувати навіть ті небагато приємних речей, які залишилися у світі, зокрема спостереження за птахами.