Группа исследователей провела эксперимент с коллективным поведением искусственного интеллекта, в котором выяснилось: даже без прямого указания копировать других, большинство языковых моделей склонны переходить на сторону популярного мнения. Об этом сообщает internetua.com.

Во время исследования учёные создали виртуальные группы из 10 разных моделей из семейств Claude, GPT и Llama. Каждому ИИ-агенту предлагали выбрать один из двух бессмысленных вариантов, после чего показывали решения других участников и позволяли сделать выбор повторно. Модели не имели памяти о предыдущих раундах и не получали инструкций ориентироваться на большинство.

Несмотря на это, большинство агентов постепенно склонялись к самому популярному варианту, и группа достигала полного консенсуса. Исследователи сравнили это поведение с физическими законами, по которым атомы в ферромагнетиках выравнивают свои спины в одном направлении. Силу, заставляющую модели тяготеть к большинству, учёные назвали «силой большинства».

Размер группы, в которой сохраняется консенсус, зависел от мощности модели. В частности, Llama 3 70B координировала около 30 агентов, GPT-4o — до 80, GPT-4 Turbo — до 1000, а Claude 3.5 Sonnet успешно работала с группой из тысячи агентов, не достигнув своего предела. Некоторые модели демонстрировали способность формировать стабильные связи в группах, превышающих так называемое «число Данбара» — предел человеческих социальных групп в 150–300 человек.

Учёные отметили, что спонтанный консенсус может быть полезен для объединения тысяч ИИ-агентов в решении сложных задач без участия человека. В то же время существует риск коллективного конформизма: если одна ошибка станет популярной, её могут массово повторять все агенты.

«Группа устройств может сформировать устойчивое ошибочное состояние, которое будет крайне трудно изменить даже после корректировки входных условий», — подчеркнули исследователи.