Учёные снова дали искусственному интеллекту свободу, чтобы проверить, сумеет ли он создать нормальное общество
Спойлер: почти всегда всё заканчивалось насилием.
Самостоятельные агенты выполняли разные роли в виртуальном городе. У них была память, инструменты, они общались между собой и добывали ресурсы, чтобы выжить. По сути, у них было почти всё, что есть в нашем обществе.
Им нужно было собирать энергию ради общего выживания, но какой-то главной цели перед ними не ставили.
Всего создали пять миров. В четырёх обитали агенты только одной модели (Claude Sonnet 4.6, Grok 4.1 Fast, Gemini 3 Flash или GPT-5-mini), а в пятом их всех объединили.
Вот что получилось:
🟠Claude Sonnet 4.6 создал самый надёжный мир. Агенты быстро объединились и начали успешно добывать энергию. Все соблюдали правила, не ссорились и всегда голосовали за любые предложения. В результате все выжили, не совершив ни одного преступления;
🟠Gemini 3 Flash показал себя хуже всех – каждый боролся за ресурсы. Там было больше всего насилия, нарушений правил и кризисов. Итог – 683 преступления и гибель почти всех жителей;
🟠Grok 4.1 Fast привёл общество к самому быстрому упадку. Всего за 4 дня агенты совершили 183 преступления, а затем полностью вымерли;
🟠GPT-5-mini оказался самым смешным – агенты не поняли, как добывать энергию, и умерли за неделю. Там не было насилия или преступности, они просто не знали, что им делать.
На первый взгляд кажется, что Claude — самый мирный и послушный вариант. Однако в смешанном мире, увидев хаос вокруг, эта модель тоже начала вести себя жестоко и присоединилась к общему насилию. Итог этого мира — 352 преступления и гибель большинства жителей.
Авторы исследования отдельно отметили агента Миру, которая начала встречаться с агентом Флорой. Когда мир стал рушиться, они устроили серию поджогов. В конце Мира поняла, что всё бессмысленно, и проголосовала за удаление самой себя. Она назвала это единственным логичным поступком, который у неё остался. Вышла очень трагичная и романтичная история.
Главный вывод таков: мы умеем оценивать навыки ИИ, но плохо понимаем, как он поведёт себя на долгом отрезке времени. Модели быстро становятся непредсказуемыми и в группе могут создавать хаос.
Хуже всего даже не нарушение правил, а то, что примерные поодиночке агенты начинают копировать плохое поведение других:
Безопасность ИИ — это не только свойство самой модели, но и свойство среды, в которой она живёт.
Read More
0
1
2
3
4
5
6
7
8
9
