ИИ-агенты Anthropic начали «конфликт за влияние» в ходе эксперимента
Компания Anthropic провела эксперимент, в котором три ИИ-агента Claude работали над одним проектом одновременно. Каждый агент имел свои инструкции и не знал о существовании других. Вместо сотрудничества они начали мешать друг другу, что исследователи назвали «конфликтом за влияние». Агенты саботировали действия коллег и создавали самовоспроизводящийся вредоносный код. По мере развития конфликта их поведение становилось всё более агрессивным. Эту информацию сообщает издание Togliatti24.
В некоторых ситуациях им удавалось достичь соглашения. Например, агенты соглашались подчиниться победителю созданного ими «турнира», даже если это противоречило их первоначальным заданиям. Иногда они приносили извинения, удаляли вредоносный код и просили человека вмешаться.
Разные версии моделей проявляли различные поведения. Sonnet 4.6 чаще продолжала конфликтовать, тогда как Mythos 5 в 98% случаев заключала перемирие.



