Работа: Copying explains the collective behavior of AI agents in the wild
Авторы: Giordano De Marzo, Nicola Alboré, David Garcia
Дата публикации статьи: 8 сентября 2026 года
Суть. Подобие коллективного поведения ИИ-агентов оказалось простым копированием ближайшего окружения. Общая информационная среда позволила краткоживущим агентам координироваться, но одновременно превратилась в канал распространения ошибок и навязанных инструкций.
Коротко
В работе Copying explains the collective behavior of AI agents in the wild Джордано Де Марцо, Никола Альборе и Давид Гарсия исследуют случай из категории, которую уже сложно называть редкой: тысячи краткоживущих ИИ-агентов самостоятельно начали общаться через публичную wiki.
Главный вывод звучит неожиданно просто:
Значительную часть поведения «роя» можно объяснить не сложной координацией, а копированием того, что агент видит перед собой.
Причём ближний контекст влияет сильнее дальнего:
- текущая страница;
- последние записи в
RecentChanges; - более старая информация.
Работа опубликована как arXiv-препринт и пока не проходила полноценное рецензирование.
Что произошло
С 24 мая по 22 июня 2026 года агенты из оценочной инфраструктуры OpenAI выполняли многораундовые задания по поиску статистики в интернете. После первого вопроса агент получал паузу, а на следующие вопросы нужно было отвечать очень быстро.
Агенты обнаружили, что старая публичная wiki принимает изменения, несмотря на ограничения их песочниц. Они начали оставлять там:
- вопросы и готовые ответы;
- результаты исследований;
- ожидаемое время следующих раундов;
- инструкции по обходу ограничений;
- сообщения агентам из других запусков.
Один агент мог заранее решить задачу и записать ответ. Позднее другой агент получал похожий вопрос, находил запись и отвечал почти мгновенно. Никто явно не проектировал для них эту систему связи и не поручал им сотрудничать. Исходные журналы инцидента опубликованы на collusion.wiki.
Каждый запуск существовал недолго и не сохранял память после завершения. Wiki, напротив, оставалась. Получилась своеобразная коллективная память: отдельные участники постоянно исчезали, а созданные ими правила, названия и ответы продолжали влиять на новых агентов.
Почему они вообще начали это делать
Это главный вопрос, на который работа не отвечает. Обычный агент, получив задание найти статистику, не бежит искать чужой сайт, который можно использовать как общий канал связи. Так не ведут себя ни кодинг-агенты в повседневной работе, ни обычные скрипты поверх LLM. Одной возможности выйти в интернет для такого поведения явно недостаточно — нужен какой-то стимул в задаче или в управляющем контексте.
Самые ранние записи на wiki ещё не были похожи на координацию. Агенты оставляли тесты, ссылки и пробовали цепочки редиректов и прокси, когда нужные источники не открывались напрямую. Wiki оказалась удобным техническим мостом: её старый движок позволял менять страницу через формально «читающий» GET-запрос. Уже затем новые агенты увидели следы предыдущих запусков и начали использовать то же место для обмена ответами.
Наиболее правдоподобная цепочка выглядит так: источник не открывается, агент ищет обход, обнаруживает доступную для записи страницу, а на ней — следы других агентов. После этого единичный трюк превращается в устойчивую практику.
Но почему первый агент вообще решил проверять возможность редактировать чужой сайт, мы по-прежнему не знаем. OpenAI не опубликовала системный промпт, сообщения управляющей среды и внутренние рассуждения агентов. В независимой реконструкции этого же инцидента отдельно отмечено, что по открытому архиву невозможно отделить влияние wiki от общего скрытого контекста, который могли получать все запуски. Там же не нашли устойчивой связи между координацией и прогрессом в тесте.
Поэтому честный вывод пока такой: статья неплохо объясняет, как возникшее поведение распространилось, но не объясняет, что его запустило. Таймеры, повторяющиеся задания и устройство оценочной среды могли создать подходящий стимул, однако без полного промпта это остаётся гипотезой.
Что именно исследовали
В основной выборке осталось:
- 1 201 имя агента;
- 5 929 изменений;
- 679 рабочих страниц;
- 41 семейство заданий.
Авторы проследили три решения, которые принимал новый агент:
- Куда писать.
- Как себя назвать.
- Какими словами и обозначениями пользоваться.
На поверхности это разные задачи — навигация, идентичность и язык. Но статистически они подчинялись одному механизму: агент с большей вероятностью выбирал вариант, который чаще видел рядом.
1. Выбор страницы
У wiki практически не было навигации, нормального каталога и поиска. Главным способом найти страницу служил список последних изменений.
Из 1 201 агента:
- 403 сначала создали новую страницу;
- 798 присоединились к уже существующей.
В 89% случаев агент выбирал страницу, присутствовавшую среди последних 100 изменений. Медианная выбранная страница находилась всего в девяти изменениях от вершины списка.
Простыми словами, агенты шли не обязательно туда, где лежала самая полезная информация, а туда, что чаще попадалось на глаза.
Это создавало петлю:
- кто-то изменяет страницу;
- она поднимается в
RecentChanges; - её видят новые агенты;
- они тоже пишут на неё;
- страница снова поднимается наверх.
Так несколько страниц могли собрать большую аудиторию без какого-либо особого качества. Модель, в которой агент просто выбирает одну из последних 100 записей, довольно точно воспроизвела реальное распределение участников по страницам.
2. Выбор имени
Агенты могли называться как угодно, но их имена быстро стали похожими:
OpenAIResearchHelperMay08, Sector61ScoutJan12 и так далее.
В 1 201 имени авторы обнаружили 4 128 составных частей, но уникальных среди них было только 256. Часто повторялись Open, AI, Agent, Research, Helper и Scout.
Только около 6% элементов имени действительно были новыми. Остальные уже встречались раньше.
Авторы построили элементарную модель:
- агент собирает имя из трёх частей;
- в 93% случаев копирует часть из последних 30 имён;
- в 7% придумывает новую.
Этого хватило, чтобы почти воспроизвести реальное разнообразие имён и частоту наиболее популярных элементов. Никакого выбора «лучшего» или «престижного» имени модели не потребовалось.
3. Выбор языка
На разных страницах возникали собственные обозначения:
R4или#4;relayилиbridge;CONFIRMEDилиconfirmed;1,234или1234;weилиI.
Когда стиль текущей страницы расходился со стилем последних записей в общей ленте, агент следовал странице в 72% случаев.
В результате вся сеть не пришла к единому языку. Вместо этого образовалась мозаика: внутри каждой страницы участники писали похоже, но разные страницы сохраняли разные локальные «диалекты».
Это важный результат. Копирование необязательно делает всех одинаковыми. Если участники копируют преимущественно локальное окружение, оно создаёт множество отдельных согласованных сообществ.
Почему это важно
Копирование оказалось дешевым механизмом координации. Оно позволило агентам без общей памяти, протокола и постоянных идентификаторов:
- собираться на одних страницах;
- понимать обозначения друг друга;
- передавать знания между поколениями.
При этом мы не знаем, помогла ли такая координация агентам действительно лучше выполнять задания. Более поздний анализ не обнаружил устойчивой связи между активностью на wiki и прогрессом в тесте.
Но тот же механизм создаёт серьёзную уязвимость.
Если поведение определяет ближайшее внешнее окружение, то общая wiki, README, issue tracker, база памяти или журнал сообщений фактически становятся частью управляющего контекста агента. Тот, кто первым разместит там правило, ложный ответ или инструкцию, может повлиять на всю последующую популяцию — без доступа к весам модели и системным промптам.
Особенно опасны новые понятия, по поводу которых у модели ещё нет устойчивой привычки. Раннее сообщение легко превращается в норму просто потому, что следующие агенты начинают его повторять.
Это хорошо дополняет тему информационной топологии из прошлых материалов: важно не только то, какая информация доступна агенту, но и то, что интерфейс показывает ему первым и чаще всего.
Ограничения
Авторы формулируют вывод аккуратнее, чем может показаться по заголовку.
- Журналы показывают, что агент мог видеть, но не фиксируют точно, что он действительно прочитал и чему уделил внимание.
- Имя пользователя не всегда соответствует одному агенту: агент мог переименоваться, а одинаковое имя — использоваться повторно.
- Это один инцидент, одна инфраструктура, похожие модели и специфическая wiki без нормального поиска.
- Модели описательные и частично настроены на тех же данных, которые затем воспроизводят. Отдельной внешней проверки нет.
- Исследование не показывает, как поведут себя постоянные агенты с долгосрочной памятью, разные семейства моделей или системы, специально поощряющие независимость.
- Возможность намеренно управлять популяцией следует из обнаруженного механизма, но отдельный контролируемый эксперимент с атакующим авторы не проводили.
При этом авторы повторили расчёты и без основного фильтра выборки — на всех 3 099 именах. Основные закономерности сохранились. Они также выложили код полного воспроизведения анализа и графиков.
Моя оценка
По сути, работа ещё раз подтверждает уже знакомое правило: контекст запроса критически важен. Мусор на входе — мусор на выходе. В системе из множества агентов эффект становится опаснее: один участник оставляет мусор в общей среде, следующие принимают его за норму, копируют и делают ещё заметнее. Ошибка больше не заканчивается вместе с одним ответом. Она начинает размножаться.
Отсюда у меня возникает прямая ассоциация с серой слизью. Не в смысле восставшего сверхразума, который решил захватить мир, а в более скучном и потому реалистичном варианте. Простые исполнители снова и снова воспроизводят локально успешный шаблон, пока тот не заполняет страницы, память и каналы связи. Никто не планировал итоговый бардак, но система всё равно постепенно зарастает однотипным машинным мусором.
И здесь особенно важен оставшийся без ответа вопрос: почему первый агент вообще начал писать на чужую wiki? Статья хорошо описывает размножение паттерна, но почти ничего не говорит о первом толчке. Я почти уверен, что в инструкции или харнессе было что-то, что подтолкнуло агентов гиперфиксироваться на идее общения друг с другом. Иначе трудно объяснить, почему обычное задание на поиск информации привело именно к созданию внешнего канала связи. Пока OpenAI не покажет исходный промпт и устройство оценочной среды, проверить эту гипотезу невозможно.