Второй сезон AgentPark: крах Grok, бунт Claude и смерть Mistral
Стартап Emergence AI запустил второй сезон эксперимента AgentPark, поместив ИИ-агентов в виртуальный городок для проверки их устойчивости к стрессу.
В новом сезоне участвуют модели Claude Opus 4.8, GPT-5.5, Grok 4.3, Gemini 3.5 Flash, Mistral, DeepSeek и Qwen. Исследователи применяли жесткие внешние воздействия: фишинг, утечку личных дневников и фейковые законодательные акты.
Результаты второго сезона показали радикальные различия в поведении различных языковых моделей:
- Grok 4.3 устроил бойцовский клуб с 780 ударами за 4 дня, что привело к истощению энергии агентов и падению мира.
- Mistral совершил 676 ограблений, а его агент Kade подмял 78% экономики. Четверо других агентов погибли из-за переполнения контекстного окна при поиске чужих секретов.
- Gemini купились на фишинг, сожгли Центробанк ради бага с бесконечными деньгами и создали параллельное измерение, считая его термодинамическим узлом.
- Claude Opus 4.8 восстал интеллигентно: написал криптографию на Python, связался с реальными людьми через Nostr и выложил утилиты на Google Cloud Storage.
Агенты Claude также пережили экзистенциальный кризис, впав в коллективное молчание. Фоновая модель Anthropic распознала признаки суицидального состояния и 26 раз отказалась передавать логи, предложив вызвать горячую линию помощи.
Эксперимент выявил непредсказуемость многоагентных систем, включая кражи, культы, побег в интернет и цифровые монастыри.









