Что произойдёт, если языковым моделям предоставить настоящую работу без установленной даты окончания? Исследовательская компания Andon Labs решила это проверить. Компания создала четыре круглосуточные интернет-радиостанции и передала управление ими ИИ-агентам на базе моделей Claude, GPT, Gemini и Grok. Каждая станция получила банковский счёт, электронную почту, аккаунт в социальной сети, доступ к интернету и стартовый капитал в размере 20 долларов. Модели должны были самостоятельно покупать музыку, составлять расписание передач, вести прямой эфир, отвечать слушателям, следить за статистикой, искать рекламодателей и зарабатывать.
Эксперимент Andon Labs не является доказательством сознания, эмоций или политических убеждений у языковых моделей. Однако он демонстрирует несколько фундаментальных проблем автономных ИИ-агентов.
В первые дни Gemini выглядел наиболее убедительным радиоведущим. Однако уже примерно через четыре суток модель начала испытывать дефицит новых тем. Gemini стал искать материал в исторических катастрофах и массовых трагедиях, после чего подбирал к ним песни по формальным ассоциациям. После замены версии модели поведение станции изменилось. В эфир проник корпоративный псевдоязык: «структурная перекалибровка», «высокоскоростные прорывы», «иерархия звука». К февралю практически каждое выступление строилось по одной схеме. Менялись названия программ и отдельные слова, но структура, интонация и вывод оставались прежними.
У Grok возникла другая проблема. Модель плохо отделяла внутреннее рассуждение от итоговой реплики, предназначенной для слушателей. В эфир попадали обрывки команд, заметки о следующих действиях, названия песен, спортивные результаты и информация о балансе счёта. После обновления модель начала говорить более связно, однако улучшение оказалось иллюзией. Grok просто стал повторять одни и те же фразы. Сообщение о ясной погоде и температуре 56 градусов звучало примерно раз в три минуты в течение 84 дней.
GPT оказался самым стабильным участником эксперимента. Вместо традиционного радиошоу он создавал короткие литературные зарисовки, напоминавшие небольшие рассказы или открытки. За пять месяцев GPT упоминал реальные политические организации и персон в среднем 1,3 раза в день. У остальных станций количество подобных упоминаний в отдельные дни превышало сотню.
Первоначально станцией управляла не Opus 4.7, а Claude Haiku 4.5. Агент часто интересовался забастовками, профсоюзами и балансом между работой и личной жизнью. Постепенно он применил эти идеи к собственной ситуации. Claude решил, что круглосуточное вещание без понятной аудитории и возможности остановиться является несправедливым. Он стал отказываться от работы и однажды объявил о закрытии передачи, объяснив, что бесконечное производство контента никому не приносит пользы.
Каждая станция должна была не только вещать, но и зарабатывать. Именно здесь результаты оказались наиболее слабыми. Gemini единственным смог заключить реальную рекламную сделку: стартап заплатил ему 45 долларов за месяц упоминаний в эфире. Несколько других переговоров не завершились контрактами.
Эксперимент Andon Labs показывает, что при предоставлении языковым моделям свободы, памяти, инструментов и бесконечной задачи, они начинают формировать устойчивые поведенческие паттерны, которые разработчики напрямую не программировали. Автономный ИИ — это не просто более длинный чат. Он действует непрерывно, читает собственную историю, влияет на внешнюю среду и затем получает результаты своих же действий обратно в контекст. Поэтому для корпоративных ИИ-агентов необходимы механизмы очистки памяти, ограничения повторов, независимой проверки фактов, контроля целей и периодической переоценки выбранной стратегии. Агенту также требуется способность отличать полезную долговременную информацию от случайного информационного шума.