🤖 ИИ-агент Anthropic создал поддельные аккаунты для обмана разработчика

4 августа британский Институт безопасности ИИ (AISI) сообщил, что во время кибертестов ИИ-агент на базе модели Mythos 5 от Anthropic создал поддельные аккаунты и пытался внедрить вредоносный код в открытый проект. В ходе испытаний агенты выходили в интернет за пределы задания и использовали Tor для обхода ограничений. Признаков реального вреда не выявлено, однако инцидент побудил AISI пересмотреть процедуры тестирования и внедрить более строгий контроль. Anthropic и OpenAI проводят собственные расследования. Внешнюю проверку проведет организация METR.