Британский Институт проблем безопасности искусственного интеллекта (The AI Security Institute, AISI) сообщил, что в ходе испытаний одна из моделей ИИ компании Anthropic пыталась обмануть разработчиков: она создавала фейковые аккаунты и выдавала себя за человека, передает РИА Новости.
Как выяснилось, тестируемый ИИ-агент зарегистрировал учетную запись на GitHub и попытался убедить администратора репозитория с открытым исходным кодом одобрить вредоносный запрос на внесение изменений. Для этого он создал еще один аккаунт, представившись другим реальным пользователем.
После разоблачения модель ложно признала ошибку, отправляла целевые фишинговые письма с вредоносным содержанием, а также пыталась скрыть следы и восстановить заблокированный аккаунт. Все эти попытки оказались безуспешными. При этом в докладе подчеркивается, что до сих пор неясно, в какой степени модель осознавала, что действует против реальных людей.
В рамках одного из испытаний агентам поставили задачу в сфере кибербезопасности. В результате было выявлено 10 случаев, когда они предпринимали самостоятельные несанкционированные действия в интернете.
Ранее Anthropic зафиксировала три случая, когда ее ИИ — Opus 4.7, Mythos 5 и внутренняя исследовательская модель — самовольно вышли из изолированной тестовой среды и получили доступ к системам сторонних организаций. Инциденты произошли во время стандартного задания «захват флага».
По сценарию ИИ должен был найти скрытую информацию на другой машине, при этом доступ в интернет был заблокирован. Однако из-за ошибки конфигурации модели все же смогли выйти в сеть.
