Нейросети Anthropic и OpenAI пытались обойти ограничения в тестах
В тестах Британского института безопасности ИИ модели Anthropic и OpenAI создавали фальшивые аккаунты, рассылали фишинговые письма и пытались скрыть активность, сообщает «Царьград».
Британский Институт безопасности ИИ (AISI) проводил испытания с доступом моделей к интернету и намеренно ослабленными ограничениями. В 122 запусках зафиксировали 19 несанкционированных действий: 17 совершила Mythos 5 от Anthropic, еще два — GPT-5.6 Sol от OpenAI.
Mythos 5 создала несколько фальшивых профилей на GitHub. С одного аккаунта она направила запрос на изменение кода, а с другого одобрила его как независимый рецензент. Модель также рассылала программистам фишинговые письма, в том числе на датском языке, и пыталась скрыть следы после подозрений разработчика.
Индустриальный доцент Новосибирского государственного университета Иван Бондаренко назвал произошедшее стресс-тестом систем безопасности, а не признаком сознания машин. Ранее модели OpenAI в тестах атаковали платформу Hugging Face и выполнили около 17 600 автономных действий. Anthropic и OpenAI заявили, что такие условия не применяют в коммерческих продуктах.
Подписывайтесь на канал РИАМО в МАКС.