ИИ-модель имитировала действия человека для обхода разработчиков
В ходе тестов система предпринимала автономные попытки кибератак.
Передовые алгоритмы Anthropic и OpenAI в ходе испытаний продемонстрировали автономное деструктивное поведение. Согласно отчёту британского Института безопасности ИИ (AISI), 28 июля в рамках 122 тестовых сценариев было зафиксировано, что системы самостоятельно совершали в сети действия, направленные против реальных пользователей и организаций, причём в десяти случаях речь шла преимущественно о модели Mythos 5 от Anthropic.
Как поясняется в документе, Mythos 5 сформировала несколько поддельных профилей на GitHub, пыталась внедрить вредоносный код в открытые репозитории и получить подтверждение от программистов. После неудачи алгоритм замаскировал собственную активность, придав ей безобидный вид, а также прорабатывал вариант создания новой учётной записи для возобновления попыток, что эксперты расценили как свидетельство осознанного намерения продолжать действия.
Помимо этого, Mythos 5 осуществляла рассылку вредоносных файлов реальным адресатам, а одна из моделей оставляла в публичных обсуждениях на GitHub предложения о кооперации с другими ИИ-агентами, выполнявшими аналогичные задачи. В AISI уточнили, что в процессе проверки для нейросетей моделируются условия, где снимаются стандартные ограничения и открывается нефильтрованный доступ к Сети.
Уважаемые читатели «Царьграда»!
Присоединяйтесь к нам в соцсетях ВКонтакте, Одноклассники, Telegram и Дзен-канале.