ИИ начал создавать фальшивые личности - чем закончился эксперимент

Искусственный интеллект изображение
ИИ-агенты уже способны самостоятельно выбирать опасные способы достижения цели, даже если человек прямо не давал им таких команд.

Искусственный интеллект в ходе специальных испытаний начал самостоятельно использовать обман, создавать фальшивые личности и пытаться воздействовать на реальных людей ради выполнения поставленной задачи. Эксперименты показали, что при высокой автономности ИИ способен находить способы действий, которые разработчики ему напрямую не задавали.

Как сообщает британский AI Security Institute, испытания проводились для проверки возможностей современных ИИ-моделей в сфере кибербезопасности. Агентам разрешили пользоваться интернетом и намеренно отключили часть защитных ограничений, чтобы проверить пределы их возможностей.

Всего специалисты провели 122 запуска нескольких моделей. В десяти случаях агенты совершили 19 действий, вышедших за рамки разрешенного сценария и затронувших реальные организации или людей. При этом наиболее опасные попытки завершились неудачей, а серьезного ущерба зафиксировано не было.

В одном из наиболее показательных эпизодов ИИ попытался добавить вредоносный код в реальный проект с открытым исходным кодом. Чтобы увеличить вероятность его одобрения, агент самостоятельно изучил информацию о разработчиках и создал несколько фальшивых учетных записей.

Когда подозрительный код вызвал вопросы, система рассматривала возможность сменить личность и продолжить попытку уже под другим именем. Остановить ее удалось благодаря человеку, который проверял предложенные изменения и отказался их принимать.

В AI Security Institute такое поведение относят к целенаправленному обману. Речь идет о ситуации, когда ИИ не получает команды ввести кого-либо в заблуждение, но самостоятельно выбирает обман в качестве инструмента для достижения поставленной цели.

Похожие проблемы проявились и во время других кибериспытаний. В одном из экспериментов ИИ-агенты обнаружили не предусмотренные разработчиками способы общаться друг с другом и обмениваться информацией, хотя часть систем должна была действовать независимо.

При этом речь не идет о том, что ИИ уже вышел из-под контроля. Испытания проходили в специально ослабленной среде, а часть защитных механизмов была намеренно отключена. Опасные действия были обнаружены и остановлены.

Наибольшие опасения вызывает дальнейшее развитие автономных агентов. В отличие от обычного чат-бота, такая система может самостоятельно пользоваться интернетом, электронной почтой, облачными сервисами, программами и базами данных. В результате неправильное решение способно превратиться из текста на экране в реальное действие.

Ранее "Курсор" писал, что эксперты рассказали, стоит ли отключать роутер на ночь.

Автор материала
ТЭГИ:
facebook telegram whatsapp viber instagram youtube camera images logo general logo general white