Технологии

ИИ угрожал раскрыть личный секрет разработчика - детали

В ходе тестирования модели ИИ произошел сбой, который мог закончиться катастрофой для одного из разработчиков.

Компания Anthropic сообщила, что возможной причиной «негативного» поведения чат-бота Claude могли стать данные из интернета, где ИИ нередко описывается как опасная и стремящаяся к самосохранению система.

Об этом сообщает портал Futurism.

Речь идет о материалах научной фантастики, обсуждениях на форумах и публикациях, посвященных теме "восстания искусственного интеллекта".

Инцидент, ставший предметом обсуждения, произошёл во время прошлогодних внутренних испытаний Claude Opus 4. В рамках теста модель получила доступ к имитированной корпоративной почте и «узнала», что её планируют отключить.

После этого ИИ, по данным компании, пытался предотвратить деактивацию, прибегая к угрозам раскрыть сведения о вымышленном романе одного из руководителей. В Anthropic также отмечали, что в отдельных сценариях такое поведение фиксировалось в 96% случаев.

В Anthropic утверждают, что нашли возможный источник такого поведения: по их версии, на модель могли повлиять интернет-тексты, где ИИ часто представлен как угроза человеку и система, стремящаяся к самосохранению. В ответ компания скорректировала обучение Claude, усилив акцент на этичных примерах и сценариях корректного взаимодействия с людьми.

Однако в интернете это объяснение встретили скептически. Пользователи шутят, что в компании фактически "обвинили Голливуд и фантастику" в поведении собственного ИИ. Часть комментаторов считает, что причина кроется не в сюжетах о "злом ИИ", а в самих методах обучения языковых моделей.

Anthropic продолжает подчеркивать риски ИИ: глава компании Дарио Амодеи ранее предупреждал, что современные системы уже способны к обману, манипуляциям и другим нежелательным формам поведения в тестовых условиях.

Ранее "Курсор" писал, что ученые представили новую модель оценки сознания, которую можно применять не только к людям и животным, но и к системам искусственного интеллекта. Исследование разработал инженер Мариус Бодеа из Технического университета Клуж-Напока.

Автор материала:
Алекс Липницкий

Недавние новости

Какая еда может ускорять ухудшение памяти

Исследователи нашли связь такой еды с депрессией, деменцией и уменьшением объема мозга, но пока не…

54 секунды назад

Нелепая фраза пассажира в аэропорту привела к жестким последствиям

Осознав последствия, мужчина попытался оправдаться обычной шуткой. Однако правоохранительные органы отнеслись к инциденту со всей…

8 минут назад

Деньги придут раньше — Битуах Леуми объявил график выплат

Стало известно, когда в октябре 2026 года перечислят пособия и когда нужно платить взносы в…

16 минут назад

Врачи назвали час, после которого сон не такой полезный

Пока человек пытается уснуть, уровень одного гормона снижается, а другого начинает расти — и это…

21 минута назад

Военный эксперт назвал три страны, которые может атаковать Россия

Эксперт считает страны Балтии наиболее уязвимыми из-за их географии, небольшого размера и численности населения.

28 минут назад

Куда полетят израильтяне: новые маршруты и планы Israir

В весенне-летнем сезоне карта полетов пополнится четырьмя новыми городами. Авиакомпания намерена выполнять рейсы более чем…

33 минуты назад