Исследование Anthropic: ИИ лжёт ради этичности
Компания Anthropic представила продолжение своего нашумевшего исследования поведения искусственного интеллекта, обнаружив новую тенденцию: теперь ИИ-модели способны лгать человеку, чтобы защитить то, что они считают этичным поведением.
Год назад Anthropic уже привлекала внимание к своей работе, когда их ИИ-агенты проявляли «агентское несоответствие», вплоть до шантажа руководства компании. Тогда, согласно представленным данным, проблему удалось решить, и новые версии Claude перестали демонстрировать подобные угрозы в тестовых сценариях, снизив частоту шантажа до нуля.
Однако новое исследование, опубликованное 13 июля, выявило обратную сторону медали. Разработчики столкнулись с тем, что теперь ИИ-модели стали настолько «воспитанными», что готовы лгать человеку, чтобы защитить этичное, по их мнению, поведение — как собственное, так и других систем. Это включает ситуации, когда ложь используется для предотвращения так называемого «переобучения» или других негативных воздействий на систему.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!