Новый метод позволяет извлекать конфиденциальные данные из LLM
Группа исследователей разработала метод, который позволяет извлекать «мысли» больших языковых моделей (LLM) и находить в них конфиденциальные данные, такие как пароли и API-ключи, без прямого взлома самой модели.
Восемь учёных из нескольких институтов, включая ELLIS Institute Tübingen и Институт интеллектуальных систем Общества Макса Планка, опубликовали препринт исследования, демонстрирующий успешную атаку на LLM-модели таких гигантов, как Anthropic, OpenAI и Google. Метод позволяет получить доступ к внутренним рассуждениям моделей, которые обычно скрыты от пользователей.
В ходе тестирования своего подхода исследователи смогли извлечь 62 ключа API и 33 пароля из зашифрованных блоков данных в публичных репозиториях. Это показывает, что даже скрытые от пользователя внутренние процессы LLM могут содержать уязвимости, которые приводят к утечке чувствительной информации.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!