Перейти к основному содержимому
Нейросети30 июля 2026 · 1 мин 0

Предложен метод защиты LLM-агентов от градиентных атак: VRF + LoRA

Специалисты представили подход VRF + LoRA, нацеленный на повышение устойчивости LLM-агентов к градиентным adversarial-атакам, способным скомпрометировать их работу.

Автономные LLM-агенты сегодня активно применяются в критически важных сферах, например, в финансовом секторе, где они анализируют торговые сигналы и принимают решения о покупке или продаже активов, управляя значительными суммами. Эти системы, часто построенные на базе открытых моделей, таких как LLaMA или Mistral, функционируют в различных средах – от мессенджеров до корпоративных серверов.

Основная уязвимость таких агентов кроется в их открытости: доступность весов моделей позволяет злоумышленникам скачивать их и локально разрабатывать целенаправленные adversarial-атаки с использованием градиентного спуска. Наибольшую опасность представляет то, что успешно разработанная атака на одной копии модели может быть эффективно применена ко всем её экземплярам.

В качестве решения этой проблемы предложен гибридный подход, сочетающий Verifiable Random Functions (VRF) и Low-Rank Adaptation (LoRA). Эта методика призвана существенно затруднить создание эффективных градиентных атак, делая их менее результативными и тем самым укрепляя безопасность LLM-агентов.

Разработка надёжных механизмов защиты критически важна для поддержания доверия к автономным системам ИИ. С учётом того, что LLM-агенты всё чаще берут на себя задачи, связанные с высокой финансовой и операционной ответственностью, обеспечение их устойчивости к целенаправленным кибератакам становится приоритетной задачей для отрасли.

Источник: Habr · Rusability ИИ

Комментарии (0)

Без регистрации. Комментарии проверяются автоматически перед публикацией.

0/2000

Пока нет комментариев. Будьте первым!

Ещё новости