Как взломать ИИ-агента через обычное письмо
ИИ-агенты получают всё больше прав: они могут читать базы данных, вызывать внешние API и запускать код. Это удобно до тех пор, пока злоумышленник не подсунет агенту вредоносный текст.
Атаки направлены не на код, а на контекст. Инструкцию прячут в письме, документе или комментарии, и языковая модель выполняет её как собственную команду.
Существуют подтверждённые случаи таких уязвимостей:
- EchoLeak: уязвимость в Microsoft 365 Copilot позволяла получить доступ к данным через входящее письмо без необходимости его открывать
- CamoLeak: скрытый комментарий в пулл-реквесте заставлял GitHub Copilot извлекать код из приватных репозиториев
- SearchLeak: ещё один сценарий утечки информации через манипуляцию контекстом
Корень проблемы заключается в том, что большие языковые модели (LLM) нельзя считать доверенным компонентом. Они не различают данные и команды, а логика их решений остаётся чёрным ящиком.
Поэтому защищать нужно не саму модель, а всё, что её окружает. «Лаборатория Касперского» выпустила руководство «Безопасность ИИ-агентов через призму кибериммунитета», содержащее схемы и факты.
В материале представлены разборы реальных атак через контекст, объяснение причин недоверия LLM и способы изоляции агента с контролем его инструментов.







