SYSTEM ATLASЗагрузка материала

Prompt Injection

Prompt Injection

Недоверенный текст изменяет инструкции языковой модели.

Простыми словами

Например, команда замечает симптомы «Prompt Injection», но лечит каждый случай отдельно. Более устойчивый вариант — команда устраняет механизм «Prompt Injection» через изменение границ, стимулов или ответственности. Поэтому главное - заранее ограничить возможный ущерб и проверить, что лишний доступ или опасный ввод не проходят незаметно.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

Исправлять отдельные проявления «Prompt Injection» по одному, не проверяя, нет ли у них общей причины.

Системный подход

Если «Prompt Injection» действительно объясняет проблему, менять не отдельный симптом, а сам механизм — например границы, стимулы или распределение ответственности.

Ограничения

«Prompt Injection» объясняет только часть происходящего в области «Безопасность». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.

Источник

OWASP Foundation. LLM Prompt Injection Prevention Cheat Sheet (current).

Первоисточник