17. Безопасность AI и LLM: интеграции, агенты, guardrails
Как устроены приложения с большими языковыми моделями, какие у них собственные классы дефектов и как проектировать защиту и проверки.
LLMprompt injectionагентыguardrailsAI red team4 уроков~26 ч
Ваш прогресс по разделузагрузка…
Проверяю сохранённый прогресс…
Чему вы научитесь
- Понимать модель угроз приложения, в котором есть языковая модель: входы, доступы, действия.
- Различать прямую и косвенную инъекцию промптов, чрезмерные полномочия агента и небезопасную обработку вывода.
- Знать защитные меры, которые работают, и понимать, почему на промпты нельзя полагаться как на защиту.
- Уметь готовить и оценивать проверки LLM-приложений на легальных площадках и своих стендах.
Предпосылки: Направления 1, 6, 7, 13: методология, веб, API, AppSec. Полезно понимание RAG и работы агентов.
Практика: Основные площадки: упражнения PortSwigger по LLM-атакам (легальная учебная среда) и Lakera Agent Breaker (приложения, созданные специально для обучения атакам на AI-агентов).
Уроки
1. Модель угроз приложения с языковой моделью
Чем архитектура с LLM отличается от обычного веб-приложения и какие новые границы доверия появляются.
продвинутый45 мин
2. Инъекция промптов: прямая, косвенная и защита
Как манипулируют моделью, почему фильтры на строках не работают и какие меры действительно снижают риск.
продвинутый55 мин
3. Агенты, инструменты и чрезмерные полномочия
Как агент получает доступ к данным и действиям, почему это похоже на подделку запросов и как ограничить ущерб.
продвинутый50 мин
4. Защита и проверка: guardrails, AI-red-teaming, метрики
Как выстроить защитный слой, как проверять его регулярно и как измерять устойчивость вместо надежд на фильтры.
продвинутый50 мин
Экзамен и сертификат
12 вопросов по направлению, порог сдачи 80%. Сертификат получает уникальный код и публичную страницу проверки — его можно указать в резюме.
Пройти экзамен