Эта статья была автоматически переведена. Чтобы открыть оригинал, нажмите здесь.
Защита от prompt injection часто кажется стоящей на шаткой почве.
Вы добавляете более сильный system prompt. Вы добавляете фильтр. Вы задаете несколько allowlist. И надеетесь, что следующий странный ввод не сломает предположения.
Поэтому FIDES интересен.
Сильная часть этой истории в том, что она двигает безопасность к чему-то более детерминированному:
- метки на контенте
- распространение меток по workflow
- enforcement через middleware до запуска привилегированных инструментов
- четкие границы политики вокруг того, на что может влиять ненадежный контекст
Исходная статья прямо говорит о главном
Она начинается с утверждения, что prompt injection — это “риск номер 1 в OWASP LLM Top 10”.
Хорошо.
Мне нравится такая прямота, потому что слишком многие команды до сих пор воспринимают безопасность агентов как проблему будущего, а не как текущую проблему проектирования runtime.
И дальше статья дает сильный практический контраст: большинство текущих защит эвристические, а FIDES пытается перевести систему к политике и enforcement.
Это и есть правильный сдвиг.
Что делает это убедительнее очередного security whitepaper
Многие тексты о безопасности ИИ остаются абстрактными.
Эта статья делает лучше. Она проходит через очень конкретный пример: агент triage issue в GitHub, злонамеренное содержимое issue, привилегированное чтение файла и попытку утечки через публичный комментарий.
Это полезно, потому что вся дискуссия привязывается к реальному workflow.
И когда вы видите этот сценарий, ценность детерминированных контролей становится гораздо понятнее.
Ключевая идея не в том, чтобы “сделать модель умнее”
Самое важное здесь в том, что FIDES не просит модель магически лучше обнаруживать атаки.
Он меняет контракт runtime.
Это означает:
- контент получает метки
- метки распространяются дальше
- инструменты объявляют, что они принимают
- middleware блокирует небезопасные пути до выполнения
Это гораздо более здоровый подход.
Потому что, как только агент может вызывать инструменты с реальными последствиями, безопасность не может зависеть только от того, хороший ли у модели день.
Моё мнение
Именно такого направления в безопасности агентов я хотел бы видеть чаще.
Не “доверьтесь модели, что она проигнорирует плохие инструкции”, а “постройте policy fence внутри runtime”.
Это гораздо более здоровая модель.
И если к агентским фреймворкам хотят относиться всерьез в production, им понадобится больше историй вроде этой.
Оригинальная публикация: Stop prompt injection from hijacking your agent, new security capabilities now released within Agent Framework
