· · 2 минут чтения

FIDES — это именно тот детерминированный рассказ о безопасности агентов, который я хотел бы видеть чаще

Новые возможности FIDES в Agent Framework важны, потому что они уводят защиту от prompt injection от эвристик к исполнимой политике на основе помеченного контента и проверок middleware.

Agent Framework AI Security Prompt Injection Middleware
Эта статья также доступна на:English, Español, Català, Deutsch, Français, Português, Italiano, 日本語, 中文, 한국어, हिन्दी, Polski, Türkçe, العربية, Bahasa Indonesia, Nederlands

Эта статья была автоматически переведена. Чтобы открыть оригинал, нажмите здесь.

Защита от prompt injection часто кажется стоящей на шаткой почве.

Вы добавляете более сильный system prompt. Вы добавляете фильтр. Вы задаете несколько allowlist. И надеетесь, что следующий странный ввод не сломает предположения.

Поэтому FIDES интересен.

Сильная часть этой истории в том, что она двигает безопасность к чему-то более детерминированному:

  • метки на контенте
  • распространение меток по workflow
  • enforcement через middleware до запуска привилегированных инструментов
  • четкие границы политики вокруг того, на что может влиять ненадежный контекст

Исходная статья прямо говорит о главном

Она начинается с утверждения, что prompt injection — это “риск номер 1 в OWASP LLM Top 10”.

Хорошо.

Мне нравится такая прямота, потому что слишком многие команды до сих пор воспринимают безопасность агентов как проблему будущего, а не как текущую проблему проектирования runtime.

И дальше статья дает сильный практический контраст: большинство текущих защит эвристические, а FIDES пытается перевести систему к политике и enforcement.

Это и есть правильный сдвиг.

Что делает это убедительнее очередного security whitepaper

Многие тексты о безопасности ИИ остаются абстрактными.

Эта статья делает лучше. Она проходит через очень конкретный пример: агент triage issue в GitHub, злонамеренное содержимое issue, привилегированное чтение файла и попытку утечки через публичный комментарий.

Это полезно, потому что вся дискуссия привязывается к реальному workflow.

И когда вы видите этот сценарий, ценность детерминированных контролей становится гораздо понятнее.

Ключевая идея не в том, чтобы “сделать модель умнее”

Самое важное здесь в том, что FIDES не просит модель магически лучше обнаруживать атаки.

Он меняет контракт runtime.

Это означает:

  • контент получает метки
  • метки распространяются дальше
  • инструменты объявляют, что они принимают
  • middleware блокирует небезопасные пути до выполнения

Это гораздо более здоровый подход.

Потому что, как только агент может вызывать инструменты с реальными последствиями, безопасность не может зависеть только от того, хороший ли у модели день.

Моё мнение

Именно такого направления в безопасности агентов я хотел бы видеть чаще.

Не “доверьтесь модели, что она проигнорирует плохие инструкции”, а “постройте policy fence внутри runtime”.

Это гораздо более здоровая модель.

И если к агентским фреймворкам хотят относиться всерьез в production, им понадобится больше историй вроде этой.

Оригинальная публикация: Stop prompt injection from hijacking your agent, new security capabilities now released within Agent Framework

Поделиться:
Просмотреть исходный код этой статьи на GitHub ↗
← Почему многоуровневый дизайн Microsoft Agent Framework на самом деле важен
Рецензии кода Copilot в Azure Repos — это более важное дело, чем кажется →