원문: Agent Harness: Working with your data, safely
이 글은 올해 가장 유용한 에이전트 엔지니어링 포스트 중 하나입니다. 데모 우선 자율성이라는 흔한 함정을 거부하고, 대신 에이전트가 실제 사용자 데이터와 실제 결과를 중심으로 어떻게 작동해야 하는지에 초점을 맞춥니다.
여기서 강조된 세 가지 구성 요소는 정확히 옳습니다.
- 파일 접근은 에이전트에게 사용자 소유 데이터에서 유용한 근거를 제공합니다.
- 승인 게이팅은 중요한 작업의 무음 실행을 방지합니다.
- 내구성 있는 메모리는 제어를 희생하지 않고 반복적인 상호 작용을 피합니다.
대부분의 팀은 도구 범위에 과도하게 투자하고 권한 의미론에는 과소 투자합니다. 그것은 거꾸로입니다. 열 가지 도구와 약한 승인 경계를 가진 에이전트는 세 가지 도구와 예측 가능한 제어 지점을 가진 에이전트보다 덜 가치 있습니다.
이 글의 최고의 실용적 패턴은 계층화된 승인 전략입니다:
- 항상 승인 필요: 거래나 파괴적 작업과 같은 고영향 도구.
- 자동 승인: 흐름을 유지하기 위해 위험이 낮은 읽기.
- 범위 제한 상시 승인 사용: 세션 내에서 반복적인 신뢰 작업에 대해.
이것은 건강한 위험 구배를 만듭니다. 사용자는 무해한 읽기에 방해받지 않지만, 결과가 비싸거나 되돌릴 수 없을 때는 여전히 루프 안에 있습니다.
또한 파일 메모리와 Foundry 메모리의 명시적 분할이 마음에 듭니다. 팀은 하나의 메모리 모델로 모든 문제를 해결하려는 시도를 중단해야 합니다. 보고서와 워치리스트 같은 사용자에게 보이는 상태에는 명시적 파일 아티팩트가 탁월합니다. 팩트 수준 메모리 추출은 기본 설정과 대화 컨텍스트에 더 좋습니다. 둘을 혼합하는 것이 어느 하나만으로 충분하다고 가장하는 것보다 더 나은 결과를 제공합니다.
내 독단적인 의견: 에이전트 품질의 미래는 영리한 프롬프트보다 안전 인체공학(safety ergonomics) 에 의해 더 많이 측정될 것입니다. 승인 프롬프트가 시끄러우면 사용자는 무심코 클릭합니다. 메모리 경계가 불분명하면 사용자는 어시스턴트를 신뢰하지 않습니다. 데이터 접근 기본값이 허용적이면 보안 팀이 프로젝트를 중단시킬 것입니다.
이 패턴을 채택하는 .NET 및 Python 팀에게 핵심은 정책 콜백과 승인 규칙을 핵심 비즈니스 로직으로 취급하고, 다른 중요한 코드처럼 버전 관리하고 테스트하는 것입니다. 샘플에 묻힌 임시 람다로 남겨두지 마십시오.
결론
신뢰를 얻는 에이전트 시스템은 가장 많은 일을 하는 시스템이 아닙니다. 위험이 높아질 때 명확한 중단 지점과 함께, 사용자가 의도한 것만 정확히, 더도 말고 덜도 말고 수행하는 시스템입니다.
그것이 인상적인 데모와 사람들이 실제 작업을 기꺼이 위임하는 소프트웨어의 차이입니다.
