[논문 리뷰] EvoSafeHarness — agent safety harness를 배포 환경별로 진화시키기
EvoSafeHarness 논문을 통해 agent 보안을 고정 guardrail이 아니라 모델·도메인별 runtime harness 최적화 문제로 본다.
12 posts tagged
EvoSafeHarness 논문을 통해 agent 보안을 고정 guardrail이 아니라 모델·도메인별 runtime harness 최적화 문제로 본다.
SENTINEL-RL을 통해 SOC 에이전트에서 topology reasoning을 외부 graph/RL 엔진으로 분리하는 설계를 정리한다.
SARA 논문을 통해 tool-augmented agent에서 action induction과 runtime authorization을 분리하는 설계를 정리한다.
MidTool을 통해 일반 도구 사용 능력을 mid-training 데이터 합성 문제로 보는 관점을 정리한다.
agent skill library는 평균 성공률만 보면 위험하다. skill이 만드는 gain과 regression을 분리해 운영해야 하는 이유를 정리한다.
LedgerAgent는 tool-calling agent의 작업 상태를 prompt 밖의 typed ledger로 관리하고, 변경성 tool 호출 전에 정책을 검증한다.
AI agent를 prompt wrapper가 아니라 상태, 도구, 행동 선택, 관찰, 평가가 결합된 runtime system으로 이해한다.
MCPEvol-Bench는 MCP 서버의 schema와 기능 변화가 agent 성능을 어떻게 무너뜨리는지 평가하는 benchmark다.
SafeClawBench는 도구 사용 에이전트의 보안 실패를 텍스트 동의, 감사 증거, 실제 sandbox harm으로 분리해 평가한다.
HyperTool은 반복적인 step-wise tool call을 하나의 실행 가능한 도구 단위로 묶어 에이전트의 정확도와 효율을 높인다.