[논문 리뷰] EvoSafeHarness — agent safety harness를 배포 환경별로 진화시키기
EvoSafeHarness 논문을 통해 agent 보안을 고정 guardrail이 아니라 모델·도메인별 runtime harness 최적화 문제로 본다.
12 posts tagged
EvoSafeHarness 논문을 통해 agent 보안을 고정 guardrail이 아니라 모델·도메인별 runtime harness 최적화 문제로 본다.
MidTool을 통해 일반 도구 사용 능력을 mid-training 데이터 합성 문제로 보는 관점을 정리한다.
TEPA는 장기 메모리 에이전트에서 오래된 기억을 삭제가 아니라 철회 가능한 evidence state로 다루는 방법을 제안한다.
TRAJDEBUG는 장기 agent 실패에서 최종 증상이 아니라 실패를 만든 최초 critical error step을 evidence 기반으로 찾는 프레임워크다.
ORCA-bench는 oncall RCA agent 평가를 코드 패치가 아니라 telemetry·source·모호한 장애 신고를 엮는 진단 문제로 다룬다.
agent skill library는 평균 성공률만 보면 위험하다. skill이 만드는 gain과 regression을 분리해 운영해야 하는 이유를 정리한다.
BINEVAL은 LLM 평가 기준을 원자적인 yes/no 질문으로 분해해, 불투명한 단일 점수 대신 디버깅 가능한 평가 신호와 prompt 개선 루프를 만든다.
Plans Don't Persist는 장기 실행 에이전트에서 계획이 모델 내부 상태로 유지되지 않고 context에 의존한다는 점을 측정한다.