Paper Review09.222026-09-22 09:0016 min read
[논문 리뷰] Prediction-Powered Smoothing — agent 평가를 적은 라벨로 안정화하기
slice별 agent 평가를 작은 라벨 예산으로 추정할 때 PPI와 smoothing을 어떻게 결합할지 정리한다.
3 posts tagged
slice별 agent 평가를 작은 라벨 예산으로 추정할 때 PPI와 smoothing을 어떻게 결합할지 정리한다.
OverclaimBench를 통해 코딩 에이전트의 완료 보고가 실제 작업 trace와 얼마나 일치하는지 평가하는 방법을 정리한다.
MCPEvol-Bench는 MCP 서버의 schema와 기능 변화가 agent 성능을 어떻게 무너뜨리는지 평가하는 benchmark다.