#benchmark
6 posts tagged
Paper Review07.302026-07-30 09:0014 min read
[논문 리뷰] Desktop-Delta Bench — GUI agent는 화면 변화를 이해하고 있나
GUI agent 평가는 최종 성공률만으로 부족하다. action 이후 화면 전이를 검증하는 Desktop-Delta Bench를 운영 관점에서 읽는다.
Paper Review06.262026-06-26 09:0018 min read
[논문 리뷰] K-BrowseComp — 한국어 웹 브라우징 에이전트는 왜 어려운가
K-BrowseComp는 한국 맥락의 웹 브라우징 문제로 에이전트의 검색, 증거 연결, 상태 보존 능력을 평가하는 벤치마크다.
Paper Review06.202026-06-20 09:0015 min read
[논문 리뷰] SafeClawBench — 도구 사용 에이전트의 보안 실패를 세 단계로 보기
SafeClawBench는 도구 사용 에이전트의 보안 실패를 텍스트 동의, 감사 증거, 실제 sandbox harm으로 분리해 평가한다.
Paper Review05.052026-05-05 16:2016 min read
[논문 리뷰] EnterpriseRAG-Bench: 사내 지식 RAG 벤치마크
위키·뉴스 데이터에 치우쳐 있던 RAG 벤치마크의 한계를 지적하고, Slack·Gmail·Jira 등 9종 사내 소스를 모사한 50만 문서 규모의 합성 코퍼스와 500개 질문셋을 제안한 논문.