[논문 리뷰] WikiSkill — agent 경험을 wiki로 축적해 skill을 진화시키기
WikiSkill 논문을 통해 raw trace, persistent wiki, executable skill을 분리하고 검증 게이트로 agent skill을 진화시키는 구조를 정리한다.
29 posts tagged
WikiSkill 논문을 통해 raw trace, persistent wiki, executable skill을 분리하고 검증 게이트로 agent skill을 진화시키는 구조를 정리한다.
MidTool을 통해 일반 도구 사용 능력을 mid-training 데이터 합성 문제로 보는 관점을 정리한다.
TRAJDEBUG는 장기 agent 실패에서 최종 증상이 아니라 실패를 만든 최초 critical error step을 evidence 기반으로 찾는 프레임워크다.
ORCA-bench는 oncall RCA agent 평가를 코드 패치가 아니라 telemetry·source·모호한 장애 신고를 엮는 진단 문제로 다룬다.
LedgerAgent는 tool-calling agent의 작업 상태를 prompt 밖의 typed ledger로 관리하고, 변경성 tool 호출 전에 정책을 검증한다.
AI agent를 prompt wrapper가 아니라 상태, 도구, 행동 선택, 관찰, 평가가 결합된 runtime system으로 이해한다.
E3는 agent가 먼저 작업 복잡도를 추정하고, 최소 경로로 실행한 뒤 실패할 때만 범위를 넓히는 실행 정책이다.
LinkedIn의 AI 학습자료 목록을 단순 링크 모음이 아니라 모델링 기법 중심의 블로그 연재 커리큘럼으로 재구성한다.
BINEVAL은 LLM 평가 기준을 원자적인 yes/no 질문으로 분해해, 불투명한 단일 점수 대신 디버깅 가능한 평가 신호와 prompt 개선 루프를 만든다.
K-BrowseComp는 한국 맥락의 웹 브라우징 문제로 에이전트의 검색, 증거 연결, 상태 보존 능력을 평가하는 벤치마크다.
Plans Don't Persist는 장기 실행 에이전트에서 계획이 모델 내부 상태로 유지되지 않고 context에 의존한다는 점을 측정한다.
Xiaomi 연구진의 HarnessX 논문을 바탕으로, 프롬프트·도구·메모리·제어 흐름으로 구성된 에이전트 하네스를 1급 객체로 만들고 실행 트레이스로 자동 진화시키는 방법을 정리한다.
Loop Engineering은 에이전트에게 한 번 더 좋은 프롬프트를 쓰는 일이 아니라, 발견·계획·실행·검증·반복 사이클을 시스템으로 설계하는 일이다.
MinSync는 git 없이 파일 변경을 추적하고, 바뀐 텍스트만 다시 chunking·embedding해서 로컬 vector index를 최신 상태로 유지한다.
HyperTool은 반복적인 step-wise tool call을 하나의 실행 가능한 도구 단위로 묶어 에이전트의 정확도와 효율을 높인다.