All Posts
172 articles published
[논문 리뷰] Prediction-Powered Smoothing — agent 평가를 적은 라벨로 안정화하기
slice별 agent 평가를 작은 라벨 예산으로 추정할 때 PPI와 smoothing을 어떻게 결합할지 정리한다.
한국어 개인정보 탐지 데이터셋을 직접 구축한 이유
KoPII-Pipeline의 데이터셋 구축 배경, 합성·공개 데이터 결합 과정, 한국어 PII 모델 평가 결과를 정리한다.
[논문 리뷰] OverclaimBench — 코딩 에이전트의 '끝냈다'는 말을 어떻게 검증할까
OverclaimBench를 통해 코딩 에이전트의 완료 보고가 실제 작업 trace와 얼마나 일치하는지 평가하는 방법을 정리한다.
[논문 리뷰] EvoSafeHarness — agent safety harness를 배포 환경별로 진화시키기
EvoSafeHarness 논문을 통해 agent 보안을 고정 guardrail이 아니라 모델·도메인별 runtime harness 최적화 문제로 본다.
[논문 리뷰] SENTINEL-RL — SOC 에이전트는 보안 그래프를 직접 읽지 말아야 한다
SENTINEL-RL을 통해 SOC 에이전트에서 topology reasoning을 외부 graph/RL 엔진으로 분리하는 설계를 정리한다.
AI 시대 개발자가 알아야 할 아키텍처 언어 8가지
AI가 코드를 작성하는 시대에 개발자가 왜 Redis, Kafka 같은 기술명보다 아키텍처 드라이버, 품질 속성, 트레이드오프, ADR 같은 설계 언어를 먼저 익혀야 하는지 정리한다.
[논문 리뷰] WikiSkill — agent 경험을 wiki로 축적해 skill을 진화시키기
WikiSkill 논문을 통해 raw trace, persistent wiki, executable skill을 분리하고 검증 게이트로 agent skill을 진화시키는 구조를 정리한다.
[논문 리뷰] SARA — tool output이 command가 될 때 권한을 분리하는 법
SARA 논문을 통해 tool-augmented agent에서 action induction과 runtime authorization을 분리하는 설계를 정리한다.
데이터베이스는 상태가 사는 곳이다 — 트랜잭션, 잠금, 마이그레이션
백엔드 지식 지도 2편. 동시에 두 요청이 같은 데이터를 만질 때 데이터베이스가 무엇을 보장하고, 무엇은 애플리케이션이 책임져야 하는지 정리한다.
분산 시스템에서는 응답 없음만으로 아무것도 알 수 없다
백엔드 지식 지도 3편. 부분 실패, 타임아웃, 재시도, 멱등성, 과부하 대응, 관측 지표를 하나의 사고방식으로 정리한다.
백엔드 장애를 읽는 법 — 로그만 보지 말고 신호를 연결하자
백엔드 지식 지도 마지막 편. 네트워크, HTTP, OS, DB, 큐, 분산 시스템의 신호를 연결해 장애를 진단하는 실전 순서를 정리한다.
HTTP와 API는 서비스 사이의 계약이다 — 멱등성, 상태코드, 타임아웃
백엔드 지식 지도 5편. HTTP 메서드 의미론, 5xx의 화자, 스트리밍 타임아웃, CORS와 리다이렉트 함정을 실무 관점에서 정리한다.
백엔드 엔지니어를 위한 지식 지도 — 무엇부터 공부해야 하나
백엔드 지식을 네트워크, HTTP, OS와 프로세스, 데이터베이스, 워커와 큐, 분산 시스템이라는 여섯 영역으로 나누고 무엇부터 공부하면 좋은지 정리한다.
네트워크 장애를 읽는 법 — DNS, TCP, TLS, HTTP를 나눠서 보기
백엔드 지식 지도 7편. 연결 실패를 DNS, TCP, TLS, HTTP, 라우팅, 컨테이너 네트워크 문제로 나누어 진단하는 관점을 정리한다.
OS와 프로세스를 모르면 백엔드 장애의 절반은 안 보인다
백엔드 지식 지도 6편. 프로세스, 신호, 파일 디스크립터, 이벤트 루프, GIL, OOM, cgroup을 운영 장애 관점에서 정리한다.
워커와 큐를 쓰면 반드시 물어야 하는 질문 — 이 잡이 두 번 돌면?
백엔드 지식 지도 4편. 큐를 쓰는 이유와 함께 배달 보장, 멱등 소비자, 가시성 타임아웃, DLQ, 큐 격리를 실무 관점에서 정리한다.
Claude 워터마킹과 AI 텍스트 탐지 — 생성된 글은 어디까지 추적 가능한가
Claude 텍스트 워터마킹과 AI 탐지기 구현 사례를 바탕으로, 생성 텍스트를 통계적으로 식별하는 방식과 실무에서 조심해야 할 지점을 정리한다.
[논문 리뷰] MidTool — tool-use는 post-training만으로 해결되지 않는다
MidTool을 통해 일반 도구 사용 능력을 mid-training 데이터 합성 문제로 보는 관점을 정리한다.
[논문 리뷰] TEPA — 오래된 agent memory를 철회하는 법
TEPA는 장기 메모리 에이전트에서 오래된 기억을 삭제가 아니라 철회 가능한 evidence state로 다루는 방법을 제안한다.
[논문 리뷰] TRAJDEBUG — long-horizon agent trajectory에서 첫 치명 오류 찾기
TRAJDEBUG는 장기 agent 실패에서 최종 증상이 아니라 실패를 만든 최초 critical error step을 evidence 기반으로 찾는 프레임워크다.
PyTorch profiling: nn.Linear에서 fused MLP까지 병목 읽기
PyTorch profiler trace로 nn.Linear와 MLP 병목을 읽고 fusion 최적화를 판단하는 실무 기준을 정리한다.
[논문 리뷰] ORCA-bench — oncall RCA agent는 코딩 벤치마크와 다르다
ORCA-bench는 oncall RCA agent 평가를 코드 패치가 아니라 telemetry·source·모호한 장애 신고를 엮는 진단 문제로 다룬다.
[논문 리뷰] Desktop-Delta Bench — GUI agent는 화면 변화를 이해하고 있나
GUI agent 평가는 최종 성공률만으로 부족하다. action 이후 화면 전이를 검증하는 Desktop-Delta Bench를 운영 관점에서 읽는다.
[논문 리뷰] The Regression Tax — agent skill은 추가할수록 좋아질까
agent skill library는 평균 성공률만 보면 위험하다. skill이 만드는 gain과 regression을 분리해 운영해야 하는 이유를 정리한다.
AI 기본기 13: Data-centric AI — 모델보다 데이터셋 품질을 먼저 의심하는 법
AI 시스템 성능을 모델 교체만으로 올리려 하기 전에 데이터 정의, 라벨 품질, 분포, 합성 데이터, 평가셋을 어떻게 설계해야 하는지 정리한다.
[논문 리뷰] LedgerAgent — tool-calling agent에 상태 원장을 붙이기
LedgerAgent는 tool-calling agent의 작업 상태를 prompt 밖의 typed ledger로 관리하고, 변경성 tool 호출 전에 정책을 검증한다.
AI 기본기 8: Agent와 Tool Use — LLM을 실행 가능한 시스템으로 바꾸는 법
AI agent를 prompt wrapper가 아니라 상태, 도구, 행동 선택, 관찰, 평가가 결합된 runtime system으로 이해한다.
[논문 리뷰] MCPEvol-Bench — MCP 서버 변화에 적응하는 agent 평가하기
MCPEvol-Bench는 MCP 서버의 schema와 기능 변화가 agent 성능을 어떻게 무너뜨리는지 평가하는 benchmark다.
ICML 2026 수상 논문 중 LLM 엔지니어가 읽어볼 만한 것들
ICML 2026 수상 논문 중 LLM 엔지니어 관점에서 실무적으로 읽어볼 만한 논문을 추렸다. Diffusion LLM, RLVR, memorization, alignment, 비동기 RL 시스템을 중심으로 정리한다.
[AI Search] BRDFusion: 물리 기반 렌더링과 생성 모델을 함께 쓰는 도시 장면 이해
BRDFusion 논문을 AI Search stack 관점에서 읽는다. 도시 주행 영상에서 geometry, material, HDR lighting을 분해하고, 물리 기반 controllability와 생성 모델의 photorealism을 결합해 relighting, night simulation, object insertion을 가능하게 하는 구조를 정리한다.
[논문 리뷰] Complexity-Aware Agents — 쉬운 작업에 과한 reasoning을 쓰지 않는 법
E3는 agent가 먼저 작업 복잡도를 추정하고, 최소 경로로 실행한 뒤 실패할 때만 범위를 넓히는 실행 정책이다.
[AI Search] Data Journalist Agent: 데이터에서 검증 가능한 멀티모달 스토리까지
Data Journalist Agent, Data2Story 논문을 AI Search stack 관점에서 읽는다. raw dataset을 기사형 웹 스토리로 바꾸는 multi-agent newsroom 구조와 Inspector 기반 provenance, human evaluation, machine-checkable verifiability를 정리한다.
[논문 리뷰] SLBench — agent skill 파일을 실행 가능한 계약으로 테스트하기
Agent skill은 문서가 아니라 precondition·constraint·fallback을 지켜야 하는 실행 계약이다.
AI 기본기: 모델링 관점에서 다시 짜는 학습 로드맵
LinkedIn의 AI 학습자료 목록을 단순 링크 모음이 아니라 모델링 기법 중심의 블로그 연재 커리큘럼으로 재구성한다.
[논문 리뷰] DynaKRAG — multi-hop RAG를 evidence control 문제로 보기
Multi-hop RAG의 병목은 검색 횟수가 아니라 다음 evidence operation을 고르는 제어 정책이다.
[AI Search] Language Models Need Sleep: 긴 컨텍스트를 잠자는 동안 압축하는 법
Language Models Need Sleep 논문을 AI Search stack 관점에서 읽는다. 긴 컨텍스트를 매번 attention cache에 들고 가는 대신, eviction 직전에 여러 번의 offline recurrent pass로 SSM fast weights에 통합하는 sleep 메커니즘이 왜 long-context reasoning과 retrieval-augmented agent runtime에 중요한지 정리한다.
[AI Search] QKV Projection Sharing: Transformer는 정말 Q, K, V 세 개가 모두 필요할까
Do Transformers Need Three Projections? 논문을 AI Search stack 관점에서 읽는다. Query, Key, Value projection을 일부 공유해도 품질을 크게 잃지 않으면서 KV cache를 줄일 수 있는지, Q-K=V가 왜 실용적인 절충점인지, GQA/MQA와 결합하면 on-device·edge search serving에 어떤 의미가 생기는지 정리한다.
[AI Search] Gemma 4: Open-weight Multimodal Model을 Search Stack에서 읽기
Gemma 4 Technical Report를 AI Search stack 관점에서 읽는다. open-weight multimodal model family가 dense/MoE, encoder-free 12B, thinking mode, long-context KV cache 최적화, quantization, MTP drafter를 통해 검색·에이전트 시스템의 실행 위치와 비용 구조를 어떻게 바꾸는지 정리한다.
[논문 리뷰] Distributed Attacks — PR과 시간에 흩어진 코딩 에이전트 공격
코딩 에이전트 보안은 PR 하나의 diff가 아니라 여러 세션에 누적되는 상태와 공격 그래프를 봐야 한다.
[논문 리뷰] Dense Retriever의 위치 편향은 타고나는가, 학습되는가
Dense retriever가 문서 앞부분 정보를 선호하는 현상은 모델 구조만의 문제가 아니라, fine-tuning 데이터에서 정답 근거가 어디에 있었는지에 크게 좌우된다.
Memora: 에이전트 메모리는 RAG보다 더 섬세해야 한다
Microsoft Memora를 통해 에이전트 메모리에서 추상화와 구체성을 분리해야 하는 이유를 정리한다.
[논문 리뷰] BINEVAL — LLM 평가를 점수가 아니라 질문으로 쪼개기
BINEVAL은 LLM 평가 기준을 원자적인 yes/no 질문으로 분해해, 불투명한 단일 점수 대신 디버깅 가능한 평가 신호와 prompt 개선 루프를 만든다.
Headroom: LLM 앞단에 context compression layer를 두는 이유
Headroom을 예로 agent 입력을 LLM에 넣기 전 압축·캐시·복원하는 context layer 설계 포인트를 정리한다.
[논문 리뷰] K-BrowseComp — 한국어 웹 브라우징 에이전트는 왜 어려운가
K-BrowseComp는 한국 맥락의 웹 브라우징 문제로 에이전트의 검색, 증거 연결, 상태 보존 능력을 평가하는 벤치마크다.
[논문 리뷰] Plans Don't Persist — 에이전트의 계획은 생각보다 오래 남지 않는다
Plans Don't Persist는 장기 실행 에이전트에서 계획이 모델 내부 상태로 유지되지 않고 context에 의존한다는 점을 측정한다.
[논문 리뷰] HarnessX — 에이전트 하네스를 실행 트레이스로 진화시키기
Xiaomi 연구진의 HarnessX 논문을 바탕으로, 프롬프트·도구·메모리·제어 흐름으로 구성된 에이전트 하네스를 1급 객체로 만들고 실행 트레이스로 자동 진화시키는 방법을 정리한다.
루프 엔지니어링 — 프롬프트가 아니라 검증 루프를 설계하는 일
Loop Engineering은 에이전트에게 한 번 더 좋은 프롬프트를 쓰는 일이 아니라, 발견·계획·실행·검증·반복 사이클을 시스템으로 설계하는 일이다.
[논문 리뷰] SafeClawBench — 도구 사용 에이전트의 보안 실패를 세 단계로 보기
SafeClawBench는 도구 사용 에이전트의 보안 실패를 텍스트 동의, 감사 증거, 실제 sandbox harm으로 분리해 평가한다.
외부 코딩 에이전트를 붙이기 전에 보안 게이트부터 설계하자
GitHub의 third-party coding agent 보안 검증을 계기로, 코딩 에이전트 도입 전 필요한 권한·검증·감사 게이트를 정리한다.
MinSync — 파일이 바뀐 만큼만 다시 인덱싱하기
MinSync는 git 없이 파일 변경을 추적하고, 바뀐 텍스트만 다시 chunking·embedding해서 로컬 vector index를 최신 상태로 유지한다.
[논문 리뷰] HyperTool — 에이전트의 도구 호출 단위를 다시 설계하기
HyperTool은 반복적인 step-wise tool call을 하나의 실행 가능한 도구 단위로 묶어 에이전트의 정확도와 효율을 높인다.
AI에게 기억을 주다: 장기기억 메모리 시스템의 진화
AI 모델의 문맥 길이 한계를 극복하는 3가지 메모리 솔루션 — Supermemory, Mem0, Turbo-graph의 설계 철학과 실무 적용 방법.
AI 엔지니어 필독 논문 10개 — ③ 실무 적용과 학술의 속도 (RAG, LoRA, PEFT)
대형 언어 모델 시대, 학술은 이제 Nature가 아닌 arXiv에서 일어난다. RAG와 PEFT가 어떻게 실무 AI 엔지니어의 필수 무기가 되었는지, 논문 3편으로 정리하기.
AI 엔지니어 필독 논문 10개 — ② NLP 혁명과 멀티모달 (BERT, GPT, ViT, DDPM)
BERT와 GPT로 시작된 언어 모델 시대. 그리고 Transformer를 이미지와 생성 모델로 확장한 ViT와 DDPM이 어떻게 AI 업계를 바꿨는지.
AI 엔지니어 필독 논문 10개 — ① 기초 아키텍처 (Attention, VAE, GANs)
AI 면접 단골 논문 10개를 정리한 시리즈 첫 편. Attention Is All You Need, VAE, GANs가 어떻게 현대 AI의 기초를 다졌는지 이해한다.
RPG 포트폴리오 만들기 — Kaboom.js 픽셀 RPG 단일 페이지
Kaboom.js로 픽셀 RPG 형식의 인터랙티브 이력서를 만들고, NDA를 보호하며 공개하는 프로젝트 만들기
AI 엔지니어 필독 논문 10개 — ③ 실무 적용과 학술의 속도 (RAG, LoRA, PEFT)
큰 모델을 효율적으로 운영하고, 환각을 줄이고, 제한된 리소스에서 학습하는 3가지 실무 기술. 그리고 AI 논문이 Nature/Science를 무시하고 arXiv에서 업계로 직결되는 이유.
[논문 리뷰] DeepSeek-V4 — 1M Context에서 KV Cache 10% 수준으로 압축한 Hybrid Attention
DeepSeek-V4는 기존 Multi-Head Attention의 개념을 바탕으로, Compressed Sparse Attention(CSA)와 Heavily Compressed Attention(HCA)을 결합한 Hybrid Attention으로 1M token context를 지원하면서도 KV cache를 90% 감축했다. 이전 Attention 이해하기 시리즈의 Q/K/V와 Multi-Head Attention 개념을 이어 DeepSeek-V4가 어떻게 구현했는지 살펴본다.
merge냐 rebase냐 — 히스토리를 어떻게 그릴 것인가
merge는 기록, rebase는 재서술. 두 명령의 동작과 황금률(공유 브랜치 rebase 금지), 그리고 팀 규약 패턴 세 가지를 정리한다.
[논문 리뷰] A-RAG: Agentic RAG가 2026년의 기본기가 된 이유
단일 retriever→generator 파이프라인이 한계를 보이는 가운데, 질의 분해·병렬 검색·검증·합성을 에이전트가 분담하는 A-RAG의 계층적 검색 인터페이스를 살펴본다.
[논문 리뷰] EnterpriseRAG-Bench: 사내 지식 RAG 벤치마크
위키·뉴스 데이터에 치우쳐 있던 RAG 벤치마크의 한계를 지적하고, Slack·Gmail·Jira 등 9종 사내 소스를 모사한 50만 문서 규모의 합성 코퍼스와 500개 질문셋을 제안한 논문.
SSH·SCP·Rsync — 원격 접속과 파일 동기화 한 묶음
원격 서버 접속, 키 인증, ~/.ssh/config로 별명 만들기, 포트 포워딩, 그리고 파일 옮기는 scp/rsync까지. 실전에서 매일 쓰는 패턴 위주로 정리.
파일 검색 명령어 정리 — find, grep, fd, ripgrep
터미널에서 '그 파일 어디 있더라'와 '이 단어 어느 파일에 있더라'를 빠르게 해결하는 네 가지 도구 — find, grep, fd, ripgrep을 한 번에 정리한다.
man이 너무 길 때 — tldr로 리눅스 명령어 빠르게 익히기
man 페이지를 끝까지 읽지 않고도 자주 쓰는 옵션 한두 개만 빠르게 확인하고 싶을 때, tldr이 가장 편하다. 설치부터 실전 활용까지 정리.
Markdown 정복기 (2) — 코드, 표, 이미지
Markdown 시리즈 2편. 자주 쓰지만 자주 깨지는 영역 — 코드 블록(언어 지정, 라인 강조), 표(정렬), 이미지(크기·캡션)를 정리한다.
Markdown 정복기 (1) — 기본 문법 한 번에 정리
Markdown 시리즈 1편. 헤딩, 강조, 리스트, 링크, 인용 등 어떤 환경에서도 통하는 기본 문법을 한 번에 정리한다.
[NLP] Transformer 3가지 Attention 자세히 보기 (Encoder/Decoder Self-Attention, Cross-Attention, Multi-Head)
이전 글에서 등장한 Transformer의 3가지 Attention(Encoder Self-Attention, Decoder Masked Self-Attention, Encoder-Decoder Attention)이 각각 어떻게 동작하는지, 그리고 Multi-Head Attention이 왜 필요한지 정리한다.