Project09.202026-09-20 09:0023 min read
한국어 개인정보 탐지 데이터셋을 직접 구축한 이유
KoPII-Pipeline의 데이터셋 구축 배경, 합성·공개 데이터 결합 과정, 한국어 PII 모델 평가 결과를 정리한다.
2 posts tagged
KoPII-Pipeline의 데이터셋 구축 배경, 합성·공개 데이터 결합 과정, 한국어 PII 모델 평가 결과를 정리한다.
AI 시스템 성능을 모델 교체만으로 올리려 하기 전에 데이터 정의, 라벨 품질, 분포, 합성 데이터, 평가셋을 어떻게 설계해야 하는지 정리한다.