Paper Review07.072026-07-07 09:0028 min read[AI Search] FineWeb2: Multilingual Search를 위한 데이터 파이프라인FineWeb2 논문을 AI Search stack 관점에서 읽는다. 다국어 검색 품질은 retrieval model만의 문제가 아니라 언어 식별, deduplication, 언어별 filtering, quality-aware rebalancing으로 만들어지는 데이터 파이프라인 문제다.#AI Search#FineWeb2#multilingual+3
Paper Review07.062026-07-06 09:0023 min read[AI Search] GlotLID: Multilingual Search의 첫 번째 게이트GlotLID 논문을 AI Search stack 관점에서 읽는다. 다국어 검색·RAG에서 언어 식별은 작은 전처리처럼 보이지만, 실제로는 인덱스 라우팅, 데이터 정제, low-resource corpus 품질을 결정하는 첫 번째 게이트다.#AI Search#GlotLID#language-identification+3