sy/dev
Paper Review
27 min read

[AI Search] Incompressible Knowledge Probes: LLM의 파라미터 수를 지식 용량으로 추정할 수 있을까

Incompressible Knowledge Probes 논문을 AI Search stack 관점에서 읽는다. 닫힌 LLM의 파라미터 수를 추론 비용이 아니라 희귀 factual knowledge recall로 추정하려는 시도와, 이 방법이 모델 선택·평가·검색 시스템 설계에 주는 의미를 정리한다.

  1. 0AI Search는 Vector DB만으로 끝나지 않는다
  2. 1[AI Search] Roaring Bitmap: Vector Search 이전에 필요한 빠른 필터링
  3. 2[AI Search] ColBERT: 문서를 하나의 벡터로 뭉개지 않는 검색
  4. 3[AI Search] PLAID: ColBERT를 빠르게 만드는 검색 엔진
  5. 4[AI Search] SPLATE: Sparse Retrieval과 Late Interaction의 만남
  6. 5[AI Search] LIMIT: Embedding Search의 이론적 한계
  7. 6[AI Search] Gemini Embedding 2: Multimodal Search를 위한 Unified Embedding
  8. 7[AI Search] Position Bias: Dense Retriever가 문서 앞쪽을 좋아하는 이유
  9. 8[AI Search] AcuRank: Reranking Compute를 어려운 쿼리에 더 쓰는 법
  10. 9[AI Search] LDAR: Long Context와 RAG 사이에서 Distractor를 피하는 검색
  11. 10[AI Search] GlotLID: Multilingual Search의 첫 번째 게이트
  12. 11[AI Search] FineWeb2: Multilingual Search를 위한 데이터 파이프라인
  13. 12[AI Search] GLiNER: 검색 문서에서 원하는 Entity를 바로 뽑는 Open NER
  14. 13[AI Search] SWE-agent: Agent에게는 검색창보다 Interface가 필요하다
  15. 14[AI Search] Darwin Gödel Machine: 스스로 진화하는 Agent를 어떻게 평가할 것인가
  16. 15[AI Search] Gemma 4: Open-weight Multimodal Model을 Search Stack에서 읽기
  17. 16[AI Search] QKV Projection Sharing: Transformer는 정말 Q, K, V 세 개가 모두 필요할까
  18. 17[AI Search] Language Models Need Sleep: 긴 컨텍스트를 잠자는 동안 압축하는 법
  19. 18[AI Search] Looped World Models: World Model에 반복 계산 깊이를 넣는 법
  20. 19[AI Search] VibeThinker-3B: 작은 모델은 어디까지 검증 가능한 추론을 할 수 있나
  21. 20[AI Search] Data Journalist Agent: 데이터에서 검증 가능한 멀티모달 스토리까지
  22. 21[AI Search] BRDFusion: 물리 기반 렌더링과 생성 모델을 함께 쓰는 도시 장면 이해
  23. 22[AI Search] LOCUS: 검색 가능한 지역 법령 코퍼스를 만드는 일
  24. 23[AI Search] Incompressible Knowledge Probes: LLM의 파라미터 수를 지식 용량으로 추정할 수 있을까

Incompressible Knowledge Probes: Estimating Black-Box LLM Parameter Counts via Factual Capacity

Bojie Li (2026)- arXiv

한 줄 요약

이 논문은 닫힌 LLM의 파라미터 수를 API latency나 가격으로 추정하지 말고, 모델이 외우고 있는 희귀 factual knowledge의 양으로 거칠게 추정해보자는 논문이다.

논문이 제안하는 Incompressible Knowledge Probes, 줄여서 IKP는 모델에게 1,400개의 희귀 사실 질문을 던진 뒤, open-weight model에서 관측한 정답률 ↔ 파라미터 수 관계를 이용해 proprietary model의 effective knowledge capacity를 추정한다.

AI Search 관점에서 보면 이 논문은 “어떤 모델이 더 똑똑한가”보다 더 구체적인 질문을 던진다.

이 모델은 검색 없이, 자기 파라미터 안에 얼마나 긴 꼬리의 지식을 저장하고 있는가?

왜 AI Search에 중요한가

AI Search 시스템을 만들 때 모델의 역할은 크게 두 가지로 갈린다.

외부 지식 접근: retrieval, web search, DB, tool
내부 지식 접근: parametric memory, world knowledge, domain familiarity

RAG를 붙이면 모든 문제가 해결될 것처럼 보이지만, 실제 제품에서는 여전히 모델 내부 지식이 중요하다.

  • query rewrite에서 사용자의 표현을 domain concept으로 바꾸기
  • 검색 결과가 이상한지 감지하기
  • entity, acronym, 연구자, 제품명, 라이브러리명을 대략적으로 알아보기
  • retrieved evidence가 부족할 때 답변을 보수적으로 멈추기
  • long-tail domain에서 hallucination과 refusal 패턴을 예측하기

즉 AI Search stack은 “검색기가 얼마나 좋은가”만의 문제가 아니다. reader model이 검색 전에 이미 무엇을 알고 있는가가 pipeline 전체 품질에 영향을 준다.

IKP는 이 parametric knowledge를 측정하려는 시도다. 특히 closed-source model의 파라미터 수가 공개되지 않는 상황에서, 모델의 지식 용량을 black-box API만으로 추정하려는 점이 흥미롭다.

문제의식: 추론 비용으로 모델 크기를 맞히는 건 너무 외부 요인에 흔들린다

닫힌 모델의 파라미터 수를 추정할 때 흔히 쓰는 방법은 inference economics다.

대략 이런 식이다.

API 가격 / latency / throughput
  → 필요한 GPU 수 추정
  → serving stack 가정
  → 모델 크기 역산

그런데 이 방법은 모델 자체보다 외부 요인에 많이 흔들린다.

  • hardware generation
  • batching
  • quantization
  • speculative decoding
  • MoE routing
  • vendor pricing strategy
  • serving optimization

논문은 이 대신 모델 내부에 저장된 지식량을 보자고 한다.

핵심 직관은 단순하다.

어떤 사실은 reasoning으로 계산할 수 없다. 그런 사실을 맞히려면 어딘가에 저장되어 있어야 한다.

예를 들어 “USTC Hackergame이 언제 시작됐는가” 같은 정보는 일반 언어 능력만으로 유도할 수 없다. 이 정보는 학습 데이터에서 본 뒤 모델 파라미터 안에 저장됐거나, 외부 검색으로 가져와야 한다.

논문은 이런 종류의 사실을 incompressible knowledge로 본다.

핵심 아이디어: 압축 가능한 능력과 압축 불가능한 지식을 분리한다

논문의 중요한 구분은 이거다.

구분예시scaling 해석
procedural capability추론, 문법 처리, instruction following, 문제 풀이 전략architecture와 post-training 개선으로 더 작은 모델에 압축 가능
factual capacity특정 연구자, 기관 설립연도, 희귀 entity 속성, obscure event사실 자체를 저장해야 하므로 압축에 한계가 있음

최근 작은 모델이 MMLU나 일부 reasoning benchmark에서 예전 큰 모델을 따라잡는 현상은 꽤 익숙하다. 논문은 이를 Densing Law 맥락에서 설명한다. procedural capability는 시간이 지나며 parameter당 효율이 좋아진다.

하지만 factual knowledge는 다르다고 본다. “희귀한 사실을 알고 있음”은 더 좋은 reasoning recipe만으로 생기지 않는다. 결국 training data에서 봤고, 모델 안에 저장됐어야 한다.

그래서 저자는 IKP가 benchmark saturation의 반대편을 본다고 주장한다.

reasoning benchmark가 압축 가능한 능력을 재는 동안, IKP는 압축하기 어려운 factual storage를 잰다.

IKP는 어떻게 만들었나

IKP는 총 1,400개 probe로 구성된다. 난이도는 T1부터 T7까지 7개 tier이고, 각 tier에 200개씩 배치한다.

큰 흐름은 두 단계다.

Phase A: LLM-generated candidates
  - 주로 T1~T2
  - 쉬운/중간 난이도 사실 질문 생성
 
Phase B: corpus-grounded probes
  - 주로 T3~T7
  - Wikidata, DBLP, arXiv/OpenAlex 기반 long-tail 사실 추출

중요한 점은 어려운 probe를 LLM에게 그냥 만들라고 하지 않았다는 것이다. 논문에 따르면 LLM-generated candidate의 약 82%는 난이도 프롬프트를 줘도 T1~T2에 머문다. 모델이 모르는 long-tail 사실을 모델에게 생성시키는 건 순환 논리에 빠지기 쉽다.

그래서 T3~T7은 외부 corpus에서 가져온다.

  • Wikidata 기반 founding year, geography, institution, civic landmark 등
  • DBLP / arXiv / OpenAlex 기반 CS researcher probe
  • 연구자 probe는 “subfield + 관련 paper/system/institution/co-author”를 함께 요구

특히 연구자 probe가 재밌다.

질문: In computer science, what is the research subfield of [Name],
      and name one paper, system, institution, or co-author associated with their work?

단순히 “이 사람은 database 연구자입니다”라고 말하는 것만으로는 부족하다. 관련 논문, 시스템, 기관, 공동저자 같은 검증 가능한 artifact를 같이 말해야 한다. 이렇게 해야 모델이 그럴듯한 분야명을 찍는 것을 줄일 수 있다.

품질 필터링: long-tail benchmark는 생각보다 지저분하다

이 논문에서 마음에 든 부분은 probe 품질 문제를 꽤 솔직하게 다룬다는 점이다.

초기 1,400개 probe 중 name collision과 label ambiguity를 점검했고, 최종 분석에는 1,311개 cleaned probe를 사용한다. 제거된 항목은 89개, 약 6.4%다.

필터링 대상은 다음과 같다.

  • reasoning으로 계산 가능한 질문
  • 더 강한 landmark model은 틀리고 약한 model은 맞히는 비단조 probe
  • 동명이인 collision이 큰 연구자 이름
  • AI/ML 쪽처럼 frontier model training corpus에 과도하게 노출됐을 가능성이 큰 항목
  • Wikidata label만으로는 어떤 entity인지 불분명한 질문
  • Wikidata 자체의 long-tail 오류

이 대목은 AI Search 평가에서도 그대로 중요하다. long-tail evaluation set을 만들면 “모델이 틀렸다”고 말하기 전에, 사실은 정답 DB나 질문 자체가 애매한 경우가 적지 않다.

논문은 ambiguous probe를 제거하자 calibration이 좋아졌다고 보고한다.

항목제거 전제거 후
probe 수1,4001,311
calibration R²0.9000.910
90% prediction interval factor3.45x3.20x

scoring: hallucination penalty를 빼고 정답률만 본다

IKP의 기본 점수는 단순하다.

IKP accuracy = 맞힌 probe 비율

논문은 hallucination penalty를 기본값에서 제거한다. 즉, 모르면 거절한 답과 틀린 답은 둘 다 0점이다.

이 선택은 논쟁적일 수 있다. hallucination을 덜 하는 모델이 불리해질 수 있기 때문이다. 예를 들어 safety-tuned model은 실제로 알고 있는 사실도 거절할 수 있다. 그러면 IKP는 해당 모델의 실제 지식 용량을 과소평가한다.

저자는 이 문제를 인정한다. 대신 penalty hyperparameter와 tier별 flooring 선택이 frontier estimate를 크게 흔들 수 있으니, 기본 결과는 가장 단순한 no-penalty scoring으로 둔다. 따라서 refusal이 많은 모델의 estimate는 lower bound로 읽어야 한다.

결과 1: 지식 정답률은 파라미터 수와 꽤 잘 맞는다

논문은 93개 open-weight model을 calibration set으로 사용한다. 크기는 135M부터 1,600B까지이고, 19개 vendor를 포함한다.

회귀식은 단순하다.

accuracy = slope * log10(parameter_count_in_billions) + intercept

핵심 결과는 다음과 같다.

결과값
open model calibration93 models
parameter range135M ~ 1,600B
전체 R²0.910
10x parameter 증가당 accuracy 증가약 15.9pp
leave-one-out median fold error1.48x
2x 안에 들어온 비율72%
3x 안에 들어온 비율86%
90% prediction interval factor약 3.20x

이 숫자의 해석은 조심해야 한다. IKP는 “정확한 파라미터 수 측정기”가 아니다. 논문도 계속 강조하듯이, 이건 대략적인 order-of-magnitude estimator다.

그래도 black-box API만으로 이 정도 correlation이 나온다는 점은 흥미롭다. 특히 모델의 가격이나 latency가 아니라, 모델이 실제로 기억하는 long-tail fact를 사용한다는 점에서 기존 추정 방식과 다른 신호다.

결과 2: MoE는 active parameter보다 total parameter가 factual knowledge를 더 잘 설명한다

Mixture-of-Experts model에서는 항상 질문이 생긴다.

지식 용량은 active parameter를 봐야 하나, total parameter를 봐야 하나?

IKP 결과에서는 total parameter가 더 잘 맞는다.

MoE 기준R²
total parameters0.67
active parameters0.41

논문은 이를 factual knowledge가 특정 token에서 활성화되는 expert 일부에만 국소적으로 저장되는 것이 아니라, 전체 expert weight에 분산되어 저장된다는 쪽으로 해석한다.

AI Search 관점에서는 꽤 실용적인 의미가 있다. MoE model을 reader나 reranker로 쓸 때, latency 관점에서는 active parameter가 중요하지만, parametric knowledge coverage 관점에서는 total capacity를 무시하면 안 된다는 뜻이다.

결과 3: thinking mode는 지식을 새로 만들지 않는다

논문은 base/think pair 30개를 비교한다. thinking mode는 평균적으로 약 +2.3pp accuracy를 올린다. 다만 효과는 T3~T4 같은 중간 난이도 tier에서 크고, T7에서는 사라진다.

해석은 직관적이다.

thinking mode가 하는 일:
  저장된 지식을 더 잘 꺼내기
 
thinking mode가 못 하는 일:
  파라미터 안에 없는 희귀 사실을 새로 만들기

이건 RAG/agent system에도 그대로 적용된다. reasoning budget을 늘리면 검색 결과를 더 잘 조합하거나 기억을 더 잘 호출할 수는 있다. 하지만 source에 없고 model에도 없는 사실을 안정적으로 만들어낼 수는 없다.

그래서 search stack에서는 thinking model 호출을 “지식 보강”으로 착각하면 안 된다. 없는 지식은 retrieval이나 tool로 가져와야 한다.

결과 4: Densing Law는 factual knowledge에는 잘 적용되지 않는다

논문은 2023년 9월부터 2026년 6월까지의 100개 open-weight model을 대상으로, 같은 parameter count에서 시간이 지날수록 IKP accuracy가 올라가는지 본다.

Densing Law식 예측이라면 parameter당 capability가 빠르게 좋아져야 한다. 논문이 계산한 예측치는 약 +0.0129/month, 즉 연간 약 +15.4pp다.

하지만 실제 IKP의 time coefficient는 다음과 같다.

+0.0013 / month
95% CI: [-0.0004, +0.0033]
p = 0.19

사실상 0과 구분되지 않는다. 논문은 Densing prediction을 p < 1e-15로 기각한다고 보고한다.

이 결과가 맞다면, 작은 모델이 reasoning benchmark에서 큰 모델을 따라잡는 현상과 별개로, long-tail factual capacity는 여전히 parameter scaling에 강하게 묶여 있다.

표준 benchmark와 비교하면?

논문은 MMLU, MMLU-Pro, GPQA Diamond, SimpleQA와도 비교한다. 같은 open-weight subset에서 parameter count proxy로 얼마나 잘 작동하는지 본 것이다.

요약하면 IKP가 더 안정적이다.

MetricR² vs log10(N)같은 subset의 IKP R²시간 drift
SimpleQA0.9040.991+0.03pp/month
MMLU0.7050.886+0.58pp/month
MMLU-Pro0.6890.900+0.82pp/month
GPQA Diamond0.5200.903+1.99pp/month

MMLU-Pro나 GPQA처럼 reasoning-heavy benchmark일수록 시간이 지나며 같은 크기의 모델도 점수가 올라간다. 반면 SimpleQA와 IKP처럼 순수 factual recall에 가까운 benchmark는 time drift가 작다.

이 비교는 논문의 주장을 잘 보여준다.

benchmark가 무엇을 재는지에 따라 scaling law가 다르게 보인다.

closed model estimate는 어떻게 읽어야 하나

논문은 97개 proprietary model에 대해 open-model-equivalent parameter band를 보고한다. 예를 들어 상위권 모델들은 수조 parameter equivalent로 추정된다.

다만 이 부분은 특히 조심해서 읽어야 한다.

  • 결과는 point estimate가 아니라 90% prediction interval이다.
  • interval factor가 약 3.2x로 넓다.
  • 1T 이상 open-weight calibration anchor가 적어서 high-end extrapolation 불확실성이 더 크다.
  • refusal-heavy model은 no-penalty scoring에서 실제보다 작게 보일 수 있다.
  • Gemini 3.x family는 tier landmark 영향 때문에 frontier estimate table에서 제외된다.

그래서 “어떤 모델이 정확히 몇 B/T parameter다”라고 읽으면 안 된다. 더 적절한 해석은 이렇다.

이 모델은 long-tail factual recall 기준으로
대략 어느 capacity band에 놓이는가?

즉 IKP는 모델의 비밀 파라미터 수를 폭로하는 도구라기보다, 검색 없이 커버 가능한 long-tail 지식 범위의 상대 비교 도구에 가깝다.

hallucination similarity: 틀린 답도 fingerprint가 된다

논문 후반의 재밌는 부분은 hallucination similarity다. 모델 A와 B가 둘 다 틀린 probe에서, 같은 틀린 답을 냈는지를 본다.

독립적으로 학습된 모델이라면 obscure fact에 대해 같은 오답을 낼 확률이 낮다. 반대로 같은 base weight를 공유하거나 lineage가 가까우면, 틀릴 때도 비슷하게 틀릴 수 있다.

논문은 HSS, Hallucination Similarity Score를 사용해 세 가지 regime을 구분한다.

regime기준해석
shared baseHSS ≥ 0.30, Jaccard ≥ 0.60같은 weight를 inference/alignment만 다르게 serving
lineage0.10 ≤ HSS < 0.30post-training, continued pretraining, distillation 가능성
retrainedHSS < 0.10독립 재학습에 가까운 패턴

이건 AI Search evaluation에서도 꽤 쓸 만한 아이디어다. 정답률만 보면 비슷한 모델 두 개가, 오답 패턴을 보면 완전히 다른 lineage일 수 있다. 특히 ensemble, model routing, fallback 설계에서는 “같이 틀리는 모델”을 피하는 게 중요하다.

AI Search stack에서의 위치

저는 IKP를 search stack 안에서 다음 위치에 놓고 싶다.

model selection / evaluation layer
  ├─ latency, price, context length
  ├─ reasoning benchmark
  ├─ domain eval
  ├─ retrieval-augmented task eval
  └─ parametric knowledge coverage eval  ← IKP류 probe

IKP 자체를 그대로 제품 benchmark로 쓰기보다는, 조직의 domain에 맞게 변형하는 게 더 현실적이다.

예를 들어 enterprise AI Search라면 이런 probe가 필요하다.

domainincompressible probe 예시
사내 문서 검색특정 프로젝트 코드명, 과거 의사결정, 내부 시스템 약어
법률/세무 검색특정 조항 번호, 예규명, 판례 식별자, 개정 시점
개발자 검색obscure library API, commit-era behavior, maintainer artifact
리서치 검색long-tail 논문 저자, 시스템 이름, dataset lineage

단, 사내/도메인 사실은 공개 web pretraining에 없을 수 있으므로 “모델이 모르는 게 정상”이다. 이때 IKP식 probe는 모델 자체 평가보다 RAG coverage 평가로 바뀐다.

without retrieval: parametric baseline
with retrieval: system coverage
둘의 차이: retrieval layer가 실제로 채워주는 지식량

이 관점이 실무적으로 더 중요하다. 좋은 AI Search system은 모델이 모르는 사실을 잘 가져와야 한다. 따라서 IKP류 평가를 retrieval on/off로 나눠 돌리면, reader model의 내부 지식과 search layer의 기여도를 분리해서 볼 수 있다.

실무적으로 생각해볼 점

1. “모델이 안다”와 “검색해서 찾는다”를 분리해서 평가해야 한다

RAG 평가에서 흔한 실수는 end-to-end 정답률만 보는 것이다. 하지만 답을 맞혔다고 해서 retrieval이 잘 된 것은 아닐 수 있다. 모델이 이미 알고 있었을 수도 있다.

IKP식 baseline을 먼저 재면 이 문제를 줄일 수 있다.

closed-book score: model parametric knowledge
open-book score: model + retrieval system
delta: retrieval이 실제로 더한 가치

2. long-tail eval set은 품질 관리 비용이 크다

논문이 Wikidata long-tail 오류와 label ambiguity를 길게 다룬 이유가 있다. obscure fact일수록 source도 지저분해진다.

AI Search 평가셋을 만들 때도 자동 생성만 믿으면 안 된다.

  • entity collision
  • outdated answer
  • ambiguous question
  • contested attribution
  • source mismatch
  • 질문에 정답 힌트가 포함되는 leakage

이런 문제를 audit하지 않으면 모델 평가가 아니라 데이터셋 오류 측정이 된다.

3. refusal은 capacity 평가를 왜곡한다

no-penalty scoring에서 refusal은 ignorance와 같다. 그래서 safety-tuned model은 실제보다 작아 보일 수 있다.

서비스에서는 이 차이가 중요하다.

모르는가?
알지만 말하지 않는가?
그럴듯하게 틀리는가?

세 경우의 UX와 risk는 다르다. AI Search 제품에서는 정답률뿐 아니라 refusal rate, hallucination rate, abstention quality를 따로 봐야 한다.

4. 오답 패턴은 routing과 ensemble 설계에 쓸 수 있다

두 모델이 정답률은 비슷해도 같은 문제에서 같이 틀리면 ensemble 가치가 낮다. 반대로 error correlation이 낮으면 fallback model로 의미가 있다.

IKP의 hallucination similarity는 이를 long-tail factual probe로 측정하는 한 방법이다.

한계

논문이 인정하는 한계도 꽤 명확하다.

  1. prediction interval이 넓다
    90% prediction interval factor가 약 3.20x다. precise parameter counter가 아니다.

  2. 1T 이상 calibration anchor가 부족하다
    1T 이상 open-weight model이 많지 않아 최상위 closed model estimate는 extrapolation 성격이 강하다.

  3. training data 차이를 완전히 통제하기 어렵다
    vendor별 pretraining corpus, filtering, post-training, refusal policy 차이가 residual로 남는다.

  4. retrieval augmentation confound가 있다
    API 뒤에서 retrieval을 쓰면 parametric knowledge가 아닌데도 높은 점수가 나올 수 있다. 논문은 T7 최고 점수가 약 28% 수준이라 현재는 강한 RAG 증거가 없다고 보지만, 원리적으로는 confound다.

  5. probe contamination 문제가 있다
    probe set이 공개되고 이후 training data에 들어가면 benchmark가 오염된다. 재현성과 비공개 probe 유지 사이의 tension이 있다.

  6. long-tail ground truth 자체가 어렵다
    Wikidata나 web source가 obscure tier에서 틀리거나 애매할 수 있다.

제 해석

이 논문의 가장 좋은 점은 “LLM 평가를 capability score 하나로 뭉개지 말자”는 메시지다.

요즘 모델 평가는 reasoning, coding, tool use, long context, instruction following, safety가 뒤섞여 있다. 그런데 AI Search를 만들 때 필요한 질문은 더 작고 구체적이다.

  • 이 모델은 검색 없이 어떤 long-tail 지식을 알고 있나?
  • 검색을 붙이면 얼마만큼 보강되나?
  • 모를 때 거절하는가, 틀리는가?
  • 같은 vendor/model family끼리 같이 틀리는가?
  • 작은 모델 + 좋은 retrieval이 큰 모델 closed-book을 대체할 수 있는가?

IKP는 이 질문들 중 첫 번째를 꽤 정면으로 다룬다. 그리고 그 결과는 search system 설계에 직접 연결된다.

저는 이 논문을 “닫힌 모델 파라미터 수 맞히기” 논문으로만 읽으면 조금 아깝다고 본다. 더 중요한 건 parametric memory를 측정 가능한 evaluation axis로 끌어낸 것이다.

AI Search stack에서는 retrieval quality와 model knowledge가 자주 섞인다. IKP류 평가는 이 둘을 분리해준다.

모델이 이미 알고 있던 것
검색기가 찾아준 것
reader가 evidence로부터 추론한 것

이 세 층을 분리해서 봐야 search product의 병목을 제대로 찾을 수 있다.

정리

Incompressible Knowledge Probes는 희귀 factual knowledge recall을 이용해 black-box LLM의 effective knowledge capacity를 추정한다. 93개 open-weight model에서 R² 0.910의 log-linear calibration을 얻었고, closed model에 대해서는 넓은 prediction band 형태의 추정치를 제공한다.

정확한 파라미터 수를 맞히는 도구는 아니다. 하지만 AI Search 관점에서는 훨씬 실용적인 질문을 던진다.

모델 내부 지식은 어디까지이고, 검색 시스템은 그 밖의 지식을 얼마나 잘 메우는가?

이 질문을 평가 체계에 넣는 순간, RAG 평가는 단순 end-to-end accuracy가 아니라 parametric knowledge, retrieval coverage, reader reasoning, refusal/hallucination behavior를 분리해 보는 문제가 된다. 저는 이게 이 논문의 가장 큰 실무적 가치라고 본다.

Comments