Jev는 정말 그냥 분류기일까? — 일반화가 바꾸는 자동화 모델의 의미
Sebastian Raschka의 Jev 코멘트와 Hugging Face Decision Index를 바탕으로, Jev를 단순 classifier로 치부하면 놓치게 되는 일반화, 데이터, calibration, 자동화 아키텍처의 의미를 정리한다.
최근 TypeSafe AI가 공개한 Jev는 꽤 흥미로운 논쟁을 만들고 있다. 한쪽에서는 Jev를 새로운 종류의 모델, 즉 System One Model이라고 소개한다. 반면 다른 쪽에서는 이렇게 말한다.
결국 그냥 classifier 아닌가?
이 반응은 어느 정도 타당하다. Jev는 ChatGPT처럼 긴 문장을 생성하는 모델이 아니다. 사용자가 정의한 선택지나 구조화된 출력 공간 안에서, 입력 상태를 보고 가장 적절한 판단을 내린다. 이메일을 분류하거나, 고객 요청을 라우팅하거나, 어떤 액션을 실행할지 고르는 식이다.
겉으로 보면 전통적인 머신러닝의 분류 모델과 크게 다르지 않아 보인다. 하지만 Sebastian Raschka는 최근 글에서 이 지점을 조금 다르게 본다. 그의 핵심 메시지는 간단하다.
Jev를 "그냥 분류기"라고 부르는 것은 쉽지만, 중요한 것은 그 분류기가 얼마나 잘 일반화되느냐다.
이 글은 Jev의 API 구조를 분석한 이전 글의 후속편에 가깝다. 이번에는 구현 추정보다, 왜 단순해 보이는 classifier 인터페이스가 자동화 아키텍처에서 중요해질 수 있는지에 초점을 맞춘다.
Jev는 무엇을 하는 모델인가?
일반적인 LLM은 입력을 받고, 다음 토큰을 하나씩 예측하면서 텍스트를 생성한다.
입력: 이 고객 문의에 답변해줘
출력: 안녕하세요, 고객님. 문의 주신 내용에 대해...반면 Jev는 자유로운 텍스트 생성을 목표로 하지 않는다. 대신 미리 정의된 출력 구조 안에서 판단한다.
입력: 고객 이메일, 결제 내역, 이전 문의 이력
출력:
- 환불 승인: 0.72
- 추가 확인 필요: 0.21
- 환불 거절: 0.07즉 Jev는 문장을 "써주는" 모델이라기보다, 소프트웨어 안에서 사용할 수 있는 고속 의사결정 함수에 가깝다.
TypeSafe AI는 이를 다음과 같은 방향으로 설명한다.
unstructured state in, typed probabilistic decisions out
조금 풀어 쓰면 이렇다.
비정형 상태를 입력으로 받아, 타입이 정해진 확률적 결정을 출력하는 모델
여기서 중요한 단어는 세 가지다.
- typed: 출력 형식이 미리 정해져 있다.
- probabilistic: 단순히 답 하나만 주는 것이 아니라, 각 선택지의 확률과 confidence를 준다.
- decisions: 목적이 텍스트 생성이 아니라 판단이다.
이 세 가지를 합치면 Jev의 포지션이 보인다. Jev는 사람에게 보여줄 문장을 만드는 모델이 아니라, 코드가 바로 사용할 수 있는 판단값을 만드는 모델이다.
"그냥 classifier 아닌가?"라는 비판
Jev를 본 많은 사람들은 자연스럽게 이런 생각을 할 수 있다.
이거 BERT classifier랑 뭐가 다르지?
실제로 Raschka도 Jev의 내부 구조가 공개되지는 않았지만, 아마 다음과 비슷할 것이라고 추정한다.
- ModernBERT 같은 encoder-style 모델
- 불확실성과 confidence calibration을 학습하는 강화학습 방식
- 예를 들면
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty류의 접근
이 추정이 맞다면 Jev는 완전히 새로운 모델 아키텍처라기보다, 기존 encoder 기반 분류 모델과 calibration 학습 기법을 잘 조합한 시스템일 가능성이 높다.
그리고 이 지점에서 "그냥 classifier"라는 비판이 나온다.
기존에도 우리는 오랫동안 classifier를 써왔다.
- 스팸 메일 분류
- 감성 분석
- 문서 카테고리 분류
- 사기 거래 탐지
- 이탈 가능성 예측
- 추천 시스템의 ranking/scoring
그렇다면 Jev는 정말 새로울까?
핵심은 일반화다
Raschka의 답은 꽤 현실적이다.
classifier라는 형식 자체는 새롭지 않다. 하지만 Jev가 정말 흥미로운 이유는 다양한 문제에 잘 일반화되는 것처럼 보이기 때문이다.
기존 classifier는 보통 특정 업무에 묶여 있었다.
예를 들어 스팸 메일 분류기는 스팸을 잘 잡는다. 하지만 그 모델을 갑자기 게임 플레이, 주식 거래 판단, workflow 라우팅, LLM output 검증에 쓰기는 어렵다.
대부분의 classifier는 다음과 같은 특징을 가졌다.
- 특정 도메인 전용
- 특정 라벨셋 전용
- 특정 데이터 분포 전용
- 새로운 문제에 적용하려면 재학습 또는 파인튜닝 필요
그런데 Jev가 주장하는 방향은 다르다. 하나의 모델/API가 다양한 decision task에 적용될 수 있다는 것이다.
예를 들면 다음과 같다.
- 고객 이메일 분류
- workflow 단계 선택
- 위험도 판단
- 게임 상태에 따른 다음 행동 결정
- 주식 거래 시그널 판단
- LLM 응답 검증
- guardrail / moderation
- 대량 문서의 feature extraction
이게 사실이라면 Jev의 차별점은 "분류한다"가 아니다. 더 정확히는 분류 문제처럼 표현할 수 있는 많은 일을 하나의 범용 decision model로 처리한다는 데 있다.
생성형 AI와 다른 방향의 자동화
지금까지 AI 자동화는 주로 LLM 중심으로 발전해왔다. LLM은 강력하다. 글을 쓰고, 코드를 만들고, 요약하고, 추론하고, 사람과 대화할 수 있다.
하지만 LLM을 실제 소프트웨어 자동화에 넣으려 하면 몇 가지 문제가 생긴다.
1. 출력이 자유롭다
자유로운 출력은 사람에게는 좋지만, 소프트웨어에는 부담이다.
LLM이 JSON을 출력하라고 해도 가끔 형식을 깨거나, 불필요한 문장을 붙이거나, 애매한 값을 만들 수 있다. 요즘은 structured output 기능이 좋아졌지만, 근본적으로 LLM은 텍스트 생성 모델이다.
2. 느리다
LLM은 토큰을 순차적으로 생성한다. 긴 reasoning이나 긴 응답이 필요한 경우 latency가 커진다.
사람과 대화하는 인터페이스에서는 몇 초가 허용될 수 있다. 하지만 애플리케이션 내부에서 수천, 수만 번 호출해야 하는 판단 로직이라면 이야기가 달라진다.
3. 비싸다
복잡한 workflow에서 LLM을 여러 번 호출하면 비용이 빠르게 증가한다. 특히 출력 토큰이 많아질수록 비용도 커진다.
4. confidence를 믿기 어렵다
LLM에게 "얼마나 확신해?"라고 물어보면 답은 할 수 있다. 하지만 그 confidence가 실제 정확도와 잘 맞는지는 별개의 문제다.
자동화에서는 이게 매우 중요하다. 어떤 모델이 95% 정확하더라도, 자신이 틀릴 5%의 경우를 스스로 잘 모른다면 안정적인 자동화에 쓰기 어렵다.
Jev가 노리는 지점
Jev는 LLM의 유연성을 포기하는 대신, 자동화에 필요한 특성을 강화하려는 모델이다.
- 자유 텍스트 생성 대신 구조화된 출력
- 긴 응답 대신 빠른 판단
- 문자열 parsing 대신 type-safe output
- 단일 답변 대신 확률과 confidence
- 범용 대화 대신 workflow 내부 decision
이 관점에서 Jev는 ChatGPT의 대체재라기보다, LLM 기반 agent나 workflow 옆에 붙는 판단 엔진에 가깝다.
예를 들어 agent 시스템을 만든다고 해보자.
LLM은 다음과 같은 일을 잘한다.
- 사용자의 요청 이해
- 계획 세우기
- 도구 사용 전략 만들기
- 긴 문서 요약
- 코드 작성
- 설명 생성
반면 Jev 같은 모델은 다음과 같은 곳에 어울린다.
- 이 요청을 어떤 agent에게 보낼지
- 이 작업을 자동 승인할지 사람에게 넘길지
- 이 결과물이 위험한지 아닌지
- 이 고객이 이탈 가능성이 높은지
- 이 workflow의 다음 분기가 무엇인지
- 이 LLM 응답을 통과시킬지 차단할지
즉, LLM이 "생각하고 말하는 모델"이라면, Jev는 "빠르게 판단하고 분기시키는 모델"에 가깝다.
핵심은 알고리즘보다 데이터일 수 있다
Raschka가 특히 흥미롭게 보는 부분은 이 지점이다. 그는 Jev의 진짜 secret sauce가 모델 구조나 학습 알고리즘보다 데이터에 있을 가능성이 높다고 본다.
이 관점은 꽤 설득력 있다.
AI 역사에서 큰 도약은 종종 "완전히 새로운 알고리즘"보다, 기존 연구를 좋은 데이터, 좋은 스케일, 좋은 제품 인터페이스와 결합했을 때 발생했다.
Raschka는 예시로 Stable Diffusion과 ChatGPT를 언급한다.
Stable Diffusion도 diffusion 모델 연구 흐름 위에 있었다. ChatGPT도 InstructGPT와 RLHF 연구의 연장선에 있었다.
하지만 둘 다 단순히 "기존 논문의 구현체"로 끝나지 않았다. 데이터, 학습 레시피, 제품화, 접근성, UX가 맞물리면서 큰 전환점이 됐다.
Jev도 비슷할 수 있다.
기술적으로는 encoder classifier + calibration RL처럼 보일 수 있다. 하지만 다양한 decision task를 포괄하는 데이터셋과 API 설계가 잘 되어 있다면, 실제 제품적 의미는 훨씬 커질 수 있다.
Decision Index가 보여주는 것
이 논의를 더 흥미롭게 만드는 자료가 하나 더 있다. Hugging Face Space에 공개된 Jev Decision Index는 TypeSafe Jev의 "Decision Model"을 재현하려는 공개 모델들을 같은 벤치마크 묶음에서 비교한다.
2026년 9월 27일 기준 Decision Index 0.2.1은 다음 조건을 내세운다.
- TypeSafe의 Jev
jev-1.13.0을 reference로 둔다. - 공개 재현 모델 67개를 비교한다.
- 43개 benchmark에 걸쳐 모델당 약 12만 개 decision request를 던진다.
- open reproduction은 1개의 NVIDIA RTX PRO 6000에서 실행한다.
- 점수는 chance-corrected 방식으로 계산해, 0은 무작위 추측, 100은 완전 정답에 가깝게 해석한다.
상위권 결과도 흥미롭다. Decision Index 표에서는 Jev가 57.9점으로 reference 위치에 있고, Surogate Rune 26B-A4B v3가 57.4점, Decider chat · Gemma-4-31B가 57.3점, AutoJev-27B가 56.4점으로 거의 근접한 점수를 보인다. 즉 Jev의 아이디어가 단일 비공개 API에만 머무르지 않고, 여러 팀이 공개 모델로 재현하려고 경쟁하는 영역이 됐다는 뜻이다.
다만 이 지표를 볼 때는 주의할 점이 있다. Decision Index는 "Jev를 실제 업무에서 완전히 대체할 수 있다"는 증명이라기보다, typed decision model이라는 문제 설정이 하나의 벤치마크 생태계로 분화되고 있다는 신호에 가깝다.
특히 중요한 점은 이 벤치마크가 단순 정확도 하나만 보는 것이 아니라는 점이다. 문서에는 각 benchmark의 primary metric을 유지하고, answer하지 못한 request는 틀린 것으로 처리하며, cherry-picking보다 breadth와 honesty를 보상한다고 설명한다. 이 방향은 Jev류 모델을 평가할 때 꽤 중요하다. 자동화용 decision model은 잘 맞힌 샘플만 보여주는 데모보다, 어디까지 답할 수 있고 어디서 실패하는지를 드러내야 하기 때문이다.
Decision Index는 Raschka의 주장을 보강하는 자료로 읽을 수 있다. Jev가 "그냥 classifier"라면, 질문은 단순히 "분류 정확도가 몇 퍼센트인가"에서 끝난다. 하지만 여러 공개 재현 모델이 같은 decision interface, 같은 benchmark suite, 같은 calibration/coverage 문제를 놓고 경쟁하기 시작했다면 이야기가 달라진다. 이제 논점은 classifier냐 아니냐가 아니라, 어떤 모델과 학습 레시피가 범용 decision layer를 가장 잘 만들 수 있느냐가 된다.
왜 calibration이 중요한가?
Jev 논의에서 중요한 키워드 중 하나는 calibration이다.
모델이 어떤 답을 90% 확신한다고 말했을 때, 실제로도 비슷한 상황에서 90% 정도 맞아야 잘 calibrated된 모델이라고 할 수 있다.
이게 중요한 이유는 자동화에서 confidence가 곧 정책 결정에 쓰이기 때문이다.
예를 들어 다음처럼 운영 정책을 만들 수 있다.
환불 승인 확률 0.97 → 자동 승인
환불 승인 확률 0.62 → 상담원 검토
환불 승인 확률 0.12 → 자동 거절 후보이런 시스템에서는 모델의 확률이 단순한 장식이 아니다. workflow를 움직이는 핵심 신호다.
LLM이 그럴듯한 confidence를 말하는 것과, 모델의 확률이 실제 정확도와 잘 맞는 것은 완전히 다르다.
Jev가 정말 강력하려면 단순히 정답을 잘 맞히는 것뿐만 아니라, 언제 확신하고 언제 불확실한지를 잘 알아야 한다. 자동화에서는 이 능력이 매우 중요하다.
System One Model이라는 표현
TypeSafe AI는 Jev를 System One Model이라고 부른다. 이 표현은 심리학에서 말하는 System 1 / System 2 구분을 떠올리게 한다.
- System 1: 빠르고 직관적인 판단
- System 2: 느리고 깊은 추론
LLM, 특히 reasoning model은 점점 System 2에 가까운 방향으로 발전하고 있다. 천천히 생각하고, 여러 단계를 거쳐 추론하고, 복잡한 문제를 푼다.
반면 Jev는 System 1에 가깝다.
- 빠르게 판단
- 낮은 latency
- 구조화된 출력
- 반복 호출에 적합
- 소프트웨어 내부 decision에 적합
이 구분은 앞으로 AI 시스템 설계에서 중요해질 수 있다.
모든 문제에 거대한 reasoning LLM을 호출하는 것은 비효율적이다. 반대로 모든 문제를 작은 classifier로 처리하는 것도 불가능하다.
앞으로는 이런 구조가 자연스러워질 가능성이 크다.
복잡한 계획 / 생성 / 설명 → LLM 또는 reasoning model
빠른 분류 / 라우팅 / 검증 / scoring → System One Model즉, Jev는 LLM을 대체한다기보다 AI 시스템 안에서 다른 역할을 맡는 모델군의 가능성을 보여준다.
Jev가 정말 성공하려면 필요한 조건
물론 아직 조심해서 봐야 할 부분도 많다.
TypeSafe AI의 주장처럼 Jev가 빠르고, 저렴하고, 정확하고, 일반화가 잘 된다면 매우 흥미로운 기술이다. 하지만 몇 가지는 더 검증되어야 한다.
1. 실제 다양한 도메인에서 잘 동작하는가?
데모는 인상적일 수 있다. 하지만 실제 업무 환경은 훨씬 지저분하다.
- 데이터 품질이 낮고
- 예외 상황이 많고
- 도메인마다 기준이 다르고
- 라벨 정의가 애매하며
- 시간이 지나며 분포가 바뀐다
이런 환경에서도 잘 작동하는지 확인해야 한다.
2. calibration이 정말 믿을 만한가?
확률을 출력하는 것과 그 확률이 믿을 만한 것은 다르다. 실제 운영 환경에서 confidence가 정확도와 얼마나 잘 맞는지가 중요하다.
3. 복잡한 의사결정을 어떻게 표현할 것인가?
모든 문제를 선택지 고르기로 단순화할 수는 없다. 실제 workflow에서는 여러 판단이 연결되고, 중간 상태가 바뀌고, 사람의 승인이나 외부 시스템의 결과가 개입한다.
Jev 같은 모델이 강해지려면, 단일 분류뿐 아니라 복합 workflow 안에서 어떻게 조합되는지가 중요하다.
4. 기존 LLM structured output과 얼마나 차별화되는가?
요즘 LLM도 structured output, function calling, JSON schema 등을 지원한다. 따라서 Jev의 차별점은 단순히 "구조화된 출력"이 아니라 다음 요소에서 나와야 한다.
- 압도적인 속도
- 낮은 비용
- 높은 consistency
- 좋은 calibration
- 실제 decision task에서의 정확도
- 개발자가 쓰기 쉬운 API
그래서 Jev는 그냥 classifier인가?
기술적으로 보면 어느 정도는 맞다.
Jev는 자유 텍스트를 생성하는 LLM이 아니라, 정해진 출력 공간에서 판단하는 모델이다. 그리고 그 구조는 우리가 오래전부터 알고 있던 classification 모델과 닮아 있다.
하지만 "그냥 classifier"라고만 말하면 중요한 부분을 놓친다.
진짜 질문은 이것이다.
이 classifier가 얼마나 범용적으로 작동하는가?
얼마나 잘 calibrated되어 있는가?
얼마나 빠르고 저렴하게 소프트웨어 안에서 반복 호출될 수 있는가?
실제 자동화 workflow를 얼마나 안정적으로 바꿀 수 있는가?
만약 Jev가 이 질문들에 좋은 답을 낸다면, 그건 단순한 classifier가 아니라 자동화를 위한 새로운 모델 인터페이스라고 볼 수 있다.
마무리
생성형 AI의 지난 몇 년은 "무엇이든 말로 생성하는 모델"의 시대였다. ChatGPT 이후 우리는 자연스럽게 AI를 대화, 글쓰기, 코딩, reasoning의 관점에서 바라보게 됐다.
하지만 실제 자동화에서 필요한 것은 항상 긴 문장 생성이 아니다.
많은 경우 필요한 것은 더 단순하다.
- 이 요청을 어디로 보낼까?
- 이 결과를 승인할까?
- 이 사용자는 위험한가?
- 이 문서는 어떤 카테고리인가?
- 이 agent output은 믿을 만한가?
- 다음 workflow 단계는 무엇인가?
이런 문제에는 빠르고, 싸고, 일관적이고, 확률을 잘 표현하는 판단 모델이 더 적합할 수 있다.
Jev가 흥미로운 이유는 바로 여기에 있다.
Jev는 우리에게 묻고 있다.
모든 AI 자동화가 꼭 텍스트 생성 모델 위에 있어야 할까?
아마 앞으로의 AI 시스템은 하나의 거대한 LLM만으로 구성되지 않을 것이다. 대신 여러 종류의 모델이 역할을 나눠 갖게 될 가능성이 크다.
- reasoning model은 복잡한 사고를 담당하고
- LLM은 생성과 인터페이스를 담당하고
- Jev 같은 System One Model은 빠른 판단과 분기를 담당하는 식이다
그런 의미에서 Jev는 단순한 classifier 논쟁을 넘어, AI 자동화 아키텍처가 앞으로 어떻게 바뀔 수 있는지 보여주는 흥미로운 신호라고 볼 수 있다.
참고
- Sebastian Raschka, It's Easy to Dismiss Jev as Just a Classifier
- TypeSafe AI, Introducing System One Models & Jev
- multimodalart, Jev Decision Index
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty