Concept07.242026-07-24 09:0033 min readAI 기본기 11: Post-training과 Alignment — RLHF와 DPO는 모델의 행동을 어떻게 바꾸는가Pretraining 이후의 LLM을 사용자가 원하는 방식으로 행동하게 만드는 post-training 흐름을 SFT, preference learning, RLHF, DPO 관점에서 정리한다.#AI기본기#post-training#alignment+3
Concept07.182026-07-18 09:0021 min readAI 기본기 5: Next-Token Prediction과 Instruction Tuning — LLM은 무엇을 배우고 무엇을 맞춰 가는가Causal language modeling, next-token prediction, pretraining, instruction tuning, RLHF/RLAIF를 하나의 학습 파이프라인으로 연결해 LLM이 실제로 무엇을 최적화하는지 이해한다.#AI기본기#LLM#pretraining+2