Concept07.242026-07-24 09:0033 min readAI 기본기 11: Post-training과 Alignment — RLHF와 DPO는 모델의 행동을 어떻게 바꾸는가Pretraining 이후의 LLM을 사용자가 원하는 방식으로 행동하게 만드는 post-training 흐름을 SFT, preference learning, RLHF, DPO 관점에서 정리한다.#AI기본기#post-training#alignment+3