Published on2026년 3월 17일강화학습 완전 정복: DQN, PPO부터 RLHF, DPO까지 LLM 정렬까지reinforcement-learningppodqnrlhfdpollm-alignment2026-03MDP 기초부터 DQN, PPO, SAC, RLHF, DPO까지. LLM 정렬에 사용되는 강화학습 기법을 PyTorch Stable-Baselines3 코드와 함께 완전 정복합니다.
Published on2026년 3월 9일DPO(Direct Preference Optimization) 논문 심층 분석 — RLHF 없이 LLM 정렬하기ai-papersdporlhfllm-alignmentpreference-optimization2026-03DPO의 수학적 원리부터 구현, RLHF와의 비교, IPO/KTO/ORPO 변형까지 — LLM 선호도 최적화의 핵심을 실무 관점에서 심층 분석합니다.