1. 핵심 개념 정립
1.1 Policy의 본질적 이해
- Policy π(a|s): 상태 s에서 행동 a를 선택할 확률분포임
- 요리사가 재료(상태)를 보고 어떤 요리법(행동)을 쓸지 결정하는 확률적 판단 기준임
- 수학적으로 π: S → P(A)의 매핑 함수임
1.2 On-Policy vs Off-Policy의 철학적 차이
On-Policy: "배우는 정책 = 행동하는 정책"
- 현재 학습 중인 정책으로 직접 경험을 수집하고 그 경험으로만 학습함
- 학생이 자신의 공부법으로만 공부하고 그 결과로만 공부법을 개선하는 방식임
Off-Policy: "배우는 정책 ≠ 행동하는 정책"
- 다른 정책(behavior policy)으로 수집한 경험으로 목표 정책(target policy)을 학습함
- 다른 학생들의 공부 경험을 관찰하며 자신만의 최적 공부법을 찾는 방식임
2. On-Policy 방법론 심화 분석
2.1 SARSA (State-Action-Reward-State-Action)
핵심 업데이트 공식:
Q(s,a) ← Q(s,a) + α[r + γQ(s',a') - Q(s,a)]수식 해부:
Q(s,a): 현재 상태-행동 가치 추정치α: 학습률 (새로운 정보를 얼마나 반영할지)r: 즉시 보상γ: 할인 인자 (미래 보상의 중요도)Q(s',a'): 다음 상태에서 실제로 취할 행동의 가치
직관적 이해:
- 예측 오차
[r + γQ(s',a') - Q(s,a)]를 계산함 - 실제 경험한 보상과 기대했던 가치의 차이를 학습에 반영함
- 보수적 운전자가 실제 경험한 길만으로 내비게이션을 업데이트하는 방식임
2.2 Policy Gradient 방법
기본 목적함수:
J(θ) = E_π[R_t] = Σ_s d^π(s) Σ_a π(a|s,θ) R^π(s,a)정책 경사 정리 (Policy Gradient Theorem):
∇_θ J(θ) = E_π[∇_θ log π(a|s,θ) Q^π(s,a)]수식 분해:
d^π(s): 정책 π 하에서의 상태 분포 (얼마나 자주 그 상태에 있는가)∇_θ log π(a|s,θ): 정책의 로그 확률에 대한 경사 (어떤 방향으로 정책을 바꿀지)Q^π(s,a): 현재 정책 하에서의 행동 가치 (그 행동이 얼마나 좋은지)
직관적 해석:
- 좋은 결과를 낸 행동의 확률은 높이고, 나쁜 결과를 낸 행동의 확률은 낮춤
- 화가가 성공한 그림 기법은 더 자주 쓰고, 실패한 기법은 덜 쓰는 학습 과정임
2.3 REINFORCE 알고리즘
업데이트 공식:
θ ← θ + α ∇_θ log π(a_t|s_t,θ) G_t여기서 G_t = Σ_{k=0}^{T-t-1} γ^k r_{t+k+1}
핵심 아이디어:
- 에피소드가 끝난 후 전체 수익
G_t를 계산함 - 좋은 에피소드에서 한 행동들의 확률을 증가시킴
- 몬테카를로 방식으로 분산이 큼 (운의 영향이 큼)
3. Off-Policy 방법론 심화 분석
3.1 Q-Learning의 수학적 구조
벨만 최적 방정식:
Q*(s,a) = E[r + γ max_a' Q*(s',a') | s,a]Q-Learning 업데이트:
Q(s,a) ← Q(s,a) + α[r + γ max_a' Q(s',a') - Q(s,a)]On-Policy와의 핵심 차이:
- SARSA:
Q(s',a')(실제로 할 행동) - Q-Learning:
max_a' Q(s',a')(최적 행동)
직관적 비유:
- SARSA: 실제 운전 경험으로만 길을 배움
- Q-Learning: 모든 가능한 길을 비교해서 최고의 길을 찾음
3.2 Importance Sampling의 수학적 기초
문제 정의:
목표 정책 π로 기댓값을 구하고 싶지만 행동 정책 b로 데이터를 수집함
Importance Sampling 공식:
E_π[f(X)] = E_b[f(X) * π(X)/b(X)]강화학습 적용:
E_π[G_t] = E_b[G_t * Π_{k=t}^{T-1} π(a_k|s_k)/b(a_k|s_k)]직관적 해석:
- 다른 사람의 경험을 내 상황에 맞게 가중치를 조정해서 활용함
- 음식 리뷰를 볼 때 나와 취향이 비슷한 사람의 리뷰에 더 가중치를 두는 방식임
3.3 Off-Policy Actor-Critic
이중 네트워크 구조:
- Actor: π_θ(a|s) (정책 네트워크)
- Critic: V_φ(s) 또는 Q_φ(s,a) (가치 네트워크)
업데이트 공식:
θ ← θ + α_θ ∇_θ log π_θ(a|s) [Q_φ(s,a) - V_φ(s)]
φ ← φ + α_φ ∇_φ [Q_φ(s,a) - V_φ(s)]²핵심 아이디어:
- Actor는 정책을 개선하고 Critic은 가치를 평가함
- 감독(Critic)이 배우(Actor)의 연기를 평가하며 함께 발전하는 구조임
4. 수렴성과 안정성 분석
4.1 On-Policy의 수렴 조건
Robbins-Monro 조건:
Σ_t α_t = ∞, Σ_t α_t² < ∞의미:
- 학습률이 충분히 크게 누적되어야 함 (탐험 충분)
- 학습률 제곱의 합은 유한해야 함 (수렴 보장)
- 대표적 예: α_t = 1/t
4.2 Off-Policy의 수렴 조건
Deadly Triad 문제:
- Function Approximation (함수 근사)
- Bootstrapping (부트스트래핑)
- Off-Policy Learning
수렴 어려움의 원인:
- 분포 변화로 인한 불안정성
- Importance Sampling의 높은 분산
- Target Network 없이는 발산 가능성 높음
5. 실제 적용 시 고려사항
5.1 탐험-활용 딜레마
ε-greedy 정책:
π(a|s) = {
1-ε+ε/|A| if a = argmax Q(s,a)
ε/|A| otherwise
}UCB (Upper Confidence Bound):
a_t = argmax_a [Q_t(a) + c√(ln t / N_t(a))]5.2 Experience Replay의 수학적 근거
배치 업데이트:
L(θ) = E_{(s,a,r,s')~D}[(r + γ max_a' Q(s',a';θ^-) - Q(s,a;θ))²]장점:
- 데이터 효율성 증대
- 상관관계 제거로 안정성 향상
- Off-Policy 학습 가능
6. 결론 및 선택 가이드
6.1 On-Policy 선택 기준
- 안정적 수렴이 중요한 경우
- 연속적 제어 문제
- 정책 자체가 중요한 경우
6.2 Off-Policy 선택 기준
- 데이터 효율성이 중요한 경우
- 과거 경험 재활용이 필요한 경우
- 탐험 데이터가 제한적인 경우
핵심 메시지:
On-Policy는 안전한 보수적 학습, Off-Policy는 효율적이지만 불안정할 수 있는 학습임. 문제 특성에 따라 적절한 방법론을 선택하는 것이 핵심임.