[부담없는 강화학습 이론]: On-Policy, Off-Policy

1. 핵심 개념 정립

1.1 Policy의 본질적 이해

  • Policy π(a|s): 상태 s에서 행동 a를 선택할 확률분포임
  • 요리사가 재료(상태)를 보고 어떤 요리법(행동)을 쓸지 결정하는 확률적 판단 기준임
  • 수학적으로 π: S → P(A)의 매핑 함수임

1.2 On-Policy vs Off-Policy의 철학적 차이

On-Policy: "배우는 정책 = 행동하는 정책"

  • 현재 학습 중인 정책으로 직접 경험을 수집하고 그 경험으로만 학습함
  • 학생이 자신의 공부법으로만 공부하고 그 결과로만 공부법을 개선하는 방식임

Off-Policy: "배우는 정책 ≠ 행동하는 정책"

  • 다른 정책(behavior policy)으로 수집한 경험으로 목표 정책(target policy)을 학습함
  • 다른 학생들의 공부 경험을 관찰하며 자신만의 최적 공부법을 찾는 방식임

2. On-Policy 방법론 심화 분석

2.1 SARSA (State-Action-Reward-State-Action)

핵심 업데이트 공식:

Q(s,a) ← Q(s,a) + α[r + γQ(s',a') - Q(s,a)]

수식 해부:

  • Q(s,a): 현재 상태-행동 가치 추정치
  • α: 학습률 (새로운 정보를 얼마나 반영할지)
  • r: 즉시 보상
  • γ: 할인 인자 (미래 보상의 중요도)
  • Q(s',a'): 다음 상태에서 실제로 취할 행동의 가치

직관적 이해:

  • 예측 오차 [r + γQ(s',a') - Q(s,a)]를 계산함
  • 실제 경험한 보상과 기대했던 가치의 차이를 학습에 반영함
  • 보수적 운전자가 실제 경험한 길만으로 내비게이션을 업데이트하는 방식임

2.2 Policy Gradient 방법

기본 목적함수:

J(θ) = E_π[R_t] = Σ_s d^π(s) Σ_a π(a|s,θ) R^π(s,a)

정책 경사 정리 (Policy Gradient Theorem):

∇_θ J(θ) = E_π[∇_θ log π(a|s,θ) Q^π(s,a)]

수식 분해:

  • d^π(s): 정책 π 하에서의 상태 분포 (얼마나 자주 그 상태에 있는가)
  • ∇_θ log π(a|s,θ): 정책의 로그 확률에 대한 경사 (어떤 방향으로 정책을 바꿀지)
  • Q^π(s,a): 현재 정책 하에서의 행동 가치 (그 행동이 얼마나 좋은지)

직관적 해석:

  • 좋은 결과를 낸 행동의 확률은 높이고, 나쁜 결과를 낸 행동의 확률은 낮춤
  • 화가가 성공한 그림 기법은 더 자주 쓰고, 실패한 기법은 덜 쓰는 학습 과정임

2.3 REINFORCE 알고리즘

업데이트 공식:

θ ← θ + α ∇_θ log π(a_t|s_t,θ) G_t

여기서 G_t = Σ_{k=0}^{T-t-1} γ^k r_{t+k+1}

핵심 아이디어:

  • 에피소드가 끝난 후 전체 수익 G_t를 계산함
  • 좋은 에피소드에서 한 행동들의 확률을 증가시킴
  • 몬테카를로 방식으로 분산이 큼 (운의 영향이 큼)

3. Off-Policy 방법론 심화 분석

3.1 Q-Learning의 수학적 구조

벨만 최적 방정식:

Q*(s,a) = E[r + γ max_a' Q*(s',a') | s,a]

Q-Learning 업데이트:

Q(s,a) ← Q(s,a) + α[r + γ max_a' Q(s',a') - Q(s,a)]

On-Policy와의 핵심 차이:

  • SARSA: Q(s',a') (실제로 할 행동)
  • Q-Learning: max_a' Q(s',a') (최적 행동)

직관적 비유:

  • SARSA: 실제 운전 경험으로만 길을 배움
  • Q-Learning: 모든 가능한 길을 비교해서 최고의 길을 찾음

3.2 Importance Sampling의 수학적 기초

문제 정의:
목표 정책 π로 기댓값을 구하고 싶지만 행동 정책 b로 데이터를 수집함

Importance Sampling 공식:

E_π[f(X)] = E_b[f(X) * π(X)/b(X)]

강화학습 적용:

E_π[G_t] = E_b[G_t * Π_{k=t}^{T-1} π(a_k|s_k)/b(a_k|s_k)]

직관적 해석:

  • 다른 사람의 경험을 내 상황에 맞게 가중치를 조정해서 활용함
  • 음식 리뷰를 볼 때 나와 취향이 비슷한 사람의 리뷰에 더 가중치를 두는 방식임

3.3 Off-Policy Actor-Critic

이중 네트워크 구조:

  • Actor: π_θ(a|s) (정책 네트워크)
  • Critic: V_φ(s) 또는 Q_φ(s,a) (가치 네트워크)

업데이트 공식:

θ ← θ + α_θ ∇_θ log π_θ(a|s) [Q_φ(s,a) - V_φ(s)]
φ ← φ + α_φ ∇_φ [Q_φ(s,a) - V_φ(s)]²

핵심 아이디어:

  • Actor는 정책을 개선하고 Critic은 가치를 평가함
  • 감독(Critic)이 배우(Actor)의 연기를 평가하며 함께 발전하는 구조임

4. 수렴성과 안정성 분석

4.1 On-Policy의 수렴 조건

Robbins-Monro 조건:

Σ_t α_t = ∞, Σ_t α_t² < ∞

의미:

  • 학습률이 충분히 크게 누적되어야 함 (탐험 충분)
  • 학습률 제곱의 합은 유한해야 함 (수렴 보장)
  • 대표적 예: α_t = 1/t

4.2 Off-Policy의 수렴 조건

Deadly Triad 문제:

  1. Function Approximation (함수 근사)
  2. Bootstrapping (부트스트래핑)
  3. Off-Policy Learning

수렴 어려움의 원인:

  • 분포 변화로 인한 불안정성
  • Importance Sampling의 높은 분산
  • Target Network 없이는 발산 가능성 높음

5. 실제 적용 시 고려사항

5.1 탐험-활용 딜레마

ε-greedy 정책:

π(a|s) = {
  1-ε+ε/|A|  if a = argmax Q(s,a)
  ε/|A|      otherwise
}

UCB (Upper Confidence Bound):

a_t = argmax_a [Q_t(a) + c√(ln t / N_t(a))]

5.2 Experience Replay의 수학적 근거

배치 업데이트:

L(θ) = E_{(s,a,r,s')~D}[(r + γ max_a' Q(s',a';θ^-) - Q(s,a;θ))²]

장점:

  • 데이터 효율성 증대
  • 상관관계 제거로 안정성 향상
  • Off-Policy 학습 가능

6. 결론 및 선택 가이드

6.1 On-Policy 선택 기준

  • 안정적 수렴이 중요한 경우
  • 연속적 제어 문제
  • 정책 자체가 중요한 경우

6.2 Off-Policy 선택 기준

  • 데이터 효율성이 중요한 경우
  • 과거 경험 재활용이 필요한 경우
  • 탐험 데이터가 제한적인 경우

핵심 메시지:
On-Policy는 안전한 보수적 학습, Off-Policy는 효율적이지만 불안정할 수 있는 학습임. 문제 특성에 따라 적절한 방법론을 선택하는 것이 핵심임.