AI 에이전트 구축Building AI Agents
Chapter 08 · Reinforcement Learning

강화학습과 AI 에이전트

블록을 쌓는 법을 가르치는 교사는 없다. 아이는 행동하고, 결과를 보고, 조정한다. 강화학습은 기계에게 같은 방식을 준다.

강화학습 탐험 vs 활용 MDP · 벨만 방정식 DQN · PPO · AlphaZero

Section 01시행착오의 학습

RAG와 지식 그래프는 모델에게 외부 메모리를 주었다. 하지만 LLM은 여전히 실제 세계에 대한 이해가 제한적이다 — 상식 추론, 공간 관계에서 특히. 인간은 탐색하며 배운다.

블록을 쌓거나 자전거 타는 법을 배우는 아이를 생각하라. 각 움직임을 가르치는 교사는 없다. 아이는 행동하고, 결과를 관찰하고, 조정하며 배운다. 강화학습(RL)은 시스템이 누적 보상을 최대화하려고 결정을 내려야 하는 기계학습의 한 분야다. 지도학습(라벨)과 달리, RL에서 모델은 경험에서 배운다.

Concept RL 시스템의 요소

에이전트 — 학습자·의사결정자. 환경 — 에이전트가 상호작용하는 모든 것. 상태(S) — 특정 시간 환경의 구성. 행동(A) — 에이전트가 할 수 있는 결정.

정책(π) — 상태를 행동으로 매핑하는 규칙. RL의 핵심이다. 보상(R) — 환경이 주는 긍정/부정 신호. 가치 함수 — 장기적으로 그 상태가 얼마나 좋은지.

직관 — 탐험 대 활용 새 도시에서 식당을 고른다고 하자. 처음엔 여러 곳을 시도한다(탐험). 좋아하는 곳을 찾으면 거기 자주 간다(활용). 하지만 늘 익숙한 곳만 가면 더 나은 식당을 영영 못 찾는다. 언제 새것을 시도하고 언제 머무를지 — 이것이 RL의 영원한 미해결 질문이다.

다중 팔 강도 문제

k-팔 강도(k-armed bandit)는 RL의 가장 고전적 예제다. n개의 레버를 가진 슬롯머신, 각 레버는 고유한 성공 확률을 가진다. 목표는 어떤 레버가 최고 보상을 주는지 알아내 보상 총합을 최대화하는 것이다. 행동의 진짜 가치 q*(a)를 모르므로 추정치 Q를 계산한다.

증분 가치 추정 (Incremental Update)
Qn+1 = Qn + α [ Rn − Qn ]
Qn 현재 가치 추정 · Rn 받은 보상 · α 단계 크기 · [Rn − Qn] 오류 — 추정을 실제 목표로 끌어당긴다.
Motion · ε-탐욕 — 탐험과 활용의 균형 STEP 01 / 5
space 재생 · → 다음 · R 리셋

ε-탐욕(ε-greedy) 방법은 거의 항상 추정 가치가 가장 높은 행동(탐욕적 행동)을 고르되, 확률 ε로 무작위 행동을 시도한다. 순수 탐욕 방법은 차선책이다 — 탐험을 허용하는 방법이 80%의 시간에 최적 선택을 하는 반면, 순수 탐욕은 1/3에 그친다. UCB(상한 신뢰도)는 무작위 대신 최적성 가능성과 불확실성에 따라 비탐욕 행동을 고른다.

Section 02마르코프 결정 과정

다중 팔 강도는 즉각적 보상만 본다. 하지만 체스에서 목표는 말을 먹는 게 아니라 게임을 이기는 것이다. 마르코프 결정 과정(MDP)은 행동이 즉각적 보상뿐 아니라 미래 결과에도 영향을 미치는 문제다.

미로를 탐색한다고 하자. 각 교차점이 상태, 각 회전이 행동이다. 어떤 경로는 출구에 가까워지지만, 어떤 경로는 원을 그리거나 막다른 곳으로 간다. 보상은 즉각적이지 않다 — 끝에 도달해야 받는다.

MDP의 핵심은 마르코프 속성이다 — 각 상태는 미래를 예측하는 데 필요한 모든 정보를 담는다. 에이전트 목표는 즉각적 이득이 아니라 장기 누적 보상을 최대화하는 것이다.

누적 보상 (할인 적용)
Gt = Rt+1 + γRt+2 + γ²Rt+3 + … = Σk γk Rt+k+1
Gt 시간 t 이후 누적 보상(반환) · γ 할인율 — 0에 가까우면 즉각 보상 중시, 1에 가까우면 미래 보상 중시.

벨만 방정식

가치 함수를 효율적으로 계산하기 위해 재귀 형식으로 다시 쓴 것이 벨만 방정식(Bellman equation)이다. 현재 상태의 가치를 다음 상태의 가치로 표현한다 — 정책에 따라 행동을 고르고, 확률로 보상을 받으며, 그 확률들을 가중 평균한다. 수많은 훌륭한 RL 알고리즘의 기초다.

Bellman Equation — 상태 가치 함수
vπ(s) = Σa π(a|s) Σs',r p(s',r|s,a) [ r + γ·vπ(s') ]
π(a|s) 정책 — 상태 s에서 행동 a를 고를 확률 · p(s',r|s,a) 상태 전이 확률 · r + γ·vπ(s') 즉각 보상 + 할인된 다음 상태 가치.
함정 — 보상을 잘못 정의하면 에이전트는 어떻게든 보상을 최대화한다. 목표가 잘못 정의되면 의도하지 않은 결과가 나온다. 체스에서 보상이 "게임 승리"가 아니라 "말 먹기"라면, 에이전트는 게임에서 지더라도 먹은 말 수를 최대화한다.

Section 03심층 강화학습

고전 RL은 정책·가치 함수를 단순 함수로 표현한다 — 저차원 공간에는 잘 맞지만 복잡한 환경에서는 일반화에 실패한다. 심층 강화학습(Deep RL)은 정책과 가치 함수를 신경망으로 표현한다. 신경망은 범용 근사 정리에 따라 어떤 복잡한 함수도 표현할 수 있다.

심층 RL 알고리즘 분류
알고리즘유형핵심
DQN가치 기반 · 오프-정책Q-함수를 신경망으로, 경험 재생 + 목표 네트워크
REINFORCE정책 기반 · 온-정책정책을 직접 학습, 궤적 보상으로 가중치 갱신
PPO정책 기반 · 온-정책클리핑된 목적 함수로 안정적 업데이트
액터-비평가혼합액터가 정책을, 비평가가 가치 함수를 학습
AlphaZero모델 기반심층학습 + MCTS, 자기 대전
Concept DQN — 심층 Q-네트워크

DeepMind가 Atari 게임을 푸는 데 쓴 알고리즘. 세 구성 요소 — Q-네트워크(상태-행동 가치 예측), 목표 네트워크(안정적 목표 Q-값 생성, 주기적으로만 갱신), 경험 재생(과거 경험을 버퍼에 저장해 무작위 배치로 학습 — 연속 경험의 상관을 끊어 안정화).

DQN — 학습 알고리즘 골격
for episode in episodes:
    state = env.reset()
    while not done:
        action = epsilon_greedy(Q_net, state)   # 탐험/활용
        next_s, reward, done = env.step(action)
        replay.add(state, action, reward, next_s) # 경험 저장
        batch = replay.sample()                  # 무작위 배치
        target = reward + γ · max(target_net(next_s))
        loss   = (Q_net(state)[action] - target)²
        update(Q_net, loss)                      # 역전파
    if step % C == 0: target_net = copy(Q_net) # 동기화

정책 기반 방법 — REINFORCE에서 PPO로

REINFORCE는 정책을 직접 학습한다. 무작위 정책으로 시작해 궤적(상태·행동의 연속)을 생성하고, 높은 보상을 모은 궤적은 더 자주 나오게, 낮은 보상은 덜 나오게 가중치를 갱신한다. 개념적으로 단순하지만 정책 업데이트의 분산이 크다.

PPO(Proximal Policy Optimization)는 가장 널리 쓰이는 RL 알고리즘이다. REINFORCE의 단순함과 TRPO의 안정성을 균형 잡는다. 핵심 혁신은 클리핑된 목적 함수 — 새 정책과 이전 정책의 확률 비율이 [1−ε, 1+ε] 범위(예: ε=0.2)를 벗어나면 업데이트를 잘라낸다. 정책이 한 번의 업데이트로 너무 멀리 발산하는 것을 막는다. 3장에서 본 RLHF가 PPO를 쓰는 이유다.

액터-비평가는 두 방법의 강점을 결합한다 — 액터가 정책을 결정하고, 비평가가 시간차(TD) 오류로 그 행동을 평가해 피드백한다.

Section 04AlphaZero와 MCTS

AlphaZero는 인간의 전문성이나 수작업 규칙 없이 체스·쇼기·바둑을 마스터했다. 비결은 심층학습과 몬테카를로 트리 탐색의 결합이다.

AlphaZero는 전적으로 자기 대전(self-play)으로 배운다. 게임 규칙 외에는 아무 선행 지식 없이 시작해, 자신과 수백만 게임을 하며 시행착오로 좋고 나쁜 수를 점진적으로 이해한다. 이 접근법은 인간 게임 분석으로 얻을 수 있는 것보다 훨씬 많은 훈련 데이터를 만들어낸다.

신경망은 두 출력을 낸다 — 정책 헤드(가능한 수에 대한 확률 분포)와 가치 헤드(현재 위치에서 이길 확률). 그리고 MCTS(Monte Carlo Tree Search)로 여러 수 앞을 계획한다.

Motion · MCTS 네 단계 STEP 01 / 5
space 재생 · → 다음 · R 리셋
Concept MCTS의 네 단계

① 선택(Selection) — 루트 노드에서 시작해, 탐색과 활용을 균형 잡는 UCT 공식으로 자식 노드를 따라 내려간다.

② 확장(Expansion) — 선택된 노드가 끝 상태가 아니면, 가능한 행동을 나타내는 자식 노드를 하나 이상 추가한다.

③ 시뮬레이션(Rollout) — 새 노드에서 간단·무작위 정책으로 게임을 끝까지 진행한다. 결과(승·패·무)가 보상이다.

④ 역전파(Backpropagation) — 시뮬레이션 보상을 루트까지 경로를 따라 거슬러 올려, 각 노드의 평균 보상·방문 수를 갱신한다.

핵심 — AlphaZero의 세 혁신 게임 전반의 일반화 — 같은 알고리즘이 게임별 조정 없이 체스·쇼기·바둑에 쓰인다. 인간 지식 불필요 — 자기 대전으로 배워 인간이 탐색하지 않은 혁신적 전략을 발견한다. 효율적 탐색 — MCTS로 모든 수 대신 가장 유망한 수에만 집중한다.

Section 05LLM과 RL의 만남

RL과 LLM은 오랫동안 병렬로 발전했지만, 최근 점점 교차한다. 상호작용은 세 경우로 나뉜다.

  • RL이 LLM을 강화 — RL로 NLP 작업에서 LLM 성능을 높인다. RLHF가 대표 — 3장에서 본 정렬이다. PPO가 주로 쓰인다 — 정렬된 모델이 원본에서 크게 벗어나지 않게 보장하기 때문이다. 프롬프트 최적화도 RL 문제로 표현된다.
  • LLM이 RL을 강화 — LLM의 추론·계획·다중 양식 처리 능력으로 RL 에이전트를 지원한다.
  • RL과 LLM의 결합 — 둘 다 다른 쪽을 학습시키지 않고, 기술 세트를 계획하기 위해 결합한다.
LLM 강화 RL — LLM의 네 역할
역할하는 일
정보 처리자특성 추출, 자연어를 형식 언어로 번역, 환경의 압축 표현 추출
보상 설계자작업 설명 기반으로 보상 생성 — 직접 평가하거나 보상 함수 코드 생성
의사결정자행동 집합 축소, 시퀀스 모델링으로 행동 선택
생성자세계 모델 시뮬레이터로 궤적 생성, 정책을 자연어로 설명(XRL)
함정 — LLM 강화 RL의 한계 LLM 강화 RL은 LLM의 능력에 크게 의존한다. LLM은 편향·환각을 겪고, 에이전트가 이를 상속한다. 사전 학습에 없던 환경·작업에 적응하기 어렵다. 계산 비용·지연이 증가한다. 데이터 프라이버시·지적 재산권 같은 윤리 문제도 여전히 미해결이다.
핵심 강화학습은 시행착오와 지연된 보상으로 배우는 패러다임이다. 다중 팔 강도에서 탐험·활용의 균형을, MDP와 벨만 방정식에서 장기 보상의 형식화를, DQN·PPO·액터-비평가에서 신경망 정책을, AlphaZero+MCTS에서 계획을 배웠다. 그리고 RLHF가 보여주듯, RL은 LLM을 인간 가치와 정렬시킨다. RL은 에이전트가 환경에서 행동하며 배우게 만드는 마지막 조각이다.