logo

문제점

문제점

강화학습의 어려움

  • 느린 학습 속도, 높은 계산 비용, 낮은 성능
  • 보상 함수를 결정하기 어려움
  • 국소최적과 과적합
  • 불안정성과 재현의 어려움
  • 물리적 적용이 어려움
  • 배경 지식 없이 무작위적 시행착오

느린 학습 속도, 높은 계산 비용, 낮은 성능

  • 느린 학습 속도와 높은 계산 비용
    • 컴퓨터 게임에서 인간이 몇 분 정도면 하면 낼 수 있는 실력에 강화학습으로 도달하려면 게임을 수 십 시간 분량해야 (+ 학습 시간)
    • 가상의 환경에서 로봇의 달리기 동작을 학습하는데 CPU 64개로 100 시간 분량의 계산이 필요
    • 알파고 제로 (2017)의 하드웨어 가격은 2천5백만 달러로 추정
  • 특화된 방법에 미치지 못하는 성능
    • 강화학습은 다양한 종류의 문제에 적용할 수 있는 일반적 방법론
    • 특정 문제에 특화된 방법론에 성능이 못 미치는 경우가 많이 있음

보상 함수를 결정하기 어려움

  • 강화학습은 궁극적으로 보상을 많이 받도록 행동하게 학습
  • 보상이 분명하지 않거나, 측정하기 어려우면 적용할 수 없음
    • 예: 챗봇의 목적을 사용자의 만족으로 정의할 경우, 만족도의 측정이 어려움
  • 또는 극단적으로 보상만을 극대화하는 행동을 할 수 있음
    • 예: 컴퓨터 게임에서 플레이 시간을 보상으로 정의한 경우 일시 정지를 무한히 거는 행동을 할 수 있음

국소 최적과 과적합

  • 국소 최적
    • 강화 학습에서 한 행동의 수익은 이어지는 다른 행동들에 영향을 받음
    • 국소 최적인 정책에 빠질 경우 빠져 나오기가 쉽지 않음
  • 특정한 종류의 환경에 과적합
    • 딥러닝에서 컴퓨터 비전, 자연어 처리 등은 전이 학습에서 큰 성과
    • 대량의 데이터로 사전 학습 후 다양한 종류의 과제에 미세 조정을 하여 사용
    • 강화 학습의 경우 특정한 종류의 환경에 과적합되는 경향, 전이 학습이 어려움

국소 최적과 과적합을 설명하는 도서 표지 이미지

불안정성과 재현의 어려움

  • 강화 학습은 다른 종류의 학습에 비해 학습이 불안정
  • 강화 학습에서 한 행동의 수익은 다른 행동들과 복잡하게 연관
  • 동일한 상태에서 동일한 행동을 하더라도, 다른 상태에서 행동이 바뀌면 가치가 달라짐
  • 동일한 알고리즘으로 동일한 환경에서 학습을 해도 똑같은 결과를 내기가 어려움

물리적 적용이 어려움

  • 강화학습은 수많은 시행착오를 전제로 함
  • 게임 등 가상적인 환경에서는 시행착오를 하더라도 실패에 따른 부담이 없음
  • 물리적 환경에서는 시행착오에 많은 시간과 비용이 들고, 실패의 부담이 큼
  • 가상 환경에서 시행 착오를 한 후, 물리적 환경에 적용할 경우 환경 간의 차이로 인해 적용이 어려움(Sim-to-Real)

Sim-to-Real 환경 차이를 보여주는 로봇 조작 이미지

배경 지식 없이 무작위적 시행착오

  • Atari 게임 "Montezuma's Revenge" → 보상이 드물어 학습이 어려움
  • 첫 번째 방의 경우 첫 번째 방에서 첫 번째 열쇠를 얻기 위해 멀리 움직여야 함
  • 게임의 실패 조건이 매우 엄격
  • 사람의 경우 화면상의 요소(열쇠, 두개골, 사다리 등)으로부터 해야 할 행동을 추론할 수 있음 → 사전 지식을 제거하면 훨씬 어려워짐

Montezuma's Revenge 첫 번째 방 화면

Montezuma's Revenge 화면 요소 예시

강화학습 적용이 효과적인 문제의 특성

  • 많은 경험을 생성하기가 쉬움(예: 바둑, 컴퓨터 게임, 시뮬레이션 등)
  • 문제를 더 단순한 문제로 바꾸기 쉬움
  • (강화학습 행위자들 간의 대결 형식의) 셀프 플레이가 가능함
  • 보상을 정의하는 직관적인 방법이 있음(예: 이기면 +1, 지면 -1)
  • 행동에 대한 피드백이 빠르고 많이 주어짐

퀴즈

문제 1 / 8맞음: 0힌트: 0틀림: 0채점중: 0남음: 8

슬라이드에서 강화학습의 어려움으로 제시한 항목을 모두 고르세요.

  • 느린 학습 속도와 높은 계산 비용
  • 보상 함수를 결정하기 어려움
  • 불안정성과 재현의 어려움
  • 학습 데이터가 항상 완전하게 정답 라벨을 포함함

퀴즈를 풀려면 대화형 기능을 불러와야 합니다.

Previous
챗봇