1일차 복습
퀴즈
확률적 디코딩(Stochastic Decoding)을 사용할 때의 가장 큰 특징은 무엇인가요?
- ○항상 동일한 답변이 나온다
- ○문법적으로 완벽한 문장만 생성된다
- ○같은 질문에도 매번 다른 답변이 나올 수 있다
- ○계산 속도가 결정론적 디코딩보다 빠르다
퀴즈를 풀려면 대화형 기능을 불러와야 합니다.
확률적 디코딩(Stochastic Decoding)을 사용할 때의 가장 큰 특징은 무엇인가요?
확률적 디코딩은 매 단계마다 확률 분포에 따라 다음 토큰을 샘플링하므로, 실행할 때마다 결과가 달라질 수 있습니다.
ChatGPT 학습 1단계인 SFT(Supervised Fine-Tuning)에서 주로 사용하는 데이터 형태는?
SFT 단계에서는 인간 작업자가 직접 작성한 질문과 이상적인 답변 데이터를 사용하여 모델을 미세 조정합니다.
LLM이 데이터를 처리하는 기본 단위는 무엇인가요?
LLM은 텍스트를 의미 있는 작은 단위인 '토큰(Token)'으로 쪼개서 처리합니다.
인과적 언어 모형(Causal Language Model)의 작동 방식은?
인과적 언어 모형은 P(xn∣x1,...xn−1)와 같이 이전 문맥을 보고 다음 토큰을 순차적으로 예측합니다.
인공신경망에서 모형의 구체적인 형태를 결정하는 수치는 무엇인가요?
파라미터(가중치와 편향 등)는 학습을 통해 조정되며, 모형이 데이터를 어떻게 처리할지를 결정하는 핵심 수치입니다.
임베딩(Embedding)이란 무엇인가요?
임베딩은 의미가 비슷한 토큰들이 공간 상에서 가깝게 위치하도록, 토큰을 수치 벡터로 표현하는 과정입니다.
문장이 길어질수록 LLM이 환각(Hallucination)을 일으킬 가능성이 높아지는 수학적 이유는?
매 단계 정답을 맞출 확률이 p일 때, 길이가 n인 문장이 모두 정답일 확률 pn은 n이 커질수록 0에 가깝게 줄어듭니다.
환각을 부추기는 현재의 평가 방식(객관식 등)이 가진 근본적인 문제는?
확실하지 않을 때 '모른다'고 하기보다 그럴듯한 답을 생성(찍기)하도록 유도하는 인센티브 구조가 환각을 심화시킵니다.
강화학습 단계에서 사람이 직접 일일이 평가하지 않고 '보상 모델(Reward Model)'을 사용하는 주된 이유는?
모델이 업데이트될 때마다 사람이 매번 평가하는 것은 불가능하므로, 사람의 선호도를 모사한 보상 모델을 사용하여 고속으로 학습합니다.
RLHF(Reinforcement Learning from Human Feedback)의 주된 목적은 무엇인가요?
단순한 다음 단어 예측을 넘어, 유용하고 안전하며 사용자가 원하는 답변을 생성하도록 모델을 조정하는 것이 RLHF의 목표입니다.
Python이 데이터 과학 및 LLM의 주류 언어가 된 이유로 가장 적절하지 않은 것은?
Python은 실행 속도 자체는 느린 편이지만, 생산성이 높고 C로 작성된 라이브러리(NumPy 등)를 연결하여 성능 문제를 해결합니다.
Jupyter Notebook에서 현재 셀을 실행하고 다음 셀로 넘어가는 단축키는?
Ctrl+Enter는 실행만 하고 머무르며, Shift+Enter는 실행 후 다음 셀로 이동합니다.
Python 변수명 작성 규칙으로 올바르지 않은 것은?
Python의 예약어(keyword)는 문법적인 용도로 사용되므로 변수명으로 쓸 수 없습니다.
Pandas 라이브러리를 관례적으로 사용하는 별칭(alias)은?
Pandas는 pd라는 단축 이름을 사용합니다.
Pandas DataFrame df에서 'name'과 'score' 두 개의 열(column)을 선택하여 새로운 DataFrame을 만드는 올바른 코드는?
여러 열을 선택할 때는 리스트(['name', 'score'])를 데이터프레임의 선택 연산자([...]) 안에 넣어야 하므로 대괄호가 두 겹([[...]])이 됩니다.
탐색적 데이터 분석(EDA)의 설명으로 적절하지 않은 것은?
가설을 검증하고 확증하는 것은 확인적 데이터 분석(CDA)에 해당합니다. EDA는 데이터를 탐색하며 가설을 생성하는 단계에 가깝습니다.
데이터의 중심 경향을 나타내는 통계량 중, 극단적인 이상치(Outlier)의 영향을 가장 덜 받는 것은?
평균은 모든 값을 더하므로 극단값에 민감하지만, 중앙값은 순서상 가운데 위치한 값이므로 극단값의 영향을 거의 받지 않습니다.
수치형 변수 하나(Univariate)의 분포를 구간(Bin)별 빈도수로 나타내는 가장 대표적인 시각화 방법은?
연속형 변수의 분포를 확인할 때는 히스토그램을 주로 사용합니다. 막대 그래프는 범주형 변수의 빈도를 나타낼 때 사용됩니다.
상자 그림(Box Plot)에서 상자(Box)의 위아래 길이(IQR)가 의미하는 것은?
상자의 밑변은 1사분위수(25%), 윗변은 3사분위수(75%)이므로, 상자의 높이는 중간 50% 데이터가 퍼져 있는 범위를 나타냅니다.
Matplotlib을 기반으로 하여, 더 세련된 디자인과 손쉬운 통계적 시각화 기능을 제공하는 Python 라이브러리는?
Seaborn은 Matplotlib만큼 강력하지만 사용하기 더 쉽고, 통계적 그래프를 그리는 데 최적화되어 있습니다.