2일차 복습
퀴즈
산점도(Scatter Plot)에서 점의 색상(Color)을 이용해 제3의 범주형 변수를 표현하고 싶을 때 사용하는 seaborn 인자는?
- ○size
- ○style
- ○hue
- ○alpha
퀴즈를 풀려면 대화형 기능을 불러와야 합니다.
산점도(Scatter Plot)에서 점의 색상(Color)을 이용해 제3의 범주형 변수를 표현하고 싶을 때 사용하는 seaborn 인자는?
'hue'는 색조를 의미하며, 데이터의 그룹에 따라 색상을 다르게 지정할 때 사용합니다.
Matplotlib에서 차트의 전체 영역(Canvas)을 담당하는 최상위 컨테이너 객체는 무엇인가?
하나의 Figure 안에 여러 개의 Axes(작은 그래프)가 들어갈 수 있습니다.
Matplotlib/Seaborn에서 하나의 Figure 안에 여러 개의 그래프(Axes)를 격자 형태로 배치하기 위해 사용하는 함수는?
subplots(nrows=2, ncols=2)와 같이 행과 열의 개수를 지정하여 사용합니다.
객체 지향 인터페이스(Object-oriented Interface) 방식에서 Axes 객체 ax에 제목을 설정하는 메서드는?
pyplot 방식인 plt.title()과 달리 객체 방식에서는 set_ 접두사가 붙는 경우가 많습니다.
완성된 그래프를 이미지 파일로 저장하기 위해 사용하는 메서드는?
그림(Figure)을 저장(save)한다는 뜻의 함수입니다.
지도 학습(Supervised Learning)의 핵심 특징은?
지도 학습은 선생님이 문제(X)와 정답(y)을 알려주며 가르치는 방식과 유사합니다.
지도 학습(Supervised Learning)과 강화 학습(Reinforcement Learning)의 차이점은?
강화 학습은 동물이 맛있는 간식을 얻기 위해 행동을 학습하는 것과 유사합니다.
머신러닝에서 전체 데이터를 훈련(Train) 세트와 테스트(Test) 세트로 나누는 주된 이유는?
훈련 데이터만 잘 맞추는 것이 아니라, 처음 보는 데이터(Test)도 잘 맞추는지 확인해야 합니다.
별도의 학습 과정 없이, 예측 시점에 가장 가까운 k개의 이웃 데이터를 찾아 다수결이나 평균으로 예측하는 '게으른 학습(Lazy Learning)' 알고리즘은?
이름에 'Neighbors'가 들어갑니다.
회귀(Regression) 모델의 성능을 평가하는 지표로, 전체 변동 중 모델이 설명하는 변동의 비율(0~1 사이)을 나타내는 것은?
R2라고도 표기하며, 1에 가까울수록 모델이 데이터를 잘 설명한다는 의미입니다.
로지스틱 회귀(Logistic Regression)에 대한 설명으로 가장 적절한 것은?
로지스틱 회귀는 시그모이드 함수를 통해 확률(0~1)을 출력하여 이진 분류를 수행합니다.
의사결정나무(Decision Tree)가 데이터를 분할할 때 사용하는 기준 중 하나로, 한 노드 안에 데이터가 얼마나 섞여 있는지를 나타내는 척도는?
지니 지수(Gini Index)나 엔트로피(Entropy)가 이것을 측정하는 방법입니다.
의사결정나무의 깊이가 너무 깊어지면 훈련 데이터에만 지나치게 맞춰지는 현상은?
나무가 너무 복잡해지면 훈련 데이터의 잡음까지 학습하게 됩니다.
혼동 행렬(Confusion Matrix)에서, 실제로는 음성(Negative, 0)인데 모델이 양성(Positive, 1)이라고 잘못 예측한 경우를 무엇이라 하는가?
거짓 양성이라고도 하며, '예측이 Positive(양성)였으나 틀렸다(False)'는 의미입니다.
스팸 메일 분류기에서 스팸 메일을 양성이라고 할 때, 일반 중요한 메일을 스팸으로 잘못 분류(FP)하는 것을 최소화해야 할 때 가장 중요한 평가 지표는?
모델이 '스팸'이라고 예측한 것 중에 진짜 스팸이 얼마나 많은지가 중요합니다. (억울한 일반 메일이 없어야 함)
암 진단과 같이 실제로 암인 환자(Positive)를 놓치지 않고 모두 찾아내는(위음성(FN)을 줄이는) 것이 중요할 때 가장 우선시해야 할 지표는?
실제 양성 데이터를 모델이 얼마나 잘 '재현'해냈는가를 봅니다. (암 환자를 놓치지 않아야 함)
분류 모델의 문턱값(Threshold)을 높이면 어떤 방향으로 변화가 일어나는지 모두 고르세요.
문턱값이 높아지면 양성이라고 판단하는 개수는 줄어들지만, 확실한 것만 양성이라 하므로 정밀도는 올라갑니다.
ROC 곡선 아래의 면적을 뜻하며, 1에 가까울수록 모델의 성능이 좋음을 나타내는 지표는?
Area Under the Curve의 약자입니다.
머신러닝에서 '공짜 점심은 없다 (No Free Lunch)'는 말의 의미로 가장 적절한 것은?
데이터의 특성에 따라 적합한 알고리즘이 다르기 때문에 여러 모델을 시도하고 검증해봐야 한다는 뜻입니다.
F1 Score는 정밀도(Precision)와 재현도(Recall)의 어떤 평균을 사용하여 계산하는가?
역수의 산술 평균의 역수입니다. 두 지표가 골고루 높아야 높은 점수가 나오도록 설계되었습니다.