
정답보상을 최대화하는 행동을 학습하는 강화 학습입니다.
핵심 개념
강화 학습(Reinforcement Learning)의 정의
기계 학습은 크게 지도 학습, 비지도 학습, 강화 학습으로 나뉩니다. 이 중 강화 학습은 '환경(environment)', '에이전트(agent)', '상태(state)', '행동(action)', '보상(reward)'이라는 요소로 정의됩니다. 에이전트가 현재 상태를 인식하고 여러 행동 중 하나를 선택하면 환경으로부터 보상을 받으며, 누적 보상을 최대화하는 방향으로 정책(policy)을 학습합니다. 지문에 나온 '에이전트, 상태 인식, 보상 최대화 행동 선택'이라는 표현이 강화 학습의 정의를 그대로 서술한 것입니다.
선지별 해설
①에이전트가 상태를 인식하고 보상을 최대화하는 행동(순서)을 선택하는 것은 강화 학습의 정의 그 자체이므로 정답입니다.
②지도 학습은 입력과 정답 레이블 쌍으로 학습하는 방식으로, 보상 개념이 아니라 정답과의 오차를 줄이는 방식이라 지문과 맞지 않습니다.
③비지도 학습은 레이블 없이 데이터의 군집·구조를 찾는 방식으로, 보상 최대화와는 무관합니다.
④앙상블 학습은 여러 모델의 예측을 결합해 성능을 높이는 기법으로, 상태·보상 기반의 행동 선택과는 다릅니다.

정답실제 음성 중 음성으로 맞힌 비율이 특이도라는 설명이 옳습니다.
핵심 개념
이진 분류기의 성능 지표
혼동행렬(TP, FN, FP, TN)에서 도출되는 지표들의 정의를 정확히 구분하는 문제입니다. 정밀도(precision)는 양성으로 예측한 것 중 실제 양성 비율 TP/(TP+FP), 재현율(recall)=민감도(sensitivity)는 실제 양성 중 양성으로 맞힌 비율 TP/(TP+FN), 특이도(specificity)는 실제 음성 중 음성으로 맞힌 비율 TN/(TN+FP), 위양성율(FPR)은 실제 음성 중 양성으로 잘못 판정한 비율 FP/(FP+TN)입니다. 각 지표의 분모가 무엇인지가 핵심 구분점입니다.
선지별 해설
①양성으로 판정한 것 중 실제 양성 비율은 정밀도(precision)입니다. 재현율은 실제 양성을 분모로 하므로 지표를 뒤바꾼 설명입니다.
②실제 음성 중 분류기가 음성으로 판정한 비율 TN/(TN+FP)이 특이도(specificity)의 정확한 정의이므로 옳습니다.
③실제 양성 중 양성으로 판정한 비율은 재현율(민감도)입니다. 위양성율은 실제 음성을 분모로 하므로 잘못된 설명입니다.
④민감도는 클수록, 위양성율은 작을수록 좋은 성능을 의미하므로 대소 관계를 정반대로 서술한 틀린 설명입니다.