- Published on
공개 벤치마크는 우리 문제를 대신 재 주지 않습니다. 입력 분포도, 정답의 정의도, 실패의 비용 구조도 다르기 때문입니다. 이 글은 실제 트래픽에서 사례를 건져 올려 실패 유형별로 층화하고, 정답을 정의할 수 없는 과제에 루브릭을 씌우고, 채점 스크립트를 붙이는 과정을 실제 코드로 따라갑니다. 예시가 몇 개면 충분한지 신뢰구간으로 감을 잡고, 작은 평가셋에서 두 모델의 5퍼센트포인트 차이가 통계적으로 의미 있는지 McNemar 검정과 부트스트랩으로 판정하는 방법까지 다룹니다. 마지막으로 평가셋을 CI에 붙이는 법, 오염을 막는 법, 그리고 평가셋 자체가 낡는 문제를 정리합니다.