벤치마크 점수는 모델의 속성이 아니라 특정 조건에서 수행된 측정의 결과입니다. 같은 LLaMA 65B가 같은 MMLU에서 63.6점과 48.8점을 동시에 받은 사건은, 하네스가 프롬프트를 어떻게 조립하고 정답을 어떻게 파싱하느냐가 점수의 상당 부분을 결정한다는 것을 보여 줍니다. 이 글은 평가 하네스가 내부에서 실제로 수행하는 여섯 단계를 분해하고 lm-evaluation-harness 0.4.12, HELM 0.5.16, Inspect AI를 비교합니다. 작은 모델 하나를 처음부터 끝까지 돌리는 명령어와 태스크 정의를 직접 고쳐 보는 예시를 넣었고, 마지막에 결과를 재현하려면 무엇을 반드시 기록해야 하는지 목록으로 정리했습니다.