Skip to content

Agent-benchmark

  • Published on
    텍스트·이미지·에이전트는 같은 "성능"이라는 단어를 쓰지만 측정 구조가 전혀 다릅니다. 텍스트는 정답이 있는 척하는 객관식과 정답이 없는 생성형으로 갈라지고, 이미지는 분포 거리와 사람 판단이 어긋나며, 에이전트는 부분 성공·환경 상태·비결정성 때문에 애초에 하나의 숫자로 압축되지 않습니다. 이 글은 각 영역의 대표 지표가 실제로 계산하는 값을 정의 수준에서 뜯어보고, 영역마다 "지표는 높은데 실제로는 나쁜" 사례를 하나씩 붙였습니다. 마지막에 영역·과제·지표·놓치는 것을 한 장의 표로 정리합니다.