- Published on
Tessl 연구진이 2026년 6월 arXiv에 올린 포지션 논문은, 오늘날의 코딩 벤치마크가 에이전트형 소프트웨어 엔지니어링과 근본적으로 어긋나 있다고 주장합니다. 벤치마크는 개별 모델을 재려고 만들어졌는데, 우리는 그것으로 모델·하네스·컨텍스트·환경·피드백이 얽힌 시스템 전체를 비교하고 있기 때문입니다. 논문은 세 가지 구체적 어긋남 — 모델과 하네스를 뭉뚱그리는 점수, 단일 정답 채점이 정당한 대안을 벌주는 점, 컴포넌트 단위 신호가 없어 개선을 이끌 수 없는 점 — 을 짚습니다. 이 글은 그 논증을 정리하고, 더 나은 평가가 컴포넌트 단위·다중 정답·시스템 인식이라는 방향으로 어떻게 생겨야 하는지 따져 봅니다.