Skip to content

Coding-benchmarks

  • Published on
    Tessl 연구진이 2026년 6월 arXiv에 올린 포지션 논문은, 오늘날의 코딩 벤치마크가 에이전트형 소프트웨어 엔지니어링과 근본적으로 어긋나 있다고 주장합니다. 벤치마크는 개별 모델을 재려고 만들어졌는데, 우리는 그것으로 모델·하네스·컨텍스트·환경·피드백이 얽힌 시스템 전체를 비교하고 있기 때문입니다. 논문은 세 가지 구체적 어긋남 — 모델과 하네스를 뭉뚱그리는 점수, 단일 정답 채점이 정당한 대안을 벌주는 점, 컴포넌트 단위 신호가 없어 개선을 이끌 수 없는 점 — 을 짚습니다. 이 글은 그 논증을 정리하고, 더 나은 평가가 컴포넌트 단위·다중 정답·시스템 인식이라는 방향으로 어떻게 생겨야 하는지 따져 봅니다.
  • Published on
    OpenAI 평가팀은 가장 널리 쓰이는 코딩 벤치마크인 SWE-bench Verified가 오염과 설계 결함 탓에 더 이상 의미 있는 신호를 주지 못한다고 밝혔습니다. 신호(모델을 가려내는 힘)와 잡음(실행마다 흔들리는 변동)이라는 두 축으로 다시 보면, 리더보드 순위의 상당수가 잡음 위에 서 있습니다. 오염·하네스 차이·채점 불가능한 과제·과적합이 어떻게 점수를 부풀리는지 정리하고, 팀이 코딩 어시스턴트를 고를 때 리더보드가 아니라 자기 과제로 평가해야 하는 이유를 eval-first 원칙과 함께 설명합니다.