- Published on
2026년 8월에 공개된 한 사례 글은 40억 파라미터급 오픈 모델을 강화학습으로 후학습해 검색 과제에서 프론티어 모델과 맞먹으면서 요청당 비용은 자릿수 단위로 낮췄다고 밝힙니다. 이 글은 그 주장을 소개하는 대신 검증합니다. 원문에서 실제로 확인되는 숫자와 확인되지 않는 숫자를 구분하고, 좁은 과제에서만 성립하는 조건이 무엇인지 정리하며, 후학습이 라우팅보다 유리해지는 손익분기를 직접 계산할 수 있는 코드를 붙였습니다.