Skip to content

Inference-cost

  • Published on
    2026년 7월 31일 DeepSeek이 V4-Flash API를 공개 베타로 전환했습니다. 아키텍처는 4월의 프리뷰와 동일한 284B 총 파라미터 · 13B 활성 MoE에 1M 컨텍스트이고, 바뀐 것은 사후학습뿐입니다. 공식 체인지로그가 공개한 점수는 Terminal Bench 2.1에서 82.7, Toolathlon verified 70.3인데, 이 숫자들은 DeepSeek이 자사 하네스로 잰 벤더 자체 측정이라는 점을 먼저 짚어야 합니다. 이 글은 순위표 대신 능력당 단가를 계산합니다 — 캐시 적중 입력이 100만 토큰당 0.0028달러라는 항목이 왜 헤드라인 가격보다 중요한지, 출력 대 입력 배수가 2배인 가격표가 추론 워크로드에서 어떻게 6배짜리 가격표를 앞지르는지, 그리고 어떤 트래픽을 여기로 보내고 어떤 트래픽은 보내면 안 되는지를 정리합니다.
  • Published on
    OpenAI가 2026년 7월 30일 GPT-5.6 Luna 가격을 80%, Terra를 20% 내렸습니다. 7월 9일 정식 출시로부터 3주 만이고, 최상위 Sol 가격은 그대로입니다. Luna는 100만 토큰당 입력 1달러 출력 6달러에서 입력 0.20달러 출력 1.20달러가 됐습니다. 이 글은 인하폭을 소개하는 대신 곡선을 계산합니다 — 인하 후 세 티어의 단가 비율이 정확히 25 대 10 대 1로 고정되어 티어 안에서는 토큰 믹스가 순위를 바꾸지 못한다는 사실, 그래서 실제 결정은 단가가 아니라 오답 하나를 고치는 비용이 정한다는 점(100만 건 분류 워크로드에서 손익분기는 건당 약 0.52달러), 캐싱이 청구서를 옮기는 구간과 못 옮기는 구간, 그리고 벤치마크 순위가 벤치마크마다 뒤집히는 이유를 실제 수치로 따져 봅니다.
  • Published on
    2026년 7월 28일 Hacker News에서 336점을 받은 글이 있습니다. Fermisense가 Qwen3.5-9B를 GRPO로 약 500달러어치 GPU 시간만큼 학습시켜, 같은 도구와 같은 채점기를 쓴 다섯 개 프런티어 구성을 전자상거래 카탈로그 검수 과제에서 앞섰다는 보고입니다. 달성 가능 점수의 87.3% 대 최고 프런티어 76.9%, 1,000건 처리 비용은 약 0.50달러 대 19달러에서 172달러였습니다. 이 글은 그 결과를 부정하지도 확대하지도 않고 조건을 분해합니다 — 좁고 잘 정의되고 라벨이 풍부한 과제라는 세 조건이 왜 결정적인지, 500달러가 왜 청구서에서 가장 싼 항목인지, 그리고 자체 서빙의 단가가 가동률에 어떻게 무너지는지(월 7만 8천 건이 손익분기)를 계산합니다.