
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>Chaos and Order</title>
      <link>https://www.youngju.dev/blog</link>
      <description>천천히 올바르게. AI Researcher &amp; DevOps Engineer Youngju&#39;s blog. GPU/CUDA, LLM, MLOps, Kubernetes AI workloads, and data engineering — plus mindset essays on confidence, routines, health, and sport psychology.</description>
      <language>ko</language>
      <managingEditor>fjvbn2003@gmail.com (Youngju Kim)</managingEditor>
      <webMaster>fjvbn2003@gmail.com (Youngju Kim)</webMaster>
      <lastBuildDate>Fri, 31 Jul 2026 00:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.youngju.dev/tags/inference-cost/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.youngju.dev/blog/2026-07-31-deepseek-v4-flash-what-the-numbers-mean</guid>
    <title>DeepSeek V4 Flash가 실제로 바꾸는 것 — 리더보드가 아니라 능력당 단가의 문제</title>
    <link>https://www.youngju.dev/blog/2026-07-31-deepseek-v4-flash-what-the-numbers-mean</link>
    <description>2026년 7월 31일 DeepSeek이 V4-Flash API를 공개 베타로 전환했습니다. 아키텍처는 4월의 프리뷰와 동일한 284B 총 파라미터 · 13B 활성 MoE에 1M 컨텍스트이고, 바뀐 것은 사후학습뿐입니다. 공식 체인지로그가 공개한 점수는 Terminal Bench 2.1에서 82.7, Toolathlon verified 70.3인데, 이 숫자들은 DeepSeek이 자사 하네스로 잰 벤더 자체 측정이라는 점을 먼저 짚어야 합니다. 이 글은 순위표 대신 능력당 단가를 계산합니다 — 캐시 적중 입력이 100만 토큰당 0.0028달러라는 항목이 왜 헤드라인 가격보다 중요한지, 출력 대 입력 배수가 2배인 가격표가 추론 워크로드에서 어떻게 6배짜리 가격표를 앞지르는지, 그리고 어떤 트래픽을 여기로 보내고 어떤 트래픽은 보내면 안 되는지를 정리합니다.</description>
    <pubDate>Fri, 31 Jul 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>llm</category><category>deepseek</category><category>inference-cost</category><category>moe</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/2026-07-31-gpt-5-6-price-performance-curve</guid>
    <title>GPT-5.6과 가격 대비 성능의 한계 — 곡선 위에서 내 워크로드의 자리를 찾는 법</title>
    <link>https://www.youngju.dev/blog/2026-07-31-gpt-5-6-price-performance-curve</link>
    <description>OpenAI가 2026년 7월 30일 GPT-5.6 Luna 가격을 80%, Terra를 20% 내렸습니다. 7월 9일 정식 출시로부터 3주 만이고, 최상위 Sol 가격은 그대로입니다. Luna는 100만 토큰당 입력 1달러 출력 6달러에서 입력 0.20달러 출력 1.20달러가 됐습니다. 이 글은 인하폭을 소개하는 대신 곡선을 계산합니다 — 인하 후 세 티어의 단가 비율이 정확히 25 대 10 대 1로 고정되어 티어 안에서는 토큰 믹스가 순위를 바꾸지 못한다는 사실, 그래서 실제 결정은 단가가 아니라 오답 하나를 고치는 비용이 정한다는 점(100만 건 분류 워크로드에서 손익분기는 건당 약 0.52달러), 캐싱이 청구서를 옮기는 구간과 못 옮기는 구간, 그리고 벤치마크 순위가 벤치마크마다 뒤집히는 이유를 실제 수치로 따져 봅니다.</description>
    <pubDate>Fri, 31 Jul 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>llm</category><category>openai</category><category>inference-cost</category><category>prompt-caching</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/2026-07-31-small-model-finetuning-beats-frontier</guid>
    <title>500달러로 파인튜닝한 9B가 프런티어를 이긴 조건 — 그리고 그 조건이 얼마나 좁은가</title>
    <link>https://www.youngju.dev/blog/2026-07-31-small-model-finetuning-beats-frontier</link>
    <description>2026년 7월 28일 Hacker News에서 336점을 받은 글이 있습니다. Fermisense가 Qwen3.5-9B를 GRPO로 약 500달러어치 GPU 시간만큼 학습시켜, 같은 도구와 같은 채점기를 쓴 다섯 개 프런티어 구성을 전자상거래 카탈로그 검수 과제에서 앞섰다는 보고입니다. 달성 가능 점수의 87.3% 대 최고 프런티어 76.9%, 1,000건 처리 비용은 약 0.50달러 대 19달러에서 172달러였습니다. 이 글은 그 결과를 부정하지도 확대하지도 않고 조건을 분해합니다 — 좁고 잘 정의되고 라벨이 풍부한 과제라는 세 조건이 왜 결정적인지, 500달러가 왜 청구서에서 가장 싼 항목인지, 그리고 자체 서빙의 단가가 가동률에 어떻게 무너지는지(월 7만 8천 건이 손익분기)를 계산합니다.</description>
    <pubDate>Fri, 31 Jul 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>llm</category><category>fine-tuning</category><category>reinforcement-learning</category><category>inference-cost</category>
  </item>

    </channel>
  </rss>
