
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>Chaos and Order</title>
      <link>https://www.youngju.dev/blog</link>
      <description>천천히 올바르게. AI Researcher &amp; DevOps Engineer Youngju&#39;s blog. GPU/CUDA, LLM, MLOps, Kubernetes AI workloads, and data engineering — plus mindset essays on confidence, routines, health, and sport psychology.</description>
      <language>ko</language>
      <managingEditor>fjvbn2003@gmail.com (Youngju Kim)</managingEditor>
      <webMaster>fjvbn2003@gmail.com (Youngju Kim)</webMaster>
      <lastBuildDate>Sun, 02 Aug 2026 00:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.youngju.dev/tags/training-stability/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.youngju.dev/blog/mlops/2026-08-02-llm-training-case-studies</guid>
    <title>공개된 학습 사례에서 배우기 — 무엇을 시도했고 무엇이 실패했나</title>
    <link>https://www.youngju.dev/blog/mlops/2026-08-02-llm-training-case-studies</link>
    <description>공개된 대규모 학습 기술 보고서와 로그북 일곱 건을 골라 성공 지표가 아니라 실패와 대응만 뽑아 정리했습니다. Llama 3 405B의 54일간 419건 중단 통계에서 체크포인트 주기를 역산하고, DeepSeek-V3와 Kimi K2가 손실 스파이크를 각각 다른 층위에서 없앤 방식을 비교합니다. Olmo 계열이 안정성 수정을 아키텍처에 남긴 이유, OPT-175B와 BLOOM 로그북이 남긴 실패 기록의 원형, SmolLM3와 Marin이 공개한 데이터 혼합 실험 노트도 다룹니다. 각 사례마다 출처를 링크하고, 보고서가 말하지 않아 재현할 수 없는 부분을 따로 적었습니다.</description>
    <pubDate>Sun, 02 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>mlops</category><category>llm-training</category><category>case-study</category><category>training-stability</category><category>scaling</category>
  </item>

    </channel>
  </rss>
