
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>Chaos and Order</title>
      <link>https://www.youngju.dev/blog</link>
      <description>천천히 올바르게. AI Researcher &amp; DevOps Engineer Youngju&#39;s blog. GPU/CUDA, LLM, MLOps, Kubernetes AI workloads, and data engineering — plus mindset essays on confidence, routines, health, and sport psychology.</description>
      <language>ko</language>
      <managingEditor>fjvbn2003@gmail.com (Youngju Kim)</managingEditor>
      <webMaster>fjvbn2003@gmail.com (Youngju Kim)</webMaster>
      <lastBuildDate>Wed, 19 Aug 2026 00:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.youngju.dev/tags/tiny-models/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-01-text-generation.en</guid>
    <title>AI for Everyone, Part 1 — Training a 16M-Parameter Language Model From Scratch in 15 Minutes</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-01-text-generation.en</link>
    <description>Training a language model from scratch on a single GPU. With the TinyStories dataset and a 16-million-parameter decoder-only transformer, we produced readable English fairy tales in 15 minutes. We look at why the causal mask matters, what weight tying saves, and what a perplexity of 8 actually means for the sentences that come out — using real training logs and unedited samples. Measured on an RTX 3090.</description>
    <pubDate>Wed, 19 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>llm</category><category>transformer</category><category>pytorch</category><category>hands-on</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-01-text-generation.ja</guid>
    <title>みんなのためのAI 第1回 — 1600万パラメータの言語モデルを15分でゼロから学習させる</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-01-text-generation.ja</link>
    <description>GPU 1枚で言語モデルをゼロから学習させます。TinyStories データセットと1600万パラメータのデコーダ専用トランスフォーマーで、15分で読める英語の童話を生成しました。因果マスクがなぜ必要か、重み共有が何を節約するのか、perplexity 8 が実際にどんな文章を意味するのかを、実際の学習ログと生成結果で確認します。RTX 3090 実測。</description>
    <pubDate>Wed, 19 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>llm</category><category>transformer</category><category>pytorch</category><category>hands-on</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-01-text-generation</guid>
    <title>모두를 위한 AI 1편 — 16M 파라미터 언어모델을 15분에 처음부터 학습시키기</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-01-text-generation</link>
    <description>GPU 한 장으로 언어모델을 처음부터 학습시켜 봅니다. TinyStories 데이터셋과 1,600만 파라미터짜리 디코더 전용 트랜스포머로 15분 만에 읽히는 영어 동화를 생성했습니다. 어텐션 마스크가 왜 필요한지, 가중치 묶기가 무엇을 절약하는지, perplexity 20이 실제로 어떤 문장을 뜻하는지를 실제 학습 로그와 생성 결과로 확인합니다. RTX 3090 실측 기준.</description>
    <pubDate>Wed, 19 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>llm</category><category>transformer</category><category>pytorch</category><category>hands-on</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-01-text-generation.zh</guid>
    <title>人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-01-text-generation.zh</link>
    <description>用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer，15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果，来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。</description>
    <pubDate>Wed, 19 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>llm</category><category>transformer</category><category>pytorch</category><category>hands-on</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-03-image-text-to-text.en</guid>
    <title>AI for Everyone, Part 3 — Loss of 0.0017, Accuracy of 7.5%: The Culprit Was One Padding Slot</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-03-image-text-to-text.en</link>
    <description>We built a VQA model — one that answers questions about an image — with 1.48 million parameters. Training loss fell to 0.0017 while accuracy sat at 7.5%, worse than guessing. The cause was not the model but a single line in the code that builds the targets, and fixing it produced 99.5%. This is a look at why low loss does not guarantee a good model, and how to spot the trap, using the real outputs.</description>
    <pubDate>Fri, 21 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>vqa</category><category>multimodal</category><category>debugging</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-03-image-text-to-text.ja</guid>
    <title>みんなのためのAI 第3回 — 損失0.0017なのに正解率7.5%、犯人はパディング1マスだった</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-03-image-text-to-text.ja</link>
    <description>画像と質問を一緒に受け取って答える VQA モデルを148万パラメータで作りました。学習損失は0.0017まで落ちたのに正解率は7.5%。ランダムより悪い数値です。原因はモデルではなく正解を作るコード1行で、直したら99.5%になりました。なぜ低い損失が良いモデルを保証しないのか、その罠をどう見抜くのかを実際の出力で確認します。</description>
    <pubDate>Fri, 21 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>vqa</category><category>multimodal</category><category>debugging</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-03-image-text-to-text</guid>
    <title>모두를 위한 AI 3편 — 손실 0.0017인데 정확도 7.5%, 범인은 패딩 한 칸이었다</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-03-image-text-to-text</link>
    <description>이미지와 질문을 함께 받아 답하는 VQA 모델을 148만 파라미터로 만들었습니다. 학습 손실은 0.0017까지 떨어졌는데 정확도는 7.5%였습니다. 무작위보다 나쁜 수치였죠. 원인은 모델이 아니라 정답을 만드는 코드 한 줄이었고, 고치자 99.5%가 됐습니다. 왜 낮은 손실이 좋은 모델을 보장하지 않는지, 그리고 그 함정을 어떻게 알아채는지를 실제 출력으로 확인합니다.</description>
    <pubDate>Fri, 21 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>vqa</category><category>multimodal</category><category>debugging</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-03-image-text-to-text.zh</guid>
    <title>人人可懂的 AI 第3篇 — 损失0.0017却只有7.5%正确率，元凶是一格填充</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-03-image-text-to-text.zh</link>
    <description>我们用148万参数做了一个 VQA 模型：同时接收图像和问题并给出答案。训练损失降到 0.0017，正确率却只有 7.5%，比随机猜还差。原因不在模型，而在生成标签的一行代码；改掉之后变成 99.5%。本文用真实输出说明：为什么低损失并不保证好模型，以及如何识破这个陷阱。</description>
    <pubDate>Fri, 21 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>vqa</category><category>multimodal</category><category>debugging</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-04-image-to-text.en</guid>
    <title>AI for Everyone, Part 4 — Captioning Images With 1.37M Parameters, and Why Part 3 Bug Was Absent Here</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-04-image-to-text.en</link>
    <description>We joined a CNN encoder to a transformer decoder and captioned Fashion-MNIST images. With 1.37 million parameters and ten minutes of training, the label hit rate reached 91%. This part looks at what cross-attention does in an encoder-decoder setup, and why the EOS bug that dropped Part 3 accuracy to 7.5% never appeared in this code — with the two functions placed side by side.</description>
    <pubDate>Sat, 22 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>captioning</category><category>multimodal</category><category>transformer</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-04-image-to-text.ja</guid>
    <title>みんなのためのAI 第4回 — 137万パラメータで画像に文をつける、そして第3回のバグがここになかった理由</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-04-image-to-text.ja</link>
    <description>CNN エンコーダとトランスフォーマーデコーダをつないで、Fashion-MNIST の画像にキャプションをつけるモデルを作りました。137万パラメータ、10分の学習でラベル的中率91%です。エンコーダ・デコーダ構造で cross-attention が何をするのか、そして第3回で正解率を7.5%に落とした EOS バグがなぜこのコードになかったのかを、2つの関数を並べて確認します。</description>
    <pubDate>Sat, 22 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>captioning</category><category>multimodal</category><category>transformer</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-04-image-to-text</guid>
    <title>모두를 위한 AI 4편 — 137만 파라미터로 이미지에 문장 붙이기, 그리고 3편의 버그가 여기엔 없던 이유</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-04-image-to-text</link>
    <description>CNN 인코더와 트랜스포머 디코더를 이어 붙여 Fashion-MNIST 이미지에 캡션을 다는 모델을 만들었습니다. 137만 파라미터, 10분 학습으로 라벨 적중률 91%가 나왔습니다. 인코더-디코더 구조에서 cross-attention이 무엇을 하는지, 그리고 3편에서 정확도를 7.5%로 떨어뜨렸던 EOS 버그가 왜 이 코드에는 없었는지를 두 함수를 나란히 놓고 확인합니다.</description>
    <pubDate>Sat, 22 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>captioning</category><category>multimodal</category><category>transformer</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-04-image-to-text.zh</guid>
    <title>人人可懂的 AI 第4篇 — 用137万参数给图像配句子，以及第3篇的 bug 为何没出现在这里</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-04-image-to-text.zh</link>
    <description>把 CNN 编码器接上 Transformer 解码器，给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练，标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么，并把两个函数并排放在一起，说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。</description>
    <pubDate>Sat, 22 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>captioning</category><category>multimodal</category><category>transformer</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-05-image-to-image.en</guid>
    <title>AI for Everyone, Part 5 — Colourising Photos With a 0.47M U-Net, and Why the Colours Came Out Washed Out</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-05-image-to-image.en</link>
    <description>The smallest model in this series — a 472K-parameter U-Net — restored colour to greyscale CIFAR-10 images. Shapes survived intact, but the colours came out noticeably washed out. That is not a capacity problem; it is a consequence of choosing L1 loss. We look at what skip connections carry, and why a regression loss drains saturation, using the actual output images.</description>
    <pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>computer-vision</category><category>unet</category><category>colorization</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-05-image-to-image.ja</guid>
    <title>みんなのためのAI 第5回 — 47万パラメータの U-Net で白黒写真に色をつける、そしてなぜ色が褪せたのか</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-05-image-to-image.ja</link>
    <description>シリーズ最小の47万パラメータ U-Net で CIFAR-10 の白黒画像をカラーに復元しました。形は正確に保たれましたが色が目に見えて褪せています。これはモデルの容量の問題ではなく L1 損失を選んだ結果です。skip connection が何を運ぶのか、そして回帰損失がなぜ彩度を殺すのかを実際の結果画像で確認します。</description>
    <pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>computer-vision</category><category>unet</category><category>colorization</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-05-image-to-image</guid>
    <title>모두를 위한 AI 5편 — 47만 파라미터 U-Net으로 흑백 사진에 색 입히기, 그리고 왜 색이 바랬는가</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-05-image-to-image</link>
    <description>시리즈에서 가장 작은 모델인 47만 파라미터 U-Net으로 CIFAR-10 흑백 이미지를 컬러로 복원했습니다. 형태는 정확히 살렸지만 색이 눈에 띄게 바랬는데, 이건 모델 용량 문제가 아니라 L1 손실을 고른 결과입니다. skip connection이 무엇을 나르는지, 그리고 회귀 손실이 왜 채도를 죽이는지를 실제 결과 이미지로 확인합니다.</description>
    <pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>computer-vision</category><category>unet</category><category>colorization</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-05-image-to-image.zh</guid>
    <title>人人可懂的 AI 第5篇 — 用47万参数的 U-Net 给黑白照片上色，以及颜色为何发灰</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-05-image-to-image.zh</link>
    <description>本系列最小的模型 —— 47万参数的 U-Net —— 把 CIFAR-10 的黑白图像还原成彩色。形状保留得很好，颜色却明显发灰。这不是容量问题，而是选用 L1 损失的必然结果。我们用真实输出图像说明 skip connection 究竟运送了什么，以及回归损失为何会抽干饱和度。</description>
    <pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>computer-vision</category><category>unet</category><category>colorization</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-06-text-to-image.en</guid>
    <title>AI for Everyone, Part 6 — Drawing Digits From Words With a 1.11M Diffusion Model</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-06-text-to-image.en</link>
    <description>We built a conditional diffusion model with 1.11 million parameters that draws a 0 when you type &quot;zero&quot;. The forward process that adds noise is a single formula; the reverse process that restores the image is that same line walked backwards 400 times. Using the actual generated output, we look at how diffusion sidesteps the washed-out colour problem from Part 5, and why the model is trained to predict noise rather than the image.</description>
    <pubDate>Mon, 24 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>diffusion</category><category>ddpm</category><category>generative</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-06-text-to-image.ja</guid>
    <title>みんなのためのAI 第6回 — 111万パラメータの拡散モデルで単語から数字を描く</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-06-text-to-image.ja</link>
    <description>&quot;zero&quot; と書けば0を描く条件付き拡散モデルを111万パラメータで作りました。ノイズを混ぜる forward は数式1行、復元する reverse はその1行を400回逆にたどるだけです。第5回で L1 損失が色を褪せさせた問題を拡散がどう回避するのか、そしてなぜモデルがノイズを予測するよう学習されるのかを、実際の生成結果で確認します。</description>
    <pubDate>Mon, 24 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>diffusion</category><category>ddpm</category><category>generative</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-06-text-to-image</guid>
    <title>모두를 위한 AI 6편 — 111만 파라미터 디퓨전으로 단어에서 숫자 그리기</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-06-text-to-image</link>
    <description>&quot;zero&quot;라고 쓰면 0을 그리는 조건부 디퓨전 모델을 111만 파라미터로 만들었습니다. 노이즈를 섞는 forward는 공식 한 줄이고, 복원하는 reverse는 그 한 줄을 400번 거꾸로 밟는 것뿐입니다. 5편에서 L1 손실이 색을 바래게 만든 문제를 디퓨전이 어떻게 피해 가는지, 그리고 왜 모델이 노이즈를 예측하도록 학습되는지를 실제 생성 결과로 확인합니다.</description>
    <pubDate>Mon, 24 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>diffusion</category><category>ddpm</category><category>generative</category><category>pytorch</category><category>tiny-models</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/ai/tiny-models-06-text-to-image.zh</guid>
    <title>人人可懂的 AI 第6篇 — 用111万参数的扩散模型从单词画出数字</title>
    <link>https://www.youngju.dev/blog/ai/tiny-models-06-text-to-image.zh</link>
    <description>我们用111万参数做了一个条件扩散模型：输入 &quot;zero&quot; 就画出 0。加噪的 forward 只是一行公式，还原的 reverse 就是把这一行倒着走 400 次。本文用真实生成结果说明扩散如何绕开第5篇中 L1 损失导致的颜色发灰问题，以及为什么模型被训练去预测噪声而不是图像。</description>
    <pubDate>Mon, 24 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>ai</category><category>diffusion</category><category>ddpm</category><category>generative</category><category>pytorch</category><category>tiny-models</category>
  </item>

    </channel>
  </rss>
