CNN 인코더와 트랜스포머 디코더를 이어 붙여 Fashion-MNIST 이미지에 캡션을 다는 모델을 만들었습니다. 137만 파라미터, 10분 학습으로 라벨 적중률 91%가 나왔습니다. 인코더-디코더 구조에서 cross-attention이 무엇을 하는지, 그리고 3편에서 정확도를 7.5%로 떨어뜨렸던 EOS 버그가 왜 이 코드에는 없었는지를 두 함수를 나란히 놓고 확인합니다.
GPU 한 장으로 언어모델을 처음부터 학습시켜 봅니다. TinyStories 데이터셋과 1,600만 파라미터짜리 디코더 전용 트랜스포머로 15분 만에 읽히는 영어 동화를 생성했습니다. 어텐션 마스크가 왜 필요한지, 가중치 묶기가 무엇을 절약하는지, perplexity 20이 실제로 어떤 문장을 뜻하는지를 실제 학습 로그와 생성 결과로 확인합니다. RTX 3090 실측 기준.
hidden_size, num_hidden_layers, num_attention_heads와 num_key_value_heads, head_dim, intermediate_size, rope_theta, vocab_size, tie_word_embeddings까지 config.json의 모든 필드가 메모리와 속도에 어떻게 나타나는지 설명하고, Qwen3-8B와 Mixtral-8x7B의 파라미터 수를 손으로 세어 공개된 텐서 수와 정확히 일치시키는 과정을 보여줍니다.
AI와 ML을 실무에서 다루는 한국어 글 중에서 구체적이고 재현 가능한 14편을 골랐습니다. LangChain RAG 파이프라인 전 과정, 임베딩과 벡터 유사도로 본 의미 검색의 원리, 벡터 데이터베이스 일곱 종 비교, pgvector에서 Qdrant로 옮긴 마이그레이션 기록, Ollama에서 vLLM으로 옮겨 처리량을 끌어올린 과정, LLM 서빙 지표의 트레이드오프, 사용량 추적기 자작기, 트랜스포머 논문 리뷰와 코드 구현, BERT 정리, 그리고 AI 네이티브 조직 9개월 정리와 MCP 인증 흐름까지 다룹니다. 순위표가 아니라 편집자의 선택이며 모든 링크는 2026년 8월 12일에 직접 열어 확인했습니다.
왜 Transformer에 위치 정보가 필요한지부터 시작해 sinusoidal, learned, 상대 위치 인코딩, 그리고 RoPE와 ALiBi를 단계적으로 설명합니다. 길이 외삽과 컨텍스트 확장(NTK, YaRN), 멀티모달의 M-RoPE까지 연결하고 흔한 함정을 정리합니다.
Transformer의 self-attention, 멀티헤드, 위치 인코딩, FFN, 잔차 연결과 정규화를 처음부터 분해해 설명합니다. 텐서 shape와 파라미터 수 계산, causal mask, 인코더/디코더 구조, 그리고 추론 단계의 KV cache까지 연결해 전체 그림을 그립니다.
스탠퍼드 CS336(Language Modeling from Scratch)이 해커뉴스 상위권에 오르며 from-scratch LLM 학습이 다시 화제입니다. 토크나이저부터 어텐션, 분산 학습, 스케일링 법칙, 정렬, 추론 최적화까지 전체 커리큘럼을 해부하고 20주 학습 플랜과 미니 프로젝트 아이디어를 정리했습니다.
2026년 파운데이션 모델 세계는 더 이상 Transformer 일변도가 아니다. Vaswani의 2017년 "Attention is All You Need"는 여전히 표준이지만, 그 옆에 Mamba/Mamba 2 같은 상태공간 모델(SSM), RWKV/RetNet/Griffin 같은 선형 RNN 재발견 진영, AI21 Jamba와 Falcon Mamba 같은 하이브리드, Sepp Hochreiter의 xLSTM, Test-Time Training, Sora의 DiT, Mixtral/DeepSeek-V3 671B/Google Million Experts 같은 MoE, Flash Attention 3와 Ring Attention, 그리고 Gemini 2M/Magic LTM-2-mini 100M의 초장문 컨텍스트까지 — 어떤 아키텍처가 어떤 문제에 강한지, 한국과 일본 진영은 무엇을 만들고 있는지 한 번에 정리.
2017년 Attention Is All You Need에서 2026년 Titans와 DeepSeek-R1까지, LLM 시대를 만든 50여 편의 랜드마크 논문을 테마별로 정리한다. Transformer · BERT · GPT 시리즈 · Scaling Laws · Chinchilla · InstructGPT · PaLM · Flash Attention 1/2/3 · LLaMA 1/2/3/4 · GPT-4 · Mistral · Mixtral · DPO · KTO · ORPO · RWKV · Mamba 1/2 · DeepSeek-V3 · DeepSeek-R1 · o1 · Titans · TTT · Era of Experience · Tülu 3 · Sleeper Agents · Scaling Monosemanticity · Mixture of a Million Experts · RoPE · YARN · Ring Attention · GPTQ · AWQ · BitNet b1.58 · DDPM · DiT · MMR1까지, 각 논문의 기여와 영향을 1단락 단위로 정리하고 실제 arxiv URL을 함께 제공한다. PR12, Tunib 잎차이, 일본 Connpass 論文読み会, PFN 블로그 등 한일 리딩 그룹 자료까지 묶어 2026년 5월 기준 가장 압축된 LLM 논문 로드맵을 만든다.
LLM 분야의 진짜 변화는 어떤 논문에서 시작됐는가. 2017년 Attention is All You Need부터 2026년의 추론 모델까지, 반드시 알아야 할 랜드마크 논문 20여 편을 시기·주제별로 정리한다. 각 논문은 '왜 중요한가·한 줄 요약·후속 영향'으로 압축하고, arXiv·블로그 링크를 끝에 모았다. 시간 부족한 엔지니어를 위한 LLM 논문 지도.
LLaMA 3, GPT-4, Claude 같은 대형 모델을 효율적으로 훈련하고 서빙 가능하게 만든 핵심 최적화, FlashAttention과 그 후속 기법들. 이 글은 efficient attention을 처음부터 해부합니다. Naive attention의 O(N²) 메모리 문제, Tri Dao의 2022년 IO-aware 통찰, Tiling과 Online Softmax, SRAM vs HBM 활용, FlashAttention-2/3의 진화, PagedAttention(vLLM)이 KV cache를 OS 가상 메모리처럼 다룬 이유, Multi-Query/Grouped-Query Attention, Sliding Window, Ring Attention까지 — 현대 LLM 인프라의 성능 비밀을 제대로 이해하고 싶은 엔지니어를 위한 종합 가이드입니다.
LLM을 "프롬프트에 답하는 블랙박스"로만 쓰면 임계점에서 막힌다. Transformer의 Attention이 실제로 어떻게 토큰 관계를 계산하는지, Pre-training → SFT → RLHF → DPO 파이프라인이 왜 이 순서로 설계됐는지, RAG 1/2/3세대의 차이와 Agentic RAG의 본질, Agent 설계(ReAct, Plan-and-Execute, Multi-Agent)의 근본 패턴, 그리고 LLM 평가가 왜 미해결 문제인지까지 — 블랙박스를 뜯어보는 한 편. Season 2의 여섯 번째, 2025년 엔지니어의 필수 교양.
ChatGPT, Claude, Gemini의 공통 기반인 Transformer를 완전 분석. Attention 메커니즘, positional encoding, multi-head, encoder vs decoder, GPT와 BERT의 차이까지 — Transformer의 모든 것을 720줄로 수학과 함께 파헤친다.
LLM의 롱 컨텍스트 처리를 가능하게 하는 KV Cache의 원리부터 메모리 소비 분석, MQA·GQA·PagedAttention·슬라이딩 윈도우·Ring Attention 등 최적화 기법, 모델별 컨텍스트 윈도우 비교, Needle-in-a-Haystack 벤치마크까지 실무 관점에서 포괄적으로 다룹니다.
Mamba(Selective State Space Models) 논문을 심층 리뷰한다. S4에서 Mamba까지의 발전 과정, Selective Scan 메커니즘, Hardware-Aware 알고리즘, 그리고 Mamba-2의 State Space Duality까지 코드와 함께 분석.
Google의 BERT 논문을 심층 분석한다. Masked Language Model(MLM)과 Next Sentence Prediction(NSP)을 통한 양방향 사전학습, Fine-tuning 전략, 그리고 11개 NLP 벤치마크를 석권한 아키텍처의 핵심 원리를 수식과 코드 예제로 정리한다.
Google의 ViT 논문을 심층 분석한다. 이미지를 패치 시퀀스로 변환하는 혁신적 접근, Patch Embedding과 Position Embedding의 원리, CNN 대비 성능과 데이터 효율성 트레이드오프, 그리고 DeiT, Swin Transformer, BEiT 등 후속 연구까지 총정리한다.