MHA, MQA, GQA, MLA를 실제 config 값으로 비교합니다. Qwen3, Mixtral, GLM-4.5의 그룹 쿼리 어텐션과 DeepSeek-V3, Kimi K2의 잠재 어텐션이 토큰당 KV 캐시를 몇 배 줄이는지 공식과 숫자로 계산하고, 그 대가로 무엇을 내주는지 정리합니다.
hidden_size, num_hidden_layers, num_attention_heads와 num_key_value_heads, head_dim, intermediate_size, rope_theta, vocab_size, tie_word_embeddings까지 config.json의 모든 필드가 메모리와 속도에 어떻게 나타나는지 설명하고, Qwen3-8B와 Mixtral-8x7B의 파라미터 수를 손으로 세어 공개된 텐서 수와 정확히 일치시키는 과정을 보여줍니다.
전문가 혼합 계층의 config 필드를 실제 모델로 읽습니다. Mixtral의 8개 중 2개, Qwen3의 128개 중 8개, DeepSeek-V3의 256개 라우팅 전문가와 공유 전문가, Kimi K2의 희소도 48을 비교하고, 활성 파라미터와 전체 파라미터가 왜 다른 비용을 만드는지, 로드 밸런싱 손실과 보조 손실 없는 편향 방식이 무엇을 맞바꾸는지 정리합니다.
RMSNorm과 프리노름, SwiGLU가 왜 지금의 표준이 되었는지 config 값으로 확인하고, Qwen3의 QK-Norm과 Kimi K2의 QK-Clip처럼 어텐션 로짓 폭주를 막는 최신 장치를 실제 리포트의 수치와 함께 정리합니다. 안정성을 위해 무엇을 추가하고 무엇을 감수하는지 다룹니다.
rope_theta 하나가 문맥 길이에 어떻게 작용하는지 파장 계산으로 보여 주고, Llama 3의 500000, Qwen3의 ABF, DeepSeek-V3와 Kimi K2의 YaRN 설정, GLM-4.5의 부분 회전을 실제 config로 비교합니다. 긴 컨텍스트가 왜 공짜가 아닌지 프리필 연산량과 캐시 비용으로 정리합니다.
바이트 수준 BPE가 어떻게 동작하는지 설명하고, Qwen3와 DeepSeek-V3, Mixtral의 실제 토크나이저 파일을 내려받아 같은 뜻의 영어와 한국어 문장을 직접 토큰화해 비교합니다. 어휘 크기의 트레이드오프, config의 vocab_size와 실제 어휘 수가 다른 이유, 그리고 토큰 수가 비용과 문맥 창에 미치는 영향을 정리합니다.
벤치마크 방법론 논문 열두 편을 arXiv 원문 초록에서 직접 확인해, 리더보드 숫자를 어떻게 읽어야 하는지 정리했습니다. 데이터 오염, 프롬프트 형식 민감도, 평가 하네스 차이, 자체 보고, 리더보드의 표집 비대칭, LLM 심사자의 편향, 그리고 오차 막대를 붙이는 통계적 접근까지 다룹니다. 영역별 최신 기술 리포트 읽기 시리즈의 마지막 편이자, 앞선 다섯 편을 읽는 방법에 대한 안내입니다.
이미지 생성과 이해 기술 리포트 열한 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. 정류 흐름 트랜스포머와 VAR, Emu3, SANA, Janus-Pro, FLUX.1 Kontext, Qwen-Image 계열, Seedream 4.0, Z-Image와 Mage-Flow, InternVL3, 그리고 평가 쪽 Qwen-Image-Bench까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 영역별 최신 기술 리포트 읽기 시리즈 5편.
텍스트 LLM 기술 리포트 9편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. DeepSeek-V3와 DeepSeek-R1, Qwen3, Gemma 3, Olmo 3, Kimi K2, MiniMax-01, Mellum2, s1이 각각 무엇을 새로 했고 저자들이 어떤 한계를 스스로 밝혔는지 읽습니다. 모델 순위는 다루지 않습니다. 리더보드는 계속 바뀌고 리포트의 점수는 대부분 자체 보고이기 때문입니다. 영역별 최신 기술 리포트 읽기 시리즈 1편.
OCR과 문서 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Donut과 Nougat에서 GOT-OCR2.0, olmOCR, DeepSeek-OCR과 그 후속, GLM-OCR, Qianfan-OCR, MinerU2.5-Pro, HunyuanOCR-1.5까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 문서 파싱 점수는 벤치마크 버전과 채점 방식에 특히 민감하기 때문입니다. 영역별 최신 기술 리포트 읽기 시리즈 2편.
음성 인식과 합성 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Whisper와 Omnilingual ASR, Qwen3-ASR, Open ASR Leaderboard, Seed-TTS와 F5-TTS, CosyVoice 2, Qwen3-TTS, Fish Audio S2, Moshi, Qwen2.5-Omni와 MOSS-Audio가 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위 대신 지연, 언어 커버리지, 스트리밍 제약을 봅니다. 영역별 최신 기술 리포트 읽기 시리즈 4편.
비디오 생성과 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. CogVideoX, Movie Gen, HunyuanVideo, LTX-Video, Wan, Seedance 1.0과 2.0, 그리고 이해 쪽의 Qwen2.5-VL, VideoLLaMA 3, HY-Himmel까지 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않고, 대신 길이·해상도·토큰 예산 같은 실제 제약을 봅니다. 영역별 최신 기술 리포트 읽기 시리즈 3편.
3D 비전의 SOTA 흐름을 정리합니다. 단안 깊이 추정(상대·미터 깊이)과 Depth Anything 계열의 개념, 스테레오·MVS 개요, 그리고 NeRF에서 3D 가우시안 스플래팅으로 이어지는 실시간 렌더링의 발전을 표현·학습·응용 관점에서 아키텍처 원리 중심으로 살펴봅니다.
오디오 표현(파형·스펙트로그램·뉴럴 코덱)부터 오토리그레시브 오디오 언어모델과 확산 기반 오디오, 텍스트-음악 조건화까지 계보 중심으로 정리합니다. EnCodec, MusicGen, AudioLM 계열의 원리와 상용 모델, 평가·저작권 쟁점을 아키텍처 관점에서 분석합니다.
객체 검출과 이미지 분할의 SOTA 계보를 정리합니다. 2단계 R-CNN에서 1단계 YOLO/SSD, 트랜스포머 기반 DETR로 이어지는 검출의 흐름과, 시맨틱·인스턴스·판옵틱 분할, 그리고 프롬프트 가능 분할을 연 Segment Anything(SAM)까지 아키텍처 원리 중심으로 살펴봅니다.
휴머노이드 로봇이 두 발로 걷고 손으로 물건을 다루기까지, 이족보행 제어와 전신 제어(whole-body control)의 핵심 개념을 정리합니다. ZMP와 MPC, 강화학습 기반 로코모션, 균형과 낙상 회복, 보행과 조작의 통합, 그리고 시뮬레이션 학습을 실물로 옮기는 흐름을 다이어그램과 함께 살펴봅니다.
하나의 정책으로 여러 로봇, 여러 작업을 해내려는 로봇 파운데이션 모델의 흐름을 정리합니다. 제너럴리스트 정책의 개념, Open X-Embodiment 같은 대규모 로봇 데이터, 크로스 임바디먼트, VLA와의 관계, 스케일링 관점, 그리고 데이터·안전·평가라는 과제를 다이어그램과 함께 살펴봅니다.
이산 액션 토큰의 한계를 넘어, 행동을 연속값으로 생성하는 두 흐름을 살펴봅니다. Diffusion Policy는 행동을 디노이징으로 생성하고, π0는 flow-matching으로 고주파 연속 액션을 만듭니다. 두 접근의 아이디어, 아키텍처, 제어 주파수, 강점과 한계를 정리합니다.
휴머노이드 로봇을 위한 VLA는 빠른 반사와 느린 사고를 함께 갖춰야 합니다. NVIDIA GR00T N1과 Figure AI Helix를 중심으로, 빠른 저수준 제어(System 1)와 느린 계획(System 2)을 결합하는 듀얼 시스템 아키텍처, 학습 방식, 과제와 전망을 정리합니다.
2026년의 AI 하드웨어 연구 흐름을 논문 단위로 훑어봅니다. 웨이퍼스케일과 포토닉스, 인메모리 컴퓨팅, FP4 저정밀 학습, 희소성과 MoE 하드웨어, 광 인터커넥트, 차세대 메모리, 뉴로모픽, 하드웨어-소프트웨어 공동설계까지 핵심 아이디어와 의의, 한계를 정리합니다.
2017년 Attention Is All You Need에서 2026년 Titans와 DeepSeek-R1까지, LLM 시대를 만든 50여 편의 랜드마크 논문을 테마별로 정리한다. Transformer · BERT · GPT 시리즈 · Scaling Laws · Chinchilla · InstructGPT · PaLM · Flash Attention 1/2/3 · LLaMA 1/2/3/4 · GPT-4 · Mistral · Mixtral · DPO · KTO · ORPO · RWKV · Mamba 1/2 · DeepSeek-V3 · DeepSeek-R1 · o1 · Titans · TTT · Era of Experience · Tülu 3 · Sleeper Agents · Scaling Monosemanticity · Mixture of a Million Experts · RoPE · YARN · Ring Attention · GPTQ · AWQ · BitNet b1.58 · DDPM · DiT · MMR1까지, 각 논문의 기여와 영향을 1단락 단위로 정리하고 실제 arxiv URL을 함께 제공한다. PR12, Tunib 잎차이, 일본 Connpass 論文読み会, PFN 블로그 등 한일 리딩 그룹 자료까지 묶어 2026년 5월 기준 가장 압축된 LLM 논문 로드맵을 만든다.
LLM 정렬 기술의 핵심 논문들을 심층 분석합니다. InstructGPT의 RLHF 파이프라인, Anthropic의 Constitutional AI, DPO의 수학적 기반, PPO 학습 안정성, 그리고 KTO/IPO/ORPO 등 최신 연구까지 체계적으로 비교하고 실무 적용 방안을 정리합니다.
Retrieval-Augmented Generation(RAG) 연구의 진화를 논문 중심으로 추적합니다. 초기 RAG(Lewis et al.)부터 RETRO의 대규모 검색, Self-RAG의 자기 반성, Corrective-RAG의 검색 품질 평가까지 핵심 아키텍처와 벤치마크를 비교 분석합니다.
Test-Time Scaling(TTS)은 학습 파라미터를 늘리지 않고 추론 시점의 계산 예산을 늘려 성능을 높이는 접근이다. 이 글은 Best-of-N, Self-Consistency, Tree Search, Verifier/Reranker 기반 방법을 논문 맥락과 실무 적용 관점에서 정리한다.
Scalable Diffusion Models with Transformers(DiT) 논문을 분석합니다. U-Net 기반 디퓨전 모델의 한계를 넘어 Transformer 백본으로 전환한 배경, adaLN-Zero 조건화, 스케일링 법칙, SORA/DALL-E 3로의 영향까지 다룹니다.
Google의 BERT 논문을 심층 분석한다. Masked Language Model(MLM)과 Next Sentence Prediction(NSP)을 통한 양방향 사전학습, Fine-tuning 전략, 그리고 11개 NLP 벤치마크를 석권한 아키텍처의 핵심 원리를 수식과 코드 예제로 정리한다.
Ian Goodfellow의 GAN 원본 논문부터 DCGAN, WGAN, Progressive GAN, StyleGAN까지 — 생성적 적대 신경망의 핵심 이론인 minimax 게임, Nash 균형, 학습 불안정성 해결법을 수식과 함께 분석하고, GAN 계보의 진화를 총정리한다.
Microsoft의 ResNet 논문을 심층 분석한다. Degradation 문제의 발견, Skip Connection의 수학적 원리, Bottleneck 구조, ImageNet ILSVRC 2015 우승 아키텍처를 수식과 코드로 정리하고 ResNet이 현대 딥러닝에 미친 영향을 조망한다.
Meta AI의 Segment Anything Model(SAM) 시리즈를 완전 정복한다. SAM 1(이미지 프롬프터블 세그멘테이션), SAM 2(비디오 실시간 세그멘테이션), SAM 3(개념 인식 세그멘테이션)까지 아키텍처, 데이터셋, 핵심 혁신, 성능 벤치마크, 그리고 설치·실행 방법을 총정리한다.
Google의 ViT 논문을 심층 분석한다. 이미지를 패치 시퀀스로 변환하는 혁신적 접근, Patch Embedding과 Position Embedding의 원리, CNN 대비 성능과 데이터 효율성 트레이드오프, 그리고 DeiT, Swin Transformer, BEiT 등 후속 연구까지 총정리한다.