CNN 인코더와 트랜스포머 디코더를 이어 붙여 Fashion-MNIST 이미지에 캡션을 다는 모델을 만들었습니다. 137만 파라미터, 10분 학습으로 라벨 적중률 91%가 나왔습니다. 인코더-디코더 구조에서 cross-attention이 무엇을 하는지, 그리고 3편에서 정확도를 7.5%로 떨어뜨렸던 EOS 버그가 왜 이 코드에는 없었는지를 두 함수를 나란히 놓고 확인합니다.
이미지와 질문을 함께 받아 답하는 VQA 모델을 148만 파라미터로 만들었습니다. 학습 손실은 0.0017까지 떨어졌는데 정확도는 7.5%였습니다. 무작위보다 나쁜 수치였죠. 원인은 모델이 아니라 정답을 만드는 코드 한 줄이었고, 고치자 99.5%가 됐습니다. 왜 낮은 손실이 좋은 모델을 보장하지 않는지, 그리고 그 함정을 어떻게 알아채는지를 실제 출력으로 확인합니다.
이미지 생성과 이해 기술 리포트 열한 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. 정류 흐름 트랜스포머와 VAR, Emu3, SANA, Janus-Pro, FLUX.1 Kontext, Qwen-Image 계열, Seedream 4.0, Z-Image와 Mage-Flow, InternVL3, 그리고 평가 쪽 Qwen-Image-Bench까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 영역별 최신 기술 리포트 읽기 시리즈 5편.
비전 모델은 하나의 범주가 아닙니다. 대화형 VLM, OCR 전용, 문서 구조화, 이미지 검색용 임베딩은 서로 다른 물건이고 대체되지 않습니다. 이 글은 2026-08-12에 확인한 각 범주의 오픈 모델 카드 값을 정리하고, 해상도와 다중 이미지 처리 같은 실제 제약, 그리고 카드가 명시한 금지 용도를 함께 다룹니다. 오픈 모델 가이드 시리즈 6편입니다.
텍스트·이미지·에이전트는 같은 "성능"이라는 단어를 쓰지만 측정 구조가 전혀 다릅니다. 텍스트는 정답이 있는 척하는 객관식과 정답이 없는 생성형으로 갈라지고, 이미지는 분포 거리와 사람 판단이 어긋나며, 에이전트는 부분 성공·환경 상태·비결정성 때문에 애초에 하나의 숫자로 압축되지 않습니다. 이 글은 각 영역의 대표 지표가 실제로 계산하는 값을 정의 수준에서 뜯어보고, 영역마다 "지표는 높은데 실제로는 나쁜" 사례를 하나씩 붙였습니다. 마지막에 영역·과제·지표·놓치는 것을 한 장의 표로 정리합니다.
이미지와 오디오, 비디오를 어떻게 토큰으로 바꾸고 텍스트와 하나의 시퀀스로 엮는지 정리합니다. 패치·VQ 기반 이미지 토큰화, 이산 코덱 오디오 토큰화, 프레임 샘플링, 인터리빙과 구분 토큰, 토큰 폭증과 압축, 컨텍스트 비용까지 멀티모달 LLM의 입력 구성을 깊이 다룹니다.
2026년 5월 기준 비전-언어 모델(VLM)의 모든 것을 한 글에 담는다. CLIP 계열(SigLIP, EVA-CLIP)부터 오픈 VLM(LLaVA-NeXT, InternVL3, Qwen2.5-VL, Pixtral, Molmo, Idefics3, MiniCPM-V), 폐쇄형(GPT-4o, Claude 4.7, Gemini 2.5), 비전 파운데이션(DINOv2/v3, SAM 2, Florence-2), 학습 레시피, 평가(MMMU, MathVista, ChartQA, DocVQA), OCR-centric VLM, 비디오 VLM, vLLM/SGLang 서빙, 그리고 한국·일본 VLM 씬까지 깊이 정리한다.
텍스트만 다루던 시대가 끝났다. 2025년 LLM은 이미지·문서·영상·오디오를 자연스럽게 처리한다. GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtral 비교, Document AI와 레이아웃 이해, OCR의 현대화, 비디오·오디오, 한국어 문서 특수성, 그리고 멀티모달 RAG까지. 실전 케이스로 정리한 한 편.
HuggingFace 트렌딩 논문 TOP 10과 2025년 AI 연구 10대 트렌드를 개발자 관점에서 리뷰합니다. DeepSeek-R1의 순수 RL 추론, Nemotron-Cascade 30B/3B MoE, GRPO, vLLM PagedAttention, 100만 토큰 컨텍스트의 한계, 비디오 생성 벤치마크까지.