전문가 혼합 계층의 config 필드를 실제 모델로 읽습니다. Mixtral의 8개 중 2개, Qwen3의 128개 중 8개, DeepSeek-V3의 256개 라우팅 전문가와 공유 전문가, Kimi K2의 희소도 48을 비교하고, 활성 파라미터와 전체 파라미터가 왜 다른 비용을 만드는지, 로드 밸런싱 손실과 보조 손실 없는 편향 방식이 무엇을 맞바꾸는지 정리합니다.
텍스트 LLM 기술 리포트 9편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. DeepSeek-V3와 DeepSeek-R1, Qwen3, Gemma 3, Olmo 3, Kimi K2, MiniMax-01, Mellum2, s1이 각각 무엇을 새로 했고 저자들이 어떤 한계를 스스로 밝혔는지 읽습니다. 모델 순위는 다루지 않습니다. 리더보드는 계속 바뀌고 리포트의 점수는 대부분 자체 보고이기 때문입니다. 영역별 최신 기술 리포트 읽기 시리즈 1편.
2026년 8월 기준 허깅페이스 상위권에 올라 있는 오픈 웨이트 모델들의 카드와 기술 보고서를 읽고, 데이터 수집부터 양자화 배포까지 제작 파이프라인을 순서대로 정리했습니다. MoE 희소성이 20배를 넘어선 이유, 전역 어텐션을 줄이는 네 가지 접근, 사전학습 토큰 예산과 안정화 기법, SFT 이후의 선호 최적화와 강화학습, 그리고 증류와 저비트 배포까지 실제 모델을 예시로 다룹니다. 중요한 전제를 먼저 밝히면, 대부분의 오픈 웨이트 릴리스는 학습 데이터 구성을 공개하지 않습니다. 어느 곳이 실제로 공개했고 어느 주장이 만든 쪽의 자체 측정인지 문단마다 구분해 적었습니다.
2026년 7월 31일 DeepSeek이 V4-Flash API를 공개 베타로 전환했습니다. 아키텍처는 4월의 프리뷰와 동일한 284B 총 파라미터 · 13B 활성 MoE에 1M 컨텍스트이고, 바뀐 것은 사후학습뿐입니다. 공식 체인지로그가 공개한 점수는 Terminal Bench 2.1에서 82.7, Toolathlon verified 70.3인데, 이 숫자들은 DeepSeek이 자사 하네스로 잰 벤더 자체 측정이라는 점을 먼저 짚어야 합니다. 이 글은 순위표 대신 능력당 단가를 계산합니다 — 캐시 적중 입력이 100만 토큰당 0.0028달러라는 항목이 왜 헤드라인 가격보다 중요한지, 출력 대 입력 배수가 2배인 가격표가 추론 워크로드에서 어떻게 6배짜리 가격표를 앞지르는지, 그리고 어떤 트래픽을 여기로 보내고 어떤 트래픽은 보내면 안 되는지를 정리합니다.
2026년 7월 29일 Show HN에 올라온 TurboFieldfare는 Gemma 4 26B-A4B를 M 시리즈 맥에서 약 2GB 램으로 돌린다고 주장합니다. 디스크에는 14.3GB가 깔리고, 램에 상주하는 것은 1.35GB짜리 공유 코어뿐이며, 토큰마다 필요한 전문가 가중치를 SSD에서 읽어 옵니다. 이 글은 그 숫자들을 직접 유도해 검증합니다 — 4비트 그룹 64 양자화가 왜 가중치당 4.5비트가 되어 14.2GB로 떨어지는지, 라우티드 전문가와 공유 코어의 분리에서 1.35GB가 정확히 나오는지, 토큰당 800MB가 필요한데 실측이 250~320MB인 것이 왜 캐시 적중률 60~69%를 뜻하는지를 계산합니다. 그리고 M5 Pro의 실측 처리량이 순수 SSD 대역폭 상한을 넘는다는 사실에서, 2GB라는 숫자가 프로세스 상주 메모리일 뿐 실제 워킹셋이 아니라는 결론을 끌어냅니다.
colibrì는 순수 C 약 1,300줄로 작성된 추론 엔진으로, 744B(7,440억) 파라미터 MoE 모델인 GLM-5.2를 램 25GB짜리 소비자용 PC에서 돌립니다. 핵심은 MoE 희소성과 디스크 스트리밍입니다 — 밀집 레이어 약 9.9GB만 램에 상주시키고, 약 370GB의 라우팅 전문가는 NVMe SSD에 두고 토큰마다 필요한 것만 읽습니다. 대가는 정직하게 느립니다: 콜드 상태 약 0.05–0.1 tok/s, 사실상 문단당 몇 분. 학습 캐시와 MTP 추측 디코딩, int4·int8 양자화로 그 느림을 갉아먹습니다. 이 글은 colibrì가 실제로 무엇을 하는지, 무엇이 그걸 견딜 만하게 만드는지, 그리고 작은 기계로 큰 모델을 돌리는 일이 언제 값어치가 있는지를 정리합니다.
Tencent이 2026년 7월 6일 Hy3를 Apache 2.0으로 공개했다. 총 295B 중 21B만 활성화되는 MoE 추론·에이전트 언어 모델이다. 무엇이 실제로 새로운지, 중국계 오픈 웨이트 흐름에서 어디에 놓이는지, 그리고 벤더가 직접 낸 벤치마크 숫자를 어디까지 믿어야 하는지 정리했다.
2026년 파운데이션 모델 세계는 더 이상 Transformer 일변도가 아니다. Vaswani의 2017년 "Attention is All You Need"는 여전히 표준이지만, 그 옆에 Mamba/Mamba 2 같은 상태공간 모델(SSM), RWKV/RetNet/Griffin 같은 선형 RNN 재발견 진영, AI21 Jamba와 Falcon Mamba 같은 하이브리드, Sepp Hochreiter의 xLSTM, Test-Time Training, Sora의 DiT, Mixtral/DeepSeek-V3 671B/Google Million Experts 같은 MoE, Flash Attention 3와 Ring Attention, 그리고 Gemini 2M/Magic LTM-2-mini 100M의 초장문 컨텍스트까지 — 어떤 아키텍처가 어떤 문제에 강한지, 한국과 일본 진영은 무엇을 만들고 있는지 한 번에 정리.
HuggingFace 트렌딩 논문 TOP 10과 2025년 AI 연구 10대 트렌드를 개발자 관점에서 리뷰합니다. DeepSeek-R1의 순수 RL 추론, Nemotron-Cascade 30B/3B MoE, GRPO, vLLM PagedAttention, 100만 토큰 컨텍스트의 한계, 비디오 생성 벤치마크까지.