- Published on
UC Santa Cruz 팀이 2026년 5월에 공개한 LlamaWeb은 llama.cpp의 WebGPU 백엔드로, 8개 벤더의 기기 16대에서 브라우저 LLM 추론을 실측한 지금까지 가장 넓은 데이터셋을 남겼습니다. 결과는 양면적입니다. 기존 브라우저 프레임워크(WebLLM, Transformers.js)보다 메모리를 29~33% 덜 쓰고 디코드 처리량은 45~69% 높지만, prefill은 WebLLM의 49% 수준에 머물고, 네이티브 CUDA 대비 prefill 최대 10배 디코드 2.5배가 여전히 벌어져 있습니다. 병목의 정체가 흥미로운데, 텐서 코어를 여는 subgroup matrix 기능이 어느 stable 브라우저에도 없기 때문입니다 — 네이티브로 그 기능을 켜면 같은 코드가 prefill에서 WebLLM을 88% 앞섭니다. 이 글은 그 숫자들이 어디서 나왔는지, 브라우저의 진짜 제약이 왜 VRAM이 아니라 탭 메모리인지, 안전 검사와 양자화가 각각 얼마를 청구하는지, 그리고 언제 이걸 쓰면 안 되는지를 정리합니다.