Skip to content

On-device-ai

  • Published on
    UC Santa Cruz 팀이 2026년 5월에 공개한 LlamaWeb은 llama.cpp의 WebGPU 백엔드로, 8개 벤더의 기기 16대에서 브라우저 LLM 추론을 실측한 지금까지 가장 넓은 데이터셋을 남겼습니다. 결과는 양면적입니다. 기존 브라우저 프레임워크(WebLLM, Transformers.js)보다 메모리를 29~33% 덜 쓰고 디코드 처리량은 45~69% 높지만, prefill은 WebLLM의 49% 수준에 머물고, 네이티브 CUDA 대비 prefill 최대 10배 디코드 2.5배가 여전히 벌어져 있습니다. 병목의 정체가 흥미로운데, 텐서 코어를 여는 subgroup matrix 기능이 어느 stable 브라우저에도 없기 때문입니다 — 네이티브로 그 기능을 켜면 같은 코드가 prefill에서 WebLLM을 88% 앞섭니다. 이 글은 그 숫자들이 어디서 나왔는지, 브라우저의 진짜 제약이 왜 VRAM이 아니라 탭 메모리인지, 안전 검사와 양자화가 각각 얼마를 청구하는지, 그리고 언제 이걸 쓰면 안 되는지를 정리합니다.
  • Published on
    애플 실리콘 수석 프로덕트 매니저 더그 브룩스가 The Deep View 인터뷰에서 Mac mini와 Mac Studio에 대한 수요와 온디바이스 AI의 방향을 이야기했습니다. 개발자들이 왜 이 작은 데스크톱을 로컬 LLM·에이전트 머신으로 고르는지, 통합 메모리 구조의 진짜 이점은 무엇인지, 그리고 CUDA 생태계 격차와 최근 가격 인상이라는 정직한 트레이드오프까지 — 임원의 발언을 그대로 인용하되 마케팅은 걷어내고 정리합니다.