들어가며 — 트렌딩 1페이지의 절반은 새 모델이 아닙니다
2026년 8월 2일에 허깅페이스 트렌딩 목록 첫 화면을 열면 서른 개 남짓한 저장소가 보입니다. 그중 절반가량은 새로 학습된 모델이 아닙니다. 남이 만든 가중치를 GGUF로 변환해 올린 것, 커뮤니티가 성격을 바꾼 파인튜닝, 그리고 사실상 미러입니다.
이게 나쁘다는 얘기가 아닙니다. 양자화 재업로드가 없으면 노트북에서 27B 모델을 돌릴 수 없습니다. 문제는 이 목록을 "요즘 뜨는 모델 순위"로 읽으면 판단이 어긋난다는 점입니다. 어떤 조직이 무엇을 만들었는지, 그 모델이 어디에 쓰이는지, 라이선스가 무엇인지가 목록 위에서는 전부 뭉개져 보입니다.
이 글은 순위표를 옮겨 적지 않습니다. 대신 용도별로 나눠서 실제로 배포에 올리게 되는 모델들을 정리하고, 각각에 대해 만든 곳과 규모, 라이선스, 그리고 쓰기 전에 알아야 할 제약을 적었습니다. 먼저 원본과 파생본을 구별하는 방법부터 시작합니다. 이걸 익혀 두면 나머지 목록이 훨씬 잘 읽힙니다.
수치는 전부 조회 시점인 2026년 8월 2일에 허깅페이스 API와 모델 카드에서 직접 확인한 값입니다. 다운로드 수는 허깅페이스가 기본으로 노출하는 최근 30일 기준입니다. 누적 다운로드와는 다릅니다. 예컨대 Qwen3.6-27B는 30일 기준 657만, 누적 기준 1,880만입니다. 이 글의 표는 전부 30일 기준으로 통일했습니다.
트렌딩의 절반은 재업로드입니다 — 원본과 파생본 구별법
허깅페이스는 저장소 사이의 관계를 태그로 기록합니다. 모델 페이지 상단의 배지와 API의 태그 목록이 같은 값을 씁니다.
| 태그 형태 | 의미 | 페이지에 뜨는 문구 |
|---|---|---|
base_model:quantized:원본 | 원본을 양자화해 다시 올림 | Quantized from |
base_model:finetune:원본 | 원본을 추가 학습함 | Finetuned from |
base_model:adapter:원본 | LoRA 등 어댑터만 담음 | Adapter for |
base_model:merge:원본 | 여러 모델을 병합함 | Merge of |
| 태그 없음 | 원본 릴리스이거나 관계를 표기하지 않음 | 없음 |
여기서 주의할 점은 마지막 줄입니다. 태그가 없다고 원본이라는 보장은 없습니다. 업로더가 적지 않으면 안 붙습니다. 그래서 실무에서는 세 가지를 같이 봅니다.
첫째, 조직 계정을 봅니다. Qwen, deepseek-ai, moonshotai, google, microsoft, nvidia, upstage, LGAI-EXAONE, skt 같은 계정은 조직 인증 배지가 붙습니다. 개인 계정에 올라온 프런티어급 모델은 거의 항상 파생본입니다.
둘째, 파일 목록을 봅니다. 원본 릴리스에는 config.json, model.safetensors.index.json, tokenizer.json, chat_template.jinja가 함께 있습니다. GGUF 파일 몇 개만 있고 config.json이 없다면 변환본입니다.
셋째, 이름 규칙을 봅니다. -GGUF, -AWQ, -GPTQ, -NVFP4, -FP8, -INT4, -MLX, -ONNX 접미사는 사실상 전부 변환본입니다.
그런데 왜 파생본이 원본보다 많이 받아질까요. 이유가 몇 가지 겹칩니다. 원본은 보통 BF16 한 벌만 올라오는데 이건 GPU 여러 장이 필요합니다. 반면 GGUF 변환본은 노트북에서 돌아가니 개인 사용자 수가 압도적으로 많습니다. 게다가 GGUF 저장소는 양자화 등급별로 파일이 여러 개라 부분 다운로드가 잦고, MLX나 ONNX처럼 특정 런타임에 묶인 포맷은 그 생태계의 기본 경로가 됩니다.
실제 숫자로 보면 이렇습니다. 같은 날 조회한 최근 30일 다운로드입니다.
| 원본 | 원본 다운로드 | 파생본 | 파생본 다운로드 |
|---|---|---|---|
| Qwen/Qwen3.6-27B | 6,572,759 | prism-ml/Bonsai-27B-gguf | 2,510,237 |
| Qwen/Qwen3.6-27B | 6,572,759 | unsloth/Qwen3.6-27B-MTP-GGUF | 1,181,465 |
| moonshotai/Kimi-K3 | 559,924 | unsloth/Kimi-K3-GGUF | 41,337 |
| poolside/Laguna-S-2.1 | 77,021 | unsloth/Laguna-S-2.1-GGUF | 170,109 |
| upstage/Solar-Open2-250B | 13,426 | nota-ai/Solar-Open2-250B-Nota-NVFP4 | 22,396 |
| nvidia/parakeet-tdt-0.6b-v3 | 207,975 | mlx-community/parakeet-tdt-0.6b-v3 | 1,300,339 |
아래 세 줄에서는 파생본이 원본을 앞섭니다. parakeet의 경우 애플 실리콘용 MLX 변환본이 원본의 여섯 배 넘게 받아집니다. 원본 저장소의 다운로드 수를 "이 모델의 인기"로 읽으면 이 구조 때문에 크게 틀립니다.
선택에 미치는 영향은 세 가지입니다.
하나, 파생본은 원본의 수정을 자동으로 따라가지 않습니다. 원본 팀이 토크나이저나 채팅 템플릿을 고쳐 올려도 변환본은 그대로입니다. 릴리스 직후 몇 주 동안은 원본 커밋 이력을 확인하는 편이 안전합니다.
둘, 라이선스는 파생본에서 바뀌지 않습니다. 원본이 상업적 사용을 제한하면 GGUF 변환본도 똑같이 제한됩니다. 변환본 카드에 라이선스가 아예 없거나 애매하게 적힌 경우가 있는데, 이때 기준은 원본입니다.
셋, 품질이 검증된 파생본과 아닌 것의 차이가 큽니다. unsloth, mlx-community, ggml-org, RedHatAI 같은 계정은 변환 파이프라인이 공개돼 있고 회귀 확인 흔적이 남습니다. 이름에 형용사가 잔뜩 붙은 개인 병합본은 재현 가능한 평가가 없는 경우가 대부분입니다.
범용 LLM과 코딩 모델 — 프런티어급이 통째로 열렸습니다
지금 상위권은 1조 파라미터를 넘는 MoE 모델들이 차지하고 있습니다. 아래는 조회 시점의 트렌딩 상위에서 원본 릴리스만 추린 것입니다.
| 모델 | 만든 곳 | 규모 | 컨텍스트 | 라이선스 | 30일 다운로드 |
|---|---|---|---|---|---|
| moonshotai/Kimi-K3 | Moonshot AI | 2.8T / 활성 104B MoE | 1,048,576 | Kimi K3 License (자체) | 559,924 |
| deepseek-ai/DeepSeek-V4-Flash | DeepSeek | 284B / 활성 13B MoE | 1M | MIT | 2,814,414 |
| zai-org/GLM-5.2 | Z.ai | 카드에 미표기 | 1M | MIT | 1,683,442 |
| Qwen/Qwen3.6-27B | Qwen | 27B 밀집 + 비전 | 262,144 (확장 1,010,000) | Apache 2.0 | 6,572,759 |
| Qwen/Qwen3.6-35B-A3B | Qwen | 35B / 활성 3B MoE | 262,144 | Apache 2.0 | 5,939,238 |
| thinkingmachines/Inkling | Thinking Machines | 975B / 활성 41B MoE | 카드에 미표기 | Apache 2.0 | 59,076 |
| upstage/Solar-Open2-250B | Upstage | 250B / 활성 15B MoE | 1M | Upstage Solar License | 13,426 |
| skt/A.X-K2 | SK텔레콤 | 688B / 활성 33B MoE | 262,144 | Apache 2.0 | 1,218 |
| LGAI-EXAONE/K-EXAONE-2.0-750B-A37B | LG AI Research | 750B / 활성 37B MoE | 카드 참조 | Apache 2.0 | 101 |
몇 가지 짚어야 할 제약이 있습니다.
Kimi K3는 MIT가 아니라 자체 라이선스입니다. 라이선스 원문을 보면 사용, 수정, 재배포, 파인튜닝은 자유롭지만 두 개의 문턱이 있습니다. 모델 추론이나 파인튜닝을 제3자에게 제공하는 사업, 즉 카드가 정의하는 Model as a Service를 운영하면서 연속 12개월 합산 매출이 2천만 미국 달러를 넘으면 별도 계약이 필요합니다. 또 월간 활성 사용자 1억 명 또는 월 매출 2천만 달러를 넘는 제품에 쓰면 UI에 모델 이름을 표시해야 합니다. 사내 전용 사용에는 두 조건 모두 적용되지 않습니다. 대부분의 회사에는 사실상 무제한이지만, 라이선스를 확인하지 않고 "오픈소스"로 분류해 두면 나중에 곤란해집니다.
Solar Open 2도 비슷하되 방향이 다릅니다. Upstage Solar License는 아파치 2.0의 조항을 대부분 그대로 가져오면서 4조 (e)항을 추가했습니다. 이 모델로 파생 AI 모델을 만들어 배포하면 이름이 Solar로 시작해야 하고, 관련 웹사이트와 문서에 브랜드 문구를 표시해야 합니다. 상업적 사용 자체는 막지 않지만 브랜딩 의무가 붙습니다.
한국어 관점에서 눈여겨볼 만한 세 모델이 같은 시기에 나왔습니다. Upstage의 Solar Open 2는 한국어와 일본어를 명시적으로 지원하고 카드에 사전학습 토큰 약 12조 개, B200 기준 GPU 시간 200만 시간을 적어 두었습니다. SKT의 A.X K2는 688B / 활성 33B MoE이고, 카드가 밝힌 바로는 정부 소버린 AI 파운데이션 모델 사업의 일부입니다. LG AI Research의 K-EXAONE 2.0은 750B / 활성 37B이며 아파치 2.0으로 나왔습니다. 셋 모두 조회 시점 기준으로는 다운로드가 아직 적습니다. K-EXAONE 2.0은 101, A.X K2는 1,218입니다. 공개된 지 며칠 되지 않았기 때문이고, 이 숫자로 품질을 판단할 수는 없습니다.
Inkling은 규모에 비해 다운로드가 적은데(59,076), 975B / 활성 41B는 개인이 돌릴 수 있는 크기가 아니기 때문입니다. 같은 계정의 Inkling-Small과 그 NVFP4 변형이 함께 올라와 있고, 흥미롭게도 NVFP4 변형(25,352)이 원본 BF16(3,998)보다 여섯 배 넘게 받아집니다. 실제로 서빙에 올리는 사람은 저정밀도 쪽을 집는다는 뜻입니다.
코딩 쪽은 목적이 좀 더 좁습니다.
| 모델 | 만든 곳 | 규모 | 라이선스 | 30일 다운로드 | 제약 |
|---|---|---|---|---|---|
| poolside/Laguna-S-2.1 | poolside | 118B / 활성 8B | OpenMDW-1.1 | 77,021 | BF16 가중치만 약 236GB |
| Kwaipilot/KAT-Coder-V2.5-Dev | Kwaipilot | 35B / 활성 3B | Apache 2.0 | 10,771 | 공개판은 텍스트 전용, 비전 모듈 제외 |
| moonshotai/Kimi-K2.7-Code | Moonshot AI | 1T급 | 자체 | 665,880 | Kimi 계열 라이선스 확인 필요 |
Laguna S 2.1의 라이선스인 OpenMDW-1.1은 상업적 사용과 수정을 자유롭게 허용한다고 카드가 밝히고 있습니다. 다만 이 라이선스는 최근에 자리 잡은 것이라 사내 법무 검토 목록에 없을 가능성이 높습니다. 카드에 적힌 대로 48개 레이어 중 12개만 전역 어텐션이고 36개는 윈도 512짜리 슬라이딩 윈도인데, 1M 컨텍스트를 이 구조로 감당합니다.
KAT-Coder-V2.5-Dev는 카드가 직접 밝힌 제약이 중요합니다. 공개된 가중치는 언어 모델 부분만이고 비전 및 멀티모달 구성 요소는 포함되지 않아 텍스트 전용으로 동작합니다. 벤치마크 표는 전체 모델 기준이 아닌지 반드시 확인해야 하는 유형입니다.
임베딩과 리랭커 — 2년 전 모델이 아직 1위입니다
이 영역은 LLM과 완전히 다른 리듬으로 움직입니다. 신규 모델이 계속 나오지만 실사용 1위는 여전히 오래된 모델입니다.
| 모델 | 만든 곳 | 크기 | 라이선스 | 30일 다운로드 | 공개일 |
|---|---|---|---|---|---|
| sentence-transformers/all-MiniLM-L6-v2 | SBERT | 22M급 | Apache 2.0 | 251,140,343 | 2022-03 |
| BAAI/bge-m3 | BAAI | 카드 참조 | MIT | 34,621,449 | 2024-01 |
| Qwen/Qwen3-Embedding-0.6B | Qwen | 0.6B | Apache 2.0 | 9,801,487 | 2025-06 |
| google/embeddinggemma-300m | 0.3B | Gemma License | 1,911,651 | 2025-07 | |
| Qwen/Qwen3-Reranker-0.6B | Qwen | 0.6B | Apache 2.0 | 2,725,199 | 2025-05 |
| Alibaba-NLP/gte-reranker-modernbert-base | Alibaba NLP | 0.1B | Apache 2.0 | 2,386,616 | 2025-01 |
| microsoft/harrier-oss-v1-0.6b | Microsoft | 0.6B | MIT | 214,363 | 2026-03 |
| jinaai/jina-reranker-v3.5 | Jina AI | 0.6B | CC BY-NC 4.0 | 1,866 | 2026-07 |
MiniLM-L6-v2의 2억 5천만이라는 숫자는 성능 때문이 아닙니다. 수많은 라이브러리의 기본값으로 박혀 있고, CI가 돌 때마다 내려받기 때문입니다. 임베딩 영역의 다운로드 수는 품질 지표로 쓸 수 없습니다.
제약 두 가지가 실무에서 자주 걸립니다.
첫째, google/embeddinggemma-300m은 접근 승인이 필요한 저장소입니다. 조회 시점에 gated 값이 manual이라, 로그인하지 않고 카드 원문을 받으면 접근 제한 안내만 나옵니다. 젬마 라이선스에 동의해야 합니다. 도커 이미지 빌드 단계에서 토큰 없이 받으려다 실패하는 전형적인 지점입니다.
둘째, Jina AI의 최신 모델은 CC BY-NC 4.0입니다. 비상업 조건이 붙습니다. jina-reranker-v3.5도, jina-embeddings-v5-text-small도 마찬가지입니다. 성능 표만 보고 도입 결정을 내리면 배포 직전에 막힙니다. 상업 서비스라면 Qwen3-Reranker 계열이나 GTE 계열 같은 아파치 2.0 쪽으로 후보를 좁히는 편이 낫습니다.
Microsoft의 harrier-oss-v1은 MIT로 나온 다국어 임베딩 계열입니다. 카드가 밝힌 MTEB v2 점수는 270M이 66.5, 0.6B가 69.0, 27B가 74.3인데 이건 자체 보고 수치이고 릴리스 시점 기준이라고 명시돼 있습니다. 임베딩 교체는 인덱스 재구축을 동반하니, 카드 점수 대신 본인 데이터로 재현하고 결정하는 게 맞습니다. 재현 방법은 RAG 검색 품질을 디버깅하는 법과 임베딩 모델과 벡터 검색 실전 가이드에서 따로 다뤘습니다.
비전과 문서 — OCR과 컴퓨터 사용 에이전트
이 영역은 지금 두 갈래로 갈립니다. 하나는 문서를 텍스트로 바꾸는 OCR, 다른 하나는 화면을 보고 조작하는 에이전트입니다.
| 모델 | 만든 곳 | 크기 | 라이선스 | 30일 다운로드 | 용도 |
|---|---|---|---|---|---|
| baidu/Unlimited-OCR | Baidu | 3.3B | MIT | 2,457,387 | 문서 OCR |
| nvidia/LocateAnything-3B | NVIDIA | 3.8B | 자체 | 716,448 | 개방 어휘 위치 지정 |
| ATH-MaaS/OvisOCR2 | ATH | 0.9B | Apache 2.0 | 68,429 | 경량 OCR |
| microsoft/Mage-VL | Microsoft | 4.7B | Apache 2.0 | 10,525 | 범용 비전 언어 |
| microsoft/Fara1.5-27B | Microsoft | 27B | MIT | 2,775 | 브라우저 조작 에이전트 |
Unlimited-OCR은 카드 스스로 DeepSeek-OCR을 한 걸음 더 밀었다고 밝히고 있고, 논문이 함께 공개돼 있습니다. MIT에 3.3B라서 문서 파이프라인에 붙이기 좋은 조합입니다.
Fara1.5-27B는 성격이 특이합니다. Qwen3.5-27B를 지도학습 미세조정한 컴퓨터 사용 에이전트이고, DOM이나 접근성 트리를 보지 않고 스크린샷만으로 판단해 픽셀 좌표를 찍습니다. 카드가 굵게 경고하는 부분이 있는데, 마이크로소프트가 만든 하네스 안에서만 쓰라는 것입니다. 직접 통합하면 샌드박싱, 도메인 허용 목록, 감시 모드, 즉시 정지를 직접 구현할 책임이 사용자에게 넘어옵니다. 민감한 것이 있는 머신에서 브라우저 권한을 열어 두고 돌리지 말라고 명시적으로 적혀 있습니다. 이런 종류의 모델은 성능표보다 이 문단을 먼저 읽어야 합니다.
LocateAnything-3B는 Qwen2.5-3B-Instruct를 파인튜닝한 파생본입니다. 다운로드 71만은 원본 계열 릴리스가 아니어도 특정 작업에 잘 맞으면 널리 쓰인다는 예시입니다. 다만 라이선스가 other라 상업 도입 전에 원문 확인이 필요합니다.
음성 — STT는 정리됐고 TTS는 아직 갈립니다
음성 인식 쪽은 실사용 분포가 꽤 안정적입니다.
| 모델 | 만든 곳 | 크기 | 라이선스 | 30일 다운로드 |
|---|---|---|---|---|
| openai/whisper-large-v3-turbo | OpenAI | 0.8B | MIT | 8,503,879 |
| Qwen/Qwen3-ASR-0.6B | Qwen | 0.9B | Apache 2.0 | 3,548,123 |
| mistralai/Voxtral-Mini-4B-Realtime-2602 | Mistral AI | 4.4B | Apache 2.0 | 2,097,354 |
| CohereLabs/cohere-transcribe-03-2026 | Cohere Labs | 2.1B | Apache 2.0 | 1,029,521 |
| microsoft/VibeVoice-ASR | Microsoft | 8.7B | MIT | 678,655 |
| nvidia/parakeet-tdt-0.6b-v3 | NVIDIA | 0.6B | CC BY 4.0 | 207,975 |
Whisper large-v3-turbo가 여전히 1위입니다. 2024년 10월 모델인데도 그렇습니다. 새 모델을 넣을 때는 대체 이유가 분명해야 합니다. 실시간 스트리밍이 필요하면 Voxtral의 리얼타임 계열이나 NVIDIA의 스트리밍 계열, 다국어 폭이 필요하면 Qwen3-ASR이나 VibeVoice-ASR 쪽입니다. VibeVoice-ASR 카드의 언어 목록에는 한국어가 포함돼 있습니다.
parakeet 계열은 CC BY 4.0이라 저작자 표시 의무가 붙습니다. 실무에서 자주 놓치는 조항입니다. 그리고 앞에서 본 대로 실제 사용량은 mlx-community 미러 쪽이 훨씬 큽니다.
음성 합성은 더 흩어져 있습니다.
| 모델 | 만든 곳 | 라이선스 | 30일 다운로드 | 비고 |
|---|---|---|---|---|
| hexgrad/Kokoro-82M | hexgrad | Apache 2.0 | 11,282,032 | 82M, 카드가 상업 배포를 명시적으로 환영 |
| Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice | Qwen | Apache 2.0 | 2,400,018 | 음성 커스터마이즈 |
| openbmb/VoxCPM2 | OpenBMB | Apache 2.0 | 963,360 | |
| k2-fsa/OmniVoice | k2-fsa | 태그에 라이선스 없음 | 849,526 | Qwen3-0.6B 기반 파생 |
| Supertone/supertonic-3 | Supertone | OpenRAIL | 28,838 | 한국어 포함 30여 개 언어 |
Kokoro-82M은 82M 파라미터로 1,100만 다운로드를 찍습니다. 이 영역에서 크기와 채택률이 반비례한다는 걸 보여 주는 사례입니다. 카드에는 이 이름을 사칭하는 가짜 사이트에 대한 경고도 함께 실려 있습니다.
OmniVoice는 조회 시점에 라이선스 태그가 비어 있었습니다. 다운로드 85만짜리 모델인데도 그렇습니다. 라이선스가 없다는 건 "자유롭게 쓰라"가 아니라 "권리 관계가 불명확하다"에 가깝습니다. 사내 사용은 몰라도 제품에 넣을 때는 업로더에게 확인이 필요합니다. OpenRAIL 계열은 또 다른 이야기인데, 특정 용도를 금지하는 조항이 본문에 붙습니다. 법무 검토 없이 넘어갈 라이선스가 아닙니다.
이미지와 비디오 — 라이선스를 가장 먼저 봅니다
생성 이미지·비디오 영역은 다른 어떤 영역보다 라이선스 편차가 큽니다. 성능 비교보다 이걸 먼저 봐야 합니다.
| 모델 | 만든 곳 | 라이선스 | 접근 승인 | 30일 다운로드 |
|---|---|---|---|---|
| Tongyi-MAI/Z-Image-Turbo | Tongyi MAI | Apache 2.0 | 불필요 | 1,102,053 |
| Lightricks/LTX-2.3 | Lightricks | LTX-2 커뮤니티 라이선스 | 불필요 | 2,128,047 |
| black-forest-labs/FLUX.1-dev | Black Forest Labs | 비상업 라이선스 | 필요 | 537,643 |
| krea/Krea-2-Turbo | Krea | Krea 2 커뮤니티 라이선스 | 필요 | 144,966 |
| Wan-AI/Wan2.2-TI2V-5B | Wan AI | Apache 2.0 | 불필요 | 16,094 |
FLUX.1-dev는 좋아요 13,887로 이 목록에서 압도적 1위인데 라이선스 이름 자체가 비상업입니다. 접근 승인도 필요합니다. 좋아요 수와 상업적 사용 가능성은 아무 상관이 없습니다.
Z-Image-Turbo는 카드에 따르면 6B 파라미터의 증류 모델로, 8회 함수 평가로 이미지를 만들고 16GB VRAM 소비자 기기에 들어간다고 적혀 있습니다. 아파치 2.0이라 제약이 가장 적습니다. 다만 이 성능 수치는 만든 쪽의 자체 측정입니다.
Krea 2 계열과 LTX-2 계열은 이름에 커뮤니티가 들어가지만 조건이 붙은 자체 라이선스입니다. Krea 쪽은 라이선스 본문이 PDF로 링크돼 있고 접근 승인이 자동으로 걸려 있습니다. 이 영역에서 파생 LoRA와 GGUF 변환본이 유난히 많이 트렌딩에 오르는데, 그 파생본들의 라이선스 기준은 전부 원본입니다.
소형·온디바이스 — 3B 이하와 극저비트
기기에서 돌리는 쪽은 두 갈래입니다. 처음부터 작게 만든 모델과, 큰 모델을 극한까지 눌러 담은 것입니다.
| 모델 | 만든 곳 | 규모 | 라이선스 | 30일 다운로드 | 특징 |
|---|---|---|---|---|---|
| Nanbeige/Nanbeige4.2-3B | Nanbeige | 총 4B, 비임베딩 3B | Apache 2.0 | 27,892 | 루프 트랜스포머 |
| LiquidAI/LFM2.5-350M | Liquid AI | 350M | LFM 자체 라이선스 | 89,888 | 학습 예산 28T 토큰 |
| microsoft/harrier-oss-v1-270m | Microsoft | 270M | MIT | 221,855 | 다국어 임베딩 |
| fdtn-ai/antares-1b | fdtn-ai | 1B급 | Apache 2.0 | 11,297 | granite-4.0-1b 파생, 접근 승인 필요 |
| prism-ml/Bonsai-27B-gguf | Prism ML | Qwen3.6-27B의 1비트 변환 | Apache 2.0 | 2,510,237 | 배포 크기 약 3.9GB |
Bonsai-27B는 이 글의 두 축이 만나는 지점입니다. 트렌딩 상위권이고 다운로드가 251만인데, 원본이 아니라 Qwen3.6-27B의 양자화 재업로드입니다. 카드가 밝힌 표현은 가중치당 실효 1.125비트이고, 128개 가중치마다 FP16 스케일 하나를 공유하는 부호 비트 표현입니다. FP16 대비 약 14.2배 축소, 15개 사고 모드 벤치마크 평균 76.11로 FP16 대비 89.5퍼센트 유지라고 적혀 있습니다.
이 숫자들은 전부 만든 쪽의 자체 측정입니다. 그리고 카드가 스스로 지적한 부분이 흥미로운데, 통상적인 저비트 빌드는 라벨보다 실제 평균 비트 폭이 큽니다. 널리 쓰이는 Qwen3.6-27B의 "2비트" 빌드가 실제로는 9.4GB에 가중치당 2.8비트라는 예를 들고 있습니다. 양자화 등급 이름을 그대로 믿지 말고 파일 크기를 파라미터 수로 나눠 보라는 얘기입니다. 양자화 형식별 차이는 GPTQ, AWQ, GGUF 양자화 비교에서 정리해 두었습니다.
LFM2.5-350M의 카드는 온디바이스 모델 카드가 어떠해야 하는지 보여 줍니다. 파라미터 350M, 레이어 16개, 학습 예산 28조 토큰, 컨텍스트 32,768, 지식 컷오프 2024년 중반, 그리고 결정적으로 "지식 집약 작업과 프로그래밍에는 권장하지 않는다"는 문장이 들어 있습니다. 만든 쪽이 한계를 먼저 적어 두면 도입 판단이 훨씬 빨라집니다.
소형 모델을 본인 작업에 맞추는 쪽이 목적이라면, 크기를 고르는 기준은 로컬 LLM VRAM 계산법에, 학습 절차는 QLoRA 프로덕션 파인튜닝에 정리돼 있습니다.
마치며 — 순위표가 아니라 좌표를 보세요
트렌딩 목록은 최근 며칠의 변화율입니다. 무엇이 좋은지가 아니라 무엇이 새로 올라왔는지를 보여 줍니다. 그래서 목록 위쪽에는 갓 올라온 GGUF 변환본과, 아직 아무도 돌려 보지 않은 750B 모델이 나란히 앉아 있습니다.
실무에서 필요한 건 좌표입니다. 이 모델을 누가 만들었는지, 원본인지 파생본인지, 라이선스가 무엇을 금지하는지, 그리고 만든 쪽이 카드에 어떤 한계를 적어 두었는지. 이 네 가지는 어느 순위표에도 안 나오지만 전부 모델 카드 첫 화면에 있습니다. 다음 글에서는 그 카드가 담고 있는 학습 파이프라인을 뜯어보고, 그다음 글에서 카드를 5분 안에 읽는 순서를 정리합니다.
현재 단락 (1/129)
2026년 8월 2일에 허깅페이스 트렌딩 목록 첫 화면을 열면 서른 개 남짓한 저장소가 보입니다. 그중 절반가량은 새로 학습된 모델이 아닙니다. 남이 만든 가중치를 GGUF로 변환...