- Authors

- Name
- Youngju Kim
- @fjvbn20031
引言 —— 热门榜第一页有一半不是新模型
2026 年 8 月 2 日打开 Hugging Face 热门榜单第一屏,能看到三十来个仓库。其中大约一半根本不是新训练出来的模型,而是把别人做的权重转成 GGUF 上传的、被社区改了性格的微调版,以及事实上的镜像。
这不是说这样不好。没有量化重新上传,笔记本电脑根本跑不动 27B 的模型。问题在于,把这份榜单当成「最近哪个模型最受欢迎的排名」来读,判断就会跑偏。哪个机构做了什么、这个模型该用在哪、许可证是什么,在榜单上全都被抹平了。
本文不打算照抄排行榜,而是按用途分类,整理出真正会被拿去部署的模型,为每一个都写清楚厂商、规模、许可证,以及使用前需要了解的限制。先从怎么分辨原版和衍生版讲起——学会这个,后面整份榜单会好读得多。
所有数字都是在查询当下、也就是 2026 年 8 月 2 日,直接从 Hugging Face API 和模型卡片上核实的。下载量用的是 Hugging Face 默认展示的近 30 天数字,和累计下载量是两回事。比如 Qwen3.6-27B,按 30 天算是 657 万,按累计算是 1,880 万。本文所有表格都统一用 30 天口径。
热门榜一半是重新上传 —— 怎么分辨原版和衍生版
Hugging Face 用标签记录仓库之间的关系。模型页面顶部的徽章和 API 里的标签列表,用的是同一个值。
| 标签形式 | 含义 | 页面上显示的文字 |
|---|---|---|
base_model:quantized:原版 | 把原版量化之后重新上传 | Quantized from |
base_model:finetune:原版 | 在原版基础上做了额外训练 | Finetuned from |
base_model:adapter:原版 | 只包含 LoRA 之类的适配器 | Adapter for |
base_model:merge:原版 | 合并了多个模型 | Merge of |
| 没有标签 | 要么是原版发布,要么没标出关系 | 无 |
这里要注意的是最后一行:没有标签,不代表就是原版,只是上传者没填而已。所以实际操作中要同时看三样东西。
第一,看机构账号。像 Qwen、deepseek-ai、moonshotai、google、microsoft、nvidia、upstage、LGAI-EXAONE、skt 这类账号会带机构认证徽章。前沿级模型如果挂在个人账号下,几乎肯定是衍生版。
第二,看文件列表。原版发布通常会一起带上 config.json、model.safetensors.index.json、tokenizer.json、chat_template.jinja。如果只有几个 GGUF 文件、没有 config.json,那就是转换版。
第三,看命名规则。带 -GGUF、-AWQ、-GPTQ、-NVFP4、-FP8、-INT4、-MLX、-ONNX 这类后缀的,事实上全都是转换版。
那为什么衍生版反而比原版下载得多呢?原因叠加了好几层。原版通常只发一份 BF16,得用多张 GPU 才跑得动;而 GGUF 转换版能在笔记本上跑,个人用户的数量压倒性地多。再加上 GGUF 仓库按量化档位分成好几个文件,部分下载的情况很常见,而像 MLX、ONNX 这类绑定特定运行时的格式,会成为那个生态里的默认路径。
用实际数字看是这样的。以下是同一天查询到的近 30 天下载量。
| 原版 | 原版下载量 | 衍生版 | 衍生版下载量 |
|---|---|---|---|
| Qwen/Qwen3.6-27B | 6,572,759 | prism-ml/Bonsai-27B-gguf | 2,510,237 |
| Qwen/Qwen3.6-27B | 6,572,759 | unsloth/Qwen3.6-27B-MTP-GGUF | 1,181,465 |
| moonshotai/Kimi-K3 | 559,924 | unsloth/Kimi-K3-GGUF | 41,337 |
| poolside/Laguna-S-2.1 | 77,021 | unsloth/Laguna-S-2.1-GGUF | 170,109 |
| upstage/Solar-Open2-250B | 13,426 | nota-ai/Solar-Open2-250B-Nota-NVFP4 | 22,396 |
| nvidia/parakeet-tdt-0.6b-v3 | 207,975 | mlx-community/parakeet-tdt-0.6b-v3 | 1,300,339 |
下面三行里,衍生版都反超了原版。以 parakeet 为例,面向 Apple 芯片的 MLX 转换版下载量是原版的六倍还多。如果把原版仓库的下载量当成「这个模型有多受欢迎」来读,会因为这个结构而错得很离谱。
这对选型的影响体现在三个方面。
第一,衍生版不会自动跟上原版的修复。哪怕原厂团队修好了分词器或聊天模板并重新上传,转换版依然停在原地。发布后的头几周,最好去核对原版的提交历史。
第二,许可证不会在衍生版里被放宽。如果原版限制商用,GGUF 转换版也会受到同样的限制。有些衍生版的卡片上要么完全没写许可证,要么写得含糊,这时候的判断基准应该是原版。
第三,质量经过验证的衍生版和没经过验证的衍生版之间差别很大。像 unsloth、mlx-community、ggml-org、RedHatAI 这类账号,转换流水线是公开的,留有回归验证的痕迹;而名字里堆满形容词的个人合并版,大多数情况下背后没有可复现的评测。
通用 LLM 和编程模型 —— 前沿级已经整个开放了
现在排名靠前的都是参数超过一万亿的 MoE 模型。下表只挑出了查询时热门榜前列里的原版发布。
| 模型 | 厂商 | 规模 | 上下文 | 许可证 | 30 天下载量 |
|---|---|---|---|---|---|
| moonshotai/Kimi-K3 | Moonshot AI | 2.8T / 激活 104B MoE | 1,048,576 | Kimi K3 License (自定) | 559,924 |
| deepseek-ai/DeepSeek-V4-Flash | DeepSeek | 284B / 激活 13B MoE | 1M | MIT | 2,814,414 |
| zai-org/GLM-5.2 | Z.ai | 卡片未标注 | 1M | MIT | 1,683,442 |
| Qwen/Qwen3.6-27B | Qwen | 27B 稠密 + 视觉 | 262,144 (可扩展至 1,010,000) | Apache 2.0 | 6,572,759 |
| Qwen/Qwen3.6-35B-A3B | Qwen | 35B / 激活 3B MoE | 262,144 | Apache 2.0 | 5,939,238 |
| thinkingmachines/Inkling | Thinking Machines | 975B / 激活 41B MoE | 卡片未标注 | Apache 2.0 | 59,076 |
| upstage/Solar-Open2-250B | Upstage | 250B / 激活 15B MoE | 1M | Upstage Solar License | 13,426 |
| skt/A.X-K2 | SK 电讯 | 688B / 激活 33B MoE | 262,144 | Apache 2.0 | 1,218 |
| LGAI-EXAONE/K-EXAONE-2.0-750B-A37B | LG AI Research | 750B / 激活 37B MoE | 见卡片 | Apache 2.0 | 101 |
有几个限制需要提一下。
Kimi K3 用的不是 MIT,而是自定义许可证。看许可证原文,使用、修改、再分发、微调都是自由的,但有两道门槛。如果运营的是卡片定义的 Model as a Service —— 也就是向第三方提供模型推理或微调的业务 —— 一旦连续 12 个月的合计营收超过 2000 万美元,就需要另签协议。另外,如果用在月活超过 1 亿或月营收超过 2000 万美元的产品里,就得在界面上展示模型名字。纯内部使用不受这两条约束。对大多数公司来说这实际上没有限制,但如果不核对许可证就把它归类成「开源」,日后会有麻烦。
Solar Open 2 情况类似,但方向不同。Upstage Solar License 基本原样搬用了 Apache 2.0 的条款,但加了一条第 4(e) 款:用这个模型做出衍生 AI 模型并分发,名字必须以 Solar 开头,相关网站和文档也要展示品牌标识。这不妨碍商用本身,但附带了品牌义务。
从中文/韩文语境看,值得关注的三个模型在同一时期发布了。Upstage 的 Solar Open 2 明确支持韩语和日语,卡片写着预训练 token 约 12 万亿、按 B200 计 200 万 GPU 小时。SKT 的 A.X K2 是 688B / 激活 33B MoE,据卡片透露是政府主权 AI 基础模型项目的一部分。LG AI Research 的 K-EXAONE 2.0 是 750B / 激活 37B,以 Apache 2.0 发布。查询时这三个的下载量都还很低——K-EXAONE 2.0 是 101,A.X K2 是 1,218。这是因为它们才公开了几天,这些数字还不能用来判断质量。
Inkling 相对于自身规模,下载量偏低(59,076),因为 975B / 激活 41B 不是个人能跑得动的体量。同一个账号下还挂着 Inkling-Small 及其 NVFP4 版本,有意思的是 NVFP4 版本(25,352)的下载量是原版 BF16(3,998)的六倍还多——说明真正把它拿去部署的人,选的是低精度那一侧。
编程这一侧的用途更窄一些。
| 模型 | 厂商 | 规模 | 许可证 | 30 天下载量 | 限制 |
|---|---|---|---|---|---|
| poolside/Laguna-S-2.1 | poolside | 118B / 激活 8B | OpenMDW-1.1 | 77,021 | 光 BF16 权重就约 236GB |
| Kwaipilot/KAT-Coder-V2.5-Dev | Kwaipilot | 35B / 激活 3B | Apache 2.0 | 10,771 | 公开版仅限文本,不含视觉模块 |
| moonshotai/Kimi-K2.7-Code | Moonshot AI | 1T 级 | 自定 | 665,880 | 需核对 Kimi 系列许可证 |
Laguna S 2.1 用的许可证 OpenMDW-1.1,据卡片称自由允许商用和修改。不过这个许可证是最近才出现的,很可能还没进公司法务的审查名单。按卡片所写,48 层里只有 12 层是全局注意力,其余 36 层是窗口为 512 的滑动窗口,1M 上下文就是靠这个结构撑起来的。
KAT-Coder-V2.5-Dev 需要留意卡片直接写明的限制:公开的权重只是语言模型部分,不包含视觉和多模态组件,只能以纯文本方式运行。这类模型必须先确认基准表是不是按完整模型测的。
嵌入与重排模型 —— 两年前的模型仍然是第一
这个领域的节奏和 LLM 完全不同。新模型源源不断地出现,但实际使用量的第一名依然是一个老模型。
| 模型 | 厂商 | 大小 | 许可证 | 30 天下载量 | 发布日期 |
|---|---|---|---|---|---|
| sentence-transformers/all-MiniLM-L6-v2 | SBERT | 约 22M | Apache 2.0 | 251,140,343 | 2022-03 |
| BAAI/bge-m3 | BAAI | 见卡片 | MIT | 34,621,449 | 2024-01 |
| Qwen/Qwen3-Embedding-0.6B | Qwen | 0.6B | Apache 2.0 | 9,801,487 | 2025-06 |
| google/embeddinggemma-300m | 0.3B | Gemma License | 1,911,651 | 2025-07 | |
| Qwen/Qwen3-Reranker-0.6B | Qwen | 0.6B | Apache 2.0 | 2,725,199 | 2025-05 |
| Alibaba-NLP/gte-reranker-modernbert-base | Alibaba NLP | 0.1B | Apache 2.0 | 2,386,616 | 2025-01 |
| microsoft/harrier-oss-v1-0.6b | Microsoft | 0.6B | MIT | 214,363 | 2026-03 |
| jinaai/jina-reranker-v3.5 | Jina AI | 0.6B | CC BY-NC 4.0 | 1,866 | 2026-07 |
MiniLM-L6-v2 那 2.51 亿的数字不是因为性能好,而是因为它被写死在无数库的默认配置里,每次 CI 跑起来都会下载一次。在嵌入这个领域,下载量没法当作质量指标来用。
实务中经常撞上的限制有两个。
第一,google/embeddinggemma-300m 是一个门控仓库。查询当下 gated 的值是 manual,不登录就去拉卡片原文,只会看到访问受限的提示,必须先同意 Gemma 许可证。这是 Docker 镜像构建阶段没带 token 就想拉取、结果失败的典型场景。
第二,Jina AI 最新的模型都是 CC BY-NC 4.0,附带非商用条件。jina-reranker-v3.5 是这样,jina-embeddings-v5-text-small 也是这样。只看性能表就做出引入决定,会在部署前一刻被卡住。如果是商业服务,最好把候选范围收窄到 Apache 2.0 这一侧,比如 Qwen3-Reranker 系列或者 GTE 系列。
微软的 harrier-oss-v1 是一个用 MIT 发布的多语言嵌入系列。卡片给出的 MTEB v2 分数是 270M 拿 66.5、0.6B 拿 69.0、27B 拿 74.3,同时明确写着这是自我报告的数字、以发布时点为准。换嵌入模型意味着要重建索引,所以正确做法是用自己的数据复现一遍再做决定,而不是照搬卡片上的分数。复现方法另见如何调试 RAG 检索质量和嵌入模型与向量检索实战指南。
视觉与文档 —— OCR 与电脑操作 Agent
这个领域目前分成两条支线:一条是把文档转成文本的 OCR,另一条是看着屏幕操作的 agent。
| 模型 | 厂商 | 大小 | 许可证 | 30 天下载量 | 用途 |
|---|---|---|---|---|---|
| baidu/Unlimited-OCR | 百度 | 3.3B | MIT | 2,457,387 | 文档 OCR |
| nvidia/LocateAnything-3B | NVIDIA | 3.8B | 自定 | 716,448 | 开放词表定位 |
| ATH-MaaS/OvisOCR2 | ATH | 0.9B | Apache 2.0 | 68,429 | 轻量 OCR |
| microsoft/Mage-VL | Microsoft | 4.7B | Apache 2.0 | 10,525 | 通用视觉语言 |
| microsoft/Fara1.5-27B | Microsoft | 27B | MIT | 2,775 | 浏览器操作 agent |
Unlimited-OCR 的卡片自称把 DeepSeek-OCR 又往前推了一步,还附有一篇论文。MIT 加 3.3B 的组合,很适合接进文档处理流水线。
Fara1.5-27B 的性格比较特别。它是对 Qwen3.5-27B 做有监督微调得到的电脑操作 agent,不看 DOM 或无障碍树,只靠截图判断,点击像素坐标。卡片里有一段用加粗字体写的警告:只能在微软打造的那套 harness 里使用。如果直接拿去自己集成,沙箱隔离、域名白名单、监控模式、紧急停止这些都得自己实现,责任也就转移到了使用者身上。卡片明确写着,不要在有敏感信息的机器上开着浏览器权限运行它。这类模型,性能表之前应该先读这一段。
LocateAnything-3B 是对 Qwen2.5-3B-Instruct 做微调得到的衍生版。71 万的下载量说明,哪怕不是原版系列的发布,只要贴合某个具体任务,照样能被广泛使用。不过它的许可证标的是 other,商用之前需要核对原文。
语音 —— STT 已经尘埃落定,TTS 还在分化
语音识别这一侧的实际使用分布相当稳定。
| 模型 | 厂商 | 大小 | 许可证 | 30 天下载量 |
|---|---|---|---|---|
| openai/whisper-large-v3-turbo | OpenAI | 0.8B | MIT | 8,503,879 |
| Qwen/Qwen3-ASR-0.6B | Qwen | 0.9B | Apache 2.0 | 3,548,123 |
| mistralai/Voxtral-Mini-4B-Realtime-2602 | Mistral AI | 4.4B | Apache 2.0 | 2,097,354 |
| CohereLabs/cohere-transcribe-03-2026 | Cohere Labs | 2.1B | Apache 2.0 | 1,029,521 |
| microsoft/VibeVoice-ASR | Microsoft | 8.7B | MIT | 678,655 |
| nvidia/parakeet-tdt-0.6b-v3 | NVIDIA | 0.6B | CC BY 4.0 | 207,975 |
Whisper large-v3-turbo 依然排第一,尽管它是 2024 年 10 月的模型。要引入新模型,替换的理由必须足够清楚。如果需要实时流式处理,可以看 Voxtral 的实时系列或 NVIDIA 的流式系列;如果需要更广的多语言覆盖,可以看 Qwen3-ASR 或 VibeVoice-ASR。VibeVoice-ASR 卡片的语言列表里包含韩语。
parakeet 系列是 CC BY 4.0,带有署名义务——这是实务中经常被漏掉的一条条款。而且正如前面所见,实际使用量在 mlx-community 镜像那一侧要大得多。
语音合成这边就更分散了。
| 模型 | 厂商 | 许可证 | 30 天下载量 | 备注 |
|---|---|---|---|---|
| hexgrad/Kokoro-82M | hexgrad | Apache 2.0 | 11,282,032 | 82M,卡片明确欢迎商用部署 |
| Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice | Qwen | Apache 2.0 | 2,400,018 | 声音定制 |
| openbmb/VoxCPM2 | OpenBMB | Apache 2.0 | 963,360 | |
| k2-fsa/OmniVoice | k2-fsa | 标签里没有许可证 | 849,526 | 基于 Qwen3-0.6B 的衍生版 |
| Supertone/supertonic-3 | Supertone | OpenRAIL | 28,838 | 含韩语在内约 30 种语言 |
Kokoro-82M 只有 82M 参数,却拿下了 1100 万下载量,是这个领域里体积和采用率成反比的一个例证。卡片里还附带了一条警告,提醒当心冒用这个名字的假网站。
OmniVoice 在查询当下许可证标签是空的——即便它是个下载量 85 万的模型。没有许可证,与其说是「随便用」,不如说更接近「权利归属不清楚」。内部使用也许没问题,但要放进产品里,需要找上传者核实。OpenRAIL 系列又是另一回事,正文里会附带禁止特定用途的条款,不是一份能跳过法务审查的许可证。
图像与视频 —— 许可证要放在第一位看
生成式图像/视频这个领域,许可证的差异比其他任何领域都大。要先看这个,再看性能对比。
| 模型 | 厂商 | 许可证 | 是否需要授权访问 | 30 天下载量 |
|---|---|---|---|---|
| Tongyi-MAI/Z-Image-Turbo | 通义 MAI | Apache 2.0 | 不需要 | 1,102,053 |
| Lightricks/LTX-2.3 | Lightricks | LTX-2 Community License | 不需要 | 2,128,047 |
| black-forest-labs/FLUX.1-dev | Black Forest Labs | 非商用许可证 | 需要 | 537,643 |
| krea/Krea-2-Turbo | Krea | Krea 2 Community License | 需要 | 144,966 |
| Wan-AI/Wan2.2-TI2V-5B | Wan AI | Apache 2.0 | 不需要 | 16,094 |
FLUX.1-dev 以 13,887 个赞遥遥领先这份榜单,但它许可证的名字本身就是「非商用」,还需要授权访问。点赞数和能不能商用之间没有任何关系。
据卡片所说,Z-Image-Turbo 是一个 6B 参数的蒸馏模型,8 次函数评估就能出图,能塞进 16GB 显存的消费级设备。因为是 Apache 2.0,限制最少。不过这个性能数字是厂商自己测出来的。
Krea 2 系列和 LTX-2 系列名字里都带着「community」,但其实是附带条件的自定义许可证。Krea 这边许可证正文是以 PDF 链接的形式给出的,而且自动开启了授权访问。这个领域里衍生 LoRA 和 GGUF 转换版格外容易冲上热门榜,而这些衍生版的许可证基准,全都是原版。
小型与端侧 —— 3B 以下与极限低比特
跑在端侧设备上的模型分两条路:一开始就做小的模型,以及把大模型压到极致的模型。
| 模型 | 厂商 | 规模 | 许可证 | 30 天下载量 | 特点 |
|---|---|---|---|---|---|
| Nanbeige/Nanbeige4.2-3B | Nanbeige | 总量 4B,非嵌入部分 3B | Apache 2.0 | 27,892 | 循环 Transformer |
| LiquidAI/LFM2.5-350M | Liquid AI | 350M | LFM 自定义许可证 | 89,888 | 训练预算 28T token |
| microsoft/harrier-oss-v1-270m | Microsoft | 270M | MIT | 221,855 | 多语言嵌入 |
| fdtn-ai/antares-1b | fdtn-ai | 1B 级 | Apache 2.0 | 11,297 | granite-4.0-1b 的衍生版,需要授权访问 |
| prism-ml/Bonsai-27B-gguf | Prism ML | Qwen3.6-27B 的 1 比特转换版 | Apache 2.0 | 2,510,237 | 部署体积约 3.9GB |
Bonsai-27B 正是本文两条线索交汇的地方。它排在热门榜前列,下载量 251 万,但它不是原版,而是 Qwen3.6-27B 的量化重新上传。卡片给出的说法是每权重实效 1.125 比特,每 128 个权重共享一个 FP16 缩放系数的符号位表示法。称相比 FP16 缩小约 14.2 倍,在 15 项思考模式基准上平均得分 76.11,相当于保留了 FP16 的 89.5%。
这些数字全都是厂商自己测出来的。而卡片自己指出的一点很有意思:常规的低比特构建版本,实际平均比特宽度往往比标签上写的更大。它举例说,广泛使用的 Qwen3.6-27B「2 比特」版本,实际上是 9.4GB、每权重 2.8 比特。也就是说,不要照单全收量化档位的名字,而要拿文件大小去除以参数量自己算一遍。不同量化格式之间的差异,整理在GPTQ、AWQ、GGUF 量化对比里。
LFM2.5-350M 的卡片示范了一份端侧模型卡片该有的样子:参数量 350M,16 层,训练预算 28 万亿 token,上下文 32,768,知识截止到 2024 年年中,还有关键的一句——「不建议用于知识密集型任务和编程」。厂商把限制先写出来,引入判断就能快得多。
如果目的是把小模型调整到贴合自己的工作,选规模的标准整理在本地 LLM 显存计算法里,训练流程整理在QLoRA 生产环境微调里。
结语 —— 该看的是坐标,不是排行榜
热门榜单反映的是最近几天的变化率,展示的是什么东西是新出现的,而不是什么东西是好的。所以榜单靠前的位置上,刚上传的 GGUF 转换版和还没人跑过的 750B 模型会并排坐在一起。
实务中真正需要的是坐标:这个模型是谁做的,是原版还是衍生版,许可证禁止了什么,厂商又在卡片里写下了哪些限制。这四件事,哪个排行榜都不会告诉你,但全都写在模型卡片的第一屏上。下一篇会拆解那张卡片背后的训练流水线,再下一篇会整理出 5 分钟读懂一张卡片的顺序。