[F4]开源模型扎堆上新,你为什么没用起来?
数据来源均为官方仓库与发布说明,查证日期 2026 年 9 月 24 日。文中部署数字为量化后社区实测口径。
九月的开源发布节奏,夸张点说,是三天一个。9 月 3 日阿布扎比的 K2 Horizon 六个档位砸下来,10 日 DeepSeek 放出 V4.1 Flash 权重,22 日小米干脆把万亿参数的 MiMo-V2.6 用 MIT 协议扔上 Hugging Face。扫榜的文章刷了一屏,可我身边真把新模型跑起来的朋友,一只手数得过来。
不是你懒。是“上新”和“能用”之间隔着三道硬杠:你手上的硬件接不接得住、上下文够不够你干活、许可协议让不让你商用。绝大多数人倒在第一道杠上,剩下的倒在第三道上。这篇就把本月几个重点开源模型逐个过筛,筛完你会发现,真能今天就上手的,其实就两三个。
※ ※ ※
📋 先把候选摆上桌
本月(含 8 月底压线发布、9 月发酵的)值得过筛的开源/开放权重模型,我按发布时间列了一张表。参数、许可、上下文全部对照官方仓库或发布说明写的,查证日期 2026 年 9 月 24 日:

两张表外的也提一句:Kimi K3(2.8T 参数,7 月发布权重)用的定制协议带 MaaS 归属条款;GLM-5.3 旗舰本体是另一回事,它和 Flash 不是一个许可。这正是第三道筛子存在的原因。
※ ※ ※
🧱 第一道筛:你的硬件接不接得住
权重放出来不等于你能跑。我去年踩过最疼的一次坑,就是兴冲冲把某家“全面开源”的 200B 模型拉下来 380GB,才发现自家那台 2×A6000 连加载都加载不完,光下载占了小半宿的带宽。后来我学乖了:看发布会不如看显存。
开源模型圈有个心照不宣的换算:FP8 权重的显存需求大约是参数量 ×1 字节,量化到 4bit 再除以 2,然后上下文 KV cache 还要吃一大块。按这个口径把上表过一遍:
- ▪ MiMo-V2.6-Pro:1.02 万亿参数。FP8 一个多 T,就算 Unsloth 式的 2bit 极限量化也要两百多 G 显存。这是给机房准备的,不是给你的 4090。
- ▪ DeepSeek-V4.1-Flash:552B+196B,激活参数只有 8B/16B,听起来很省?激活小省的是算力,不是显存。权重还是全部要装进显存或内存,社区实测单机要 4×H200 级别起步,Mac Studio 192G 勉强能塞量化版,速度感人。
- ▪ GLM-5.3-Flash:320B 总参。同理,FP8 约 306 GiB,官方口径最低 8×H100 或 4×H200。256G 内存的顶配 Mac Studio 跑 2bit 量化是本月博主视频里的常客,能跑,但别指望它当日常主力。
- ▪ Qwen3.8-27B:27B 稠密,4bit 量化约 19GB,一张 24G 显存的卡或者 24G 内存的 M 系 Mac 直接落地,实测 30 tok/s 上下。这是表里唯一一个“下班买张卡明天就能用”的。
- ▪ K2 Horizon:六档从 0.9B 到 375B,挑中间档位,选择很多,下面单说。

第一道筛下来,个人和小团队真正可部署的:Qwen3.8-27B 全尺寸,K2 Horizon 的中小档位,MiMo-V2.6-Distill-Qwen-9B(小米同天放出来的 9B 蒸馏版,专为 RL 研究准备)。万亿俱乐部全体出局。
这里补一句容易被忽略的:显存不够不等于彻底没戏,还有“CPU+GPU 混合”这条路。KTransformers、llama.cpp 的 MoE offload 都能把不常激活的专家层扔到内存里,256G 内存的工作站跑 320B 级 MoE 是这半年社区视频的高频题材。但我劝你看清代价:跑起来和跑得动是两回事。实测社区口径,这类配置的速度通常掉到个位数 token/s,写代码的 agent 循环里等一轮回复要按分钟计。当玩具值得折腾,当生产力工具不划算。真要用大 MoE,直接调 API 更体面。
可运行的上手命令,以 Qwen3.8-27B 的量化版为例(llama.cpp 路线,任何 Apache 2.0 的 27B 级模型同理):
# 下载量化权重后直接起一个 OpenAI 兼容服务
llama-server -m ./qwen3.8-27b-Q4_K_M.gguf \
--host 192.0.2.10 --port 8080 -c 32768
# 验证
curl http://192.0.2.10:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}]}'
示例主机 192.0.2.10 是文档保留地址,换成你自己的内网 IP。
※ ※ ※
📏 第二道筛:上下文够不够你干活
现在正是 agent 工作流的年代,一个模型如果装不下你的仓库、你的几十份合同、你上一轮工具调用的完整轨迹,能力再强也得排不上队。这一关反而没什么悬念:本月新发布的旗舰开源模型清一色 1M token 起步,GLM-5.3-Flash、DeepSeek-V4.1-Flash、MiMo-V2.6 全系都是 1,048,576 级别的窗口。
真正要看的细节是另外两个:
一是最大输出。DeepSeek-V4.1-Flash 支持到 384K 输出,GLM-5.3-Flash 托管端点是 128K。你要模型一次性生成整个模块的代码,输出上限比输入上限更能卡住你。
二是长上下文的实际开销。KV cache 是长文本的隐形账单。V4.1 Flash 这代把每 token 的缓存压到约 890 字节(FP4 精度加压缩稀疏注意力),比上一代小了四分之三。同样号称 1M 窗口的模型,实际能开多长、多快,差距就在这种地方。别只看宣传页那个“1M”,要看你那个硬件上开到 1M 还剩多少速度。
第二道筛对本月新模型基本不构成淘汰,但它淘汰的是你去年的库存:还在用 128K 窗口老模型跑长文档的,这次值得换。
顺便给一个实操细节:把长上下文真正用起来的,往往不是窗口数字,而是你的调用姿势。以 DeepSeek 的新模型为例,官方推荐的采样参数是 temperature 1.0、top_p 0.95,长任务把 max_tokens 直接开到 256K 以上;reasoning_effort 是个 1 到 100 的旋钮,聊天场景开低档省 token,跑 DeepSWE 那种长程任务再拉满。同一个模型,旋钮拧对和拧错,账单能差出三四倍。
# 1M 窗口的模型,喂整仓库前先算一下预算(openai sdk 兼容任何中转)
from openai import OpenAI
cli = OpenAI(base_url="http://192.0.2.10:8080/v1", api_key="***")
def tok_est(text): # 粗估:英文 4 字符/token,中文约 1.5
return int(len(text) / 2.2)
for name in ("repo_dump.md", "contracts.md"):
src = open(name).read()
print(f"{name}: ≈{tok_est(src):,} tokens")
※ ※ ※
📜 第三道筛:许可协议,最容易翻车的一道
这是大多数人压根不看、法务最想看的一道。今年开源圈一个明显趋势:所谓“开源”的许可正在分化,同样把权重放上 Hugging Face,条款天差地别。本月三个样本摆在一起特别有代表性:
- ▪ MIT:GLM-5.3-Flash、DeepSeek-V4.1-Flash、MiMo-V2.6。三个字的协议,商用、修改、分发随便来,没有任何使用领域限制。
- ▪ Apache 2.0:K2 Horizon 全系、Qwen3.8-27B。同样是宽松系,比 MIT 多了专利授权条款,一般认为对企业更友好。
- ▪ 定制协议:Qwen-Image-2.1 9 月 20 日发布时,把前代沿用的 Apache 2.0 换成了“仅限非商用研究与评测”,想商用必须单独找阿里签商业许可,价格和时间表都没公布。Kimi K3 的定制协议里则藏着 MaaS 归属条款,GLM-5.3 旗舰对年营收 100 亿美元以上的 MaaS 运营商另有安全审查要求。
Qwen-Image-2.1 这个转身值得所有做产品的人警惕:它说明“这个系列以前是 Apache”不构成任何预期,每一个新版本都要重读一遍 license 文件。我见过团队把模型 ID 写进配置文件就再也不看一眼,三年后审计才发现底座换过两次协议。
还有一类人最需要看这道筛:拿开源模型微调后商业分发的。MIT 和 Apache 2.0 下微调产物归你,随便卖;但带营收线和归属条款的协议下,你的衍生品可能连带受约束,比如要求你的产品界面标注基座模型品牌、或者超过营收线要报备。条款细节各家不同,别拿本文当法律意见,动手前把协议正文从头到尾读一遍,四十分钟的事,省下的是重构成本。
一句话:MIT 和 Apache 2.0 直接放行,凡是“Custom”“Community License”“Research License”字样出现,先去找协议正文读第 1 节和第 3 节,再决定进不进技术栈。

※ ※ ※
🎯 过筛结论:本周你该动哪个
三道筛子过完,给三类人三个具体答案:
只有一张消费级显卡或一台 24G 内存 Mac:Qwen3.8-27B,Apache 2.0,本地起服务,今天下班就能干。它是表里唯一同时过三道筛的“全尺寸自部署”选项。别嫌 27B 小,这代 27B 的编程水平按官方口径已经超过上一代更大的 Plus 线,日常写脚本、改文案、做结构化抽取完全够用,隐私数据不出门是它独有的加分项。
有正经 GPU 资源(4×H200 起):GLM-5.3-Flash 和 DeepSeek-V4.1-Flash 都过筛,MIT、1M 上下文、agentic 基准都是第一梯队(V4.1 Flash 官方 Terminal-Bench 2.1 得分 90.6,反超上一代旗舰 V4-Pro)。两个都重,选一个先跑,我建议按你的推理框架生态挑:vLLM/SGLang 两者都支持,KTransformers 路线 GLM 的社区资料更多。还有一笔账:自建一套 8×H100 月成本按国内云现价粗算是六位数人民币量级,同样的钱走 API,绝大多数团队一天烧不到零头的零头。自部署的真正理由只有一个:数据不能出门,或者你要深度定制。没有这两条,别为了“掌控感”开机房。
没有 GPU,但工作流重度依赖大模型:别死磕部署,直接走 API。GLM-5.3-Flash 的 API 挂牌价输入 $0.15/百万 token,DeepSeek 新价格低峰期输入 ¥1/百万 token,MiMo-V2.6 官方说它是 Artificial Analysis 追踪列表里最便宜的上榜模型,训练 1T 参数只花了约 262 万美元,API 定价也延续这个风格。开源模型吃到的最大红利,与其说是“免费权重”,不如说是它把整条 API 市场的价格打了下来。一个务实的组合拳:主力用闭源旗舰保体验,批量任务、日志清洗、初稿生成全部切到开源新贵的低价 API,月账单能砍一半以上。
还有一个彩蛋级别的值得收藏:K2 Horizon。它是本月唯一一个把权重、训练代码、训练数据、中间检查点、日志全套放出来的发布(Apache 2.0),375B 那档你部署不起,但 0.9B 到几十 B 的小档位做微调实验、复现训练流程,它是目前唯一“可验证”的素材。研究机构把它当教材用,比大多数论文有用。想入坑大模型训练又找不到完整样本的,这是今年最值得 star 的仓库。
顺手把三个筛子做成一个可以存进笔记的检查清单,以后每刷到一个新发布,五问过关再过:
1. 总参数 ×1 字节(FP8)≈ 显存起步价,我有什么? 2. license 文件正文里有没有 revenue cap / attribution / non-commercial 字样? 3. 1M 窗口在你的推理框架里开到多少会降速? 4. 最大输出够不够你单次任务用? 5. 社区 GGUF/FP8 量化出了没有,出了再上生产?
※ ※ ※
最后说一层窗户纸
为什么“扎堆上新”和“没人用起来”能同时成立?因为这些发布几乎都是机房级军备竞赛的副产品:万亿 MoE、45T token 预训练、七千个 RL 环境,厂商卷的是榜单,而个人开发者真正的日常瓶颈是那 19GB 显存和那张没读过的 license。筛子这个东西,不是给模型设的,是给需求设的。你想清楚自己要它干什么,一个月上新十个也只留一个。
下一篇想聊点更大的:整个 9 月,AI 圈发生了不少事后回头看都是分水岭的事,硅谷在立法、北京在发司法解释、算力在并购。我挑几件真正改变了某类人默认做法的,一件一件说。
※ ※ ※
※ ※ ※
资料来源
- ▪ 小米 MiMo 官方发布页(mimo.mi.com/docs/news/latest/v2-6,2026-09-22 更新);MiMo-V2.6 Hugging Face collection(XiaomiMiMo/mimo-v26)
- ▪ DeepSeek-V4.1-Flash 官方仓库 deepseek-ai/DeepSeek-V4.1-Flash 及技术报告(MIT,2026-09-10);API 变更日志(deepseek-flash 定价与旧 ID 退役时间表)
- ▪ Z.ai GLM-5.3-Flash 发布页与 zai-org/GLM-5.3-Flash(MIT,2026-08-25 权重上传,26 日官宣)
- ▪ 阿里 Qwen3.8-27B 开源报道及仓库(Apache 2.0,2026-08-14);Qwen-Image-2.1 模型卡许可段(Qwen Research License Agreement,2026-09-20)
- ▪ 阿布扎比创新技术中心 / Institute of Foundation Models:K2 Horizon 发布(Apache 2.0,2026-09-03)
- ▪ Fireworks AI《Best Open Source LLMs 2026》、LLMCheck 开源本地模型月榜(2026 年 9 月口径,量化显存与速度参考)
- ▪ Kimi K3(moonshotai)与 GLM-5.3 旗舰的定制许可条款:各家官方 LICENSE 文件
- ▪ 以上数字均于 2026-09-24 通过官网/官方仓库交叉查证。文中示例主机均为文档保留地址(RFC 5737),非作者真实环境;硬件门槛为量化社区实测口径的约数。
评论 (0)
登录 或 注册 后参与讨论。