凌晨被群消息炸醒:Meta把30B模型塞进20GB,二手3090能再战三年

 昨晚十一点多,胜哥准备关电脑睡觉。

手机震了一下。群里老陈甩了个链接,配了三个感叹号。

"兄弟们快看这个!!!!!!!"

胜哥点开。HuggingFace 页面。Muse Glimmer。往下翻——30B参数,Apache 2.0开源。往下翻——4-bit量化后不到20GB24GB显存的显卡就能跑。往下翻——DFlash投机解码,RTX 5090上从每秒74.9个token蹦到233.4个。三倍。

胜哥放下手机,想了想,又拿起来,把链接转发到了另一个群。

然后可能是老陈的猫跳上了他的键盘,发了一条全是"asdfghjkl"的消息。老陈回了句:

"猫在我键盘上跑,可能猫也觉得能跑哈。"

就是这种时候,垃圾佬的直觉会告诉你——有什么东西变了。

结果第二天早上刷新闻,蚂蚁百灵 Ling-3.0-tiny 也开源了——7.9B参数,MoE架构,M4 Pro MacBook 上跑到每秒86-90个token

两个模型,24小时之内。一个说"30B能本地跑",另一个说"笔记本也能跑得很聪明"。

胜哥觉得,这事儿值得坐下来好好聊聊。


30B模型怎么塞进一张游戏显卡里的

8月10号,Meta 超级智能实验室把 Muse Glimmer 放上了 HuggingFace。Apache 2.0协议——免费下载,免费商用,随便你怎么改。

30B参数什么概念?去年大家还在说"7B能跑、13B勉强、30B想都别想"。30B全精度需要大约55GB显存,一张消费级显卡根本装不下——RTX 4090才24GB

Meta 这波用了4-bit量化。

量化说白了就是压缩——把模型的数字精度从16位砍到4位。牺牲一点点精度,换来内存占用砍到原来的四分之一不到。Meta自己的数据:精度损失只有0.2%到1%——说实话这个数字小到胜哥都有点怀疑,但反正先信着。

结果就是:

  • 语言模型权重压缩到不到20GB
  • 剩下的显存放视觉编码器 + 上下文缓存 + DFlash投机解码器
  • 全部塞进一张24GB显卡里

具体给你列清楚:

  • K-Quant-17GB版本:目标24GB显存。RTX 3090(24GB)、RTX 4090(24GB)都能跑。精度损失约1%
  • K-Quant-Dynamic版本:目标32GB显存。RTX 5090(32GB)。精度损失仅0.2%
  • Mac这边:M4 Max/M5 Max MacBook Pro,32GB统一内存就能跑

Reddit上已经有老哥实测了——RTX 3090单卡,实际占用22到23GB显存,跑起来了。社区反应也快,Unsloth当天就做了GGUF镜像,Ollama、llama.cpp、LM Studio、vLLM全适配了。

速度方面,DFlash投机解码器(一个小模型一次猜16个token,主模型再一次性验证)把速度拉了一大截:

  • RTX 5090:每秒74.9233.4个token(3.1倍)
  • M5 Max:每秒26.650.2个token(1.8倍)
  • M4 Max:每秒23.737.8个token(1.5倍)

这些是Meta自己的数据。独立测试还没大规模出来。但胜哥多说一句——就算打八折,这个速度也够日常用了。

Muse Glimmer不只会聊天。它的能力列表你自己看:

  • 131072 token上下文——一本技术手册从头看到尾
  • 能读图片——图表、截图、文档都能理解
  • 能调用工具——MCP Atlas得分75.5,比同级别的Google Gemma4-31B高了二十多个点
  • 写代码——SWE-Bench Pro 51.2分,30B级别目前最高
  • 超过100种语言

老陈在群里补了一句:

"意思是我3090终于不用只跑Stable Diffusion了。"


同一天,另一个模型也来了——门槛更低

8月11号,蚂蚁百灵在HuggingFace开源了Ling-3.0-tiny。

跟Muse Glimmer走的不是一条路——它更轻、更省、门槛更低:

  • 总参数7.9B,MoE架构,每次推理只激活1.3B参数
  • 提供BF16、FP8、INT4三种精度版本
  • M4 Pro MacBook实测每秒86-90个token
  • 8K上下文下峰值内存才8.34GB
  • 用了Kimi Delta Attention和MLA混合架构,128个路由专家

翻译成人话:一台MacBook就能跑,不需要买显卡,不需要装机。

胜哥看了一眼自己的设备。又看了一眼。默默打开了HuggingFace。

两个模型放一起看,趋势太清楚了——

开源模型正在从"需要一间机房"变成"需要一张好显卡",再变成"一台好笔记本就够了"。

Muse Glimmer把30B的AI能力带到了消费级GPU上。Ling-3.0-tiny把"够用的AI"带到了笔记本上。两条路,一个方向:本地,离线,你的机器。

对咱们垃圾佬来说,这件事到底意味着什么

群里的兄弟大部分是捡旧工作站、组NAS、几百块淘准系统的主。RTX 3090二手多少钱?

海外市场:800到1000美元。 国内闲鱼:大概4500到7000块(2026年8月行情)。

这笔钱不是小数目。胜哥不跟你画饼说"人人都能跑30B模型"——你得先有张24GB的卡。

但关键是,门槛在降低这件事本身。

半年前,想本地跑一个能用的AI,要么花几万块买A100,要么老老实实付API月费。现在呢?

一张用了五六年的二手RTX 3090 + 一个免费开源的30B模型 = 无限次调用。不用联网,数据不出你家门。写代码、读文档、分析表格、做研究——全部在你自己机器上跑。


DDR5内存涨到16G一千多块,存储涨到1T SSD五百起步。但AI模型的推理能力,正在从"按月付费的服务"变成"一次投入的硬件功能"。

你的老工作站插上一张二手3090,它就不是文件服务器了——它是一台AI服务器。

老陈的3090是三年前花九千多买的。

"本来想卖了换50系,现在不卖了。这卡能跑30B模型,比换新卡值。"

当然,不是每个人都要买3090。如果你手头有M系列MacBook、内存32GB以上的,直接用MLX跑Muse Glimmer,Mac的统一内存这时候就是显存。如果是M4 Pro MacBook,Ling-3.0-tiny能跑到你打字都跟不上的速度。

如果你还在用老工作站、没独显、也没MacBook——那就先跑Ling-3.0-tiny。INT4版本在8GB内存的设备上就能跑起来。先体验,再决定要不要升级。

胜哥今天就把话说明白:

24GB显存是本地AI的"入场券"。你不需要最新最贵的卡,二手3090就是现阶段性价比最高的选择。16GB内存是"起步线"——Ling-3.0-tiny这种轻量模型在这个配置上就能流畅跑。

现在该干嘛?三步

① 先别冲动买显卡。

Muse Glimmer才发布两天,社区适配还在进行中。等Ollama/llama.cpp上的实际表现出来、等独立测试数据。二手3090价格目前还算稳,不需要抢。

② 手上有什么用什么,先跑Ling-3.0-tiny。

门槛低。MacBook、台式机都能跑。INT4量化版本8GB内存起步。先体验一下"本地AI是什么感觉",再决定值不值得投钱升级。

③ 如果你已经有了24GB显存卡,现在就去下载。

HuggingFace搜"Muse Glimmer GGUF",Ollama或LM Studio加载,几分钟就能跑起来。胜哥建议先试K-Quant-17GB版本——社区反馈在3090上22GB左右的占用,很稳。

下载地址给你:

  • Muse Glimmer:huggingface.co/meta-models/Muse-Glimmer-30B
    (GGUF量化快速上手版:huggingface.co/meta-models/Muse-Glimmer-30B-GGUF)
  • Ling-3.0-tiny:huggingface.co/inclusionAI/Ling-3.0-tiny
    (另有FP8版:huggingface.co/inclusionAI/Ling-3.0-tiny-fp8
    INT4版:huggingface.co/inclusionAI/Ling-3.0-tiny-int4)

几个容易踩的坑,提前说清楚

量化版别下错。HuggingFace上一堆GGUF变体,K-Quant、Q4_K_M、Q5_K_M……看着差不多,精度和速度差距挺大。胜哥的建议是第一次跑就用官方推荐的K-Quant-17GB,跑通了再换别的折腾。

DFlash要单独装。它是个独立的小模型,不是自动配套的。你要么下载DFlash权重文件,要么用支持它的运行时(llama.cpp的某些版本、ExecuTorch)。否则你只跑到原始速度,看不到那个3.1倍加速。

视觉功能吃显存。Muse Glimmer能看图,但一旦开了视觉编码器,22-23GB显存基本就顶满了。如果你本来在跑30B还想同时处理图像,24GB卡会吃紧。32GB版本(RTX 5090)才真正游刃有余。

Mac的统一内存不是显存,是共享池。MacBook跑的时候系统本身要占一部分内存,所以32GB的MacBook留给模型的实际可用内存可能只有28-29GB。打算用Mac跑的朋友,提前看一下Activity Monitor。

Reddit/Hacker News这两天会吵翻天。这模型8/10才放出来,独立评测、各家量化版本、社区调优建议,会在接下来一周内陆续冒出来。胜哥建议你收藏这文章,过两天再回来看评论区,会比现在信息全得多。

这不是那种"赶紧冲冲冲"的新品。胜哥反而不建议你今天就去下单显卡——等独立测试出来、等社区踩完坑,结论会更清晰。


写完这篇,胜哥想说句大实话。

2025年,本地AI是极客的玩具。2026年8月,两个模型在24小时内同时宣布"你能在自家电脑上跑"。Meta把一个30B模型塞进了一张游戏显卡,蚂蚁把一个8B模型塞进了一台笔记本。

都是Apache 2.0商用协议——随便用,不要钱。这不是巧合。

开源本地AI的时代,真的他妈来了。

你的电脑不再是"终端"。它正在变成"大脑"。一张三年前的旧显卡,现在是一台AI工作站的核心。这事儿搁去年谁敢信?

懂的都懂,不懂的说了也不懂。

(胜哥科技数码聊,专治各种硬件选择困难症。关注胜哥,下期接着聊。)

评论

此博客中的热门博文

130元,买不了吃亏买不了上当!联想P300工作站,垃圾佬的纳斯圣杯?

150块钱的 HP ProDesk 600 G2 SFF 竟然是 NAS 界的神机?

闲鱼150块淘来的“老古董”工作站,摇身一变高性价比NAS?