博文

目前显示的是标签为“Ling-3.0-tiny”的博文

凌晨被群消息炸醒:Meta把30B模型塞进20GB,二手3090能再战三年

图片
  昨晚十一点多,胜哥准备关电脑睡觉。 手机震了一下。群里老陈甩了个链接,配了三个感叹号。 "兄弟们快看这个!!!!!!!" 胜哥点开。HuggingFace 页面。Muse Glimmer。往下翻—— 30B参数 ,Apache 2.0开源。往下翻——4-bit量化后不到 20GB , 24GB 显存的显卡就能跑。往下翻——DFlash投机解码,RTX 5090上从每秒 74.9个token 蹦到 233.4个 。三倍。 胜哥放下手机,想了想,又拿起来,把链接转发到了另一个群。 然后可能是老陈的猫跳上了他的键盘,发了一条全是"asdfghjkl"的消息。老陈回了句: "猫在我键盘上跑,可能猫也觉得能跑哈。" 就是这种时候,垃圾佬的直觉会告诉你——有什么东西变了。 结果第二天早上刷新闻,蚂蚁百灵 Ling-3.0-tiny 也开源了—— 7.9B参数 ,MoE架构,M4 Pro MacBook 上跑到每秒 86-90个token 。 两个模型,24小时之内。一个说"30B能本地跑",另一个说"笔记本也能跑得很聪明"。 胜哥觉得,这事儿值得坐下来好好聊聊。 30B模型怎么塞进一张游戏显卡里的 8月10号,Meta 超级智能实验室把 Muse Glimmer 放上了 HuggingFace。Apache 2.0协议——免费下载,免费商用,随便你怎么改。 30B参数什么概念?去年大家还在说"7B能跑、13B勉强、30B想都别想"。30B全精度需要大约 55GB显存 ,一张消费级显卡根本装不下——RTX 4090才 24GB 。 Meta 这波用了4-bit量化。 量化说白了就是压缩——把模型的数字精度从16位砍到4位。牺牲一点点精度,换来内存占用砍到原来的四分之一不到。Meta自己的数据:精度损失只有 0.2%到1% ——说实话这个数字小到胜哥都有点怀疑,但反正先信着。 结果就是: 语言模型权重压缩到不到 20GB 剩下的显存放视觉编码器 + 上下文缓存 + DFlash投机解码器 全部塞进一张 24GB 显卡里 具体给你列清楚: K-Quant-17GB版本 :目标 24GB 显存。RTX 3090(24GB)、RTX 4090(24GB)都能跑。精度...