焦点

一台Mac也能跑Kimi K3!128GB内存硬塞1.6TB权重|tb|mac|gpu|kimi|固态硬盘|token_网易订阅

时间:2010-12-5 17:23:32  作者:焦点   来源:娱乐  查看:  评论:0
内容摘要:编辑|山辉Kimi K3开放完整权重后,不少人都跃跃欲试。2.8 万亿参数、官方 MXFP4 权重,拥有了这些,你就可以自己捣鼓这个规模巨大的模型,可以部署到本地。现实情况真有这么简单吗?有人总结,运

一台Mac也能跑Kimi K3!128GB内存硬塞1.6TB权重|tb|mac|gpu|kimi|固态硬盘|token_网易订阅
编辑|山辉Kimi K3开放完善权重后,也能硬塞硬盘易订阅不少人都跃跃欲试。内存2.8 万亿参数、权重官方 MXFP4 权重,固态具有了这些,也能硬塞硬盘易订阅你就可以自己捣鼓这个规模巨大的内存模型,可以部署到本地。权重现实状况真有这么便捷吗?固态有人总结,运行 Kimi K3 其实很那么点儿,也能硬塞硬盘易订阅只需 1.5TB GPU 内存、内存大约 8 张 H100,权重以及一座小型变电站。固态很快有人算了一笔账,也能硬塞硬盘易订阅按照这张粗略的内存成本表,如果将大容量 GPU 服务器和供电设施都算进去,权重整套配置可能触及百万美元。这么一看,好像已经和我们这些「个人玩家」没什么关系了。也有人不死心,最初认真探究能不能通过量化,把这个 2.8 万亿参数模型强行塞进个人设备。只然而,评比如区对此常用不太乐观。但没想到,还真有人在一台Mac 上跑起来了。128GB 的 Mac,真把 1.6TB 权重塞下了一名开发者拿出一台128GB 统一内存的 M5 Max,直接加载 Kimi K3 发布在 Hugging Face 上的官方 MXFP4 权重。这套权重足足有 1.56TB,体积超过设备内存十倍,显然无法一次性完善载入。他的方式是让约 97GiB 的静态权重常驻内存,其余部分不一次性加载,而是在推理流程中从固态硬盘持续读取。模型运行到哪一层,对应的权重才被送入内存参与方式算。这样一来,128GB 内存不需同时装下整个模型,只需容纳常驻权重和目前参与方式算的部分。最后,Kimi K3 真的开口了。开发者先问了一句「How are you」,模型正常回答「I am fine, thank you」。随后,他又让模型验明正身 Transformer 中的注意力机制,Kimi K3 也最初生成回答。但输出高效度相当缓慢。测试中,模型处理输入的高效度约为0.98 token/s,生成高效度只有0.32 token/s。换算下来,每生成一个 token 大约需三秒。一个正常首先度的回答,可能关键等上几分钟。这至少说明了一件事:一台只有 128GB 内存的 Mac,确实能够以流式读取的方式运行 1.6TB 的 Kimi K3 官方权重。然而,这只处理了容量状况。权首需不断从硬盘搬进内存,模型每生成一个 token,都关键等待大量数据实现读取和方式算,推理高效度自然很难提高。开发者也表示,这套方式划目前题用来调通推理图。下一步,他准备把模型进一步压缩到 Q2,再采取两台各配备 512GB 统一内存的 Mac Studio,尝试把高效度提高到可以正常聊天的水平。显然,如果不想让 Kimi K3 的语高效「快得像闪电」——《疯狂动物城》里的那只树懒,只用一台 128GB 的 Mac 是不行的。80 张 5090,这是真能用后续压缩是不太行了,还有人选项把显卡数量提上去。Ning 团队采取 80 张 RTX 5090,完善运行了 2.8 万亿参数的 Kimi K3。整套系统由 10 个节点组成,每个节点安装 8 张 RTX 5090,总显存实现 2.56TB。团队直接采取 Kimi 官方发布的 MXFP4 权重,没有进一步量化。在首先日测试中,Kimi K3 的单流推理高效度实现了20 token/s。相比 Mac 上的 0.32 token/s,输出高效度提高了六十多倍,基础进入可以正常对话的范围。这套方式划采取仍然是消费级显卡。RTX 5090 搭载 GDDR7 显存,不具有 HBM 和 NVLink,10 个节点之间也只通过 25GbE 以太网连接。80 张 5090 给予了 2.56TB 总显存和约 143TB/s 聚合带宽,高于 32 张 H100 方式划的 107TB/s 和 16 张 B200 方式划的 128TB/s。当然,聚合带宽无法直接代表整套系统的推理性能,多节点通信、算子效率和调度开销都会意义最后高效度。即便如此,20 token/s 的实测结荚已经说明,消费级 GPU 集群也能以可用高效度运行完善 Kimi K3。团队表示,这还只是首先日、未经充分改进的结荚。之前,他们曾将 4090 集群运行 GLM-5.2 的高效度从 30 token/s 提高至 110 token/s,Kimi K3 仍有后续提高效的空间。相比传统的数据中心 GPU 方式划,这条路线减小了对 HBM 和快捷互联设备的依赖,但 80 张 5090、10 个节点,以及配套的网络、供电和散热设施,投入依然相当可观。这么看来,一台 ThinkPad 确实不可能,80 张游戏显卡倒是可以跑。
copyright © 2026 powered by 知来藏往网   sitemap