详情

首页手游攻略 Kimi K3开源了,本地部署,先备好3000万

Kimi K3开源了,本地部署,先备好3000万

佚名 2026-07-29 07:26:56

家人们,关于大模型本地部署的文章,可能到这里就是我最后一次写了

天意如此,绝唱便以我最喜欢的 Qwen3.6-27B 来收官

本地部署 Qwen3.6 比英伟达更会玩,速度提升了 2.5 倍

就在刚刚,Kimi 如约兑现承诺,正式开源 K3 权重,参数量为2.8T

惊人的 1.56 TB,是它的权重文件体积;论开放权重模型的规模,全球没有比它更大的

结论先说:

  • K3 权重是 MXFP4 精度,实测 1.56TB(96 个 safetensors 分片),单台 8 卡 H200(1128GB 显存)连权重都装不下,单节点直接出局
  • 把网络计入后,入门门槛就是两台 8×H200,约 730 万—800 万元,而这仅仅是入场券
  • 按照官方明确给出的 64 卡以上超节点部署建议,若采用8 台 8×H200,约 2900 万—3000 万元
  • 若再把 1M 上下文、并发与高可用考虑进去,这会成为一个达到几千万级别的 AI 基础设施项目

K3 的实力如何

在两个最强闭源模型 Claude Fable 5 与 GPT-5.6 Sol 面前,K3 的整体能力还有差距;放到开源阵营中,它则处于断档领先的位置

Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2

Agent 能力:开源第一梯队包括 JobBench、SpreadsheetBench、AutomationBench 的表现,而 BrowseComp 更以 91.2 分拿下全场第一

这样的实力已经足以让闭源模型感到压力

。。。如今连订阅价格这件事,Kimi 也已经赶上 Claude 和 GPT 了,值得专门一提

每月699 元、199 元、99 元和49 元,分别对应 Kimi 的各档套餐

从高到低看,ChatGPT 各档价格为200 美元(Pro 20x)、100 美元(Pro 5x)、20 美元、8 美元

给人的感觉是,Kimi 直接参考闭源旗舰模型价格,再按汇率换算

缺点同样明显:额度消耗得太快,即使选择 199 的套餐,也很难支撑使用

模型尺寸

K3 在 SFT 阶段便引入量化感知训练(QAT),所以权重原生采用 MXFP4、激活采用 MXFP8;也正因此,这个参数量达到2.8 T的大模型,其模型文件仅有 1.56TB

每参数约 4.25 bit,也就是约 0.53 字节:这是把块级缩放因子计入 MXFP4 的 4 bit 权重后所得的换算结果,据此可以估算:

2.8T 参数 × 0.53 字节 ≈ 1.5TB

注意,这个 1.56TB 已经是”压缩后”的状态了,别指望像 GLM-5.2 那样”换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化

前文:认真算算本地部署 GLM-5.2 需要多少钱?

那篇文章最终判断:若要私有化部署 GLM-5.2 的743B 原版模型,350 万元只能算入场券

那么,本地部署2.8T 的 K3 究竟需要多少钱?

占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留,参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:

1.56TB × 1.18 ≈ 1.84TB

好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现

坏消息在于,面对这样的显存需求,单机时代已经结束

根据我掌握的数据,今年内存和硬盘大幅涨价,一台完整的 8×H200 SXM 服务器要从350 万元起步

看看长鑫科技的涨幅和市值,未来内存依旧会像金子一样。。。

主流推理框架最适合在16、32、64这样的卡数上分片,因为它们属于 2 的幂次方;多机推理涉及张量并行与专家并行,照此规划卡数最省心

Kimi K3 本地部署的三档方案比较

入场券方案一:约 730 万—800 万元,配置为16 卡、两台

16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档

进入多机部署后,高速网络不可避免,需要200G 起步的 RDMA 交换机、光模块与线缆:

项目预算
两台 8×H200 服务器约 700 万元
高速网络及线缆约 30 万—100 万元
合计约 730 万—800 万元

舒适档方案二:约 1450 万—1550 万元,配置为32 卡、四台

显存达到4512GB,除权重外还能留下约 3TB 余量,此时长上下文和可观的并发才开始具备实现条件

官方推荐姿势方案三:约 2900 万—3000 万元,配置为64 卡、八台

官方技术博客的原话指出:更大的高带宽通信域有助于提升推理效率,K3 的部署配置,建议选择 64 卡以上的超节点

项目预算
八台 8×H200 服务器约 2800 万元
高速网络及线缆约 100 万—200 万元
合计约 2900 万—3000 万元

达到这个规模后,机房也必须同步升级:单台整机功耗约 10.2kW,八台合计80kW+,高密机柜、PDU、供电改造和散热都要调整,不过与整机采购相比,这些费用已经不算多

最后

前面谈到了长鑫科技,

刚才刷到一个讲述长鑫与合肥故事的视频,心里有些感触再多说两句

三星、海力士、美光三家当年控制着内存,涨价或断供都由它们说了算,国内厂商连牌桌都上不了。面对无人看好的局面,合肥依然拿出真金白银,陪长鑫熬了快十年冷板凳,经历了流片失败,也走过了良率爬坡。到了今天——恰逢内存涨价周期,任何人都已经无法绕开长鑫这个名字

同样的剧本,如今正在大模型行业再次上演

看看现在使用 Claude 有多别扭:一边遭到 Anthropic 封号,一边在群里指责它霸道,骂完之后又转身寻找渠道请求续上——被拿捏到这种程度,能不生气吗?

当然生气,可又无可奈何,毕竟对方的模型确实强

长鑫的故事并没有玄妙道理:一个被卡脖子的行业,只有一条出路,就是自己把产品造出来,并且造得足够好

GLM-5.2、Kimi K3 们正在沿着这条路前进。差距依然存在,但方向已十分清晰:闭源模型每封一次号、涨一次价、增加一次区域限制,都会把用户送给国产开源模型

内存领域我们坚持了十年,大模型不必等待那么久

等到那一天,想封号就封吧,随便封

本文由作者【老章很忙】原创/授权发布于平台,微信公众号为【Ai学习的老章】,未经许可禁止转载。
点击查看更多
推荐专题
热门阅读