Kimi K3 深度研究:2.8T 开源前沿模型的评测、训练、推理经济与部署全景
| 日期 | 版本号 |
|---|---|
| 2026-07-22 | v1.2 |
| 2026-07-19 | v1.1 |
| 2026-07-18 | v1.0 |
本报告主要基于 Moonshot AI 官方一手材料、Artificial Analysis 独立评测、VentureBeat / Axios / Bloomberg / CNBC 等国际权威媒体,以及 Simon Willison 一手实测等高 / 中权重来源;Hacker News 与 X 社区情绪、自媒体转述仅作低权重参考,已在文中逐条标注。
核心结论
- 定位:开放权重模型首次摸到闭源前沿门槛。 Kimi K3(2026-07-16 发布)总参数 2.8T、MoE 架构(896 专家激活 16)、100 万 token 上下文、原生视觉,是全球最大参数规模的开放权重模型、首个"3T 级"开放模型;权重承诺 2026-07-27 前开源(来源:Moonshot 官方博客 | 权重:高)。
- 综合智能全球第 4,编程全球第 1。 Artificial Analysis 智能指数 57 分(189 个模型中第 4),仅次于 Claude Fable 5(~60)与 GPT-5.6 Sol(~59),领先 Claude Opus 4.8(~56);Arena.ai 前端代码竞技场 1679 分登顶,7 个细分领域拿下 6 项第一(来源:Artificial Analysis / Arena.ai,经 The Decoder、VentureBeat 转引 | 权重:高)。
- 成本:单任务成本进入与 GPT-5.6 Sol 同档、约为 Opus 4.8 一半的区间。 AA 实测单任务成本 $0.94 vs GPT-5.6 Sol $1.04 vs Opus 4.8 $1.80;API 定价 $3/$15(缓存命中 $0.30)约为 Fable 5($10/$50)的三分之一,但已是前代 K2.6 的约 3 倍——"超低价中国 AI"时代结束(来源:Artificial Analysis、Kimi API 文档 | 权重:高)。
- 训练:架构创新驱动约 2.5 倍扩展效率,但关键算力数据未披露。 KDA 混合线性注意力(百万上下文解码最高 6.3 倍加速)+ Attention Residuals(<2% 成本换 ~25% 训练效率)+ 全均衡专家并行 + MXFP4/MXFP8 原生量化感知训练;训练 token 量、GPU 小时、训练成本待 7 月 27 日技术报告披露(来源:Moonshot 官方博客 | 权重:高)。
- 芯片:主体仍是英伟达,国产芯片在测,官方未确认。 2026 年 2 月 Moonshot 公开求购 NVIDIA H20 并测试华为昇腾;旁证为美团 LongCat-2.0 被官方口径称为"首个完全依靠国产算力完成训推全流程的万亿参数模型"(来源:公开报道,官方未披露,待验证 | 权重:中)。
- 推理需求:处于 Agent 驱动的 token 通胀通道。 OpenRouter 周调用量一年内从 2.1T 升至 46.7T token(2026-06-21 当周);K3 发布两天在 opencode 编程场景录得 58B token、平均单会话 210 万 token、缓存命中率 93%(来源:OpenRouter、opencode.ai | 权重:中)。
- 开源部署是数据中心级工程。 原生 MXFP4 权重约 1.4–1.5TB,FP16 约 5.6TB;官方推荐 64+ 加速卡 supernode;消费级硬件不可行,8×A100 80GB 为理论下限(来源:Moonshot 官方博客、servergurus / vramcalculator 测算 | 权重:中)。
- 风险与待验证: 幻觉率从 K2.6 的 39% 升至 51%(准确率 33%→46%),事实型负载需保留核验;隐藏约 85 token 系统提示;官方评测混用 KimiCode / Claude Code / Codex 三种 harness,跨模型可比性需打折(来源:Artificial Analysis、Simon Willison 实测 | 权重:高 / 中)。
- SemiAnalysis 7/19 专题:KDA 不削弱硬件需求,反而净增。 KDA 虽将 KV 缓存传输带宽需求最高降约 10 倍,但 2.8T 权重占 1.5TB+ HBM、WideEP 使单次前向计算产生 120+ 次专家交换(每层每次前向都发生,而 KV 传输整个对话仅一次),叠加 KV 卸载带动 DDR5/NVMe 需求;杰文斯悖论下效率降本将推动上下文向 500 万+ token 与应用规模扩张——GPU、HBM、DRAM、网络总需求不降反升;且 64 卡超节点并非英伟达独占,昇腾 950 SuperPod 同为 64 芯片配置(来源:SemiAnalysis 7/19 报告,公众号全文转述 | 权重:高)。
- 训练侧新增口径(国泰海通纪要): 训练数据预计至少 30 万亿 token(较以往翻倍,专家推测待验证);预训练成本占比约 60%+(两年前 >90%),后训练 30–40% 且持续上行;2.5 倍扩展效率归因为模型端约 6 成、硬件形态推理加速约 3 成、KV Cache 等约 1 成;推理瓶颈中 GPU FLOPs 占比或已降至两成以下,通信与存储成为主战场(来源:国泰海通证券电话会议纪要 7/17,专家观点 | 权重:中)。
- 第三方生产级验证落地(7/21–7/22 增量): Fireworks 独立实测约 1030 个 agentic 任务,K3 与 Fable 5 总体打平(SWE 92.4% vs 92.6%)、成本最高省约 50 倍,oracle 路由 93% 准确率、72–96% 任务分给 K3;微软内部评估将部分 Copilot 推理迁至 K3,测算年省最高 6 亿美元(仍"评估"非确认部署)(来源:Fireworks 官方博客——托管厂商自测、存在利益相关;The Information 经 IT之家转述 | 权重:中)。
- 需求打满与商业化推进(7/20–7/22 增量): K3 上线 48 小时 GPU 需求打满、Moonshot 暂停新订阅(The Decoder 与北美一线调研双源同口径);发布两天进 OpenRouter 日榜前十(7/18 当日约 1420 亿 token);月之暗面递交港股 IPO、ARR 三个月翻三倍,Kimi Work / Kimi Hosted Agent / kimi-cli 把 K3 从单模型延展为 agent 产品栈(来源:The Decoder、北美一线调研、AI HOT 聚合 | 权重:中 / 低-中)。
- 反向校准:换 ECI 尺子,中美差距仍有 4.4–6.1 个月。 按 AAI 日常实用性口径差距仅 1.5–2.9 个月,但按 Epoch ECI 潜在通用能力口径,K3(初步 ECI 155.53)相对美国前沿后向差距约 4.37–6.08 个月,FrontierMath 不具前沿竞争力;"追平"结论高度依赖评测尺子,安全/CBRN 与严肃数学维度证据缺位(来源:Lisan al Gaib Substack 引 Epoch AI 数据 | 权重:中)。
正文
一、水平评测
1.1 整体水平
- AA 智能指数 v4.1:57 分,全球第 4(共 189 个模型)——开放权重模型首次进入该位置(来源:Artificial Analysis,经 The Decoder 转引 | 权重:高)。
- Arena.ai 前端代码竞技场:1679 分第 1,高于 Fable 5(1631)与 GPT-5.6 Sol(1618),较 K2.6 的第 18 名跃升 17 位(来源:Arena.ai / LMArena,经 VentureBeat 转引 | 权重:高)。
- 长程知识工作 AA-Briefcase:Elo 1547,第 2,比 K2.6 提高 732 分,仅 Fable 5 更高;rubric 评分与分析质量接近 Fable 5(来源:Artificial Analysis | 权重:高)。
- 代表性单项:Terminal-Bench 2.1 得 88.3(GPT-5.6 Sol 88.8、Fable 5 / Opus 4.8 均 84.6);GPQA Diamond 93.5%(发布时最强开源成绩);BrowseComp 91.2%;HLE(带工具)56.0%;1M 上下文无技巧评测 90.4 分(来源:Moonshot 官方博客、Artificial Analysis | 权重:高)。
- 官方坦承整体仍落后 Fable 5 与 GPT-5.6 Sol;35 项官方测试中约 7 项第一,多数第二/第三(来源:Moonshot 官方博客、The Decoder | 权重:高)。
- ⚠️ 幻觉率反向上升:AA-Omniscience 上准确率从 K2.6 的 33% 升至 46%,但幻觉率从 39% 升至 51%——答得更多的同时编造也更多,事实型工作负载必须保留人工核验(来源:Artificial Analysis,经 The Decoder 转引 | 权重:高)。
1.2 与 GPT-5.6 Sol / Opus 4.8 / Fable 5 的水平与成本对比
| 维度 | Kimi K3 | GPT-5.6 Sol | Claude Opus 4.8 | Claude Fable 5 |
|---|---|---|---|---|
| AA 智能指数 | 57 | ~59 | ~56 | ~60 |
| GDPval-AA v2(Elo) | 1668(官方基准表口径;VentureBeat 另报 1687,见信源冲突提示) | 1748(官方基准表) | 1600 | 1760 |
| 前端代码 Arena | #1,1679 | 1618 | — | 1631 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 84.6 | 84.6 |
| API 输入/输出($/M token) | $3 / $15(缓存命中 $0.30) | $5 / $30 | — | $10 / $50 |
| 单任务成本(AA 实测) | $0.94 | $1.04 | $1.80 | 更高 |
(来源:Artificial Analysis、Kimi API 文档、The Decoder 价格表 | 权重:高)
要点:
- 水平:综合智能 K3 小幅落后 GPT-5.6 Sol(57 vs 59)、小幅领先 Opus 4.8(57 vs 56);14 项对比测试中击败 GPT-5.6 Sol 达 11 项、全面击败 Opus 4.8;编程、视觉、长程任务稳定超过 GPT-5.5 与 Opus 4.8(来源:Artificial Analysis、掘金/SegmentFault 转述 AA 数据 | 权重:高 / 中)。
- 成本:单 token 价格约为 K2.6 的 3 倍,但因 token 效率提升(完成同等 9 项评测输出 token 比 K2.6 少 21%,132M vs 166M,同时指数得分提高 13 分),单任务成本 $0.94 反而低于 GPT-5.6 Sol、约为 Opus 4.8 的一半;不过仍远高于开源同行 GLM-5.2($0.32)与 DeepSeek V4 Pro($0.04)(来源:Artificial Analysis | 权重:高)。
- 定价转向:$3/$15 与 Anthropic Sonnet 5 同档,Simon Willison 指出这是"中国实验室有史以来最贵的模型",标志 Moonshot 不再对旗舰做折扣定价(来源:Simon Willison 博客、modemguides 转述 | 权重:中)。
二、训练维度
2.1 算力与算力方法
- 官方已披露:相比 K2 整体 scaling efficiency 提升约 2.5 倍(同等算力转化更强智能);从 SFT 阶段起采用量化感知训练(MXFP4 权重 + MXFP8 激活)以"适配更广泛硬件";引入完全均衡的专家并行训练(静态形状、关键路径无主机同步)(来源:Moonshot 官方博客 | 权重:高)。
- 官方未披露:训练 token 总量、GPU 小时数、训练总成本,将随技术报告(与权重同步)公布(来源:Moonshot 官方博客、财联社 | 权重:高)。
- ⚠️ 以下来源权重低,仅供参考:发布前有第三方按 3–4T MoE 规模估算训练成本约 $50–80M(基于 H200/H20 集群现价),非官方推算,仅供量级参考(来源:tokenmix.ai | 权重:低,仅供参考)。
2.2 训练方法核心亮点
- KDA(Kimi Delta Attention):混合线性注意力,线性注意力与完整注意力交错组合,百万 token 上下文解码速度最高提升 6.3 倍;设计周期约 1.5 年,前身 Kimi-Linear 已 MIT 开源(来源:Moonshot 官方博客、learnku 技术社区 | 权重:高 / 中)。
- Attention Residuals(AttnRes):以深度方向注意力替代传统残差连接,<2% 额外成本换约 25% 训练效率提升;2026 年 3 月 arXiv 论文,四个月后即进旗舰(来源:Moonshot 官方博客、lilting.ch | 权重:高 / 中)。
- Stable LatentMoE + Quantile Balancing:896 专家 / 激活 16 的极端稀疏度下,直接按路由分数分位数分配专家,消除启发式更新与敏感超参(来源:Moonshot 官方博客 | 权重:高)。
- Per-Head Muon:Muon 优化器扩展到按注意力头独立优化;配合 SiTU 激活函数与 Gated MLA(来源:Moonshot 官方博客 | 权重:高)。
- 原生 QAT:4bit 权重是训练原生精度而非事后压缩,开源后低精度部署接近无损——这是该规模模型的首创(来源:Moonshot 官方博客、vramcalculator.com | 权重:高 / 中)。
2.3 训练 / 推理用国产芯片还是英伟达?
- 官方未明确披露训练芯片,技术报告发布前无权威定论(来源:Moonshot 官方博客 | 权重:高)。
- 可核实的公开事实:2026 年 2 月 Moonshot 曾在微博公开求购 NVIDIA H20,并透露华为昇腾芯片在测试中——指向主力训练算力仍为英伟达(H20/H200 级),国产芯片处验证 / 补充阶段(来源:chaobro.com 汇总公开报道 | 权重:中,单一来源,待验证)。
- 旁证:财联社报道同期将美团 LongCat-2.0 称为"业界首个完全依靠国产算力完成训练与推理全流程的万亿参数模型",隐含 K3 并非全国产算力(来源:财联社 | 权重:中)。
- 推理侧:MXFP4 QAT 的设计目标即广泛硬件兼容,官方建议 64+ 加速卡 supernode,未绑定特定厂商(来源:Moonshot 官方博客 | 权重:高)。
三、推理维度
3.1 推理端需求量
- 行业背景:OpenRouter 平台周调用量从一年前的 2.1T token 升至 2026-06-21 当周的 46.7T token(连续九周上涨,2026 年内周消耗增长约 280%),前四模型全部来自中国厂商(来源:OpenRouter 数据,经 36 氪、东方财富转引 | 权重:中)。
- K3 早期信号:发布两天即在 opencode 编程场景录得 58B token(约 2.8 万会话、2 万独立用户),平均单会话 210 万 token、输入缓存命中率 93%、平均单会话成本 $1.31——典型 Agent 长程任务负载形态(来源:opencode.ai 使用数据 | 权重:中)。
- 结构性判断:K3 默认且仅提供 max thinking 档,单请求 token 消耗显著高于普通对话模型;Agent 工作流(100K–1M token 调用区间)是推理需求的主要放大器(来源:财联社、OpenRouter 官方说明 | 权重:中)。
3.2 基于单任务成本的 Token 消耗与成本计算
官方定价:输入(缓存未命中)$3/M、输入(缓存命中)$0.30/M、输出(含推理 token)$15/M,全上下文长度统一价(来源:Kimi API 文档 | 权重:高)。
计算框架:
单任务成本 = (输入 token + 约 85 隐藏系统提示) × $3/M(缓存命中则 $0.30/M)
+ 输出 token(含思维链,占比约 80%)× $15/M
- 实测锚点 1(Artificial Analysis):K3 完成 9 项智能评测共消耗约 1.32 亿输出 token,单任务平均 $0.94——典型评测任务 ≈ 5–6 万输出 token(来源:Artificial Analysis | 权重:高)。
- 实测锚点 2(Simon Willison 一手实测):单张 SVG 生成消耗 95 输入 + 16,658 输出 token(其中 13,241 为推理 token),成本 $0.25;并发现约 85 token 的隐藏系统提示(模型拒绝透露内容)——每次调用存在固定隐性输入开销(来源:Simon Willison 博客,经 CSDN 转译 | 权重:中)。
- 实测锚点 3(opencode 编程会话):平均单会话 2.1M token、$1.31;因 93% 输入走缓存($0.30/M),成本被大幅压低;官方称编码负载缓存命中率可超 90%,由 Mooncake 分离式推理架构(FAST 2025 最佳论文)支撑(来源:opencode.ai、Moonshot 官方博客 | 权重:中 / 高)。
四、开源部署:硬件需求量化
权重 2026-07-27 发布,原生 MXFP4。量化测算如下(来源:servergurus、vramcalculator、wan27.org 三方测算,口径一致 | 权重:中):
| 配置档位 | 可行性 | 说明 |
|---|---|---|
| 消费级 GPU(24GB)/ Mac Studio 512GB | 不可行 | 最低可行量化也放不下 |
| 4× RTX PRO 6000(共 384GB) | 勉强 | 需激进 2bit 量化,个位数 tok/s |
| 8× A100 80GB(共 640GB) | 理论下限 | MXFP4/INT4 可装入,约 5–15 tok/s |
| 8× H100/H200、16× H200 | 生产入门 | FP16 权重需 ~5.6TB,8 卡很紧 |
| 64+ 加速卡 supernode | 官方推荐 | 专家并行需要大高带宽通信域,互联与显存同等重要 |
关键数字:
- 权重体积:MXFP4(约 4.25 bit/参数)≈ 1.4–1.5TB;BF16/FP16 约 5.6TB;下载量约为 DeepSeek-R1 671B(407GB Q4)的 3.7 倍(来源:vramcalculator、rohitai | 权重:中)。
- 每 token 激活约 50B 参数,计算量相当于大稠密模型;但 MoE 要求全部 896 个专家权重驻留内存并可高速路由——稀疏性省算力不省显存(来源:servergurus、rohitai | 权重:中)。
- KV 缓存:1M 上下文估算 200–400GB,精确值需等 config.json 公布(KDA 正是为压缩该项而设计)(来源:servergurus 估算 | 权重:中,估算值,待验证)。
- 总推理显存底线:MXFP4 部署约 1.5–2TB 起步(权重 + KV + 激活开销)(来源:wan27.org | 权重:中)。
- 经验法则:跑不动 K2.6(594GB、含 KV 约 700GB)就不用考虑 K3;能跑 K2.6 的硬件,内存需求 ×2.8 即 K3 门槛(来源:wan27.org | 权重:中)。
- 软件栈:Moonshot 已向 vLLM 社区贡献 KDA prefill-cache 实现,随权重一同发布;llama.cpp / GGUF 生态支持预计需数周至数月(来源:Moonshot 官方博客、wan27.org | 权重:高 / 中)。
五、国外媒体覆盖与市场反应("Kimi moment")
- 媒体全景:VentureBeat("史上最大开源模型,媲美美国顶级系统")、Axios("中国开放权重模型以前沿级结果震惊 AI 界";Mozilla CTO 评论"现在这就是美国 vs 中国的问题")、Bloomberg("缩小与美国对手差距")、CNBC("可对标 OpenAI 与 Anthropic")、Fortune、TechCrunch、Tom's Hardware 均在 24 小时内覆盖(来源:Techmeme、bregg.com 汇总核对 | 权重:中)。
- 估值与商业化:Moonshot 半年内估值从 180 亿升至 315 亿美元,ARR 突破 3 亿美元(来源:CNBC,经 BlockBeats 转引 | 权重:中,单一来源,待验证)。
- 市场冲击:发布后智谱单日 -28.5%、MiniMax -15.6%、阿里 -4%;台积电 -7%、软银 -9%;纳指 100 -1%、英伟达 -1.2%;Bloomberg 称之为"Kimi moment"——投资者重新质疑西方 AI 基建资本开支回报(来源:unwire.pro、中财网 | 权重:中)。
- 投行观点:美银证券称"AI 行业领先地位正变得短暂",阿里"开源领导者"叙事面临考验(来源:美银证券,经 TradingKey 转引 | 权重:中,转述)。
- 社区情绪(低权重,仅供参考):HN 发布 6 小时 836 分登顶(最终约 1052 分 / 656 评论);代表性观点认为"不再是落后六个月,而是几周";实测用户称 $100 Kimi 编程套餐额度约等于 $200 Anthropic Fable 套餐;X 上 CMU 教授 Ruslan Salakhutdinov(杨植麟博导)发帖祝贺获 22 万浏览(来源:Hacker News / X,经 eesel.ai、新浪科技转述 | 权重:低,仅供参考)。
- SemiAnalysis:7/19 已发布 K3 专题报告,要点见下文第六节。
六、SemiAnalysis 与国泰海通纪要增量(2026-07-19 补充)
6.1 SemiAnalysis 7/19 专题:KDA 省带宽,但硬件总需求不降反升
- 市场误解的起点:KDA 可将 KV 缓存传输的网络需求最高降低约 10 倍,部分投资者类比 DeepSeek R1 时刻,恐慌"英伟达 GPU、HBM、DRAM、网络设备需求将被削弱"(来源:SemiAnalysis 7/19 报告,公众号全文转述 | 权重:高)。
- SemiAnalysis 的四层反驳(来源:同上 | 权重:高):
- 模型体重压垮效率幻觉:2.8T 参数权重本身占用 1.5TB+ HBM;每次前向计算约需 1.5TB HBM 带宽,仍需 GB300 NVL72 级高带宽互联;K2(1T)最小部署单元仅 16 卡,K3 官方要求 64+ 卡超节点——参数翻倍带来的硬件门槛跃升远非单一注意力机制的效率提升所能抵消。
- WideEP 的代价:896 个专家分散部署到不同 GPU(每张卡只存少量专家),单次前向计算需执行 120+ 次分发与合并操作;KV 缓存传输在整个对话周期仅发生一次,而专家间权重交换在每一层、每一次前向计算中都发生——KDA 节省的带宽可能被 WideEP 大幅抵消甚至净增加。GB200/GB300 NVL72 铜背板带宽为同级 DGX B200 系统的 18 倍,恰好承接该需求。
- HBM 未减负 + 卸载外溢:即便 KDA 与 Gated MLA 降低缓存单位占用,权重已占满 HBM;中等并发下 KV 缓存必须卸载至 CPU DDR5 内存与 NVMe 固态——额外带动 DRAM 与高速存储需求。
- 杰文斯悖论:效率提升降低单次推理成本 → 上下文从 100 万向 500 万+ token 演进、应用场景与用户规模扩大 → 算力总需求持续上涨。
- 关键补充:并非英伟达独家受益。64 芯片扩展域不一定是 NVL72——华为昇腾 950 SuperPod 同为 64 芯片配置,具备类似 NVLink 的统一总线(UB)内存扩展能力,可跨 16 个机架扩展至 1024 颗 NPU(来源:SemiAnalysis 报告援引知情人士 | 权重:高)。
- 投资含义:不应将模型效率提升解读为硬件需求利空;能承接大规模部署、具备强互联能力的高端 AI 基础设施(NVL72 系列、昇腾 SuperPod 等)以及 HBM/DRAM/NVMe 是效率革命的长期受益方(来源:SemiAnalysis | 权重:高)。
6.2 国泰海通电话会议纪要(7/17 晚《Kimi K3 解密》,已核实版)
- 训练成本结构:预训练占比约 60%+(两年前 >90%,Kimi 当时或 >95%),后训练 30–40% 且逐步提升,趋势上预训练有望降至约 50%;后训练成本大头是数据获取(蒸馏成本越来越高)与专用数据制造(来源:国泰海通证券电话会议纪要,专家观点 | 权重:中)。
- 训练数据量:专家预计本版至少 30 万亿 token,较以往翻倍(推测,待 7/27 技术报告验证)(来源:同上 | 权重:中,专家推测)。
- 2.5 倍扩展效率归因:系统性创新——网络架构 / 训练方法 / 推理量化单项各不超 50%,系统工程合成;归因推断为模型端约 6 成、结合硬件形态的推理加速约 3 成、KV Cache 等缓存约 1 成(来源:同上 | 权重:中,专家推断)。
- 未公开细节:KDA 层与 MLA 层的比例设计(Kimi Linear 公开方案约 3:1)未披露,可按层间激活比例自动调整数据通路,待 7/27 权重确认(来源:同上 | 权重:中)。
- 推理瓶颈结构:GPU FLOPs 占比或已降至 两成以下,其余全靠通信与存储——超节点是受限算力下的解法("DeepSeek 提出并验证、Kimi 贯彻到近 3 万亿参数规模")(来源:同上 | 权重:中)。
- 国产算力:K3 推理相关环节对昇腾 950 应有原生支持,能用国产算力跑出高效、相对省成本的结果(来源:同上,专家判断 | 权重:中,待验证)。
- C 端定价与毛利:会员四档 49 / 99 / 199 / 699 元/月(Andante / Moderato / Allegretto / Allegro),约一年未变;C 端毛利率可能低于 10%,后续或提价或整合价格体系;B 端定价与 ARR 是更好的参考点(来源:同上 | 权重:中)。
- 行业判断:2026 年两大核心方向为大模型自我训练与超长程任务;模型迭代速度或提升 3–4 倍(大版本约 3 个月一发、小版本 2 周–1 个月一发);45nm 芯片设计演示与 AI 自我优化训练"异曲同工"(来源:同上,专家预期 | 权重:中)。
- ⚠️ 口径警示:纪要主持人称 K3"综合水平全球第三、部分细分反超 Fable 与 GPT-5.6",与官方口径(整体仍落后 Fable 5 与 GPT-5.6 Sol)不一致,纪要自身已标注以官方为准。
6.3 低权重线索:雪球《产业专家交流:KIMI K3 与算力产业》(7/19)
⚠️ 以下来源权重低(雪球帖子 / 无法核实出处的专家口述),仅供参考,不构成核心结论依据。
- 训练资源:K3 训练使用接近 2 个 B300 万卡集群 + 数个 H200 集群,算力主要来自阿里云(阿里持股超 30%);6 月 Qwen 训练算力紧张减供后,Kimi 转向 AWS 等海外采购(8 卡服务器月租超 50 万元)。
- 推理需求强度:199 元套餐 10–12 小时即可烧完;K3 周末全天处于高峰不可用状态;专家称推理算力需求为 3–4 倍。
- 算力供需与价格:Kimi 账上近 400 亿现金、预计至少 2/3 投算力;智谱 + Kimi 两家训练 + 推理需求近 400 亿/年 ≈ 13 个万卡集群;下半年国内 B300 到货不超 1 万台;B300 五年闭口长协租金接受度已超 28 万/月(年内涨 3 倍)、违约罚则 30–40%、另有 10% 预付;Q2 交付 256 台 B300 以上的 A 股公司不超 6 家。
- ROI 论证:纯推理 ROI >10、含训练 ROI >3、云厂商 ROI >2——"几乎每个环节都在赚钱",算力再涨 1–2 倍也便宜(专家观点)。
七、2026-07-22 增量:第三方生产级验证、需求打满与"路由时代"
本节基于 7/20–7/22 新入库素材(Fireworks 实测、The Decoder / The Information 报道、Lisan al Gaib × Epoch AI、ZeroHedge × DB、北美一线调研等),对第一至五节形成补充与交叉验证;与 7/19 前内容冲突处以高权重来源为准。
7.1 Fireworks 独立实测(7/21):K3 + Fable 路由 > 任一单模型
- 总体打平、分项分化:约 1030 个真实 agent 循环任务(SWE 460 / 多语言 225 / 法律 120 / 算法 100 / 终端 89),同一 harness 下 K3 与 Fable 5 总分差在几个点以内——SWE 92.4% vs 92.6%;但按领域拆分后各有所长:K3 强于符号数学、开发工具、终端安全与密码学(89 项终端任务中独占胜出 11 vs 7,拿下安全/加密集群)与法律;Fable 强于多语言广度(Java/Python/C++)与网页、数据可视化(来源:Fireworks 官方博客 | 权重:中——托管厂商自测、存在利益相关,但方法论与数字可复核)。
- 成本:最高约 50 倍优势,且五类任务全线更便宜。差距来源是 token 定价 + 提示缓存 + 单任务工作量结构:SWE 上 K3 干得更多(约 55 轮 / 130 万 token vs Fable 21 轮 / 13 万 token),但缓存命中把额外输入成本压平;终端长任务上则反过来,Fable 会陷入循环(64 轮 / 150 万 token,有时直接超时)。代价是挂钟时间更长——后台大规模跑 agent 时账单优先、实时交互时速度优先(来源:同上 | 权重:中)。
- "不要选模型,要路由":oracle 路由(理论上限,逐任务选最便宜正确者)准确率达 93%,72–96% 任务流量分给 K3——路由后整体质量超过任一单模型、成本接近只用便宜模型。Fireworks 的判断:"单一模型既浪费资源,也已不再是 SoTA;最优 AI 不再出自单一实验室,而是多模型混合;路由器才是护城河"(来源:同上 | 权重:中)。⚠️ 注意 oracle 路由是理论上限,实用路由需多一个数量级的路由数据才能逼近;且该结论由 K3 托管方提出,与其商业利益一致,独立复现待第三方。
- 同篇公告 Fireworks 宣布 D 轮融资与 10 亿美元 ARR(来源:同上 | 权重:中,厂商自报)。
7.2 需求侧:从"供不应求"到"西方一线厂商生产级评估"
- 需求打满(双源确认):K3 上线 48 小时内 GPU 需求触顶,Moonshot 暂停新用户订阅(The Decoder);北美一线调研(7/22)同口径确认,并补充托管 Kimi 的 Databricks 多区域 GPU 全面紧缺、Fireworks 日处理超 40 万亿 token、Baseten 日处理 30 万亿 token——全行业推理算力供给紧张(来源:The Decoder;北美一线调研纪要 | 权重:中 / 低-中)。
- OpenRouter 早期流量:发布两天进日榜前十,7/18 当日调用量约 1420 亿 token;初期 Moonshot 为唯一 provider,429 频发——开放权重不等于市场立刻有足够 GPU 稳定承载(来源:《当开源模型逼近闭源,谁会成为 AI 世界的路由器?》| 权重:中)。
- 微软 Copilot 评估迁移:The Information(经 IT之家转述)报道微软内部测试 K3、评估将部分 Copilot 推理从 OpenAI/Anthropic 迁出,内部测算年省最高 6 亿美元云基础设施成本——国产开源旗舰首次进入西方一线厂商生产级评估;目前仍是"评估"而非确认部署(来源:The Information 转述 | 权重:中,待确认)。
- 商业化与产品栈:月之暗面递交港股 IPO,ARR 三个月翻三倍;Kimi Work(agentic workspace,HN 515 分)、Kimi Hosted Agent B2B 平台(官方称 B 端收入七成来自 API 调用)、kimi-cli 相继上线——K3 从单模型延展为"模型→agent 产品栈",开放权重商业模式验证被向前推进一步(来源:AI HOT 聚合、Hacker News | 权重:低-中,多为厂商口径)。
7.3 反向校准:ECI 口径下中美差距仍有 4.37–6.08 个月
- 两把尺子两个答案:Lisan al Gaib(Substack,引 Epoch AI 数据)测算——按 AAI(偏日常实用性、短跨度编程/智能体任务)K3 后向差距仅 1.5–2.9 个月,趋势线外推中国 2027 年末超美;但按 ECI(IRT 项目反应理论统一尺度、衡量潜在通用能力),K3 初步 ECI 155.53(90% CI [153.87, 158.21]),后向差距 4.37–6.08 个月,且趋势线不相交(来源:Lisan al Gaib Substack / Epoch AI | 权重:中,方法论透明但含推测成分)。
- 官方基准构成偏科:35 项官方基准中视觉 + 智能体占 24 项;无长上下文、无网络安全/CBRN 等安全基准、无严肃数学(FrontierMath 上 K3 不具前沿竞争力,仍落后发布 7 个月的 GPT-5.2-Pro)、无 token 效率基准——"追平"结论高度依赖尺子(来源:同上 | 权重:中)。
- 反向证据链:UK AISI Cyber Range 长程攻防环境中 GLM-5.2 仅与 Opus 4.5 相当;尚未见中国模型产出科学突破;蒸馏贡献"非零但规模未知"(Anthropic 称可追踪蒸馏攻击);安全测试投入更少可能额外贡献约一个月"纸面差距"(来源:同上 | 权重:中)。
- "追上上一代、美国已转向下一代"情景:Mythos 据传为 10T 模型,SpaceX AI、OpenAI、Meta 均在开发 10T 级;若 Fable 5.1 / GPT-6 已训练完成而暂缓发布,"追平"叙事可能迅速失效(来源:同上 | 权重:低-中,情景推演)。
- 与本报告第一节的关系:该分析与官方口径"整体仍落后 Fable 5 与 GPT-5.6 Sol"方向一致,但把差距量化到月级别,并提示 AAI 类指数的结构性偏乐观——阅读 Arena/AAI 排名时应同时参照 ECI 类潜在能力口径。
7.4 市场与资金面:从单日"Kimi moment"到持续重估
- 开源商品化四假设挑战(DB Adrian Cox,经 ZeroHedge):稀缺性(可自由复制托管→AI 变商品化基础设施)、定价权(按 token 付费时代,便宜开源替代昂贵 API)、资本开支假设(若更低算力需求即可达相近性能,数万亿美元 capex 存疑)、美国技术护城河(OpenRouter 上中国模型 token 份额 2026 年已超美国,美国企业使用中国模型周份额升向 60%)(来源:ZeroHedge 引 Deutsche Bank | 权重:中)。
- 资金轮动:JPM 口径资金流持续转向中国(KWEB/CQQQ/MCHI 需求强劲,资金来自韩国 EWY、台湾 EWT 等亚洲 AI 赢家);HSTECH 挑战长期下降趋势线与 100 日均线,投资者远未做多——突破意味着市场开始为中国 AI 生态做更广泛重估而非单纯互联网反弹(来源:The Market Ear / ZeroHedge 引 JPM、LSEG | 权重:中)。
- 结局判断与杰文斯悖论:DB 认为最可能结局是开源与闭源共存("火车与汽车"),护城河从原始权重转向专有数据、产品设计、记忆、安全与效率的组合;效率提升按杰文斯悖论继续推高算力总需求——与 SemiAnalysis 第六节结论同向(来源:同上 | 权重:中)。
7.5 监管变量
- OpenAI 战略未来主管 Dean W. Ball 将 K3 开源定性为"减速主义"、建议美政府制造监管恐慌;前白宫 AI 负责人 David Sacks 反向发文称"在中国模型能处理的任务上限制美国模型只会削弱竞争力"——美国国内对开源/对华监管的政策博弈本身成为 K3 可用性与估值的扰动变量(来源:ai_daily 7/21 汇总、ZeroHedge | 权重:低-中)。
八、信源冲突提示
| 来源 | 结论 / 数值 | 权重 | 说明 |
|---|---|---|---|
| Moonshot 官方技术博客完整基准表 | GDPval-AA v2:K3 1668 / Fable 5 1760 / GPT-5.6 Sol 1748;AA-Briefcase:K3 1548 / Fable 1583 / Sol 1495 | 🟢 高(官方自测) | 官方口径下 K3 在 GDPval 列三者第 3 |
| Artificial Analysis(经 The Decoder / codersera) | GDPval-AA v2 Elo 1668(其测试序列中第 2,未含 Sol) | 🟢 高 | 与官方数值一致(多源一致) |
| VentureBeat(Carl Franzen) | GDPval-AA v2 1687,总排名第 3 | 🟡 中 | 与官方 1668 相差 19 分(约 1.1%),系快照 / 配置差异;以官方与 AA 的 1668 为准 |
| 国泰海通纪要(主持人口径) | "全球第三、部分细分反超 Fable 与 GPT-5.6" | 🟡 中 | 与官方"整体落后 Fable 5 与 GPT-5.6 Sol"方向不一致;纪要自身已标注以官方为准 |
| Moonshot 官方 35 项基准 | K3 多项第一 / 前三 | 🟢 高(官方自测) | 混用 KimiCode / Claude Code / Codex 三种 harness,跨模型可比性需打折(The Decoder 亦指出) |
| Fireworks 实测(7/21) | SWE 92.4% vs 92.6%,K3 与 Fable 5"总体打平" | 🟡 中(托管厂商自测) | 与 AA 智能指数(Fable ~60 > K3 57)方向不同:harness 与任务构成不同(真实 agent 循环 vs 学术基准集),且 Fireworks 有利益相关;两者并存,不作取舍 |
| Lisan al Gaib 引 AA(7/21 文章) | K3 智能指数"排名第三" | 🟡 中 | 本报告采用发布时快照"第 4(57 分)";差异系 AA 榜单随新模型入库滚动更新所致 |
九、待验证与后续跟踪
- 2026-07-27 权重发布:是否按期、许可是否含 MAU 条款、模型格式(原生 MXFP4 还是附带 BF16)。
- 技术报告:训练 token 量(纪要专家推测 ≥30 万亿,待验证)、GPU 小时、训练成本、训练芯片配置(国产 vs 英伟达定论)、激活参数精确值、KDA/MLA 层比例(Kimi Linear 约 3:1)、KDA 的 KV cache 精确口径。
- DeepSeek V5(据传本周发布):若以激进定价落地,将挤压 K3 窗口期。
- SemiAnalysis 完整原文:当前内容为公众号全文转述,建议回溯 semianalysis.com 原文核对 WideEP 120+ 次交换、18 倍背板带宽等关键数字。
- 开源生态:vLLM / SGLang / llama.cpp 对 KDA 的支持进度;社区极限量化(<2bit)对 2.8T 模型的质量损耗。
- 商业化验证:K3 定价(K2.6 的 3 倍)能否在 DeepSeek / GLM 的低价竞争中守住份额;C 端毛利率(专家称或 <10%)与 B 端 ARR 进展;月之暗面传赴港 IPO(7/21 已递表,ARR 三个月翻三倍口径待招股书核实);算力拆分后新订阅重开时点与价格。
- 算力供需交叉验证(低权重线索升级路径):B300 下半年到货 <1 万台、长协租金 >28 万/月、Kimi 近 400 亿现金 2/3 投算力等说法,需以阿里云 / 英伟达渠道、上市公司公告等高权重来源验证后方可入结论层。
- 微软 Copilot 迁移(7/22 新增):是否从"内部评估"升级为确认部署及时间表;若落地,是开放权重模型首次承接西方一线厂商生产推理流量。
- 路由经济性复现(7/22 新增):Fireworks oracle 路由 93% / 72–96% 选 K3 为理论上限且出自托管方,待非利益相关第三方用实用路由复现"K3 默认 + 前沿模型兜底"的成本-质量曲线。
- Epoch 正式 ECI(7/22 新增):K3 初步 ECI 155.53 为部分基准口径,待 FrontierMath 等全套结果更新后复核中美差距区间(4.37–6.08 个月)。
信息来源
| 来源 | 标识 / 路径 | 信源权重 | 用途 |
|---|---|---|---|
| Moonshot AI 官方博客《Kimi K3: Open Frontier Intelligence》 | kimi.com/blog/kimi-k3 | 🟢 高(公司官方一手) | 架构、训练方法、定价、部署建议、官方基准 |
| Moonshot 官方技术博客 PDF(含 35 项完整基准表) | RAW/clippings/2-AI 应用/Kimi K3 技术博客:开放前沿智能 --- Kimi K3 Tech Blog- Open Frontier Intelligence.pdf | 🟢 高(公司官方一手) | 完整基准表官方口径(GDPval 1668/1760/1748、AA-Briefcase 1548 等)、Mooncake、缓存命中率 |
| SemiAnalysis《Kimi K3 KDA 机制分析》(2026-07-19) | 来源登记表 ID:[SemiAnalysis:Kimi K3的KDA机制——效率提升反而加剧需要更多的GPU、HBM、DRAM和网络,而非更少!_20260719_1510].md(位于 RAW _inbox,公众号全文转述) | 🟢 高(SemiAnalysis,转述,待原文复核) | 硬件需求不降反升四层论证、WideEP、杰文斯悖论、昇腾 950 SuperPod |
| Kimi API 官方文档 | platform.kimi.ai/docs/guide/kimi-k3-quickstart | 🟢 高(公司官方一手) | API 参数、定价、缓存机制 |
| Artificial Analysis 评测 | 经 The Decoder、codersera 转引 | 🟢 高(顶级独立评测) | 智能指数、单任务成本、token 效率、幻觉率 |
| Arena.ai / LMArena 前端代码竞技场 | 经 VentureBeat、TradingKey 转引 | 🟢 高(独立第三方榜单) | 前端代码排名 |
| VentureBeat(Carl Franzen / Michael Nuñez) | venturebeat.com | 🟡 中(国际权威媒体) | 发布全景、GDPval 口径、Moonshot 背景 |
| Axios | 经 bregg.com 转引 | 🟡 中 | 地缘与政策框架 |
| Bloomberg | 经 unwire.pro、中财网转引 | 🟡 中 | "Kimi moment"、市场冲击 |
| CNBC | 经 BlockBeats 转引 | 🟡 中 | 估值与 ARR |
| The Decoder | the-decoder.com | 🟡 中(专业技术媒体) | AA 数据细节、价格表、harness 混合提示 |
| Fortune / TechCrunch / Tom's Hardware | 经 bregg.com、webreactiva 转引 | 🟡 中 | 覆盖确认 |
| Simon Willison 博客(鹈鹕实测) | simonwillison.net,经 CSDN 完整转译 | 🟡 中(一手实测,可核实) | 隐藏系统提示、单任务 token 结构、视觉能力 |
| 财联社 | cls.cn/detail/2429127 | 🟡 中(国内权威财经媒体) | 发布要点、LongCat-2.0 国产算力旁证 |
| OpenRouter 调用量数据 | 经 36 氪、东方财富、科技日报转引 | 🟡 中 | 推理需求行业背景 |
| opencode.ai 使用数据 | opencode.ai/zh/data/moonshot/kimi-k3 | 🟡 中 | K3 早期 token 消耗形态 |
| 美银证券点评 | 经 TradingKey 转引 | 🟡 中(投行观点转述) | 行业领先地位评价 |
| chaobro.com(芯片求购报道汇总) | chaobro.com | 🟡 中(单一来源,待验证) | H20 求购与昇腾测试线索 |
| servergurus / vramcalculator / wan27.org / rohitai | 各自站点 | 🟡 中(部署测算,口径互相印证) | 开源部署硬件量化 |
| learnku / datalearner / lilting.ch | 技术社区 | 🟡 中 | 架构细节转述 |
| 36 氪 / 东方财富 / 科技日报 / 中财网 / unwire.pro / sina | 国内媒体 | 🟡 中 | 市场反应、行业数据 |
| 国泰海通证券电话会议纪要《Kimi K3 解密》(2026-07-17 晚,已核实版) | RAW/clippings/2-AI 应用/KimiK3解密纪要_20260717_已核实.docx | 🟡 中(券商纪要,出处可核实;专家观点为推断) | 训练成本结构、30T token 推测、2.5x 归因、C 端定价毛利、超节点逻辑、昇腾 950 支持 |
| Fireworks 官方博客《Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA》(2026-07-21) | RAW/clippings/_inbox/Kimi K3 与 Fable 实力相当;Kimi K3 + Fable 达到当前最优水平。 --- Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA-副本.pdf(fireworks.ai/blog/kimik3-fable) | 🟡 中(托管厂商自测,存在利益相关;方法论与数据可复核) | K3 vs Fable 约 1030 任务实测、oracle 路由 93% / 72–96%、最高 50 倍成本优势、"路由而非选模型" |
| The Decoder(K3 需求 48 小时打满、暂停新订阅) | the-decoder.com | 🟡 中(专业技术媒体) | 需求侧硬证据 |
| The Information(微软 Copilot 评估迁 K3,经 IT之家转述) | 经 aihot.virxact.com / IT之家转引 | 🟡 中(权威科技媒体转述,待确认) | 年省最高 6 亿美元测算、生产级评估信号 |
| Lisan al Gaib Substack《中国 AI 模型追上美国前沿了吗?重新衡量 Kimi-K3 之后的答案》(引 Epoch AI) | RAW/clippings/2-AI 应用/[中国_AI_模型追上美国前沿了吗?重新衡量_Kimi-K3_之后的答案_20260721_1616].md | 🟡 中(独立分析,方法论透明;含推测成分) | AAI vs ECI 双口径差距(1.5–2.9 个月 vs 4.37–6.08 个月)、K3 初步 ECI 155.53、蒸馏与"追上上一代"情景 |
| ZeroHedge × Deutsche Bank(Adrian Cox)《The Battle For The Future Of AI: Open-Source Models 101》 | RAW/clippings/_inbox/IMA-xxpq-20260721-开源模型入门指南-ZeroHedge.md | 🟡 中(大行研究经媒体转述) | 开源商品化四假设挑战、OpenRouter 中美 token 份额、共存结局与杰文斯悖论 |
| The Market Ear / ZeroHedge《America Built AI. China Is Commoditizing It.》(引 JPM、LSEG、DB) | RAW/clippings/_inbox/IMA-xxpq-20260721-中国AI生态进行更广泛的重估.md | 🟡 中(市场评论,数据来自 JPM/LSEG/DB) | 资金轮动中国 AI 生态重估、美国企业用中国模型周份额升向 60% |
| 《当开源模型逼近闭源,谁会成为 AI 世界的路由器?》(2026-07-20) | RAW/clippings/2-AI 应用/[当开源模型逼近闭源,谁会成为 AI 世界的路由器?_20260720_2057].md | 🟡 中(行业分析,引 OpenRouter 数据) | K3 两天进 OpenRouter 日榜前十、7/18 约 1420 亿 token、单 provider 429 容量问题 |
| 北美一线调研纪要(2026-07-22) | RAW/clippings/_inbox/[北美一线调研:开源未来9成token份额、算力依然紧缺_20260722_0905].md | 🟡 低-中(调研纪要,多方口径汇总) | Kimi K3 48 小时触算力上限、Databricks/Fireworks/Baseten 算力紧缺、开源 token 份额趋势 |
| AI HOT 聚合(月之暗面港股 IPO、Kimi Hosted Agent、Kimi Work)+ Hacker News | aihot.virxact.com、news.ycombinator.com | 🔴 低-中(聚合/厂商口径,待招股书与独立数据核实) | ARR 三个月翻三倍、B 端收入七成来自 API、产品栈延展 |
| tokenmix.ai 训练成本估算 | tokenmix.ai | 🔴 低(仅供参考) | 训练成本量级推算 |
| 雪球《产业专家交流:KIMI K3 与算力产业》(2026-07-19) | 来源登记表 ID:[【产业专家交流】关于KIMIK3与算力产业 1.无可争议的强。2.8T的模型,KV缓存直接砍掉75%,1MTokens上下文解码窗口吞吐提升6.3倍,这些都是参数层..._20260719_1043].md(位于 RAW _inbox,雪球链接 xueqiu.com/4132495870/400977104) | 🔴 低(仅供参考) | B300 万卡集群 / 租金 / 400 亿现金等算力供需线索,不入结论 |
| Hacker News / X 评论 | 经 eesel.ai、yeekal、掘金转述 | 🔴 低(仅供参考) | 社区情绪,不入结论 |
| CSDN / 掘金 / SegmentFault | 自媒体转译 | 🔴 低(仅供参考) | 辅助核对 |
版本变更记录
| 日期 | 版本 | 主要变更 | 关键数字变化 |
|---|---|---|---|
| 2026-07-22 | v1.2 | 接入 Fireworks 1030 任务独立实测、The Decoder / 北美一线调研需求打满、Lisan al Gaib × Epoch ECI 反向校准、ZeroHedge × DB 开源商品化框架;新增正文第七节与核心结论 11–13 | K3 vs Fable 5 SWE 92.4% vs 92.6%;oracle 路由 93% / 72–96% 选 K3;ECI 口径差距 4.37–6.08 个月;OpenRouter 7/18 当日约 1420 亿 token |
| 2026-07-19 | v1.1 | 接入 SemiAnalysis KDA 专题与国泰海通电话会议纪要;新增正文第六节与核心结论 9–10 | 扩展效率约 2.5 倍;训练数据 ≥30 万亿 token(专家推测);KV 带宽需求最高降约 10 倍但 WideEP 单次前向 120+ 次专家交换,硬件总需求不降反升 |
| 2026-07-18 | v1.0(初版) | K3 发布 48 小时内全景研究:水平评测、训练方法、推理经济、开源部署硬件量化 | AA 智能指数 57 全球第 4;单任务成本 $0.94;MXFP4 权重约 1.4–1.5TB |