AlphaVault /行业研判

Kimi K3 深度研究:2.8T 开源前沿模型的评测、训练、推理经济与部署全景

日期版本号
2026-07-22v1.2
2026-07-19v1.1
2026-07-18v1.0

本报告主要基于 Moonshot AI 官方一手材料、Artificial Analysis 独立评测、VentureBeat / Axios / Bloomberg / CNBC 等国际权威媒体,以及 Simon Willison 一手实测等高 / 中权重来源;Hacker News 与 X 社区情绪、自媒体转述仅作低权重参考,已在文中逐条标注。

核心结论

  1. 定位:开放权重模型首次摸到闭源前沿门槛。 Kimi K3(2026-07-16 发布)总参数 2.8T、MoE 架构(896 专家激活 16)、100 万 token 上下文、原生视觉,是全球最大参数规模的开放权重模型、首个"3T 级"开放模型;权重承诺 2026-07-27 前开源(来源:Moonshot 官方博客 | 权重:高)。
  2. 综合智能全球第 4,编程全球第 1。 Artificial Analysis 智能指数 57 分(189 个模型中第 4),仅次于 Claude Fable 5(~60)与 GPT-5.6 Sol(~59),领先 Claude Opus 4.8(~56);Arena.ai 前端代码竞技场 1679 分登顶,7 个细分领域拿下 6 项第一(来源:Artificial Analysis / Arena.ai,经 The Decoder、VentureBeat 转引 | 权重:高)。
  3. 成本:单任务成本进入与 GPT-5.6 Sol 同档、约为 Opus 4.8 一半的区间。 AA 实测单任务成本 $0.94 vs GPT-5.6 Sol $1.04 vs Opus 4.8 $1.80;API 定价 $3/$15(缓存命中 $0.30)约为 Fable 5($10/$50)的三分之一,但已是前代 K2.6 的约 3 倍——"超低价中国 AI"时代结束(来源:Artificial Analysis、Kimi API 文档 | 权重:高)。
  4. 训练:架构创新驱动约 2.5 倍扩展效率,但关键算力数据未披露。 KDA 混合线性注意力(百万上下文解码最高 6.3 倍加速)+ Attention Residuals(<2% 成本换 ~25% 训练效率)+ 全均衡专家并行 + MXFP4/MXFP8 原生量化感知训练;训练 token 量、GPU 小时、训练成本待 7 月 27 日技术报告披露(来源:Moonshot 官方博客 | 权重:高)。
  5. 芯片:主体仍是英伟达,国产芯片在测,官方未确认。 2026 年 2 月 Moonshot 公开求购 NVIDIA H20 并测试华为昇腾;旁证为美团 LongCat-2.0 被官方口径称为"首个完全依靠国产算力完成训推全流程的万亿参数模型"(来源:公开报道,官方未披露,待验证 | 权重:中)。
  6. 推理需求:处于 Agent 驱动的 token 通胀通道。 OpenRouter 周调用量一年内从 2.1T 升至 46.7T token(2026-06-21 当周);K3 发布两天在 opencode 编程场景录得 58B token、平均单会话 210 万 token、缓存命中率 93%(来源:OpenRouter、opencode.ai | 权重:中)。
  7. 开源部署是数据中心级工程。 原生 MXFP4 权重约 1.4–1.5TB,FP16 约 5.6TB;官方推荐 64+ 加速卡 supernode;消费级硬件不可行,8×A100 80GB 为理论下限(来源:Moonshot 官方博客、servergurus / vramcalculator 测算 | 权重:中)。
  8. 风险与待验证: 幻觉率从 K2.6 的 39% 升至 51%(准确率 33%→46%),事实型负载需保留核验;隐藏约 85 token 系统提示;官方评测混用 KimiCode / Claude Code / Codex 三种 harness,跨模型可比性需打折(来源:Artificial Analysis、Simon Willison 实测 | 权重:高 / 中)。
  9. SemiAnalysis 7/19 专题:KDA 不削弱硬件需求,反而净增。 KDA 虽将 KV 缓存传输带宽需求最高降约 10 倍,但 2.8T 权重占 1.5TB+ HBM、WideEP 使单次前向计算产生 120+ 次专家交换(每层每次前向都发生,而 KV 传输整个对话仅一次),叠加 KV 卸载带动 DDR5/NVMe 需求;杰文斯悖论下效率降本将推动上下文向 500 万+ token 与应用规模扩张——GPU、HBM、DRAM、网络总需求不降反升;且 64 卡超节点并非英伟达独占,昇腾 950 SuperPod 同为 64 芯片配置(来源:SemiAnalysis 7/19 报告,公众号全文转述 | 权重:高)。
  10. 训练侧新增口径(国泰海通纪要): 训练数据预计至少 30 万亿 token(较以往翻倍,专家推测待验证);预训练成本占比约 60%+(两年前 >90%),后训练 30–40% 且持续上行;2.5 倍扩展效率归因为模型端约 6 成、硬件形态推理加速约 3 成、KV Cache 等约 1 成;推理瓶颈中 GPU FLOPs 占比或已降至两成以下,通信与存储成为主战场(来源:国泰海通证券电话会议纪要 7/17,专家观点 | 权重:中)。
  11. 第三方生产级验证落地(7/21–7/22 增量): Fireworks 独立实测约 1030 个 agentic 任务,K3 与 Fable 5 总体打平(SWE 92.4% vs 92.6%)、成本最高省约 50 倍,oracle 路由 93% 准确率、72–96% 任务分给 K3;微软内部评估将部分 Copilot 推理迁至 K3,测算年省最高 6 亿美元(仍"评估"非确认部署)(来源:Fireworks 官方博客——托管厂商自测、存在利益相关;The Information 经 IT之家转述 | 权重:中)。
  12. 需求打满与商业化推进(7/20–7/22 增量): K3 上线 48 小时 GPU 需求打满、Moonshot 暂停新订阅(The Decoder 与北美一线调研双源同口径);发布两天进 OpenRouter 日榜前十(7/18 当日约 1420 亿 token);月之暗面递交港股 IPO、ARR 三个月翻三倍,Kimi Work / Kimi Hosted Agent / kimi-cli 把 K3 从单模型延展为 agent 产品栈(来源:The Decoder、北美一线调研、AI HOT 聚合 | 权重:中 / 低-中)。
  13. 反向校准:换 ECI 尺子,中美差距仍有 4.4–6.1 个月。 按 AAI 日常实用性口径差距仅 1.5–2.9 个月,但按 Epoch ECI 潜在通用能力口径,K3(初步 ECI 155.53)相对美国前沿后向差距约 4.37–6.08 个月,FrontierMath 不具前沿竞争力;"追平"结论高度依赖评测尺子,安全/CBRN 与严肃数学维度证据缺位(来源:Lisan al Gaib Substack 引 Epoch AI 数据 | 权重:中)。

正文

一、水平评测

1.1 整体水平
1.2 与 GPT-5.6 Sol / Opus 4.8 / Fable 5 的水平与成本对比
维度Kimi K3GPT-5.6 SolClaude Opus 4.8Claude Fable 5
AA 智能指数57~59~56~60
GDPval-AA v2(Elo)1668(官方基准表口径;VentureBeat 另报 1687,见信源冲突提示)1748(官方基准表)16001760
前端代码 Arena#1,167916181631
Terminal-Bench 2.188.388.884.684.6
API 输入/输出($/M token)$3 / $15(缓存命中 $0.30)$5 / $30$10 / $50
单任务成本(AA 实测)$0.94$1.04$1.80更高

(来源:Artificial Analysis、Kimi API 文档、The Decoder 价格表 | 权重:高)

要点:

二、训练维度

2.1 算力与算力方法
2.2 训练方法核心亮点
  1. KDA(Kimi Delta Attention):混合线性注意力,线性注意力与完整注意力交错组合,百万 token 上下文解码速度最高提升 6.3 倍;设计周期约 1.5 年,前身 Kimi-Linear 已 MIT 开源(来源:Moonshot 官方博客、learnku 技术社区 | 权重:高 / 中)。
  2. Attention Residuals(AttnRes):以深度方向注意力替代传统残差连接,<2% 额外成本换约 25% 训练效率提升;2026 年 3 月 arXiv 论文,四个月后即进旗舰(来源:Moonshot 官方博客、lilting.ch | 权重:高 / 中)。
  3. Stable LatentMoE + Quantile Balancing:896 专家 / 激活 16 的极端稀疏度下,直接按路由分数分位数分配专家,消除启发式更新与敏感超参(来源:Moonshot 官方博客 | 权重:高)。
  4. Per-Head Muon:Muon 优化器扩展到按注意力头独立优化;配合 SiTU 激活函数与 Gated MLA(来源:Moonshot 官方博客 | 权重:高)。
  5. 原生 QAT:4bit 权重是训练原生精度而非事后压缩,开源后低精度部署接近无损——这是该规模模型的首创(来源:Moonshot 官方博客、vramcalculator.com | 权重:高 / 中)。
2.3 训练 / 推理用国产芯片还是英伟达?

三、推理维度

3.1 推理端需求量
3.2 基于单任务成本的 Token 消耗与成本计算

官方定价:输入(缓存未命中)$3/M、输入(缓存命中)$0.30/M、输出(含推理 token)$15/M,全上下文长度统一价(来源:Kimi API 文档 | 权重:高)。

计算框架:

单任务成本 = (输入 token + 约 85 隐藏系统提示) × $3/M(缓存命中则 $0.30/M)
           + 输出 token(含思维链,占比约 80%)× $15/M

四、开源部署:硬件需求量化

权重 2026-07-27 发布,原生 MXFP4。量化测算如下(来源:servergurus、vramcalculator、wan27.org 三方测算,口径一致 | 权重:中):

配置档位可行性说明
消费级 GPU(24GB)/ Mac Studio 512GB不可行最低可行量化也放不下
4× RTX PRO 6000(共 384GB)勉强需激进 2bit 量化,个位数 tok/s
8× A100 80GB(共 640GB)理论下限MXFP4/INT4 可装入,约 5–15 tok/s
8× H100/H200、16× H200生产入门FP16 权重需 ~5.6TB,8 卡很紧
64+ 加速卡 supernode官方推荐专家并行需要大高带宽通信域,互联与显存同等重要

关键数字:

五、国外媒体覆盖与市场反应("Kimi moment")

六、SemiAnalysis 与国泰海通纪要增量(2026-07-19 补充)

6.1 SemiAnalysis 7/19 专题:KDA 省带宽,但硬件总需求不降反升
6.2 国泰海通电话会议纪要(7/17 晚《Kimi K3 解密》,已核实版)
6.3 低权重线索:雪球《产业专家交流:KIMI K3 与算力产业》(7/19)

⚠️ 以下来源权重低(雪球帖子 / 无法核实出处的专家口述),仅供参考,不构成核心结论依据。

七、2026-07-22 增量:第三方生产级验证、需求打满与"路由时代"

本节基于 7/20–7/22 新入库素材(Fireworks 实测、The Decoder / The Information 报道、Lisan al Gaib × Epoch AI、ZeroHedge × DB、北美一线调研等),对第一至五节形成补充与交叉验证;与 7/19 前内容冲突处以高权重来源为准。

7.1 Fireworks 独立实测(7/21):K3 + Fable 路由 > 任一单模型
7.2 需求侧:从"供不应求"到"西方一线厂商生产级评估"
7.3 反向校准:ECI 口径下中美差距仍有 4.37–6.08 个月
7.4 市场与资金面:从单日"Kimi moment"到持续重估
7.5 监管变量

八、信源冲突提示

来源结论 / 数值权重说明
Moonshot 官方技术博客完整基准表GDPval-AA v2:K3 1668 / Fable 5 1760 / GPT-5.6 Sol 1748;AA-Briefcase:K3 1548 / Fable 1583 / Sol 1495🟢 高(官方自测)官方口径下 K3 在 GDPval 列三者第 3
Artificial Analysis(经 The Decoder / codersera)GDPval-AA v2 Elo 1668(其测试序列中第 2,未含 Sol)🟢 高与官方数值一致(多源一致)
VentureBeat(Carl Franzen)GDPval-AA v2 1687,总排名第 3🟡 中与官方 1668 相差 19 分(约 1.1%),系快照 / 配置差异;以官方与 AA 的 1668 为准
国泰海通纪要(主持人口径)"全球第三、部分细分反超 Fable 与 GPT-5.6"🟡 中与官方"整体落后 Fable 5 与 GPT-5.6 Sol"方向不一致;纪要自身已标注以官方为准
Moonshot 官方 35 项基准K3 多项第一 / 前三🟢 高(官方自测)混用 KimiCode / Claude Code / Codex 三种 harness,跨模型可比性需打折(The Decoder 亦指出)
Fireworks 实测(7/21)SWE 92.4% vs 92.6%,K3 与 Fable 5"总体打平"🟡 中(托管厂商自测)与 AA 智能指数(Fable ~60 > K3 57)方向不同:harness 与任务构成不同(真实 agent 循环 vs 学术基准集),且 Fireworks 有利益相关;两者并存,不作取舍
Lisan al Gaib 引 AA(7/21 文章)K3 智能指数"排名第三"🟡 中本报告采用发布时快照"第 4(57 分)";差异系 AA 榜单随新模型入库滚动更新所致

九、待验证与后续跟踪

  1. 2026-07-27 权重发布:是否按期、许可是否含 MAU 条款、模型格式(原生 MXFP4 还是附带 BF16)。
  2. 技术报告:训练 token 量(纪要专家推测 ≥30 万亿,待验证)、GPU 小时、训练成本、训练芯片配置(国产 vs 英伟达定论)、激活参数精确值、KDA/MLA 层比例(Kimi Linear 约 3:1)、KDA 的 KV cache 精确口径。
  3. DeepSeek V5(据传本周发布):若以激进定价落地,将挤压 K3 窗口期。
  4. SemiAnalysis 完整原文:当前内容为公众号全文转述,建议回溯 semianalysis.com 原文核对 WideEP 120+ 次交换、18 倍背板带宽等关键数字。
  5. 开源生态:vLLM / SGLang / llama.cpp 对 KDA 的支持进度;社区极限量化(<2bit)对 2.8T 模型的质量损耗。
  6. 商业化验证:K3 定价(K2.6 的 3 倍)能否在 DeepSeek / GLM 的低价竞争中守住份额;C 端毛利率(专家称或 <10%)与 B 端 ARR 进展;月之暗面传赴港 IPO(7/21 已递表,ARR 三个月翻三倍口径待招股书核实);算力拆分后新订阅重开时点与价格。
  7. 算力供需交叉验证(低权重线索升级路径):B300 下半年到货 <1 万台、长协租金 >28 万/月、Kimi 近 400 亿现金 2/3 投算力等说法,需以阿里云 / 英伟达渠道、上市公司公告等高权重来源验证后方可入结论层。
  8. 微软 Copilot 迁移(7/22 新增):是否从"内部评估"升级为确认部署及时间表;若落地,是开放权重模型首次承接西方一线厂商生产推理流量。
  9. 路由经济性复现(7/22 新增):Fireworks oracle 路由 93% / 72–96% 选 K3 为理论上限且出自托管方,待非利益相关第三方用实用路由复现"K3 默认 + 前沿模型兜底"的成本-质量曲线。
  10. Epoch 正式 ECI(7/22 新增):K3 初步 ECI 155.53 为部分基准口径,待 FrontierMath 等全套结果更新后复核中美差距区间(4.37–6.08 个月)。

信息来源

来源标识 / 路径信源权重用途
Moonshot AI 官方博客《Kimi K3: Open Frontier Intelligence》kimi.com/blog/kimi-k3🟢 高(公司官方一手)架构、训练方法、定价、部署建议、官方基准
Moonshot 官方技术博客 PDF(含 35 项完整基准表)RAW/clippings/2-AI 应用/Kimi K3 技术博客:开放前沿智能 --- Kimi K3 Tech Blog- Open Frontier Intelligence.pdf🟢 高(公司官方一手)完整基准表官方口径(GDPval 1668/1760/1748、AA-Briefcase 1548 等)、Mooncake、缓存命中率
SemiAnalysis《Kimi K3 KDA 机制分析》(2026-07-19)来源登记表 ID:[SemiAnalysis:Kimi K3的KDA机制——效率提升反而加剧需要更多的GPU、HBM、DRAM和网络,而非更少!_20260719_1510].md(位于 RAW _inbox,公众号全文转述)🟢 高(SemiAnalysis,转述,待原文复核)硬件需求不降反升四层论证、WideEP、杰文斯悖论、昇腾 950 SuperPod
Kimi API 官方文档platform.kimi.ai/docs/guide/kimi-k3-quickstart🟢 高(公司官方一手)API 参数、定价、缓存机制
Artificial Analysis 评测经 The Decoder、codersera 转引🟢 高(顶级独立评测)智能指数、单任务成本、token 效率、幻觉率
Arena.ai / LMArena 前端代码竞技场经 VentureBeat、TradingKey 转引🟢 高(独立第三方榜单)前端代码排名
VentureBeat(Carl Franzen / Michael Nuñez)venturebeat.com🟡 中(国际权威媒体)发布全景、GDPval 口径、Moonshot 背景
Axios经 bregg.com 转引🟡 中地缘与政策框架
Bloomberg经 unwire.pro、中财网转引🟡 中"Kimi moment"、市场冲击
CNBC经 BlockBeats 转引🟡 中估值与 ARR
The Decoderthe-decoder.com🟡 中(专业技术媒体)AA 数据细节、价格表、harness 混合提示
Fortune / TechCrunch / Tom's Hardware经 bregg.com、webreactiva 转引🟡 中覆盖确认
Simon Willison 博客(鹈鹕实测)simonwillison.net,经 CSDN 完整转译🟡 中(一手实测,可核实)隐藏系统提示、单任务 token 结构、视觉能力
财联社cls.cn/detail/2429127🟡 中(国内权威财经媒体)发布要点、LongCat-2.0 国产算力旁证
OpenRouter 调用量数据经 36 氪、东方财富、科技日报转引🟡 中推理需求行业背景
opencode.ai 使用数据opencode.ai/zh/data/moonshot/kimi-k3🟡 中K3 早期 token 消耗形态
美银证券点评经 TradingKey 转引🟡 中(投行观点转述)行业领先地位评价
chaobro.com(芯片求购报道汇总)chaobro.com🟡 中(单一来源,待验证)H20 求购与昇腾测试线索
servergurus / vramcalculator / wan27.org / rohitai各自站点🟡 中(部署测算,口径互相印证)开源部署硬件量化
learnku / datalearner / lilting.ch技术社区🟡 中架构细节转述
36 氪 / 东方财富 / 科技日报 / 中财网 / unwire.pro / sina国内媒体🟡 中市场反应、行业数据
国泰海通证券电话会议纪要《Kimi K3 解密》(2026-07-17 晚,已核实版)RAW/clippings/2-AI 应用/KimiK3解密纪要_20260717_已核实.docx🟡 中(券商纪要,出处可核实;专家观点为推断)训练成本结构、30T token 推测、2.5x 归因、C 端定价毛利、超节点逻辑、昇腾 950 支持
Fireworks 官方博客《Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA》(2026-07-21)RAW/clippings/_inbox/Kimi K3 与 Fable 实力相当;Kimi K3 + Fable 达到当前最优水平。 --- Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA-副本.pdf(fireworks.ai/blog/kimik3-fable)🟡 中(托管厂商自测,存在利益相关;方法论与数据可复核)K3 vs Fable 约 1030 任务实测、oracle 路由 93% / 72–96%、最高 50 倍成本优势、"路由而非选模型"
The Decoder(K3 需求 48 小时打满、暂停新订阅)the-decoder.com🟡 中(专业技术媒体)需求侧硬证据
The Information(微软 Copilot 评估迁 K3,经 IT之家转述)经 aihot.virxact.com / IT之家转引🟡 中(权威科技媒体转述,待确认)年省最高 6 亿美元测算、生产级评估信号
Lisan al Gaib Substack《中国 AI 模型追上美国前沿了吗?重新衡量 Kimi-K3 之后的答案》(引 Epoch AI)RAW/clippings/2-AI 应用/[中国_AI_模型追上美国前沿了吗?重新衡量_Kimi-K3_之后的答案_20260721_1616].md🟡 中(独立分析,方法论透明;含推测成分)AAI vs ECI 双口径差距(1.5–2.9 个月 vs 4.37–6.08 个月)、K3 初步 ECI 155.53、蒸馏与"追上上一代"情景
ZeroHedge × Deutsche Bank(Adrian Cox)《The Battle For The Future Of AI: Open-Source Models 101》RAW/clippings/_inbox/IMA-xxpq-20260721-开源模型入门指南-ZeroHedge.md🟡 中(大行研究经媒体转述)开源商品化四假设挑战、OpenRouter 中美 token 份额、共存结局与杰文斯悖论
The Market Ear / ZeroHedge《America Built AI. China Is Commoditizing It.》(引 JPM、LSEG、DB)RAW/clippings/_inbox/IMA-xxpq-20260721-中国AI生态进行更广泛的重估.md🟡 中(市场评论,数据来自 JPM/LSEG/DB)资金轮动中国 AI 生态重估、美国企业用中国模型周份额升向 60%
《当开源模型逼近闭源,谁会成为 AI 世界的路由器?》(2026-07-20)RAW/clippings/2-AI 应用/[当开源模型逼近闭源,谁会成为 AI 世界的路由器?_20260720_2057].md🟡 中(行业分析,引 OpenRouter 数据)K3 两天进 OpenRouter 日榜前十、7/18 约 1420 亿 token、单 provider 429 容量问题
北美一线调研纪要(2026-07-22)RAW/clippings/_inbox/[北美一线调研:开源未来9成token份额、算力依然紧缺_20260722_0905].md🟡 低-中(调研纪要,多方口径汇总)Kimi K3 48 小时触算力上限、Databricks/Fireworks/Baseten 算力紧缺、开源 token 份额趋势
AI HOT 聚合(月之暗面港股 IPO、Kimi Hosted Agent、Kimi Work)+ Hacker Newsaihot.virxact.com、news.ycombinator.com🔴 低-中(聚合/厂商口径,待招股书与独立数据核实)ARR 三个月翻三倍、B 端收入七成来自 API、产品栈延展
tokenmix.ai 训练成本估算tokenmix.ai🔴 低(仅供参考)训练成本量级推算
雪球《产业专家交流:KIMI K3 与算力产业》(2026-07-19)来源登记表 ID:[【产业专家交流】关于KIMIK3与算力产业 1.无可争议的强。2.8T的模型,KV缓存直接砍掉75%,1MTokens上下文解码窗口吞吐提升6.3倍,这些都是参数层..._20260719_1043].md(位于 RAW _inbox,雪球链接 xueqiu.com/4132495870/400977104)🔴 低(仅供参考)B300 万卡集群 / 租金 / 400 亿现金等算力供需线索,不入结论
Hacker News / X 评论经 eesel.ai、yeekal、掘金转述🔴 低(仅供参考)社区情绪,不入结论
CSDN / 掘金 / SegmentFault自媒体转译🔴 低(仅供参考)辅助核对

版本变更记录

日期版本主要变更关键数字变化
2026-07-22v1.2接入 Fireworks 1030 任务独立实测、The Decoder / 北美一线调研需求打满、Lisan al Gaib × Epoch ECI 反向校准、ZeroHedge × DB 开源商品化框架;新增正文第七节与核心结论 11–13K3 vs Fable 5 SWE 92.4% vs 92.6%;oracle 路由 93% / 72–96% 选 K3;ECI 口径差距 4.37–6.08 个月;OpenRouter 7/18 当日约 1420 亿 token
2026-07-19v1.1接入 SemiAnalysis KDA 专题与国泰海通电话会议纪要;新增正文第六节与核心结论 9–10扩展效率约 2.5 倍;训练数据 ≥30 万亿 token(专家推测);KV 带宽需求最高降约 10 倍但 WideEP 单次前向 120+ 次专家交换,硬件总需求不降反升
2026-07-18v1.0(初版)K3 发布 48 小时内全景研究:水平评测、训练方法、推理经济、开源部署硬件量化AA 智能指数 57 全球第 4;单任务成本 $0.94;MXFP4 权重约 1.4–1.5TB

报告信息

类别
行业研判
创建日期
2026-07-18
更新日期
2026-07-22
来源数量
37
Wiki 源文件
wiki/05-行业研判/Kimi_K3深度研究_2.8T开源前沿模型评测训练成本推理经济与部署全景_20260718.md
核心来源
Moonshot AI 官方博客与 API 文档
Artificial Analysis
VentureBeat
Axios
Bloomberg
The Decoder