更新时间:16:05|覆盖窗口:2026-08-12 ~ 08-13(承接上一期 2026-08-12) 数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(OpenAI / Anthropic / Google AI / Meta AI / DeepMind / HuggingFace / Mistral / NVIDIA / The Decoder / Juya / AI Hot 等)/ 金十电报
数据覆盖与缺口(CLS 不采集属设计、非缺口;多家官方/Newsletter feed 当日 0 条为 feed_empty 正常空返回,按降级标注):
| 源 | 入库数 | 状态 |
|---|---|---|
| Product Hunt | 20 | ✓ |
| Hacker News | 21 | ✓ |
| GitHub Trending | 17 | ✓ |
| RSS | 60(精选) | 部分 feed 空返回(OpenAI Blog / Google AI / NVIDIA / Microsoft AI / YouTube·AI Explained / Ben's Bites / TLDR AI / Import AI / Interconnects / Stratechery 等 15 个 feed 当日 0 条,非抓取失败) |
| 金十电报 | 83(精选) | ✓(AI 相关占比低时注明) |
这份日报是一张二维坐标系:纵轴看模型与产品的能力 / 技术往哪走(实验→收敛中→事实标准,判档看证据强度,同一矢量当天 ≥2 个独立证据才算收敛),横轴看 AI 产品被多少人、多少场景真用上(萌芽→早期采用→主流化,判档看真实使用信号,不看 star / votes)。
一句话结论
地图今天动了一格,而且是本轮跟踪以来开放权重轴最实的一跳:Qwen3.8-Max 的开放权重正式发布,把「国产开放旗舰差最后一块开放度拼图」这个卡了近两周的 falsifier 直接命中——能力、开放、可用性三道门今天一次性补齐,开放阵营第一次在「可下载真旗舰」上和封闭侧正面坐实。封闭侧也不是静音:DeepSeek V4 Pro 0813 正式版 API 上线(增强 agent 能力、接入 Codex、DeepSWE 从 12.8 跳到 62.7)、Grok 4.6 把 xAI 重新送回智能前沿(AA 61,仅落后 Claude Opus 5 的 63),三强并立但都卡在「独立第三方复测」这道最后的闸门外。今天的重点是 Qwen3.8-Max 开放权重(已确认 S-confirmed,下面拆解);重点候选是 DeepSeek V4 Pro 0813(仍待独立 benchmark 复核)。接下来 24-72h 最该盯两件事:Qwen3.8-Max 放出后的真实部署量与跨厂可比评测,以及 8/14 Claude Code Auto Mode 默认生效后第一批真实拦截数据。
今日重点 · 深度拆解
① Qwen3.8-Max / Qwen3.8-2.4T-A95B 开放权重 —— 国产开放旗舰第一次把「可下载真旗舰」坐实
- 是什么:阿里发布 Qwen3.8-Max 的开放权重,对应模型 Qwen3.8-2.4T-A95B——2.4T 总参数、95B 每 token 激活的细粒度 MoE,混合全注意力 + 线性注意力,原生上下文最长 1M token、输出最长 128K,面向推理与 agentic 工作负载。形态定性:开放权重(非 API-only)。NVIDIA 同日给出 GB300 NVL72 多节点部署食谱,无需额外微调即实现 4K+ tok/s 吞吐。
- 方法论落点:动了纵轴
v-openflagship(开放旗舰/开放权重)与横轴f-kimiopen(开放权重入口级履约)两个档位——更重要的是它把上一期写进 watchboard 的 falsifier「若 8/13 前 Qwen3.8-Max 权重放出且许可证为宽松开源,则 v-openflagship 开放度判断回调」直接命中。此前候选②(千问开放平台)连续多期只差「开放度」这一条毕业判据,权重一放出,开放度从「待验证」回调为「已兑现」,四道确认门槛同步过:① 结构影响(开放旗舰权重开放,重塑 v-openflagship 开放度)✓;② 官方一手(QwenLM 权重页 + NVIDIA GB300 部署博客)✓;③ 真实可用(HuggingFace 可下载权重、GB300 可部署)✓;④ 独立复核(Artificial Analysis Intelligence Index 已将 Qwen3.8 Max 列入对比,τ³-Banking 51.3% 居前二、GDPval-AA v2 Elo 与 Fable 5/Opus 5 置信区间重叠;NVIDIA 实测 >4K tok/s)✓。 - 产业位置:这是开放阵营第一次有「2.4T 级、原生 256K、可数据中心级部署」的真旗舰权重,和 DeepSeek V4-Flash/Kimi K3 一起把开放权重从「可用」推到「前沿可用」。上游仍依赖 NVIDIA/国产算力协同(GB300 食谱是软硬协同范本),下游直接赋能想自托管前沿能力、又不愿被 API 定价绑死的企业与开发者;中美对照里,这是国产开放侧对 Claude/GPT 闭源 API 最直接的「可下载替代」。竞品接法大概率是:闭源侧用更低价格(Grok 4.6 $2/$6)或更强能力顶住,开放侧用「免费可部署」抢主权场景。
- 证据与反例:一手(QwenLM 权重页、NVIDIA GB300 博客)与独立(Artificial Analysis)分层成立;反例是许可证宽松度仍待 QwenLM 页明确打印(Qwen 惯例为 Apache 2.0,但今天官方页未显式声明),以及跨厂可比完整评测仍只有 AA 一家第三方、生产采用量尚未披露。这两点不阻止 S-confirmed(四门槛已满足),但决定它能不能从「开放度毕业」进一步坐实「生产采用」。
- 兑现路径:开/更新 T-116(v-openflagship 母题,权重卡点已解除、续追跨厂可比评测与生产采用);falsifier「8/13 前权重放出」已命中移除;24-72h 验证点:QwenLM 页许可证声明、首批第三方复测与自托管部署量。
- 证据入口:NVIDIA GB300 部署博客|NVIDIA 官方、>4K tok/s|查看原文;AIHot 权重上线|转述+原推|查看原文;Juya 早报 #8|第三方转述|查看原文
重点候选 · 待验证
① DeepSeek V4 Pro 0813 —— 重点候选,尚缺独立第三方 benchmark
- 为什么重要:重点厂商旗舰新代正式版 API,可能同时改变能力(增强 agent)与开放性/部署门槛两维:官方称增强 agent 能力、支持 Responses API 与 Codex 接入,DeepSWE 从预览版 12.8 升至 62.7;OpenRouter 显示其为大规模 MoE、1M 上下文、GA 发布、定价 $0.435/$0.87 per 1M。
- 确认阻断项:官方基准数字(DeepSWE 62.7 等)据 Simon Willison 考证,仅经 DeepSeek 官方微信群 → Reddit(被删)→ Hacker News ASCII 表传播,尚无独立第三方复测;权重是否开放仍未确认(Simon Willison 称「likely」但无官宣)。
- 下一步验证:24-72h 看独立 benchmark 复核与权重开放官宣;关联 T-116/v-openflagship。
- 已有证据:OpenRouter 模型页|一手规格/定价|查看原文;Simon Willison 解读|独立第三方|查看原文;金十·腾讯 CodeBuddy 支持|厂商生态确认|查看原文
纵轴 · 能力与技术演进
- 国产开源旗舰/开放权重(v-openflagship) —— 档位:收敛中(开放度子态回调)
- 实验室侧:阿里发布 Qwen3.8-Max 开放权重(2.4T/95B、原生 256K、GB300 NVL72 可部署、>4K tok/s),把开放旗舰从「权重待放」推到「可下载真旗舰」→ ①;DeepSeek 上线 V4 Pro 0813 正式版 API(增强 agent、Codex 接入、DeepSWE 62.7)补封闭侧能力。
- 证据:NVIDIA GB300 博客|NVIDIA 官方|查看原文;OpenRouter DeepSeek V4 Pro|规格/定价|查看原文
- 开源侧:Grok 4.6(封闭 API)在 AA Intelligence Index 拿 61,与 GPT-5.6 Sol 并列、仅落后 Claude Opus 5/Fable 5,τ³-Banking 51.3% 与 Qwen3.8 Max 同处前二,给开放/封闭对比提供第三方标尺。
- 证据:The Decoder|转述+价格|查看原文;Artificial Analysis|独立评测|查看原文
- 还卡在哪:跨厂可比完整评测仍只有 AA 一家第三方;Qwen3.8-Max 生产采用量、许可证宽松度待明确。
- 实验室侧:阿里发布 Qwen3.8-Max 开放权重(2.4T/95B、原生 256K、GB300 NVL72 可部署、>4K tok/s),把开放旗舰从「权重待放」推到「可下载真旗舰」→ ①;DeepSeek 上线 V4 Pro 0813 正式版 API(增强 agent、Codex 接入、DeepSWE 62.7)补封闭侧能力。
- 长任务可靠性/企业级 agent(v-longtask) —— 档位:收敛中
- 实验室侧:DeepSeek V4 Pro 0813 把「增强 agent 能力」写进正式版说明、支持 Responses API 与 Codex 接入;OpenAI Codex 活跃用户突破 1500 万(上期 1000 万)并重置用量,真实使用信号继续加厚。
- 证据:AIHot·Codex 1500 万|用户量信号|查看原文
- 开源侧:Zed 推出 Delta——基于 DeltaDB 的 agent 协作编程环境,是多 agent 协作工程化的一例。
- 证据:Hacker News·Delta|产品发布|查看原文
- 还卡在哪:跨厂可比评测标准(T-113)仍未建立;用户量是采用指标非可靠性指标。
- 实验室侧:DeepSeek V4 Pro 0813 把「增强 agent 能力」写进正式版说明、支持 Responses API 与 Codex 接入;OpenAI Codex 活跃用户突破 1500 万(上期 1000 万)并重置用量,真实使用信号继续加厚。
- 企业 agent 数据安全与信任(v-security) —— 档位:收敛中(攻击侧再加厚)
- 实验室侧:今年 3 月 LiteLLM 供应链投毒事件细节披露——约 40 分钟攻击窗口波及全球超 2500 家企业、195TB 凭据泄露(含云密钥、CI/CD 凭据),英伟达/AWS/三星等多家在受影响名单;IIT Bombay + Adobe Research 提出 PTP(Previous-Token Prediction)方法,仅靠输出文本即可近乎完美逆向还原 LLM 提示词,无权重访问也能攻第三方模型。
- 证据:AIHot·LiteLLM|事件细节|查看原文;The Decoder·PTP|研究方法|查看原文
- 还卡在哪:120 家 SAFE 框架仍是提案非强制;8/15 METR×OpenAI 审查为最后节点(→候选①/T-132)。
- 实验室侧:今年 3 月 LiteLLM 供应链投毒事件细节披露——约 40 分钟攻击窗口波及全球超 2500 家企业、195TB 凭据泄露(含云密钥、CI/CD 凭据),英伟达/AWS/三星等多家在受影响名单;IIT Bombay + Adobe Research 提出 PTP(Previous-Token Prediction)方法,仅靠输出文本即可近乎完美逆向还原 LLM 提示词,无权重访问也能攻第三方模型。
- skills/harness 标准化(v-skills) —— 档位:收敛中(事实标准候选子态)
- 开源侧:msitarzewski/agency-agents、anthropics/skills 等技能相关项目继续在 GitHub Trending 在榜,超大厂第一方技能包供给延续。
- 证据:GitHub Trending·agency-agents|在榜项目|查看原文
- 还卡在哪:无安装量/调用量/生产事故数据,pain_cleared 仍 false;Anthropic 是否加入 Agent Plugins TSC 的 8/19 节点维持。
- 开源侧:msitarzewski/agency-agents、anthropics/skills 等技能相关项目继续在 GitHub Trending 在榜,超大厂第一方技能包供给延续。
- 推理成本与小模型(v-cost) —— 档位:收敛中
- 实验室侧:DeepSeek V4 Pro 0813 定价 $0.435/$0.87 per 1M(GA,预告的涨价尚未落地);Grok 4.6 维持 $2/$6、较 Claude Opus 5 低 60%+;Qwen3.8-Max 开源免费可自托管——成本地板与收租化并存。
- 还卡在哪:两条相反价格信号同时缺条款级证据;DeepSeek 涨价节点空过、收租化无第三家跟进。
- 中国 AI 全栈(v-chinastack) —— 档位:收敛中
- 实验室侧:Qwen3.8-Max 权重发布 + 微信自研 WeLM(80B/3B 激活,嵌 14 亿用户)+ 豆包学生特惠 + 腾讯 Hy4 预告,国产模型层从开放到入口全线加厚。
- 证据:AIHot·WeLM 微信|入口级部署|查看原文
- 还卡在哪:第三方性能对比仍缺(8/20 节点)。
- 实验室侧:Qwen3.8-Max 权重发布 + 微信自研 WeLM(80B/3B 激活,嵌 14 亿用户)+ 豆包学生特惠 + 腾讯 Hy4 预告,国产模型层从开放到入口全线加厚。
- 具身智能/机器人 agent(v-embodied,边界观察) —— 档位:实验
- 开源侧:Dyna Robotics 发布 DYNA-2 世界-动作模型,基于 100 万小时第一人称人类视频预训练,任务成功率最高 90%,客户部署质量通过率 87%(上代 46%)。
- 证据:AIHot·Dyna-2|模型发布|查看原文
- 还卡在哪:仍踩「agent 软件为主形态」框架边界,连续无结构性进展,维持实验档(AC-004 early-warning)。
- 开源侧:Dyna Robotics 发布 DYNA-2 世界-动作模型,基于 100 万小时第一人称人类视频预训练,任务成功率最高 90%,客户部署质量通过率 87%(上代 46%)。
横轴 · 渗透率
- 企业知识工作(f-knowledgework) —— 档位:早期采用
- 载体/入口:Codex 活跃用户破 1500 万(真实使用加厚);Gemini 新增 14 款应用集成(Angi/OpenTable/Ticketmaster/Wix/Zocdoc 等),在设置里关联服务统一规划与待办;千问开放平台上线菜鸟智能体(@菜鸟对话寄快递、结合通讯录与历史记录自动补全);Claude Cowork 上线 Chrome 侧边栏支持跨端接续;VS Code 1.133 支持会话期间切换模型提供商(Claude/Copilot)。
- 证据:AIHot·Gemini 14 集成|入口扩张|查看原文;AIHot·菜鸟智能体|入口级 agent|查看原文;AIHot·VS Code 1.133|工具标准化|查看原文
- 真实使用信号:Codex 1500 万、Gemini 集成扩张是真实使用,但 distribution(付费/普及率)仍无硬数据;8/14 Auto Mode 生效、8/14 飞书/千问办公披露节点维持。
- 载体/入口:Codex 活跃用户破 1500 万(真实使用加厚);Gemini 新增 14 款应用集成(Angi/OpenTable/Ticketmaster/Wix/Zocdoc 等),在设置里关联服务统一规划与待办;千问开放平台上线菜鸟智能体(@菜鸟对话寄快递、结合通讯录与历史记录自动补全);Claude Cowork 上线 Chrome 侧边栏支持跨端接续;VS Code 1.133 支持会话期间切换模型提供商(Claude/Copilot)。
- 开放权重入口级履约(f-kimiopen) —— 档位:早期采用
- 载体/入口:Qwen3.8-Max 权重发布后,自托管成为可选项;千问开放平台菜鸟智能体是入口级履约的延续。
- 证据:NVIDIA GB300 博客|部署食谱|查看原文
- 真实使用信号:权重可下载 = 供给侧开放,真实部署量待 24-72h 验证。
- 载体/入口:Qwen3.8-Max 权重发布后,自托管成为可选项;千问开放平台菜鸟智能体是入口级履约的延续。
- 端侧/入口级 agent(f-caros) —— 档位:萌芽
- 载体/入口:微信自研 WeLM(3B 激活)嵌 14 亿用户聊天/搜索/小程序,是端侧+入口级最大单点部署;Google Pixel 11 在 PH 上架。
- 证据:AIHot·WeLM 微信|14 亿用户入口|查看原文
- 真实使用信号:微信规模为硬数据,但手机 Agent OS 激活量(T-103/T-130)仍缺,8/14 节点维持。
- 载体/入口:微信自研 WeLM(3B 激活)嵌 14 亿用户聊天/搜索/小程序,是端侧+入口级最大单点部署;Google Pixel 11 在 PH 上架。
资本与政策
- Anthropic 洽谈收购 Decart AI(约 60 亿美元):据彭博社,Anthropic 正洽谈以约 60 亿美元收购 Decart(专注跨芯片性能优化与生成式视频「世界模型」),谈判仍可能破裂。
- 证据:AIHot·Anthropic/Decart|彭博转述|查看原文
- Lovable 完成 4 亿美元 C 轮:AI 应用层融资信号,显示 agent 应用赛道资本热度延续。
- 证据:Hacker News·Lovable|融资|查看原文
- 腾讯 Q2 财报重注 AI、自由现金流首现负值:资本开支前置信号,呼应 AI 资本支出自我回报期主线(→T-121)。
- 证据:AIHot·腾讯 Q2|财报|查看原文
- 面壁智能启动 A 股上市辅导:国产大模型公司资本化延续。
- 证据:Juya 早报 #19|第三方转述|查看原文
待跟踪 & 本期变更
未来 24-72h 待跟踪(watchboard 投影):
| 待印证的能力矢量(纵轴) | 待观察的渗透(横轴) | 待发布动作 / 待验证项目 |
|---|---|---|
| Qwen3.8-Max 独立 benchmark 与跨厂可比评测(v-openflagship) | Qwen3.8-Max 真实自托管部署量(f-kimiopen) | Claude Code Auto Mode 8/14 默认生效首批拦截数据(→候选①/T-114/T-132) |
| DeepSeek V4 Pro 0813 独立评测与权重开放(v-openflagship) | Codex 1500 万后的 distribution 数据(f-knowledgework) | 8/15 METR×OpenAI 审查(Astra 最后节点,→T-132) |
| LiteLLM 类供应链攻击是否触发行业级响应(v-security) | 手机 Agent OS 激活量(f-caros,8/14) | 8/19 Anthropic 是否加入 Agent Plugins TSC(→T-126) |
🔄 本期变更(框架 × 跟踪合并)
- 框架:①
v-openflagship开放度子态回调——Qwen3.8-Max 开放权重今日发布,命中 8/13 falsifier,开放旗舰从「权重待放」升为「可下载真旗舰」(← frame_change,证据见今日重点①);②v-longtask真实使用加厚——Codex 破 1500 万、DeepSeek V4 Pro 增强 agent 能力(证据见纵轴);③v-security攻击侧再加厚——LiteLLM 2500 企业泄露 + PTP 提示逆向(证据见纵轴);④ 其余矢量(v-skills / v-cost / v-chinastack / v-embodied)档位沿用,本期顺延。框架体检(🔴 DUE)对照三条 invalidation_trigger 全未命中,regime 有效不换代。 - 跟踪项结算:
- #T-101(v-memory)⌛ 8/13 到期、无跨厂记忆审计/遗忘规范新进展 → 降级为季度观察(同 v-rsi 处置),退出每日 tracking_items。
- #T-113(v-longtask AgentPerf)⌛ 8/13 到期、跨厂可比评测标准仍未建立 → 结算 expire(无实质突破)。
- #T-112(v-skills 子项)⌛ 8/13 到期、仍无生产采用数据 → 结算 expire,母题 T-126 继续。
- #T-119(v-chinastack 子项)⌛ 8/13 到期、Apple 端侧/高通 SoC 无新证据 → 结算 expire。
- #T-116(v-openflagship 母题)→ ✅ 有进展顺延:Qwen3.8-Max 权重发布命中 falsifier,开放度回调,续追跨厂评测与生产采用(8/20)。
- #T-114(v-longtask/f-knowledgework)→ ⌛ 顺延:Codex 1500 万 + DeepSeek V4 Pro agent 能力加厚,8/14 Auto Mode 生效前维持 open(续 8/20)。
- #T-121(AI capex)→ ⌛ 顺延:腾讯 Q2 重注 AI + 面壁上市辅导 + 英伟达信贷,中报季继续(续 8/20)。
- #T-125(f-caros 母题)→ ⌛ 顺延:子项 T-103/T-130 无激活量,8/14 节点(续 8/19)。
- #T-126(v-skills 母题)→ ⌛ 顺延:agency-agents/anthropics skills 在榜,8/19 TSC 节点(续 8/19)。
- #T-127(v-chinastack)→ ⌛ 顺延:Qwen3.8-Max 权重 + WeLM/豆包/腾讯 Hy4 加厚,8/20 第三方对比节点(续 8/20)。
- #T-131(v-cost 母题)→ ⌛ 顺延:DeepSeek 涨价未落地、Grok 低价、Qwen 开源免费,收租化/价格战双线并存(续 8/20,子项 T-102 续 8/14)。
- #T-132(v-security 母题)→ ⌛ 顺延:LiteLLM + PTP + 120 家 SAFE 攻击侧加厚,8/15 METR×OpenAI(续 8/14,子项 T-120 续 8/14)。
- #T-133(v-chinastack 母题)→ ⌛ 顺延:WeLM 微信 14 亿 + LFM2.5-VL 端侧,中报季继续(续 8/20,子项 T-119 已 expire)。
- #T-128 / #T-129 维持 expired 结案,本期无新证据不复活。
- 候选① Claude Code 默认 Auto Mode 退出候选预算(让位于 Qwen3.8-Max S-confirmed 与 DeepSeek V4 Pro 候选),降 A 级、由 T-114/T-132 继续跟踪,8/14 生效为关键验证点。
- 新开:无新顶层项——Qwen3.8-Max 开放权重里程碑并入 T-116(v-openflagship 母题),DeepSeek V4 Pro 0813 作为 S-candidate 入 grading_audit,均不另开顶层。