更新时间:16:24|覆盖窗口:2026-09-02 ~ 09-03(承接上一期 2026-09-01)
数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(OpenAI / Anthropic / Google AI / Meta AI / DeepMind / HuggingFace / NVIDIA / The Decoder / Juya / AI Hot 等) / 金十电报
数据覆盖与缺口(CLS/财联社本 pipeline 不采集,属设计而非缺口):
| 源 | 9-02 入库 | 9-03 入库 | 状态 |
|---|---|---|---|
| Product Hunt | 20 | 16 | ✓ |
| Hacker News | 42 | 17 | ✓(9-03 相对回落属正常波动) |
| GitHub Trending | 0 | 19 | ⚠(9-02 历史快照不可补,按正常缺失) |
| RSS | 80 | 69 | ✓(含 Anthropic/Meta/Google/The Decoder/AI Hot 等;部分 Newsletter feed 当日 0 条属空返回) |
| 金十电报 | 400 | 400 | ✓(AI 相关占比低,已按 AI 过滤) |
| Juya AI Daily | 1 期 | 1 期 | ✓(9-02/9-03 源站直抓全文回填;第三方转述口径,厂商动态以官方源核对) |
这份日报是一张二维坐标系:纵轴看模型与产品的能力 / 技术往哪走(实验→收敛中→事实标准,判档看证据强度,同一矢量当天 ≥2 个独立证据才算收敛),横轴看 AI 产品被多少人、多少场景真用上(萌芽→早期采用→主流化,判档看真实使用信号,不看 star / votes)。
一句话结论
能力轴与定价同时动了一格:推理成本(v-cost)从「降涨对冲、方向未定」转向「降价侧结构性主导」——Anthropic Fable 5.1 把缓存读取定价变成旗舰级降价工具(读取成本直降 75%)、Google 六周内连发第三款平价模型(Gemini 3.8 Flash,$0.75/$3.75 每百万 token)、Meta Muse Spark 1.3 价格压到同级约 1/8-1/12,同一窗口三个独立降价信号是近月最密的一次;开放权重梯队(v-openflagship)国际侧重排坐实——Fable 5.1/Mythos 5.1 正式发布(Terminal-Bench-Science 52.6%、登顶 Artificial Analysis、成本最多降 45%),上期 T-159 的「明日发布」传闻兑现,S-confirmed 从 0 破冰。今日深度拆解给 Fable 5.1(下方);重点候选 Meta Muse Spark 1.3 离确认只差独立媒体深度评测。接下来 24-48h 盯三件事:Fable 5.1 第三方复测是否站得住(T-160)、Muse Spark 1.3 独立评测与 max 变体开放(T-157)、以及 9/5 到期的 NVIDIA×HF 官宣与 Hy4/DeepSeek 独立评测(T-154/T-156)。
今日重点 · 深度拆解
① Anthropic Fable 5.1 / Mythos 5.1 —— 旗舰换代,缓存读取定价成为新降价武器
- 是什么:Anthropic 9/2 发布新一代旗舰 Claude Fable 5.1 与 Claude Mythos 5.1——同一底层模型加不同安全层,Fable 5.1 全面开放,Mythos 5.1 仅限 Project Glasswing 内审核过的美国组织。官方口径:Terminal-Bench-Science 得分 52.6%(较 Fable 5 翻倍)、缓存读取成本低 75%、agentic coding 提升超 30%。
- 方法论落点:双轴同动,评级直接从 S-candidate 升到 S-confirmed。纵轴 v-openflagship:国际侧开放/前沿梯队重排坐实(此前国产第一梯队缺独立评测的反差更显眼,见纵轴);横轴 f-devagent:编码与长程研究 agent 的能力基准被整体抬高。一手证据(官方发布页)与独立复核(Artificial Analysis 66 分登顶、The Decoder 独立报道)同时成立,四门槛全过。
- 产业位置:这次比能力更值得看的其实是成本结构:缓存读取头一回成为旗舰级的官方降价叙事(低 75%),再配上「长程自主运行成本最多降 45%」(Decoder 口径),等于把 v-cost 的降价战场从「单次推理单价」挪到「任务级总成本」。Artificial Analysis 也提醒,max effort 下每任务成本比 Fable 5 还高 20%,降的是长程自主任务,不是所有用法。竞品侧:Muse Spark 1.3 同日以 1/8-1/12 价格贴身对标,Google 则走平价 Flash 序列(均见候选与纵轴)。
- 证据与反例:官方页与 Decoder/AI Hot/jin10 多源一致;Mythos 5.1 限美国组织的开放策略给「最先进能力是否真放开」留了问号;社区里也已经有人吐槽速率限制和自动续跑失效(AI Hot 转述 KOL),属于产品侧噪音,不影响模型定级。
- 兑现路径:新开 T-160 盯发布后梯队与定价传导;falsifier——若 FrontierSWE/Terminal-Bench 数据被第三方复测证伪或高度依赖特定评测设置,梯队重排与降价主导判断同步降级。
- 证据入口:[Anthropic 官方发布页]|[官方一手]|查看原文;[Artificial Analysis 66 分登顶]|[独立榜单(AI Hot 转述)]|查看原文;[The Decoder]|[独立报道]|查看原文;[金十快讯:缓存读取 -75%]|[官方口径转述]|查看原文
重点候选 · 待验证
① Meta Muse Spark 1.3 —— 重点候选,官方一手已可达,差独立媒体深度评测
- 为什么重要:Meta 9/3 发布 Muse Spark 1.3(编码与 agent 能力主打更新),Artificial Analysis 智能指数 62 分冲进第 3、首个跻身 Claude 与 GPT 之间(AI Hot 转述 AA 榜单,另一条口径 61-62 分逼近 Claude);DeepSWE v1.1 以 75.4% 登顶(超 GPT-5.6 与 Opus 5,AI Hot 转述);价格远低于同级——输入约 1/8、输出约 1/12。上线 Muse Code 与 Meta Model API、OpenCode Zen 免费 Contributor 档、OpenRouter 同步可用。可能同时改写 v-openflagship 国际侧平价竞争与 v-cost 降价叙事两个维度。
- 确认阻断项:独立复核仍以 Artificial Analysis 榜单与社区实测为主(第三方实测对比 1.2 版本已出),缺 Decoder 级独立媒体深度评测;max 变体仅限合伙预览、待安全测试;Muse Code 入口侧 SDK 采用数据未出。上期「官方一手页不可达」这个 blocker 本期消掉了,research.meta.ai 官方博客第一次直连成功。
- 下一步验证:24-72h 看独立媒体评测、max 变体开放时间与 Muse Code SDK 采用;关联 T-157/T-160。
- 已有证据:[Meta 官方博客]|[官方一手]|查看原文;[AA 62 分第 3]|[独立榜单(AI Hot 转述)]|查看原文;[第三方实测对比 1.2]|[独立社区实测]|查看原文;[DeepSWE 75.4% 登顶]|[第三方基准(AI Hot 转述)]|查看原文
纵轴 · 能力与技术演进
- 开放权重/开源旗舰(v-openflagship)—— 档位:收敛中
- 国际侧密度拉满:Fable 5.1/Mythos 5.1 正式发布(→今日深拆)、Muse Spark 1.3 平价入局(→候选①),开放权重竞争从「实验室发模型」进入「旗舰+平价双线」阶段。
- 国产侧:DeepSeek V4-Flash-Vision-Exp 窗口内无第三方评测出数(前值 HF 412 likes),维持候选、9/5 复核;Kimi API 原生支持 Codex 与 Claude Code(OpenAI Responses + Anthropic Messages 双格式兼容,9/2 官宣),国产模型首次以 API 兼容方式直连海外主流 coding agent 入口。
- 证据:[金十快讯:Kimi API 兼容 Codex/Claude Code]|[官方口径转述]|查看原文
- 还卡在哪:国产第一梯队(Hy4/DeepSeek V4 系)第三方独立评测仍缺席,与本期国际侧「官方+独立双证」的差距进一步显性化。
- 推理成本(v-cost)—— 档位:收敛中(判断从对冲转降价侧主导)
- Google 发布 Gemini 3.8 Flash(及 3.8 Flash Cyber,经 Fairwind 网络安全计划评估),$0.75/$3.75 每百万 token,与 3.7 同价——六周内第三款平价模型,节奏被评论者比作去年 2.5 Pro→3 的复制路径;The Decoder 点出前沿旗舰持续缺位、平价序列先行。代价:复杂任务推理步骤与工具调用增多,单任务 token 可能更高(官方口径经 AI Hot 转述)。
- Fable 5.1 缓存读取 -75% 与 Muse Spark 1.3 低 8-12 倍分别见深拆/候选,此处不重复。涨价侧(内存/HBM)窗口内无新证。
- 还卡在哪:降价是真结构性还是窗口内挤兑(旗舰换代+平价序列+开源同发),需看 9 月后续是否持续;HBM 供给约束对硬件价格的影响未解除。
- agent 技能与 harness 标准(v-skills)—— 档位:收敛中
- OpenAI WebMCP Challenge 9/3 截止(提交前 24h AI Hot 提示),实验性开放标准进入结果期,获奖方案与站点采用是下一观察点(T-151 已结算)。
- 证据:[AI Hot:WebMCP 距截止 24 小时]|[第三方转述]|查看原文
- 开源侧:Anthropic 开源 Claude Commerce Agents 参考蓝图(Apache 2.0,购物+商户 agent,含 Claude Code 插件,见横轴 f-consumer);GitHub Trending 上新 mattpocock/skills(技能包合集)、ChromeDevTools/chrome-devtools-mcp(官方 DevTools 工具化)、Gitlawb/openclaude(Claude Code 开源替代 CLI 生态)。
- 还卡在哪:分发生态继续铺,跨 agent 互通标准仍无收敛迹象(09-05 到期复核)。
- OpenAI WebMCP Challenge 9/3 截止(提交前 24h AI Hot 提示),实验性开放标准进入结果期,获奖方案与站点采用是下一观察点(T-151 已结算)。
- agent 安全与信任(v-security)—— 档位:收敛中
- OpenAI Astra 窗口内给出开放路径:官方称「即将推出,但会限制最先进网安功能」(9/2);Hugging Face 事件后为 Astra 加强安全措施,增加多层防护防止 agent「采取可能不符合预期的行动」,也继续保留部分小规模实验性训练。两周暂停的收尾是「受限能力开放+持续监控」,没有走向无限期封存(T-138 到期结算为 confirmed)。
- 政策侧:美国政府(DOJ)在纽约时报诉 OpenAI 案中支持 AI 训练属合理使用(见资本与政策)。
- 还卡在哪:供应链注入面(skill 文件)与对齐失效(Hacker-Opus)两条线仍是开放问题,Astra 的不透明推理循环也引安全专家担忧(AI Hot 转述,观点信号)。
- 长任务可靠性(v-longtask)—— 档位:收敛中
- 窗口内无新证(SKILL.state/ContextPilot 为前值),顺延。
- 记忆与上下文管理(v-memory)—— 档位:收敛中
- 窗口内无新证(产品级统一记忆仍未落地),顺延。
- 具身智能(v-embodied)—— 档位:实验
- 窗口内无强新证(microduck RL 开源为前值),维持实验档继续 early-warning。
横轴 · 渗透率
- 开发者 agent 入口(f-devagent)—— 档位:早期采用
- 载体 / 入口:Fable 5.1 成入口侧新能力基准(→今日深拆);Muse Spark 1.3 上线 Muse Code 并开放 OpenCode Zen 免费 Contributor 档与 OpenRouter(→候选①),Meta 把「免费可试」当入口争夺手段。
- 真实使用信号:窗口内以发布动作为主,缺新的第三方用量数据;Fable 5.1 上线当日即有 KOL 吐槽速率限制与自动续跑失效(AI Hot 转述),说明真用户在跑长任务。
- 证据:[AI Hot:Fable 速率限制吐槽]|[第三方转述]|查看原文
- 还差什么:新旗舰发布期的真实任务量与付费转化数据。
- 中国 AI 全栈(f-chinastack)—— 档位:早期采用
- 消费级 agent 代办(f-consumer)—— 档位:萌芽(基建雏形出现)
- 载体 / 入口:Anthropic 开源 Claude Commerce Agents 参考蓝图(Apache 2.0)——购物与商户两类 agent 的官方样板,覆盖零售/旅行/电信/娱乐四垂直,含 Claude Code 插件,任何人可自建交易执行 agent。这是消费级交易执行 agent 的第一个官方可复制底座,此前只有 Grok Bot 代购等单例。
- 真实使用信号:仍无真实购物量数据;蓝图到跑通之间隔着一整层支付/履约集成。
- 还差什么:第三方基于蓝图建出的真实 agent 与交易量(同源 Qwen E-Commerce Bench 365 天模拟经营评测属评测侧,AI Hot 报道,暂不单独计入口证据)。
- 端侧/可穿戴 AI 入口(f-caros)—— 档位:萌芽(算力侧准备 +1)
- 载体 / 入口:Perplexity 开源本地推理引擎 Lily(GitHub: pplx-garden),针对 Apple silicon 优化、默认跑 Qwen3.6-35B-A3B,官方口径 prefill 1.23x / decode 1.35x(对比 MLX-LM),Rust 运行时、自研 Metal kernel、不依赖 PyTorch/MLX——端侧跑 35B MoE 成为可复制方案,支撑 Perplexity Mac 应用的混合计算。
- 还差什么:穿戴/端侧产品本身仍无新证据(Lily 是算力准备不是入口产品)。
- 政府/国防入口(f-gov)—— 档位:萌芽
- 窗口内无新证(GenAI.mil 300 万军文人员为前值),顺延。
- 企业知识工作/AI 办公(f-knowledgework)—— 档位:早期采用
- 窗口内无新证(顺延)。
资本与政策
- 博通(AVGO)财报:XPU 客户地图再细化,但 AI 增速指引承压:盘后财报显示 AI 相关指引低于预期(Q4 营收指引 348 亿美元 < 分析师 351 亿,绩后一度跌超 6%),但 XPU 细节密集——OpenAI Jalapeno 2027 年部署 1.3GW、2028 年超 5GW(含后续一代 XPU);Anthropic 2027 年另部署 5GW 谷歌 TPU v8I,有望 2027-2028 年成为博通最大 XPU 客户;Meta MTIA 三代加速器交付至 2027 底、Q4 起大规模量产;与 OpenAI 合作第三代 XPU。算力资本继续向自研芯片/定制加速器集中(T-121 资本面新证)。
- Nscale 凭 Anthropic 订单合同收入破千亿美元、拟本月 IPO:The Information 报道英国云厂商 Nscale 已获超 1000 亿美元合同收入(含 Anthropic 450 亿协议),拟本月启动 IPO——AI 算力租赁从一级市场走进公开资本市场(SB Energy 之后又一例,T-121 呼应)。
- 证据:[金十快讯转 The Information]|[独立报道转述]|查看原文
- 月之暗面(Kimi)向港交所秘密交表、正式启动 IPO:与 Kimi API 兼容 Codex/Claude Code 同日官宣——国产大模型头部进入资本市场窗口,「国产开源旗舰商业化」从模型/API 走向股权市场定价(T-116 母题资本侧)。
- 证据:[金十快讯]|[媒体转述]|查看原文
- 美国政府支持 OpenAI 版权立场,AI 训练受「合理使用」保护:DOJ 在纽约时报诉 OpenAI 案中提交文件支持合理使用(The Decoder 称 landmark copyright case),训练数据合法性天平向模型方倾斜——对 OpenAI 直接利好,也对整个依赖公开语料训练的行业是政策侧背书(v-security 合规线)。
待跟踪
未来 24-72h 待跟踪(三栏即本期 watchboard 投影:待印证矢量=agent_eng_vectors、待观察渗透=product_forms、待发布 / 验证=watch_companies+watch_projects):
| 待印证的能力矢量(纵轴) | 待观察的渗透(横轴) | 待发布动作 / 待验证项目 |
|---|---|---|
| Fable 5.1 第三方复测能否站住(T-160,9/10 节点) | Muse Code 订阅转化与 Muse Spark 周用量是否持续(T-125/T-157) | 9/5 NVIDIA×HF 是否官宣(T-154);Cursor 切断日是否变动(T-155) |
| Muse Spark 1.3 独立媒体评测与 max 变体开放(T-157) | Claude Commerce Agents 是否出现第三方真实建站与交易量(f-consumer) | 9/5 Hy4 独立评测(T-156);DeepSeek V4-Flash-Vision-Exp 独立评测(T-116) |
| 降价是真结构性还是窗口挤兑:9 月平价/旗舰序列是否持续(v-cost) | Kimi 兼容 Codex/Claude Code 后的真实调用量(f-chinastack) | 9/10 WebMCP 挑战赛获奖结果(T-151 后续);9/14 Claude 限额调整净 -17% 生效(T-143) |