AI 日报 | 2026-07-07
更新时间:13:50|覆盖窗口:2026-07-07(承接上一期 2026-07-05;中间 07-06 缺状态,勿把数据空洞误读为平静)
数据来源:GitHub Trending / Hacker News / RSS(Juya AI 早报 / Latent Space / The Decoder 等)/ 金十电报
数据覆盖与缺口:
| 源 | 入库数 | 状态 |
|---|---|---|
| Product Hunt | 12 | ✓ |
| Hacker News | 31 | ✓ |
| GitHub Trending | 16 | ✓ |
| RSS | 48 | ✓ 主源 Juya AI 早报 / Latent Space(AINews) |
| 金十电报 | 200 | ✓(AI 相关条目占比低,靠关键词命中) |
本报告以 agent 为主轴:纵轴最强信号是任务级成本按有效能力计费(T-102) + 国产开源旗舰事实标准候选(T-116) + Skills/Harness 标准化事实标准候选(T-112);横轴最强信号是中国 AI 全栈起跳(华为 Atlas 950 + 阶跃 Agent OS + AI 智能体手机 + 支付宝 AI + 蚂蚁灵波) + ChatGPT for PowerPoint 办公软件层渗透 + Fable 5 任务级成本治理。中美 AI 摩擦从 7/1 产品代码层延伸到 7/3 企业禁用层(阿里 7/10 全面禁用 Claude Code 落地)。
档位图例:纵轴能力矢量为实验→收敛中→事实标准(每条矢量当天 ≥2 个独立证据才算收敛);横轴渗透为萌芽→早期采用→主流化(判档看真实使用信号,不看 star / votes)。🚫 去重: 每条证据只在最该落的那条轴展开一次;附录只枚举 + 指针;横向速记只写关系;本期变更只用 T 编号。
一句话结论
今天两轴地图动了一格——是事实标准候选验证日,不是单纯的证据积累日。纵轴上同时有两件够 S 级的事,都把对应矢量从"收敛中"推到"事实标准候选"。第一件是腾讯混元 Hy3 正式开源:295B MoE、Apache 2.0、256K 上下文、内部 270 位专家盲测 2.67/4 超 GLM-5.1、幻觉率 12.5%→5.4%、腾讯云 API 1 元·4 元每百万 token。它把国产开源旗舰从"三足鼎立"推到了"四源共振",T-116 当天完成候选验证(详见深度拆解①)。第二件是 Fable 5 订阅窗口 7/7 关闭并切换为 usage credits 计费,叠加 KAIST 7/5 的能耗研究指出 agent 单查询 GPU 能耗是单轮 LLM 的 62-136 倍——这两件事把任务级成本从按 token 计费正式推到了按有效能力计费的拐点,T-102 也当天完成候选验证(详见深度拆解②)。
横轴这边更显眼的是 WAIC 2026 前夜中国 AI 的全栈起跳:华为 Atlas 950 超节点 + 阶跃 Agent 操作系统 + 全球首款 AI 智能体手机 + 支付宝 AI 开放平台同日首秀,渗透从单一模型跨进"算力 + OS + 终端 + 平台"四层栈,这是 T-127 新开的依据——头部互联网厂商下场做底座不是口号,今天有了具体落点。同时 Anthropic 在 Claude 内部发现全局工作空间 J-space,叠加 agentskills / chrome-devtools-mcp 持续 Trending,skills 生态 + 浏览器 MCP + 模型内部机制三个标准化层同日推进——T-112 同步升档事实标准候选。
24-72h 盯两个对象:第一是腾讯 Hy3 的第三方独立 benchmark(MMLU / GPQA / HumanEval / AgentBench),官方盲测 2.67 是内部口径,需要第三方复核才能从候选升事实标准;第二是 Anthropic 是否在 Fable 5 usage credits 公布完整 Sonnet 5 价格表,如果官方披露与"按有效能力计费"一致,T-102 进入事实标准,如果仍按 token 计价则维持收敛中。
跟两轴无关但值得一句话记录的:三星电子业绩暴增 19 倍但股价重挫 10%、韩国 KOSPI 跌 6%——AI 内存景气周期已与 AI 估值脱钩,买预期卖事实的成熟周期现象首次在头部 AI 受益股上兑现。
今日重点 · 深度拆解
① 腾讯混元 Hy3 正式开源 —— 国产开源旗舰"四源共振"事实标准候选
- 是什么:腾讯混元团队 7/7 把旗舰 MoE 模型 Hy3 正式开源了——总参数 295B、激活 21B、上下文 256K,Apache 2.0 双发到 GitHub (Tencent-Hunyuan/Hy3) 与 HuggingFace (tencent/Hy3),腾讯云 API 当天上线,元宝同步接入免费对用户开放,OpenRouter / Nous Portal / CodeBuddy 多平台同时给出两周限时免费体验。换句话说:你想在哪个 harness 里跑,今天都能直接拿过去试,价格是每百万 tokens 输入 1 元、输出 4 元。
- 方法论落点:它直接推动 T-116 国产开源旗舰从"主流化前段"跨到"事实标准候选"。同日出现的证据有四件:Hy3 正式开源、美团 LongCat-2.0 同步开源、招商证券国际给出"Hy3 跻身第一梯队"评级、Hy3 内部 270 位专家盲测 2.67/4 超过 GLM-5.1。这是首次"开源权重 + 官方定价 + 第三方券商 + 内部盲测"四件齐发,放在同一矢量上互相印证,所以值得升档。横轴这边 Hy3 已经在 OpenRouter + CodeBuddy + Nous Portal 三处铺开,加上每百万 tokens 1/4 元的定价,把"国产模型 + 国际开发者入口 + 美企 IDE 默认选项"三个渗透层压到了同一价位带——之前 Kimi K2.7 Code 进 GitHub Copilot 已经把 T-116 立住了,Hy3 把这条线从"美企 IDE 单点"扩成了"多 IDE 多平台"。
- 产业位置:Hy3 上游吃腾讯云算力,下游直接喂给元宝(消费端)、腾讯云(企业端)、CodeBuddy(coding agent)。招商证券国际那份报告点出"成本可控 + 性能比肩 2-5 倍参数旗舰"两点,意味着国产开源旗舰的"能力跃迁 + 价格破坏"双轨在 2026 H2 第一次有了头部互联网厂商的官方站台,而不只是智谱 / DeepSeek / 月之暗面这种模型公司单挑。腾讯同一天还出现在 Kling AI 20 亿美元融资的参投方名单(CNBC 7/3)和 CXMT 30 亿美元存储订单的签约方名单(Reuters 6/29),所以中国 AI 全栈在 7 月正式进入了"头部互联网厂商下场做底座"的拐点。横向看,xAI 已经并入 SpaceXAI(Business Insider 7/6),Musk 的 AI 栈从模型扩到了 OS + 智能硬件。中美旗舰的差异不再是"中国做模型美国做模型",而是"中国做模型 + 全栈、美国做模型 + 太空 + 终端"。
- 证据与反例:一手证据已经齐——官方 GitHub/HF 仓库、腾讯云 API、元宝接入、招商证券评级,都可以直接验。但第三方独立 benchmark 仍缺:MMLU / GPQA / HumanEval / AgentBench 的非厂商口径都还没出,内部盲测 2.67/4 是腾讯自己的口径,不是第三方复核,这是 Hy3 现在还不够"事实标准"而停在"事实标准候选"的唯一卡点。幻觉率 12.5%→5.4% 也是官方口径,需要第三方复核。如果这两天有第三方 MMLU 跑分落到第一梯队,Hy3 就是首个"四源共振 + 三方复核"的国产开源旗舰,可以从候选直接升事实标准。
- 兑现路径:开 T-127(新开)"中国 AI 全栈(算力 + 模型 + OS + 平台)",把 Hy3 正式开源 + 阶跃 Agent OS + 华为 Atlas 950 + 支付宝 AI 开放平台 + CXMT 30 亿 + 可灵 20 亿这几件头部互联网厂商下场做底座的事件一起装进来。falsifier:若 Hy3 在 30 天内被第三方 benchmark 复核为"未达 GLM-5.1 同档",且招商证券国际报告被同行券商撤回为主观背书,T-116 维持"主流化前段"。24-72h 验证点:HuggingFace 上 Hy3 的第三方 benchmark 出现 + CodeBuddy 用户量披露。
② Fable 5 订阅窗口 7/7 关闭 + usage credits 计费 —— 任务级成本拐点
- 是什么:Anthropic 7/3 在官方公告里说了一件听起来小、实际很大的事——Pro / Max / Team / 部分 Enterprise 计划的 Fable 5,在 7/7 之前还能在订阅额度里跑,但 7/8 起就转到 usage credits 计量(BleepingComputer 7/3 + TheStreet 7/4 双源确认)。官方同时澄清"不是永久离开订阅",承诺"在产能充足后会重新纳入订阅",但首阶段明确按有效消耗计费,而不是订阅包干。叠加 Latent Space 7/7 的《The Field Guide to Fable》——Thariq 在现场 keynote 上讲"Unhobbling Claude",主张用户必须在订阅补贴窗口关闭前重新校准自己用 Fable 5 跑哪些任务、哪些任务降级到 Sonnet / Opus 4.8。补贴消失前的"用法重排",是 Anthropic 在 2026 H2 想推动的核心动作。
- 方法论落点:纵轴的 T-102 任务级成本从"收敛中"正式升档到"事实标准候选",因为 Fable 5 计费机制切换是单一厂商用政策动作把"按有效能力计费"从行业讨论推到落地。横轴上,T-125(coding agent 入口移动化)+ T-114(coding agent 工作台)的实际反应是用户被引导做"任务降级 + 模型重排"——这是真实使用信号,不是 star / votes 的注意力噪声。
- 产业位置:Anthropic 把"订阅打包"改成"信用额度 + 计量",本质是把模型定价的主导权从用户预算端拽回厂商端。同方向的硬证据是 KAIST 7/5 的研究(Let's Data Science 报道):agent 单查询消耗的 GPU 能耗是单轮 LLM 的 62-136 倍,因为 Reflexion / LATS 这类 agent 反复调用模型、等待工具、用延迟换精度。叠加 BestBlogs 7/5《模型、Agent 与人的成本》周刊 + AIEWF 7/3 loops debate + Anthropic 7/3 裁剪 80% system prompt(Fable 5 "want a small")+ pxpipe 7/5 削减 70% token 成本——五源共振"任务级成本必须治理"。中国侧同向:Hy3 输入 1 元/M 输出 4 元/M tokens、LongCat-2.0 美团定位"开源 + 极致成本"、蚂蚁灵波 LingBot-Vision 在 NYUv2 深度估计上 0.296 RMSE 优于 7B DINOv3 的同时小模型同样领先——中国 AI 在 7 月把"低成本 + 同档能力"做成了开源旗舰的标配。
- 证据与反例:BleepingComputer 7/3 直接引用了 Anthropic 官方原文——"For Pro, Max, Team, and select Enterprise plans, Fable 5 will be included for up to 50% of weekly usage limits through July 7, after which it will be available via usage credits"。这句话同时部分否定了 T-102 之前列的两个 falsifier 之一(Anthropic 确实公开了使用比例和转换机制,不是临时降级 + Opus 4.8 回退)。但完整 Sonnet 5 / Fable 5 价格表还没公布——目前披露的是"包含比例 + 切 credits",不是完整 token 单价,所以 T-102 现在只能停在"事实标准候选",距离"事实标准"还差最后这一张表。反过来看:若 7/15 之前 Anthropic 仍然不公布完整价格表,且用户大规模回退到 Sonnet 4.x,说明订阅包干价反而被市场接受,T-102 要降级回收敛中。
- 兑现路径:T-102 升档 → 事实标准候选。falsifier 调整:若 Anthropic 在 30 天内公布完整 Fable 5 + Sonnet 5 token 价格表且口径是"按有效能力",T-102 进事实标准;若仍是按 token 计费,降级回收敛中。24-72h 验证点:Anthropic 7/8 起的 usage credits 实际报价 + 用户在 Fable 5 / Sonnet 5 之间的迁移比例。
纵轴 · 能力与技术演进
矢量一 · 任务级成本从按 token 计费正式推向按有效能力计费 —— 档位:实验 → 收敛中 → 事实标准候选(T-102 升档,五源共振)
Anthropic 7/3 的一则公告把"按有效能力计费"从行业讨论推到了政策行为:Pro/Max/Team/部分 Enterprise 的 Fable 5 在 7/7 之前还能在订阅里跑,7/8 起就转 usage credits(BleepingComputer + TheStreet 双源)。这条政策动作背后有一个量化基础——KAIST 7/5 的能耗研究指出,agent 单查询消耗的 GPU 能耗是单轮 LLM 的 62-136 倍,因为 Reflexion / LATS 这类 agent 反复调用模型、等待工具、用延迟换精度(Let's Data Science 报道)。用户侧也在主动治理成本:pxpipe 7/5 推出削减 Claude Code / Fable 5 token 成本最多 70% 的工具。模型侧 Anthropic 同一天裁掉了 80% 的 Claude Code system prompt,理由是"Fable 5 models want a small",等于从模型设计层面承认小 system prompt 是新一代的方向。行业层面 BestBlogs 7/5《模型、Agent 与人的成本》周刊和 AIEWF 7/3 的 loops debate 把成本治理推到主轴——五源共振,任务级成本不再是单一厂商的事,是行业级别的范式切换。还差什么:Anthropic 至今没有公布完整 Sonnet 5 + Fable 5 的 token 价格表,quota / cache / thinking budget 的统一计费规则还没稳态,所以只能停在候选,不能直接进事实标准。别高兴太早:这是厂商侧单方面决策,不是市场自然演化;如果用户大规模回退到 Sonnet 4.x,说明"按订阅包干"仍是市场偏好,T-102 还得回退一档。落点见重点②。
矢量二 · 国产开源旗舰 + harness 主流化 —— 档位:主流化前段 → 事实标准候选(T-116 升档,七源共振)
腾讯混元 Hy3 和美团 LongCat-2.0 在同一天(7/7)分别开源——前者 295B MoE / Apache 2.0 / 256K,后者定位开源 + 极致成本,两家在"开源权重"这一层同时给出。行业侧立刻跟进:招商证券国际 7/7 出具"Hy3 跻身第一梯队"评级,这是头部券商第一次给国产开源旗舰做官方站台;融资层面,可灵 20 亿 AI 视频融资破纪录(阿里 / 百度 / 腾讯参投),CXMT 与腾讯签下 30 亿美元存储订单,资金流向印证了"头部互联网厂商下场做底座"的判断。横轴入口已经被三个平台同时铺开:OpenRouter / Nous Portal / CodeBuddy 接 Hy3、腾讯云 API + 元宝直接给国内 C 端和企业端、CodeBuddy 喂 coding agent 场景——加在一起,Hy3 把"国产模型 + 国际开发者入口 + 美企 IDE 默认选项"压到了同一价位带(1 元/M 输入,4 元/M 输出),T-116 从单点对标推到主流化前段。还卡在哪:第三方独立 benchmark 复核还没出来,内部盲测 2.67 是官方口径,需要 MMLU / GPQA / HumanEval / AgentBench 的非厂商口径验证。落点见重点① + T-127 新开。
矢量三 · Skills / Harness / 浏览器 MCP 标准化 —— 档位:实验 → 收敛中 → 事实标准候选(T-112 升档,六源 + 一发现)
模型内部、外部和浏览器层在同一天都有标准化动作。模型内部:Anthropic 发现 Claude 全局工作空间 J-space(Juya 7/7 #6 要闻),意味着模型自己也有"工作空间"机制——这是机制层标准化。外部开源侧:agentskills/agentskills、chrome-devtools-mcp、obra/superpowers、dotnet/skills、alirezarezvani/claude-skills、mattpocock/skills 这六个仓库 7/2-7/5 持续在 GitHub Trending,说明 skills 生态已经在多仓库自发收敛。浏览器侧:ChromeDevTools/chrome-devtools-mcp 把浏览器当作 MCP 入口标准化,等于浏览器第一次正式成为 agent 的工具来源之一。Codex 这边 openai/codex-plugin-cc 也在 Trending,把 Codex 推向插件化扩张。三层(模型内部 + skills 仓库 + 浏览器 MCP)同日推进,T-112 从收敛中升到事实标准候选。还差什么:skills 的 cross-vendor 接口仍未形成(各家 skills 还是单厂格式,迁移成本高);J-space 是单源 Juya 转述,Anthropic 官方还没公告——这两点是它现在还停在候选、没进事实标准的原因。
矢量四 · 企业 agent 生产化 + coding agent 工作台 —— 档位:收敛中(T-114 升档维持)
微软 7/3 把"Frontier Company"正式落地——$25 亿新主体、6000 名 AI 工程师,以 client-embedded 模型直接嵌入企业客户,这是 client-embedded 模式最大规模的单次动作。Cursor 同一天(7/7)推出 CFO Council 探讨 AI 经济学框架,意味着 CFO 第一次被拉进 AI 产品决策层,采购侧的预算口径开始直接对接 AI 经济学。办公软件层的渗透信号是 ChatGPT for PowerPoint 7/7 正式上线面向全球用户——它不是又一个 app,是把 ChatGPT 塞进大家天天用的 PowerPoint,与 Cursor Remote Control(手机控桌面)+ 微软 Frontier $25 亿同向,都是"不让你换工具,把 AI 塞进你已经在用的工具"。还卡在哪:企业 ROI 闭环和"学习循环"护城河还没量化,Microsoft CEO 7/3 的口径目前还停在口号层面,需要 90 天的实际企业部署数据才能验证。
矢量五 · 中美 AI 摩擦 → 企业禁用层 —— 档位:产品代码层 → 企业禁用层 / 收敛中事实标准候选(T-120 兑现)
Reuters 7/3 + Zamin 7/4 双源确认:阿里 7/10 全面禁用 Claude Code,Zamin 进一步披露阿里把 Claude Code 列为"高风险软件",要求员工改用自研 Qoder 工具。这一动作把 T-120 之前列的 falsifier 中"14 天内被撤回为'部分项目试运行'"反向兑现了——7/10 全面生效,意味着中美 AI 摩擦从 7/1 的产品代码层(Claude Code 隐藏标记中国用户)升级到了企业供应链层(中国头部企业禁用美国头部产品)。同期美国侧在做整合:xAI → SpaceXAI 7/6 重命名(Business Insider 7/6)、SpaceX 7/1 WSJ 报道 slim consumer AI device(Qualcomm Snapdragon + 自研 OS)——美国 AI 全栈从模型扩到 OS + 智能硬件,中美的摩擦层各自加深。
矢量六 · 中国 AI 全栈(算力 + OS + 模型 + 平台) —— 档位:早期采用(T-127 新开)
WAIC 2026 前夜华为 Atlas 950 超节点(业界最大规模)、阶跃 Agent 操作系统同日首秀,这是中国 AI 在算力 + OS 两层的官方亮相。模型层当天有腾讯混元 Hy3 + 美团 LongCat-2.0 + 蚂蚁灵波 LingBot-Vision 三家开源或新发布。平台层支付宝 AI 开放平台 7/7 正式上线,面向企业开发者和代开发服务商开放邀测。算力 + OS + 模型 + 平台四层栈同日落定,意味着头部互联网厂商下场做底座这件事不再停留在口号层面。还卡在哪:华为 Atlas 950 的量产时间表、阶跃 OS 的生态规模目前都没披露,真实出货量要等 WAIC 2026 议程(7/9-7/11)之后才有数据。
矢量七 · 自研 ASIC 出货前段 —— 档位:实验 → 收敛中(T-123 维持,本期无新增)
本期没有自研 ASIC 的新增证据,沿用 7/5 的五厂共振(Etched + Anthropic + Meta + SpaceX + 中国相变忆阻器)。华为 Atlas 950 作为中国侧对应信号并入 T-127,自研 ASIC 主轴维持原状。
横轴 · 渗透率
| 形态 / 产品 | 载体 / 入口 | 用户段 | 自主度 | 真实使用信号(≠ star / votes) | 档位 |
|---|---|---|---|---|---|
| 国产开源旗舰多 IDE 多平台 | Hy3 → OpenRouter/CodeBuddy/Nous Portal + 腾讯云 API + 元宝 | 开发者 | 自己跑 | Hy3 内部盲测 2.67/4 > GLM-5.1;1 元/M 输入 4 元/M 输出;两周限时免费 | 主流化前段 → 事实标准候选 |
| 办公软件层 AI 入口 | ChatGPT for PowerPoint | 企业 / 普通用户 | 有人盯 | 面向全球所有用户上线 | 早期采用 |
| AI 智能体手机(全球首款) | 华为 × WAIC 2026 首秀 | 普通消费者 | 自己跑 | "全球首款 AI 智能体手机"宣示,真实出货量待披露 | 萌芽 → 早期采用 |
| Agent OS 标准化 | 阶跃 Agent 操作系统 + 华为 Atlas 950 超节点 | 开发者 / 企业 | 自己跑 | WAIC 2026 业界最大规模超节点 + Agent OS 同日首秀 | 萌芽 |
| AI 平台化 | 支付宝 AI 开放平台 | 企业开发者 / 代开发服务商 | 自己跑 | 7/7 正式上线,邀测开放 | 萌芽 → 早期采用 |
| Fable 5 任务级成本治理 | Claude Pro/Max/Team | 专业用户 / 企业 | 自己跑 | 7/7 后 usage credits 计量,用户被引导按成本重排任务 | 主流化前段 |
ChatGPT for PowerPoint 上线这件事,信号意义大于产品意义——它不是又一个独立 app,而是把 ChatGPT 塞进全球企业日用的 PowerPoint。和 Cursor Remote Control(手机控桌面)、微软 Frontier $25 亿的方向一致,都是"不让你换工具,把 AI 塞进你已经在用的工具"。国产 harness 这一波(华为 Atlas 950 + 阶跃 OS + Hy3 + 美团 LongCat-2.0 + 支付宝 AI 平台)同日集中亮相,说明中国 AI 已经从"模型公司单挑"迈向了"头部互联网厂商全栈起跳"——横轴渗透和纵轴能力在这一天第一次能闭环:Harness 入口有 Atlas 950 + 阶跃 OS,模型有 Hy3 + LongCat-2.0,平台有支付宝 AI + 元宝,这是 T-127 新开的依据。
原始证据附录
下面这张表是双引擎(GitHub Trending / Hacker News / RSS / 金十)当天捞到的原始 feed 压成的精简版。每条只做"看到了什么 + 一句定性 + 归到哪条轴",不在这里重讲分析——已经在两轴或深度拆解里展开的,这里只写指针,不重述。
| 对象 | 来源 | 热度 / 体量 | 一句定性 | 落点 |
|---|---|---|---|---|
| 腾讯混元 Hy3 大模型 | 官方 + Juya + 金十 | 295B MoE / Apache 2.0 | 国产开源旗舰正式开源,多平台铺开 | →纵轴"国产开源旗舰" / →重点① |
| 美团 LongCat-2.0 | 招商证券国际 + Juya | 开源 | 国产开源旗舰第四家,招商证券称"关键里程碑" | →纵轴"国产开源旗舰" |
| 蚂蚁 LingBot-Vision + LingBot-Depth 2.0 | Juya | NYUv2 0.296 RMSE | 自监督视觉基础模型开源,优于 7B DINOv3 | →横轴"中国视觉开源" / 仅作 A 级 |
| 阿里 Fun-ASR-Realtime | Juya | 16 方言/30 语,88.62% | 实时语音识别升级,工业中文 88.42% / 英文 91.58% | →横轴"中国语音" / 仅作 A 级 |
| OpenAI GPT-Realtime-2.1 + 2.1-mini | Juya | 官方 | 语音模型迭代 | →横轴"国际语音" / 仅作 A 级 |
| ChatGPT for PowerPoint | Juya | 全球上线 | 办公软件层 AI 入口 | →横轴"办公软件 AI" |
| Anthropic Claude J-space 全局工作空间 | Juya | 机制发现 | 模型内部标准化发现 | →纵轴"Skills/Harness" / 单源,待 Anthropic 官方确认 |
| Cursor CFO Council | Juya | 行业 | CFO 进 AI 经济学决策层 | →纵轴"企业 agent 生产化" |
| xAI → SpaceXAI 重命名 | Business Insider 7/6 + Juya 7/7 | 官方 | xAI 并入 SpaceX,AI 产品统一 SpaceXAI 品牌 | →横轴"美国 AI 全栈" / 仅作 A 级 |
| 日本 2040 部署 1000 万 AI 机器人 | Juya | 政策 | 国家级 AI 机器人部署目标 | 仅大盘背景(政策) |
| 秘塔 AI 医学应用内测 | Juya | 内测群 | 中国垂直 AI 医疗应用 | 仅大盘背景 |
| WAIC 2026: 华为 Atlas 950 + 阶跃 Agent OS + AI 智能体手机 | 金十 7/7 | 首秀 | 业界最大规模超节点 + Agent OS + 全球首款智能体手机 | →横轴"中国 AI 全栈" / →T-127 |
| 支付宝 AI 开放平台 7/7 上线 | 金十 7/7 | 邀测 | 阿里 AI 平台化入口 | →横轴"AI 平台化" |
| 上海 AI 产业规模 6370 亿(同比 +39.5%) | 金十 7/7 | 政府数据 | 上海规上 AI 产业规模 | →资本与政策 |
| 国家发改委:AI 手机 / AI 电脑销量今年首超非 AI | 金十 7/7 | 政府表态 | AI 终端渗透率拐点 | →横轴"AI 终端" / T-103 顺延 |
| KAIST 7/5 agent 单查询能耗 62-136x | Let's Data Science 7/5 | 学术 | agent 能耗显著高于单轮 LLM | →纵轴"任务级成本" / →重点② |
| BleepingComputer 7/3 Fable 5 计费机制 | BleepingComputer | 官方转述 | Fable 5 7/7 后 usage credits | →纵轴"任务级成本" / →重点② |
| Hy3 招商证券国际"第一梯队"评级 | 招商证券国际 | 行业评级 | 国产开源旗舰首次头部券商站台 | →纵轴"国产开源旗舰" / →重点① |
| agentskills/agentskills | GH Trending | ★ 持续 | Skills 标准化仓库 | →纵轴"Skills/Harness" |
| chrome-devtools-mcp / codex-plugin-cc / obra/superpowers / dotnet/skills / mattpocock/skills | GH Trending | ★ 持续 | harness + skills 生态同日 Trending | →纵轴"Skills/Harness" |
| The Field Guide to Fable (Latent Space 7/7) | Latent Space | 编辑精选 | Thariq 现场 keynote 谈 Unhobbling Claude + Fable 5 用法 | →纵轴"任务级成本" / →重点② |
资本与政策动向(不进两轴,单独列):
阿里 7/10 全面禁用 Claude Code(Reuters 7/3 + Zamin 7/4)是 T-120 的兑现动作——摩擦层从商业摩擦推到产品代码层,再到企业供应链层,这是今天最重要的一笔资本/政策事件。WAIC 2026 前夜华为 Atlas 950 + 阶跃 OS + AI 智能体手机 + 支付宝 AI 平台同日亮相(金十 7/7),中国 AI 全栈起跳这件事在政策 / 资本侧有了官方背书。产业规模层面,上海规上 AI 产业 2025 年规模 6370 亿,同比增长 39.5%(金十 7/7),这一增速意味着 AI 产业整体仍在两位数高位扩张。国家发改委同一天表态 AI 手机 / AI 电脑销量预计今年首次超过非 AI 产品(金十 7/7)——这是终端渗透的拐点信号。三星业绩暴增 19 倍但股价重挫 10%(金十 7/7)是周期现象,不引申到 AI 整体景气衰退——AI 内存景气周期与 AI 估值首次脱钩,是买预期卖事实成熟周期现象。xAI 并入 SpaceXAI(Business Insider 7/6)则是美国 AI 全栈(模型 + OS + 智能硬件)的整合动作。
横向速记 & 降噪
横向速记(只写关系,不复述证据):
供给侧和需求侧在今天终于对上了——纵轴的"任务级成本治理"(Fable 5 计费切换 + KAIST agent 能耗研究)在横轴的"办公软件 AI"(ChatGPT for PowerPoint)、"AI 智能体手机"(华为 WAIC 首秀)、"harness 主流化"(Hy3 + CodeBuddy 多平台)上同时落地。供给侧的成本治理动作直接催生了需求侧的多入口扩张,过去常见的"能力先到、需求跟不上"在今天翻了一面:供给跑得快,但需求已经被催动起来。
开源和公司没有掉队。Hy3 正式开源、LongCat-2.0 开源、LingBot-Vision 开源是公司主动开放;agentskills、chrome-devtools-mcp、codex-plugin-cc 是社区主导;harness 层、skills 层、浏览器 MCP 层都同时有公司与开源在推,谁也没掉队,也没有一边吃独食。
中美各自的焦点错位还在加深——中国今天主推"全栈":Atlas 950 + 阶跃 OS + Hy3 + LongCat-2.0 + 支付宝 AI + 蚂蚁灵波 + 可灵 20 亿 + CXMT 30 亿;美国今天主推"任务级成本拐点 + 太空 / 终端整合":Fable 5 计费切换 + xAI → SpaceXAI + GPT-Realtime-2.1。错位很明确:中国做算力 + OS + 模型 + 平台的全栈,美国做模型 + 太空 + 终端。两条路还没有交叉点。
Anthropic 的 J-space 和 harness 标准化两条线同日推进——J-space 是模型内部机制发现(若官方确认),agentskills / chrome-devtools-mcp 是模型外部生态标准化。这意味着"模型内部 + 外部"两个标准化层在 Anthropic 和开源社区同步收敛,标准化已经从单一公司的事变成行业的事。
降噪(只写今天的具体对象):
腾讯 Hy3 内部盲测 2.67/4 超 GLM-5.1 是内部口径,第三方独立 benchmark 仍未出——MMLU / GPQA / HumanEval / AgentBench 的非厂商口径是它升档事实标准的最后一道关。引用时降级为"官方口径",不要当成已经验证的事实。
Anthropic Claude 全局工作空间 J-space 是 Juya 单源转述,Anthropic 官方未公告——若 7 天内官方未确认,T-112 的升档要从事实标准候选退回收敛中,只保留五源 skills / harness Trending 的部分。
全球首款 AI 智能体手机是 WAIC 2026 首秀宣示,真实出货量、用户量、价格都要等披露——从"萌芽 → 早期采用"需要出货数据撑住,现在还停在宣示阶段。
三星业绩暴增 19 倍但股价重挫 10% 是周期现象,不是 AI 整体景气衰退——AI 内存景气周期与 AI 估值首次脱钩,买预期卖事实的成熟周期。江波龙 2026H1 净利同比 +622x(上一期数据)反向印证中国 AI 存储超级周期仍在兑现,不要把这个信号外推到 AI 整体衰退。
待跟踪 & 本期变更
未来 24-72h 待跟踪(本期 watchboard 投影,也是下一期输入):
| 待印证的能力矢量(纵轴) | 待观察的渗透(横轴) | 待发布动作 / 待验证项目 |
|---|---|---|
| 任务级成本拐点 T-102 → 事实标准(等 Anthropic 公布完整价格表) | 中国 AI 全栈 T-127 → 主流化前段(等华为 Atlas 950 + 阶跃 OS 量产/规模披露) | 腾讯 Hy3 第三方独立 benchmark (MMLU/GPQA/HumanEval/AgentBench) |
| Skills/Harness 标准化 T-112 → 事实标准(等 J-space 官方确认) | AI 智能体手机 T-127 子项(等华为出货数据) | Anthropic 7/8 Fable 5 usage credits 实际报价 |
| 国产开源旗舰 T-116 → 事实标准(等 Hy3 第三方 benchmark + LongCat-2.0 真实使用量) | 办公软件 AI(等 ChatGPT for PowerPoint 真实用户数) | WAIC 2026 7/9-7/11 议程(华为/阶跃/腾讯/智谱/Kimi 全栈厂商集中亮相) |
| 中美 AI 摩擦 T-120 → 维持(等阿里 7/10 全面禁用 Claude Code 落地后是否扩散到其他中国 CSP) | Fable 5 用户任务迁移(等 7/8 后 Fable 5 / Sonnet 5 实际使用比例) | xAI → SpaceXAI 整合后 AI 终端设备(7/1 WSJ 报道的 slim device)首次公开 |
S 级重点对应:重点① 盯 Hy3 第三方 benchmark + 招商证券国际报告是否被同行券商跟进;重点② 盯 Anthropic 7/8 起 Fable 5 usage credits 完整价格表。
🔄 本期变更(框架 × 跟踪合并)
- 框架(动了一格,这是事实标准候选验证日):
- 纵轴升档:T-102 任务级成本 从"收敛中" → "事实标准候选"(Fable 5 7/7 后 usage credits 计费 + KAIST 7/5 agent 能耗 62-136x + Anthropic 裁剪 80% system prompt + Hy3 1元/M + pxpipe 70% 五源共振)。细节见重点②。
- 纵轴升档:T-112 Skills/Harness 标准化 从"收敛中" → "事实标准候选"(agentskills + chrome-devtools-mcp + codex-plugin-cc + obra/superpowers + dotnet/skills 五源 Trending + J-space 机制发现,五源 + 一发现)。细节见纵轴"Skills/Harness"节。
- 纵轴升档:T-116 国产开源旗舰 从"主流化前段事实标准候选" → "事实标准候选"(Hy3 正式开源 + LongCat-2.0 开源 + 招商证券国际第一梯队评级 + CodeBuddy/OpenRouter/Nous Portal 多平台 + 1元/M 价格 + 内部盲测 2.67/4 七源共振)。细节见重点①。
- 新开:T-127 中国 AI 全栈(算力 + OS + 模型 + 平台) ← WAIC 2026 前夜华为 Atlas 950 + 阶跃 OS + AI 智能体手机 + Hy3 + LongCat-2.0 + 支付宝 AI + 蚂蚁灵波 + 可灵 20亿 + CXMT 30亿 八件齐发,头部互联网厂商下场做底座。
- 顺延:T-101(记忆可靠性)、T-103(入口级 agent 真实使用量)、T-106(端侧小模型,WAIC 智能体手机首秀使其部分升档,但闭环未形成,主轴顺延)、T-113(benchmark 标准缺口)、T-119(Apple 端侧)、T-121(AI 资本支出)、T-122(AI agent 经济)、T-123(自研 ASIC,本期无新)。
- 退潮:无。
- 跟踪项结算(上一期 15 个 open + 2 dismissed,本期全部碰一次):
#T-101 → ⌛ 顺延—— 记忆可靠性卡点,本期无新证据,顺延。#T-102 → ✅ 升档事实标准候选—— Fable 5 7/7 计费切换 + KAIST 7/5 agent 能耗 62-136x + Hy3 1元/M + Anthropic 裁剪 80% system prompt + pxpipe 70% 五源共振。细节见重点②。#T-103 → ⌛ 顺延—— 入口级 agent 真实使用量,ChatGPT for PowerPoint 上线但真实用户量待披露。#T-106 → ⌛ 顺延(部分升档)—— 端侧小模型闭环未形成,但 WAIC 智能体手机 + 阶跃 Agent OS 部分支撑,主轴顺延。#T-109 → ❌ 已 dismissed(上期并入 T-120,维持)。#T-112 → ✅ 升档事实标准候选—— agentskills + chrome-devtools-mcp + codex-plugin-cc + obra/superpowers + dotnet/skills 五源 Trending + J-space 机制发现,六源共振。#T-113 → ⌛ 顺延—— benchmark 标准缺口,CursorBench 3.1 + Senior SWE-Bench 出现但跨厂可比未形成。#T-114 → ✅ 升档维持(收敛中)—— Microsoft Frontier $25亿 + Cursor CFO Council + ChatGPT for PowerPoint 三源共振。#T-116 → ✅ 升档事实标准候选—— 国产开源旗舰七源共振,细节见重点①。#T-119 → ⌛ 顺延—— Apple 端侧 + 自研 ASIC 出货前段,本期端侧 Apple 端无重大更新,WAIC 智能体手机对应 T-127。#T-120 → ✅ 兑现(收敛中事实标准候选)—— Reuters 7/3 + Zamin 7/4 双源确认阿里 7/10 全面禁用 Claude Code,falsifier 中"14 天内撤回"被反向兑现。#T-121 → ⌛ 顺延—— AI 资本支出进入自我回报期,上海 6370亿 + 国家发改委 AI 终端拐点 + 可灵 20亿 + CXMT 30亿 多源,但企业 ROI 闭环仍未量化。#T-122 → ⌛ 顺延—— AI agent 经济,加密巨头押注但 ARPU/真实使用未披露。#T-123 → ⌛ 顺延—— 自研 ASIC 出货前段,本期无新证据,沿用 7/5 五厂共振。#T-124 → ❌ 已 dismissed(上期并入 T-120,维持)。#T-125 → ✅ 升档(早期采用 → 主流化前段)—— Cursor Remote Control + 腾讯 Marvis + WAIC AI 智能体手机首秀,三源共振;公网跨设备待验证。#T-126 → ✅ 升档(收敛中 → 事实标准候选)—— harness 标准化 + 浏览器 MCP,agentskills + chrome-devtools-mcp + codex-plugin-cc + obra/superpowers + ZCode + page-agent + J-space 七源同日推进。#T-127 → 🆕 新开—— 中国 AI 全栈(算力 + OS + 模型 + 平台),WAIC 2026 前夜华为 Atlas 950 + 阶跃 OS + AI 智能体手机 + Hy3 + LongCat-2.0 + 支付宝 AI + 蚂蚁灵波 + 可灵 20亿 + CXMT 30亿 八件齐发,头部互联网厂商下场做底座。
- Open 项:上期 15 → 本期 14(T-109 + T-124 dismissed; T-102/T-112/T-114/T-116/T-125/T-126 升档; T-127 新开)。预算 10 以内仍偏多,下期继续消化(目标 10 以内)。