AI 日报 | 2026-08-02
更新时间:17:30|覆盖窗口:2026-08-02 ~ 08-02(承接上一期 2026-08-01) 数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(OpenAI / Anthropic / Google AI / Meta AI / DeepMind / HuggingFace / Mistral / NVIDIA / The Decoder / Juya / AI Hot 等)/ 金十电报
数据覆盖与缺口(CLS/财联社本身不采,非缺口;金十为采集上限 200 条,AI 相关占比偏低时以模型发布 / 半导体 / 宏观为主):
| 源 | 入库数 | 状态 |
|---|---|---|
| Product Hunt | 20 | ✓(当日榜单 votes 普遍 0,注意力信号弱,未计入重点) |
| Hacker News | 35 | ✓(精选 31) |
| GitHub Trending | 15 | ✓ |
| RSS | 91 | 部分官方 / Newsletter feed 当日 0 条(周日低产:OpenAI Blog / Google AI / HF Blog / NVIDIA / Microsoft AI / Stratechery / Ben's Bites / TLDR AI / Latent Space / Import AI / The Neuron / Interconnects / One Useful Thing / Daniel Miessler / YouTube 频道等;均 feed 正常返回 0 条,非抓取失败);AIHot / The Decoder / Simon Willison / Juya 正常 |
| 金十电报 | 124 | ✓(精选 83;AI 相关占比低,以模型发布 / 半导体 / 宏观为主) |
这份日报是一张二维坐标系:纵轴看模型与产品的能力 / 技术往哪走(实验→收敛中→事实标准,判档看证据强度,同一矢量当天 ≥2 个独立证据才算收敛),横轴看 AI 产品被多少人、多少场景真用上(萌芽→早期采用→主流化,判档看真实使用信号,不看 star / votes)。
一句话结论
今天地图没动,是证据积累日:v-security 的"可审计规范"一侧被 METR 的独立根因调查呼吁和 Snap/LinkedIn 的反 AI 水军动作同时垫厚,f-knowledgework 的真实使用信号也因 Gemini Spark 全球开放和 OpenAI 重置 Codex/Work 限额而继续变厚——但两条都还卡在档内,没跨档。本期无新 S-confirmed(DeepSeek V4-Flash 已于 8/1 毕业),S-candidate 沿用 MCP 无状态规范(候选 1/2,1 空位),等 8/5 fastmcp 生产迁移公告。接下来两天盯:① MCP fastmcp 8/5 是否兑现无状态生产迁移(决定候选能否升 S-confirmed);② METR×OpenAI HF 事件模型行为审查(8/15)是否把"可审计规范"从呼吁推向标准;③ MiniMax H3 开源权重实际放出与独立评测。
重点候选 · 待验证
① MCP 无状态规范 —— 重点候选,尚缺头部服务器生产迁移公告
- 为什么重要:协议层事实标准自我重构——核心传输从双向有状态转无状态,新增 MRTR / 标头路由 / 可缓存列表,授权对齐 OAuth 2.0;官方披露 TS/Python SDK 双破 10 亿总量,同时动了"基础设施依赖"与"部署门槛"两维。
- 确认阻断项:头部 MCP 服务器(fastmcp 等)尚未公布切换到无状态传输的生产迁移公告;旧特性(Roots / Sampling)废弃对存量生态兼容冲击无第三方评估。
- 下一步验证:8/5 fastmcp 公告是否给出生产迁移时间表与兼容方案(关联 #T-126 / v-skills)。
- 已有证据:MCP 官方博客 2026-07-28|Hacker News 讨论|Simon Willison:Stateless MCP
纵轴 · 能力与技术演进
- 企业 agent 数据安全与信任(v-security)—— 事实标准候选 · 收敛中高位子态
- 独立第三方推力:METR(评测机构)在 HF 入侵后公开呼吁对 AI agent 不当行为开展独立根因调查——把"事后复盘"往前推到"事前可审计规范"的独立制度化信号。
- 平台侧呼应:Snap 更新 Spotlight 推荐算法、完全由 AI 生成的视频不再推荐;LinkedIn 同步反击低质量 AI 内容洪流——内容可信 / 真实性的平台级治理,与"agent 采集数据缺审计"同源。
- 还卡在哪:仍缺可执行审计规范、无企业公开采购 agent 安全产品→维持事实标准候选子态,未毕业(third_party 已 true,pain_cleared 仍 false)。
- 别高兴太早:呼吁不等于标准;METR×OpenAI 审查结论 8/15 才出,OSAA 是否形成可执行规范尚无时间表。
- 长任务可靠性 / 前沿模型创意生成(v-longtask)—— 收敛中
- 实验室侧:Claude Opus 5 把"提示词生成游戏"从粗糙色块推进到带物理和音乐的完整 3D 原型;Karpathy 用其生成《指环王》3D 世界——前沿模型在长程、连贯的创意生成任务上明显进阶,是长任务可靠性在"生成式 agent"维度的侧面证据。Opus 5 已于 7/25 升 S-confirmed,今日是其能力证据的继续累积,未新开矢量。
- 还卡在哪:创意生成 demo 不等于企业级长任务可靠,跨场景生产级可靠性与成本数据仍缺。
- 国产开源旗舰 / 开放权重(v-openflagship)—— 收敛中
- 实验室侧:MiniMax 宣布视频生成模型 H3 即将开源(open weights),用户反馈质量 / 数量优于 2.5、成本更低、推理更快;国家超算互联网正式上线 DeepSeek-V4-Flash-0731 模型 API 调用与模型文件,一键接入即可调用——把"开放旗舰"从"能下载"再推到"国家级算力一键可调"。
- 开源侧:与 Kimi K3 / 字节 Seedance 2.5 共同压实开放权重方向。
- 还卡在哪:跨厂可比完整评测仍缺、蒸馏疑云未裁决→维持收敛中。
- 中国 AI 全栈(算力+OS+模型+平台)(v-chinastack)—— 收敛中
- 算力约束侧:英伟达 B300 单机深圳现货价 6 月 600 万、近日涨至 1200 万、供不应求秒空,海外采购成本约 300 万、溢价来自入境渠道——高端算力现货紧缺仍是国产替代的现实压力源,国产替代卡产能非架构。
- 制造侧:英特尔加速俄亥俄晶圆厂、EMIB-T 封装良率逼近 90%——封装自主化进度信号(关联国产设备线)。
- 还卡在哪:算力供给缺口短期靠溢价填补,国产产能爬坡仍需时间。
- skills / harness 标准化(v-skills)—— 收敛中
- 叙事侧:Chamath 将 AI 产业拆为六层,认为长期护城河在 Harness 层(把业务规则、私有数据、工作流变成 AI 可用专属上下文)——与 MCP 无状态候选同源,强化"harness 是分水岭"的判断。
- 工具侧:NVIDIA NeMo 团队发布 Molt——PyTorch 原生的智能体强化学习框架,把 agent 训练侧工具化(关联 DeepSeek Harness minimal mode 即将发布;Juya #3 DeepSeek Harness 面向 Agent 开源项目开发者招募内测)。
- 还卡在哪:MCP 候选仍缺生产迁移公告;harness 生态生产采用证据缺。
- 具身智能 agent / 物理 AI(v-embodied)—— 实验
- 单点强证据:Figure F.03 人形机器人完全自主、无遥控、无云端接管地爬上真实金属梯子并站稳——爬梯是机器人公认难点,被视为从"实验室能跑能跳"到"真实世界能上能下"的突破。
- 还卡在哪:单点演示,无人牵头整合(AC-004 边界),v-embodied 维持实验。
- 推理成本与小模型(v-cost)—— 收敛中
- OpenAI 内部版 Astra 解决十项数学开放问题(Juya #1);Tibo 称已重置 Codex 和 ChatGPT Work 使用限制(Juya #2)——限额重置延续结构性降价,真实可用门槛继续下移(关联 #T-131)。
- 还卡在哪:专用小模型 + 前沿路由跨场景生产级采用数据仍缺。
- 记忆与上下文(v-memory)/ 多智能体编排(v-multiagent)/ 模型自改进 RSI(v-rsi):今日无新直接证据,档位沿用(v-memory / v-rsi 实验,v-multiagent 收敛中),顺延。
横轴 · 渗透率
- 企业知识工作 agent(f-knowledgework)—— 早期采用
- 载体 / 入口:Gemini Spark 智能体 7/31 向全球大部分用户开放,可在指示下整理收件箱、总结通讯邮件、取消订阅、订机票——把 agent 嵌进 Google 生态的日常入口;OpenAI 重置 Codex / ChatGPT Work 限额(Juya #2)同样降低真实可用门槛。
- 真实使用信号:使用信号延续变厚(全球开放 + 限额重置),仍相对全体信息工作者处早期,未跨档。
- 还差什么:企业公开采用 / 付费 / 留存数据仍缺。
- 国产开源旗舰渗透(f-kimiopen)—— 主流化前段:国家超算互联网一键接入 V4-Flash API + MiniMax H3 即将开源,真实调用 / 下载入口继续铺开(证据见纵轴 v-openflagship);真实调用量仍待验。
- 消费级补贴入口(f-consumerpromo)/ 车机 agent(f-caros):今日无新渗透证据,顺延(特斯拉车机 × 豆包仍待官方确认)。
资本与政策
- AI 发展公开信:开源权重与前沿节奏之争 —— Simon Willison 汇总近期多封公开信,焦点是开源权重与前沿模型发布节奏的治理分歧,关联 v-openflagship 分发面与 8/1 白宫审查框架后续处置。
待跟踪 & 本期变更
未来 24-72h 待跟踪(三栏 = 本期 watchboard 投影:待印证矢量 = agent_eng_vectors、待观察渗透 = product_forms、待发布动作 = watch_companies+watch_projects):
| 待印证的能力矢量(纵轴) | 待观察的渗透(横轴) | 待发布动作 / 待验证项目 |
|---|---|---|
| v-security 能否从"事实标准候选子态"进事实标准(可执行审计规范) | f-knowledgework 全球开放后的真实使用 / 留存 | MCP fastmcp 无状态生产迁移公告(8/5) |
| v-openflagship 跨厂可比评测 / 蒸馏疑云裁决 | f-kimiopen 真实调用 / 下载量 | MiniMax H3 开源权重实际放出与独立评测 |
| v-skills:MCP 生产迁移 + DeepSeek Harness minimal mode(8/10) | f-caros 特斯拉车机官方确认与激活数据(8/14) | DeepSeek Harness 内测进展 |
| v-chinastack:B300 现货紧缺的国产替代进度 | — | METR×OpenAI HF 事件审查结论(8/15) |
---
🔄 本期变更(框架 × 跟踪合并)
- 框架:两轴矢量 / 渗透沿用,N 项顺延;v-security 事实标准候选子态被 METR 呼吁独立根因调查 + Snap/LinkedIn 反 AI 水军再压实(←
frame_change);f-knowledgework 真实使用因 Gemini Spark 全球开放 + OpenAI 重置 Codex/Work 限额变厚;S-confirmed 0 / S-candidate 1(MCP 无状态沿用,候选 1/2,1 空位)。框架体检到期执行,对照三条 invalidation_trigger 全未命中,regime 有效不换代。 - 跟踪项结算:
- #T-101 记忆可靠性 → ⌛顺延(今日无新直接证据)
- #T-113 AgentPerf benchmark → ⌛顺延(DeepSeek 已确认坐实自评缺口,跨厂可比标准仍缺)
- #T-114 coding agent 工作台 + 企业 agent → ✅有进展顺延(Gemini Spark 全球开放 + OpenAI 重置 Codex/Work 限额)
- #T-116 国产开源旗舰渗透 → ✅有进展顺延(MiniMax H3 开源 + 国家超算互联网 V4-Flash API)
- #T-121 AI capex 自我回报 → ⌛顺延(今日无新)
- #T-125 入口移动化(母题 T-103/T-130)→ ⌛顺延,续期至 2026-08-19(手机 agent OS 开售 30 天激活数据待 8/14)
- #T-126 harness+MCP(母题 T-112)→ ✅有进展顺延,续期至 2026-08-19(MCP 候选延续 + DeepSeek Harness 招募内测 + Chamath harness 叙事 + NVIDIA Molt;等 8/5 fastmcp)
- #T-127 中国 AI 全栈 → ✅有进展顺延(B300 现货翻倍 + EMIB-T 良率 ~90%)
- #T-128 RSI → ⌛顺延(今日无新)
- #T-131 AI 定价战(母题 T-102)→ ✅有进展顺延(OpenAI 重置 Codex/Work 限额 + Gemini Spark 免费全球)
- #T-132 企业 agent 数据安全(母题 T-120)→ ✅有进展顺延(METR 呼吁独立根因调查 + Snap/LinkedIn 反 AI 水军,v-security 候选子态再压实)
- #T-133 端侧/国产硬件(母题 T-119)→ ✅有进展顺延(B300 现货翻倍 + EMIB-T 良率)
- #T-129 已 expired(上期)
- 新开:无(本期无新矢量 / 渗透 / 项目达到开项门槛,open 仍 12>10 继续压缩)。
- 框架体检:AC-004 accepted(v-embodied/v-rsi 仍实验,无独立复现,early-warning 继续);AC-005 accepted(母题结构沿用,sub_items 独立到期时钟保留,open 仍超预算继续压缩)。