AI 日报 | 2026-08-04
更新时间:16:40|覆盖窗口:2026-08-04 ~ 08-04(承接上一期 2026-08-03) 数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(OpenAI / Anthropic / Google AI / Meta AI / DeepMind / HuggingFace / Mistral / NVIDIA / The Decoder / Latent Space / Juya / AI Hot / Simon Willison / The Neuron 等)/ 金十电报
数据覆盖与缺口(CLS/财联社本身不采,非缺口;金十为采集上限内全量,AI 相关占比偏低时以模型发布 / 半导体 / 宏观为主):
| 源 | 入库数 | 状态 |
|---|---|---|
| Product Hunt | 18 | ✓(当日榜单 votes 全为 0,注意力信号缺失,未计入重点判断) |
| Hacker News | 21 | ✓(AI 相关 8 条,其中 4 条进正文) |
| GitHub Trending | 16 | ✓ |
| RSS | 61 | ⚠️ 结构性偏斜延续:多个英文一手 / Newsletter feed 当日 0 条(OpenAI Blog / Google AI / HF Blog / NVIDIA / Microsoft AI / Stratechery / Ben's Bites / TLDR AI / Import AI / Interconnects / One Useful Thing 等;均 feed 正常返回 0 条,非抓取失败);实际产出集中在 AI Hot + Latent Space / Juya / The Decoder 各 1 条——英文一手观点面连续第二天偏薄,交叉验证强度低于常日 |
| 金十电报 | 353 | ✓(AI / 半导体 / A 股相关 13 条进正文;其余为宏观与商品) |
这份日报是一张二维坐标系:纵轴看模型与产品的能力 / 技术往哪走(实验→收敛中→事实标准,判档看证据强度,同一矢量当天 ≥2 个独立证据才算收敛),横轴看 AI 产品被多少人、多少场景真用上(萌芽→早期采用→主流化,判档看真实使用信号,不看 star / votes)。
一句话结论
今天地图没跨档,变的是测量口径而不是档位——两轴各多了一块硬地基。v-openflagship 从昨天的"权重实际放出"推进到"旗舰全面 live + 许可边界被官方澄清":Qwen3.8-Max 已在 OpenRouter 与 Cloudflare AI Gateway 上线可调用,跨榜拿到 Frontend Code Arena 第四(1668 Elo,仅次于 Claude Opus 5 [Max] 的 1705)、Vision Arena 第二(1305)、SWE-bench 87.3%、Terminal-Bench 2.1 得分 67.4,Vals Index 与 Claude Opus 4.7 打平(66.1 对 66.1)而单次测试成本低约 2.3 倍($2.68 对 $6.17),官方重申下周开源 Max 级权重 + 27B;同日 MiniMax 正面回应 H3 许可传闻,明确可通过正式授权在美 / 欧 / 英 / 韩部署(美国因 Disney 诉讼另需弃权书),昨天列的第二条确认阻断项被部分清掉。v-longtask 侧出现今天最实的结构性增量:Epoch AI 与 METR 联合发布 MirrorCode——第一个把"AI 能独立完成多大的软件项目"做成端到端可测口径的长程 coding 基准(25 个目标程序、22 个开源 + 3 个私有留出、132 个任务实例、6 种语言,单任务最高给到 $2,600 / 19 天无人干预预算,Claude Opus 4.7 用 14 小时 / $251 重实现了约 1.6 万行 Go 的 gotree,人类工程师估算需 2–17 周),这正好命中我们跟了近两个月的 #T-113「跨厂可比长程 benchmark 缺口」。本期 S-confirmed 0,S-candidate 2(预算 2/2 占满):① Qwen3.8-Max 开放旗舰全面 live、② MirrorCode 长程 coding 基准;上期两个候选(MiniMax H3、MCP 无状态)今日增量弱于这两个,按排序挤出候选、降 A 级继续跟踪。接下来两天盯:① 8/5 fastmcp 是否兑现无状态生产迁移公告;② 下周 Qwen3.8-Max / 27B 权重是否如期放出、许可证形态;③ MirrorCode 是否被第三方实验室采纳进模型评测口径。
重点候选 · 待验证
① Qwen3.8-Max 开放旗舰全面 live —— 新增重点候选,缺权重实体与独立复现
- 为什么重要:这是"开放旗舰"从发布叙事转向可调用商品的一天。Qwen3.8-Max(2.4T 总参 / 95B 激活 / 100 万上下文)已在 OpenRouter 与 Cloudflare AI Gateway 上线,OpenCode 已接入,API 定价输入 $2.0/M、输出 $6.0/M;同时在多个独立聚合榜同步拿到位置——Frontend Code Arena 首发第四(1668 Elo,仅次于 Claude Opus 5 [Max] 的 1705)、Vision Arena 第二(1305)、SWE-bench 87.3%、Terminal-Bench 2.1 得分 67.4;Vals Index 66.1(开放权重模型第二、43 个模型中总第十),与 Claude Opus 4.7 分数打平而单次测试成本低约 2.3 倍($2.68 对 $6.17),且相比 Qwen 3.7 Max 的 57.5 在约 2.5 个月内提升 8.6 分。官方同时重申"下周开源 Qwen3.8-Max 权重并同步开源 Qwen3.8-27B",Latent Space 的判断是"若非 Kimi K3 先发,它本会是全球最强开放模型"。它同时动了两维:
部署门槛(旗舰级开放权重的可获得性)与推理成本(同档能力下的单价差)。 - 确认阻断项:① 权重仍未放出——本期全部能力证据来自闭源 API 与聚合榜,"开放"目前只是承诺,许可证形态未知;② 厂商自评的长程能力(10+ 天无人值守自建 harness、125 小时自主复现论文并超基线 +2.71 分、526 队竞赛前 13%、GCD/RSA 芯片设计门数 8298→678、E-Commerce Bench 365 天 4.16 倍回报)全部无第三方复现;③ Arena / Vals 属聚合榜位置,非跨厂可比完整评测,与 #T-113 的缺口性质相同。
- 下一步验证:下周权重实际放出与许可证条款;长程能力宣称是否出现独立复现(关联 #T-116 / #T-113 / v-openflagship / f-kimiopen)。
- 已有证据:Latent Space AINews:Qwen 3.8 Max(2.4T) and 27B, new open weights models(第三方深度,含官方推文原文与全部能力宣称)|AI HOT:Qwen3.8 Max 上线 OpenRouter,开源权重将至|AI HOT:Qwen 3.8 Max 上线 AI Gateway,性价比突出|AI HOT:开源联盟进步飞速,Qwen 3.8-Max 登顶前端代码榜第四|The Decoder:Alibaba's new Qwen model is also taking your job(独立评论)|Juya AI Daily 2026-08-04(第三方转述,含 2.4T 规格与开源节奏)
② MirrorCode 长程 coding 基准 —— 新增重点候选,缺第三方采纳与跨厂完整榜单
- 为什么重要:这是评测层的结构性补位。过去一年 SWE-bench 类基准都在测"修 bug / 加单个 feature"这种小时级任务,而 agent 的真实卖点是"几天到几周的项目级工作"——中间这段一直没有可比口径,也正是 #T-113 卡了近两个月的东西。MirrorCode 的做法是让模型在看不到原始源码的前提下端到端重实现整个程序,只用行为对齐(包括模型从未见过的留出测试)判定通过。设计上三条是新的:scale-aware(不再把推理预算卡在 $1–10,最大单任务给到 $2,600 / 19 天无人干预)、难而可行(最难任务人类工程师估算需数月)、抗作弊(沙箱、无网络、无原始 codebase、留出测试不可见)。25 个目标程序覆盖 Unix 工具、数据序列化与查询、生物信息、解释器、静态分析、密码学、压缩,22 个已开源(132 个任务实例 / 6 种语言),3 个作为私有测试集留出。首批结果:Claude Opus 4.7 在 14 小时 / $251 内重实现了 gotree(约 1.6 万行 Go、40+ 命令),最好的实现通过 2000/2001 测试(仅漏一个日期注解边角命令),而人类工程师无 AI 辅助估算需 2–17 周。它动的是
可验证性这一维——把"agent 能做多大项目"从厂商自评拉回可复现测量。 - 确认阻断项:① 仅一家发布、尚无第三方实验室采纳该口径,还不是行业标准,只是又一个基准;② 数据污染风险作者自陈未排除——目标程序均为开源项目,模型预训练很可能见过原始 codebase,作者做了 memorization screen(通过筛查的目标模型能重实现、被判定记忆的反而失败)但明确表示"无法排除记忆贡献";③ 公开页面给出的跨模型结果口径与论文口径不完全可比(语言映射与预算设置不同),完整跨厂榜单尚未铺开。
- 下一步验证:是否有第二家独立机构用 MirrorCode 报结果、是否进入主流模型卡的标配评测(关联 #T-113 / v-longtask)。
- 已有证据:Epoch AI:MirrorCode 官方页(一手,含方法、结果与 22/25 开源说明)|arXiv 2606.30182(论文,与 METR 联合开发)|Hacker News 讨论 81 分 / 84 评论(独立)
纵轴 · 能力与技术演进
- 国产开源旗舰 / 开放权重(v-openflagship)—— 收敛中(本期最大增量,痛点继续部分缓解但未跨档)
- 旗舰侧(从"发布"到"可调用 + 有榜位"):Qwen3.8-Max 上线 OpenRouter 与 Cloudflare AI Gateway,OpenCode 已接入;Frontend Code Arena 第四(1668 Elo)、Vision Arena 第二(1305)、SWE-bench 87.3%、Terminal-Bench 2.1 得分 67.4、Vals Index 66.1(与 Opus 4.7 同分,单测成本约为其 1/2.3);官方重申下周开源 Max 级权重 + 27B。
- 许可侧(昨天的阻断项被部分清掉):MiniMax 正面回应 H3 许可限制传闻,否认"美国等地区无法合法使用",明确可通过正式授权在美国 / 欧洲 / 英国 / 韩国部署,其中美国因 Disney 诉讼需额外签署弃权书。这把昨天"Community License 商用边界未被第三方评估"从"完全未知"推进到"官方口径已给出、第三方解读仍缺"。
- 端侧可达性(新维度):Show HN 项目 Swiftlet 声称在 Mac 上以 4.3 GB 内存运行 80B 版 Qwen、在 iPhone 上运行 35B 版(HN 142 分 / 53 评论);同日 lyogavin/airllm(4GB 单卡跑 70B 推理,+1,085 stars/日)与 antirez/ds4(DeepSeek 4 Flash / PRO 的 Metal / CUDA / ROCm 本地推理引擎,+384 stars/日)同时在 Trending——开放权重的本地可跑性正在被工具层持续压低门槛。注:Swiftlet 仓库的 enrichment 因 GitHub API 限流未取到正文,性能宣称无独立验证,仅记为方向信号。
- 生态侧:AI HOT 一篇「Kimi-K3 开源背后:数据飞轮才是护城河」把开放权重的竞争落点从模型本身转到数据回流机制(第三方观点,无一手数据)。
- 还卡在哪:Qwen 权重下周才放、许可证形态未知;H3 独立质量横评仍为零;跨厂可比完整评测仍缺→
pain_cleared仍为 false,维持收敛中。 - 别高兴太早:今天所有"开放旗舰"能力证据都来自闭源 API 和聚合榜。榜位不等于权重,承诺不等于放出——去年 Qwen 有过"新管理层转闭源"的前科,这次的兑现节奏本身就是验证点。
- 长任务可靠性 / 企业级 agent(v-longtask)—— 收敛中(评测口径侧本期最强增量)
- 测量侧(本期新增):Epoch AI × METR 发布 MirrorCode,把长程 coding 做成端到端可测口径——25 个目标程序 / 22 个开源 / 132 个任务实例 / 6 种语言,最大单任务给 $2,600、19 天无人干预预算;Opus 4.7 重实现约 1.6 万行 Go 的 gotree 用时 14 小时 / $251(人类估算 2–17 周),最好实现通过 2000/2001 测试。数据污染由 memorization screen 部分排除但未证否。
- 能力侧(厂商自评,不作独立证据):Qwen3.8-Max 宣称 10+ 天无人值守自建 coding harness、125 小时自主研究循环超原论文基线 +2.71 分、竞赛击败 87% 人类队伍、完整芯片设计流(门数 8298→678、面积 -81%、500 MHz 时序收敛)、E-Commerce Bench 365 天模拟 4.16 倍回报。全部无第三方复现,与 MirrorCode 的可复现口径形成鲜明对照——这正是本期把 MirrorCode 而非 Qwen 长程宣称写进候选阻断项的原因。
- 使用侧(人机分工的独立观点):Sean Goedecke 的《LLMs reward expertise》登 HN 824 分——核心论点是 LLM 是"放大镜"而非"替代品",领域专业知识决定产出上限(以 Terence Tao 用 AI 做数学为例证),评论区大量从业者自述与之相符。这条对企业 agent 落地的含义是:agent 生产化的瓶颈可能不在模型,而在使用者能否把问题说清楚。
- agent 能力可移植 / harness 标准化(v-skills)—— 收敛中
- 运行环境侧(新形态):Cloudflare 开源
@cloudflare/computer——给每个 AI agent 配一台独立虚拟工作计算机,底层是基于 SQLite 的虚拟文件系统,默认跑在 isolate(动态 worker)里,官方称 不到 10% 的任务才需要开容器,npm install @cloudflare/computer即可用。这是把"agent 的执行沙箱"从重容器压到轻 isolate 的一次工程尝试。 - 协作框架侧:Y Combinator 开源 QM——MIT 许可的多智能体协作框架,可在 Slack 和网页端运行,每个员工 / 房间隔离内存、文件、密钥与权限,支持 Pi / OpenCode / Codex / Claude Code 多种后端,面向约 10–500 人团队,部署需自备云账户与 Postgres。这是"多 agent 进组织"少见的完整开源实现,但无采用数据。
- harness 侧(第三方转述):Juya 当日提到 Kiro 推出统一 agent harness(ACP 协议 + Cedar 权限模型),与 #T-126 的"多厂 harness 标准化"方向一致;因系第三方转述、未取到一手公告,仅记为方向信号。
- 生态侧:Panniantong/Agent-Reach(给 agent 装"眼睛"读写 Twitter / Reddit 等,+1,057 stars/日)与 zhaoxuya520/reverse-skill(逆向工程 / 授权渗透测试 skill 仓库,+2,446 stars/日居首)同日登 Trending——skill 化封装继续扩散,但 star 不是使用量。
- 还卡在哪:MCP 无状态规范本期仍无生产迁移证据(8/5 fastmcp 公告是下一个判定点),今日按排序被挤出候选降 A 级,但 #T-126 的开放痛点未变。
- 运行环境侧(新形态):Cloudflare 开源
- 推理与任务成本(v-cost)—— 收敛中(本期证据密度高)
- 价格侧:GPT-5.6 Luna 宣布降价 80% 且永久生效;Qwen3.8-Max 以 $2/M 输入、$6/M 输出进入旗舰档,第三方给出的综合成本约为 Opus 4.7 的 1/2.3。两条叠在一起,旗舰档单价的下移已不像促销。
- 工程侧(本期新增,比降价更结构性):Cloudflare 公布在生产规模跑 Kimi 与 GLM 的压缩实践——Kimi K2.6 用 FP8 KV cache 把可承载上下文从 686K 推到 1.37M tokens,GLM 5.2 用 INT4 把权重从 705 GB 压到 421 GB,并给 KV cache 加了完整性校验(额外成本 <1%)。这条说明长上下文的边际成本正在被推理侧工程吃掉,而不只是靠标价战。
- 成本可见性侧:Cloudflare 同步推出 Billable Usage API,把用量成本做成可编程查询(HN 52 分)——agent 时代"账单归因"开始被当成基础设施问题。
- 任务级成本样本(接 #T-102):MirrorCode 给出了迄今最硬的一组——单任务预算最高 $2,600 / 19 天,Opus 4.7 完成 1.6 万行 Go 项目 14 小时 / $251。这把"任务级成本"从个案 demo 推进到基准内置口径。
- 模型自改进 / 递归自我改进(v-rsi)—— 实验(本期两条新证据,未跨档)
- OpenAI 发文称其下一代内部模型在 10 个数学与理论计算机科学的长期未解问题上产出了新结果(HN 524 分 / 讨论激烈)。争议点在评论区已经很明确:这些结果究竟贡献了新数学思想,还是高效检索并组合了既有文献——OpenAI 自身表述被质疑有营销夸大成分。无第三方数学界复核。
- 面壁智能开源 ForgeStencil,宣称一周内自动优化 100+ 个工业与科学软件、全程零人工介入。若属实,这是"模型改进现有软件系统"的批量样本,但目前仅第三方转述、无一手技术报告、无独立复现。
- 判档:两条都指向"模型产出可被验证的新结果",但一条缺同行复核、一条缺一手材料,均不构成 RSI 闭环证据→v-rsi 维持
实验。
- agent 记忆(v-memory)—— 收敛中(无痛点位移)
- TencentCloud/TencentDB-Agent-Memory 连续第二日在 Trending(+1,090 stars/日),仍是团队级记忆中枢的实现层产品,不是"遗忘—恢复—审计"标准。痛点未动。
- 企业 agent 安全与治理(v-security)—— 收敛中(事实标准候选子态,本期政策侧有动静但信息为零)
- 美国政府已完成先进 AI 模型自愿性评估框架的制定,但内容未公开,且相关方在正式发布前最多只能提前 30 天获取。方向上这是政策侧从"讨论"转向"成文",但由于文本不可见,对企业侧合规成本、开源 / 闭源是否区别对待都无法判断——这是一条"知道有、但不知道是什么"的事件。
- 还卡在哪:可执行审计规范与企业公开采购证据本期仍为零,子态不推进。
- 中国 AI 全栈(v-chinastack)—— 收敛中
- 资本 / 供应链侧:小米智造股权投资基金与 OPPO 入股电池管理芯片研发商华芯智源(工商变更已生效,非传闻)——手机厂继续向上游芯片渗透。
- 二级市场侧:A 股半导体与 CPO 板块出现单日级别的资金异动(详见「资本与政策」)。
- 模型侧:面壁 ForgeStencil 开源、Juya 提到智谱 GLM-5.3 出现仓库迹象(第三方转述、未证实,仅记为待观察)。
- 具身智能(v-embodied)—— 实验(本期无新证据)
- 昨日 AC-004 设的"连续两日强证据"标记,今日未续上:无 HOST 类可复现开源证据、无新硬件自主性演示。early-warning 撤回,档位不动。
横轴 · 渗透率
- 企业知识工作 agent(f-knowledgework)—— 早期采用(本期出现第一条降温型独立证据)
- 反向证据(重要):Google 发布 ATLAS 报告,称未发现 AI 取代办公室工作的迹象。但报告的方法论缺陷已被点出——全程仅基于 Gemini 自身的使用数据,样本封闭、口径自选,结论适用范围受限。即便打折看,这仍是本轴少见的"大厂自己出面说渗透没那么快",与厂商叙事方向相反,值得记一笔。
- 叙事侧:扎克伯格公开表态"每家企业都将拥有自己的 AI"——立场宣示,无数据。
- 供给侧:YC 开源 QM 面向 10–500 人团队的多 agent 协作,把"团队级 agent 编排"做成可自部署方案,但无采用数据。
- 判档:供给继续变厚、需求侧首次出现降温型证据,
distribution仍 false,维持早期采用,不跨档。
- 开放权重下沉(f-kimiopen)—— 早期采用(可达性继续改善)
- 端侧:Swiftlet 声称 Mac 4.3 GB 内存跑 80B Qwen、iPhone 跑 35B(无独立验证);airllm 4GB 单卡跑 70B、antirez/ds4 本地跑 DeepSeek 4 同日在 Trending。
- 云侧:Qwen3.8-Max 上 OpenRouter / AI Gateway,Cloudflare 把 Kimi 与 GLM 的生产推理成本压下来(FP8 KV cache / INT4 权重)——开放权重在第三方云上的可服务性也在改善,不只是本地。
- 判档:可达性两端同时改善,但仍无调用量 / 下载量数据,维持
早期采用。
- 消费级 AI 促销 / 免费化(f-consumerpromo)—— 早期采用
- GPT-5.6 Luna 永久降价 80%;北京 AGI Bar 上线"不限量免费 Token"服务,到店连 Wi-Fi 即可畅用 DeepSeek V4 Flash——线下场景把模型当引流品。两条都属获客手段,无留存数据。
- 内容生成侧:Dreamina Seedance 2.5 发布,支持多模态引用(闭源,与 H3 形成同代对照)。
- 车载 / 移动端 agent 入口(f-caros)—— 萌芽(本期无证据)
- 今日无新手机 agent OS 或车机集成证据,顺延。
- Product Hunt 观察:18 款当日新品 votes 全为 0,注意力信号不可用。从品类看,AI agent 相关占多数(Atlaso"一个记忆给所有 AI"、Hey Noah 创始人主动型行政助理、Domo 可定制日历 agent、Glasp MCP Connector、ZapDigits MCP、MOTHER 为 Claude Code 定制终端、Finyuus 面向持久化受治理 AI 工作流的代码优先语言)——MCP 连接器与 agent 记忆继续是新品扎堆区,但无一条可作为渗透证据。
资本与政策
- AI 债务的隐性杠杆被摆上台面:Fortune 报道 AI 相关隐性借贷规模已达 $1.65 万亿,其中债券发行 YTD 达 $2,250 亿、同比 +973.7%,按当前节奏年化约 $4,000 亿;文章判断这一融资节奏不可持续,市场已出现疲劳信号(HN 126 分 / 154 评论,讨论集中在 SPV 与租赁结构是否被充分计入)。这条直接接 #T-121"AI 资本支出进入自我回报期"的另一面——回报还没兑现,杠杆先上去了。
- A 股 AI 硬件链单日级异动:创业板指全天大涨 5.64%、科创 50 涨 4.09%、深成指涨 3.25%、沪指涨 0.33%,沪深两市成交额 2.21 万亿(较上一交易日放量),主力资金净流入 585.49 亿元。CPO 概念大爆发——主力净流入前四全是光模块 / 连接:中际旭创 46.51 亿、新易盛 43.04 亿、东山精密 42.97 亿、天孚通信 23.4 亿;盘中联讯仪器 20CM 涨停,协创数据、鼎通科技、长光华芯、仕佳光子跟涨;富时 A50 成分股收盘呈"银行走软、半导体走强"。这是本期最集中的一次"AI 算力硬件"定价,但属单日情绪,不构成 #T-133 要的中报级财务验证。
- 韩国把 AI 提到国家投资议程:总统李在明表示 AI 驱动的产业变革正在重塑全球产业格局,强调韩国需"大胆"和"迅速"投资;同日 KOSDAQ 指数飙升近 6%,史上首次连续 3 个交易日触发买方侧边路交易机制。
- 苹果 × OpenAI 诉讼升级为公开对喷:苹果申请临时禁令,试图阻止 OpenAI 及两名前员工使用其机密信息;OpenAI 以官网长文回应,称苹果对此案处理有误,并另发《Apple is getting this wrong》(HN 146 分 / 129 评论,该页 enrichment 被 403 拦截,未取到全文)。人才流动与商业秘密的边界正在被推到法庭。
- 美国 AI 评估框架成文但不透明:自愿性评估框架制定完成、内容未公开、发布前最多提前 30 天获取(见纵轴 v-security)。
- 苹果印度年销售额首破 100 亿美元(截至今年 3 月的过去 12 个月),零售渠道持续扩张——与 AI 无直接因果,但对端侧 AI 的硬件基数有含义。
待跟踪 & 本期变更
🔭 下一步验证节点
| 节点 | 日期 | 影响 |
|---|---|---|
| fastmcp 无状态生产迁移公告 | 2026-08-05 | #T-126 / v-skills |
| Qwen3.8-Max / 27B 权重实际放出与许可证形态 | 2026-08-10 | #T-116 / f-kimiopen |
| MiniMax H3 独立第三方质量评测(许可侧已部分兑现) | 2026-08-10 | #T-116 / v-openflagship |
| MirrorCode 是否被第二家独立机构采纳报结果 | 2026-08-18 | #T-113 / v-longtask |
| DeepSeek V4-Flash 独立第三方 benchmark 复现 | 2026-08-10 | #T-116 / #T-113 |
| DeepSeek Harness minimal mode 发布 | 2026-08-10 | #T-126 / v-skills |
| Qwen-CUA 权重 / 产品化与 OSWorld-Verified 第三方复现 | 2026-08-17 | #T-113 / v-longtask |
| 美国 AI 自愿评估框架文本公开 | 2026-08-20 | #T-132 / v-security |
| METR×OpenAI HF 事件模型行为审查结论 | 2026-08-15 | #T-132 / v-security |
| 千问办公钉钉端入口上线与企业席位采购数据 | 2026-08-14 | #T-114 / f-knowledgework |
| Gemini Spark 全球开放后真实使用 / 留存数据 | 2026-08-10 | #T-114 / f-knowledgework |
| 特斯拉车机引入豆包 / 千问官方确认与真实激活数据 | 2026-08-14 | f-caros / #T-125 |
| 努比亚 NaviX / 荣耀 Robot Phone 开售 30 天真实激活数据 | 2026-08-14 | #T-130 |
| Fable 5 正式定价核对与用户反应 | 2026-08-10 | #T-102 / #T-131 / v-cost |
| 中报季正式披露(星宸 / 中科创达 / 长鑫) | 2026-08-31 | #T-133 |
🔄 本期变更(框架 × 跟踪合并)
- 框架:两轴矢量 / 渗透沿用,未跨档。本期特征是"测量口径先于能力档位变化"——v-longtask 的最强增量不是模型更强,而是第一次有独立第三方(Epoch AI × METR)把长程 coding 做成可复现基准;v-openflagship 的增量不是权重更多,而是旗舰从"发布"到"可调用 + 有榜位 + 许可有官方口径"。v-cost 因 GPT-5.6 Luna 永久降价 80% + Qwen 旗舰定价 + Cloudflare FP8/INT4 压缩(Kimi K2.6 上下文 686K→1.37M、GLM 5.2 权重 705GB→421GB)三条叠加,从"价格战"扩到"工程侧边际成本下降";v-rsi 因 OpenAI 十道数学难题 + 面壁 ForgeStencil 出现两条新证据但均缺复核,维持
实验;v-embodied 因今日无证据,AC-004 的"连续两日强证据"标记未续上、撤回;f-knowledgework 首次出现降温型独立证据(Google ATLAS),维持早期采用。S-confirmed 0 / S-candidate 2(新增 Qwen3.8-Max 开放旗舰全面 live、新增 MirrorCode 长程 coding 基准;候选预算 2/2 已占满)。 - 候选换手说明:上期两个候选今日均被排序挤出、按 A 级继续跟踪,不再写入定级审计——① MiniMax H3 开放权重:今日增量仅为许可澄清(第三方转述 MiniMax 回应),无独立质量横评、无调用量,结构影响弱于 Qwen 旗舰 live 与 MirrorCode;② MCP 无状态规范:今日零新证据,等 8/5 fastmcp。两者对应的开放痛点均未消失,分别挂在 #T-116 与 #T-126 下继续跟踪。
- 框架体检:不到期(上次 review 2026-08-03,昨日刚执行,三条 invalidation_trigger 全未命中),本期不重复执行。
- 跟踪项结算(13 项逐条):
- #T-101 记忆可靠性 → ⌛顺延(TencentDB Agent Memory 连续在榜属实现层,非"遗忘—恢复—审计"标准;痛点未动)
- #T-113 AgentPerf benchmark 标准缺口 → ✅部分确认(MirrorCode 是本项开立以来第一条真正对症的证据:独立第三方、跨模型、端到端、抗作弊、22/25 开源可复现。但"跨厂可比标准"要求的是被采纳,目前仅一家发布 → 不结项,缺口从"无口径"降级为"有口径待采纳",新增 8/18 采纳节点)
- #T-114 coding agent 工作台 + 企业 agent → ⌛顺延(今日无新采购 / 采用数据;YC QM 属供给侧新增,Google ATLAS 为反向证据,两者相抵)
- #T-116 国产开源旗舰渗透 → ✅有进展顺延(Qwen3.8-Max 上 OpenRouter / AI Gateway + 跨榜位置 + 重申下周开源;MiniMax 官方澄清 H3 许可可正式授权在美 / 欧 / 英 / 韩部署。但权重未放出、独立横评仍零 → 8/10 节点不变)
- #T-121 AI capex 自我回报 / 估值再校准 → ✅有进展顺延(Fortune 揭示隐性借贷 $1.65 万亿、债券发行同比 +973.7%——回报未兑现而杠杆先行,与本项"自我回报期"命题形成对冲证据;A 股 CPO 单日主力净流入超 150 亿属情绪面)
- #T-125 入口移动化(母题 T-103/T-130)→ ⌛顺延(今日无新手机 agent OS 证据;开售 30 天激活数据待 8/14)
- #T-126 harness+MCP(母题 T-112)→ ✅有进展顺延(Cloudflare
@cloudflare/computer把 agent 沙箱从容器压到 isolate、YC QM 开源多智能体协作、Kiro 统一 harness 第三方转述;MCP 无状态零新证据,8/5 fastmcp 为关键判定点) - #T-127 中国 AI 全栈 → ✅有进展顺延(小米 / OPPO 入股华芯智源工商变更生效;面壁 ForgeStencil 开源;A 股半导体走强。无产能 / 出货类硬数据)
- #T-128 RSI → ✅有进展顺延(OpenAI 称下一代内部模型在 10 个数学 / TCS 未解问题上出新结果,HN 524 分但被质疑营销夸大、无数学界复核;面壁 ForgeStencil 宣称一周零人工优化 100+ 软件,仅第三方转述。两条均未构成 RSI 闭环,档位不动,到期日 8/10 不变)
- #T-131 AI 定价战(母题 T-102)→ ✅有进展顺延(GPT-5.6 Luna 永久降价 80% 是本项开立以来最接近"结构性"的一条——"永久"措辞排除了促销解释;Qwen3.8-Max 旗舰定价 $2/$6 per M;T-102 侧 MirrorCode 给出 $2,600/19 天与 $251/14 小时的任务级成本硬样本)
- #T-132 企业 agent 数据安全(母题 T-120)→ ⌛顺延(美国自愿评估框架完成但内容未公开,无法评估;仍缺可执行审计规范与企业采购证据。新增 8/20 文本公开节点)
- #T-133 端侧 / 国产硬件财务验证(母题 T-119)→ ⌛顺延(今日仅有 A 股情绪面异动与小米 / OPPO 股权投资,非财务验证;中报正式披露待 8/31)
- #T-129 分布式 LLM 推理 → 已 expired(上期结转,本期不复活:今日无相关证据)
- 节点到期结算:本期无到期节点(最近一个为 8/5 fastmcp)。
- 新开:无。MirrorCode 归入 #T-113 既有母题,Cloudflare computer / YC QM 归入 #T-126,Qwen3.8-Max 归入 #T-116,AI 债务归入 #T-121,均不新开顶层项(open 仍 12 > 10 预算,继续压缩)。
- 框架体检挑战:AC-004 → partial / 标记撤回(v-embodied 今日零证据,"连续两日强证据"未续上,early-warning 撤销,档位维持
实验,若后续再现独立可复现证据需重新起算);AC-005 → accepted 延续(12 个顶层项全部按母题结构结算,sub_items 保留独立到期时钟,本期无新增近重复条目;候选预算 2/2 占满且完成一次全量换手,换手理由已在「候选换手说明」显式记录;open 仍超预算,继续压缩)。