AI 日报 | 2026-08-03
更新时间:16:20|覆盖窗口:2026-08-03 ~ 08-03(承接上一期 2026-08-02) 数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(OpenAI / Anthropic / Google AI / Meta AI / DeepMind / HuggingFace / Mistral / NVIDIA / The Decoder / Juya / AI Hot / Simon Willison / The Neuron 等)/ 金十电报
数据覆盖与缺口(CLS/财联社本身不采,非缺口;金十为采集上限 200 条,AI 相关占比偏低时以模型发布 / 半导体 / 宏观为主):
| 源 | 入库数 | 状态 |
|---|---|---|
| Product Hunt | 20 | ✓(当日榜单 votes 普遍为空,注意力信号弱,未计入重点) |
| Hacker News | 33 | ✓(精选 20) |
| GitHub Trending | 15 | ✓ |
| RSS | 53 | ⚠️ 结构性偏斜:21 个英文一手 / Newsletter feed 当日 0 条(OpenAI Blog / Google AI / HF Blog / NVIDIA ×2 / Microsoft AI / The Decoder / Stratechery / Ben's Bites / TLDR AI / Import AI / Latent Space / Interconnects / One Useful Thing / Daniel Miessler / YouTube 六频道;均 feed 正常返回 0 条,非抓取失败);实际产出集中在 AI Hot 50 条 + Juya / Simon Willison / The Neuron 各 1 条——今日英文一手观点面偏薄,中文聚合源占 94%,交叉验证强度低于常日 |
| 金十电报 | 306 | ✓(精选 92;AI 相关占比低,以模型发布 / 半导体 / 宏观为主) |
这份日报是一张二维坐标系:纵轴看模型与产品的能力 / 技术往哪走(实验→收敛中→事实标准,判档看证据强度,同一矢量当天 ≥2 个独立证据才算收敛),横轴看 AI 产品被多少人、多少场景真用上(萌芽→早期采用→主流化,判档看真实使用信号,不看 star / votes)。
一句话结论
今天地图动了半格但没跨档:v-openflagship(国产开源旗舰 / 开放权重)从上期的"宣布即将开源"变成"权重实际放出并被 Day-0 承接"——MiniMax H3 权重上 Hugging Face,同日被 ComfyUI 原生接入、vLLM-Omni 支持、fal 平台 Day 0 上线、LMSYS 收录,沐曦曦云 C 系列与摩尔线程两家国产 GPU 同步完成 Day-0 适配;阿里同日发布 2.4T 参数的 Qwen3.8-Max 并宣布下周首次开源 Qwen-Max 级权重(附带 27B)。这把"开放权重"从可下载推进到"多推理栈 + 国产卡即刻可跑",部署门槛这一维痛点被部分清掉,但跨厂可比完整评测与独立质量复现仍缺→矢量维持收敛中。本期 S-confirmed 0,S-candidate 2(占满预算):新增 ① MiniMax H3 开放权重,沿用 ② MCP 无状态规范。接下来两天盯:① 8/5 fastmcp 是否兑现无状态生产迁移公告;② H3 的独立第三方质量评测与 community license 商用边界;③ Qwen3.8-Max 权重是否如期在下周放出、许可证形态。
重点候选 · 待验证
① MiniMax H3 开放权重 —— 新增重点候选,尚缺独立质量评测与许可证边界评估
- 为什么重要:全模态视频生成模型首次以开放权重形态落地,并在同一天被多条独立推理链路接住——不是"能下载",而是"多栈即刻可跑"。H3 支持文本 / 图像 / 视频 / 音频统一多模态上下文,输出 4–15 秒、最高 2K、24 FPS、32 kHz 原生立体声,系统由 H3-Context-IR + H3-Base + H3-Regenerate-2K 三模块组成。它同时动了两维:
基础设施依赖(沐曦、摩尔线程两家国产 GPU Day-0 适配,把开放权重和国产算力接在一起)与部署门槛(自托管 / 可定制路径打开,不再只有闭源 API)。 - 确认阻断项:① 无独立第三方质量评测——与字节 Dreamina Seedance 2.5(同日发布,30 秒连续视频、50 个参考文件)等闭源同代模型无可比横评;② 采用 MiniMax H3 Community License 而非标准开源许可,商用边界未被第三方评估;③ 无任何生产环境采用 / 调用量数据,Day-0 承接目前只到"可用",不到"在用"。
- 下一步验证:H3 独立评测与真实调用量(关联 #T-116 / v-openflagship / f-kimiopen);许可证条款的第三方解读。
- 已有证据:Hugging Face MiniMaxAI/MiniMax-H3 模型卡(一手,权重与规格)|AI HOT:H3 正式开源,2K + 原生立体声|AI HOT:fal 平台 Day 0 上线开放权重|AI HOT:原生接入 ComfyUI|AI HOT:vLLM-Omni 支持|AI HOT:沐曦曦云 C 系列 Day 0 适配|AI HOT:摩尔线程 Day-0 适配
② MCP 无状态规范 —— 沿用候选,仍缺头部服务器生产迁移公告
- 为什么重要:协议层事实标准自我重构——核心传输从双向有状态转无状态,新增 MRTR / 标头路由 / 可缓存列表,授权对齐 OAuth 2.0;官方披露 TS/Python SDK 双破 10 亿总量,同时动了"基础设施依赖"与"部署门槛"两维。
- 确认阻断项:头部 MCP 服务器(fastmcp 等)尚未公布切换到无状态传输的生产迁移公告;旧特性(Roots / Sampling)废弃对存量生态兼容冲击无第三方评估。本期无新生产迁移证据。
- 下一步验证:8/5 fastmcp 公告是否给出生产迁移时间表与兼容方案(关联 #T-126 / v-skills)。
- 已有证据:MCP 官方博客 2026-07-28|Hacker News 讨论|Simon Willison:Stateless MCP
纵轴 · 能力与技术演进
- 国产开源旗舰 / 开放权重(v-openflagship)—— 收敛中(本期最大增量,痛点部分缓解)
- 权重侧(从"宣布"到"可用"):MiniMax H3 权重实际上线 Hugging Face(模型卡含 Diffusers 用法、Files and versions 已开放),同日被 ComfyUI 原生接入、vLLM-Omni 支持、fal 平台 Day 0 提供、LMSYS 收录;沐曦曦云 C 系列 GPU 与摩尔线程分别完成 Day-0 适配——开放权重第一次和国产算力在发布当天完成对接。
- 旗舰侧:阿里发布 Qwen3.8-Max,总参数 2.4T,定价输入 $2.0/M、输出 $6.0/M、隐式缓存 $0.25/M;宣布下周开源其权重并同步开源 Qwen3.8-27B——这是 Qwen 首次开源 Max 级模型权重,也是继 Kimi K3 之后第二个 >2T 的开放权重模型。同日 Qwen3.8-Max 登 Vision Arena 第二、Text Arena 第二、前端代码榜第四,OpenCode Go 已上线该模型,通义千问团队入驻 X 开 AMA。
- 独立复核侧:Hacker News 486 分 / 213 评论,讨论集中在两点——2.4T 权重对本地部署几无可行性("需要众筹 VRAM"),真正被开发者关心的是 27B / 中等尺寸档;多名开发者自述 Qwen3.6-35B-A3B / 27B 已是日常主力,并把它当作组织切换到 agent/harness-first 编码的入口。
- 还卡在哪:跨厂可比完整评测仍缺、蒸馏疑云未裁决、H3 无独立质量横评、Qwen 权重下周才放→
pain_cleared仍为 false,维持收敛中,未跨事实标准。 - 别高兴太早:Day-0 适配是"能跑",不是"在用";2.4T 旗舰的开放权重对绝大多数使用者是象征意义大于可部署性,真正决定渗透的是 27B 档的质量。
- 长任务可靠性 / 企业级 agent(v-longtask)—— 收敛中
- 能力侧(新形态):Qwen 团队与 XLang Lab 联合发布 Qwen-CUA——原生 Computer Use agent,仅靠截图感知界面,不依赖 DOM 树、无障碍元数据或任务专用 API,通过原生键鼠事件操作浏览器 / 桌面 / 专业软件;397B-A17B MoE 架构在 OSWorld-Verified 取得 86.2,更大的 Qwen-CUA-Max(参数量 >1T)达 87.6。目前只提供技术报告与参考 demo,无权重、无产品。
- 能力侧(成本口径):Karpathy 公开反对继续用"鹈鹕骑自行车"测 LLM,改用 Opus 5 做 3D 世界生成——输入《指环王》首段、约 100 万 token 预算(约 $10)、运行约 2 小时、写出 5500 行代码程序化渲染故事场景;同时指出当前 LLM 无法高效原生感知视频或在游戏内玩游戏,只能靠慢速截图自检。这既是长程生成能力的再确认,也给了"任务级成本 = 单价 × 时延"一组具体数字(关联 #T-102)。
- 还卡在哪:Qwen-CUA 是厂商自评基准(OSWorld-Verified 虽为公开基准但无第三方复现),无权重无产品;Opus 5 的 3D 生成仍是 demo 而非企业级长任务可靠性。
- 企业 agent 数据安全与信任(v-security)—— 事实标准候选 · 收敛中高位子态
- 攻击面量化(新):IBM 与 Ponemon 调查显示,AI 驱动攻击已占恶意数据泄露事件的 1/4,同比增长 56%,单起平均损失 600 万美元(高于整体均值 20%);62% 此类攻击针对关键基础设施,另有超 20% 企业遭遇过针对 AI 模型 / 应用系统的入侵,常见诱因是周边系统薄弱与云配置不当——这是"agent 安全"从事件叙事转向可量化损失口径的一手行业调查。
- 供给瓶颈(新):METR(上期呼吁独立根因调查的同一机构)表示 AI 安全研究最大瓶颈不是资金而是人才,岗位年薪最高 50.3 万美元仍招不到人——独立审计能力的产能约束被点名。
- 工具侧:Cogent AI 发布 VR-1(专为网络安全后训练的推理模型),同步推出评测基准 IntrusionBench 与安全智能体运行时 Cogent AI Harness——安全侧开始出现"模型 + 基准 + harness"的成套供给。
- 还卡在哪:仍缺可执行审计规范、无企业公开采购 agent 安全产品→维持事实标准候选子态,未毕业(
third_partytrue,pain_clearedfalse)。攻击面量化解决的是"有多严重",不是"怎么审计"。
- 具身智能 agent / 物理 AI(v-embodied)—— 实验(连续第二日强证据,逼近 multi_impl)
- 学习框架侧(可复现):自变量机器人发布并开源 HOST 框架(Human-to-robot One-Shot Skill AcquisiTion)——机器人观察一段 29 秒人类视频即可学会新技能且保留旧技能,成功率 62%(零样本基线 45%);相比 Pi-0.5 + 微调,数据量减少 50 倍、学习速度提升 500 倍。方法上不翻译人类动作,而是先"想象执行后的结果"再反推动作;用动态时间规整做"按任务进度对齐",把进度时间误差降低一个数量级;核心是双专家 MoT 架构(视频专家预测未来图景 + 动作专家执行)。论文与代码已全部开源。
- 为什么值得记档:这是 v-embodied 首次出现开源可复现的能力证据(上期 Figure F.03 自主爬梯为闭源单点演示)。两日两个独立强证据,但一个是硬件自主性、一个是学习效率,维度不同、无相互复现→
multi_impl仍判 false,矢量维持实验。 - 还卡在哪:62% 成功率来自厂商自评,无第三方复现;无人牵头整合(AC-004 边界)。
- 记忆与上下文(v-memory)—— 实验
- 实现侧:TencentDB Agent Memory(GitHub Trending +602 stars/日)——腾讯云推出的团队级 agent 记忆中枢,MIT 许可、npm 发行、三服务一键启动(memory-core 等),主打"团队记忆"而非单机会话记忆。
- 上下文压缩侧:Simon Willison 发布 condense-json 1.0(用替换串压缩 JSON,用于 LLM 的 SQLite 日志省空间);另有开发者用 pxpipe 把密集文本渲染成 PNG 喂给 Fable 5——1928×1928 图片约 4761 vision tokens 可装约 92K 字符,但属视觉压缩非无损,模型可能误读精确 ID / 哈希,仅适合背景上下文。
- 还卡在哪:star 不是使用量;跨会话记忆的遗忘 / 恢复 / 审计返回弧仍无工程标准,矢量维持
实验。
- skills / harness 标准化(v-skills)—— 收敛中
- 跨 agent 复用侧:different-ai/openwork(+280 stars/日)——Claude Cowork 与 Codex 的开源桌面替代,核心机制是"一个 OpenWork MCP 接进 Codex / Claude Code / Cursor,跨工具、跨同事、跨机器复用同一套 skills / MCP / 连接",仅暴露
search_capabilities与execute_capability两个工具;企业侧提供发布能力、权限管理的 admin 界面。这是 harness 标准化在"能力可移植"方向的具体实现。 - 约束工程侧:开源插件 Ponytail 在 Claude Code 写码前强制三问(功能是否已存在 / 能否用标准库 / 是否真需要新代码),声称代码量减少 80%–94%、成本降低 47%–77%、任务速度提升 3–6 倍。单来源社媒转述、无独立复现,数据按厂商 / 作者自评处理。
- 工具侧:xAI 发布 Grok Build v0.2.119,扩展 Auto 模式自动批准范围、允许用 glob 模式配置 Bash "始终允许"权限——agent 权限粒度继续工程化。
- 还卡在哪:MCP 候选仍缺生产迁移公告;openwork / Ponytail 均无生产采用数据。
- 跨 agent 复用侧:different-ai/openwork(+280 stars/日)——Claude Cowork 与 Codex 的开源桌面替代,核心机制是"一个 OpenWork MCP 接进 Codex / Claude Code / Cursor,跨工具、跨同事、跨机器复用同一套 skills / MCP / 连接",仅暴露
- 推理成本与小模型(v-cost)—— 收敛中
- 低价 agent 侧:The Neuron 报道 DeepSeek 升级 V4-Flash 并把 API 价格维持在分币级("28-cent agent model");GitHub Trending 出现 antirez/ds4(+139 stars/日)——面向 Metal / CUDA / ROCm 的 DeepSeek 4 Flash 本地推理引擎;HN 讨论中有开发者自述团队日常已大量转向 DS-V4-Flash-0731。三条都是软证据(媒体转述 / 项目热度 / 开发者口述),非 benchmark。
- 免费额度侧:FFmpeg 官方发文感谢 Cursor 为多名 FFmpeg 开发者提供免费额度,用于项目开发与代码审查——头部开源项目公开采用商业 coding agent 的真实使用信号。
- 还卡在哪:专用小模型 + 前沿路由跨场景生产级采用数据仍缺。
- 中国 AI 全栈(算力+OS+模型+平台)(v-chinastack)—— 收敛中
- 存储 / 产能侧:长鑫存储注册资本由约 238.9 亿增至约 313.9 亿元(+31%);长鑫科技当日成交额 299.89 亿元居沪深两市首位,7 月公募打新获配金额亦以长鑫居首(100 家基金公司合计 108.29 亿元)——国产存储资本开支与二级市场定价同步走强。
- 算力适配侧:沐曦、摩尔线程 Day-0 适配 MiniMax H3(见 v-openflagship)——国产 GPU 从"能跑基准"往"发布日即支持新模型"推进。
- 封装 / ASIC 侧:联发科称首款 AI ASIC 加速器 2026Q2 量产、第二款有望 2028 年量产,已将英特尔 EMIB-T 与台积电 CoWoS 并列为关键 2.5D 封装技术,并批准 50 亿美元保障供应链。
- 还卡在哪:增资与成交额是投入 / 情绪口径,不是产能爬坡口径;Day-0 适配无性能对比数据。
- 多智能体编排(v-multiagent)—— 收敛中
- 平台侧:阿里云内测面向 B 端的人机协作平台"万有无界",由多名数字员工组成协作小组围绕完整项目共同推进,区别于侧重日常办公流程的"千问办公",聚焦复杂项目的多智能体协同交付,当前能力免费。属未官宣的内测消息,按"待确认"处理。
- 还卡在哪:内测 + 无采用数据,缺跨场景生产级采用。
- 模型自改进 / RSI(v-rsi):今日无新直接证据,档位沿用
实验,顺延(AC-004 边界)。
横轴 · 渗透率
- 企业知识工作 agent(f-knowledgework)—— 早期采用(分发面出现明确商业化路径)
- 载体 / 入口:阿里企业级 Agent 产品"千问办公"今日开启公测,网页版与独立 PC 客户端已开放,钉钉 PC / 手机端内置入口近期上线;由 QoderWork、MuleRun、悟空三款产品整合而来,号称业内首款同时支持桌面端 Agent、云端 Agent、企业协同 Agent 的产品,内置最新旗舰 Qwen3.8。
- 商业化口径(首次明确):个人免费版 0 元;个人标准版 78 元 / 月(原价 98);个人高级版 158 元 / 月(原价 198);企业标准版 198 元 / 月 / 席;企业旗舰版需询价。
- 真实使用信号:公测 + 明码标价 + 钉钉分发入口在途,把"能用"推到"能买";但仍无公开采用 / 付费 / 留存数据,
distribution仍判 false,未跨档。 - 还差什么:钉钉端入口实际上线时间、企业侧席位采购数据。
- 国产开源旗舰渗透(f-kimiopen)—— 主流化前段:H3 权重实际放出并被 ComfyUI / vLLM-Omni / fal / LMSYS 与两家国产 GPU Day-0 承接,Qwen3.8-Max 承诺下周开源 Max 级 + 27B 权重(证据见纵轴 v-openflagship);分发入口继续加厚,但真实调用 / 下载量仍待验,
real_usage仍 false,未跨档。
- 自动驾驶 / Robotaxi(横轴外沿观察,暂不新开渗透形态):百度萝卜快跑在中国香港启动完全无人驾驶试运营(右舵市场全球首创)并在伦敦开始道路测试;文远知行与 GreenMobility 合作打造丹麦首个商业化 Robotaxi 项目,计划 2027 上半年推出 L4 级 GXR 服务,丹麦为其第六个欧洲国家(全球 13 国 40 余城)。两条均为地理扩张证据,与两轴(agent 软件形态)关联弱,仅登记不开项。
- 消费级补贴入口(f-consumerpromo)/ 车机 agent(f-caros):今日无新渗透证据,顺延(特斯拉车机 × 豆包仍待官方确认)。
资本与政策
- 蚂蚁灵波首轮拟募资 15 亿元,公司已回应确认 —— 蚂蚁集团旗下具身智能公司灵波科技启动首轮融资,拟募资 15 亿元,目标年底完成二轮;若如期完成将刷新具身领域创业公司融资速度。公司回应"确实在跟投资人接触……将持续聚焦通用机器人大脑,加大对具身原生技术路线的投入"。灵波 2025 年 3 月落地上海浦东,7 月初发布 LingBot 2.0 系列(Vision / Depth 2.0 / VLA 2.0 / World 2.0 / Video / VA 2.0),覆盖感知—理解—行动全链。关联 #T-121(资本自我回报期)与 v-embodied。
- 韩国国家 AI 计算中心(KOACC)动工 —— 总投资 2.5 万亿韩元(约 118.4 亿元人民币),三星 SDS 持股 30% 领衔,联合 NAVER Cloud、三星电子、Kakao、KT,目标 2028 年建成,并设研发区为韩国产 NPU 提供验证环境——又一国家级算力主权项目,与国产算力路线同构。
- OpenAI 超级 PAC 被曝资助 AI 生成新闻网站攻击行业批评者 —— 一个伪装成记者的机器人采访请求暴露该站点;这是本月第二次发现其与 Targeted Victory 关联,后者是 OpenAI 1.25 亿美元政治行动的核心运营方。与 v-security 的"内容可信"面同源。
- 宇树科技上市首日破发 —— 具身智能一级市场热度(灵波 15 亿)与二级市场定价(宇树破发)出现背离,是 #T-121 估值再校准的对冲信号。证据为社媒短评,事实层仅取"破发"这一点。
待跟踪 & 本期变更
未来 24-72h 待跟踪(三栏 = 本期 watchboard 投影:待印证矢量 = agent_eng_vectors、待观察渗透 = product_forms、待发布动作 = watch_companies+watch_projects):
| 待印证的能力矢量(纵轴) | 待观察的渗透(横轴) | 待发布动作 / 待验证项目 |
|---|---|---|
| v-openflagship:H3 独立质量横评 + community license 商用边界 | f-kimiopen 真实调用 / 下载量 | Qwen3.8-Max / 27B 权重下周实际放出与许可证形态(8/10) |
| v-skills:MCP 生产迁移 + DeepSeek Harness minimal mode(8/10) | f-knowledgework 千问办公钉钉入口上线与席位采购 | MCP fastmcp 无状态生产迁移公告(8/5) |
| v-longtask:Qwen-CUA 权重 / 产品化与 OSWorld 第三方复现 | f-caros 特斯拉车机官方确认与激活数据(8/14) | METR×OpenAI HF 事件审查结论(8/15) |
| v-security:可执行审计规范能否落地(人才瓶颈已点名) | — | 中报季正式披露(星宸 / 中科创达 / 长鑫,8/31) |
---
🔄 本期变更(框架 × 跟踪合并)
- 框架:两轴矢量 / 渗透沿用,未跨档。最大增量在 v-openflagship——痛点从"宣布即将开源"推进到"权重实际放出 + 多推理栈与国产 GPU Day-0 承接",
部署门槛维度部分缓解,但跨厂可比评测缺 →pain_cleared仍 false,维持收敛中(←frame_change)。v-security 因 IBM 攻击面量化(占泄露事件 1/4、单起 600 万美元)+ METR 人才瓶颈 + Cogent VR-1 成套供给继续压实候选子态;v-embodied 因 HOST 开源出现首个可复现证据但维度不重合,维持实验;f-knowledgework 因千问办公公测 + 明码定价,分发路径首次具体化但无采用数据、未跨档。S-confirmed 0 / S-candidate 2(新增 MiniMax H3 开放权重,沿用 MCP 无状态;候选预算 2/2 已占满)。 - 框架体检(到期执行):距上次 review(2026-07-25)9 天,本期执行。对照三条 invalidation_trigger:① 未出现非 agent 的新 AI 交互范式聚集证据(Qwen-CUA 属 agent 感知方式变化,仍在 agent 范式内);② 核心矢量未集体进入事实标准,v-openflagship / v-security / v-skills 三条均仍有活跃开放痛点;③ 未被全新第一序变量取代(安全虽变厚,仍是矢量而非主导变量)。三条全未命中,regime 有效,框架不换代,下次复核按周期排。
- 跟踪项结算(13 项逐条):
- #T-101 记忆可靠性 → ⌛顺延(TencentDB Agent Memory + condense-json 属实现 / 工具,非遗忘-恢复-审计标准;痛点未动)
- #T-113 AgentPerf benchmark → ⌛顺延(Qwen-CUA 报 OSWorld-Verified 86.2 / 87.6 为公开基准但属厂商自评,Karpathy 公开否定既有测法却未给替代标准;跨厂可比完整评测仍缺)
- #T-114 coding agent 工作台 + 企业 agent → ✅有进展顺延(千问办公公测 + 明码定价 + 钉钉入口在途;阿里"万有无界"内测;FFmpeg 采用 Cursor)
- #T-116 国产开源旗舰渗透 → ✅部分确认(next_node "MiniMax H3 开源权重实际放出" 原定 8/5,今日提前兑现:HF 权重上线 + 四条推理链 Day-0 + 两家国产 GPU 适配;Qwen-Max 级首次开源承诺加码。但"独立评测"分项未兑现 → 该子节点顺延至 8/10)
- #T-121 AI capex 自我回报 / 估值再校准 → ✅有进展顺延(蚂蚁灵波 15 亿融资已获公司回应 vs 宇树上市破发,一二级背离;长鑫增资 +31%)
- #T-125 入口移动化(母题 T-103/T-130)→ ⌛顺延,续期至 2026-08-19(今日无新手机 agent OS 证据;开售 30 天激活数据待 8/14)
- #T-126 harness+MCP(母题 T-112)→ ✅有进展顺延,续期至 2026-08-19(openwork 跨 agent 能力复用 + Ponytail 约束工程 + Grok Build 权限粒度;MCP 候选沿用无新迁移证据,等 8/5 fastmcp)
- #T-127 中国 AI 全栈 → ✅有进展顺延(长鑫增资至 313.9 亿 + 成交额居首;沐曦 / 摩尔线程 Day-0 适配 H3;联发科 EMIB-T 与 50 亿美元供应链预算)
- #T-128 RSI → ⌛顺延(今日无新 RSI 证据,AC-004 边界)
- #T-131 AI 定价战(母题 T-102)→ ✅有进展顺延(DeepSeek V4-Flash 分币级 agent 定价第三方转述 + Qwen3.8-Max 输入 $2.0/M 输出 $6.0/M 旗舰定价公开 + 千问办公免费档;T-102 侧 Karpathy 给出 $10 / 2 小时 / 5500 行的任务级成本样本)
- #T-132 企业 agent 数据安全(母题 T-120)→ ✅有进展顺延(IBM 攻击面量化 + METR 人才瓶颈 + Cogent VR-1 / IntrusionBench;仍缺可执行审计规范)
- #T-133 端侧 / 国产硬件财务验证(母题 T-119)→ ✅有进展顺延(长鑫增资 +31% 与打新获配居首 + 联发科 ASIC 排产;中报正式披露待 8/31)
- #T-129 分布式 LLM 推理 → 已 expired(上期结转,本期不复活:今日无相关证据)
- 节点到期结算:
DeepSeek V4-Flash 独立第三方 benchmark 复现与真实调用量(原定 2026-08-03,今日到期)→ 部分兑现:真实使用侧出现软证据(antirez/ds4 本地推理引擎登 Trending、HN 开发者自述日常主力、The Neuron 报道分币级定价),但独立第三方 benchmark 复现仍为零 → 该节点顺延至 2026-08-10,蒸馏疑云维持未裁决。 - 新开:无。MiniMax H3 归入 #T-116 既有母题,Qwen-CUA 归入 #T-113/v-longtask 观察,均不新开顶层项(open 仍 12>10,继续压缩)。
- 框架体检挑战:AC-004 accepted(HOST 开源是 v-embodied 首个可复现证据、灵波资本侧加厚,但与 Figure F.03 维度不重合、无独立复现,v-embodied / v-rsi 维持实验,early-warning 升级为"连续两日强证据"标记,若第三日再现独立可复现证据需重估档位);AC-005 accepted(本期 12 个顶层项全部按母题结构结算,sub_items 保留独立到期时钟,无新增近重复条目;候选预算由 1/2 占满至 2/2,open 仍超预算继续压缩)。