更新时间:18:30|覆盖窗口:2026-08-20 ~ 08-21(承接上一期 2026-08-20)
数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(OpenAI / Anthropic / Google AI / Meta AI / DeepMind / HuggingFace / Mistral / NVIDIA / The Decoder / Juya / AI Hot 等)/ 金十电报
数据覆盖与缺口(抓取失败 / enrichment 缺失在"状态"列标注,不展开成段落):
| 源 | 入库数 | 状态 |
|---|---|---|
| Product Hunt | 20 | ✓ |
| Hacker News | 20 | ✓ |
| GitHub Trending | 17 | ✓ |
| RSS | 60 | 16 个 feed 当日 0 条(OpenAI / Google AI / NVIDIA / 微软 AI / Juya RSS / Ben's Bites / TLDR AI / Import AI / Interconnects / One Useful Thing / Stratechery / Simon Willison / YouTube×4),属 feed_empty 正常空返回,非抓取失败;Juya 已源站直抓补齐 |
| 金十电报 | 386 | ✓(AI 相关占比低,已过滤) |
这份日报是一张二维坐标系:纵轴看模型与产品的能力 / 技术往哪走(实验→收敛中→事实标准,判档看证据强度,同一矢量当天 ≥2 个独立证据才算收敛),横轴看 AI 产品被多少人、多少场景真用上(萌芽→早期采用→主流化,判档看真实使用信号,不看 star / votes)。
一句话结论
地图今天仍没跨档,但 v-skills 的卡点换了一代——Anthropic 把 computer use、browser use 工具、Skills API 和 Files API 一起从 beta 推到 GA,Skills / Files 同步上 Microsoft Foundry、computer use / browser use 即将上 Vertex AI,同日 Cursor 放出官方 plugin 仓库(每个插件带 .cursor-plugin/plugin.json manifest)、社区侧 mattpocock/skills 通过 Claude Code 官方 marketplace 与 skills.sh 双通道分发,上期那句"harness 标准化仍靠大厂落地"今天被兑现(T-126 结案 confirmed),新痛点变成"三套清单 / 分发规范并存 + skill 供应链安全刚起步"。今天没有 S-confirmed,两个候选席位换人:Qwen-UI-Agent(一手证据齐全,MobileWorld 82.1 / OSWorld-Verified 79.5 / WebArena 73.6 全面超 GPT-5.6 Sol 与 Opus 4.8)与 Anthropic Claude Platform GA(结构影响最强但官方博客本环境抓不到,仅二手),顶替上期两个卡在权重节点、始终缺一手的候选(它们降为 A 级、继续以 T-116 / T-136 跟踪)。接下来最该盯:Qwen-UI-Agent 权重可得性与第三方独立复核(新增 T-140)、8/24 DeepSeek V4 Pro 权重、以及 Anthropic「客户自管 30 天留存」与 OpenAI「Private Safety Processing」两条数据治理路线今秋谁被企业接受(新增 T-141)。
重点候选 · 待验证
深挖预算 2/2 占满。本期候选席位重排:Qwen-UI-Agent(一手齐全)与 Claude Platform GA(结构影响最强)证据强度均高于上期两个候选,按 candidate_budget=2 顶替;上期 DeepSeek V4 Pro 0813 与 GLM-5.3 未被撤销,降为 A 级、继续按 T-116 / T-136 在 8/24、8/28 验证(见纵轴 v-openflagship)。
① Qwen-UI-Agent(阿里通义 MAI-UI)—— 重点候选,尚缺可下载权重确认与第三方复核
- 为什么重要:命中候选触发条件①(重点厂商旗舰级新一代基础模型)。这是把移动端、电脑端、网页与 DeepSearch 收进同一个 GUI agent 基座的尝试:统一动作空间把 GUI 操作与 CLI 执行交错在一起、单轮生成批量动作(官方称约 40% 动作为批处理),在线 RL 支持超 100 步轨迹训练、上万并行环境加速 rollout,另有 AutoResearch 式数据飞轮让 agent 自己造任务 / 环境、诊断失败、规划下一轮迭代。若权重可下载且第三方能复现,
v-openflagship与v-longtask会同时受推动。 - 确认阻断项:GitHub 仓库(Tongyi-MAI/MAI-UI)与技术报告页已放,但未确认可下载权重页 / HF 模型页;第三方独立复核(Artificial Analysis、OSWorld 官方榜)全无;基准数字目前只有厂商自测口径。
- 下一步验证:看权重是否落 HF / ModelScope、看 OSWorld-Verified 与 WebArena 第三方榜是否出现同名条目(→新增 T-140)。
- 已有证据:[arXiv 一手]|[技术报告 2607.28227,2026-07-30 提交]|查看原文;[官方项目页]|[基准与演示]|查看原文;[GitHub 官方仓库]|[Tongyi-MAI/MAI-UI]|查看原文
- 关键数字(官方自测):移动端 MobileWorld 82.1%(GPT-5.6 Sol 67.5%、Claude Opus 4.8 62.3%、Gemini 3.1 Pro 58.1%)、真机 MobileWorld-Real 92.2%、AndroidDaily 97.5%;电脑端 OSWorld-Verified 79.5%、长程 OSWorld-v2 partial-progress 40.0%;浏览器 WebArena 73.6%;GUI grounding ScreenSpot-Pro(zoom-in)81.5%。真机训练覆盖 100+ 手机机型、150+ app。
② Anthropic Claude Platform GA(computer use / browser use / Skills API / Files API)—— 重点候选,官方一手页本环境不可达
- 为什么重要:命中候选触发条件(重点厂商重大新产品线)。这不是又一个 beta:技能(Skills)和文件(Files)被做成正式 API,computer use 里新增 browser use 工具,Skills API + Files API 同步登陆 Microsoft Foundry、更新的 computer use / browser use 即将登陆 Google Cloud Vertex AI,现有 beta 集成在迁移期继续可用。官方口径是"在没有 API 的应用里自动化工作、每个任务更少往返,并基于版本化技能与可复用文件构建 Claude Managed Agents"——版本化技能这一句,是把 skill 从"prompt 附件"提到"可治理制品"的关键动作。
- 确认阻断项:官方博客页
claude.com/blog/computer-use-skills-api-files-api在本运行环境 enrichment 与直连 curl 均失败(网络层不可达,非页面不存在),因此只有二手转述与官方 X 帖转述,一手门未过;无第三方采用规模或独立评测。 - 下一步验证:官方博客页恢复可达后补一手;看 Microsoft Foundry / Vertex AI 侧文档是否出现对应 GA 条目;看企业侧是否出现可核查的采用数字。
- 已有证据:[AI Hot 转述 ClaudeDevs 官方帖]|[四项功能 GA]|查看原文;[Juya AI Daily 第三方转述]|[Claude Platform 正式上线]|查看原文
纵轴 · 能力与技术演进
v-skills(agent 技能与 harness 标准)—— 档位:收敛中(卡点已迁移)
- 大厂侧(今日最强增量):Anthropic 把 computer use / browser use / Skills API / Files API 推到 GA 并跨三云分发(见候选②)。Cursor 放出官方插件仓库
cursor/plugins,20+ 官方插件各自独立目录 +.cursor-plugin/plugin.jsonmanifest,覆盖 teaching / continual-learning / cursor-team-kit / thermos / create-plugin / ralph-loop / agent-compatibility / cli-for-agent / orchestrate / cursor-sdk,第三方侧还挂了 Gmail / Google Drive / Google Calendar / Gong / Salesforce。- 证据:[GitHub 官方仓库]|[cursor/plugins manifest 规范]|查看原文
- 社区侧(跨 agent 分发已成型):mattpocock/skills 上 Trending,两条分发路径并行——Claude Code 官方 marketplace(
claude plugins install mattpocock-skills,托管只读、自动更新)与 skills.sh(npx skills@latest add,写进你自己的 repo 可改);作者明确对标 GSD / BMAD / Spec-Kit,定位"小、易改、可组合、任何模型都能用",newsletter 约 6 万开发者。这是第三方独立采用的实证,也是三套清单机制并存的实证。- 证据:[GitHub]|[mattpocock/skills]|查看原文
- 运行时侧:
agent-substrate/substrate上 Trending——agent 沙箱运行时控制平面,microVM 与 gVisor 双支持、亚秒级 suspend / resume、把大量"多数时间空闲"的 actor 多路复用到少量 worker 上(demo 里 8 个物理 pod 跑约 250 个有状态 actor,30x+ 超售),跨休眠保留 RAM 与文件系统全状态快照,建在 K8s 之上;Apache-2.0,但仓库明确标注非 Google 官方支持产品。- 证据:[GitHub]|[agent-substrate/substrate]|查看原文
- 安全侧(新冒出来的痛点):腾讯
AI-Infra-Guard上 Trending,AI 基础设施安全扫描,工具矩阵里已经出现 EdgeOne Skill Scanner——有人开始专门扫 skill 了。Claude Code 侧 v2.1.238 加 readline 键位与插件市场 headersHelper、并新增 Concise 输出风格(/config或settings.json设outputStyle)。 - 关系判断:今天同时凑齐"大厂把 skill 做成 GA 商品"+"第二家大厂出 manifest 规范"+"社区 skill 走官方 marketplace 被采用"+"沙箱运行时基础设施化"+"专门的 skill 安全扫描器",
v-skills的三档判据里前两条(≥2 独立实现含开源同做法、第三方独立采用)已经够了。 - 还卡在哪:第三条不成立——今天恰好冒出新工程痛点:Claude plugin /
.cursor-pluginmanifest / skills.sh 三套清单与分发机制并存、跨 agent 互通标准未定;skill 供应链安全刚有扫描器、无审计惯例;skill 质量参差(mattpocock 的批评本身就是证据)。所以不进"事实标准",维持收敛中,但上期 open_pain 已兑现、卡点整体前移了一格(→T-126 结案、新增 T-142)。
v-openflagship(开放权重 / 开源旗舰)—— 档位:收敛中
- 实验室侧(阿里今日一口气三条线):Qwen-UI-Agent GUI agent 基座(见候选①);Qwen-Image-3.0 系列发布,旗舰 Pro 在 Artificial Analysis 图像编辑榜首发第 6、文生图榜第 9,较上代分别 +83 / +48 Elo(图像编辑从 #34 跳到 #6),支持 4.5k token 提示词、最小 10 像素级精确文字渲染、原生 12 语言,Pro 定价 1K 分辨率 $0.04 / 张、2K $0.075,快速版 Qwen-Image-3.0 两档均 $0.03——这是本期唯一带第三方独立榜单复核的模型侧证据。
- 证据:[Artificial Analysis 独立榜]|[Qwen-Image-3.0-Pro 图像编辑 #6]|查看原文
- 开源侧(开放的是"训练过程",不只是终态权重):蚂蚁百灵把 Ling-3.0-tiny-base 与 Ling-3.0-flash-base 开源,除最终 Base checkpoint 外同步放出预训练、中期训练、WSM 合并三阶段共 6 个 checkpoint;中期训练后用 checkpoints 加权合并(WSM,Warmup-Stable and Merge)替代传统学习率衰减,所以这批 Base 更适合继续预训练与动态扩数据、并可在训练后离线探索不同"衰减曲线"。tiny 总参 7.9B / 激活 1.3B,以约前代一半总参在多数评测取得更高结果;flash 总参 124B / 激活 5.1B,官方称相比总参 2–3 倍的 base model 仍有优势。官方同时明确 Base 未做指令对齐、不建议直接当聊天服务部署。商汤则在 HF 开源原生统一多模态 SenseNova-U1.5-8B-MoT(NEO-unify 架构,Apache-2.0),称在图像生成、中英文文本渲染、原生 4K、图像编辑、复杂指令遵循与视觉控制六方面有可感知提升。
- 闭源 / 匿名侧:DeepSeek-V4-Flash-Vision-Exp 在 DeepSeek API 上线,文本能力与 V4-Flash 持平,多模态智能体基准相较 V4-Flash 大幅跃升、官方称已接近 Opus-4.8——是多模态实验版而非旗舰权重重构,判 A 级。OpenRouter 与 OpenCode 同日上线不公开供应商的 stealth 模型 Ox Alpha,1M 上下文、接受文本 / 图像 / 视频输入、面向持续 agentic 工作与生产负载,OpenCode 称一周内免费。
- 还卡在哪:上期两个候选的权重节点仍未到——DeepSeek V4 Pro 0813 可下载权重 8/24 未放且无官方 model card、GLM-5.3 官方页与权重 8/28 待核(→T-116 / T-136),它们本期让出候选席位但跟踪不变;Qwen-UI-Agent 的权重可得性与第三方复核同样缺(→T-140);跨厂完整可比评测依旧只有图像侧有独立榜。
- 别高兴太早:今天开放度是实打实往前走了(开训练过程 checkpoint 比开终态权重更进一步),但"真旗舰可下载 + 第三方复现"这条线一个都没闭合。
v-cost(推理成本与小模型)—— 档位:收敛中
- 技术侧(投机解码进入产品化):Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B 三款模型发布 DSpark draft model checkpoints,以极小内存增量换解码加速且不改变输出质量,官方数据 GPU 吞吐最高 +3.18 倍、设备端最高 +2.87 倍,LFM2.5-2.6B 的函数调用延迟平均降 57%。
- 证据:[Juya AI Daily]|[LFM2.5 DSpark draft models]|查看原文
- 市场侧(半价定价战出现份额层面的第一个后果):Ramp 的企业刷卡 / token 支出数据显示,Q3 至今 OpenAI 的 API 支出环比增长 82%、Anthropic 76%,这是自 2025 年 Q2 以来 OpenAI 首次在季度环比增速上反超;口径里明确把原因指向 GPT-5.6 Sol 正成为开发者默认选择,而 Fable 5 因价格与监管数据留存要求采用不及预期。属第三方数据集单源转述、非官方财报,先记为 T-134 的部分兑现。
- 证据:[AI Hot 转述 Ramp 数据]|[企业 API 增速 82% vs 76%]|查看原文
- 还卡在哪:收租化 30 天内第二家跟进仍未见;竞品直接跟降的价格动作依旧没有,今天出现的是份额转移而非价格跟随,所以 T-134 不结案。
v-security(企业 agent 数据安全与信任)—— 档位:收敛中(两条技术路线开始分叉)
- 实验室侧(今日重量级):Anthropic 的 Mythos 级模型 30 天留存规则保留不变(理由是有些攻击只有跨多次请求才看得出来,所以受管模型的提示词与输出留 30 天),但机制要改:企业可以把这 30 天日志放在自己的 AWS / GCP 环境、用自己的访问控制管,Anthropic 不留副本,今秋上线。Claude Code 负责人 Boris Cherny 确认已与客户共建一段时间。现有文档其实已经写明客户走 Bedrock 或 Google Cloud Agent Platform 时受管数据留在 AWS / GCP 内,直连 Claude Platform 的留存仍由 Anthropic 按现规则处理——所以秋季这一步是把"客户自管托管"推广到全部企业接入路径,不是从零发明。
- 关系判断(比上期更进一步):上期 OpenAI 走的是 Private Safety Processing——保住零数据保留、同时跨相关交互检测滥用;Anthropic 今天走的是 custody 转移——留存照留但交给客户自己托管。同一个企业合规诉求,两家给出方向相反的技术答案:一边把数据留在客户手里,一边把检测搬到隐私计算侧。这是 v-security 从"三面闭合"进入"路线分化"的实证,也是企业选型开始有真实取舍的起点(→新增 T-141)。
- 供应链侧:腾讯 AI-Infra-Guard 的 EdgeOne Skill Scanner 把扫描对象指向 skill 本身(见 v-skills)。Ollama 云端 Kimi K3 推给过半订阅用户,明确美欧托管 + 零数据保留。
- 证据:[Juya AI Daily]|[Ollama 云端 Kimi K3 零留存]|查看原文
- 口径矛盾(值得记一笔):同一个 Ox Alpha,OpenRouter 页面说提示词与补全由提供方保留但不用于训练,OpenCode 却称零数据保留——匿名 stealth 模型的数据治理属于灰区,两边口径不一致时不宜采信任何一方。
- 评测侧(单源待核):有 xAI 关联账号称 Grok 4.6 在 Simbian 网络防御基准上击败 GPT-5.6 Sol、GPT-5.5、Sonnet 4.6、GLM 5.2、DeepSeek 4 Pro、Kimi K3、Opus 4.8 与 Opus 4.7;单源社媒转述、无榜单页、无第三方复核,仅记录不采信。
- 证据:[AI Hot 转述社媒]|[Grok 4.6 Simbian 基准,单源待核]|查看原文
- 还卡在哪:企业 MCP 数据安全机制仍未获独立审计认可;两条路线都要等秋季才见真章(Anthropic 今秋落地、OpenAI 9 月白皮书)。
v-longtask(长任务可靠性)—— 档位:收敛中
- 模型侧:Qwen-UI-Agent 的在线 RL 支持超 100 步轨迹、上万并行环境 rollout,长程 OSWorld-v2 拿到 40.0% partial progress(见候选①)——这是长任务从"演示"往"可训练可测"走的工程侧证据。
- 运行时侧:agent-substrate 的亚秒级 suspend / resume + 跨休眠全状态快照,解决的是长任务 agent"挂着不干活也占资源"的成本问题(见 v-skills)。
- 还卡在哪:两条证据方向不同(一个训练 / 评测、一个运行时持久化),不构成同痛点的 ≥2 独立证据收敛;上期卡点未动——Claude 计算蛋白质设计闭环仍是 Anthropic 单厂演示,今日无跨厂复现或 toolchain 开放(→T-137)。
- 别高兴太早:仍然没有第二家把长程科研闭环跑出来。
v-memory(记忆可靠性)—— 档位:实验
- 有两个单点信号但都不够:Cursor 官方插件里出现
continual-learning(用增量 transcript 驱动、只保留高信号要点来更新AGENTS.md),akitaonrails/ai-memory上 Trending。都是单厂插件或单点项目形态,跨 agent 长期记忆仍无标准,维持实验档。 - 证据:[GitHub]|[cursor/plugins 之 continual-learning]|查看原文
v-embodied(具身智能 / 机器人 agent)—— 档位:实验
- 仅有预告级信号:科大讯飞称新主力通用大模型将在端侧同步落地车载、机器人场景(见 f-chinastack),尚无产品出货或复现。边界观察(AC-004):模型自改进 / RSI 与具身智能连续 12 天维持实验档,复现缺口未解、无 regime 漂移实证,继续 early-warning,不触发框架换代。
横轴 · 渗透率
- f-knowledgework(企业知识工作 / AI 办公) —— 档位:早期采用
- 载体 / 入口:IDE / 办公软件 / API / 桌面 App
- 用户段与自主度:企业 / 专业用户|copilot → 有监督
- 真实使用信号:Anthropic 上线 Claude Academy,课程与教程全部免费向所有人开放,除教怎么用 Claude 外也放与产品模型无关的通用 AI 学习内容,按兴趣推课、追踪进度与徽章——这是上手漏斗层面的动作,比又一个功能更贴近渗透率。OpenAI 侧一天推了一串办公化能力:ChatGPT 桌面端出 Apple Messages 插件(在 Mac 上搜信息、理清对话进展、起草并发送回复)、ChatGPT Work 与 Codex 支持只读链接分享对话(给 PR / 深度分析 / 项目交接补上下文)、ChatGPT Sites 支持把 teammates 加为编辑者共同构建发布(git 与 CI 由 Codex 后台处理)、Computer History 扩展到欧洲经济区 / 英国 / 瑞士的 Pro / Business / Enterprise(限 Mac、需主动开启)、GPT-Image-2 API 开放透明背景预览;Exa 插件进 Codex 与 ChatGPT,号称可访问超 1000 亿网站 / 论文 / 文档。字节 TraeWork 上线电脑控制,自然语言驱动跨软件持续操作并交付文件,把 AI 工作流延到本地文件与无 API 的桌面软件,全程可见、支付 / 删除等高风险动作暂停确认、屏幕内容不持久存储,Mac 支持后台运行、Windows 暂不支持。
- 还差什么:全是能力铺开,没有一个可核查的企业常态化采用数字,distribution 仍为 false。
- 证据:[Juya AI Daily]|[Claude Academy 免费开放]|查看原文
- f-devagent(开发者 agent 入口) —— 档位:早期采用
- 载体 / 入口:IDE 扩展 / CLI / 插件市场 / 消费级订阅
- 用户段与自主度:开发者 → 泛技术用户|copilot → 有监督
- 真实使用信号:Google 官方推出 Antigravity IDE 扩展,一口气覆盖 VS Code、Visual Studio、JetBrains 全系与 Zed,装完在 IDE 内获得会话、自定义与"与 Antigravity 生态共享上下文"的多 agent 编排;个人开发者用 Google 账号登录、含免费层的任意订阅方案都适用,企业可用 Gemini Enterprise 或 GCP 项目凭证——这是今天渗透侧最实的分发动作,同日也上了 Product Hunt。xAI 把 Grok Build 模式向所有 SuperGrok 与 X Premium 订阅用户开放(grok.com / iOS / Android),一条提示词生成带独立域名的已发布产品,背后跑完整编码 agent、支持 subagents / 浏览器使用 / 数据库与 secrets,可发布到 grok.me 或自有域名、也可导出源码继续开发——coding agent 被打包进消费级订阅。OpenCode 免费提供 Muse Spark 1.2;Ollama 云端订阅推 Kimi K3 已覆盖过半用户。Product Hunt 侧同向:Epho(云端 Claude Code)、OneCLI、Plow Latch(本地 AI 桌面管理器)、Local、Dockhand。
- 还差什么:Grok Build 触达的是订阅用户而非公开大众,没有 DAU / 留存;Antigravity 扩展刚发,无安装量。
- 证据:[Juya AI Daily]|[Antigravity IDE 扩展四端覆盖]|查看原文
- f-caros(端侧 / 可穿戴 AI 入口) —— 档位:萌芽
- 载体 / 入口:本地桌面 App / 车载 / 机器人
- 用户段与自主度:大众|copilot
- 真实使用信号:只有 Product Hunt 侧的本地化尝试(Plow Latch 本地 AI 桌面管理器、Local),加科大讯飞端侧落地车载与机器人的预告,无一条 DAU 或出货信号。
- 还差什么:端侧入口仍停在工具与预告,缺任何规模化使用数据。
- f-chinastack(中国 AI 全栈) —— 档位:早期采用
- 载体 / 入口:云 / 模型 API / 国产算力 / 国际标准
- 用户段与自主度:企业 / 专业用户|copilot → 有监督
- 真实使用信号:模型侧今天很密(Qwen-UI-Agent、Qwen-Image-3.0、蚂蚁 Ling-3.0 Base 全流程开源、商汤 SenseNova-U1.5、DeepSeek-V4-Flash-Vision-Exp,见纵轴)。标准侧出现新维度:中国信通院牵头的两项 ITU 国际标准成功结项即将发布——《面向大模型的边缘侧推理软硬件系统能力技术要求》与《面向大语言模型算子的要求和评价指标》(ITU-T SG21 全会 2026-07-06 至 07-17 日内瓦),是从"用国产栈"往"定国际口径"走。硬件财务侧首次有中报口径:中兴通讯披露 2026 上半年服务器及存储等算力产品在互联网、金融、电力行业头部客户规模上量、推动国内政企业务收入快速增长,AI 终端产品矩阵(家庭终端 / 手机 / 移动互联)收入增长。科大讯飞则称将推基于全国产算力的新主力通用大模型,代码能力与 Token 性价比要进国内第一梯队、全国产算力训练指标继续国内领先,8 月底先出阶段性版本。
- 还差什么:中兴口径是定性"规模上量 / 快速增长",没有金额与占比拆分,国产算力硬件的财务验证仍不完整(→T-133 顺延);讯飞是预告不是发布。
- 证据:[金十电报]|[信通院牵头 ITU 两项标准结项]|查看原文;[金十电报]|[中兴算力产品规模上量]|查看原文;[金十电报]|[科大讯飞全国产算力大模型]|查看原文
资本与政策
- 博通拟举债筹资超 600 亿美元支持 AI 芯片项目(含 Anthropic):据彭博社(IT之家转述),博通正与多家贷款机构磋商,方案预计包含约 300 亿美元次级债分档,并为 600 亿至 700 亿美元优先担保债分档提供部分担保,正在商讨的金额可能把总融资规模推到 1000 亿美元;黑石与阿波罗全球管理正接洽参与。博通已与 Anthropic 及 OpenAI 签有芯片供应协议,此前在帮 Alphabet 与 Meta 设计定制芯片。仍处讨论阶段、规模与结构可能变化,也可能分阶段筹集。这笔钱的性质是给"绕开英伟达"的定制芯片路线加杠杆(→v-cost / T-121)。
- 证据:[AI Hot 转述 IT之家 / 彭博]|[博通 600 亿美元债务融资]|查看原文
- NVIDIA 以 60 亿美元买下 poolside 的"模型工厂":据 Latent Space 主播 swyx 与 poolside 创始人的最新一期播客及相关转述,NVIDIA 收购的是 poolside 的 model factory 业务,大量研究人员拿到 NVIDIA offer,创始人留守 poolside,公司后续可能转型为 neocloud 算力提供商。属播客 / 社媒口径,未见官方公告。
- 证据:[AI Hot 转述 swyx / Latent Space]|[NVIDIA 6B 收购 poolside 模型工厂]|查看原文
- Anthropic 最快 8 月底公开递交 IPO 申请(传闻,单源待官方):Juya 转述的前瞻消息,无官方确认;与今天的 Platform GA、Claude Academy、数据留存新政放在一起看,是"企业化 / 合规化"节奏,但作为资本事件仍属传闻级,不作框架硬证据。
- 证据:[Juya AI Daily 转述]|[IPO 传闻]|查看原文
- 日本再拨逾 9 亿美元支持 Rapidus:日本政府将再拨 1500 亿日元(约 9.44 亿美元)支持芯片初创企业 Rapidus,加大支出以与台积电等竞争。同日 SK 海力士回应"尚未决定在日本建厂",称将在今日起一个月内进一步披露(此前有报道称其将在宫城县建存储芯片工厂)。
- MiniMax 研发负责人阿岛(缪宇航)离职:据报道其飞书状态已显示离职,此前负责 M3.x、Code、Agent、Audio 与海螺 AI 等多条研发线,下一站与接替人选均无公开消息。
- 证据:[Juya AI Daily 转述]|[MiniMax 阿岛离职]|查看原文
待跟踪 & 本期变更
未来 24-72h 待跟踪(watchboard 投影;矢量 / 形态用 canonical id 引用):
| 待印证的能力矢量(纵轴) | 待观察的渗透(横轴) | 待发布动作 / 待验证项目 |
|---|---|---|
| v-openflagship:Qwen-UI-Agent 权重是否落 HF / ModelScope、第三方榜是否复现(T-140,8/29) | f-devagent:Antigravity IDE 扩展安装量与留存 | DeepSeek V4 Pro 权重官宣与 HF 页(T-116,8/24) |
| v-openflagship:DeepSeek V4 Pro 0813 权重 8/24 是否放出(T-116) | f-devagent:Grok Build 面向订阅用户开放后的实际发布量 | GLM-5.3 权重放开与智谱官方页(T-136,8/28) |
| v-skills:三套 skill / plugin 清单规范是否收敛出互通标准(T-142,9/5) | f-chinastack:中兴 AI 算力收入的金额 / 占比拆分(T-133) | 科大讯飞全国产算力主力大模型阶段性版本(8 月底) |
| v-security:Anthropic 客户自管留存今秋落地 vs OpenAI 9 月白皮书(T-141,9/30) | f-knowledgework:Claude Academy 是否带出可核查上手数据 | Claude Platform GA 官方博客页恢复可达后补一手(候选②) |
🔄 本期变更(框架 × 跟踪合并)
- 框架:两轴档位均沿用,无跨档。实质变化在
v-skills的 open_pain 迁移——上期"harness 标准化仍靠大厂落地"今日被 Anthropic GA + Cursor manifest + 社区 skill 走官方 marketplace 三面兑现(T-126 结案 confirmed),新 open_pain 改为"Claude plugin / .cursor-plugin manifest / skills.sh 三套清单与分发规范并存、跨 agent 互通标准未定;skill 供应链安全刚有扫描器、无审计惯例"。v-security的 open_pain 增记"两条数据治理路线(客户自管托管 vs 隐私计算侧检测)分叉、企业选型开始有真实取舍"。watch_companies 增补阿里通义 MAI-UI、Cursor、Liquid AI、博通;watch_projects 增补 Qwen-UI-Agent、cursor/plugins、mattpocock/skills、agent-substrate、AI-Infra-Guard、Ling-3.0-base(←frame_change)。 - 候选席位重排:上期 2 个候选(DeepSeek V4 Pro 0813 + Harness、GLM-5.3)未被撤销、未被证伪,因证据强度低于本期两个新对象(前者始终缺一手与可下载权重、后者缺官方 model card)而让出深挖席位,降为 A 级并继续按 T-116 / T-136 在 8/24、8/28 验证;candidate_budget 仍为 2/2 占满。
- 跟踪项结算(上期每个 open 项均经处理,无凭空消失):
#T-116(v-openflagship)国产开源旗舰系统性渗透:今日蚂蚁 Ling-3.0 Base 全流程开源、商汤 SenseNova-U1.5、Qwen 三线齐发继续加厚,但 DeepSeek V4 Pro 权重仍卡 8/24 → 顺延;子项#T-136(GLM-5.3 8/28 官验)今日无新 → 顺延;新增子项#T-140(Qwen-UI-Agent 权重可得性与第三方独立复核,8/29 到期)。#T-121(v-cost)AI 资本支出自我回报期:博通拟举债 600 亿至 1000 亿美元支持定制芯片是资金侧加杠杆的新证据,但非回报期结算点 → 顺延;子项#T-139(Etched 7 亿融资,9/15)今日无新 → 顺延。#T-125(v-skills)coding agent 入口移动化 / Remote Control:今日 Grok Build 向所有 SuperGrok / X Premium 开放(含 iOS / Android)是入口下沉的实证,但仍限订阅用户、无 DAU → 顺延。#T-126(v-skills)harness 标准化 + browser MCP → confirmed(结案)。Anthropic 把 browser use 工具与 Skills API / Files API 从 beta 推到 GA,并跨 Microsoft Foundry / 即将 Vertex AI 分发;Cursor 同日放出带.cursor-plugin/plugin.jsonmanifest 的官方插件仓库;社区 mattpocock/skills 经 Claude Code 官方 marketplace 分发。大厂落地这一条已经成立,痛点转入 T-142。#T-127(v-openflagship)中国 AI 全栈:信通院牵头 ITU 两项大模型边缘侧标准结项、中兴算力产品规模上量、科大讯飞全国产算力大模型预告 → 全栈继续推进但均非结算点 → 顺延。#T-131(v-cost,已 confirmed)GPT-5.6 Sol 半价定价战:维持 confirmed,今日 Ramp 份额数据是其下游后果,记入 T-134。#T-132(v-security)企业 agent 数据安全:Anthropic 30 天留存保留 + 企业自管托管今秋落地,是本项最强单日增量,但企业 MCP 独立审计仍缺 → 顺延;子项#T-138(OpenAI 暂停前沿训练两周,9/2)今日无新 → 顺延;新增子项#T-141(Anthropic 客户自管留存 vs OpenAI Private Safety Processing 两路线今秋落地对比,9/30 到期)。#T-133(v-openflagship)端侧 / 国产 AI 硬件财务验证:中兴中报首次给出定性确认(算力产品规模上量、AI 终端收入增长),但无金额与占比拆分,不足以结案 → 顺延,update 记录"已有中报定性口径、缺量化拆分"。#T-134(v-cost)GPT-5.6 Sol 半价后连锁:Ramp 数据显示 OpenAI 企业 API 增速 Q3 至今 82% 反超 Anthropic 76%(2025Q2 以来首次),且明确归因 GPT-5.6 Sol 成开发者首选、Fable 5 受价格与留存要求拖累 → 部分兑现,顺延;结案仍需竞品直接跟降或官方财报口径。#T-135(v-openflagship)Anthropic Model 2 披露待验证 → expired(窗口 8/21 到期)。今日 Anthropic 侧动作密集(Platform GA、Claude Academy、数据留存新政、IPO 传闻、博通债务融资支持其定制芯片),但无 Model 2 的官方披露也无否认,按验证窗口到期结案;若后续出现官方披露另开新项。#T-137(v-longtask)Claude 蛋白设计闭环跨厂复现(8/29):今日无跨厂复现或 toolchain 开放 → 顺延。
- 新开:顶层新增
#T-142(v-skills,三套 skill / plugin 清单与分发规范是否收敛出跨 agent 互通标准、skill 供应链安全扫描是否被采用,9/5 到期),是 T-126 结案后的继承痛点;另按母题归并新增两个子项 T-140(挂 T-116)、T-141(挂 T-132)。结算后顶层 open 数 9(≤10 软上限)。 - 框架体检:距上次 review 13 天,对照三条 invalidation_trigger 全未命中,regime 维持"稳定";AC-004 边界观察连续 12 天维持实验档、无 regime 漂移实证。本期 v-skills 卡点迁移属档内前移,不构成 regime 换代。