AlphaVault← 产业跟踪
AI 日报 | 2026-09-08 AI 日报

更新时间:19:06|覆盖窗口:2026-09-07 ~ 09-08(承接上一期 2026-09-06)
数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(OpenAI / Anthropic / Google AI / Meta AI / DeepMind / HuggingFace / NVIDIA / The Decoder / Juya / AI Hot 等) / 金十电报

数据覆盖与缺口(CLS/财联社本 pipeline 不采集,属设计而非缺口):

9-07 入库9-08 入库状态
Hacker News4232
GitHub Trending1821✓(GitHub API 元数据限流,ECC repo 抓取失败,仓库细节以热榜行为准)
RSS5163✓(9-08 当日 OpenAI Blog / Google AI / HF / NVIDIA Dev 等 feed 0 条属源站无更新;OpenAI 动作经 Juya 全文回填与 The Decoder 核对)
金十电报297274✓(AI 相关占比低,已按 AI 过滤)
Product Hunt1020
Juya AI Daily1 期1 期✓(9-07 期 feed 截断、9-08 期 RSS 未收录,均已直抓当日页面回填全文;第三方转述口径,厂商动态以官方源核对)
这份日报是一张二维坐标系:纵轴看模型与产品的能力 / 技术往哪走(实验收敛中事实标准,判档看证据强度,同一矢量当天 ≥2 个独立证据才算收敛),横轴看 AI 产品被多少人、多少场景真用上(萌芽早期采用主流化,判档看真实使用信号,不看 star / votes)。

一句话结论

地图今天新开一条矢量:「模型自改进 / RSI」从框架边缘的观察项转成正式登记——OpenAI 一个「RSI 日」三连发(自动化研究实习生里程碑达成、2028 年 3 月自动化研究员目标、首席科学家 Pachocki 长文《An Alien Mind》),把递归自我改进从概念写成了研究组织方式(→候选①)。能力叙事跑得越快,验证和信任的裂缝就越扎眼:同一个窗口里,数学家把「AI 解决 NS」的传闻变成了对 OpenAI 的公开指控(→候选②),评测机构半个月内第三次改口径,而真用起来的仍然只有开发者和企业那几拨人。两个候选都过不了确认门——OpenAI 的内部指标按定义无法第三方复核,NS 争端是单方陈述且已遭否认——所以本期没有深度拆解。接下来 24-72h 盯三件事:Bubeck 承诺的 NS 争端回应、AA v4.3(Terminal-Bench 4.0)的后续复测、9/14 Claude 限额调整落地。

双轴定位图 · 能力成熟度 × 渗透度
2026-09-08 · 纵轴档位 + 毕业三条完成度,横轴档位 + 五追问命中数
供给超前:能力收敛了,还没人真用兑现区:能力成熟 + 真用起来需求拉动:用得广但技术没定型未挂钩实验萌芽收敛中早期采用事实标准主流化能力成熟度 ↑渗透度 →端侧/可穿戴 AI 入口 — 渗透 萌芽|五追问 2/5|大众|使用信号:Meta Muse Voice Transcribe($0.18/小时,AA 独立确认)对准 AI 眼镜常驻助手底座;本窗口无新证端侧/可穿戴 AI …消费级 agent 代办 — 渗透 萌芽|五追问 2/5|大众|使用信号:Grok Bot Marketplace 上期省钱账延续;本窗口无新证消费级 agent …政府/国防入口 — 渗透 萌芽|五追问 3/5|企业/政府|使用信号:公安部「国家反诈 AI」App 全渠道分发;纽约市公立学校八年级以下禁用 AI 工具(反向信号);本窗口无新增正面信号政府/国防入口中国 AI 全栈 — 渗透 早期采用|五追问 3/5|企业/专业|使用信号:QoderWake 1.0 数字员工正式版(钉钉/飞书/企微常驻、10 岗位、本地敏感数据+高危拦截);千问 10+ 金融服务智能体;TRAE 高校扶持计划;DeepSeek 社招约 150 资深后端;Hy4 优化版全量上线(独立评测仍缺)中国 AI 全栈开发者 agent 入口 — 渗透 早期采用|五追问 5/5|开发者|使用信号:Omarchy 自称首个从头为 agent 打造的 OS(OpenRouter 路由、Omacom 再募 50 万美元);ECC/superpowers/karpathy-skills 连日霸榜;Codex 全付费订阅用量重置;OpenAI 恢复 Plus/BS 5 小时限制(社区口径)开发者 agent …企业知识工作/AI 办公 — 渗透 早期采用|五追问 5/5|企业|使用信号:ChatGPT Work 个人写作风格学习(Gmail/Drive/Slack/SharePoint,全付费 Work 订阅);Similarweb:ChatGPT 网站流量份额回升 55.5%(Gemini 25.6%,同比 ChatGPT 73.3%↓、Claude 1.9→9.3%);UBS 2027 起 AI 技能硬性要求 vs NYC 禁令企业知识工作/AI …A. 推理成本 — 档位 收敛中|毕业度 2/3|同档停留 ≥10 天|卡点:效率侧三证齐发(AMD 19 天 11 倍、TPU InferenceX 性价比 +50%、Sol-H3 15.5 倍)+ API 价格 18 个月 1000 倍;供给面反向:OpenAI 恢复 5 小时限制(社区口径)+ Codex 全量重置;9/14 Claude 限额调整(净 -17%)将至AB. 长任务可靠性与上下文管理 — 档位 收敛中|毕业度 1/3|同档停留 ≥10 天|卡点:τ²-Bench(Sierra+普林斯顿):Opus 5 构建客服 agent 仅 23.9% vs 专家人类 82.2%,协作型工程任务成新硬卡点;Astra 23h43m 无人工通关 Portal 抬高游戏级长任务;FLT 后续与 NS 争端(受迫 NS 爆破+同路线指控)进入争议区BC. 记忆与上下文管理(agent 主动管理自身上下文) — 档位 收敛中|毕业度 1/3|同档停留 5 天|卡点:PayPal 论文量化记忆反噬(信陈旧记忆、缓解依赖模型规模);NemoClaw 进大厂开发者工具链;跨会话统一记忆与第三方复现仍缺(本窗口无新证)CD. 开放权重/开源旗舰 — 档位 收敛中|毕业度 1/3|同档停留 ≥10 天|卡点:AA v4.3 双旗舰并列 53(口径之争降温)但榜单半月三修快过复测;开源梯队 GLM-5.3/Kimi K3 并列 44、MiniCPM5-2B 把开源压到端侧(AA 指数 23);Mistral €3B 主权开放权重创欧洲纪录;国产侧第三方深度复测仍缺(Hy4 复核 9/15)DE. agent 安全与信任 — 档位 收敛中|毕业度 2/3|同档停留 ≥10 天|卡点:Pachocki 自认 CoT 监控可靠性下降、呼吁有强制约束力的共同安全标准(第三方审计/政府/国际监督)、标准前自愿放缓;wiki 事件细节(6 月中旬、1.8 万条);NS 争端把「用户会话是否进训练」变成公开追问;披露框架文本未出EF. agent 技能与 harness 标准 — 档位 收敛中|毕业度 1/3|同档停留 ≥10 天|卡点:ECC(68 子代理/286 技能/94 命令、自带注入扫描)连日霸榜;腾讯 TeamAI-CLI 把技能治理做成 git+MR+hook;Microsoft 论文量化技能换推理(GPT-5.4-mini 恢复 55-100%+、token 少 2.9-4.5 倍);跨 agent 互通标准仍未收敛、skill 供应链安全扫描无行业规范FG. 具身智能 — 档位 实验|毕业度 —|同档停留 ≥10 天|卡点:宇树 UnifoLM-X2-1.0 世界模型实时驱动全自主格斗(官方视频);Qwen-Drive 1.0 被指解释与动作不符;三星据悉 CES 2027 首秀人形机器人;产品化交付与真实使用数据仍缺GH. 模型自改进 / RSI — 档位 实验|毕业度 —|同档停留 1 天|卡点:OpenAI「RSI 日」三连发(研究实习生里程碑 3.1 倍运行时、2028-03 自动化研究员目标、An Alien Mind)把 RSI 写成研究组织方式;内部指标不可第三方复核、CoT 监控可靠性自认下降、算力与难自动化环节仍制约H记忆与上下文管理(agent 主动管理自身上下文) — 窗口起点:实验09-01 进档1. OpenAI RSI 日 · S-candidate — 自动化研究实习生里程碑+三大北极星+An Alien Mind17. Unitree UnifoLM-X2-1.0 · A 级 — 世界模型实时驱动全自主格斗72. NS 声明争端 · S-candidate — 受迫 NS 爆破结果+对 OpenAI 的公开指控23. AA v4.3 · A 级 — Fable 5.1×Astra 并列 53,TB 4.0+AutomationBench-AA36. AMD vLLM 11x · A 级 — MI355X agentic 19 天 11 倍64. ECC 开源 · A 级 — 68 子代理/286 技能/94 命令 MIT45. MiniCPM5-2B · A 级 — 2.52B 端侧开源,AA 指数 2358. ChatGPT Work 风格学习 · A 级 — 个人风格学习进办公流8
矢量·双侧证据矢量·仅实验室矢量·仅开源产品形态(在横轴上)今日 S 级今日 A 级今日 B 级底图矢量记 A/B/C…,今日对象记 1/2/3…
A推理成本收敛中 · 毕业 2/3 · 停留 ≥10 天
B长任务可靠性与上下文管理收敛中 · 毕业 1/3 · 停留 ≥10 天
C记忆与上下文管理(agent 主动管理自身上下文)收敛中 · 毕业 1/3 · 停留 5 天
D开放权重/开源旗舰收敛中 · 毕业 1/3 · 停留 ≥10 天
Eagent 安全与信任收敛中 · 毕业 2/3 · 停留 ≥10 天
Fagent 技能与 harness 标准收敛中 · 毕业 1/3 · 停留 ≥10 天
G具身智能实验 · 毕业 — · 停留 ≥10 天
H模型自改进 / RSI实验 · 毕业 — · 停留 1 天
1OpenAI RSI 日S-candidate
2NS 声明争端S-candidate
3AA v4.3A 级
4ECC 开源A 级
5MiniCPM5-2BA 级
6AMD vLLM 11xA 级
7Unitree UnifoLM-X2-1.0A 级
8ChatGPT Work 风格学习A 级
10 天窗口内档位位移 1 次:记忆与上下文管理(agent 主动管理自身上下文) 09-01。 星与圆点是今天定级的 8 个对象,落在它推动的矢量 × 形态那一格。

重点候选 · 待验证

① OpenAI「RSI 日」三连发 —— 重点候选,缺独立复核

② Navier–Stokes 声明与实验室争端 —— 重点候选,缺独立仲裁

纵轴 · 能力与技术演进

横轴 · 渗透率

资本与政策

10 天档位迁移带
2026-08-24 ~ 2026-09-08 · 按 canonical id 对齐,全部取自 report_state
08-2408-2508-2608-2808-3009-0109-0309-0409-0609-08纵轴 · 能力矢量推理成本(v-cost)推理成本推理成本 — 08-24|收敛中推理成本 — 08-25|收敛中推理成本 — 08-26|收敛中推理成本 — 08-28|收敛中推理成本 — 08-30|收敛中推理成本 — 09-01|收敛中推理成本 — 09-03|收敛中推理成本 — 09-04|收敛中推理成本 — 09-06|收敛中推理成本 — 09-08|收敛中长任务可靠性与上下文管理(v-longtask)长任务可靠性与上下文管理长任务可靠性与上下文管理 — 08-24|收敛中长任务可靠性与上下文管理 — 08-25|收敛中长任务可靠性与上下文管理 — 08-26|收敛中长任务可靠性与上下文管理 — 08-28|收敛中长任务可靠性与上下文管理 — 08-30|收敛中长任务可靠性与上下文管理 — 09-01|收敛中长任务可靠性与上下文管理 — 09-03|收敛中长任务可靠性与上下文管理 — 09-04|收敛中长任务可靠性与上下文管理 — 09-06|收敛中长任务可靠性与上下文管理 — 09-08|收敛中记忆与上下文管理(agent 主动管理自身上下文)(v-memory)记忆与上下文管理记忆与上下文管理(agent 主动管理自身上下文) — 08-24|实验记忆与上下文管理(agent 主动管理自身上下文) — 08-25|实验记忆与上下文管理(agent 主动管理自身上下文) — 08-26|实验记忆与上下文管理(agent 主动管理自身上下文) — 08-28|实验记忆与上下文管理(agent 主动管理自身上下文) — 08-30|实验记忆与上下文管理(agent 主动管理自身上下文) — 09-01|收敛中↑ 进档记忆与上下文管理(agent 主动管理自身上下文) — 09-03|收敛中记忆与上下文管理(agent 主动管理自身上下文) — 09-04|收敛中记忆与上下文管理(agent 主动管理自身上下文) — 09-06|收敛中记忆与上下文管理(agent 主动管理自身上下文) — 09-08|收敛中开放权重/开源旗舰(v-openflagship)开放权重/开源旗舰开放权重/开源旗舰 — 08-24|收敛中开放权重/开源旗舰 — 08-25|收敛中开放权重/开源旗舰 — 08-26|收敛中开放权重/开源旗舰 — 08-28|收敛中开放权重/开源旗舰 — 08-30|收敛中开放权重/开源旗舰 — 09-01|收敛中开放权重/开源旗舰 — 09-03|收敛中开放权重/开源旗舰 — 09-04|收敛中开放权重/开源旗舰 — 09-06|收敛中开放权重/开源旗舰 — 09-08|收敛中agent 安全与信任(v-security)agent 安全与信任agent 安全与信任 — 08-24|收敛中agent 安全与信任 — 08-25|收敛中agent 安全与信任 — 08-26|收敛中agent 安全与信任 — 08-28|收敛中agent 安全与信任 — 08-30|收敛中agent 安全与信任 — 09-01|收敛中agent 安全与信任 — 09-03|收敛中agent 安全与信任 — 09-04|收敛中agent 安全与信任 — 09-06|收敛中agent 安全与信任 — 09-08|收敛中agent 技能与 harness 标准(v-skills)agent 技能与 har…agent 技能与 harness 标准 — 08-24|收敛中agent 技能与 harness 标准 — 08-25|收敛中agent 技能与 harness 标准 — 08-26|收敛中agent 技能与 harness 标准 — 08-28|收敛中agent 技能与 harness 标准 — 08-30|收敛中agent 技能与 harness 标准 — 09-01|收敛中agent 技能与 harness 标准 — 09-03|收敛中agent 技能与 harness 标准 — 09-04|收敛中agent 技能与 harness 标准 — 09-06|收敛中agent 技能与 harness 标准 — 09-08|收敛中具身智能(v-embodied)具身智能具身智能 — 08-24|实验具身智能 — 08-25|实验具身智能 — 08-26|实验具身智能 — 08-28|实验具身智能 — 08-30|实验具身智能 — 09-01|实验具身智能 — 09-03|实验具身智能 — 09-04|实验具身智能 — 09-06|实验具身智能 — 09-08|实验模型自改进 / RSI(v-rsi)模型自改进 / RSI模型自改进 / RSI — 09-08|实验横轴 · 产品形态中国 AI 全栈(f-chinastack)中国 AI 全栈中国 AI 全栈 — 08-24|早期采用中国 AI 全栈 — 08-25|早期采用中国 AI 全栈 — 08-26|早期采用中国 AI 全栈 — 08-28|早期采用中国 AI 全栈 — 08-30|早期采用中国 AI 全栈 — 09-01|早期采用中国 AI 全栈 — 09-03|早期采用中国 AI 全栈 — 09-04|早期采用中国 AI 全栈 — 09-06|早期采用中国 AI 全栈 — 09-08|早期采用开发者 agent 入口(f-devagent)开发者 agent 入口开发者 agent 入口 — 08-24|早期采用开发者 agent 入口 — 08-25|早期采用开发者 agent 入口 — 08-26|早期采用开发者 agent 入口 — 08-28|早期采用开发者 agent 入口 — 08-30|早期采用开发者 agent 入口 — 09-01|早期采用开发者 agent 入口 — 09-03|早期采用开发者 agent 入口 — 09-04|早期采用开发者 agent 入口 — 09-06|早期采用开发者 agent 入口 — 09-08|早期采用企业知识工作/AI 办公(f-knowledgework)企业知识工作/AI 办公企业知识工作/AI 办公 — 08-24|早期采用企业知识工作/AI 办公 — 08-25|早期采用企业知识工作/AI 办公 — 08-26|早期采用企业知识工作/AI 办公 — 08-28|早期采用企业知识工作/AI 办公 — 08-30|早期采用企业知识工作/AI 办公 — 09-01|早期采用企业知识工作/AI 办公 — 09-03|早期采用企业知识工作/AI 办公 — 09-04|早期采用企业知识工作/AI 办公 — 09-06|早期采用企业知识工作/AI 办公 — 09-08|早期采用端侧/可穿戴 AI 入口(f-caros)端侧/可穿戴 AI 入口端侧/可穿戴 AI 入口 — 08-24|萌芽端侧/可穿戴 AI 入口 — 08-25|萌芽端侧/可穿戴 AI 入口 — 08-26|萌芽端侧/可穿戴 AI 入口 — 08-28|萌芽端侧/可穿戴 AI 入口 — 08-30|萌芽端侧/可穿戴 AI 入口 — 09-01|萌芽端侧/可穿戴 AI 入口 — 09-03|萌芽端侧/可穿戴 AI 入口 — 09-04|萌芽端侧/可穿戴 AI 入口 — 09-06|萌芽端侧/可穿戴 AI 入口 — 09-08|萌芽消费级 agent 代办(f-consumer)消费级 agent 代办消费级 agent 代办 — 08-30|萌芽消费级 agent 代办 — 09-01|萌芽消费级 agent 代办 — 09-03|萌芽消费级 agent 代办 — 09-04|萌芽消费级 agent 代办 — 09-06|萌芽消费级 agent 代办 — 09-08|萌芽政府/国防入口(f-gov)政府/国防入口政府/国防入口 — 09-01|萌芽政府/国防入口 — 09-03|萌芽政府/国防入口 — 09-04|萌芽政府/国防入口 — 09-06|萌芽政府/国防入口 — 09-08|萌芽10 天内档位变化合计:1 次
实验 / 萌芽收敛中 / 早期采用事实标准 / 主流化无声消失
每格一天,颜色是当天的档位。10 天里合计 1 次档位变化。

待跟踪

未来 24-72h 待跟踪:

待印证的能力矢量(纵轴)待观察的渗透(横轴)待发布动作 / 待验证项目
v-rsi:其他实验室是否跟进 RSI 表态或放缓承诺;第三方对 OpenAI 内部指标的检验性讨论f-knowledgework:Work 风格学习上线后的企业实际用量与留存Bubeck 承诺的 NS 争端回应与训练数据追问(T-166);AA v4.3 Coding Agent Index 更新与后续复测(T-160/T-162,9/10-9/12)
v-longtask:FLT repo 社区复用与 PR 回流;τ²-Bench 是否被其他 harness 复测f-chinastack:QoderWake 与千问金融智能体的真实使用量misalignment 披露框架文本(T-165,9/20);Claude 限额调整 9/14 落地(T-143);DevDay 9/29
v-cost:9/14 限额调整后的实际供给与价格走向f-devagent:Omarchy 装机量与 agent-native OS 跟随者Anthropic IPO 招股书 9 月底窗口(T-121);Muse Code 正式版与 NVIDIA×HF 交割(T-157/T-161,9/15)