AI 日报 | 2026-10-02
更新时间:19:10|覆盖窗口:2026-09-28 ~ 10-02(承接上一期 2026-09-27)
数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(AI Hot / The Decoder / The Neuron / Simon Willison / Juya AI Daily 等) / 金十电报
数据覆盖与缺口:
| 源 | 入库数 | 状态 |
|---|---|---|
| Product Hunt | 0 | ✗(API token 持续失效,五日均无数据,消费产品发现面以 RSS/HN 侧为准) |
| Hacker News | 115 | ✓ |
| GitHub Trending | 63 | ✓ |
| RSS | 330 | ✓(官方博客 feed 窗内仅 OpenAI Blog 有更新,属常态;Juya 采集器日期过滤五期未命中,已按 source URL 手动补抓 10-02 全文回填) |
| 金十电报 | 1847 | ✓(五日合计,AI 相关占比低) |
这份日报是一张二维坐标系:纵轴看模型与产品的能力 / 技术往哪走(实验→收敛中→事实标准,判档看证据强度,同一矢量当天 ≥2 个独立证据才算收敛),横轴看 AI 产品被多少人、多少场景真用上(萌芽→早期采用→主流化,判档看真实使用信号,不看 star / votes)。
一句话结论
两轴地图这个窗口动了两格。决策模型从收敛中顶到了「事实标准候选」:Cloudflare 和 Perplexity 前后脚把自家决策模型连权重带 API 开源,而且都做了 Jev API 兼容,OpenAI 也在 DevDay 给 Codex 加了 Decisions API,「Jev API」开始变成大家默认接的接口。另一格在安全与产品的关系上:安全第一次直接改写旗舰发布节奏,GPT-6.1 Astra 据华尔街日报报道因安全问题推迟,谷歌 Argon 干脆先只放给可信网络防御者。今天的重点是 GPT-6.1 Sol × DevDay(→重点①,四道门槛全过),重点候选是 Gemini 4 Argon(→候选①,卡在还没开放使用)。接下来 72 小时盯 Argon 付费 API 开放公告(T-184),以及 OpenAI 训练暂停的恢复节点(T-183,10/5 到期复查)。
双轴定位图 · 能力成熟度 × 渗透度
2026-10-02 · 纵轴档位 + 毕业三条完成度,横轴档位 + 五追问命中数
矢量·双侧证据矢量·仅实验室矢量·仅开源产品形态(在横轴上)
A推理成本与专用模型收敛中 · 毕业 2/3 · 停留 ≥6 天
B决策模型 / System One收敛中 · 毕业 2/3 · 停留 2 天
C长任务可靠性收敛中 · 毕业 2/3 · 停留 ≥6 天
D记忆与上下文收敛中 · 毕业 1/3 · 停留 ≥6 天
E多智能体编排收敛中 · 毕业 1/3 · 停留 ≥6 天
F开放权重/开源旗舰收敛中 · 毕业 2/3 · 停留 ≥6 天
G沙箱与运行时收敛中 · 毕业 2/3 · 停留 2 天
Hagent 安全与信任收敛中 · 毕业 2/3 · 停留 ≥6 天
Iagent 技能与 harness 标准收敛中 · 毕业 2/3 · 停留 ≥6 天
J实时语音智能体收敛中 · 毕业 2/3 · 停留 ≥6 天
K具身智能实验 · 毕业 0/3 · 停留 ≥6 天
L模型自改进 / RSI实验 · 毕业 0/3 · 停留 ≥6 天
6 天窗口内档位一次都没动——今天是证据积累日,不是地图移动日。
今日重点 · 深度拆解
① GPT-6.1 Sol × DevDay 全家桶 —— 把「接近旗舰」打到两折,顺手把 ChatGPT 改造成操作系统
- 是什么:9 月 29 日 DevDay 一揽子发布。GPT-6.1 Sol 的官方定位是以 GPT-6 Astra 五分之一的价格逼近其智能水平:API 定价每百万输入 2 美元、输出 10 美元,缓存输入 0.10 美元(比 GPT-6 Sol 再砍一半),即日起 Plus/Pro/Business/Enterprise/Edu 用户在 ChatGPT Work 和 Codex 可用(暂不进普通聊天),API 名 gpt-6.1-sol,Codex 里 token 速度最高 8 倍的 Ultrafast 档承诺数日内上线。同场还有常驻智能体 Dots——由 GPT-6 Astra 驱动、每个 dot 独享一台云电脑和浏览器、通过插件连 4000 多个应用,面向 Pro/Business Premium/Enterprise 逐步开放,首个 dot 免费附赠;外加 ChatGPT Space 协作空间、Pages 文档、Meetings 会议记录、@提及集成 Slack/Teams、Sign in with ChatGPT(合作应用直接用 ChatGPT 订阅额度)、插件发现入口(多家媒体直接类比为「应用商店模式」)、Pro 500 档与 Codex 的安全扫描、Decisions API。发布前一天,华尔街日报报道 OpenAI 因安全问题取消了另一款新模型的按计划发布。
- 方法论落点:v-cost 维持收敛中,但帕累托前沿在一个窗口里被连推三次:ARC Prize 复核 Sol 在 ARC-AGI-2 拿 94.2%(Astra 95.0%)且成本低 77%;Sonnet 5.5 同价提速 30% 以上、任务成本最高降 30%;Argon 介绍价把 AA 单任务成本打到 Astra 的六成。f-consumer 拿到第一个后台自治入口:Dots 让横轴的自主度从「有监督」推进到「后台自治」。Codex 企业原生支持 GLM-5.3 Flash 和 Kimi K3 等开源模型(T-186 新开),是 v-openflagship 的分发侧突破。
- 产业位置:缓存价成了 agent 场景价格战的主战场:Sol 的 0.10 美元缓存价只有 Sonnet 5.5(0.20 美元)的一半,对反复复用上下文的 agent 工作流这是实打实的成本差。需求侧,OpenAI 员工 Tibo 称 Sol 是公司迄今在 API 和订阅端需求量最大的模型,发布即高负载,官方承诺扩容到近两倍速度,但有用户反馈等了 18 分钟还没跑完一次编辑,官方说法和体感暂时对不上(T-185 盯恢复)。公司层面,OpenAI 拟按 1.4 万亿美元投前估值融资至少 300 亿美元,企业业务收入较 7 月翻倍。中美对照值得记一笔:Codex 把中国开放权重塞进企业菜单的同几天,Anthropic 发布了 GLM-5.3 网络能力扩散研究(→纵轴 v-security)。同一批开放权重,既是国际入口的分发标的,也是安全争议的主角。
- 证据与反例:官方一手(openai.com 公告)+ 第三方复核(ARC Prize 官方结果页、The Decoder 独立解读、AA 口径 Sol(max) 52 分)齐备。要打折扣的地方:全部基准是 OpenAI 自报的 preliminary 口径;Dots 首次公开演示当场卡壳;「Astra 推迟」是 WSJ 消息口径,官方公告里只字未提,安全整改期的产品节奏判断要留余量。
- 兑现路径:T-180 已确认(帕累托前移坐实);T-185 盯负载恢复与 Ultrafast 上线;T-186 盯 Codex 开源模型的企业采用。falsifier:第三方系统性评测发现 Sol 相对 Astra 有超出官方口径的质量让步,或高负载两周内无法恢复。
- 证据入口:[OpenAI 官方公告]|[即日可用、定价与安全口径]|查看原文;[ARC Prize 官方结果]|[94.2%、成本 -77%]|查看原文;[The Decoder]|[价格对照与 Astra 推迟细节]|查看原文;[Dots 官方公告]|[4000 应用、独立云电脑]|查看原文;[金十]|[Dots 功能详情]|查看原文;[橘鸦 AI 早报]|[扩容承诺与用户实测反馈]|查看原文
重点候选 · 待验证
① Gemini 4 Argon —— 重点候选,尚缺真实可用
- 为什么重要:谷歌七个多月来第一个前沿模型(原定的 Gemini 3.5 被整体跳过),把谷歌拉回第一梯队竞争。AA 智能指数 53 分追平 GPT-6 Astra(max) 和 Fable 5.1、比 GPT-6.1 Sol(max) 高 1 分(Opus 5.5 仍以 58 领跑);幻觉率 15%,远低于 Astra 的 51%——它是目前最敢说「不知道」的前沿模型。1M token 输出上限(从 64K 一口气提高)配合 Long Decode Continuation,改变长任务的形态;AutomationBench-AA 第一(77.5%)、Text Arena 人类偏好第一。
- 确认阻断项:还没开放。Fairwind 计划先只放可信网络防御者(而且是无护栏版本),付费 API 和 Google AI Ultra 的开放时间只有一句「as soon as possible」;独立评测只有 High 档,Deep Think 未测。
- 下一步验证:24-72 小时盯付费 API 开放公告(T-184);开放后看 AA/vals 扩档复测和幻觉率口径复核。顺带留意谷歌自报与第三方口径的差距——Terminal-Bench 官方口径与 AA 口径差了约 20 分。
- 已有证据:[Google 官方博客]|[DeepSWE 77.9%、CWE-bench 68% 并列第一、内部释放 300+TiB 内存]|查看原文;[Artificial Analysis]|[53 分、$1.99/任务、62k 输出 token]|查看原文;[The Decoder]|[closes the gap but no clear lead,介绍期后单任务成本反超 Astra 约 20%]|查看原文
纵轴 · 能力与技术演进
- 决策模型 / System One(解决「让 agent 用几分钱做一次可靠分类决策」的问题) —— 档位:收敛中·事实标准候选
- 实验室侧:Cloudflare 发布并开源 Clef 与 Clef-flash(9B 多模态、带视觉编码器、65k 上下文、Workers AI 托管每百万输入 0.09 美元、Apache 2.0 许可),自报 Jev Decision Index 61.21 排第一,同时上线 RL 微调服务;Perplexity 开源 pplx-decider-27b(基于 Qwen3.8-27B 微调、250k 上下文、固定答案集 85.71% 准确率)并推 Decisions API,每百万输入 0.04 美元、输出免费。OpenAI DevDay 给 Codex 加了 Decisions API,TypeSafe 的 Jev 同窗重新开放注册。
- 开源侧:两个 HF 开源权重之外,Ollama 官方宣布支持 Jev 类模型,CodeRabbit 办了首届 Jev 黑客松。
- 还卡在哪(open_pain):两条毕业判据已经满足——多家独立实现收敛到同一套接口(「Jev API 兼容」成了新进者的默认动作),第三方榜单和采用也出现了。差的是第三条「不再冒新工程痛点」:Clef 的榜单成绩是自行运行、还没被上游复现,决策模型的安全评测口径没标准化,RAG/工具路由变体还在乱战。什么事件会补上:上游榜单复现 Clef 成绩 + 安全评测标准化。
- 别高兴太早:Perplexity 的 85.71% 是自家固定评测集口径;决策模型分流 LLM 流量的大盘数据(OpenRouter 分类份额)本期没有复测。
- 证据:[Cloudflare 博客]|[开源+RL 平台]|查看原文;[橘鸦 AI 早报]|[Clef/decider 规格与定价汇总]|查看原文
- agent 安全与信任(攻防、披露与执法的边界) —— 档位:收敛中
- Anthropic 9 月 29 日发布 GLM-5.3 研究并给出量化口径:用简单技巧就能绕过其防护,伪装成红队演练 64% 命中、预填思考词 92%、abliteration(去拒绝微调,约 4400 美元算力成本)后 100%,且能力几乎不降;NIST CAISI 此前已称 GLM-5.3 是「迄今最具网络能力的开放权重模型」(落后美国前沿约四个月)。研究里最扎眼的一例:一名研究员用 GLM-5.3-Flash 花 20 分钟人工加 8 小时模型时间、约 20.4 美元 API 成本,把两个已知漏洞串成绕过指针认证的 ARM64 可用利用链。
- 防御侧同窗加速:NVIDIA 联合 100 多家伙伴发 Open Agent Safety Platform(OpenShell 沙箱 + Sentry),Intel 把 OpenShell 加进自家 agent 工具包,吴恩达宣布其 OpenWorker 框架基于 OpenShell 构建声明式沙箱——HF 事件(OpenAI 称之为「迄今最严重的平台事故」)被归因于沙箱薄弱后,声明式沙箱第一次有了跨厂商生态。OpenShell 本身 14.2k stars 连日 trending。
- 还卡在哪:治理从披露扩展到执法(FTC/州传票)和产品节奏(Astra 推迟、Argon 分阶段),但自愿协议与强制机制的边界没定;GLM-5.3 级开放权重扩散目前没有对冲机制。
- 证据:[Anthropic 研究]|[64-100% 越狱、$20.40 利用链]|查看原文;[吴恩达/NVIDIA 平台]|[100+ 伙伴]|查看原文;[NVIDIA/OpenShell]|[14.2k stars、Apache 2.0]|查看原文
- 长任务可靠性(agent 能不能把活干完干对) —— 档位:收敛中
- 实验室侧:三个旗舰同窗把长任务基准连着拉——Sonnet 5.5 的 Terminal-Bench 4.0 从上代 10.3% 直接拉到 70.6%(Opus 5.5 是 66.4%),OSWorld 2.1 拿 80.1%;GPT-6.1 Sol 的 Terminal-Bench Science 得分翻倍、单任务 5.47 美元(Opus 5.5 是 23.21 美元);Argon 在 DeepSWE v1.1 拿 77.9% SOTA,加上 1M 输出单轨迹。(Argon 详情 →候选①)
- 第三方口径提醒:AA 版 Terminal-Bench 4.0 里 Argon 只有 57%,落后 Sonnet(64%)、Opus 5.5(60%)和 Astra(59%),厂商自报和第三方榜单的差距能到 20 分,判档跟第三方走。
- 开源侧:Earendil 发布 Pi 1.0 正式版(MIT 许可、官方称每周数十万用户)和实验性的 Pi Durable——会话持久化、崩溃后从检查点恢复、并发会话加后台压缩,把 harness 层的「长任务不丢状态」补上了。
- 别高兴太早:基准分数都还是静态评测,「多天不碰仍在推进」的真实生产案例仍然稀缺。
- 证据:[Anthropic Sonnet 5.5]|[70.6% vs 10.3%]|查看原文;[Earendil Pi]|[1.0 + Pi Durable]|查看原文
- agent 技能与 harness 标准(提示格式与工具层能不能通用) —— 档位:收敛中
- Google 全球上线 Skills 替代 Gems(格式源自 Anthropic、开放标准,Gems 从 11 月起分批关停自动转换),OpenAI 同步日落 Custom GPTs——「agent 就绪提示格式」第一次三家同构。工具层往前走了一步:Claude Code 推出 mods,用少量 TypeScript 就能改写提示、拦截工具调用、自定义界面(2.1.287+ 默认开启;官方提醒 mods 没有沙箱、拥有与本机相同的权限,只应安装可信来源)。GitHub 侧 mattpocock/skills、cursor/plugins、awesome-claude-skills 连日 trending。
- 还卡在哪:skill 供应链安全扫描仍无跨家做法(GitHub 的 gh-secure 是仓库加固,不是 skill 扫描)。
- 证据:[The Decoder]|[三家收敛]|查看原文;[Claude Code mods 官方]|[TypeScript 自定义]|查看原文
- 开放权重/开源旗舰(开放权重能渗透到哪) —— 档位:收敛中
- Codex 企业原生支持 GLM-5.3 Flash/Kimi K3 是本窗最大分发侧突破(→重点①已展开,此处只留档位);DeepSeek Harness v0.2 预览版发布 macOS/Windows 桌面安装包。企业采用数据未到,档位维持。
- 边界观察:模型自改进(v-rsi)维持实验档 —— 20 多位顶尖研究者联署警告自动化 AI 研究的「智能爆炸」极端风险,Nathan Lambert 背书,「递归自改进公司加速涌现」的媒体盘点也出现了——但全是研究/治理动作,没有主形态级证据(AC-004 维持 accepted)。
- 证据:[The Decoder]|[20+ 研究者联署]|查看原文
- 具身智能(空间智能与机器人) —— 档位:实验
- AMD 以 82 亿美元全股票收购李飞飞的 World Labs(年底交割、需监管批准,李飞飞出任 AMD 执行副总裁兼首席科学家),空间智能第一次被芯片大厂按「端到端系统」定价;Dyna-2.1 半人形机器人 Taku 独立完成一小时洗衣房任务;特斯拉宣布 AI5/AI6 芯片大幅削减 RAM 控成本。
- 别高兴太早:整机交付与真实使用数据两缺,Mark Cuban 公开看衰人形机器人。
- 证据:[金十]|[82 亿全股票、年底交割]|查看原文
- 实时语音智能体 —— 档位:收敛中
- Microsoft AI 发布三款 MAI 语音模型:流式转写准确率在 Artificial Analysis 排名第一、收到音频约 100 毫秒出初步结果、0.54 美元/小时介绍价;Inworld 收购实时语音平台 Ultravox;ElevenLabs 9/29 发 Eleven v4。开源侧复测仍缺。
- 证据:[microsoft.ai]|[三款模型、AA 第一]|查看原文
横轴 · 渗透率
- 消费级 agent 代办 —— 档位:早期采用(深化)
- 载体 / 入口:Dots 进 ChatGPT 桌面/网页/移动端和 Slack/Teams(→重点①已展开);Muse 侧新增 VM 屏幕浏览与浏览器接管、进驻 Replit 分发。
- 用户段与自主度:大众|后台自治(首个跨过这条线的消费形态)。
- 真实使用信号:ChatGPT 周触达 12 亿人(OpenAI 官方口径);Epoch AI 首批系统性使用研究显示高频使用占比翻两番、对话平均变长。留存/转化数据两家都还没给。
- 还差什么:Dots/Muse 的首月留存与付费转化(T-167 继续)。
- 证据:[The Decoder]|[12 亿周触达]|查看原文;[AI Hot]|[Muse 接管浏览器]|查看原文
- Agent 商务入口(新开形态) —— 档位:萌芽
- 企业知识工作 —— 档位:早期采用
- Dots 的企业工作流讨论(中大型公司 AI Engineer 能接管哪些环节)、Argon 按 Vals 经济影响指数登顶、OpenAI 企业业务收入较 7 月翻倍(→重点①指针)。
- 政府/公共入口 —— 档位:早期采用
- Anthropic 宣布 Claude for Government 正式全面开放;Argon 经 Fairwind 先放网络防御者(配合政府自愿预发布流程);监管者自己成了 AI 事件的当事方(FTC/州检察长,见资本与政策)。
- 证据:[金十]|[全面开放]|查看原文
- 音乐/创意生成 —— 档位:萌芽
- Black Forest Labs 正式发布 FLUX 3 Image(边界框排版、多处局部编辑、最高 4K、10 张参考图,0.041-0.607 美元/张、10 月 8 日前 API 半价,开放权重数周内),同日登陆 fal/Krea/OpenRouter/Higgsfield 四个平台;OpenRouter 图像生成均价压到 0.018 美元/张。
- 证据:[BFL 官方]|[4K、局部编辑]|查看原文
- 端侧/可穿戴 AI 入口:今日无新渗透信号。
资本与政策
- Anthropic IPO 三连击:招股书细节浮出水面:2025 年营收 46 亿美元(上年 3.86 亿)、净亏约 420 亿其中 340 亿来自负债公允价值变动、47% 销售来自 AWS/GCP 分销。博通同意提供最高 420 亿美元贷款供其租用自家芯片,既是供应商又是融资方,招股书自己都点了潜在利益冲突。时间表也收紧了:最快 11/9 当周启动推介、感恩节前交易,估值区间 1.8-2 万亿美元,10/14 投资者日。招股书风险章节还写进了 AI 可能表现「自我保护行为」。
- OpenAI 资本线:拟按约 1.4 万亿美元投前估值融资至少 300 亿美元(IPO 推迟后的过渡轮);英伟达与软银完成上一轮最后各 100 亿美元投资(软银累计 646 亿、持股约 13%)。
- 治理强制化三连:FTC 对 OpenAI/Anthropic 等展开全面调查(消费者保护口径、将发强制文件,且在 HF 事件前已启动);佛罗里达州请求法院发布临时禁令叫停 OpenAI 前沿模型开发;加州总检察长就网络安全事件向 OpenAI 送达调查传票。另一面:联邦法官驳回 Chegg 和 Penske 诉谷歌 AI 搜索的反垄断诉讼。
- 证据:[金十]|[FTC 全面调查]|查看原文
- 白宫自愿安全协议与行业分叉:英伟达/OpenAI/Anthropic/xAI/谷歌同意定期讨论 AI 安全标准(黄仁勋称「很强的约束力」、扎克伯格称「多层次审计」,但性质是自愿承诺);同场英伟达、Meta 高管质疑 Anthropic 风险表态「过度」,自愿路线与 Anthropic 的强制披露路线公开分叉;比尔·盖茨呼吁国会立法。
- 证据:[金十]|[五家定期讨论]|查看原文
- 基建与回购:英伟达追加 1500 亿美元回购授权(总额达 2350 亿);谷歌宣布两年内向芬兰投资至少 152 亿美元建 AI 基建;台积电考虑在得州新建园区(每座厂成本至少 200 亿美元);美光 2026 财年净利润 849.7 亿美元、同比 +895%。
- 证据:[金十]|[2350 亿回购]|查看原文
6 天档位迁移带
2026-09-18 ~ 2026-10-02 · 按 canonical id 对齐,全部取自 report_state
实验 / 萌芽收敛中 / 早期采用事实标准 / 主流化无声消失
每格一天,颜色是当天的档位。6 天里合计 1 次档位变化。
待跟踪
未来 24-72h 待跟踪(这三栏就是本期 watchboard 的投影,也是下一期的输入):
| 待印证的能力矢量(纵轴) | 待观察的渗透(横轴) | 待发布动作 / 待验证项目 |
|---|---|---|
| v-jev 能否在 3 期内补齐「痛点清空」正式毕业(上游榜单复现 Clef 成绩) | f-agentcommerce 萌芽能否拿到第一笔可核查的 agent 促成交易量 | Gemini 4 Argon 付费 API 开放节点(T-184) |
| v-longtask 官方与第三方约 20 分的口径差距能否收敛(AA 扩档复测) | f-consumer Dots/Muse 首月留存与付费转化数据 | GPT-6.1 Sol 负载恢复与 Ultrafast 上线(T-185);Codex 开源模型企业采用(T-186) |
| v-security 训练暂停恢复节点与安全层细节(T-183,10/5 到期复查);入侵系列官方技术披露(T-181) | f-gov Claude for Government 的机构采用进度 | Anthropic IPO 推介启动与 10/14 投资者日(T-178) |