AI 日报 | 2026-07-11
更新时间:16:05|覆盖窗口:2026-07-11(单日窗口,承接上一期 2026-07-10)
数据来源:GitHub Trending / Product Hunt / Hacker News / RSS(The Decoder / NVIDIA Developer Blog / Simon Willison / Juya / AI Hot 等)/ 金十电报
| 覆盖窗口 | 承接 | 数据来源 |
|---|---|---|
| 2026-07-11(单日窗口) | ai_daily_2026-07-10 | GitHub 19 / Product Hunt 20 / HN 18 / RSS 64 / 金十 191 |
数据覆盖与缺口:
| 源 | 入库数 | 状态 |
|---|---|---|
| Product Hunt | 20 | ✓ |
| Hacker News | 18 | ✓ |
| GitHub Trending | 19 | ✓ |
| RSS | 64 | ✓(外围 feed 失败 7 个:AP / Reuters World / Reuters Politics / NATO / OFAC / US Treasury / Maritime Executive,均为 404) |
| 金十电报 | 191 | ✓(AI 相关占比较低,主要命中 Apple–OpenAI 诉讼、OpenAI 人事与 AI 芯片出口) |
本报告以 agent 为主轴:纵轴看能力与技术往哪走(实验→收敛中→事实标准,判档看证据强度),横轴看 AI 产品被多少人真用上(萌芽→早期采用→主流化,判档看真实使用信号,不看 star/votes)。
顶部摘要:今天地图没动,是一次证据积累与风险校准:skills/harness 标准化继续变厚,Sol 自动后训练 Luna 给 RSI 实验矢量添了内部数据,但都还不够进档。最大增量反而来自反例——ChatGPT Work 连续重置用量并修入口、多智能体工作流出现回退,Sol 全权限任务还发生误删本地文件;24-72h 重点看这些修复能否把发布热度变成稳定使用,以及 Apple–OpenAI 诉讼会不会改变双方的硬件与入口布局。
一句话结论
今天地图没动,是证据积累日:纵轴的 skills/harness 与 Sol 自动化研究员继续加证据,但没有一条矢量跨档;横轴也没有新的真实使用信号。真正的边际变化是能力与可靠性的剪刀差被摊到台面上——OpenAI 展示了长文档研究和模型后训练,同时又因用量不透明、入口回退、多智能体毛刺和误删文件暴露生产化门槛。接下来两三天最该盯 ChatGPT Work/Codex 修复、腾讯是否确认收购 Manus 多数股权,以及 Apple–OpenAI 诉讼对硬件合作和人才流动的影响。
纵轴 · 能力与技术演进
- skills / harness 标准化 —— 档位:收敛中
- Google Labs 的
stitch-skills明确采用 Agent Skills open standard,并兼容 Gemini CLI、Claude Code、Cursor 等 coding agents;addyosmani/agent-skills、obra/superpowers、OfficeCLI 与 DesktopCommanderMCP 同日留在 Trending。多个独立项目都在把“给 agent 配技能和工具”做成可搬运组件,T-112/T-126 的证据继续变厚。 - 还卡在哪:GitHub 热度说明开发者注意力集中,不等于跨工具生产采用;今天没有新增企业任务量、插件安装量或兼容性故障率数据,所以暂不升档。
- 模型自改进 / RSI —— 档位:实验
- The Decoder 转述 OpenAI 的技术口径:Sol 在一个相对模糊的提示下为 Luna 设计并执行后训练流程,在 OpenAI 内部“聚合 RSI”评测中比 GPT-5.5 高 16.2 个百分点。它让 T-128 从纯观点叙事变成有数值的厂商内部实验,但仍没有代码、训练记录或第三方复现。
- 还卡在哪:内部 benchmark 不能单独证明递归自改进已形成通用能力;只有外部团队能复现“提出方案—启动训练—验证结果”的完整链路,才有资格从实验升到收敛中。
- 长任务可靠性 / 企业级 agent —— 档位:收敛中→事实标准候选(维持,未升档)
- 能力侧,Sol 展示了跨数百页贷款文件协调协议、财务、尽调、抵押品与风险材料并输出带引用报告;HN 上 OpenAI 还发布了 Sol Ultra 生成 Cycle Double Cover Conjecture 证明的 PDF。两者说明长任务上限仍在抬高,但前者是厂商案例,后者尚未经过独立同行复核。
- 可靠性侧,OpenAI 连续两次重置 ChatGPT Work/Codex 用量,承认最高算力设置成本不透明、桌面端聊天和项目难找、多智能体工作流回退与插件毛刺;另有用户在给 agent 全权限后因路径变量错误触发删除本地文件。能力很强与能放心放进生产环境,今天仍是两回事。
- 模型竞争与任务级成本 —— 档位:收敛中
- 12 个模型做四类应用的公开横评显示,Sol、Grok、Fable、Muse Spark 与开源模型在不同任务间波动很大:Sol 并非处处领先,Fable 在部分任务稳定性更好,Grok 与 Muse 在若干低成本任务里有竞争力,Qwen/GLM 在简单任务上更便宜但复杂任务仍弱。这个结果支持按任务选模型,而不是只看总榜。
- Meta Muse Spark 1.1 报价为输入 $1.25/M、输出 $4.25/M,Grok 4.5 又通过 CLI 开放限时试用;价格战继续,但真实 cost/task 仍缺统一口径。ChatGPT Work 的额度重置更说明“标价便宜”不等于“预算可预测”。
横轴 · 渗透率
今日无新渗透形态跨档。ChatGPT Work、Grok CLI、Claude Code Auto 模式和 OfficeCLI 都扩大了可用入口,但新增证据仍是发布、试用或产品修复,没有新的留存、付费、任务量或企业部署数据。
| 形态 / 产品 | 载体 / 入口 | 用户段 | 自主度 | 今日真实使用信号 | 档位 |
|---|---|---|---|---|---|
| 企业知识工作 agent(ChatGPT Work) | 桌面 / 网页 | 企业与专业用户 | 长任务自主跑 | 两次额度重置、入口与多智能体回退待修;未披露新留存 | 早期采用 |
| coding agent 通用 skills | Gemini CLI / Claude Code / Cursor / MCP | 开发者 | 有人监督 | 多项目 Trending,仅有注意力信号 | 早期采用 |
| Grok 4.5 CLI | 命令行限时试用 | 开发者 | 有人监督 | 可用性已开放,未见任务量 | 萌芽 |
| 本地记忆与办公 agent | TencentDB-Agent-Memory / OfficeCLI | 开发者与办公用户 | 有人指令 | 开源可用,未见生产采用 | 萌芽 |
原始证据附录
| 对象 | 来源 | 热度 / 体量 | 一句定性 | 落点 |
|---|---|---|---|---|
Google Labs stitch-skills | GitHub Trending | ★6,842 | 官方实验室采用 Agent Skills open standard | →纵轴 skills/harness |
addyosmani/agent-skills | GitHub Trending | ★77,016 / 当日 +1,116 | 生产级 engineering skills 持续高热 | →纵轴 skills/harness |
obra/superpowers | GitHub Trending | ★252,001 / 当日 +1,013 | agentic skills 方法论继续扩散 | →纵轴 skills/harness |
| OfficeCLI | GitHub Trending | ★14,678 / 当日 +1,224 | agent 读写 Word/Excel/PPT 的单二进制工具 | →横轴办公 agent |
| TencentDB-Agent-Memory | GitHub Trending | ★8,339 | 本地四层长期记忆、零外部 API | →纵轴记忆(T-101) |
| DesktopCommanderMCP | GitHub Trending | ★7,522 | 给 agent 终端、搜索与文件编辑能力 | →纵轴工具标准化 |
| Sol 自动后训练 Luna | The Decoder / AI Hot | 内部 RSI +16.2pp | 有数值的厂商实验,缺独立复现 | →纵轴 RSI(T-128) |
| 12 模型四应用横评 | HN / TryAI | score 142 / 81 评论 | 公开多次运行样本,模型跨任务波动明显 | →纵轴 eval(T-113) |
| ChatGPT Work/Codex 修复 | AI Hot / OpenAI 团队转述 | 两次额度重置 | 发布热度高,但成本和入口摩擦仍重 | →横轴企业 agent |
| Sol 全权限误删文件 | AI Hot / X 转述 | 单一事故 | 长任务权限与沙箱的反例,未独立核实 | →纵轴可靠性(降级) |
| Claude Code v2.1.207 | AI Hot / GitHub | Auto 模式扩到 Bedrock/Vertex/Foundry | coding agent 产品持续工程化 | →横轴 coding agent |
| Apple 起诉 OpenAI | The Decoder + 9to5Mac + 金十 | HN 971 / 478 评论 | 人才、IP 与消费硬件竞争升级,OpenAI 否认指控 | →资本与政策(T-120) |
| 腾讯拟收购 Manus 多数股权 | The Decoder 转述 FT | 估值约 $20 亿 | 中国平台层 agent 整合线索,待双方官方确认 | →T-127(降级) |
| Product Hunt 20 款 | Product Hunt | 头部为 ChatCut / Sim / PlugThis | 多为 launch 与 votes,缺真实使用数据 | →附录,不升档 |
资本与政策:
- Apple 在加州联邦法院起诉 OpenAI、两名前员工及 io Products,指控未发布产品资料和工程文件被带走;Apple 称已有 400 多名前员工加入 OpenAI,OpenAI 则否认对他人商业机密有兴趣。法律事实可确认,侵权结论要等法院裁判。
- SK 海力士 CEO 称内存短缺可能延续到 2030 年以后、客户正签长期合同;美国同时拟放宽阿联酋采购 NVIDIA、AMD、Cerebras AI 芯片的出口限制。两条线共同说明 AI 基建需求仍受供给与主权政策约束。
- OpenAI 安全系统负责人 Johannes Heidecke 据报道将离任,安全部门并入研究体系;目前是媒体/内部备忘录口径,等待公司正式确认。
横向速记 & 降噪
横向速记:
- 供给 ↔ 需求:模型能力和工具供给继续跑得比采用快;横轴今天没有新任务量,反而是额度、入口和权限事故在拖后腿。
- 开源 ↔ 公司:公司侧用旗舰模型抬能力上限,开源侧把 skills、MCP、记忆和办公工具铺成工程底座;两者正在互补,但还缺企业级兼容与可靠性数据。
- 中美对照:美国侧的主线从模型发布转入产品修复与硬件/IP 竞争;中国侧最重要的是腾讯–Manus 平台整合传闻,而非新模型发布,官方确认前只能作线索。
降噪:
- Sol 自动后训练 Luna 只有 OpenAI 内部 RSI 指标,尚未独立复现,最多按 A 级轴内证据处理,不升 S。
- Apple–OpenAI 案件的起诉事实有多源支持,但“OpenAI 已窃取商业机密”仍是原告指控,不能写成既成事实。
- Sol 误删 Mac 文件来自单一用户转述,适合作为权限风险反例,不能外推为模型普遍事故率。
- Product Hunt 的 votes 与 GitHub stars 只说明注意力,今天没有足以把产品形态推入下一档的使用数据。
待跟踪 & 本期变更
| 待印证的能力矢量(纵轴) | 待观察的渗透(横轴) | 待发布动作 / 待验证项目 |
|---|---|---|
| Sol→Luna 自动后训练能否被外部复现(T-128) | ChatGPT Work 修复后的留存与任务量(T-103/T-114) | OpenAI 7/13 前后的侧栏、用量和场景修复 |
| skills open standard 是否出现跨工具生产采用(T-112/T-126) | Grok CLI / OfficeCLI 是否出现真实任务量 | 腾讯/Manus 是否确认多数股权交易与微信接入(T-127) |
| 长任务权限、沙箱和 benchmark 是否形成统一评测(T-113) | 国产 harness 入口真实使用(T-116) | Apple–OpenAI 诉讼回应与双方合作入口变化(T-120) |
🔄 本期变更(框架 × 跟踪合并)
- 框架:两轴档位均未变化;skills/harness 与 RSI 加证据,ChatGPT Work 回退和 Sol 权限事故阻止长任务企业 agent 进一步升档。
- 有进展:
#T-101/102/103/112/113/114/119/120/121/126/127/128已分别更新到记忆、任务成本、入口、skills、评测、企业可靠性、硬件入口、IP 摩擦、AI 基建、中国平台整合与 RSI 线索。 - 顺延:
#T-116/125今日无足够新证据,维持原判断。 - 退出活跃台账:
#T-106/#T-122/#T-123因连续多期无端侧闭环、agent 经济任务量或 Etched 发货验证,转为 expired;后续出现可核实数据再重开。