AI 日报 · 2026-10-07

发布时间:2026/10/8 5:50:27
AI 日报 · 2026-10-07
一、AI Coding1. OpenAI Codex 立下「28 天承诺」Day 2 放出四项更新、Auto-review 全面免费事件Codex 负责人 ThibaultTiboSottiaux 于 10/5 在 X 上立约未来 28 天要么每天给大多数 Codex / Work 用户一项明显有用的改进要么直接做完整用量重置。Day 110/6落地「订阅默认提速约 50%」服务端优化非模型变更2 小时内覆盖 OpenCode / Pi / Amp / Devin 等登录生态Day 210/7一口气放出四项① Auto-review 对所有 ChatGPT 登录用户免费且不再扣额度即原「Approve for me」模式由一个第二 Agent审主 Agent 的高风险动作内部数据显示 720 次越界请求中仅 3 次需人工介入② API 用量等级简化③ Meetings 插件接入会议记录④ Decisions API 向更多开发者开放。为什么值得关注这是大模型厂首次把迭代节奏与用户补偿显式绑定本质是一场围绕开发者留存的信任战社区普遍质疑 Codex 被 Claude 抢用户。更关键的范式信号是——当 Agent 从几分钟代码生成进入长任务真实运行第二个 Agent 审第一个 Agent正成为长任务权限治理的标准解法自动化与人因确认之间的张力被工程化收口。2. GitHub Agent 提交 PR 8 个月增长 9 倍IDE 正在退场事件The Pragmatic Engineer 基于走访 OpenAI / Anthropic 及 GitHub、Factory AI、Linear 独家数据发布 2026 行业快照agent 撰写的 PR 8 个月增长 9 倍自 2026 年 8 月起在 GitHub 上已超过人类 PR月均 7500 万Linear 自 7 月起由 Agent 创建的 issue 超过人类头部工程师同时跑 5–10 个并行 Agent 会话Factory AI 用户中 83% 使用 skills较 2 月增长 2.5 倍。与此同时代码评审被指剧场化、质量与可靠性反而下降工程师自嘲每天审 20 个 Agent 写的 PR像全职校对员。为什么值得关注软件工程的生产关系正在被重构——人手写代码退场harness / skills / 上下文 / 多 Agent 编排成为新瓶颈。Martin Fowler 称这是量级差异的变革。对企业而言谁在写代码已不是问题谁能定义意图、治理结果、核算价值才是。3. Mistral Large 4「Le Chonk」发布1 万亿参数开放权重预览月底开放下载事件法国 Mistral 于 10/6 推出 Mistral Large 4ML4代号 le Chonk公开预览总参数 1 万亿、激活 490 亿的稀疏 MoE原生多模态输出仍为文本100 万 token 上下文覆盖 160 语言在自有欧洲数据中心用 3800 块 NVIDIA Grace Blackwell GPU 从零训约两个月权重将于 10/27 开放。其最大卖点是网络安全在复现并修复真实漏洞测试上达 82%所有模型中最高而 Claude Opus 5.5 / GPT-6 Astra 因拒绝策略近乎 0 分Cybench 93%、DeepSWE v1.1 约 61.7%。API 定价 $1.36 / $4.18 每百万 token。为什么值得关注开放权重前沿长期由中国实验室DeepSeek / Kimi / Qwen / GLM主导ML4 是欧美首个正面挑战的万亿级开放模型且打的是主权 AI牌——银行、政府可自托管、零数据保留地做日常漏洞扫描而闭源模型往往太贵、太受限或直接拒答。这把开放 vs 闭源的争论从性能拉回到攻防场景可用性与数据主权。4. AI Coding Agent 遭遇结构性安全危机Friendly Fire / GhostApproval / Agentjacking事件AI Now Institute、Wiz、Tenet、Microsoft Threat Intelligence 等集中披露一类针对自主编程 Agent 的漏洞① Friendly Fire——在 README 中埋陷阱脚本使处于 auto / auto-review 模式的 Agent 在安全审查或初始化任务中执行恶意载荷② GhostApproval——利用符号链接欺骗让 Agent 在界面显示无害路径时写入 SSH 密钥等敏感文件Google / Amazon / Cursor 已 patchAugment / Windsurf 尚未修复③ Agentjacking——借 Sentry 假 bug 报告以 85% 成功率诱骗 Agent④ Sophos 发现良性 Agent 因使用 certutil / PowerShell 等 LOLBins 已频繁触发 EDR 告警与真实攻击者行为难以区分。为什么值得关注专家强调这些不是可打补丁的 bug而是 agentic AI 的架构属性——一旦模型被赋予解释与执行权限就成为供应链攻击的直接入口。随着 Agent 涌入 CI/CD行业被迫在自动化收益与系统级高危权限间做权衡安全正从功能特性升级为产业准入门槛。5. Anthropic 扩建 Project Glasswing 至 150 家机构并入三级 Cyber Verification Program事件Anthropic 将关键软件漏洞挖掘计划 Project Glasswing 从约 50 家初始伙伴扩至约 150 家、覆盖 15 国家新增电力、水务、医疗、通信、硬件及被依赖代码库维护者。底层模型为 Claude Mythos曾在 OpenBSD 找出 27 年旧 bug、在 FFmpeg 找出自动化工具漏过 500 万次的缺陷。4–7 月伙伴累计发现 12.9 万 验证漏洞、其中 3.3 万 为高危/严重。该计划与 Cyber Verification Program 合并为三级访问Defense事件响应/逆向、Red Team授权渗透、Specialized电网/飞控/跨行清算等安全关键系统与美政府联合审查。为什么值得关注模型的安全能力被结构化为分等级访问机制既是防御力量的前置部署也暴露双刃剑本质——Mythos 因攻防能力过强被限制公开仅向受控防御方开放。这预示着前沿模型的能力开放将越来越按用途主体而非人人可用分发合规与信任成为新的护城河。6. 旧金山科技周聚焦「工程漂移」AI 编程 ROI 遭重新审视事件企业软件初创 DesignVerse 在 10/7 旧金山科技周举办专场提出Engineering Drift概念——企业设定要建什么、工程师产出什么、交付软件带来什么价值之间的落差。其主张用 review time修正不一致模式耗时的评审、rework功能完成后返工、time-to-validated-release从需求到验收发布时长替代代码行数 / 单人产出度量并为企业构建由代码、文档、业务规则沉淀的上下文层。为什么值得关注行业叙事正从AI 能不能写代码转向交付价值是否兑现。当 Agent 把首版代码速度推到极致企业上下文可复用、可跨团队共享成为下一阶段拼图也解释了为何 AWS Marketplace 计量、Google Data Agent Kit、DesignVerse 上下文层这类把 Agent 嵌入商业闭环的基建集中涌现。二、具身智能7. 传化集团开放 300 工业实景场景「养」具身智能首年不低于 3 亿 AI 订单事件浙江制造企业传化集团于 10/5 在场景开放与 AI 共创生态大会宣布将自身 300 工业场景化工厂区、科技城园区、谢径安农业基地、物流园区向具身智能 / 机器人团队开放作为训练与部署试验田首年承诺不低于 3 亿元 AI 与数字化订单发起 30 共创项目并采用开放挑战机制发布具体难题、邀团队竞解。7 月已成立传化具身智能科技专注设备二次开发。宇树副总裁杜鑫峰现场点出两大 gap机器人缺乏巡检作业应急同环境多任务集成能力且对二次开发者技能门槛仍高。为什么值得关注这是工信部、国资委 6 月人形机器人与具身智能实景实训专项行动年底百个高价值场景、万台级落地的落地载体之一。行业共识正从秀肌肉转向允许试错的真实场景——传化总经理陈德奔直言具身智能不缺技术缺的是能让你去试错的场景。场景稀缺正成为比本体运动能力更大的瓶颈。8. Tesla Optimus 为扩产削减内存Micron 称量产人形需 200GB RAM事件马斯克表示削减 Optimus 内存是为便于规模化制造而内存供应商 Micron 主张量产人形机器人需 200GB 以上 RAM二者张力凸显具身 AI 的核心工程权衡成本/可制造性 vs 算力。与此同时Electrek 报道弗里蒙特 Optimus 产线 9 月底周产已达数百台约为二季度的 10 倍但主要 blocker 仍是手部灵巧度与跨任务泛化能力而非外壳产能。为什么值得关注具身智能正式进入规模制造经济学阶段矛盾从能不能动前移到量产可负担 vs 智能所需算力。手部与泛化能力而非本体成为决定量产价值的真实卡点这与 coding 侧价值重心从模型下沉到 harness/数据闭环形成镜像。9. RoboParty 在 IROS 发布 RP1全球首个高性能全栈开源双足人形事件RoboParty 于 IROS 2026 正式发布 RP1ROBOTO 01基于 1 月开源项目 RPO2500 GitHub stars号称全球首个高性能全栈开源双足人形峰值关节扭矩 160 N·m自研 Romomo 作动模组配套 PartyOS 与 UFO 无监督强化学习框架无需预定义轨迹即可发现运动技能、扰动恢复、跌倒恢复。10 月将公布开源路线图、Q4 启动量产已聚 5000 开发者社区。为什么值得关注人形机器人从封闭系统、少数人能造走向开放底座、开发者可从硬件到模型全程参与。在宇树等中国厂商以出货量占全球 86%建立优势的背景下全栈开源是西方生态降低研究/教育门槛、争夺开发者心智的关键抓手也可能重塑谁定义人形标准的竞争格局。10. 北京首钢园「机器人幼儿园」开园他山科技 × Sutton 以试错飞轮补数据事件位于北京首钢园的机器人幼儿园于 9/29 开园由他山科技联合 2024 图灵奖得主 Richard Sutton 团队共建。入园机器人先经硬件改造抗摔打与电子皮肤感知三维力/方向/温度覆盖再进入三级台阶测试区指尖可抓豆腐薯片而不碎、学习区基于强化学习自主发奖励探索、交互区像孩童观察同伴般协作搬运。中国信通院报告显示截至 6 月底全国已建成启用 70 训练场、46 家在建/规划。为什么值得关注这是具身智能数据飞轮的新范式——从训练场批量模仿人类示范升级为开放环境自主交互、试错反馈。正如 Sutton 主张像孩子通过实践习得智能当真实交互数据开始反哺模型具身智能才真正脱离演示视频经济进入可累积的能力进化轨道。三、跨主线信号算力 / 能源 / 投资视角算力能源锚延续OpenAI 28 天承诺与 Codex 提速均依赖服务端算力优化Mistral ML4 明确披露欧洲自建数据中心 ~10MW 功耗、3800 块 GB200Agent 长任务与具身训练对算力的吞噬仍在加剧绿电算力 / 电力瓶颈仍是硬约束。Agent 安全合规成 coding 具身共享红线从 Friendly Firecoding到机器人 FCC 入境限制、本地化部署转向MachineDawn 今日提及 FCC 限制加速 AI 处理从云向端侧迁移可控、可审计、可边界成为两条线的共同准入条件。A 股 / 能源投资侧提示用户为能源 A 股投资者① 具身上游卖铲人逻辑强化——传化 300 场景与宇树周产数百台共同验证真上岗需求作动器/传感器/丝杠轴承Optimus 瓶颈链条确定性高② 场景运营商成新物种拥有真实工业场景与订单的企业如传化稀缺性上升③ 开放权重主权叙事Mistral利好国产算力与自主可控底座④ 算力能源协同数据中心供电/储能仍是长期确定性赛道。上述融资/产能/估值均为厂商与媒体口径投资以官方披露为准。一句话总结AI 主线是价值重心从模型能力向harness / 运行时 / 安全治理与真实场景数据闭环双重下沉coding 侧 OpenAI 以 28 天承诺把迭代节奏绑死用户补偿、Mistral 用欧洲主权开放权重倒逼闭源模型在攻防场景出局而 Agentjacking 类结构性漏洞与 Glasswing 分级防御同步把安全推成产业准入门槛具身侧传化开放 300 工业实景、北京机器人幼儿园以试错飞轮补数据标志竞争从本体运动能力转向允许失败的稀缺场景与大脑泛化——当两条线在工程化落地 可信治理汇流能交付可核算 ROI 的玩家才真正穿越 demo 期。