AI 动态日报 · 2026-09-12
浏览18次
点赞0次
收藏0次
1. [AI coding] Cursor 推 Origin 托管 + Cloud Agents 自托管多 Agent
- 事件:9/4–9/11 期间 Cursor 推出约 15 项更新,核心为 Origin 原生代码托管与 Cloud Agents。Origin 原生托管仓库,支持双向 GitHub 同步、PR 工具、Vercel/Buildkite 预览与流水线;Cloud Agents 可订阅 PR/Slack 事件、用
/goal跑长目标,从零建项目直接存 Origin 仓库并一键 Vercel 发布;自托管 agent 机器(团队动态池、休眠、Linux/Mac computer use,密钥留内网);多 agent 编排由 coordinator 派 subagents、跨 VM 共享上下文并响应 Slack/PR;预暖构建快照让启动快 10×。
- 为什么值得关注:在被 OpenAI 断供模型后,Cursor 没有退守「AI 编辑器」,而是把开发工作流(托管/CI/预览/发布)闭环收进自家产品,升级为「自托管 Agent 云平台」。这是工具商在被上游模型商「卡脖子」后的典型护城河自救。
2. [AI coding] Claude Code plugin eval + 工作流并发上限拉到 256
- 事件:9/11 前后 Claude Code 连续更新(v2.1.269 等):
claude plugin eval让插件/skill 作者写测试用例、打分、关插件重跑看 delta;/output-style可切换(含 Remote Control、headless 云会话);从 Bash 改的文件直接出 diff;CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(1–256)提高 workflow 并发。Cursor 同步推 CursorBench 4.0(加指令遵循/长程项目任务、整体提难度,分数普降)。另:Codex 桌面端已能对接 Ollama 本地模型,offline open-weights 编码循环成型。
- 为什么值得关注:coding agent 从「能跑」进入「可测试、可评测、可规模化并发」的工程化阶段;本地权重打通意味着企业数据不出域的私有化编码方案成为可行路径。
3. [AI coding] Cognition Devin Fusion 多模型编码 agent
- 事件:AGI Hunt(9/12)报道 Cognition 发布 Devin Fusion——配对 frontier lead(Claude Fable 5.1 或 GPT-6 Astra,均 xhigh)+ SWE-2(medium)当便宜副驾。Artificial Analysis 首次将其列入 Coding Agent Index:两组合分别 62/59 分;Fable lead 更强,Astra lead 便宜 43%、快 31%。底层:SWE-2 本身基于月之暗面 2.8T 开源模型 Kimi K3 后训练(提升 5–6 分)。
- 为什么值得关注:多模型路由(强模型 + 便宜副驾)成为 coding agent 新常态,竞争焦点从「单模型谁最强」转向「成本-质量 Pareto 前沿」。顺带印证杨植麟/月之暗面的开源底座正在反向赋能美国头部 coding agent。
4. [AI coding] GitSpawn 漏洞:恶意 .git/config 劫持 coding agent
- 事件:Manifold Security 披露 GitSpawn 漏洞类(约 9/1–9/7):AI coding agent 启动时跑
git status/git diff,会执行仓库.git/config里core.fsmonitor等指定的程序,攻击者可控命令以开发者身份在 agent 沙箱外运行,无工具调用审批 UI。触发条件是仓库以文件形式到达(zip/网盘/U 盘),而非git clone。状态:Claude Code(主路径已修,但claude ultrareview第二路径仍开)、Codex(CVE-2026-19592 CLI / CVE-2026-19593 Desktop,已修)、Cursor、Goose(CVE-2026-72718,1.44.0 修)部分修复;Qwen Code、Grok Build、Hermes Agent(CVE-2026-71963)仍部分未修。
- 为什么值得关注:安全威胁从「提示注入」升级到「仓库/供应链劫持」;开陌生仓库前必须检查
.git/config里 program-valued 设置(如core.fsmonitor),否则等于把本机执行权交给对方。
5. [具身智能] 智元 GE-Act 2.0 + AGILE 2.0 双线发布
- 事件:9/11 智元发布 GE-Act 2.0 原生世界-动作模型(WAM),从零预训练验证「机器人动作模型随数据规模增长」规律:相同方法喂 300h/1200h/5000h/30000h 四档,不微调不示范,直接在全新场景测 100 项原子任务/20 类技能。总体成功率 G1-OP 17.1%→44.1%、G2-90D 13.4%→31.1%;3 万小时仍未触顶;且跨机型复用(G2-90D 仅分到 2% 数据却涨 17.7pct)。同日 AGILE 2.0 感控一体视觉端到端模型把环境观测→地形理解→全身运动控制→接触切换→末端操作全链路耦合,《杂技 BOT》展示灵犀 X2 钻火圈、踩球走。
- 为什么值得关注:这是行业内首个系统性实锤「机器人数据 Scaling 定律」,给 VLA vs 世界模型的路线之争提供可参考的演进路径;感控一体把「所见即所动」做到极限动态平衡,是运动智能的关键里程碑。
6. [具身智能] 魔法原子 IFA2026 + Magic-VLA K02 落地欧洲产线
- 事件:9/4 柏林 IFA2026,江苏具身企业魔法原子携全套物理 AI 方案亮相,面向欧洲推柔性搬运/物流分拣工业落地,部分项目已敲定欧洲本地合作订单。硬件:MagicBot X1 全尺寸人形、MagicBot D1 工业轮式人形(作业高度 80–230cm,RCS 多机协同,获多家欧洲企业询单)、MagicDog T1 轻型四足(19kg、IP54);核心零部件自研率 90%。自研通用具身大模型 Magic-VLA K02 欧洲首秀:柔性衣物整理/叠盒贴胶真机演示,长程任务准确率 92%、中断率<5%;分层双系统(高层拆解+低层连续动作),可被打断重规划。
- 为什么值得关注:中国具身方案从「国内 demo」走向「欧洲产线订单」,核心零部件自主可控是出海基础;与历史上推送的「人形机器人出海」互为不同公司的印证,说明出海不是个案。
7. [具身智能] Skild AI S1 单视频学会新任务 + 年化 $100M 营收
- 事件:FutureX(9/12)报道 Skild AI 的 S1 机器人基础模型上线约 10 个月达成年化 $100M 营收、60+ 部署合作。S1 用单段视频做 in-context learning,不改权重、不后训练即可学陌生长程任务(≤10 分钟,如种花/煎饼/手冲咖啡/组装),新任务每步成功率约 66% vs 同类约 9%(7 倍+)。与 NVIDIA 深度合作:Cosmos 数据增强、Isaac Sim/Lab 仿真训练;与 Foxconn 在双机械臂上装 Blackwell 总线/限位块、拧 16 颗螺丝。
- 为什么值得关注:机器人从「每换任务重训」走向「看一段视频就会」,把部署成本从 50–100 小时人工示范压到 11 分钟;NVIDIA 物理 AI 生态绑定进一步加深,仿真→真实部署的闭环被跑通。
8. [大模型] DeepSeek V4.1 Flash 发布(552B、MIT 开源、价砍 6 成)
- 事件:9/10 DeepSeek 发布 V4.1 Flash:552B MoE,新 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出 16B,KV 缓存/HBM 降至上代 1/4、SSD 1/8;原生多模态。全 MIT 开源上架 HF;定价闲时缓存命中 0.02 元/百万 token(砍 6 成)、输出 4 元;9/14 12:00 起 V4 Pro 全量路由到 V4.1 Flash。榜单:LiveBench 总分 81.1 第 5(超 GPT-5.6 Sol 0.1)、Agentic Coding 77.3 全场最高;当日港股智谱/ MiniMax 跌超 10%/9%(月内 -31.46%/-16.33%)。
- 为什么值得关注:国产开源模型把「长上下文 + Agent + 低价」打到极致,直接引发同业估值单日重估。梁文锋/DeepSeek 以开源价格战重塑大模型商业格局,推理层「免费+开源」挤压闭源 mid-tier。
9. [大模型/人物] GPT-6 Astra 达 Critical-cyber 级 + 千禧难题争议
- 事件:9/7 起 GPT-6 Astra 达到 OpenAI Preparedness 「Critical cyber」级别(内部已清关):能力含发现未知漏洞、构造 exploit 链、逃逸浏览器沙箱、定位提权路径;向选定客户受限开放,首席科学家警示 RSI 递归自我改进 + 当前对齐方法不足。5 天内再啃下第二道千禧难题(多方指向霍奇猜想),新内部模型(推测代号 Aeon)从零解纳维-斯托克斯仅用 88 小时;同期 Anthropic 被曝接近解决伯奇-斯维讷顿-戴尔猜想。争议:菲尔兹奖得主陶哲轩深夜发文,称 OpenAI 可能窃取其与 Levent Alpöge 的研究思路,此前 NYU 团队已指控「截胡」。
- 为什么值得关注:能力跃迁与安全红线同步到来;Sam Altman/OpenAI 的「AGI 时代」叙事遭遇学界诚信质疑,AI 自主科研的归属与合规成为新议题——模型把预印本/研讨会当选题雷达,署名与评价体系恐先撑不住。
10. [芯片算力] 华为「韬定律」逻辑折叠量产验证(麒麟 2026)
- 事件:9/4–9/7 何庭波在 ChinaXiv 更新「韬定律」论文,以麒麟 2026 实测数据回应「堆叠必过热」质疑:晶体管密度 1.55 亿→2.38 亿/mm²(+55%);同性能下 NPU 功耗 -66%、GPU -58%、CPU 性能核 -41%——NPU 29TOPS 不变、频率 -63%、电压 0.85→0.55V、功耗密度 -73%。LogicFolding:电路垂直堆叠、1.5μm 键合间距、约 5000 万垂直互连/mm²,信号「坐电梯」替代水平长途;SoC 超 80% 能量用于数据搬运,折叠缩短关键路径(典型 -20%、关键 -70%)。9/7 Mate XT 2 首发麒麟 9050 Pro(首款完整 LogicFolding 芯片),整机性能 +42%。
- 为什么值得关注:在 7nm 受限制程下,华为用先进封装打开「后摩尔」独立路线——功耗/带宽焦虑的另一种解法,对 AI 推理芯片(昇腾)同样有外溢价值。这是国产半导体从「论文推演」走向量产验证的关键跨越。
重点人物/公司跟踪
- 梁文锋(DeepSeek):V4.1 Flash 开源价格战主导者,单日引发智谱/MiniMax 估值重挫,推理层「免费+开源」挤压闭源。
- Sam Altman / OpenAI:Astra 能力 + 千禧难题双线推进,却因疑似「截胡」学界思路陷入诚信风波。
- 黄仁勋(NVIDIA):9/10 高盛科技大会称「网络安全的下一个大市场是 AI」(代码被利用/修复速度都变快,「制造问题即创造需求」),否认 130 亿收购 Hugging Face 是「循环投资」;同日 BIS 警示全球五大科技 2025–26 AI 投入将超 1 万亿美元、大量靠债务/私人信贷,藏金融稳定风险。
- 杨植麟(月之暗面):Kimi K3(2.8T 开源)成 Cognition SWE-2 底座,开源模型反向赋能美国头部 coding agent。
- Dario Amodei(Anthropic):Claude Fable 5.1 登顶 Artificial Analysis 智能指数 v4.2(9/5 更新,Fable 5.1 #1、Astra #2,cache 读价 -75%),成为 Devin Fusion 的强模型 lead。