AI 动态日报 · 2026-09-13
浏览17次
点赞0次
收藏0次
1. [AI coding] Sakana 发布 Fugu Max / Fugu Ultra v2 多模型编排引擎
- 事件:9/11 Sakana AI 发布 Fugu Max 与 Fugu Ultra v2——同一套编排架构的两个工作点。Fugu Max 把路由池扩到史上最大(含 NVIDIA Nemotron 家族),动态把每个子任务派给「最便宜且能搞定」的模型,输出定价
2/6 每百万 Token,比 Sonnet 5 / GPT-5.6 Terra / Kimi K3 便宜 40–60%;官方称在 Terminal-Bench 2.1、GPQAD、AutomationBench、SWEFish(自家编码基准)等 6 项拿最佳,并在 7/10 基准上拓展了成本-性能 Pareto 前沿。Fugu Ultra v2(5/30)主攻复杂多步推理/全栈软件工程,DeepSWE 74.3、Chartography 48.3。底层为 TRINITY(~0.6B 协调器,分 Thinker/Worker/Verifier 角色)+ Conductor(7B RL,可递归调用)。注意:其模型池明确排除 Fable 5.1 与 GPT-6 Astra。
- 为什么值得关注:多模型路由(强模型 + 便宜副驾)的主线在 Devin Fusion(已推送 #17)之后进一步成形——竞争焦点从「单模型谁最强」转向「编排系统能否用最低成本交付旗舰级结果」。Sakana 的赌注是「未来前沿由一群开放专用模型协同构成」,而非某一个巨模型。
2. [AI coding] GitHub Copilot HydraFusion 多模型路由
- 事件:GitHub 在 Copilot CLI 推出研究预览 Project HydraFusion(9/4 发布、本周持续发酵):开发者像选模型一样选 HydraFusion,系统为每个请求实时构建执行计划,从三模式中选一——Single(单模型直解)、Cascade(便宜模型先草稿,质量门控不通过再升级强模型)、Critique(另一模型族独立审阅后原模型改一次)。基于微软 HyDRA(ModernBERT 对 reasoning/code-gen/debugging/tool-use 四维打分)。离线评测:Terminal-Bench 2.1 上比 Claude Opus 5 质量 +4.9 个百分点、成本 -67%;DeepSWE -1.5pp/-36%;CheckpointBench -0.1pp/-65%。五个安全原则:全链路计费、有界执行、隔离审阅、失败不落地补丁、执行前校验路由。
- 为什么值得关注:coding agent 从「选一个模型」进化到「编排一段工作流」,且把成本-质量-延迟作为联合优化目标。与 Fugu、Devin Fusion 同属「多模型协同」浪潮,但 GitHub 把它做进了开发者每天都在用的 CLI,落地路径更短。评审模型无工具、只读仓库,降低了「审改一体」带来的状态污染风险。
3. [AI coding] OpenCode Zen / Go 免费接入 Meta Muse Spark 1.3
- 事件:OpenCode(开源编码 CLI,用户 query 点名)的 Zen 目录上线
muse-spark-1.3-contributor-free(定价0);**OpenCode Go**(10/月)同时含 DeepSeek V4 Flash + Muse Spark 1.3,请求额度高达 45,300/5h。Muse Spark 1.3 是 Meta 4 个月内第 4 次更新的编码/智能体模型:DeepSWE v1.1 75.4(高于 Opus 5 的 74.0)、Terminal-Bench 2.1 88.8、MRCR 长上下文 98.5,工具调用少 20%、Token 少 25%。代价:Contributor 档免费是因为你的提示与输出会被用于训练 Meta 后续模型。
- 为什么值得关注:开源/聚合生态正在把前沿编码模型的价格打到地板($0),这是对闭源 coding 订阅的直接冲击;也揭示了「免费」的真实对价=数据。对在意隐私的团队,这是一次明确的权衡测试——而 OpenCode 把 Muse/Kimi/Qwen/DeepSeek/GLM 等开放权重聚到一个工作流里,呼应 Orca(已推送 #8)的多 agent 思路。
4. [具身智能] FANUC × Google AI 焊接智能体
- 事件:9/11 发那科与 Google 联合发布 AI Welding Agent:基于 Google Cloud Gemini Enterprise,用 CRX 协作机器人平板示教器的内置摄像头「扫一眼零件图纸」,自动生成焊接参数(电流/电压)+ 机器人运动程序,实现零示教、零配置电弧焊;操作者可直接执行,也可人工微调。9/16 东京国际焊接展首秀,12 月底出货;以订阅形式提供(无需单独签 Gemini Enterprise 合约),且「扫描的图纸数据不用于训练 Google 模型」。
- 为什么值得关注:Physical AI 从实验室走线到工业现场的又一实锤——把「读工程图→生成可执行的机器人程序」这一高技能工序商品化,直接对冲全球焊工短缺。与 MagicLab/宇树的 VLA 走消费/通用不同,FANUC 选了确定性高、ROI 清晰的工业焊接切口,是具身智能最早跑通商业闭环的路径之一。
5. [具身智能] 拟人手 18 秒启动写笔迹(灵巧手/执行器)
- 事件:arXiv 2609.11775(FutureX 9/12 收录):研究团队让一只仿人灵巧手在笔记本 CPU 上约 18 秒初始化后,仅靠手内运动(in-hand motion)书写笔迹,平面精度 0.6mm;方法是实时估计并校正「手-笔系统」的任务雅可比矩阵,不依赖接触模型、不靠仿真训练、无需示范数据——论文称这是首次用纯手内运动写出任意单笔轨迹。
- 为什么值得关注:直击王兴兴定义的机器人「ChatGPT 时刻」短板——最后几毫米对齐(已推送 #10)。灵巧手从「能抓能捏」迈向「能稳定精细操作」是关键一跳;且该方案摆脱了对仿真和示范数据的依赖,意味着真实部署的数据与算力门槛被显著压低。结合 9 月世界机器人*会「从运动能力走向作业能力、灵巧手成关键一环」的业态转向,这条路线值得持续跟踪。
6. [具身智能] HuRo:人类视频转机器人数据做 VLA 预训练
- 事件:arXiv 2609.10706:把人类视频「机器人化」成机器人数据做 VLA 预训练。5 类人类视频源转化为约 63 万段机器人对齐片段、1.42 亿帧的 HuRo 数据集。四个真实机器人任务上,随预训练规模增大,整体完成率从 51.5% 升至 80.3%,分布外(空间/视觉变化)场景从 34.9% 升至 72.2%。代码与数据已开源。
- 为什么值得关注:机器人数据饥荒是 VLA 落地的核心瓶颈,HuRo 证明「互联网级人类视频」是可规模化利用的免费数据源——用「机器人化」对齐把人类演示转成训练信号,比纯真机采集便宜几个数量级。与智元 GE-Act 2.0(已推送 #19)的 Scaling 结论互相印证:数据规模仍是具身智能的第一杠杆。
7. [大模型] OpenAI GPT-Live-1 开放 API
- 事件:OpenAI 于 9/10 将全双工实时语音模型 GPT-Live-1 通过 API 正式开放(此前 7 月起仅限 ChatGPT 语音模式)。核心特性:模型可边听边说(full-duplex),天然支持打断、插话、话题转向;语音前端单独计费 $0.05/分钟(按秒),后台推理与工具调用另算;首发 12 种实时音色;后端可用 Responses delegation 接 GPT-6 Astra / Luna / Terra 或自有模型,并能把对话上下文 delegation 给 Codex SDK 边聊边干仓库活。官方称配 Astra(medium) 在 Tau3 首试成功率 83.6%(vs GPT-Realtime-2.1 的 45.7%),Full Duplex Bench 高 30 分。
- 为什么值得关注:语音 Agent 从「ASR+文本模型+TTS」三段拼接走向「单模型全双工」,延迟与打断体验质变,且把「推理/工具调用」解耦到可自由选配的后端——等于给语音入口接上了 coding agent(Codex)。这对呼叫中心、语音助手、以及「动口不动手」的开发者工作流是直接基础设施升级。与已推送的 Agents API(#3)构成 OpenAI 的「语音+ Agent」双线。
8. [芯片算力] 寒武纪思元 690 量产 + DeepSeek V4「Day 0」适配
- 事件:寒武纪新一代旗舰云端芯片思元 690 于 2026 年初量产:双 die 封装,FP16 算力 >700 TFLOPS、配 196GB HBM3、实测互连带宽 >890Gbps(较上代 590 近翻倍)。软件侧 MagicMind + NeuWare 统一栈,已对 DeepSeek V4、V3.2 实现「Day 0」级适配(模型发布当天即完成芯片适配并开源代码),智谱 GLM-5 亦首日同步。半年报:营收 59.96 亿元(同比 +108.13%)、归母净利 23.11 亿元(+122.61%),连续第七季盈利;一季度合同负债飙至 3.96 亿元,订单「堆到门口」。
- 为什么值得关注:国产算力与国产大模型的关系从「可以适配」升级为「模型首发即同步适配」,这是比单颗芯片性能更硬的生态护城河。在 NVIDIA 中国份额由 40%→8%(已推送 #13)、DeepSeek 16 万片昇腾订单落地的背景下,寒武纪以「Day 0 软硬协同」切走相当一部分训练/推理份额,国产 AI 产业链闭环正在成型。
9. [芯片算力] 华为昇腾 950 超节点 Atlas 950 AI SuperNode
- 事件:据国联民生证券 9/10 报告,昇腾超节点方案持续向大规模集群演进——Atlas 950 AI 超节点搭载 8192 颗 Ascend 950DT,FP8 精度总算力 8 EFLOPS,采用灵衢 2.0 互联协议,总互联带宽 16.3PB/s;其上 Atlas 950/960 SuperCluster 规划达数十万至百万卡级。软件侧 CANN 推出 PyTorch 风格的 PyOTO 编程范式降低算子开发门槛。算力评价指标正由「峰值算力」转向「单位 Token 成本、并发吞吐、实际利用率」。
- 为什么值得关注:此前推送过「DeepSeek 16 万片昇腾订单」(#13)与「韬定律逻辑折叠量产」(#24),本条是它们的系统级落点——单卡受限后用「超节点 + 极致互联」把战场升维到 8192 卡统一内存编址。这印证了那张中美芯片坐标轴的核心判断:中国走「集群互联路线」补单卡代差。对大模型训练/推理而言,真正可比的已不是一张卡的 TFLOPS,而是万卡集群的线性加速比与单位 Token 成本。
重点人物/公司跟踪
- 陈天石(寒武纪):思元 690 量产 + Day 0 适配 + 业绩翻倍,把寒武纪推上国产算力底座核心位;万亿市值后主动「降温」(福布斯提示 368.97 倍 PE 风险),理性释放信号。
- 孙正义/黄仁勋:NVIDIA 与 Sakana 合作将 Nemotron 家族纳入 Fugu 编排池(#1),老黄「网络即算力」的生态绑定再下一城。
- Dario Amodei(Anthropic):Fable 5.1 虽被 Sakana 排除在 Fugu 模型池外(#1),但其 Claude 仍是 HydraFusion(#2)、Devin Fusion(#17)的强模型 lead,生态位稳固。
- 梁文锋(DeepSeek):V4 系列同时被寒武纪(#8)与昇腾(#9)做 Day 0 / 超节点深度适配,国产模型-国产算力协同的最大受益方。