英伟达震撼开源Harness!AI自己爆改AI

浏览58次 点赞0次 收藏0次

OpenAI之后,老黄也出手了!

终于,英伟达重磅开源了自家的Harness——SoL-Pi。

它把Pi作为底盘,基于此重造了一套Harness效率增强层,让AI实现自我迭代、优化。


在这套严苛的自动化流水线中,AI自己也当上了研究员。

它们观察Agent怎么干活,找出哪些步骤在白白烧Token,提出方案、修改bug,再把方案送进测试。

AI的整个搜索从152个候选方向开始,最终留下了四大杀手级架构机制。

实测结果,令人咋舌——

Token消耗最高省64%,API调用成本骤降50%-54%。


GitHub传送门:https://github.com/NVlabs/SoL-Pi

在专业的研究场景下,每小时可直接省下8.75美元至13.5美元。英伟达,把AI省钱的开关开源了。

配置非常简单,仅需一行代码:「pi install git:github.com/NVlabs/SoL-Pi」,即可装到现有的Pi上。

Codex狂飙代码

一半Token却在空转

在让AI递归改进自己之前,能不能先让它把自我改进的账单打下来?

Harness,模型干活时使用的整套运行框架,是当下最好的解。

模型负责推理,Harness负责把工具、上下文、执行反馈和任务流程组织起来,让模型能够读文件、改代码、跑测试,并根据结果继续行动。

同一个模型,放进不同的Harness里,做事效率可能差出一截。


当前的问题在于,编程智能体的任务越来越长。

从补几行代码,到跨仓库修复问题,再到长时间自主工作,单次任务可以持续数小时。

这时候,一些平时不起眼的Token浪费,会不断累积。

改完文件,明明下一步就是跑测试,模型还要再推理一轮。一个大文件早已读过,后续请求仍在反复携带它。

几千行日志里,真正影响决策的可能只有几行,昂贵的模型却要从头读起。


递归自我改进(RSI),同样绕不开这笔开销。AI每尝试改进一次系统,都要花Token。失败的方案,也照样收费。

SoL-Pi的出现,要解决的就是这件事。

最终结果显示,和底座Pi相比,SoL-Pi少用45%到49%的token,成本低大约三分之一,平均得分保留94%左右。

和Codex、Claude Code原配的harness相比,token少35%到64%,标价成本低50%到54%。


这么惊艳的表现,SoL-Pi是如何做到的?这就不得不详细拆解下,它的核心四大机制了。

AI卷自己进化,四个大招来了

英伟达的流水线最终留下了四个机制,刀刀避开主干,专治重复劳动。

第一层:动作融合,一次调用完成编辑与验证

Action Fusion直击的是两次工具调用之间,那段多余的模型决策环节。

在基础Pi的运行轨迹里,最常见的序列是修改文件、收到结果,然后再调用命令去测试或者构建。

既然后续命令已经非常明确,中间这轮模型的「一来一回」就有了极大的压缩空间。


动作融合将一次编辑及其后续命令保留在一个本地序列中,省去了中间的模型决策环节

Action Fusion直接把编辑和后续命令封装进同一个本地执行序列。

Harness在底层完成修改、运行命令,再把合并后的结果一次性返回。测试照常执行,结果正常获取,但中间那轮模型请求被成功省去。

这相当于把两次分散的请求,合并为了一次高效的闭环操作。

第二层:在线上下文压缩,按子任务动态核算成本

Online Context Compact,解决的是「何时触发压缩」这一核心痛点。

上下文越长,历史材料越容易变成算力与资金负担。

但压缩也是有代价的:重写上下文可能会打断已有的KV-cache复用,需要重新支付处理成本。

因此过早压缩未必省钱,过去的策略往往是把压缩动作尽量推迟。


在线上下文压缩将已完成的子任务视为潜在的压缩点,然后等待后续请求能够偿还重写成本时再执行

SoL-Pi重构了判断时机,它把大任务拆分为子任务,每完成一步,就重新进行评估。

其核心逻辑在于精准计算:只有当「未来预计省下的开销」能够覆盖「本次重写的成本」时,系统才会真正执行压缩操作。

第三层:输出归档与索引,大块文件按需召回

ObservationPack,专门处理大段工具输出造成的「重复计费」问题。

一个大文件或一份超长结果,首次读取后如果一直滞留在上下文里,后续每一轮请求都会原样携带它,持续消耗缓存资源。


ObservationPack用稳定的句柄取代了重复的完整输出,同时保留原始内容以便分页召回

SoL-Pi的做法是把完整内容直接归档到本地磁盘,上下文里只留一个稳定的短句柄和一小段摘录。

这就像读完长篇报告后,直接把原件存档,手边只留索引和关键摘要。模型需要查阅细节时,直接根据索引按页取回即可。

第四层:小模型初筛日志,引入严格的证据核验机制

Evidence-Preserving Reducer的核心,是把长日志的第一遍阅读委派给成本更低的模型。

构建和测试日志动辄上万字,真正影响下一步决策的往往只有几行报错。让前沿大模型每次通读全文成本极高;可直接交给小模型去总结,又容易引入幻觉。


证据保留归约器仅在可对照存档日志核验其证据时,才接受紧凑的诊断回执

SoL-Pi在中间加了一道严格的防线——证据核验。辅助模型读完日志后,必须输出一份紧凑的诊断回执。

系统会拿着这份回执,逐条与归档的原始日志进行比对。只有严丝合缝对得上的原文,才会被放行交给前沿大模型。

这确保了主模型只接收被证实的信息,从源头上切断了误差传导。

152个点子厮杀,只留下4个

为什么是这4个机制?这就得说到英伟达真正的野心,RSI(递归自我改进)。

既然AI能改代码,也应该能改造「生产AI的系统」。

但RSI太烧钱,每一次试错都要付token费。于是英伟达换了个目标——先别急着让AI更聪明,先让它更省钱。

相比直接追分,token效率更难作弊。刷任务分数很容易过拟合,给特定题目写规则就行;但删重复上下文、压缩工具输出、合并无效决策,这些优化能迁移到不同任务和模型。

于是,一条「Agent研究Agent」的流水线启动了:

团队先搭出535个可验证环境,再让AI提出152个优化方向,随后经过三轮筛选——

先用历史轨迹估算收益,没潜力的直接淘汰;再让AI自己改代码、跑实验,并由Reviewer Agent挑刺;

最后冻结方案,在完全隔离的held-out任务上验真,能力不能掉,效率必须涨。


152个想法,最终只活下来4个,平均约40个才能出1个。

于是SoL-Pi的核心方法也逐渐清晰:让AI大量提出假设,再自动实验、淘汰、验证,把真正有效的少数机制筛出来。

让RSI飞轮,自己转起来

SoL-Pi背后,是MIT副教授、英伟达研究总监韩松掌舵的Efficient AI团队。

对他们来说,SoL-Pi当前省下了多少token开销,不过是一个阶段性注脚。

他们真正看重的,是这条「AI研究AI」的飞轮还能转多大。

在官方项目的主页中,团队还埋下了两个极具野心的长线伏笔:

一个是「闭环预训练」(Pretraining the harness)。

目前的535个环境依然是人工构建的,未来将由Agent自己去全网收集任务、搭环境、验证、更新自己的harness。

算力和环境多样性一旦拉升,harness很可能也会跑出属于自己的Scaling Law。


另一个是「效率复利」(Efficiency for efficiency)。

用变省了的harness,去跑规模更大、成本更低的自动研究循环,进而找出更高效的机制,形成成本压缩的复利效应。

在这个飞轮里,人只负责在初期提供先验方向;一旦进入循环,从研究到验证全程零干预;等AI把机制跑通了,人再回来搞清楚AI到底发现了什么,并将机器生成的粗糙代码重构成符合工业标准的版本。

现在,模型的Scaling Law各家还在争论不休;但Harness的Scaling Law,已经有人开始抢跑了。

而那个在赛道上狂奔的,是AI自己。

参考资料:

https://nvlabs.github.io/SoL-Pi/

https://github.com/NVlabs/SoL-Pi

https://x.com/MaxForAI/status/2098050525279478059

编辑:桃子 摩西

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯