智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

浏览10次 点赞0次 收藏0次

当大模型逐渐掌握对话、推理、编程和工具调用之后,自主研究被视为人工智能领域的「The Next Big Thing」。

自主研究意义在于,AI的发展将不再受制于人类知识边界,形成一种面向智能生产的全新Scaling Law——「投入多少能源,就将转化多少智力」。自主研究正是衡量智能体自主研究能力重要维度之一。

普通问答只需要定位一个事实,而自主研究面对的是一组相互关联、彼此制约的条件。智能体不仅要从庞大的信息空间中定位候选答案,还需整合分散甚至冲突的证据,并确认最终答案满足全部关键约束——只要有一项未验证,答案即为无效解。自主研究的核心难题并不是「搜索得还不够久或者证据难找」,而是:

智能体能不能知道当前答案到底已经成立了什么、还缺什么,以及下一步最应该研究什么,是如何让智能体在复杂约束中持续接近正确答案。

智源研究院发布的AREX正是围绕这一核心问题提出的。它抓住了自主研究中的关键突破口——「发现—验证不对称性」:完整答案往往难以一次性生成,但一旦形成候选解,便可以通过针对关键约束的逐项验证,快速定位不足并指导后续探索。

验证的意义并非仅仅判断答案是否正确,更重要的是帮助智能体理解「已经知道什么、还缺少什么,以及下一步应该研究什么」,从而让每一轮研究都更加精准、更具方向性。

这一思想的前瞻性在Jeff Dean近日创立的Discovery Loop公司得到印证:未来的人工智能不仅需要更强的推理能力,更需要通过持续的实验、反馈和修正形成自主发现能力。

AREX对「求解—验证」双循环的探索,体现了智源研究团队在自主研究方向上的前瞻性,也反映出通过闭环迭代推动智能持续进化,正在成为人工智能发展的重要趋势。

项目主页:

https://vectorspacelab.github.io/arex-model/

模型权重:

https://huggingface.co/collections/BAAI/arex

体验链接:

https://arex-research.com

AREX旨在训练能长期运行、

自我验证、持续修正的研究型智能体

AREX的目标,不是让模型在单轮回答中写出一个「看起来更完整」的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体——不是一次性给出答案,而是在「研究→验证→再研究」的循环中不断接近完整解,让模型真正具备持续改进当前解的能力。

面对复杂任务,智能体可以先给出一个阶段性答案;随后,它会逐项检查约束是否满足,保留已经验证的证据,定位尚未解决的主张,再发起更有针对性的后续研究。当新的证据到来后,智能体会再次更新答案、重新验证,并判断是继续深入,还是结束研究并输出最终结论。

这一过程可以递归执行多轮:研究→暂定答案→逐项验证→定位缺口→定向研究→更新答案。这里的「自我改进」,并不是指模型在执行任务时在线更新参数,而是指智能体对自身研究状态和当前答案进行持续修正。

它不再只是一个「搜索后回答」的工具,而更像一个会反复检查研究进度、修正研究路径、沉淀有效证据的研究助手。AREX通过双循环框架打通「找到答案」与「改进答案」的闭环AREX的整体方法,可以概括为一套双循环递归求解框架。内层循环负责「研究」,外层循环负责「改进」。

二者协同,让智能体不只是向前搜索,而是在每一轮中继承已有进展、修正错误方向,并不断接近更可靠的答案。


内层循环Research Loop:内层循环负责完成一轮相对完整的研究。在这一阶段,智能体会围绕当前研究问题搜索信息、调用工具、收集证据、比较候选,并构造一个暂定答案。它的目标不是一次性得到终局解,而是形成一个结构完整、证据可追踪、后续可以被审计的当前解。

如果这是第一轮研究,智能体面对的是用户提出的原始问题。如果已经经过外层验证,那么它面对的就是一个被重新定义过、更聚焦的新问题。例如:补齐某项缺失证据,消解两个来源之间的矛盾,或者替换一个无法满足全部条件的候选答案。这意味着,每一轮研究都不是简单重复,而是在更清晰的问题上继续推进。

外层循环Self-Improvement Loop:外层循环负责判断当前答案究竟走到了哪一步。AREX会依据任务中的各项约束,对暂定答案进行逐项审计,并形成约束级别的置信判断:哪些条件已经获得充分支持,哪些仍然不确定,哪些关键主张缺少证据,哪些结论需要重新研究。

如果所有必要条件都得到足够支持,智能体就结束研究并输出答案。如果仍有条件没有解决,验证结果就会被转化为下一轮内层循环的研究目标。因此,外层循环不是简单地说「答案还不够好,再试一次」,而是明确告诉内层循环:已经解决了什么,接下来只需要解决什么。这让每一轮递归都能继承已有成果,而不是从头开始。

机制分析:

长程研究状态维护带来的性能提升

AREX的推理机制包含两个循环:内层研究循环负责搜索、访问网页、验证证据、更新上下文并生成暂定答案;外层自我改进循环根据答案、证据和置信度,决定接受、继续细化或重新开始。

其中,自主上下文更新(ACU)是关键。它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。BrowseComp上的分析显示,AREX通常会主动更新上下文,而不是等到128K上下文窗口被塞满后才被动压缩。

受控实验显示,AREX完整系统在BrowseComp上达到82.5,比关闭ACU和外层循环的版本高出22.9个百分点。训练消融也表明,渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习分别贡献于工具交互、关键决策和长程策略优化。



训练消融进一步说明,AREX的提升来自多个环节共同作用。渐进式多轮能力训练先建立稳定的工具交互能力,关键步骤聚焦监督把训练信号集中到证据发现、路径否定与重定向、关键上下文更新等转折点,步骤感知强化学习则继续优化长程决策策略。

这也解释了AREX的核心思想:长程研究中真正难的不是例行搜索和访问网页,而是在关键时刻做对决定,什么时候相信一个证据,什么时候放弃一个候选,什么时候重整上下文并改变搜索方向,这些才是决定研究成败的步骤。

AREX让自主研究智能体

在长程任务中持续自我进化

长程研究不「失忆」:将「历史包袱」转化为「进度路标」。长程研究中的核心挑战,并不只是信息检索是否充分,更在于模型能否在持续延展的研究过程中稳定记住当前进展。随着交互轨迹不断变长,历史记录中会同时包含已验证的证据、被推翻的假设、中途放弃的计划以及大量重复信息。全盘保留这些内容容易让模型迷失方向,而简单截断又可能丢掉关键线索。

AREX的做法,是让模型在研究过程中主动调用上下文更新工具,将不断增长的交互历史整理成一个可以继续推进的研究状态。这种更新并不是普通摘要,而是一份「研究进度表」,帮助模型明确:当前研究到哪了?什么已经成立?什么已经被排除?接下来最该查什么?通过这种方式,模型能够持续继承有效信息、压缩冗余内容,并在当前阶段形成更稳健的最优解。

构造可验证的训练数据:从确定答案出发,生成可验证的研究轨迹。自我改进不是靠延长搜索轨迹就能堆砌出来的。AREX需要的是那种能真正教会模型如何发现线索、交叉验证、推翻错误候选、调整方向并继续前进的数据。

为此,AREX设计了一套可验证的自主研究任务生成方法:先从一个确定的实体答案出发,围绕它构造一组必须被真实证据支撑的约束条件,然后再把这些约束改写为无法通过关键词直接命中的开放式问题。这样生成的任务,迫使模型必须真正去搜索、比对和验证,而不是在文本表述里「找答案」。

随后,强教师模型在同样工具环境中完整执行这些任务,留下全过程的研究轨迹。但凡出现直接猜答案、忽略观察、证据不足或结论与证据矛盾等情况,整条轨迹都会被剔除。最终保留下来的,是从不确定候选逐步走向可验证答案的研究轨迹。

分阶段训练与关键步骤强化:使模型掌握自我改进的连贯策略。在获得高质量训练数据之后,训练顺序同样关键。AREX没有将所有轨迹简单混合训练,而是采取了分阶段策略。模型首先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。同时,AREX还会巩固论文研究、高难知识推理等专项能力,避免不同任务之间的能力相互干扰。

AREX也不会把长轨迹中的每一步都同等对待。真正决定研究是否能够取得突破的,往往是少数关键转折点,例如找到关键证据、否定错误候选、切换搜索方向,以及更新研究状态。这些关键步骤会在训练中被重点关注,并在强化学习阶段继续优化模型的研究策略。

因此,AREX的自我改进能力并不是「多搜几轮」自然涌现的结果,而是由可验证任务设计、高质量轨迹筛选、分阶段训练和关键步骤强化共同塑造出来的。它的目标是让智能体更接近真正的研究者:能够判断何时坚持当前方向,何时及时掉头,何时停下来确认答案。

实验评估:

AREX以10B激活参数达到自主研究前沿水平

为了验证AREX是否具备真实自主研究能力,智源研究院在六个基准上进行了评测,包括:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 和HLE with tools。它们分别覆盖信息深度、信息广度、深度与广度结合,以及端到端 Agent能力。


信息深度:在多跳信息中持续挖掘

BrowseComp和xbench-2510的任务设计颇为苛刻:问题往往嵌入了多个相互约束的条件,正确答案隐藏在分散的网页与间接证据之中,模型需要沿着线索逐级深入挖掘。AREX-Base在BrowseComp上达到82.5,接近GPT-5.4、Kimi-K2.6、DeepSeek-V4-Pro和Claude Opus-4.6,同时超过GLM-5与Qwen3.5-397B。

在xbench-2510 上,它接近MiroThinker-H1,并优于Qwen3.5-397B与DeepSeek-V4-Flash。结果表明,AREX能力提升并非来自更多轮次的搜索堆砌,而是源于更稳定的研究状态维护——模型能够保留已验证信息、排除错误候选,并持续围绕尚未解决的约束推进。

信息广度:在大规模信息空间中全面覆盖

WideSearch-en考察的是另一项能力:在大规模搜索空间中尽可能完整地找到目标条目,并完成去重、核验与汇总。AREX-Base在该基准上取得了82.0 Item-F1,为论文对比范围内的最高结果,超越了Kimi-K2.6、DeepSeek-V4-Pro、GPT-5.4等模型。结果表明,AREX不只擅长「挖深一个答案」,也能管理大范围搜索任务,在长程检索中持续维护已覆盖范围和剩余空白。

深度与广度的结合:可迁移的研究方法论

DeepSearchQA同时要求多步检索、证据推理与答案完整性,是深度与广度的综合测试。AREX-Base在这里取得了89.9 F1,超过GPT-5.4与DeepSeek-V4-Pro和Qwen3.5-397B,并接近Claude Opus-4.6、Kimi-K2.6和Gemini-3.1-Pro。这说明AREX学到的不是某个特定领域的搜索技巧,而是一套可迁移的研究方法论:检索、比较、验证、修正、聚合。

端到端能力:从搜索到完整研究流程

GAIA和HLE with tools进一步要求模型将搜索与规划、推理、工具调用结合起来。AREX-Base在三项测试上分别取得85.4、71.0和52.4。在GAIA上,它超过Kimi-K2.6、Gemini-3.1-Pro和Qwen3.5-397B;在HLE文本子集测评下,它超过GLM-5、DeepSeek-V4-Pro、Qwen3.5-397B和MiroThinker-H1。这说明AREX的能力可以从搜索任务迁移到完整智能体工作流:模型不仅能找到信息,还能规划行动、调用工具、验证中间结论,并组织最终答案。

总体性能对比:开源前沿、闭源旗舰与同量级模型

与开源前沿模型相比,AREX-Base在双方均报告的BrowseComp、GAIA、WideSearch-en和HLE文本子集上全部领先。与DeepSeek-V4-Pro相比,AREX-Base在DeepSearchQA、WideSearch-en和HLE文本子集上更高。

与Kimi-K2.6相比,AREX-Base在GAIA和WideSearch-en上领先,在BrowseComp上接近,但在xbench-2510和DeepSearchQA上仍有差距。测评结果显示AREX不是「所有单项都领先」,而是以10B激活参数,在深搜、广搜、端到端智能体和工具推理之间取得了均衡的综合竞争力。

与闭源旗舰模型相比,面对GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro等闭源旗舰,AREX-Base同样进入多个高难度基准的竞争区间。它在BrowseComp上与GPT-5.4几乎持平,在DeepSearchQA上超过GPT-5.4,在WideSearch-en上超过GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro。这表明AREX已经能够在关键自主研究任务上与闭源旗舰模型正面竞争,尤其在大范围信息覆盖任务中优势更明显。

与同量级基础模型与智能体模型相比,AREX-Base的总参数量为122B,每次推理仅激活10B参数。相比同总参数量的Qwen3.5-122B,AREX-Base在双方均报告的指标上全部提升;相比更大规模的Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。与专门面向搜索和研究任务训练的智能体模型相比,AREX也体现出较高的参数效率。

AREX-Turbo只有4B参数,但在多项指标上超过Qwen3.5-35B、Quest-35B和Tongyi-DeepResearch-30B;AREX-Base则在DeepSearchQA和HLE文本子集上超过MiroThinker-H1,并在xbench-2510上与其接近。这说明自主研究能力并不只来自扩大参数规模,也来自对长程研究过程的专门训练。

AREX研究平台:

将自主研究能力封装为日常研究工具

AREX LLMs解决的是智能体如何开展长期、可靠的自主研究,而AREX Research Platform在此基础上,将这一能力封装为面向科研与产业用户的日常研究工具。

学术与产业界每天都会产生大量新增信息——论文、技术报告、会议talk、开源发布与行业分析。而当前的信息分发机制多以发布时间或热度作为排序维度,而非依据用户的具体研究关注点进行组织。高价值信息被碎片化地呈现,使用者往往需要在多个来源之间自行拼接背景,信息获取成本高、效率低。

AREX平台以模型驱动的内容获取与研究智能体为核心,针对三类不同的信息形态提供独立入口:资讯持续追踪指定领域内的每日动态,论文筛选高关注度的研究工作并支持深度理解,播客从长时段访谈中提取关键观点与行业趋势。三者均由AREX智能体驱动,既支持广域浏览,也支持针对细分方向的定制化配置。


AREX首页(最终效果以上线版本为准)

定制化资讯服务:在信息组织方式上,AREX平台支持用户指定关注方向(如Coding Agent、芯片行业进展等),并据此生成持续运行的专属资讯智能体,按设定频率完成检索、筛选与汇总。

与传统「源订阅」相比,这一机制以「用户关注点」作为过滤维度,使信息流由「按热度排序」转向「按相关性组织」,从而降低无关信息干扰,提升信息获取的针对性。


AREX资讯定制

自由的可扩展性:此外,AREX平台在信息发现与自主研究之间提供直接衔接。每条资讯、论文或播客旁均提供自主研究入口,可一键调用AREX智能体。

智能体已感知当前阅读内容与上下文,无需重复交代背景,即可针对具体问题(例如「该方向是否有后续讨论」、「所选benchmark是否权威」、「相关观点在其他访谈中是否出现过」)启动检索、对比、分析与综合,输出完整的知识脉络。


聊一聊

平台承担内容发现,智能体承担理解与分析,二者在统一上下文下衔接。这一设计是AREX区别于单纯资讯工具的核心所在。

当前版本的AREX Research Platform覆盖科研工作流中的「信息获取」与「认知构建」两个阶段,即帮助用户发现相关信息并理解其研究背景。智源研究院后续将能力延伸至研究执行阶段,由提供参考信息进一步发展为支持方案产出。

重点方向是端到端自主科研,包含以下三个环节:方案设计——智能体在理解问题与现有方法后,自主提出创新方案、实验设计、对比策略;工程实现——智能体直接生成可运行的代码框架、训练配置、评估脚本,并接入计算资源执行;性能调优——智能体分析实验结果,识别瓶颈,自动迭代超参、调整结构,持续优化迭代。

最终实现:用户定义研究问题,由AREX自主完成探索、实验与优化,并交付可验证的研究结果。

AREX当前已开放BETA版测试,欢迎大家体验并反馈:arex-research.com

编辑:桃子

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯