大模型“自学成才”新突破:招商局狮子山实验室引领RLVR范式革新
作者:红鹰工作手机apiweixin.cn 发布时间:2025-07-18 21:00:01
在人工智能的广阔领域中,大模型一直扮演着举足轻重的角色。然而,传统的大模型往往高度依赖于人类专家的调教,通过精细的提示词工程、复杂的系统编排以及静态规则表来应对各种任务。但随着技术的不断进步,一个令人振奋的问题浮现:大模型能否摆脱这些依赖,真正实现“自学成才”?
近日,招商局狮子山人工智能实验室的研究团队给出了肯定的答案。他们通过引入可验证奖励的强化学习(RLVR)范式,成功让大模型自主进化出通用的探索、验证与记忆能力,从而实现了真正的“自学”。
这一突破的核心在于研究团队构建的端到端Agent训练pipeline——L0系统。该系统从智能体架构和学习范式两个关键层面进行了创新。在智能体架构层面,研究团队提出了结构化智能体框架——NB-Agent。这一框架在经典的“代码即行动”架构基础上进行了扩展,使智能体能够操作记忆/上下文,从而获得了类人类的记忆存储、信息总结与自我反思能力。
NB-Agent的“Think-Code-Observe”循环是其独特之处。在这个循环中,模型首先生成推理逻辑(Think),然后将其转化为Python代码(Code),最后执行代码并观察输出结果(Observe)。这一过程不断迭代,使智能体能够逐步优化其推理和行动策略。为了克服长文本处理这一核心挑战,研究团队还创新地将模型的上下文窗口与一个Python运行时的变量进行双向绑定,赋予了智能体主动管理自身记忆的能力。
在学习范式层面,研究团队探索了一个核心问题:是否可以仅通过RLVR范式,引导智能体从零开始,学会如何规划、搜索、验证与记忆,最终解决复杂的多轮推理任务?为了实现这一目标,L0系统采用了端到端强化学习进行智能体训练。他们重新定义了动作粒度,将一个动作不再视为一个token,而是一个完整的“思考+代码段”。同时,提出了Agentic Policy Gradient算法,将策略梯度从单token级扩展到完整动作序列级。此外,还构建了多维度自动奖励函数,包括最终答案正确性、代码执行情况、输出结构规范性等,以全面评估智能体的性能。
经过一系列的测试,L0系统展现出了惊人的进化能力。在多个经典的开放领域问答数据集上,L0系统均取得了显著的性能提升。以Qwen2.5-7B这个基础模型为例,在L0-Scaffold(仅有架构,未经过RL训练)下,它在HotpotQA上的得分仅为22%。但经过L0-RL(强化学习训练)后,其得分飙升至41%(提升84%)。在SimpleQA数据集上,L0-RL带来的提升更加显著,EM(精确匹配)得分从30%暴涨到80%(提升166%)。
这一突破不仅意味着大模型在复杂任务处理上取得了重要进展,更为人工智能的未来发展指明了方向。它表明,通过RLVR范式,智能体可以逐渐摆脱对人类专家的依赖,实现真正的自主学习和进化。这将为人工智能在各个领域的应用带来无限可能,推动科技的不断进步和发展。
文章分类
最新站内文章
联系我们
联系人:红鹰工作手机客服