蚂蚁百灵团队轻量级推理模型Ring-lite:轻量级推理新标杆
作者:红鹰工作手机apiweixin.cn 发布时间:2025-07-19 21:00:02
在人工智能的广阔天地里,轻量级推理模型正逐渐成为行业的新宠。蚂蚁百灵团队近期推出的Ring-lite模型,凭借其卓越的推理性能和高效性,在众多推理榜单上脱颖而出,成为轻量级推理模型的新标杆。
Ring-lite模型以百灵开源的MoE架构Ling-lite-1.5为基础,通过独创的C3PO强化学习训练方法,实现了在多项推理榜单上的SOTA效果。这些榜单包括AIME24/25、LiveCodeBench、CodeForce、GPQA-diamond等,涵盖了数学推理、编程竞赛和科学推理等多个领域。令人惊讶的是,Ring-lite仅使用了2.75B的激活参数,却能与3倍激活参数大小的10B以下Dense模型相媲美,这充分验证了MoE架构在推理领域的巨大潜力。
Ring-lite的成功并非偶然,它背后蕴含着团队对推理模型技术难题的深入探索和创新。其中,首创的C3PO强化学习训练方法,直击RL训练中回复长度波动导致的优化难题。相比传统方法,C3PO通过固定每个step传给优化器的总训练token数,有效稳定了训练端的梯度范数和系统吞吐,显著改善了优化不稳定和吞吐波动问题。
除了C3PO方法外,Ring-lite还探讨了Long-CoT SFT与RL的黄金训练比重。团队从token efficiency角度出发,提出了基于entropy loss来平衡训练效果和样本效率的方案。这一方案不仅提高了token效率,还使得Ring-lite在多领域任务联合RL训练中实现了协同增益,进一步提升了模型的推理性能。
在轻量级推理模型的对比中,Ring-lite也展现出了强大的实力。与业界代表性的轻量级推理模型相比,Ring-lite在数学推理、编程竞赛和科学推理等多个榜单上均取得了领先的成绩。特别是在2025年高考数学和物理题的测试中,Ring-lite也表现出了色,进一步证明了其在实际应用中的价值。
此外,Ring-lite在训练过程中还采用了分阶段的方式,先训练数学任务,再进行代码和STEM任务的混合训练,有效缓解了跨领域任务冲突问题。同时,团队还构建了大规模高质量的长推理链数据和强化学习训练数据集,为模型的训练提供了坚实的基础。
展望未来,蚂蚁百灵团队将继续在C3PO的探索上更进一步,计划实现动态学习节奏和端到端协同优化,让RL的训练更加稳定、高效。相信在不久的将来,Ring-lite将成为推动AI能力边界不断拓展的核心引擎,为人工智能领域的发展贡献更多的力量。
文章分类
最新站内文章
联系我们
联系人:红鹰工作手机客服