红鹰工作手机 > 红鹰科技数码 > 默认分类 > 阿里通义开源WebSailor,引领网络智能体新篇章

阿里通义开源WebSailor,引领网络智能体新篇章

作者:红鹰工作手机apiweixin.cn 发布时间:2025-08-11 21:00:02


2025年7月7日,阿里云传来一则振奋人心的消息:通义正式开源了其网络智能体WebSailor,并且该智能体在发布后迅速登顶了开源网络智能体榜单,这一成就无疑为阿里云在智能体领域的技术实力再添一抹亮色。

WebSailor,这个听起来就充满科技感的智能体,具备着强大的推理和检索能力。它能够在复杂场景下,对于模糊问题进行迅速而准确的检索,并通过严密的多步推理和交叉验证,在海量信息中筛选出最终的答案。这样的能力,无疑让WebSailor在信息检索领域独树一帜。

值得一提的是,WebSailor的构建方案及部分数据集已经在Github上开源,这无疑为开发者们提供了一个宝贵的资源。通过开源,阿里云不仅展示了其在技术上的自信,也鼓励了更多的开发者参与到智能体的研发中来,共同推动技术的进步。

那么,WebSailor究竟是如何做到在众多智能体中脱颖而出的呢?这背后离不开通义实验室团队的创新努力。他们采用了一整套创新的post-training方法,大幅提升了该开源模型在复杂网页推理任务上的表现。在高难度智能体评测集BrowseComp上,WebSailor的成绩一举超越了DeepSeek R1、Grok-3等模型和智能体,成功登顶开源网络智能体榜单。

为了验证WebSailor的实验效果,通义实验室在多个benchmark评测集上进行了实测。其中,BrowseComp作为OpenAI开源的浏览器检索效果评测集,包含了1266个高难度问题,是目前难度最高的评测集之一。而WebSailor在英文版和中文版BrowseComp评测集上的实测结果显示,它不仅在开源模型和Agent阵营里实现了断层领先,甚至超越了DeepSeek R1、Grok-3等闭源模型,仅次于闭源的OpenAI DeepResearch。这样的成绩,无疑是对WebSailor技术实力的最好证明。

尽管WebSailor是基于高难度数据进行训练的,但它在聚焦普通任务SimpleQA的数据集上同样表现出色,超越了其他方法。这充分展示了WebSailor的兼容性和有效性,也验证了其方法的泛化能力。阿里云表示,WebSailor提供了一个通用的workflow,可以借鉴到其他领域的问题中。它强调的“高难度任务合成+小规模冷启动+高效RL优化”的组合拳策略,具有很强的普适性。

展望未来,开源社区可以参考WebSailor的思路,去攻克更多类似“超越人类能力”的任务。无论是开放领域的复杂推理问答、学术知识发现,还是跨模态的信息整合等,WebSailor都为我们提供了一个全新的视角和思路。相信在不久的将来,我们将会看到更多基于WebSailor的创新应用涌现出来,为我们的生活带来更多的便利和惊喜。

联系我们

手机号码:+18588603721

no cache
Processed in 0.282344 Second.