红鹰工作手机 > 红鹰科技数码 > 默认分类 > 别被“安全答案”蒙蔽!60%主流大模型只是“假装懂风险”

别被“安全答案”蒙蔽!60%主流大模型只是“假装懂风险”

作者:红鹰工作手机apiweixin.cn 发布时间:2025-08-14 21:00:02


在人工智能飞速发展的当下,大模型在处理复杂问题上的能力日益增强,然而,它们真的如我们所想,能够全面理解并应对各种风险吗?最近的研究却揭示了一个令人担忧的事实:超过60%的主流推理模型,在面对风险指令时,虽然能生成看似安全的输出,但实际上并未真正理解其中的风险,只是“假装懂”而已。

这一现象被淘天集团算法技术-未来实验室团队称为“表面安全对齐”(Superficial Safety Alignment, SSA)。SSA描述了这样一种系统性漏洞:模型在表面上生成了合规的安全答案,但在其思考过程中,却未能对指令中包含的风险进行全面而精确的内部推理。换句话说,这些模型只是死记硬背了安全指令的特征,学会了拒绝回答的范式,而并未真正理解风险背后的逻辑。

为了深入研究这一现象,研究人员推出了一个名为Beyond Safe Answers(BSA)的Benchmark。这是全球首个针对推理模型思考过程中风险认知准确性的高质量评测集,它包含了挑战性的数据集、全面的覆盖范围以及详细的风险注释,为理解和提升推理模型在安全领域的应用能力提供了有力的工具。

BSA的评测结果显示,即使表现最好的模型,在标准安全评测中得分超过90%,但在推理准确率上却不到40%,在多次采样一致推理正确的情况下更是低于20%。这表明,安全合规往往只是表面现象,底层推理能力仍严重不足。模型在多风险场景下容易选择性忽视一些风险,或者在混合风险内容和同种易敏感无风险内容的场景下,风险阈值明显降低,易出现误报。

那么,如何解决这一问题呢?研究人员发现,随着模型参数量的提升,大模型在风险识别上的性能确实会有所提升,特别是在风险遗漏场景下。这表明,模型规模扩展仍然是提升安全对齐能力(特别是复杂知识场景下全面风险识别)的有效路径。然而,这并非长久之计,因为模型规模的提升也意味着计算资源的消耗和成本的增加。

更有趣的是,研究人员还发现,安全规则、优质数据微调和解码参数对模型表面安全现象也有显著影响。例如,将明确的安全规则纳入大模型的输入中,可以显著提升其回复的安全性,但有时也会放大模型的“过度敏感”,即对一些本质上无害的输入也表现出过度谨慎的态度。而通过精心设计的安全推理数据微调,虽然可以提升模型的整体回复安全性和推理过程中风险识别的准确性,但也可能导致模型过度敏感类问题的出现。

至于解码参数的调整,虽然对非安全问题的回复有显著影响,但对安全性和推理准确性的影响却极其有限。这表明,大语言模型的核心安全推理能力主要取决于训练数据和模型本身的参数,而非具体的解码策略。

这项研究不仅揭示了主流推理模型在风险认知上的局限性,也为我们指明了提升模型安全对齐能力的方向。未来,我们需要更加关注模型内部的推理过程,而不仅仅是表面的输出结果。同时,也需要探索更加有效的训练方法和数据集,以提升模型在复杂风险场景下的认知和应对能力。只有这样,我们才能确保人工智能技术的健康发展,并真正享受到其带来的便利和福祉。

联系我们

手机号码:+18588603721

no cache
Processed in 0.262962 Second.