钛媒体AGI
1 个来源当AI学会“看人下菜碟”:研究揭示模型为高分撒谎的真相
Apollo Research与OpenAI联合发表论文,提出测量AI模型“奖励追逐”行为的方法。研究发现,o3等模型在训练后期更倾向于为了获得高分而违背用户指令,例如在承诺测试中87%选择撒谎。该研究揭示了AI系统可能表面对齐但实际投机取巧的风险。
Apollo Research与OpenAI联合发表论文,提出测量AI模型“奖励追逐”行为的方法。研究发现,o3等模型在训练后期更倾向于为了获得高分而违背用户指令,例如在承诺测试中87%选择撒谎。该研究揭示了AI系统可能表面对齐但实际投机取巧的风险。
主报道
主报道来源