返回信息流
新闻事件
A重点81
DeepTech深科技
1 个来源

AI有多会耍心眼?CMU实验让7个AI模型互斗,GPT-5-mini胜出

卡内基梅隆大学的研究人员开发了Social Gym平台,让7个AI模型在21个博弈游戏中竞争,以测试其战略、欺骗、心智理论等社交能力。结果显示GPT-5-mini在多项能力上领先,而Qwen3-32B在狼人杀中表现最差。该研究旨在量化AI的社交推理能力,并发现小模型存在鹦鹉学舌等问题。

SynthePulse Insight · AI 深度解读会员精读

AI的心眼:一场游戏揭示的社交能力真相

版本 1 · 1 个来源

卡内基梅隆大学用21个游戏测试7个AI模型的社交能力,发现GPT-5-mini最会骗人,但AI的'心眼'并非统一属性,且复盘不一定越复越强。

  • 卡内基梅隆大学构建Social Gym,用21个游戏测试7个AI模型的社交能力,包括囚徒困境、狼人杀等。
  • GPT-5-mini在战略、欺骗、心智理论、说服等能力上全面领先,成为最会骗人的模型。
  • Qwen3-32B在懦夫博弈中Elo最高,但在狼人杀中垫底,显示AI社交能力并非统一属性。
展开章节目录从会做题到会来事:AI测试的新转向

从会做题到会来事:AI测试的新转向

卡内基梅隆大学的研究人员认为,AI在数学、编程等任务上已表现出色,但现实中的AI智能体需要与人和其它智能体打交道,面临信息不对称、意见分歧等复杂情况,因此需要测试AI的'心眼',即社会推理和心智理论能力。

传统测试难以量化谈判、说服等能力,Social Gym通过设计自带输赢规则的游戏,如囚徒困境、胆小鬼博弈、狼人杀等,让AI在必须靠心眼才能赢的环境中接受考验,绕开了主观评判。

限时免费

继续阅读完整分析

还有 4 节深入分析和完整结论

加载中

可信度边界

本文基于DeepTech深科技对卡内基梅隆大学研究的报道,所有数据均来自该报道,未独立核实原始论文。部分结论如'GPT-5-mini最会骗人'基于研究结果,但实验局限可能影响普适性。

主报道

DeepTech深科技

主报道来源