中科院发布知境社会心智大模型,AI情商短板有望补齐
中国科学院计算技术研究所于7月24日发布了知境社会心智大模型技术体系,旨在提升AI的情商和可信任度。该体系包含SoMBench评测基准和Zing训练方法,通过FLARE数据飞轮、两阶段训练和OPD在线蒸馏等技术,使模型在社会心智能力上超越GPT-5.5,解决了AI在社交场景中表现生硬的问题。
中国科学院计算技术研究所于7月24日发布了知境社会心智大模型技术体系,旨在提升AI的情商和可信任度。该体系包含SoMBench评测基准和Zing训练方法,通过FLARE数据飞轮、两阶段训练和OPD在线蒸馏等技术,使模型在社会心智能力上超越GPT-5.5,解决了AI在社交场景中表现生硬的问题。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
中国科学院计算技术研究所知境团队发布社会心智大模型技术体系,通过SoMBench评测、Zing自适应训练和Actio部署架构,将“读懂人心”从模糊情商转化为可测量、可训练、可部署的工程能力。
当前AI在语言和工具智能上表现优异,但在家庭聚餐、团队会议等社会场景中往往生硬不合时宜。知境团队指出,这不是知识不够,而是“读懂人心”的能力尚未跟上,社会心智的长期缺失是从“任务执行”走向“社会协作”必须补上的一课。
为此,知境团队构建了SoMBench基准,将社会心智拆解为3大一级维度、17个二级维度、71项细粒度任务,涵盖基础信念推断到高阶情绪理解等完整光谱。基准包含3481道经十余名人类专家评审的实例,通过多题型交叉验证和捷径检测等手段精准定位模型错误模式。
在20个顶级大模型测试中,最强模型正确率仅72.08%,无一达到90%天花板,表明社会心智仍是AI的“无人区”。难点在于同一场景需同时处理角色关系、隐含意图、情绪变化等多层推理,普通大模型难以理清。
知境团队设计了会“自我进化”的训练系统,核心包括FLARE数据飞轮、两阶段训练和OPD在线蒸馏。FLARE通过评测定位认知短板,针对性合成全新训练样本,只保留模型当前无法轻易答对但经过推理能学会的中高难度样本,实现“哪里弱练哪里,每次练新题”。
两阶段训练先通过多教师蒸馏和Mixed-Reward GRPO强化学习构建通用社会心智基础,再针对情绪理解、意图推断等薄弱环节进行专项强化。OPD在在线轨迹上引入教师模型token级分布约束,防止强化学习中学新忘旧,GRPO负责探索,OPD负责守住边界。
Zing-27B在5项国际基准综合均值79.80,超越GPT-5.5的78.44,尤其在HiToM(+4.08pp)和EmoBench(+5.62pp)优势明显。Zing-32B综合均值76.32,略超DeepSeek-V4-Pro的75.90,EmoBench领先6.25个百分点。Zing-8B在HiToM三阶和四阶信念推理上分别提升21.67和22.08个百分点,超越更大参数模型。
Actio是“按需调用、不乱塞”的显式心智状态部署架构,以Harness为统一编排核心,根据任务心智需求选择性激活四类支撑:PRISM(76项分层心理与社交技能)、Starling Memory(显式记录心智状态)、SAGE(跨任务可复用推理经验)和Gated RAG(社会文化知识检索)。一次推理经历四步:理解任务并识别心智需求→并行检索→排序裁剪组合引导推理→离线沉淀有效经验。
应用前景包括具身智能(家庭看护、儿童陪伴等需要实时社会推理的场景)、复杂决策推演(政策沟通、危机管理等)和人机共生(多智能体系统统一心智协议)。小参数模型(8B/14B)为端侧部署提供了可能。
知境团队强调,社会智能正成为通用人工智能的下一个核心赛道,其技术路线使社会智能从模糊“情商”转变为具有评测工具、训练方法和运行时接口的工程对象。但训练收益能否跨任务、跨文化迁移,Actio能否在长期交互中保持稳定,仍需更广泛验证。
本文信息来源于量子位对中科院计算所知境团队的报道,包含具体基准分数和模型对比数据,但部分应用前景描述为团队展望,尚未经独立验证。
知境团队将社会心智定义为可测量、可训练、可部署的工程能力,通过SoMBench、Zing和Actio构建了完整技术体系,在多项基准上超越GPT-5.5和DeepSeek-V4-Pro,但跨任务迁移和长期稳定性仍需验证。
主报道
主报道来源