S信号86
机器之心
1 个来源RefCaptioner:让参考图与视频语义精准对应
北京大学与可灵团队提出RefCaptioner,通过后训练强化模型对参考图的识别与绑定能力,并构建结构化视频描述,解决多参考图场景下视频理解模型对应能力下降的问题。该方法采用混合数据SFT和双层自适应奖励函数HCD-GRPO,提升参考图与视频语义的精准对应。
北京大学与可灵团队提出RefCaptioner,通过后训练强化模型对参考图的识别与绑定能力,并构建结构化视频描述,解决多参考图场景下视频理解模型对应能力下降的问题。该方法采用混合数据SFT和双层自适应奖励函数HCD-GRPO,提升参考图与视频语义的精准对应。
主报道
主报道来源