返回信息流
新闻事件
S信号86
机器之心
1 个来源

RefCaptioner:让参考图与视频语义精准对应

北京大学与可灵团队提出RefCaptioner,通过后训练强化模型对参考图的识别与绑定能力,并构建结构化视频描述,解决多参考图场景下视频理解模型对应能力下降的问题。该方法采用混合数据SFT和双层自适应奖励函数HCD-GRPO,提升参考图与视频语义的精准对应。

主报道

机器之心

主报道来源