当题库追不上模型,AI开始给自己出题:中国团队跑通数据层RSI
由上海交大、深势科技和上海算法创新研究院组成的无尽前沿团队发布了BigBang-V1,这是首个基于递归自我改进(RSI)原生方式训练的基座模型。该模型在训练中完全由AI自主出题、解题和验证,无需人类逐题参与,在多项评测中超越更大规模的模型。
由上海交大、深势科技和上海算法创新研究院组成的无尽前沿团队发布了BigBang-V1,这是首个基于递归自我改进(RSI)原生方式训练的基座模型。该模型在训练中完全由AI自主出题、解题和验证,无需人类逐题参与,在多项评测中超越更大规模的模型。
SynthePulse Insight · AI 深度解读会员精读
版本 1 · 1 个来源
当人类出题速度成为AI进化的瓶颈,一支中国团队用100%AI合成数据训练出35B模型,在多项科研任务上超越1T级模型。其核心不是数据规模,而是一套让数据生产系统随模型共同进化的双层闭环。
硅谷今年最贵的词是Recursive Self-Improving(RSI),即让AI参与迭代自身的模型、算法、数据和研发流程。Jeff Dean离职创办的Discovery Loop探索AI自动化科学研究,AlphaGo缔造者David Silver等大牛也在同一条赛道,顶级AI研究者正形成共识:让AI参与创造下一代AI。
但共识之下有个棘手问题:模型越强,能给AI出题、解题、验证的人越少,高质量训练数据从哪来?传统做法要么给模型套工具外壳(如harness),底层训练管线不变;要么用大模型打分筛选,但评判标准是人类预先写死的,模型变强后旧标尺很快失效。训练数据仍由人类逐题生产,进化速度被人类出题速度卡住,这是RSI落地的核心问题之一。
由上海交大人工智能学院、深势科技、上海算法创新研究院组成的无尽前沿团队发布BigBang-V1,这是首个基于RSI原生方式训练的基座模型。训练中出题、解题、验证都交给AI,通过可验证前沿任务持续生成高质量自演进合成数据,全程无需人类逐题参与。
团队换了个角度:如果模型能自我改进,能否让训练数据生产系统本身也成为被优化的对象?问题从「如何收集更多科学数据」变成「如何让数据生产系统随模型能力持续进化」。数据质量不是清洗出来的,而是任务属性决定的。任务必须同时满足前沿性(位于知识或能力边界,无已知最优答案)和可验证性(能通过形式化方法、程序执行、数值计算等客观检查),二者缺一数据都会快速贬值。
科学领域恰好同时满足两大条件,天然组合搜索、阅读、假设、数学推导、代码开发、工具调用、实验分析等,相当于面向通用智能的综合课程。Jeff Dean说Discovery Loop适用于有可衡量目标的科学和工程领域,BigBang选科学当训练场,底层逻辑同源。
本文信息主要来自量子位的报道,属于二手转述,未提供独立验证。模型性能、评测分数、团队背景等均以报道为准,部分细节(如具体评测方法、复现过程)缺乏一手来源,读者应谨慎对待。
主报道
主报道来源