返回信息流
新闻事件
A重点85
机器之心
1 个来源

35B干赢万亿参数大模型!上交大AI开始给自己造题还能自我迭代了

上海交通大学等机构的研究团队发布了科研大模型BigBang-V1,该模型基于Qwen3.6-35B-A3B进行后训练,使用完全由AI合成的数据,在多项评测中达到35B规模最佳,甚至超越部分更大模型。其核心创新在于让AI参与创建、筛选和迭代自己的训练任务,实现自我进化,标志着AI开始参与决定下一代模型的学习内容。

SynthePulse Insight · AI 深度解读

35B模型如何超越万亿参数?上交大团队让AI自己出题、自己迭代

版本 1 · 1 个来源

当预训练数据逼近极限,AI的下一步进化或许不再依赖更大的模型,而是让AI参与创造自己的训练任务。上海交通大学等团队发布的BigBang-V1,用约一万条AI合成数据,在多项基准上超越了1.6T参数的DeepSeek V4 Pro Preview,其背后的数据自我进化机制,可能预示着AI研究的新方向。

  • BigBang-V1基于Qwen3.6-35B-A3B后训练,训练数据完全由AI合成,仅约一万条。
  • 在35B规模模型中,BigBang-V1在10项评测中取得最高分,并在FrontierScience Research等任务上超越1.6T参数的DeepSeek V4 Pro Preview。
  • BigBang框架包含内外两层循环:内层由Generator和Critic Agent持续生成和筛选任务,外层用真实任务评测校准数据价值。
  • 团队称这是“数据层面的早期递归自我改进”,但完整RSI仍需AI自主改进研发能力。
展开章节目录数据瓶颈:人类专家出题速度跟不上模型消耗

数据瓶颈:人类专家出题速度跟不上模型消耗

Ilya Sutskever曾指出,预训练数据终将耗尽,单纯将训练规模放大100倍难以带来根本性变化。随着模型能力接近人类专家,下一批真正有价值的训练任务从何而来成为关键问题。

模型缺的不只是题,而是“题目加反馈”:足够前沿且可验证的任务才能形成稳定训练信号。科学领域因提供形式化证明、程序执行等多种验证手段,成为BigBang选择的交汇点。

BigBang框架:让AI参与造题、审题和迭代

BigBang的技术框架包含内外两层循环。内层由Generator Agent和Critic Agent组成:Generator以代码Agent形式工作,可修改、执行和调试数据合成程序;Critic负责两层审查,先检查基本约束,再评估高阶质量。

外层循环用于校准Critic的偏差:系统用不同版本的数据管线训练模型,在真实研究任务中评测,Meta-Critic比较Critic预判与实际能力变化,调整下一轮合成策略。

这一飞轮机制让数据生产系统随模型能力共同演化,优化对象从单条样本扩展至整套数据生产程序。

实验结果:小模型跨越规模,能力迁移至搜索与代码

BigBang-V1后训练使用约一万条AI合成数据,在11项评测中10项超过基础模型。在FrontierScience Research上获46.2分,超过DeepSeek V4 Pro Preview的40.7分;在Humanity's Last Exam上为50.3分,后者为48.2分。

在BrowseComp上取得76.5分,SWE-Bench Pro上54.2分,均较基础模型明显提高。团队认为,搜索和代码能力的同步增长说明模型学到的是跨领域的问题解决流程,而非单纯科学知识。

案例显示,在病毒识别任务中,BigBang-V1三次运行均收敛到Norovirus,而DeepSeek V4 Flash Preview三次给出不同答案;在椭圆积分任务中,BigBang-V1完成了完整解析推导,而DeepSeek V4 Pro Preview虽结果正确但依赖现成函数。

定位与局限:数据层面的早期递归自我改进

BigBang并非先例,Absolute Zero和AlphaEvolve已让AI自主提出可验证任务。BigBang的不同在于将任务生成程序、分布和评价标准共同纳入优化,并用真实任务收益校准合成管线。

论文称其为“数据层面的早期递归自我改进”。完整RSI通常指AI自主改进研发能力并训练更强继任模型,BigBang目前展示的是数据管线与模型能力的共同演化,是阶段性方案。

可信度边界

本文信息主要来自机器之心报道,属于二手来源。所有性能数据、模型细节均来自该报道,未经独立验证。部分结论(如能力迁移)为团队推断,需谨慎对待。

核心结论

BigBang-V1展示了不扩大模型规模、仅改变训练数据生产方式即可显著提升能力的可能性,其数据自我进化机制为后Scaling Law时代提供了新思路,但距离完整RSI仍有距离。

主报道

机器之心

主报道来源