返回信息流
新闻事件
A重点83
机器之心
2 个来源

智象未来发布全球首款原生全模态交互式世界模型HiDream-O1-World,登顶WBench评测

智象未来今日发布了全球首款原生全模态交互式世界模型HiDream-O1-World,该模型基于自研UiT架构,支持文本、图像、交互等多模态输入,能够生成具备长时空一致性和物理一致性的动态世界。在美团LongCat与复旦大学联合推出的WBench评测中,HiDream-O1-World首次参评便登顶Navi分榜,物理维度得分73.3,一致性维度得分88.0,综合排名第一。这一发布标志着AI内容生成从单向输出向可交互、可探索的世界模型迈进。

SynthePulse Insight · AI 深度解读会员精读

HiDream-O1-World登顶WBench:从“生成内容”到“构造世界”的范式跃迁

版本 1 · 1 个来源

智象未来发布全球首款原生全模态交互式世界模型HiDream-O1-World,基于自研UiT架构,在WBench评测中物理与一致性双项第一。本文拆解其技术路线、评测成绩与产业影响。

  • 智象未来发布HiDream-O1-World,宣称全球首款原生全模态交互式世界模型,支持文本、图像、交互等多模态输入。
  • 在美团LongCat与复旦联合推出的WBench基准中,HiDream-O1-World首次参评即登顶Navi分榜,物理维度73.3分、一致性88.0分,均列第一。
  • 自研UiT架构摒弃独立文本编码器,将图像像素、文本Token、视频体素等统一映射到共享Token空间,实现跨模态统一推理。
展开章节目录从单向生成到可交互世界:范式转变

从单向生成到可交互世界:范式转变

过去三年AI内容生成行业经历了从文生图到文生视频的迭代,但本质仍是用户提供提示词、模型输出内容、用户观看的单向范式。这种范式生产的是内容而非世界,用户始终是旁观者,无法进入或改变画面空间。业界已意识到这一局限,谷歌、World Labs等投入大量资源探索世界模型,但争议在于现有产品究竟在构造世界还是仅渲染画面。

智象未来给出的答案是发布HiDream-O1-World,宣称全球首款原生全模态交互式世界模型。该模型支持文本、图像、交互等多模态输入,可生成具备长时空一致性和物理一致性的动态世界。用户能以第一、第三人称视角自由漫游,实时编辑角色和场景,覆盖写实城市、自然地貌、二次元、幻想世界、3A游戏风格等多种风格。

限时免费

继续阅读完整分析

还有 4 节深入分析和完整结论

加载中

可信度边界

本文信息主要来自机器之心对智象未来发布会的报道,属于厂商发布与第三方评测的混合来源。WBench评测成绩为第三方基准结果,但具体评测细节未披露;ECCV 2026录用信息为厂商声明,未经独立验证。所有技术能力描述均基于厂商宣称,实际效果需独立复现。

主报道

机器之心

主报道来源

同一事件报道

另有 1 个来源报道