返回信息流
新闻事件
A重点76
阿里云开发者
1 个来源

阿里云发布Wan3.0视频生成模型,开启公测

阿里云旗下万相团队发布了新一代视频生成模型Wan3.0,并开启公测。该模型支持单次生成30秒视频,并首次支持文档、表格等多种输入格式,旨在提升视频生成的时长、真实感和一致性。Wan3.0已在千问AI平台开放公测,API价格也已公布。

SynthePulse Insight · AI 深度解读

Wan3.0公测:30秒视频生成与文档输入,视频模型迈向生产力工具

版本 1 · 1 个来源

阿里云发布Wan3.0,支持30秒视频生成、文档输入与全能参考,API价格公布,但声音与文字准确度仍有提升空间。

  • Wan3.0开启公测,单次可生成30秒视频,支持智能时长与视频延长功能。
  • 支持文本、图片、音频、视频及doc、xls、ppt、pdf、md等文档格式输入,文件不超过100MB、50页。
  • 强调真实感与一致性,人像千人千面,角色、道具、场景、风格等维度保持稳定。
  • API价格:480P/720P/1080P分别为0.3/0.6/1.2元/秒,接口近期全量开放。
  • 官方承认声音质感与文字准确度仍有进步空间。
展开章节目录公测与核心升级

公测与核心升级

8月6日,阿里云宣布新一代视频生成模型Wan3.0开启公测,在千问AI平台上线,千问APP灰度开放。官方称其从生成时长、万能创作、全能参考与真实感等维度全面升级。

Wan3.0单次可生成30秒视频,支持智能时长推荐与视频延长功能,旨在从“生成一个镜头”走向“讲述一段完整的故事”。

万物皆可生视频:文档输入与指令遵循

Wan3.0在文本、图片、音频、视频四种模态之外,首次支持doc、xls、ppt、pdf、txt、key、pages、numbers、md等文档格式输入,最多一个文件或链接,文件不超过100MB、页数不超过50页。

官方称其具备强大的提示词工程与指令遵循能力,可将文档转化为教学课件、产品演示、动态图表等视频内容,使办公素材直接转化为视频。

真实感与一致性

Wan3.0力求准确还原真实世界,文生视频人像追求“千人千面”,刻画五官皮肤细节,情绪表达自然克制,群像场景也能呈现复杂情绪。

在全能参考任务中,可保持角色、道具、声音、空间关系、风格等关键维度的一致性,如五官、发型、服饰、道具Logo、场景站位等。视频编辑能力大幅提升,支持修改画面、剧情与台词。

应用场景与定价

官方列举了影视创作、广告营销、设计创意、文旅传播等应用场景,强调低成本、高效率。

API价格公布:480P/720P/1080P分别为0.3/0.6/1.2元/秒,接口将于近期全量开放。

可信度边界

本报道基于阿里云开发者官方公众号的发布,属于第一方来源,但内容为官方宣传,部分能力描述(如“千人千面”“精准复刻”)未经独立验证,且官方承认声音与文字准确度仍有不足。

核心结论

Wan3.0通过30秒时长与文档输入扩展了视频生成的创作边界,但真实效果需待公测反馈验证,尤其声音与文字准确度是已知短板。

主报道

阿里云开发者

主报道来源