阿里云发布Wan3.0视频生成模型,开启公测
阿里云旗下万相团队发布了新一代视频生成模型Wan3.0,并开启公测。该模型支持单次生成30秒视频,并首次支持文档、表格等多种输入格式,旨在提升视频生成的时长、真实感和一致性。Wan3.0已在千问AI平台开放公测,API价格也已公布。
阿里云旗下万相团队发布了新一代视频生成模型Wan3.0,并开启公测。该模型支持单次生成30秒视频,并首次支持文档、表格等多种输入格式,旨在提升视频生成的时长、真实感和一致性。Wan3.0已在千问AI平台开放公测,API价格也已公布。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
阿里云发布Wan3.0,支持30秒视频生成、文档输入与全能参考,API价格公布,但声音与文字准确度仍有提升空间。
8月6日,阿里云宣布新一代视频生成模型Wan3.0开启公测,在千问AI平台上线,千问APP灰度开放。官方称其从生成时长、万能创作、全能参考与真实感等维度全面升级。
Wan3.0单次可生成30秒视频,支持智能时长推荐与视频延长功能,旨在从“生成一个镜头”走向“讲述一段完整的故事”。
Wan3.0在文本、图片、音频、视频四种模态之外,首次支持doc、xls、ppt、pdf、txt、key、pages、numbers、md等文档格式输入,最多一个文件或链接,文件不超过100MB、页数不超过50页。
官方称其具备强大的提示词工程与指令遵循能力,可将文档转化为教学课件、产品演示、动态图表等视频内容,使办公素材直接转化为视频。
Wan3.0力求准确还原真实世界,文生视频人像追求“千人千面”,刻画五官皮肤细节,情绪表达自然克制,群像场景也能呈现复杂情绪。
在全能参考任务中,可保持角色、道具、声音、空间关系、风格等关键维度的一致性,如五官、发型、服饰、道具Logo、场景站位等。视频编辑能力大幅提升,支持修改画面、剧情与台词。
官方列举了影视创作、广告营销、设计创意、文旅传播等应用场景,强调低成本、高效率。
API价格公布:480P/720P/1080P分别为0.3/0.6/1.2元/秒,接口将于近期全量开放。
本报道基于阿里云开发者官方公众号的发布,属于第一方来源,但内容为官方宣传,部分能力描述(如“千人千面”“精准复刻”)未经独立验证,且官方承认声音与文字准确度仍有不足。
Wan3.0通过30秒时长与文档输入扩展了视频生成的创作边界,但真实效果需待公测反馈验证,尤其声音与文字准确度是已知短板。
主报道
主报道来源