返回信息流
新闻事件
极客公园
1 个来源

Vivix 发布全球首个实时交互多模态模型 A1 和 W1

7 月 24 日,AI 公司 Vivix 正式发布两款实时交互多模态模型 A1 和 W1,参数约 30B,支持实时全双工交互、全身表演和物体交互,延迟低于 0.6 秒,推理成本大幅降低。该模型将 AI 视频从固定内容生成推向持续互动体验,可应用于虚拟导游、销售等场景。

SynthePulse Insight · AI 深度解读

Vivix 发布实时交互多模态模型:AI 视频从“生成内容”走向“生成互动”

版本 1 · 1 个来源

7 月 24 日,AI 公司 Vivix 发布两款激活参数约 30B 的实时交互多模态模型 A1 和 W1,声称实现端到端首次反应延迟低于 1.7 秒,实时视频推理成本一年内降低两个数量级。这标志着实时交互多模态技术从实验室走向真实应用。

  • Vivix 发布 A1 和 W1 两款实时交互多模态模型,激活参数约 30B,是全球首个集合多模态参考、原生交互和流式视频生成的基座模型。
  • A1 面向交互式 AI 角色,支持全身动作、物体交互、空间移动、实时全双工交互及动态图片输入,角色可边听边说边行动。
  • W1 将交互扩展到整个场景和故事,支持原生音画联合生成、多模态参考和原生多镜头叙事,用户可实时改变故事走向。
  • 技术底座包括 Vivix-Turbo(超低步数蒸馏)和 Vivix Infra(实时推理系统),实现流式生成与低延迟响应。
  • 官方报告称可见反应延迟低于 0.6 秒,端到端 TTFR 低于 1.7 秒;实时视频推理成本一年内降低两个数量级,接近主流视频平台 CDN 带宽成本。
  • Vivix 成立于 2025 年初,已完成 A 轮融资,历史股东包括 IDG、红杉、蓝驰、5Y、Monolith 及战略投资人京东和阿里。
展开章节目录A1:从“会说话的脸”到“会行动的角色”

A1:从“会说话的脸”到“会行动的角色”

Vivix 将 A1 定义为首个面向交互式 AI 角色的实时全双工模型。其核心能力包括:角色可走动、拿取物品、完成全身表演;支持实时全双工交互,用户可随时插话;自然表情与情绪随对话实时变化;互动过程中可动态加入新图片。

这些能力通过原生多模态生成循环实现:Director Agent 作为实时导演,负责判断角色行为并保持上下文;视频采用流式生成,每次生成一小段,通过局部连续性和全局序列先验维持一致性;多维联合蒸馏将推理过程压缩至两步,降低计算量。

W1:实时改变整个故事

W1 将交互从单个角色扩展到人物、物体、场景、镜头、声音和事件。它支持原生音画联合生成(画面与声音同步生成)、多模态参考(文字、图片、音频、视频共同影响生成)以及原生多镜头叙事(自动切换视角和镜头)。

W1 同样采用流式生成,用户中途加入的语音、图片、触控或镜头操作可实时改变后续故事。Vivix-Turbo 通过超低步数蒸馏减少推理步骤,并结合镜头规划和时间连续性优化,保持人物、场景和镜头的稳定。

技术底座:Vivix-Turbo 与 Vivix Infra

Vivix-Turbo 提高生成速度和稳定性,Vivix Infra 则让输入处理、音视频生成、解码和推流同时运行,缩短响应时间并降低长期运行成本。用户中途改变想法时,系统直接调整后续生成,保留已发生内容和上下文,无需从头计算。

官方报告给出的可见反应延迟低于 0.6 秒,计入网络传输和直播推流后,端到端 TTFR 低于 1.7 秒。实时视频推理成本在过去一年内降低两个数量级,已接近主流视频平台每小时 CDN 带宽成本量级。

Vivix 的愿景与融资背景

Vivix 成立于 2025 年初,已完成 A 轮融资,历史股东包括 IDG、红杉、蓝驰、5Y、Monolith 以及战略投资人京东和阿里。公司瞄准实时互动体验的空白,希望用实时交互模型补上真人实时在线与预录内容之间的缺口。

Vivix 认为互动必须带来大幅体验增益,如更强的沉浸感和更真实的反馈。A1 处理“人”,W1 加入“场景”和“时间”,Infra 确保变化及时呈现并控制成本。AI 生成的内容不再只是等待观看,而是可以在用户进入后继续生长。

可信度边界

本文信息主要来源于极客公园对 Vivix 产品发布的报道,其中性能数据(延迟、成本)来自官方报告,属于 source_claim。Vivix 的融资信息来自报道,未提供独立验证。模型能力描述基于官方演示和声明,实际效果有待第三方评测。

核心结论

Vivix 的 A1 和 W1 模型标志着实时交互多模态技术的重要进展,但性能数据仍需独立验证。其核心创新在于将 AI 视频从单向生成转变为双向互动,可能重塑内容创作和用户体验。

主报道

极客公园

主报道来源