Vivix 发布全球首个实时交互多模态模型 A1 和 W1
7 月 24 日,AI 公司 Vivix 正式发布两款实时交互多模态模型 A1 和 W1,参数约 30B,支持实时全双工交互、全身表演和物体交互,延迟低于 0.6 秒,推理成本大幅降低。该模型将 AI 视频从固定内容生成推向持续互动体验,可应用于虚拟导游、销售等场景。
7 月 24 日,AI 公司 Vivix 正式发布两款实时交互多模态模型 A1 和 W1,参数约 30B,支持实时全双工交互、全身表演和物体交互,延迟低于 0.6 秒,推理成本大幅降低。该模型将 AI 视频从固定内容生成推向持续互动体验,可应用于虚拟导游、销售等场景。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
7 月 24 日,AI 公司 Vivix 发布两款激活参数约 30B 的实时交互多模态模型 A1 和 W1,声称实现端到端首次反应延迟低于 1.7 秒,实时视频推理成本一年内降低两个数量级。这标志着实时交互多模态技术从实验室走向真实应用。
Vivix 将 A1 定义为首个面向交互式 AI 角色的实时全双工模型。其核心能力包括:角色可走动、拿取物品、完成全身表演;支持实时全双工交互,用户可随时插话;自然表情与情绪随对话实时变化;互动过程中可动态加入新图片。
这些能力通过原生多模态生成循环实现:Director Agent 作为实时导演,负责判断角色行为并保持上下文;视频采用流式生成,每次生成一小段,通过局部连续性和全局序列先验维持一致性;多维联合蒸馏将推理过程压缩至两步,降低计算量。
W1 将交互从单个角色扩展到人物、物体、场景、镜头、声音和事件。它支持原生音画联合生成(画面与声音同步生成)、多模态参考(文字、图片、音频、视频共同影响生成)以及原生多镜头叙事(自动切换视角和镜头)。
W1 同样采用流式生成,用户中途加入的语音、图片、触控或镜头操作可实时改变后续故事。Vivix-Turbo 通过超低步数蒸馏减少推理步骤,并结合镜头规划和时间连续性优化,保持人物、场景和镜头的稳定。
Vivix-Turbo 提高生成速度和稳定性,Vivix Infra 则让输入处理、音视频生成、解码和推流同时运行,缩短响应时间并降低长期运行成本。用户中途改变想法时,系统直接调整后续生成,保留已发生内容和上下文,无需从头计算。
官方报告给出的可见反应延迟低于 0.6 秒,计入网络传输和直播推流后,端到端 TTFR 低于 1.7 秒。实时视频推理成本在过去一年内降低两个数量级,已接近主流视频平台每小时 CDN 带宽成本量级。
Vivix 成立于 2025 年初,已完成 A 轮融资,历史股东包括 IDG、红杉、蓝驰、5Y、Monolith 以及战略投资人京东和阿里。公司瞄准实时互动体验的空白,希望用实时交互模型补上真人实时在线与预录内容之间的缺口。
Vivix 认为互动必须带来大幅体验增益,如更强的沉浸感和更真实的反馈。A1 处理“人”,W1 加入“场景”和“时间”,Infra 确保变化及时呈现并控制成本。AI 生成的内容不再只是等待观看,而是可以在用户进入后继续生长。
本文信息主要来源于极客公园对 Vivix 产品发布的报道,其中性能数据(延迟、成本)来自官方报告,属于 source_claim。Vivix 的融资信息来自报道,未提供独立验证。模型能力描述基于官方演示和声明,实际效果有待第三方评测。
Vivix 的 A1 和 W1 模型标志着实时交互多模态技术的重要进展,但性能数据仍需独立验证。其核心创新在于将 AI 视频从单向生成转变为双向互动,可能重塑内容创作和用户体验。
主报道
主报道来源