Vivix发布实时交互多模态模型A1,实现与虚拟角色视频通话
Vivix发布了实时交互多模态模型A1,支持用户与虚拟角色进行实时视频通话,角色能根据语音输入即时做出动作和回应。同时推出W1模型,允许用户实时改变剧情走向。A1通过统一流式架构和高效推理,可在消费级GPU上运行,延迟低至0.6秒。
Vivix发布了实时交互多模态模型A1,支持用户与虚拟角色进行实时视频通话,角色能根据语音输入即时做出动作和回应。同时推出W1模型,允许用户实时改变剧情走向。A1通过统一流式架构和高效推理,可在消费级GPU上运行,延迟低至0.6秒。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
Vivix发布全球首个原生流式架构实时交互多模态模型A1,宣称近30B激活参数可在消费级GPU上实时推理,延迟低至0.6秒。技术细节与真实能力仍需验证。
Vivix将A1定位为全球首个在一套原生流式架构中统一多模态参考、实时交互和流式生成的基础模型。传统clip-based模型一次生成完整片段,而流式生成需在持续生成中维持角色、物体和场景的一致性,如同“一边铺铁轨,一边开火车”。A1通过因果时序建模和流式状态维护,让相邻动作保持连续,并在更长时间范围内维持角色身份、场景和物体关系。
在交互建模上,A1没有将ASR文本作为唯一中间表示,而是直接建模语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号。模型在约300ms的最小时间片内推理出最新响应token(“快思考”),而更上层的Director Agent负责“慢思考”——推理、思考、tool use,并异步给出长时序宏观行为控制。
视频扩散模型的实时性瓶颈来自采样步数。Vivix提出MJD(多维联合蒸馏),以8-Step版本为质量基线,将不同去噪阶段的能力共同压缩进2-Step模型。MJD同时优化短时生成质量、长时时序一致性和多模态分布对齐,并让学生模型学习教师模型更完整的动作分布,防止模型通过少动换取稳定。
据Vivix官网技术博客,MJD使视频扩散从8-Step压缩到2-Step推理,同时保持接近8-Step版本的短时画质、指令遵循、运动表现和长时稳定性。但这一结论基于Vivix自身测试,独立验证尚未公开。
A1有效激活参数接近30B,采用8x8x4的高质量压缩率,计算量远超此前小参数或大压缩比的实时模型。Vivix推出VMI(Vivix Model Infra),通过三步实现消费级GPU实时推理:Encoder与Decoder解耦、原生NVFP4训推协同、计算-通信-内存协同调度。
Encoder与Decoder解耦避免任务互相干扰;原生NVFP4训推协同让模型在训练阶段就适应4-bit数值分布,而非训练后直接量化,宣称生成质量接近无损;协同调度引擎将计算、通信和显存调度统一纳入推理执行图,实现单卡吞吐超过10000 video tokens/s,PCIe带宽利用率达88%+。
这些数据均来自Vivix内部测试,实际部署效果和通用性有待验证。
与A1同步推出的W1模型,旨在让用户不再只是旁观者,而是可以随时介入,改变人物的选择、行动以及剧情走向。Vivix展示了W1的“实时导演”能力,但技术细节未在博客中详述。W1与A1的关系、是否共享底层架构,目前尚不明确。
尽管Vivix宣称A1实现了“近似无损的消费原生NVFP4”和“消费级显卡实时生成”,但所有性能数据均来自Vivix自身测试,缺乏第三方独立验证。长期生成中的视觉漂移、误差累积和动作衰减问题是否真正解决,仍需实际体验检验。
此外,A1的“近30B激活参数”具体指代何种计算粒度(如每帧或每秒),以及消费级GPU的具体型号和配置,官方未明确说明。W1的实际能力和应用场景也缺乏详细技术支撑。
本文信息主要来源于Vivix官方技术博客及量子位报道,所有性能数据均为Vivix自测结果,未经第三方独立验证。部分技术细节(如MJD、VMI)描述来自官方,可能存在选择性披露。读者应审慎看待“全球首个”“近似无损”等宣称。
Vivix A1在实时交互多模态模型的技术路径上展现了系统性创新,尤其是统一流式架构、MJD蒸馏和消费级GPU部署方案。但近30B参数在消费级硬件上的实际表现、长期稳定性以及W1的实用性,仍需更多独立测试和用户反馈来验证。
主报道
主报道来源