Vivix 同天发布 Vivix-A1 与 Vivix-W1

Vivix 于 7 月 24 日发布 Vivix-A1 与 Vivix-W1。A1 面向能边听、边说、边行动的全身 AI 角色,W1 面向可被语音、文字、图片和触控持续改变的音视频世界;开发者平台已提供相关 API 文档,实时 W1 仍处于私测阶段。
Vivix-A1 与 Vivix-W1 实时交互多模态模型封面

两款模型处理两类实时互动

Vivix-A1 和 Vivix-W1 都采用流式生成,但解决的问题不同。A1 把交互集中在一个 AI 角色身上:角色可以在持续生成的画面里听取指令、说话、移动,并对场景中的物体采取行动。W1 把交互范围扩展到整个音视频世界,用户可以改变人物、物体、环境、镜头和后续事件。

这种方式与常见的“输入提示词,等待整段视频生成”不同。用户不必在开始前一次性给完条件。新输入可以在生成过程中加入,后面的画面和声音会沿着当前状态继续发展,而不是另起一段互不相干的视频。

Vivix-A1 让角色边听边行动

A1 是面向全身 AI 角色的实时全双工模型。“全双工”原本用于描述双方可以同时发送和接收信息的通信方式。在这里,它指角色说话和行动时仍能接收新输入,用户可以中途打断对话、改变要求,或让角色执行新的动作。

角色不只做口型和上半身手势。A1 支持在开放场景中走动、转身、拿取物品,并让表情、声音、视线、手势和全身动作共同构成回应。用户可以通过语音、文字和图片控制角色。图片也能在互动开始后加入,例如提供一张商品参考图,再让角色把对应物品带入场景并进行展示。

A1 直接在连续的多模态信号上生成回应。多模态指文字、声音、图片和视频等不同信息形式。它不要求所有声音先转换为文字,因此环境声音和语气也可以成为角色反应的条件。上层的 Director Agent 负责规划回答和动作,流式模型则持续生成画面与声音。

Vivix-W1 让故事在播放中改写

W1 面向互动叙事和持续生成的音视频世界。文字、图片、音频和视频既可以定义开场,也可以在故事进行中成为新条件。触屏、鼠标点击、角色移动和镜头控制同样可以改变接下来发生的内容。

W1 会联合生成画面、对白、环境声、空间音效、音乐和动作,并在同一条生成流中安排多镜头叙事。故事切换人物或场景时,模型可以同时处理镜头位置、对白节奏和角色反应。用户中途加入一张图片或选择画面中的物体后,新信息会并入已有情境,后续故事从当前状态继续。

W1 在约 300 亿激活参数的中等训练规模上完成验证。激活参数是模型处理一次输入时实际参与计算的参数数量,不等于模型的全部参数。它支持多模态理解、实时交互、音画联合生成、多镜头叙事和连续流式输出。

流式生成避免等待整段视频

A1 和 W1 都把音视频拆成较小的连续片段逐步生成。每个新片段会参考前面已经发生的内容,同时接收用户刚加入的指令。这样可以更快显示变化,但也增加了长期保持人物、场景、声音和动作一致性的难度。

A1 使用短片段之间的局部连续性信号,并用全局序列信息维持较长时间的角色和场景状态。它还通过多维联合蒸馏把推理压缩到两步。蒸馏是用规模更大或计算步骤更多的模型训练精简版本,以减少每次生成所需的计算。

W1 使用 Vivix-Turbo 降低流式生成的推理步数,并联合优化镜头规划、时间连续性和多模态参考的一致性。它需要同时控制人物身份、场景、镜头、声音和动作,避免故事持续时间变长后逐渐偏离此前状态。

开发者可以从 A1 API 开始接入

Vivix 开发者平台提供实时角色和异步视频生成两类接口。实时角色使用 vivix-a1-stream 或轻量版 vivix-a1-stream-lite,开发者先通过 REST 创建会话,再用实时媒体流接收音视频,并通过 WebSocket 控制通道发送文字、动作和其他交互事件。

只需要生成一份完整视频文件时,可以使用异步接口。A1 系列包含 vivix-a1-litevivix-a1,W1 系列包含 vivix-w1-fastvivix-w1。开发者提交任务后查询处理状态,完成后取得视频播放地址。

面向实时互动世界的 vivix-w1-stream 仍处于 private beta。开发者可以在官网注册账号、创建 API Key,并通过等待名单申请模型权限。API Key 应保存在服务端,不能直接放进网页或移动应用。

两款模型各有已公开的使用边界

A1 在快速运动、空间导航和精细的人物与物体交互中,可能出现动作不一致、交互位置漂移或物理关系不准确。它更适合先从客服角色、现场表演、互动教学和商品讲解等边界清楚的场景开始验证。

W1 当前版本在专业级画面质量、复杂动作和高密度场景上,与面向离线成片训练的视频模型仍有差距。需要稳定成片和精细后期控制的项目,可以先使用异步生成;需要观众在播放中改变角色或故事时,再评估实时流式模型。