Vivix是什么
Vivix 是前商汤高管刘宇创立的AI创新企业发布的全球首个实时交互多模态基座模型 Vivix-A1 与 Vivix-W1。两款模型均采用约30B激活参数的统一流式架构,将多模态参考、原生交互与流式视频生成整合于单一模型中,支持用户通过语音、文字、触控等方式实时介入并改变AI角色动作与剧情走向。端到端首次反应延迟低于1.7秒,推理成本在一年内降低两个数量级,已接近主流视频平台CDN带宽成本,可在消费级GPU上实现实时推理。
Vivix的主要功能
-
实时全双工交互:AI 角色在说话或行动过程中,用户可随时通过语音、文字插话或更换话题,角色即时响应,无需等待当前轮次结束,实现真正的人机双向对话。
-
全身角色与动作生成:角色不仅能说话,还能实时行走、转身、拿取物品、与环境进行物理交互,支持写实人物、3D 角色和动漫形象等多种风格。
-
原生音画联合生成:画面、对白、环境音与音效同步生成,无需单独音频模型后补,实现视听一体化输出,确保口型、动作与声音高度匹配。
-
多模态动态参考:支持语音、文字、图片等多种输入方式,且图片可在互动过程中动态加入,角色能根据新素材实时调整讲解内容与动作表现。
-
原生多镜头叙事:模型可自主切换视角、移动镜头,处理对白节奏与人物反应,实现电影级的实时导演与叙事能力。
-
流式持续生成:采用小段流式生成方式,上一段内容作为下一段基础,支持故事长期演进而不漂移,保证长时间交互的连贯性。
-
极低延迟响应:流式调度器处理新输入最短仅需 300 毫秒,用户输入到画面首次可见反应平均低于 0.6 秒,端到端首次反应时间(TTFR)低于 1.7 秒。
-
消费级 GPU 实时运行:通过 MJD 多维联合蒸馏、原生 NVFP4 训推协同与 VMI 推理引擎优化,30B 参数模型可在消费级显卡上实现实时推理。
如何使用Vivix
-
访问官网申请内测:前往Vivix的官网 https://vivix.ai/ 或 API 开放平台提交体验申请。
-
选择模型与场景:根据需求选择 Vivix-A1(角色实时交互)或 Vivix-W1(互动叙事/世界生成)。
-
输入参考素材:上传角色图片、场景描述或语音指令,确定故事或角色的初始状态。
-
实时互动介入:通过语音、文字、点击或触控与AI角色/故事进行双向交流,随时改变剧情或角色行为。
-
动态调整与导出:在流式生成过程中追加新图片或修改指令,系统将实时重定向后续内容,无需从头生成。
Vivix的核心优势
-
极低延迟:流式调度器响应新输入最短仅需300毫秒,用户输入到画面首次可见反应平均低于0.6秒,端到端TTFR低于1.7秒。
-
消费级GPU实时运行:通过MJD多维联合蒸馏、原生NVFP4训推协同与VMI推理引擎,将30B参数模型压缩至2步推理,实现消费级显卡单卡超10,000 video tokens/s。
-
成本大幅降低:推理与基础设施成本在一年内降低两个数量级(约100倍),实时生成成本已接近YouTube每小时约0.2美元的CDN带宽成本。
-
非级联原生架构:摒弃传统ASR+LLM+TTS拼接管线,采用端到端原生多模态生成循环,交互更自然、延迟更低。
-
长期一致性保障:通过局部连续性衔接与全局序列先验,维持人物、背景、声音和动作的长期稳定,避免长时间生成后画面漂移。
Vivix的同类竞品对比
| 对比维度 | Vivix | 智谱 GLM-Realtime |
|---|---|---|
| 模型定位 | 全球首个实时交互多模态基座模型 | 端到端音视频通话多模态模型 |
| 核心架构 | 统一流式架构,约30B激活参数,端到端原生多模态生成循环 | 端到端多模态模型,跨文本/音频/视频实时推理 |
| 实时交互模式 | 全双工实时交互,用户可随时插话改变角色动作与剧情 | 低延迟视频理解与语音交互,支持实时打断 |
| 视频能力侧重 | 生成式:AI实时生成角色动作、场景与镜头叙事 | 理解式:实时理解用户摄像头画面并语音回应 |
| 记忆时长 | 流式持续生成,支持故事长期演进与一致性保持 | 2分钟内容记忆 |
| 延迟表现 | 流式调度器300ms,画面首次可见<0.6s,端到端TTFR<1.7s | 低延迟(强调”近乎实时”,具体数值未公开) |
| 生成模态 | 画面+对白+环境音+音效同步生成(音画联合) | 语音+文本输出(基于视频理解) |
| 角色/动作生成 | 支持全身角色行走、转身、拿取物品、物理交互 | 无(侧重理解用户视频而非生成角色) |
| 多模态输入 | 语音、文字、图片、触控/点击 | 视频、音频、文本 |
| 硬件要求 | 消费级GPU可实时运行(单卡超10,000 video tokens/s) | 云端API调用,无本地硬件要求 |
| API开放情况 | W1已开放API,A1开放内测申请 | 已上线智谱开放平台,按分钟计费 |
| 定价参考 | 推理成本一年内降低约100倍,接近CDN带宽成本 | 音频0.18–0.3元/分钟,视频1.2–2.1元/分钟 |
| 特色功能 | 电影级多镜头自主切换、角色风格自定义(写实/3D/动漫)、环境物理交互 | 清唱功能、Function Call工具调用、口语陪练、面试模拟 |
Vivix的适用人群
-
游戏开发者:需要构建开放世界剧情、实时NPC交互与动态叙事的游戏工作室。
-
直播与内容创作者:希望打造实时互动数字人、虚拟主播或沉浸式直播体验的团队。
-
房产与电商营销:需要AI销售/导购进行线上带看、商品展示与实时答疑的企业。
-
教育与文旅机构:开发虚拟导览、互动讲解、沉浸式研学内容的机构。
-
AI研究者与开发者:关注实时多模态生成、流式架构与低延迟推理技术的前沿技术人员。
© 版权声明
本站文章版权归 AI工具集 所有,未经允许禁止任何形式的转载。
相关文章
暂无评论...