是专注实时互动多模态模型的AI创作平台,核心产品包括: Vivix-A1 ,全球首个实时全双工模型,可生成有全身动作、能听、能说、能做的交互式AI角色; Vivix-W1 ,流式原生多模态模型,可通过语音、文字、触控实时改变剧情走向的互动叙事引擎及实时视频运行时Vivix IVI。Vivix自研MJD蒸馏、NVFP4量化与VMI推理引擎,实现近30B参数模型在消费级GPU上实时运行,交互延迟低于1秒,Vivix-A1 已开放API。
全身角色生成 :Vivix-A1 可实时生成会行走、转身、拿取物体、跳舞的全身 AI数字人 。
全双工实时交互 :用户可随时语音打断,角色的动作、表情与回应即时改变,无需中断重生成。
音画同步输出 :语音、表情、手势、环境声原生统一建模,无拼接痕迹。
互动叙事生成 :Vivix-W1 输入一句话可生成持续演进的音视频故事,用户可实时改变剧情走向。
多模态输入 :支持语音、文字、图片、点击、触控等多种方式参与互动。
直播电商应用 :数字主播可自由走动、展示商品,运营人员可实时语音调整直播方向。
超低延迟 :首帧延迟小于 0.6 秒,打断响应 300–900 毫秒,端到端延迟小于 1.7 秒。
消费级硬件实时运行 :近 30B 激活参数模型通过 MJD 蒸馏与 NVFP4 量化,可在消费级 GPU 上单卡实时推理,成本低于每小时 1 美元。
注册获取 API Key :访问 Vivix API 开放平台 https://platform.vivix.ai/ ,注册账号,在开发者后台创建 API Key,所有请求以 https://api.vivix.ai 为 base URL 并携带 Bearer 认证。
选择模型 :按需求选 A 系列(实时 Avatar 交互或脚本驱动 Avatar 视频)或 W 系列,如 vivix-a1-stream 、 vivix-w1-stream 等。
创建会话 :通过 REST 接口 POST /v1/realtime-avatar/sessions ,配置模式、角色形象图、音色、人设指令、语音识别(如 server_vad)等参数。
建立实时连接 :拿到返回的 session_id 后,通过 WebSocket 控制通道( wss://api.vivix.ai/v1/realtime-avatar/control )操控会话,音画输出通过 RTC(TRTC)流传输。
驱动交互 :把用户语音或文字写入对话上下文,Avatar 实时生成回复并以语音、视频、逐字字幕流式输出,支持中途打断。
实时干预 :通过 Streaming Control 接口可在生成中切换图片/角色、发送动作指令或直接脚本音频,无需中断重来。
W1 世界玩法 :以开放事件(Event)驱动剧情,事件可在生效前取消,会话支持 hold/pause 与 resume,随时插入新事件改变故事走向。
真全双工交互 :突破”半双工”请求-响应模式,模型在持续生成音视频的同时能随时接住新输入并即时改变内容。
全身角色行动力 :A1 是首个支持完整全身动作生成的实时模型,角色能行走、转身、拿取物体,而不只是固定机位对口型。
原生多模态架构 :语音、文字、图片在统一信号空间中建模,绕开 ASR+LLM+TTS 级联,感知直接驱动行为,音画动作自然同步。
超低延迟 :首帧延迟 < 0.6 秒、打断响应 300–900 毫秒、端到端 < 1.7 秒,交互延迟低于 1 秒。
大参数 + 消费级实时运行 :近 30B 激活参数配合 8x8x4 高质量压缩率,通过 MJD 蒸馏与训练期 NVFP4 量化,在消费级 GPU 上单卡跑出超 10,000 video tokens/s,推理成本低于每小时 1 美元。
原生可打断的流式架构 :因果生成 + VMI 编解码解耦设计,新指令直接在解码链路追加,当前生成无需中断重来。
直播电商 :数字主播全身出镜走动、试穿拿取商品,运营人员实时语音调整话术和选品,无需中断直播。
虚拟伴侣/AI 社交 :AI 女友/男友类应用,动作、表情、声音自然同步,用户可随时打断对话,角色即时应变。
互动影视/互动短剧 :输入一句话生成实时演进的故事,观众通过语音、点击参与剧情决策,开启”每个人都是导演”的观剧模式。
游戏 NPC 与开放世界 :赋予游戏角色自主感知和行动能力,玩家语音即可与 NPC 自然交互,推动开放世界叙事。
智能客服与虚拟导购 :7×24 小时在线的全身数字员工,能演示产品、答疑并实时响应客户需求,可嵌入网站/App/线下大屏。
专注漫剧创作的一站式AI智能制作平台
美图推出的AI视频短片创作平台
一站式 AI 漫剧与短剧创作平台
AI数字人视频生成平台,由出门问问推出
AI内容生成平台,一键创作AI视频、AI图像
一站式 AI 视频专业创作平台

