AI 陪伴的下一站:实时视频角色与世界模型
聊天框里的 AI 正在走向实时视频角色。京东 JoyAI、Vidu S1 和《Whispers from the Star》指向同一个方向:陪伴感来自在场、记忆和可改变的世界。
下一个 AI 陪伴,不会只在聊天框里

这几天看京东 JoyAI-VL-Interaction、Vidu S1,还有蔡浩宇那款《Whispers from the Star》,我第一反应不是“视频模型又进步了”。更准确地说,是聊天产品终于开始离开那个白色输入框了。
过去的 AI 陪伴像发消息。你说一句,它回一句。哪怕角色设定再细,声音再甜,底层体验仍然是“轮到谁说话”。实时视频交互想解决的不是画质问题,而是另一个更细的东西:它要让用户相信,对面那个角色正在看着你、听着你、等着你,甚至会在你没开口时主动说一句。
这也是为什么“人类陪伴”会变成一个很大的赛道。效率工具帮人省时间,但省出来的时间并不会自动变成满足感。越多人把工作、学习、购物、创作都交给 AI,越会有人需要一个不评判、不离场、能随时接住情绪的对象。这个对象未必是真人,甚至未必必须像真人。它只要足够及时、足够连续、足够懂你,就会变成一种新的消费。
京东 JoyAI:重点不是会说,而是知道什么时候该说
京东开源的 JoyAI-VL-Interaction 是这一波里最值得技术人员仔细看的项目。它不是一个“虚拟女友产品”,而是一个实时视频语言交互模型。官方 README 说得很直接:8B 规模,视觉优先,摄像头或直播流接入后,模型可以实时观察并响应。
真正关键的点在于,它不是每秒把画面丢给一个大模型再让外部规则判断要不要回答。它把“说话、沉默、委托”这件事训练进模型本身。官方材料里写到,模型每秒都会自主做一个决策:开口、保持安静,或者把复杂问题交给后台模型/API/agent。
这件事对陪伴产品很重要。人在对话里感受到的陪伴,不只是对方答案好,而是对方有分寸。你切菜快切到手时,它应该立刻提醒;你只是低头发呆时,它不该一直插话;你问一个复杂问题,它可以一边继续看着画面,一边把问题交给更强的后台模型。这个“时机感”,比单轮回答更接近真人。
从公开资料看,JoyAI 的工程栈也比较清楚:视频编码降低长视频流 token 压力,ASR/TTS 作为可插拔模块,推理/WebUI/后台 agent 运行在标准 vLLM 基础设施之上。它的应用面更像“实时视觉交互底座”:直播解说、做饭指导、监控告警、实时翻译、游戏直播评论。情感陪伴只是它的一个自然分支。
Vidu S1:把“视频生成”改造成“视频通话”
Vidu S1 的方向更贴近用户感知。它的官网标题就是“Real-time, interactive next-gen video content creation”。用户可以选择 PGC 角色,也可以上传照片、选择或克隆声音,创建自己的角色,然后通过麦克风、摄像头开始视频通话。
官网披露了几个很硬的指标:540P、25FPS 实时生成,最高到 42FPS;语音驱动交互;支持长时间互动;角色可由人、动漫角色、宠物初始图生成;还提供 API 接入。这不是传统的“输入 prompt 等视频出片”,而是把生成视频变成一个流式接口。
这里的产品意义很大。视频模型过去更像剪辑软件:你给提示词,它给片段。S1 想做的是让角色“在线”。在线意味着低延迟、可打断、状态连续。你不是等一个视频文件,而是在和一个视觉对象共同度过一段时间。
但也要把话说清楚:公开资料没有说明 S1 的全部底层实现。更稳妥的判断是,它可能不是“每一帧都由一个完整世界模型从零生成”。现实可行的工程路径通常是混合式:角色身份由图像/视频模型保持一致,语音由 TTS/声音克隆流式输出,表情和口型由驱动模型生成,动作和镜头由轻量控制层调度,必要时再接入更重的视频生成模块。用户看到的是实时视频;系统里面很可能是一条拆得很细的低延迟流水线。
蔡浩宇的《Whispers from the Star》:它更像游戏,不像聊天软件
蔡浩宇团队 Anuttacon 的《Whispers from the Star》更有意思,因为它把 AI 陪伴放进了游戏结构里。公开报道和演示里,玩家通过文字、语音,甚至视频方式与 Stella 互动;Stella 的回答、情绪、行动和剧情走向会受到玩家输入影响。中文圈有人把它称作“AI 情感决策游戏”,这个说法比“AI 女友”更准确。
它最像的不是 Replika,而是一个只有一个重要 NPC 的生存游戏。玩家不是单纯调情,也不是完成任务列表,而是在一个“远距离陪伴”的设定里,通过对话影响角色的生存、情绪和选择。它把亲密关系、剧情分支、角色记忆、实时语音和游戏状态绑在一起。
这里有一个容易被误解的点:很多传播会说“实时生成视频”。但从目前公开资料看,不能简单理解为“所有画面都是视频大模型实时生成”。更可能的方案是游戏引擎实时演算画面,AI 负责对话、情绪、决策、口型、动作触发和剧情走向。也就是说,画面可以是实时的,角色反馈可以是实时的,但“视频画面是否完全由生成模型逐帧生成”,需要和营销说法分开看。
这并不削弱它的价值。相反,对陪伴产品来说,游戏引擎可能比纯视频生成更可靠。它能保持空间、角色、道具和任务状态,能让用户行为长期影响世界。这就是“世界模型”真正重要的地方:不是画面炫,而是世界记得你做过什么。

为什么“世界模型”会和陪伴绑在一起
OpenAI 在 Sora 技术报告里把视频生成模型称为通向世界模拟器的一条路。Google DeepMind 的 Genie 3 更直接:给一个文本提示,它可以生成可实时导航的动态世界,24FPS、720p,并在几分钟内保持一致性。Decart 的 Oasis 则用 Minecraft 式场景证明了另一件事:用户键盘输入可以直接影响一个由模型生成的视频世界,20FPS 实时输出。
这些研究离大规模消费级陪伴还有距离,但方向已经清楚。陪伴不只是角色说话,而是角色所在的世界能不能被用户改变。
如果 AI 角色只能回答“我理解你”,它是聊天机器人。如果它能看到你正在做什么,知道什么时候该沉默,记得你上次说过的事,并在一个连续世界里因为你的一句话改变行动,它就开始像一个陪伴对象。如果再往前一步,角色所在的房间、城市、星球能被你长期塑造,这就不只是陪伴 App,而是一个情感入口的虚拟生活空间。
市场已经在给钱了
陪伴需求不是概念。TechCrunch 引用 Appfigures 的数据称,截至 2025 年 7 月,全球 Apple App Store 和 Google Play 上仍活跃且有收入的 AI 陪伴应用有 337 个,其中 128 个在 2025 年发布。AI 陪伴应用全球累计下载 2.2 亿次,2025 年上半年下载 6000 万次,同比增长 88%。同一时期,这类应用上半年收入 8200 万美元,全年有望超过 1.2 亿美元;累计消费者支出已达 2.21 亿美元。
这组数字不算整个聊天机器人市场,只算“有拟人角色、朋友、恋人、幻想人物等人格化互动”的陪伴应用。它说明了两件事:第一,用户愿意为情绪关系付费;第二,这个市场还在早期,头部集中度很高,前 10% 应用拿走 89% 收入。
Sensor Tower 的 2025 AI 应用报告给了更大的背景:2025 年上半年,全球生成式 AI App 下载接近 17 亿,IAP 收入接近 19 亿美元;亚洲下载增长尤其快,H1 2025 相比 H2 2024 增长 80%。a16z 的消费者 AI Top 100 也把 Character.AI 列为少数连续多期在榜的“陪伴”代表。换句话说,陪伴不是小众异类,而是消费 AI 的稳定类别之一。
需求侧也不难理解。WHO 在 2023 年启动社会连接委员会时提到,社会孤立和孤独已经是全球公共健康问题。Technavio 对 AI companion app 的市场预测也把心理健康、数字 wellness、社交陪伴列为核心驱动。你可以不同意具体市场规模预测,但很难否认底层需求:人需要被回应,需要被看见,需要一个安全的出口。
真正的机会:不是做一个更会撒娇的 Bot
如果只看短期商业化,AI 女友、AI 男友、二次元角色会跑得最快。它们付费意愿强,内容刺激明确,也容易做增长。但更大的机会不应该被“虚拟恋人”四个字框住。
陪伴可以有很多形态。一个银发用户需要的是不催促他的生活助理;一个高压工作的年轻人需要的是能接住深夜情绪的倾听者;一个独居孩子需要的是安全、受控、不会诱导依赖的学习伙伴;一个游戏玩家需要的是会记住共同经历的 NPC;一个内容创作者需要的是能实时看画面、给反馈、陪他排练的搭档。
这些场景最后都会走向同一个技术要求:实时、多模态、可记忆、有分寸,并且越来越视频化。
我会怎么判断这个赛道
短期看角色:谁的设定更打动人,谁的声音更自然,谁的付费转化更高。中期看系统:谁能把语音、视觉、记忆、内容安全和低延迟成本压到可规模化。长期看世界:谁能让用户不是“来聊天”,而是“回到一个有人等他的地方”。
京东 JoyAI 证明了实时视觉交互的底座可以开源化;Vidu S1 把实时视频角色做成了直观产品;《Whispers from the Star》把 AI 陪伴放进游戏世界里。三条线看起来不同,实际上都在逼近同一个终点:AI 陪伴会从对话框,迁移到可看的角色、可持续的关系、可改变的世界。
这事儿不会因为模型更聪明就自动发生。它需要产品克制,也需要安全边界。越像真人,越不能只追求黏性;越能陪伴,越要防止操控。但方向已经很清楚了。AI 先替人做事,然后开始陪人。前者提高效率,后者接住效率之后留下的空白。
参考资料
- 京东 JoyAI-VL-Interaction GitHub / README:8B 实时视频语言交互模型、说话/沉默/委托决策、400 万时间对齐交互样本。
- Vidu S1 官方页:实时交互视频创作、角色视频通话、540P 25FPS、语音驱动、角色和声音自定义。
- OpenAI《Video generation models as world simulators》、Google DeepMind Genie 3、Decart Oasis:视频生成与可交互世界模型的技术方向。
- TechCrunch / Appfigures:AI companion apps 2025 年上半年收入 8200 万美元、累计下载 2.2 亿、全年收入预计超过 1.2 亿美元。
- Sensor Tower《State of AI Apps Report 2025》、a16z《Top 100 Gen AI Consumer Apps》、WHO social connection materials、Technavio AI Companion App Market forecast。
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment