塔斯娱乐资讯网

Sam Altman前段时间在一个播客里说:我们现在已经在奇点之中了。 当然,不是科幻电影里天崩地裂的那种奇点,而是一种温和的过程:新能力出现,刚开始大家觉得震撼,很快就习惯了,再过一阵觉得理所当然。 最近,一家叫Vivix的公司发布的实时互动模型,让我切实感受到了这一点。 它做了一个叫Vivix-A1 ​

Sam Altman前段时间在一个播客里说:我们现在已经在奇点之中了。

当然,不是科幻电影里天崩地裂的那种奇点,而是一种温和的过程:新能力出现,刚开始大家觉得震撼,很快就习惯了,再过一阵觉得理所当然。
最近,一家叫Vivix的公司发布的实时互动模型,让我切实感受到了这一点。它做了一个叫Vivix-A1的实时互动模型,思路跟整个AI视频赛道都不一样。
奇迹变成日常,日常变成底线。往前看永远觉得还没到,往回看才发现早就过了。
1过去一整年,AI视频赛道的竞争烈度不用多说。但几乎所有团队都在同一个方向上发力:画面更清晰,物理更真实,时序更连贯。
所有AI视频模型都是需要先输入一条指令,等几秒到几十秒,拿到一段成品视频,然后去看。但它其实锁死了一整类产品形态。
前段时间,有个做AI陪伴App的朋友跟我讲了他的技术架构。为了让产品里的虚拟角色能跟用户实时对话和互动,他的团队先后接入了四套模型。四套模型之间要做数据格式转换,要处理延迟并维护兼容性,团队折腾了两个多月才跑通。
但用户说一句话,角色要愣两三秒才有反应,而且只有脸在动,身体是僵的。
目前市面上很多号称能互动的AI数字人产品,底层架构都是类似的拼接方案。效果好一点的延迟压到一秒出头,差一点的三四秒也很常见。包括一些实时互动的模型,也都有非常僵的纸片人感。
而且不管怎么优化,一个根本性的限制始终存在:角色的能力上限,被这套拼接架构里最弱的那一环决定。
视频驱动模型只能驱动面部,角色就只能坐着说话。LLM的响应慢了半秒,整条链路的延迟就多半秒。
这是一个很经典的系统工程困境。当你把多个独立模块串联起来的时候,整体性能不取决于最强的那个模块,而取决于最弱的那个。
2而Vivix-A1的做法完全不同。它不拼模型,听、说、理解、全身动作、物体交互,全部整合在同一个模型的同一个生成环里。
它是一个持续运行的环:在角色行动和说话的同时,模型同步接收你的输入,然后在几百毫秒内改变角色接下来的行为和画面。
打个比方,传统方案像是你跟四个翻译接力传话,每个翻译只负责一段,中间每一次交接都有等待时间。
Vivix-A1更像是你直接跟一个母语者面对面聊天,对方同时在听你说话、在理解、在回应、在做手势,这些事是并行发生的。
你给它一张半身图,角色就能站起来走路、转身,弯腰去拿桌上的东西。你可以在它行动的过程中随时发新指令,语音、文字、图片都可以。它说话说到一半你打断了,它马上停下来处理你的新要求。
换句话说,Vivix完全换了一个维度:把AI视频从被观看的内容变成可以被实时参与的体验。
3而且,前面说的模型拼接方案,需要同时维护四套模型的接口、版本、兼容性、延迟优化,还要处理它们之间的数据流转。
对一个五六人的小团队来说,工程负担非常重。很多有想法的开发者和产品负责人,不是不知道AI互动角色有市场,而是被实现成本挡在了门外。
但Vivix-A1是以API形式开放的,调一套接口,你就拿到了完整的实时交互能力,推理成本据说已经降到了消费级应用可以承受的范围。
比如,最直观的场景是AI直播。传统直播带货至少需要主播、运营、场控、投手四五个人。人力是最大的成本项,主播要休息要排班,一天最多播十几个小时。
之前也有人尝试过AI直播,但那基本是脚本驱动的视频循环,观众问什么角色根本不理。
但Vivix-A1的能力边界不同:角色可以在直播间里实时走动、展示商品,观众用弹幕或语音提问,角色能立刻响应并配合动作。24小时不断,不请假。
同理,虚拟陪伴、语言陪练、AI教育类产品也是一样。
现在市面上的AI伴侣基本都是纯文字或纯语音,用户跟角色之间的连接感很有限。如果角色能被看见、能做动作、能在你说话的同时做出即时反应,产品的沉浸感和用户黏性可能会是完全不同的量级。
4但最重要的,还是时间窗口。现在AI实时交互这个方向就处在这个阶段,行业的主流注意力还在画质竞赛上。
但少数人已经开始思考另一个问题:如果AI角色可以实时互动了,哪些产品形态会被重新定义?
Vivix-A1的API开放,也是同一个节点。技术供给侧的能力跃迁已经发生了,接下来比的是谁能最快在需求侧找到切入点。
Vivix目前在开放平台上开放了A1模型的内测申请,有兴趣的可以去看看~