Skip to content

Avataar 的 Varya 把 AI 视频成本砍到十分之一,这才是真正的看点

Avataar.ai 今天在新德里的一场活动上发布了 Varya,印度电子和信息技术部的部长也在现场。这是一款 140 亿参数的 AI 视频模型,公司把它的质量归到和阿里巴巴 Wan 2.2、谷歌 Veo 3 同一档。但真正关键的数字不是某项质量跑分,而是价格。Varya 生成视频的成本大约是每秒 ₹0.48,公司称这比领先的全球模型便宜最多十倍。它靠的是一套蒸馏架构,把生成所需的常规 50 个扩散步骤压缩到 4 步,同时把输出质量保持在接近完整步数模型的水平。

Varya 是印度的蒸馏视频模型,用 4 步而非 50 步生成片段

这款模型的诞生得到了印度 IndiaAI Mission 的帮助,后者提供了对国家级 AI 算力的补贴访问。它专门针对印度场景训练,因此在体现地域多样性、节日、食物、服饰和日常环境方面,比那些主要用西方数据训练的模型表现得更好。varya.avataar.ai 上有一个在线演示,Avataar 表示会把 Varya 作为开放权重模型发布,连同训练数据一起放到印度的 AIKosh 平台上,让开发者可以自行托管或微调。一份关于架构和蒸馏方法的技术报告也即将发布。

4 步而不是 50 步

这里的技术动作才是全部重点。扩散模型从噪声开始生成,再经过多步细化,每一步都是对网络的一次完整推理。50 步就意味着 50 次推理。蒸馏的做法是训练一个更小、更快的学生模型,让它复现那个慢吞吞、需要很多步的教师模型的产出,但只用寥寥几步就完成。4 步而不是 50 步,意味着每帧的算力少了十倍以上,而视频生成的成本几乎全都压在每帧算力上。

实际耗时把这件事讲得很具体。在一块 NVIDIA H200 上,Avataar 称 Varya 大约 45 秒就能生成一段 5 秒、720p 的片段。同样的任务,Wan 2.2 大约要 1,230 秒。这不是边际上的小胜,而是数量级的差别,它决定了你的模型是能面向大量用户提供服务,还是只够撑起一场演示。

这正是过去两年让快速图像生成变得实用的同一套招数。如今看到它在生产规模上落地到视频,还附带一个真实的每秒价格,这才是值得关注的信号。

为什么成本是 2026 年的视频故事

过去两年,AI 视频的讨论都围绕能力展开。谁的模型能做 4K。谁的模型能同步音频。谁的模型能在多个镜头里保持角色一致。这场竞赛大体已经分出结果。Kling 3.0 在 3 月推出了带音频的 4KLTX 2.3 用开源做到了同样的事,而各家前沿模型彼此都已足够接近,差距更多是口水仗,而不是真正的鸿沟。

没解决的是经济账。我们曾写过 Sora 如何一天烧掉大约一百万美元,而它整个生命周期的营收只有两百万,最终被 OpenAI 关停。能力从来不是问题,提供服务的成本才是。一款漂亮但用不起的模型,是演示,不是产品。

所以 2026 年真正有意思的前沿,不是某个会做新花样的模型,而是用十分之一的成本把同样的事做出来的模型。Varya 只是一个数据点。整个领域更大的动向,也就是蒸馏、更少的步数、为特定场景调校的更小模型,才是把 AI 视频从一个赔钱的橱窗变成一个小团队真能在上面做东西的关键。

这对开发者意味着什么

如果你正在做的产品把视频生成当作产品的一部分,而不是一次性的东西,那么每秒成本就是你的单位经济模型。它决定了一个功能你是能向所有人提供,还是只能配额限量或者额外加价。成本降低十倍,并不会让你的产品好上十倍,但它会让一整类原本入不敷出的产品突然变得可行。

这就是为什么我们一直更关注曲线上便宜的那一端,而不是花哨的那一端。在 Cinevva,平台里的生成工具要成为一门生意,前提是单次生成的成本足够低,低到创作者可以自由试验,而我们不会在每一次点击上流血。Sora 给的教训是,好的产出配上错的成本会拖垮整家公司。Varya 给的教训是,成本终于开始动了,而且动得很快,那些在便宜又好用的模型上做东西的团队,会比那些追着昂贵又炫目的模型跑的团队活得更久。

地域这个角度同样重要。一款针对印度场景训练、按印度预算定价的模型提醒我们,下一波这类工具不会全都出自同样的那几家美国实验室,也不会全都按美国人的钱包定价。更便宜、更本地、更具体,是一条和更大、更通用不同的竞争轴线,而这条轴线正是那些既有玩家反应迟缓、难以防守的。

参考资料