智谱AI公布清影新升级:视频生成步入“有声”时代
创始人
2024-11-09 02:40:51
0

新京报贝壳财经讯(记者罗亦丹)今年以来,Sora带火的AI生成视频吸引了许多人的关注,年内各式各样的AI视频大模型层出不穷,但有一点是一致的:所有AI生成的视频都是一段无声的“默片”。不过这一点即将迎来改变。

11月8日,“新AI六小龙”之一的北京AI大模型公司智谱宣布,其视频生成工具清影进行了重要升级,新清影在以下5个方面实现了提升:模型能力上,在图生视频的质量、美学表现、运动合理性以及复杂提示词语义理解方面能力明显增强;支持生成 10s、4K、60 帧超高清视频;支持任意比例的图像生成视频,包括超宽画幅;新增同一指令/图片可以一次性生成4个视频的多通道生成能力;以及最重要的——新清影可以生成与画面匹配的音效,其音效功能将在本月上线公测。

根据智谱AI展示的视频,新清影生成的视频有着各式各样的音效,如出现赛车视频时的引擎轰鸣声,主角飞到空中时风刮过衣领猎猎作响的声音,以及拉小提琴时可以贴合手部动作的琴声等。

智谱AI演示视频截图,图中拉小提琴的视频为AI生成,且有声音。

智谱披露的技术博客文档显示,为视频增添声音的是其开发的多模态模型家族音效模型 CogSound,基于GLM-4V的视频理解能力,CogSound 能够准确识别并理解视频背后的语义和情感,并为无声视频添加与之相匹配的音频内容,甚至可以生成更加复杂的音效,如爆炸、水流、乐器、动物叫声、交通工具声等。

具体来看,CogSound 的音效生成能力主要得益于采用潜空间扩散模型(Latent Diffusion Model),将音频生成过程从高维的原始空间转移到低维潜空间,降低了计算复杂度,同时保持了生成音频的高质量和高效率;引入分块时序对齐交叉注意力(Block-wise Temporal Alignment Cross-attention)机制,优化了视频长序列与音频特征之间的特征匹配;整合了旋转位置编码技术,通过为序列中的每个位置提供唯一标识并捕捉位置间的相对关系,让每个视频帧的位置都拥有独特的“坐标”,在音频生成中有效提升了时序一致性,确保音频序列的连贯性和过渡自然性。

“当前,AI生成视频用于影视创作仍需要多种不同的创作工具串联使用,但基于我们多模态的最新成果,实现这种一站式原生多模态工作流,这样的前景无疑是激动人心的。”智谱方面表示。

校对 吴兴发

相关内容

热门资讯

黑科技存在(wePOke)辅助... 黑科技存在(wePOke)辅助枝巧(黑科技)有辅助软件(好像是有挂)准备好在 ia的高塔上攀登,扮演...
黑科技工具"poke... 黑科技工具"pokerrrr开挂"微扑克有透视挂吗(本来是有挂)-哔哩哔哩微扑克有透视挂吗辅助器中分...
黑科技系统!wepower轻量... 黑科技系统!wepower轻量版辅助器(黑科技)太坑了存在有挂(详细教程黑科技教程)-哔哩哔哩1、下...
黑科技真的(德扑之星软件透明软... 黑科技真的(德扑之星软件透明软件多少钱)外挂黑科技辅助神器(透视)果然存在有挂(黑科技介绍)-哔哩哔...
黑科技科技(wepOkE)ai... 黑科技科技(wepOkE)ai辅助(黑科技)透明挂真假辨别(原生是真的有挂)1、不需要AI权限,帮助...
黑科技辅助"来玩德州... 黑科技辅助"来玩德州扑克约局神器"云扑克外挂(切实真的是有挂)-哔哩哔哩1、进入到来玩德州扑克约局神...
黑科技计算!wepower微扑... 黑科技计算!wepower微扑克有无外挂(智能ai)太坑了是真的有挂(安装教程黑科技详情)-哔哩哔哩...
黑科技软件(Wepoke透明挂... 黑科技软件(Wepoke透明挂)外挂透视辅助器(透视)都是真的有挂(黑科技技巧)-哔哩哔哩1、很好的...
黑科技有挂(德州aapoker... 黑科技有挂(德州aapoker俱乐部)ai辅助(透视)德州辅助工具(一贯真的有挂);1分钟了解详细教...
黑科技私人局"wep... 黑科技私人局"wepoke调控参数"impoker有挂吗(一贯真的有挂)-哔哩哔哩;1、wepoke...