智谱AI公布清影新升级:视频生成步入“有声”时代
创始人
2024-11-09 02:40:51
0

新京报贝壳财经讯(记者罗亦丹)今年以来,Sora带火的AI生成视频吸引了许多人的关注,年内各式各样的AI视频大模型层出不穷,但有一点是一致的:所有AI生成的视频都是一段无声的“默片”。不过这一点即将迎来改变。

11月8日,“新AI六小龙”之一的北京AI大模型公司智谱宣布,其视频生成工具清影进行了重要升级,新清影在以下5个方面实现了提升:模型能力上,在图生视频的质量、美学表现、运动合理性以及复杂提示词语义理解方面能力明显增强;支持生成 10s、4K、60 帧超高清视频;支持任意比例的图像生成视频,包括超宽画幅;新增同一指令/图片可以一次性生成4个视频的多通道生成能力;以及最重要的——新清影可以生成与画面匹配的音效,其音效功能将在本月上线公测。

根据智谱AI展示的视频,新清影生成的视频有着各式各样的音效,如出现赛车视频时的引擎轰鸣声,主角飞到空中时风刮过衣领猎猎作响的声音,以及拉小提琴时可以贴合手部动作的琴声等。

智谱AI演示视频截图,图中拉小提琴的视频为AI生成,且有声音。

智谱披露的技术博客文档显示,为视频增添声音的是其开发的多模态模型家族音效模型 CogSound,基于GLM-4V的视频理解能力,CogSound 能够准确识别并理解视频背后的语义和情感,并为无声视频添加与之相匹配的音频内容,甚至可以生成更加复杂的音效,如爆炸、水流、乐器、动物叫声、交通工具声等。

具体来看,CogSound 的音效生成能力主要得益于采用潜空间扩散模型(Latent Diffusion Model),将音频生成过程从高维的原始空间转移到低维潜空间,降低了计算复杂度,同时保持了生成音频的高质量和高效率;引入分块时序对齐交叉注意力(Block-wise Temporal Alignment Cross-attention)机制,优化了视频长序列与音频特征之间的特征匹配;整合了旋转位置编码技术,通过为序列中的每个位置提供唯一标识并捕捉位置间的相对关系,让每个视频帧的位置都拥有独特的“坐标”,在音频生成中有效提升了时序一致性,确保音频序列的连贯性和过渡自然性。

“当前,AI生成视频用于影视创作仍需要多种不同的创作工具串联使用,但基于我们多模态的最新成果,实现这种一站式原生多模态工作流,这样的前景无疑是激动人心的。”智谱方面表示。

校对 吴兴发

相关内容

热门资讯

中国电信2025年云网路由交换... C114讯 11月12日消息(水易)来自中国电信阳光采购网消息,中国电信云网路由交换设备(2025年...
海尔智家获得发明专利授权:“隔... 证券之星消息,根据天眼查APP数据显示海尔智家(600690)新获得一项发明专利授权,专利名为“隔板...
国台办介绍厦金“小三通”智能通... 11月12日上午,国台办举行例行新闻发布会。记者:自11月5日起,厦门高崎国际机场、五通客运码头两个...
国台办答南方+:“中国台北”名... 11月12日上午,国台办举行例行新闻发布会。南方+记者在会上提问:大陆方面表示,将按照一个中国原则和...
原创 金... 中国军迷现在有种幸福的烦恼,新装备入列后转眼之间“小甜甜”就变“牛夫人”了。福建舰已经入列,包括笔者...
马云全面高调杀回来了 作者 | 黄昱 编辑 | 王小娟 当阿里巴巴踏上人工智能赛道的快车道时,马云家族的全球资产版图也在继...
丈夫结扎9个月后,妻子又怀孕了... 近日,河北一女子反映丈夫做输精管切断结扎手术9个月后,她却被诊断怀孕,怀疑医院的手术有问题。 11月...
原创 中... 在瞬息万变的国际关系舞台上,我们正在目睹一个颠覆性的转折点:加拿大与中国的关系似乎正在逐步修复,而这...
以色列选美小姐台上瞪巴勒斯坦小... ▲新京报我们视频出品(ID:wevideo) 11月10日,以色列选美小姐希拉兹在比赛中疑似白了巴勒...
最新政策来袭,工厂进入“机器人... 近日,国新办举行了国务院政策例行吹风会。会上, 工业和信息化部规划司司长姚珺指出,加速推动“机器人+...