全球算力架构升级战已打响。英伟达架构持续升级,升级迭代速度明显加快,平均两年架构升级,我们判断目的是维持在GPU霸主地位, 根 据新浪财经报道,B10...
2024-04-01 53 人工智能AI行业报告
Sora横空出世引领多模态产业革命。美国时间2月15日,文生视频大模型Sora横空出世,能够根据文本指令或静态图像生成1分钟的 视频。其中,视频生成包含精细复杂的场景、生动的角色表情以及复杂的镜头运动,同时也接受现有视频扩展或填补缺失的帧。总体 而言,不管是在视频的保真度、长度、稳定性、一致性、分辨率、文字理解等方面,Sora都做到了业内领先水平,引领多模态产业革 命。此外,当 Sora 训练的数据量足够大时,它也展现出了一种类似于涌现的能力,从而使得视频生成模型具备了类似于物理世界通 用模拟器的潜力。 拆解视频生成过程,技术博采众长或奠定了Sora文生视频领军地位。从技术报告中,Sora视频生成过程大致由“视频编码+加噪降噪 +视频解码”三个步骤组成,视频压缩网络、时空patches、transformer架构、视频数据集等技术与资源在其中发挥了重要作用。 视频压缩网络:过往VAE应用于视频领域通常需插入时间层,Sora从头训练了能直接压缩视频的自编码器,可同时实现时间和空间的 压缩,既节省算力资源,又最大程度上保留视频原始信息,或为Sora生成长视频的关键因素,并为后续处理奠定基础。 时空patches:1)同时考虑视频中时间和空间关系,能够捕捉到视频中细微的动作和变化,在保证视频内容连贯性和长度的同时,创 造出丰富多样的视觉效果;2)突破视频分辨率、长宽比等限制的同时显著提升模型性能,节约训练与推理算力成本。 Transformer架构:1)相比于U-Net架构,transformer突显Scaling Law下的“暴力美学”,即参数规模越大、训练时长越长、训 练数据集越大,生成视频的效果更好;2)此外,在transformer大规模训练下,逐步显现出规模效应,迸发了模型的涌现能力。 视频数据集:Sora或采用了更丰富的视频数据集,在原生视频的基础上,将DALL・E3的re-captioning技术应用于视频领域,同时利 用GPT保障文字-视频数据集质量,使得模型具有强大的语言理解能力。
标签: 人工智能AI行业报告
相关文章
全球算力架构升级战已打响。英伟达架构持续升级,升级迭代速度明显加快,平均两年架构升级,我们判断目的是维持在GPU霸主地位, 根 据新浪财经报道,B10...
2024-04-01 53 人工智能AI行业报告
首先祝贺世界工程组织联合会创新技术专委会(WFEO-CEIT)和深圳市科学技术 协会共同组织编写了这份报告,做了一件很有意义的工作。在这份报告中,来自...
2024-03-29 40 人工智能AI行业报告
相比单模态,多模态大模型同时处理文本、图片、音频以及视频 等多类信息,与现实世界融合度高,更符合人类接收、处理和表达信 息的方式,与人类交互方式更加灵...
2024-03-28 71 人工智能AI行业报告
目前市面AIGC产品众多,且底层技术和产品功能的更新迭代速度较快,为此本报告推出AIGC应用app智能化评估体系,旨在通过量化指 标测量AIGC应用产...
2024-03-22 68 人工智能AI行业报告
自 2022 年底 OpenAI 发布 ChatGPT 至今已逾一年,本轮 AI 革命迭代衍生的强大模型能 力也逐渐在商业化场景得到初步应用。我们认为...
2024-03-22 89 人工智能AI行业报告
最新留言