大型语言模型是生成或嵌入式文本的基础模型 (一种大型神经网络)。它们生成的文本可以通过为其 提供起点或“提示”来进行调节,从而使其能够用自然 语言或代...
2025-01-17 59 人工智能AI行业报告
PaLM-E 构建了多个不同尺寸的模型。PaLM-E 由 LLM 和编码器构成。LLM 方面,选取 80 亿、620 亿和 5400 亿参数的 PaLM(PaLM 是仅使用解码器的 LLM,且已完成预训练)。 编码器方面,选取 40 亿参数和 22 亿参数的 ViT。两者结合,分别构建了参数为 120 亿的 PaLM-E-12B、840 亿的 PaLM-E-84B、5620 亿的 PaLM-E-562B,其中 PaLM-E-562B 是 目前现有最大的视觉语言(vision-language)模型。PaLM-E 有两种训练策略。1)各模态的编码器和 PaLM 一起训练,同时更新参数;2)考 虑到 LLM 在给定合适的提示(prompt)时能够表现出很好的推理能力,可以“冻结(freeze)” LLM,只训练与模态相关的编码器。完整的 PaLM-E 训练数据集包含数十个子训练集,涉及视觉、语言和具身数据。PaLM-E 进行跨任务的联合训练,其训练集为包含视觉、语言和具身数据。其中,完全混合(full mixture) 的数据集由来自各种任务的互联网规模的视觉和语言数据组成,通过设置采样频率,使得 其中 8.9%的数据为具身数据。值得注意的是,目前具身数据的训练数据集还远少于图像和 语言训练数据集。
PaLM-E 从两个思路出发,与基线模型进行结果比较。1)比较不同的输入表示(状态估计 向量、ViT 等编码器)在性能、泛化能力、数据有效性方面的表现。2)聚焦单一的 PaLM-E 架构(预训练的 ViT+PaLM),将原始图像作为连续输入,针对不同的联合训练策略和模型 参数,比较其在性能、泛化能力、数据有效性方面的表现。比较基线选取的是 SOTA 视觉 语言模型 PaLI(未在机器人具身数据上训练)+SayCan 算法(机器人模型,人工提供了机 器人最优动作序列指导 oracle affordances)。 实验涉及 3 种不同的机器人环境/任务。1)任务与运动规划(Task and Motion Planning , TAMP),机器人必须对物体进行抓取、堆放等操作;2)桌面环境操作(table-top pushing environment),主要是对桌面上的积木块等物体进行操作;3)移动操作(mobile manipulation domain)。机器人在厨房环境中解决各种任务,包括在抽屉里寻找物品、挑选 物品,并将其交给人类。PaLM-E 分别在各领域的专业数据集上进行训练。例如桌面环境使 用的训练集为 Language-Table dataset。
标签: 人工智能AI行业报告
相关文章
大型语言模型是生成或嵌入式文本的基础模型 (一种大型神经网络)。它们生成的文本可以通过为其 提供起点或“提示”来进行调节,从而使其能够用自然 语言或代...
2025-01-17 59 人工智能AI行业报告
大模型快速发展,网信办数据显示,截至2024年7月30日,全国范围内通过登记备案的行业大模型有136款,占比达69%。行业大 模型深度赋能教育、金融、...
2025-01-08 76 人工智能AI行业报告
生成式AI也在加速赋能广告制作环节。今年业绩和股价爆发的AppLovin和汇量科技,主要关注的是决策式 AI在程序化广告平台的技术突破,提升广告投放精...
2025-01-06 105 人工智能AI行业报告
纵观历史50年,五次半导体市场规模迅猛成长均伴随爆款电子产品的普及。自1976年起,全球半导体市场历经了5次迅猛成长,分别由台式电脑(1983~198...
2025-01-05 89 人工智能AI行业报告
先进封装:受AI芯片大面积需求带动,2.5D先进封装于2023至2024年供不应 求情况明显,据TrendForce预估,2025年晶圆代工厂配套提供...
2025-01-05 97 人工智能AI行业报告
针对外贸 B2B 垂类场景的AI助手AI麦可:截至2024/6/30,购买AI麦可的会员共6095 位(不含试用体验包客户),较2024年一季度末增加...
2025-01-04 67 人工智能AI行业报告
最新留言