人工智能在影视文娱,以及游戏等行业具备广泛的应用场景,核心主线就在于内容生产力的释放与升级方面。一方面,整体提升文娱产业工 业化水平,形成AI赋能全流...
2024-03-07 11 人工智能AI行业报告
参数量和数据量是判断大模型的重要参数。2018 年以来,大语言模型训练使用的数据集规 模持续增长。2018 年的 GPT-1 数据集约 4.6GB,2020 年的 GPT-3 数据集达到了 753GB, 而到了 2021 年的 Gopher,数据集规模已经达到了 10,550GB。总结来说,从 GPT-1 到 LLaMA 的大语言模型数据集主要包含六类:维基百科、书籍、期刊、Reddit 链接、Common Crawl 和其他数据集。维基百科是一个免费的多语言协作在线百科全书。维基百科致力于打造包含全世界所有语 言的自由的百科全书,由超三十万名志愿者组成的社区编写和维护。截至 2023 年 3 月,维 基百科拥有 332 种语言版本,总计 60,814,920 条目。其中,英文版维基百科中有超过 664 万篇文章,拥有超 4,533 万个用户。维基百科中的文本很有价值,因为它被严格引用,以 说明性文字形式写成,并且跨越多种语言和领域。
一般来说,重点研究实验室会首先选取 它的纯英文过滤版作为数据集。书籍主要用于训练模型的故事讲述能力和反应能力,包括小说和非小说两大类。数据集包 括 Project Gutenberg 和 Smashwords (Toronto BookCorpus/BookCorpus)等。Project Gutenberg 是一个拥有 7 万多本免费电子书的图书馆,包括世界上最伟大的文学作品,尤 其是美国版权已经过期的老作品。BookCorpus 以作家未出版的免费书籍为基础,这些书籍 来自于世界上最大的独立电子书分销商之一的 Smashwords。期刊可以从 ArXiv 和美国国家卫生研究院等官网获取。预印本和已发表期刊中的论文为数 据集提供了坚实而严谨的基础,因为学术写作通常来说更有条理、理性和细致。ArXiv 是一 个免费的分发服务和开放获取的档案,包含物理、数学、计算机科学、定量生物学、定量 金融学、统计学、电气工程和系统科学以及经济学等领域的 2,235,447 篇学术文章。美国 国家卫生研究院是美国政府负责生物医学和公共卫生研究的主要机构,支持各种生物医学 和行为研究领域的研究,从其官网的“研究&培训”板块能够获取最新的医学研究论文。
标签: 人工智能AI行业报告
相关文章
人工智能在影视文娱,以及游戏等行业具备广泛的应用场景,核心主线就在于内容生产力的释放与升级方面。一方面,整体提升文娱产业工 业化水平,形成AI赋能全流...
2024-03-07 11 人工智能AI行业报告
中国移动自主构建语言、视觉、语音等多种类型大模型,具备跨行业供给侧增强、高可控性、异构软硬件灵活部 署几大显著的技术特色,整体性能指标实现国内主流水平...
2024-03-06 9 人工智能AI行业报告
大模型的兴起,打开了产业通向数据驱动、智能决策 时代的大门。此前IBM商业价值研究院曾在其《值得押 注的七大投资决策》报告中指出,未来十年,生成式 A...
2024-03-06 12 人工智能AI行业报告
这些发现表明 , 发达经济体可能更容易受到人工智能采用带来的劳动力市场变化的影响 , 这种变化在比新兴市场经济体和低收入国 家更短的时间内实现。鉴于发...
2024-03-06 9 人工智能AI行业报告
判断一项新科技浪潮是否已经对产业产生了巨大影响的有效方法之一便是去各大招聘网站搜索相关 新兴岗位出现的数量、种类及其薪资水准。一旦出现井喷之势,说明产...
2024-02-26 77 人工智能AI行业报告
最新留言