海外发展:现阶段海外大模型发展领先,GPT4已呈现出色的内容生成与交互能力,Google、Meta等也已发布相关产品,预计将带来可观的增量市场与效率...
2023-06-13 4 人工智能行业报告下载
参数量和数据量是判断大模型的重要参数。2018 年以来,大语言模型训练使用的数据集规 模持续增长。2018 年的 GPT-1 数据集约 4.6GB,2020 年的 GPT-3 数据集达到了 753GB, 而到了 2021 年的 Gopher,数据集规模已经达到了 10,550GB。总结来说,从 GPT-1 到 LLaMA 的大语言模型数据集主要包含六类:维基百科、书籍、期刊、Reddit 链接、Common Crawl 和其他数据集。维基百科是一个免费的多语言协作在线百科全书。维基百科致力于打造包含全世界所有语 言的自由的百科全书,由超三十万名志愿者组成的社区编写和维护。截至 2023 年 3 月,维 基百科拥有 332 种语言版本,总计 60,814,920 条目。其中,英文版维基百科中有超过 664 万篇文章,拥有超 4,533 万个用户。维基百科中的文本很有价值,因为它被严格引用,以 说明性文字形式写成,并且跨越多种语言和领域。
一般来说,重点研究实验室会首先选取 它的纯英文过滤版作为数据集。书籍主要用于训练模型的故事讲述能力和反应能力,包括小说和非小说两大类。数据集包 括 Project Gutenberg 和 Smashwords (Toronto BookCorpus/BookCorpus)等。Project Gutenberg 是一个拥有 7 万多本免费电子书的图书馆,包括世界上最伟大的文学作品,尤 其是美国版权已经过期的老作品。BookCorpus 以作家未出版的免费书籍为基础,这些书籍 来自于世界上最大的独立电子书分销商之一的 Smashwords。期刊可以从 ArXiv 和美国国家卫生研究院等官网获取。预印本和已发表期刊中的论文为数 据集提供了坚实而严谨的基础,因为学术写作通常来说更有条理、理性和细致。ArXiv 是一 个免费的分发服务和开放获取的档案,包含物理、数学、计算机科学、定量生物学、定量 金融学、统计学、电气工程和系统科学以及经济学等领域的 2,235,447 篇学术文章。美国 国家卫生研究院是美国政府负责生物医学和公共卫生研究的主要机构,支持各种生物医学 和行为研究领域的研究,从其官网的“研究&培训”板块能够获取最新的医学研究论文。
标签: 人工智能行业报告下载
相关文章
海外发展:现阶段海外大模型发展领先,GPT4已呈现出色的内容生成与交互能力,Google、Meta等也已发布相关产品,预计将带来可观的增量市场与效率...
2023-06-13 4 人工智能行业报告下载
AI大模型推动计算机历史三次最大浪潮实现“三山叠峦”。与以往科技产业浪潮最大不同在于,此次AI浪潮不是终端硬件变革开启,而是软件先行定义一切...
2023-06-09 65 人工智能行业报告下载
我们从以上三个维度,分析当前发布的部分大模型:1)算力:算力布局主要来源于芯片的采购布局,算力基础设施的投入阻挡了部分小公司的入局。当前数据训练需...
2023-06-06 85 人工智能行业报告下载
2021年AI投资总额是2020年的2倍多,头部的AI初创企业吸引了更大额的资金投资。2021的平均私募市场投资规模比2020年高81.1%,中...
2023-06-06 65 人工智能行业报告下载
文心一言是百度自主研发的大语言模型,在文心知识增强大模型ERNIE及对话大模型PLATO的基础上研发,基于飞桨深度学习平台训练和部署,其关键技术包括...
2023-06-06 56 人工智能行业报告下载
最新留言