Agent(代理)一概念起源于哲学,描述了一种拥有欲望、信念、意图以及采取行动能力的实体。在计算机科学和人工智能领域,"Agent"...
2025-04-17 42 人工智能AI行业报告
参数量和数据量是判断大模型的重要参数。2018 年以来,大语言模型训练使用的数据集规 模持续增长。2018 年的 GPT-1 数据集约 4.6GB,2020 年的 GPT-3 数据集达到了 753GB, 而到了 2021 年的 Gopher,数据集规模已经达到了 10,550GB。总结来说,从 GPT-1 到 LLaMA 的大语言模型数据集主要包含六类:维基百科、书籍、期刊、Reddit 链接、Common Crawl 和其他数据集。维基百科是一个免费的多语言协作在线百科全书。维基百科致力于打造包含全世界所有语 言的自由的百科全书,由超三十万名志愿者组成的社区编写和维护。截至 2023 年 3 月,维 基百科拥有 332 种语言版本,总计 60,814,920 条目。其中,英文版维基百科中有超过 664 万篇文章,拥有超 4,533 万个用户。维基百科中的文本很有价值,因为它被严格引用,以 说明性文字形式写成,并且跨越多种语言和领域。
一般来说,重点研究实验室会首先选取 它的纯英文过滤版作为数据集。书籍主要用于训练模型的故事讲述能力和反应能力,包括小说和非小说两大类。数据集包 括 Project Gutenberg 和 Smashwords (Toronto BookCorpus/BookCorpus)等。Project Gutenberg 是一个拥有 7 万多本免费电子书的图书馆,包括世界上最伟大的文学作品,尤 其是美国版权已经过期的老作品。BookCorpus 以作家未出版的免费书籍为基础,这些书籍 来自于世界上最大的独立电子书分销商之一的 Smashwords。期刊可以从 ArXiv 和美国国家卫生研究院等官网获取。预印本和已发表期刊中的论文为数 据集提供了坚实而严谨的基础,因为学术写作通常来说更有条理、理性和细致。ArXiv 是一 个免费的分发服务和开放获取的档案,包含物理、数学、计算机科学、定量生物学、定量 金融学、统计学、电气工程和系统科学以及经济学等领域的 2,235,447 篇学术文章。美国 国家卫生研究院是美国政府负责生物医学和公共卫生研究的主要机构,支持各种生物医学 和行为研究领域的研究,从其官网的“研究&培训”板块能够获取最新的医学研究论文。
标签: 人工智能AI行业报告
相关文章
Agent(代理)一概念起源于哲学,描述了一种拥有欲望、信念、意图以及采取行动能力的实体。在计算机科学和人工智能领域,"Agent"...
2025-04-17 42 人工智能AI行业报告
[Download]资源名称:DeepSeek深度解读报告:部署、使用、安全(49页)...
2025-04-15 55 人工智能AI行业报告
DeepSeek V3与R1模型实现了开源,采用MIT协议。这产生多方面影响: 对大模型发展:这提升了世界对中国AI大模型能力的认知,一定程度打破了O...
2025-04-14 51 人工智能AI行业报告
DeepSeek 团队最大的特点之一就是年轻。团队成员中, 应届生和在读生占据了相当大的比例,他们活跃在公司的各 个项目和研究领域中。这些年轻人思维敏...
2025-04-14 71 人工智能AI行业报告
DeepSeek引领AI应用变革,“AI+消费”有望迎来大爆发。DeepSeek首次实现了大规模AI模型性能与成本之间的“剪刀差式突破”,显著 降低了...
2025-04-13 56 人工智能AI行业报告
DeepSeek 是一家中国人工智能公司,成立于 2023 年 7 月 17 日,总部位于浙江 杭州。它由量化资管巨头幻方量化创立,专注于大语言模型(...
2025-04-10 63 人工智能AI行业报告
最新留言