BigScience 和 BLOOM 模型
BigScience 是 1,000 多名研究人员进行的为期一年的开放研究合作,产生了 BLOOM,这是第一个真正的多语言、公开发布的大型语言模型。
概述
It matters as a landmark in transparent, community-driven AI built outside Big Tech.
深入探讨
BigScience 是一个为期一年的研究研讨会,从 2021 年到 2022 年举办,由 Hugging Face 协调,汇集了来自 60 多个国家和 250 个机构的 1,000 多名志愿者研究人员。其主要成果于 2022 年 7 月发布,是 BLOOM,一个 1760 亿参数的自回归语言模型。 BLOOM 有意采用多种语言,在涵盖 46 种自然语言和 13 种编程语言的 ROOTS 语料库上进行训练,对代表性不足的语言(例如几种非洲和南亚语言)具有很强的代表性。训练在法国公共资助的 Jean Zay 超级计算机上运行了几个月,使用了大约 384 个 GPU。 BLOOM 是根据 Responsible AI 许可证发布的,并提供其数据、训练和预期用途的完整文档,与类似模型的封闭开发形成鲜明对比。
技术洞察
BLOOM 是一个与 GPT-3 规模相似的纯解码器转换器,使用 ALiBi 位置嵌入而不是学习的位置向量,这有助于它推断出比训练中看到的更长的序列。它还应用了嵌入层归一化,提高了大规模训练的稳定性。多语言 ROOTS 语料库经过精心组装和记录,因此语言组合和数据源是透明且可审核的,这是故意偏离不透明的抓取数据集。
战略影响
供应商策略
供应商路线图会影响您的团队接下来可以构建的功能。
成本与预算
商业条款和部署选项会影响长期成本和风险。
风险与安全
公司激励措施塑造了产品默认、安全态势和开放性。
大科学的未来和 BLOOM 模型
BigScience 证明了大规模、开放管理的人工智能是可能的,其模型影响了后来的开放版本和更广泛的透明度推动。未来的多语言工作可能会建立在数据文档和包容性语言覆盖方面的经验教训上,而更新、更高效的模型在原始能力上已经超越了 BLOOM。它持久的遗产是发布模型卡、数据声明和负责任的许可证的规范,以及公共计算可以训练前沿规模模型的证据。
现实世界的实施
生成并完成多种语言的文本,包括商业模式服务不足的语言
作为研究偏见、多语言迁移和扩展行为的开放研究基线
微调为特定于任务或遵循指令的变体,例如针对非英语社区的 BLOOMZ
为研究训练数据来源和负责任的人工智能许可的学者提供完整记录的模型
风险与防护栏
发布公告可能会超过实际生产工作流程的稳定性。
API 定价或政策转变可能会在一夜之间打破假设。
单一供应商依赖性增加了锁定和迁移成本。
实施路线图
使用您自己的任务和数据集评估提供商。
在集成之前查看隐私、安全和法律条款。
维护跨模型或供应商的后备计划。
监控发行说明,以便路线图的更改不会让团队感到意外。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the BigScience and the BLOOM Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is BigScience and the BLOOM Model?
BigScience 是 1,000 多名研究人员进行的为期一年的开放研究合作,产生了 BLOOM,这是第一个真正的多语言、公开发布的大型语言模型。作为在大型科技公司之外构建的透明、社区驱动的人工智能的里程碑,它具有重要意义。
与当时类似大小的模型相比,BLOOM 模型的主要区别目标是什么?
BLOOM 被设计为真正的多语言版本,并以完整的文档公开发布,这与同等规模的封闭模型不同。
BLOOM 大约有多少个参数?
BLOOM 是一个包含 1760 亿个参数的模型,其规模与 GPT-3 类似。
BLOOM 经过训练可以处理多少种自然语言?
BLOOM 的 ROOTS 训练语料库涵盖 46 种自然语言和 13 种编程语言。
哪个组织负责协调 BigScience 的合作?
Hugging Face 协调了 BigScience,这是一个由 1,000 多名志愿者研究人员组成的研讨会。
BLOOM 在哪里接受培训?
BLOOM 在法国的 Jean Zay 超级计算机上进行了训练,证明公共计算可以训练前沿规模的模型。