BigScience 和 BLOOM 模型
BigScience 是 1,000 多名研究人員進行的為期一年的開放研究合作,產生了 BLOOM,這是第一個真正的多語言、公開發布的大型語言模型。
概述
It matters as a landmark in transparent, community-driven AI built outside Big Tech.
深入探討
BigScience 是一個為期一年的研究研討會,從 2021 年到 2022 年舉辦,由 Hugging Face 協調,匯集了來自 60 多個國家和 250 個機構的 1,000 多名志願者研究人員。其主要成果於 2022 年 7 月發布,是 BLOOM,一個 1760 億參數的自回歸語言模型。 BLOOM 有意採用多種語言,在涵蓋 46 種自然語言和 13 種程式語言的 ROOTS 語料庫上進行訓練,對代表性不足的語言(例如幾種非洲和南亞語言)具有很強的代表性。訓練在法國公共資助的 Jean Zay 超級電腦上運行了幾個月,使用了大約 384 個 GPU。 BLOOM 是根據 Responsible AI 許可證發布的,並提供其資料、訓練和預期用途的完整文檔,與類似模型的封閉開發形成鮮明對比。
技術洞察
BLOOM 是一個與 GPT-3 規模相似的純解碼器轉換器,使用 ALiBi 位置嵌入而不是學習的位置向量,這有助於它推斷出比訓練中看到的更長的序列。它還應用了嵌入層歸一化,提高了大規模訓練的穩定性。多語言 ROOTS 語料庫經過精心組裝和記錄,因此語言組合和資料來源是透明且可審核的,這是故意偏離不透明的抓取資料集。
戰略影響
供應商策略
供應商路線圖會影響您的團隊接下來可以建立的功能。
成本與預算
商業條款和部署選項會影響長期成本和風險。
風險與安全
公司激勵措施塑造了產品預設、安全態勢和開放性。
大科學的未來與 BLOOM 模型
BigScience 證明了大規模、開放管理的人工智慧是可能的,其模型影響了後來的開放版本和更廣泛的透明度推動。未來的多語言工作可能會建立在資料文件和包容性語言覆蓋方面的經驗教訓上,而更新、更有效率的模型在原始能力上已經超越了 BLOOM。它持久的遺產是發布模型卡、資料聲明和負責任的許可證的規範,以及公共計算可以訓練前沿規模模型的證據。
現實世界的實施
產生並完成多種語言的文本,包括商業模式服務不足的語言
作為研究偏見、多語言遷移和擴展行為的開放研究基線
微調為特定於任務或遵循指令的變體,例如針對非英語社群的 BLOOMZ
為研究訓練資料來源和負責任的人工智慧授權的學者提供完整記錄的模型
風險與防護欄
發佈公告可能會超過實際生產工作流程的穩定性。
API 定價或政策轉變可能會在一夜之間打破假設。
單一供應商依賴性增加了鎖定和遷移成本。
實施路線圖
使用您自己的任務和資料集評估提供者。
在整合之前查看隱私、安全和法律條款。
維護跨模型或供應商的後備計劃。
監控發行說明,以便路線圖的變更不會讓團隊感到意外。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the BigScience and the BLOOM Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is BigScience and the BLOOM Model?
BigScience 是 1,000 多名研究人員進行的為期一年的開放研究合作,產生了 BLOOM,這是第一個真正的多語言、公開發布的大型語言模型。作為在大型科技公司之外建構的透明、社群驅動的人工智慧的里程碑,它具有重要意義。
與當時類似大小的模型相比,BLOOM 模型的主要差異目標是什麼?
BLOOM 被設計為真正的多語言版本,並以完整的文件公開發布,這與同等規模的封閉模型不同。
BLOOM 大約有多少個參數?
BLOOM 是一個包含 1760 億個參數的模型,其規模與 GPT-3 類似。
BLOOM 經過訓練可以處理多少種自然語言?
BLOOM 的 ROOTS 訓練語料庫涵蓋 46 種自然語言和 13 種程式語言。
哪個組織負責協調 BigScience 的合作?
Hugging Face 協調了 BigScience,這是一個由 1,000 多名志願者研究人員組成的研討會。
BLOOM 在哪裡接受訓練?
BLOOM 在法國的 Jean Zay 超級電腦上進行了訓練,證明公共運算可以訓練前緣規模的模型。