GUIA DE EMPRESAS

BigScience e o modelo BLOOM

BigScience foi uma colaboração de pesquisa aberta de mais de 1.000 pesquisadores que durou um ano e que produziu o BLOOM, um dos primeiros modelos de linguagem de grande porte verdadeiramente multilíngue e lançado abertamente.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro da BigScience e o modelo BLOOM
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

It matters as a landmark in transparent, community-driven AI built outside Big Tech.

Mergulho profundo

BigScience foi um workshop de pesquisa de um ano que ocorreu de 2021 a 2022, coordenado pela Hugging Face e reunindo mais de 1.000 pesquisadores voluntários de mais de 60 países e 250 instituições. Seu resultado principal, lançado em julho de 2022, foi BLOOM, um modelo de linguagem autorregressiva de 176 bilhões de parâmetros. O BLOOM foi deliberadamente multilíngue, treinado no corpus ROOTS cobrindo 46 línguas naturais e 13 linguagens de programação, com forte representação de línguas sub-representadas, como várias línguas africanas e do sul da Ásia. O treinamento durou vários meses no supercomputador Jean Zay, financiado publicamente, na França, usando cerca de 384 GPUs. O BLOOM foi lançado sob a Licença de IA Responsável com documentação completa de seus dados, treinamento e usos pretendidos, contrastando fortemente com o desenvolvimento fechado de modelos comparáveis.

Impacto Estratégico

Estratégia do fornecedor

Os roteiros dos fornecedores influenciam quais recursos sua equipe pode construir a seguir.

Custo e orçamento

Os termos comerciais e as opções de implantação afetam os custos e riscos a longo prazo.

Risco e segurança

Os incentivos da empresa moldam os padrões de produto, a postura de segurança e a abertura.

O futuro da BigScience e o modelo BLOOM

A BigScience demonstrou que a IA em grande escala e governada abertamente é possível, e o seu modelo influenciou lançamentos abertos posteriores e o impulso mais amplo pela transparência. O futuro trabalho multilíngue provavelmente se baseará em suas lições de documentação de dados e cobertura linguística inclusiva, enquanto modelos mais novos e mais eficientes ultrapassaram o BLOOM em capacidade bruta. Seu legado duradouro é a norma de publicação de cartões de modelo, declarações de dados e licenças responsáveis, além da prova de que a computação pública pode treinar modelos em escala de fronteira.

Implementação no mundo real

Gerar e completar texto em dezenas de idiomas, incluindo aqueles que não são atendidos por modelos comerciais

Servindo como uma base de pesquisa aberta para estudar preconceitos, transferência multilíngue e dimensionamento de comportamento

Ajuste fino em variantes específicas de tarefas ou de acompanhamento de instruções, como BLOOMZ para comunidades que não falam inglês

Fornecendo um modelo totalmente documentado para acadêmicos que estudam a origem dos dados de treinamento e o licenciamento responsável de IA

Riscos e guarda-corpos

  • Os anúncios de lançamento podem superar a estabilidade em fluxos de trabalho de produção reais.

  • Os preços das APIs ou as mudanças nas políticas podem quebrar suposições da noite para o dia.

  • A dependência de um único fornecedor aumenta os custos de aprisionamento e migração.

Roteiro de implementação

  1. Avalie os provedores usando suas próprias tarefas e conjuntos de dados.

  2. Revise os termos legais, de privacidade e segurança antes da integração.

  3. Mantenha um plano alternativo entre modelos ou fornecedores.

  4. Monitore as notas de lançamento para que as mudanças no roteiro não surpreendam as equipes.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BigScience and the BLOOM Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is BigScience and the BLOOM Model?

BigScience foi uma colaboração de pesquisa aberta de mais de 1.000 pesquisadores que durou um ano e que produziu o BLOOM, um dos primeiros modelos de linguagem de grande porte verdadeiramente multilíngue e lançado abertamente. É importante como um marco na IA transparente e voltada para a comunidade, construída fora da Big Tech.

Qual foi o principal objetivo distintivo do modelo BLOOM em comparação com modelos de tamanho semelhante de sua época?

O BLOOM foi projetado para ser genuinamente multilíngue e foi lançado abertamente com documentação completa, ao contrário de modelos fechados de escala comparável.

Aproximadamente quantos parâmetros o BLOOM possui?

BLOOM é um modelo de 176 bilhões de parâmetros, colocando-o em uma escala semelhante ao GPT-3.

Para quantas linguagens naturais o BLOOM foi treinado?

O corpus de treinamento ROOTS do BLOOM cobriu 46 linguagens naturais mais 13 linguagens de programação.

Qual organização coordenou a colaboração BigScience?

Hugging Face coordenou o BigScience, um workshop com mais de 1.000 pesquisadores voluntários.

Onde o BLOOM foi treinado?

O BLOOM foi treinado no supercomputador Jean Zay na França, demonstrando que a computação pública poderia treinar um modelo em escala de fronteira.