A continuaciónSiguiente guía
IA de código abierto
Empresas
GUÍA de empresas
LAION es una organización alemana sin fines de lucro que lanzó conjuntos masivos de datos abiertos de imágenes y texto, el más famoso LAION-5B, que impulsó el entrenamiento de modelos generativos abiertos como Stable Diffusion.
Es importante porque puso datos multimodales a escala web a disposición de investigadores fuera de las grandes corporaciones.
LAION (Red abierta de inteligencia artificial a gran escala) es una organización alemana sin fines de lucro fundada en 2021 para democratizar la investigación en aprendizaje automático mediante la publicación de grandes conjuntos de datos abiertos. Su versión más conocida, LAION-5B, contiene aproximadamente 5,85 mil millones de pares de imagen y texto filtrados a partir de datos web de rastreo común utilizando el modelo CLIP de OpenAI para mantener los pares donde se alinean el título y la imagen. Fundamentalmente, LAION no aloja las imágenes en sí; distribuye URL y metadatos, para que los usuarios descarguen imágenes de las fuentes web originales. Estos conjuntos de datos fueron fundamentales para entrenar Stable Diffusion y otros modelos abiertos de conversión de texto a imagen. LAION se ha enfrentado a un serio escrutinio: en 2023, los investigadores encontraron enlaces a imágenes de abuso ilegal en el conjunto de datos, lo que llevó a LAION a eliminarlo, limpiarlo y volver a publicar una versión más segura, destacando los riesgos del scraping a escala web sin filtrar.
Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.
Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.
Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.
Los conjuntos de datos multimodales abiertos enfrentarán una presión cada vez mayor en torno a los derechos de autor, el consentimiento y el contenido dañino, lo que impulsará hacia un filtrado más sólido, una recopilación basada en licencias y registros de exclusión voluntaria. La nueva publicación de LAION de un conjunto de datos limpio indica un cambio hacia la auditoría de seguridad como paso predeterminado. Espere más datos sintéticos o con licencia, estándares de procedencia y herramientas de detección. La tensión entre el acceso abierto para los laboratorios pequeños y los riesgos legales y éticos de los datos extraídos de la web definirá la siguiente fase de la construcción de conjuntos de datos.
Entrenamiento de modelos abiertos de conversión de texto a imagen, como Stable Diffusion, en miles de millones de pares de imágenes y títulos
Creación y evaluación comparativa de sistemas de clasificación de disparo cero y recuperación de texto de imagen estilo CLIP
Investigación del sesgo del conjunto de datos, la seguridad del contenido y la procedencia de los datos a escala web
Filtrar subconjuntos por idioma, resolución o puntuación estética para crear conjuntos de datos de ajuste especializados
Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.
Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.
La dependencia de un único proveedor aumenta los costos de bloqueo y migración.
Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.
Revise los términos legales, de seguridad y de privacidad antes de la integración.
Mantenga un plan alternativo entre modelos o proveedores.
Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
LAION es una organización alemana sin fines de lucro que lanzó conjuntos masivos de datos abiertos de imágenes y texto, el más famoso LAION-5B, que impulsó el entrenamiento de modelos generativos abiertos como Stable Diffusion. Es importante porque puso datos multimodales a escala web a disposición de investigadores fuera de las grandes corporaciones.
LAION no aloja imágenes; distribuye URL y metadatos, para que los usuarios obtengan imágenes de sus fuentes web originales.
LAION-5B contiene alrededor de 5.850 millones de pares de imagen-texto, de ahí el '5B' en su nombre.
LAION utilizó el CLIP de OpenAI para medir la similitud de la imagen y el título y descartar pares mal coincidentes.
Stable Diffusion, un modelo abierto de texto a imagen, se entrenó con datos de imagen-texto de LAION.
Los investigadores encontraron enlaces a material ilegal sobre abuso infantil, lo que llevó a LAION a eliminar el conjunto de datos, limpiarlo y volver a publicar una versión más segura.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
IA de código abierto
Empresas