A continuaciónSiguiente guía
LAION y conjuntos de datos abiertos
Empresas
GUÍA de empresas
StarCoder es un modelo de lenguaje grande abierto para código, creado por ServiceNow Research y Hugging Face a través del proyecto BigCode.
It matters because it brought a permissively licensed, transparently trained coding assistant to a field dominated by closed models.
StarCoder es una familia de modelos de generación de código lanzada en mayo de 2023 por BigCode, una colaboración codirigida por ServiceNow Research y Hugging Face. El buque insignia StarCoderBase es un modelo de 15,5 mil millones de parámetros entrenado en aproximadamente un billón de tokens extraídos de The Stack, un gran conjunto de datos de código fuente con licencia permisiva que abarca más de 80 lenguajes de programación. Una característica distintiva clave es su ventana de contexto de 8000 tokens y su entrenamiento Fill-in-the-Middle, lo que le permite completar el código dadas las líneas anteriores y siguientes en lugar de solo predecir hacia adelante. BigCode hizo hincapié en la gobernanza de datos: publicó los datos de capacitación, ofreció una herramienta de exclusión voluntaria para los desarrolladores y lanzó el modelo bajo la licencia responsable OpenRAIL-M. StarCoder2, lanzado en 2024, amplió la cobertura a más de 600 idiomas.
Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.
Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.
Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.
Los modelos de código se están moviendo hacia flujos de trabajo agentes en los que no solo se autocompletan sino que también planifican, ejecutan pruebas y corrigen su propia salida. StarCoder2, capacitado en el conjunto de datos más grande Stack v2 creado con Software Heritage, apunta hacia una cobertura de lenguaje más amplia y una mejor procedencia de los datos. Espere un énfasis continuo en datos de capacitación transparentes, mecanismos de exclusión voluntaria y claridad en las licencias a medida que crece el escrutinio legal de los modelos entrenados en código, además de una integración más estrecha en las plataformas de desarrollo empresarial.
Impulsar sugerencias de autocompletado y finalización de código dentro de complementos IDE y extensiones de editor
Generar funciones repetitivas, pruebas unitarias y cadenas de documentación a partir de un comentario en lenguaje natural
Traducir o refactorizar código entre lenguajes de programación dentro de una base de código empresarial
Sirve como asistente de codificación autohospedable para organizaciones que no pueden enviar código propietario a API de nube cerrada.
Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.
Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.
La dependencia de un único proveedor aumenta los costos de bloqueo y migración.
Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.
Revise los términos legales, de seguridad y de privacidad antes de la integración.
Mantenga un plan alternativo entre modelos o proveedores.
Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
StarCoder es un modelo de lenguaje grande abierto para código, creado por ServiceNow Research y Hugging Face a través del proyecto BigCode. Es importante porque trajo un asistente de codificación capacitado de manera transparente y con licencia permisiva a un campo dominado por modelos cerrados.
BigCode fue un esfuerzo de colaboración codirigido por ServiceNow Research y Hugging Face para crear modelos de código abiertos y desarrollados de forma responsable.
StarCoder recibió capacitación en The Stack, un gran corpus de código con licencia permisiva en más de 80 idiomas.
La capacitación Fill-in-the-Middle reordena los documentos para que el modelo aprenda a generar un intervalo faltante dado el contexto anterior y siguiente.
StarCoderBase tiene alrededor de 15,5 mil millones de parámetros, modestos para los estándares actuales pero fuertes para su tamaño en tareas de código.
StarCoder utiliza atención de consultas múltiples, compartiendo proyecciones de claves y valores entre cabezas para reducir la memoria y acelerar la inferencia de contexto a largo plazo.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
LAION y conjuntos de datos abiertos
Empresas