Búsqueda de haz
La búsqueda por haz es una estrategia de decodificación que mantiene las secuencias parciales más prometedoras en cada paso en lugar de comprometerse con avidez con una.
Descripción general
It matters because it produces higher-quality, more coherent text for tasks like translation and summarization than picking the single best word every time.
Buceo profundo
Cuando un modelo de lenguaje genera texto, predice una probabilidad para el siguiente token y luego lo repite. La decodificación codiciosa siempre toma el token de mayor probabilidad, pero eso puede arrinconarlo: una elección temprana que sea la mejor a nivel local puede conducir a una sentencia peor en general. Haz de búsqueda de coberturas manteniendo las secuencias parciales top-k (el 'ancho del haz', a menudo 4-10). En cada paso, expande cada haz con posibles siguientes tokens, califica a todos los candidatos según su probabilidad logarítmica acumulada y mantiene solo el k superior. El resultado es la secuencia completa con la puntuación más alta. Se convirtió en el estándar para la traducción automática y sigue siendo común cuando un resultado fiel y de alta probabilidad importa más que la creatividad.
Información técnica
La búsqueda por haz puntúa secuencias sumando las probabilidades logarítmicas de los tokens, lo que la predispone hacia secuencias más cortas (cada token adicional agrega un término negativo). Para contrarrestar esto, los sistemas aplican la normalización de la longitud, dividiendo la puntuación por la longitud de la secuencia (a veces elevada a una potencia). Un ancho de haz mayor explora más candidatos, pero cuesta más cálculo y, contrariamente a la intuición, a veces puede producir un texto más insulso o degenerado, un efecto bien documentado en la traducción automática neuronal.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro de la búsqueda por haz
Para la generación creativa abierta, la búsqueda de haces se reemplaza cada vez más por métodos de muestreo (top-k, núcleo) porque los haces tienden a producir texto genérico y repetitivo. Pero para tareas restringidas (traducción, reconocimiento de voz, generación de código, salida estructurada), la búsqueda de haces y sus variantes (búsqueda de haces diversos, búsqueda de haces restringida que fuerza las palabras requeridas) siguen siendo valiosas. Espere enfoques híbridos continuos que combinen la exploración estilo haz con muestreo, además de una decodificación consciente de las tareas que adapta la estrategia a si la prioridad es la fidelidad o la diversidad.
Implementación en el mundo real
Sistemas de traducción automática neuronal que eligen la interpretación más fluida de una oración entre muchas frases candidatas
Reconocimiento automático de voz que decodifica la transcripción más probable a partir de las probabilidades del modelo acústico
Modelos de subtítulos de imágenes que producen un único título coherente en lugar de uno plausible y aleatorio
Generación restringida que obliga a que aparezcan palabras clave o terminología específicas en la salida mediante la búsqueda de haz restringido
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Beam Search quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Búsqueda de haz guiado con restricciones
Preguntas frecuentes
What is Beam Search?
La búsqueda por haz es una estrategia de decodificación que mantiene las secuencias parciales más prometedoras en cada paso en lugar de comprometerse con avidez con una. Es importante porque produce textos más coherentes y de mayor calidad para tareas como traducción y resúmenes que elegir la mejor palabra cada vez.
¿Qué controla el 'ancho del haz' (k) en la búsqueda del haz?
El ancho del haz es el número de secuencias parciales superiores retenidas y expandidas en cada paso; anchos más grandes exploran más candidatos.
¿En qué se diferencia la búsqueda por haz de la decodificación codiciosa?
La decodificación codiciosa requiere sólo la ficha superior en cada paso; setos de búsqueda de rayos mediante el seguimiento de varias secuencias prometedoras simultáneamente.
¿Por qué se aplica comúnmente la normalización de longitud en la búsqueda de haces?
Cada token adicional agrega una probabilidad logarítmica negativa, por lo que sin normalización, las secuencias más cortas obtienen una puntuación más alta de manera injusta.
¿Para qué tarea es especialmente adecuada la búsqueda por haz?
La búsqueda por haz sobresale cuando el objetivo es una representación única, precisa y fluida, razón por la cual se convirtió en estándar en la traducción.
¿Cuál es una desventaja conocida de utilizar un ancho de haz muy grande para la generación abierta?
Contrariamente a la intuición, los haces más amplios en la generación de texto neuronal a menudo favorecen secuencias genéricas y repetitivas en lugar de secuencias interesantes.