Paper argumenterer for utviklingsstrategier slår RL ved å holde LLM-svarsett varierte
Et nytt arXiv preprint argumenterer for at LLM-er etter trening med evolusjonsstrategier – en populasjonsbasert, gradientfri metode som forstyrrer vekter direkte – slår forsterkende læring på pass@k og løsningsdekning. Sammendraget siterer bedre matematiske benchmark-resultater, men nevner ingen modeller, benchmarks eller tall.