ДалееСледующее руководство
Оперативное управление версиями и регрессионное тестирование
Технический
Техническое РУКОВОДСТВО
Автоматическая оптимизация подсказок использует алгоритм для поиска лучших инструкций или примеров с несколькими кадрами.
Он оценивает подсказки кандидатов по метрике на наборе примеров, вместо того, чтобы полагаться на вручную измененные формулировки. К хорошо известным подходам относятся APE, Google OPRO от DeepMind и DSPy, платформа с открытым исходным кодом из Стэнфорда. Вместе они превращают оперативное проектирование из догадок в измеримый и повторяемый процесс.
У настраиваемых вручную подсказок есть известный недостаток. Формулировки, которые подходят для одной модели, набора данных или версии, могут незаметно перестать работать для другой, а изменения обычно оцениваются лишь на нескольких примерах. Автоматическая оптимизация подсказок заменяет этот цикл поиском. Вы предоставляете три вещи: - Задание. - Набор входных данных, в идеале с ожидаемыми результатами. – Метрика, например точное совпадение или рубрика, оцененная другой моделью. Оптимизатор генерирует подсказки кандидатов, запускает их, оценивает и сохраняет победителей. Первые примеры конкретизировали идею. APE (Инженер автоматических подсказок, Чжоу и др., 2022) предложил модель, предлагающую множество инструкций из примеров ввода-вывода, а затем сохранила те, которые получили наивысшие оценки. OPRO (Optimization by PROmpting, Yang et al., Google DeepMind, 2023) использовала LLM в качестве оптимизатора. В его мета-подсказке были перечислены предыдущие инструкции с их оценками, а модель предлагала новые. OPRO нашел такие инструкции, как «Сделай глубокий вдох и работай над этой задачей шаг за шагом», которые получили хорошие оценки для одной конкретной модели по математике в начальной школе. Оптимизированная формулировка может быть неинтуитивной и специфичной для модели. DSPy идет дальше, меняя способ написания программ. Он был разработан в Стэнфордском НЛП Омаром Хаттабом и его коллегами и представлен в 2023 году. Вы объявляете, что делает каждый шаг, с помощью подписи, например «вопрос, контекст -> ответ», и комбинируете модули, такие как Predict или ChainOfThought. Оптимизатор (ранее называемый телесуфлером), такой как BootstrapFewShot или MIPROv2, затем «компилирует» программу, выбирая демонстрации и инструкции для каждого модуля, чтобы максимизировать ваши показатели. Стоит исправить три заблуждения: - Эти инструменты устраняют человеческое суждение. Это не так, потому что показатели и примеры определяют «лучше». - Оптимизированным подсказкам можно доверять. Они могут переохватить небольшой набор данных. - Оптимизация бесплатна. Это требует реальных вызовов API, иногда многих.
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Быстрая оптимизация становится обычной частью проектирования LLM наряду с оценочными пакетами, а не предметом исследования. Открытые вопросы остаются. Насколько хорошо оптимизированные подсказки передаются между моделями? Как вы пишете показатели субъективных качеств, таких как тон или готовность помочь? Как избежать переобучения небольших наборов данных? Некоторые исследования сочетают быструю оптимизацию с облегченной точной настройкой, и DSPy поддерживает и то, и другое. Модели часто меняются, поэтому возможность автоматической повторной оптимизации на основе стабильного набора тестов, вероятно, будет иметь большее значение, чем какой-либо один умный запрос. Определение хороших показателей и примеров остается человеческой работой.
Команда, создающая классификатор заявок в службу поддержки, записывает подпись DSPy «заявка -> категория» и предоставляет 200 помеченных заявок и показатель точности. Затем оптимизатор выбирает несколько демонстраций, которые получают наилучшие результаты.
Когда компания переходит от одного поставщика LLM к другому, она повторно запускает оптимизатор DSPy для новой модели. Он не переписывает вручную подсказки, настроенные для старой модели.
Исследователь запускает цикл в стиле OPRO. Одна модель предлагает новые формулировки инструкции, каждая формулировка оценивается по математическому тесту, и история лучших результатов возвращается в следующий раунд предложений.
Конвейер вопросов и ответов с расширенным поиском оптимизирован от начала до конца с помощью метрики, которая сравнивает окончательные ответы с эталонными ответами. И этап написания запроса, и этап ответа улучшаются вместе.
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Автоматическая оптимизация подсказок использует алгоритм для поиска лучших инструкций или примеров с несколькими кадрами. Он оценивает подсказки кандидатов по метрике на наборе примеров, вместо того, чтобы полагаться на вручную измененные формулировки. К хорошо известным подходам относятся APE, Google OPRO от DeepMind и DSPy, платформа с открытым исходным кодом из Стэнфорда. Вместе они превращают оперативное проектирование из догадок в измеримый и повторяемый процесс.
Оптимизатору нужна задача, примеры и метрика, чтобы он мог оценить подсказки-кандидаты и сохранить лучшие.
OPRO использует языковую модель в качестве оптимизатора. Он видит прошлые инструкции с их оценками и предлагает новые.
Инструкция получила хорошие оценки для одной конкретной модели по математике в начальной школе. Формулировка, найденная при поиске, может оказаться неожиданной и не перенестись на другие модели.
Сигнатуры определяют, что должен делать модуль с точки зрения полей ввода и вывода. Затем DSPy обрабатывает приглашение.
Успешные следы становятся редкими примерами, в том числе для внутренних шагов, которые вы никогда не обозначили для себя.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Оперативное управление версиями и регрессионное тестирование
Технический