Техническое РУКОВОДСТВО

Федеративное обучение

Федеративное обучение обучает общую модель на многих устройствах или организациях без сбора необработанных данных в одном месте.

2 минуты чтенияПоследнее обновление

Обзор

Only model updates travel to the server, so the sensitive data stays where it lives.

Глубокое погружение

При обычном обучении все данные собираются на центральных серверах. Федеративное обучение меняет ситуацию: глобальная модель рассылается участникам (телефонам, больницам, банкам), каждый обучается локально на своих собственных данных, и обратно отправляются только результирующие изменения веса. Сервер усредняет эти обновления в улучшенную глобальную модель и повторяет действия. Google представил идею Gboard, улучшающую прогнозирование клавиатуры на миллионах телефонов без загрузки того, что набирают люди. Этот подход эффективен там, где данные являются конфиденциальными, регулируемыми или слишком большими для перемещения, например, медицинские записи, разбросанные по больницам. Проблемы включают в себя ненадежные устройства, данные, которые резко различаются между участниками (данные, не относящиеся к IID), а также тот факт, что необработанные обновления все еще могут привести к утечке информации, поэтому они сочетаются с методами обеспечения конфиденциальности.

Техническая информация

Классическим алгоритмом является федеративное усреднение (FedAvg): каждый клиент выполняет несколько локальных шагов градиентного спуска, затем сервер берет средневзвешенное значение новых весов, обычно взвешенных по объему данных, имеющихся у каждого клиента. Поскольку перед синхронизацией клиенты тренируются выполнять несколько шагов, количество раундов связи резко сокращается по сравнению с отправкой каждого градиента. Чтобы предотвратить утечку данных из обновлений, интегрированные системы добавляют безопасное агрегирование, которое позволяет серверу видеть только общую сумму, и дифференциальную конфиденциальность, которая вносит калиброванный шум.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее федеративного обучения

Федеративное обучение переходит от клавиатур к межорганизационному использованию в здравоохранении, финансах и Интернете вещей, где такие правила, как HIPAA и GDPR, затрудняют объединение данных. Ожидайте более тесной интеграции с дифференциальной конфиденциальностью и безопасной агрегацией, а также таких платформ, как TensorFlow Federated, Flower и NVIDIA FLARE, готовых к использованию в производстве. Растущим фронтом становится объединенная точная настройка больших языковых моделей, позволяющая организациям совместно улучшать модели конфиденциального текста. Ключевым направлением исследований остается улучшение обращения с неравномерно распределенными и ненадежными участниками.

Реальная реализация

Google Gboard улучшает прогнозирование следующих слов и смайлов на телефонах без загрузки нажатий клавиш.

Больницы совместно обучают моделям диагностической визуализации, не обмениваясь защищенными записями пациентов.

Банки сотрудничают в разработке моделей обнаружения мошенничества, сохраняя при этом конфиденциальность транзакций каждого учреждения.

Apple персонализирует такие функции устройства, как QuickType и предложения Siri, используя локальное обучение.

Риски и ограничения

Оптимизация одного теста может скрыть более широкие недостатки системы.

Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

1

Определите целевые показатели задержки, качества и стоимости перед внедрением.

2

Тестирование при реалистичной нагрузке и условиях данных.

3

Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

4

Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Federated Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

CI/CD для машинного обучения

Часто задаваемые вопросы

What is Federated Learning?

Федеративное обучение обучает общую модель на многих устройствах или организациях без сбора необработанных данных в одном месте. На сервер передаются только обновления модели, поэтому конфиденциальные данные остаются там, где они находятся.

How does federated learning train a shared model without centralizing user data?

Федеративное обучение сохраняет необработанные данные локальными; каждый участник обучается на своих собственных данных и отправляет только обновления модели, которые объединяет сервер.

Что делает на сервере алгоритм федеративного усреднения (FedAvg)?

FedAvg объединяет локально обученные веса клиентов в единую улучшенную глобальную модель, обычно взвешивая каждого клиента по объему использованных данных.

Какой продукт, как известно, использовал федеративное обучение для улучшения прогнозов?

Google использовал федеративное обучение в Gboard, чтобы улучшить прогнозирование текста с миллионов телефонов, не собирая при этом то, что набирают пользователи.

Почему федеративное обучение привлекательно для данных здравоохранения?

Данные о состоянии здоровья являются конфиденциальными и регулируются, поэтому сохранение их локальным и при этом построение общей модели гораздо лучше соответствует законам вроде HIPAA, чем объединение их в пул.

Почему сами по себе обновления моделей не являются автоматически полностью конфиденциальными?

Градиенты и изменения веса могут раскрыть подробную информацию об обучающих примерах, поэтому добавляются безопасное агрегирование и дифференциальная конфиденциальность.