GUIDE Technique

Formats de sérialisation des modèles

La sérialisation de modèles est la façon dont un modèle d'apprentissage automatique formé est enregistré sur le disque afin qu'il puisse être chargé et exécuté ultérieurement, sur une autre machine ou dans une autre langue.

2 minutes de lectureDernière mise à jour

Aperçu

Le format que vous choisissez affecte la portabilité, la vitesse, la taille du fichier et même la sécurité.

Plongée profonde

Après la formation, un modèle n'est constitué que de chiffres (poids) plus une description de son architecture. La sérialisation écrit cet état dans un fichier. Différents écosystèmes utilisent différents formats. Les fichiers pickle de Python et .pt par défaut de PyTorch sont pratiques mais vous lient à Python et peuvent exécuter du code arbitraire au chargement, ce qui en fait un risque de sécurité avec des fichiers non fiables. ONNX (Open Neural Network Exchange) est un format neutre en termes de framework qui permet à un modèle formé dans PyTorch de s'exécuter dans un autre environnement d'exécution ou langage. SavedModel et l'ancien HDF5 servent TensorFlow et Keras. Pour les grands modèles de langage, les safetensors sont devenus populaires car ils stockent uniquement les données tensorielles dans une disposition simple, rapide et mappable en mémoire sans exécution de code, ce qui les rend à la fois plus sûrs et plus rapides à charger. GGUF est largement utilisé pour exécuter efficacement des LLM quantifiés sur du matériel local.

Aperçu technique

Le compromis clé se situe entre les formats natifs du framework et les formats d’échange. Les formats natifs (pickle, .pt) capturent des objets Python complets mais nécessitent le même code pour être désérialisés et peuvent exécuter du code caché. Les formats d'échange comme ONNX exportent le graphique de calcul et les pondérations dans un schéma standardisé (à l'aide de tampons de protocole) afin que tout environnement d'exécution compatible puisse l'exécuter. Safetensors devient minimal : un petit en-tête JSON décrivant le nom, la forme et le type de chaque tenseur, suivi des octets bruts, permettant un mappage de mémoire sans copie.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir des formats de sérialisation de modèles

Attendez-vous à une consolidation continue autour de formats sûrs et portables. Safetensors devient la norme par défaut pour partager publiquement les poids des modèles, car il supprime le risque d'exécution de code de pickle, et GGUF est la norme de facto pour l'inférence LLM locale avec quantification. ONNX continue de se développer en tant que pont entre les cadres de formation et les temps d'exécution de déploiement optimisés sur les appareils de périphérie, les navigateurs et les accélérateurs. Dans l’ensemble, la tendance privilégie les formats neutres en termes de langage, économes en mémoire et sécurisés de par leur conception.

Mise en œuvre dans le monde réel

Une équipe entraîne un modèle dans PyTorch, l'exporte vers ONNX et l'exécute dans une application C# sans dépendance Python.

Hugging Face distribue les poids des modèles sous forme de tenseurs de sécurité afin que les utilisateurs puissent les télécharger sans risque d'exécution de code malveillant.

Un développeur télécharge un fichier GGUF d'un LLM quantifié pour l'exécuter localement sur le processeur d'un ordinateur portable.

Un service TensorFlow charge un répertoire SavedModel contenant le graphique et les variables pour servir des prédictions via une API.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Serialization Formats quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Questions fréquemment posées

Qu'est-ce que les formats de sérialisation des modèles ?

La sérialisation de modèles est la façon dont un modèle d'apprentissage automatique formé est enregistré sur le disque afin qu'il puisse être chargé et exécuté ultérieurement, sur une autre machine ou dans une autre langue. Le format que vous choisissez affecte la portabilité, la vitesse, la taille du fichier et même la sécurité.

Pourquoi le format pickle de Python est-il considéré comme un risque de sécurité pour les modèles ?

Le décapage peut exécuter du code arbitraire, donc le chargement d'un fichier pickle non fiable peut compromettre votre système.

Quel est le principal avantage du format ONNX ?

ONNX est un format d'échange indépendant du framework, permettant la portabilité entre les environnements d'exécution, les langages et le matériel.

Pourquoi les tenseurs de sécurité sont-ils devenus populaires pour partager les poids des modèles ?

Safetensors évite le risque d'exécution de code lié au pickle et se charge rapidement via le mappage mémoire, ce qui le rend sûr et efficace.

À quel cas d'utilisation ?

GGUF est le format de facto pour distribuer et exécuter des LLM quantifiés localement et efficacement.

Que stocke principalement un format d’échange comme ONNX ?

ONNX capture le graphique de calcul et les paramètres du modèle dans un schéma standard afin que tout environnement d'exécution compatible puisse l'exécuter.