Que s'est-il passé
TypeSafe AI a annoncé la sortie en accès anticipé de Jev, une nouvelle classe de modèle d'IA conçue spécifiquement pour une prise de décision rapide et structurée au sein des flux de travail logiciels. Contrairement aux grands modèles de langage traditionnels qui génèrent du texte de manière séquentielle, Jev utilise une architecture d'échantillonnage parallèle et une méthode de formation appelée apprentissage par renforcement pour les décisions calibrées (RLCD) pour générer directement des valeurs probabilistes saisies. La société affirme que Jev atteint des niveaux d'intelligence similaires à ceux des LLM frontaliers sur des tâches spécifiques du « System One » tout en fonctionnant 40 à 200 fois plus rapidement, avec des temps de réponse compris entre 70 ms et 500 ms. Le modèle est conçu pour éliminer les hallucinations et les erreurs de type en limitant les sorties à des schémas prédéfinis, ce qui le rend adapté aux applications en temps réel, au traitement des données et aux flux de travail automatisés où la latence et la fiabilité sont essentielles.
TypeSafe AI, une société issue de deux années de développement furtif, a lancé son premier produit, Jev, en accès anticipé. Le modèle est classé dans la catégorie « System One », un terme inspiré de la distinction de Daniel Kahneman entre la pensée rapide et intuitive et le raisonnement lent et délibéré. L'innovation principale est le passage de la génération de texte autorégressive à l'échantillonnage parallèle, ce qui permet au modèle de générer toutes les sorties en une seule requête plutôt que jeton par jeton.
L'architecture technique comprend une nouvelle conception de modèle et une méthode de formation appelée for Calibrated Decisions (RLCD). Cette approche se concentre sur la production de résultats avec des probabilités épistémiquement honnêtes, garantissant que les scores de confiance du modèle correspondent à sa précision réelle. Le modèle est optimisé pour les sorties structurées, ce qui signifie qu'il ne génère pas de texte de forme libre mais plutôt des valeurs saisies qui s'inscrivent dans des schémas prédéfinis, éliminant ainsi la possibilité d'erreurs de type et d'hallucinations dans le contexte de données structurées.
TypeSafe affirme que Jev offre un avantage significatif en termes de performances par rapport aux LLM frontières existants pour des tâches spécifiques. La société rapporte des temps de réponse de bout en bout compris entre 70 ms et 500 ms, contre 3 à 329 secondes pour les LLM standards. Cela se traduit par une accélération de 40x à 200x pour les requêtes de forme « System One ». La société met également en avant la rentabilité, citant des chiffres jusqu'à 193,6 fois plus rapides et 444,6 fois moins chers dans ses évaluations internes, bien qu'elle note qu'il s'agit d'estimations supérieures.
Le modèle est actuellement disponible en accès anticipé, la société intégrant activement les développeurs à partir d'une liste d'attente. Le service est actuellement basé sur la côte ouest et la société a déclaré que les prix sont transparents mais qu'ils pourraient être subventionnés à court terme. La version initiale se concentre sur les entrées d'état basées sur du texte, avec la prise en charge d'une cardinalité allant jusqu'à 255 choix, en utilisant un système en deux étapes pour des scénarios de cardinalité plus élevée afin de gérer la latence.
Détails de la source: typesafe.ai ↗
Pourquoi c'est important
Cette version résout un goulot d'étranglement important dans l'automatisation de l'IA : la latence et le manque de fiabilité des LLM à usage général lorsqu'ils sont intégrés dans le code de production. En fournissant un modèle qui produit des décisions structurées et sécurisées avec des scores de confiance calibrés, TypeSafe permet aux développeurs d'intégrer l'IA dans des flux de travail à haute fréquence, tels que des fonctionnalités d'expérience utilisateur en temps réel, un mappage de données à grande échelle et des arbres de décision complexes, sans les frais généraux liés à l'analyse et à la validation des sorties en texte libre. La rapidité et la rentabilité revendiquées pourraient abaisser la barrière à l’entrée de l’automatisation basée sur l’IA, permettant ainsi des cas d’utilisation qui étaient auparavant économiquement ou techniquement irréalisables en raison de la nature lente et sujette aux erreurs de l’inférence LLM standard.
La principale proposition de valeur de Jev est sa capacité à fonctionner comme un moteur de décision fiable et à faible latence au sein des systèmes logiciels. Les LLM traditionnels sont souvent trop lents et sujets aux erreurs pour les applications en temps réel ou le traitement de gros volumes de données. En fournissant un modèle qui garantit des sorties de type sécurisé et des probabilités calibrées, TypeSafe permet une nouvelle catégorie de flux de travail basés sur l'IA, tels que la logique de notation, de routage et de branchement en temps réel, qui peuvent être intégrés directement dans le code sans avoir besoin de couches complexes d'analyse et de validation.
Les implications économiques sont importantes. Si les avantages revendiqués en termes de coût et de rapidité perdurent en production, Jev pourrait rendre l’automatisation de l’IA viable pour un plus large éventail de processus métier. L'entreprise fait une analogie avec le paradoxe de Jevons, suggérant qu'à mesure que le coût de l'intelligence baisse, la demande augmentera, ouvrant la voie à de nouveaux cas d'utilisation qui étaient auparavant trop coûteux ou lents à mettre en œuvre.
L'accent mis sur les probabilités calibrées est particulièrement important pour les applications d'entreprise où la prise de décision nécessite une compréhension claire de l'incertitude. En fournissant des scores de confiance cohérents et honnêtes, Jev permet aux développeurs de créer des systèmes capables de prendre des décisions éclairées basées sur les résultats du modèle, plutôt que de s'appuyer sur les explications en texte libre du modèle, qui peuvent être incohérentes et difficiles à analyser.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Que regarder ensuite
Les développeurs doivent surveiller les commentaires d'accès anticipé concernant les performances réelles du modèle dans les environnements de production, en particulier sa cohérence et la précision de ses probabilités calibrées. La société a noté que ses critères d'évaluation peuvent contenir des biais, et qu'une vérification indépendante des avantages allégués en termes de rapidité et de coût est donc nécessaire. De plus, l'expansion des capacités de Jev au-delà de l'état basé sur le texte vers d'autres types de données, tels que les images, sera un indicateur clé de son utilité plus large dans divers scénarios d'automatisation.
Une vérification indépendante des allégations de performance est cruciale. TypeSafe a reconnu que ses critères d'évaluation peuvent contenir des biais, car les flux de travail ont été créés par sa propre équipe et les réponses de référence étaient basées sur la moyenne de modèles frontières spécifiques. Des tests tiers seront nécessaires pour confirmer les avantages réels de Jev en termes de vitesse, de coût et de précision dans divers scénarios réels.
L'expansion des modalités de saisie de Jev est un domaine clé à surveiller. La version actuelle se concentre sur l'état basé sur le texte, mais la société a fait allusion à la prise en charge future d'autres types de données, tels que les images. La capacité de traiter des entrées multimodales élargira considérablement l'applicabilité du modèle dans des domaines tels que la vision par ordinateur et l'analyse de données complexes.
Les commentaires des développeurs sur le programme d'accès anticipé fourniront des informations précieuses sur la convivialité pratique du modèle. Les problèmes liés à l'intégration, à la stabilité de l'API et à l'exactitude des probabilités calibrées dans les cas extrêmes seront des facteurs critiques pour déterminer le succès et l'adoption à long terme du modèle.