Que s'est-il passé
Tech Times rapporte que Positron AI, basée à Reno, a clôturé un cycle de financement de série C de 875 millions de dollars pour une valorisation post-argent de 5 milliards de dollars. Le financement est destiné à soutenir Asimov, un ASIC d'inférence personnalisé dont la sortie sur bande est prévue d'ici la fin de 2026 et la production au second semestre 2027. La conception utilise la mémoire LPDDR5X plutôt que le HBM utilisé dans les principaux accélérateurs Nvidia.
Tech Times rapporte que le financement de Positron s'est déroulé en deux tranches : une série C de 375 millions de dollars avec une valorisation pré-argent annoncée de 3,5 milliards de dollars et une série C-1 pouvant atteindre 500 millions de dollars. Le média indique que les investisseurs comprenaient NEA, Andra Capital, Atreides Management, Valor Equity Partners, SemiAnalysis Capital, la Qatar Investment Authority, Cisco Investments et d'autres. Le rapport indique que Positron prévoit d'utiliser le capital pour Asimov et les infrastructures d'ingénierie associées.
Selon Tech Times, Asimov est conçu pour utiliser LPDDR5X, un type de mémoire standard utilisé dans les smartphones et les ordinateurs portables, au lieu du HBM. La société affirme que son architecture pourrait atteindre une utilisation de la bande passante mémoire supérieure à 90 %, tandis que le rapport indique que Positron caractérise l'utilisation typique du décodage par inférence GPU comme inférieure à 30 %. Ces chiffres sont attribués à Positron et ne sont pas confirmés de manière indépendante. Tech Times rapporte également que le système Atlas de Positron est déployé dans plus de 50 racks Oracle Cloud Infrastructure et est utilisé par le service d'inférence Parasail, Jump Trading et i3d.net étant identifiés comme clients de production. La source n’établit pas de disponibilité générale ni de prix.
Détails de la source: techtimes.com ↗
Pourquoi c'est important
Le financement met en évidence un différend matériel conséquent sur la manière dont l’inférence de l’IA doit être optimisée. Positron affirme que le décodage de modèles séquentiels n’utilise souvent qu’une fraction de la bande passante mémoire théorique d’un accélérateur, ce qui rend l’utilisation efficace, la capacité de mémoire et la disponibilité de la chaîne d’approvisionnement plus importantes que la seule bande passante maximale. Si les affirmations de l’entreprise sont fondées, son approche pourrait offrir une infrastructure d’inférence moins coûteuse et plus largement déployable. Cependant, le récit du Tech Times indique clairement qu’Asimov n’a pas enregistré ses performances et que ses chiffres de performance restent des objectifs de conception de l’entreprise, et non des mesures indépendantes.
Tech Times présente le cycle comme un pari sur le matériel spécifique à l'inférence à une époque où les systèmes d'IA sont de plus en plus exécutés en continu pour les utilisateurs plutôt que seulement formés. Le rapport indique que la conception de Positron cible entre 288 Go et 2 304 Go de mémoire par puce Asimov, avec une capacité supplémentaire possible grâce à l'extension CXL, et indique que Titan est destiné à servir des modèles dépassant 16 000 milliards de paramètres. Il s’agit de spécifications planifiées et non de capacités démontrées.
L’argument de la chaîne d’approvisionnement est également important. La source indique que HBM dépend d'une fabrication spécialisée et d'un emballage avancé, tandis que le LPDDR5X est produit par plusieurs fournisseurs à plus grande échelle. Cela pourrait être important pour les acheteurs limités par la disponibilité de la mémoire, l’alimentation du rack ou les exigences de refroidissement. Tech Times rapporte que Titan est conçu pour des installations refroidies par air et par liquide, mais aucun résultat indépendant en termes de coût total, de débit ou d'efficacité n'est fourni.
La mise en garde centrale est la validation. La source cite des commentaires antérieurs de tiers selon lesquels les comparaisons de l'Atlas de Positron avec les systèmes Nvidia nécessitent une vérification, et affirme qu'Asimov n'a pas encore enregistré. Tech Times rapporte également une estimation de la bande passante réalisable pour Asimov nettement inférieure à la bande passante maximale de la future architecture Rubin de Nvidia. L’issue reste donc en suspens.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
Which component of an AI application is the machine-learning model itself?
Que regarder ensuite
Les tests clés sont l'enregistrement d'Asimov, les benchmarks indépendants, la disponibilité de la production et l'économie des systèmes Titan construits à partir des puces Asimov. Les conditions d'accès, l'éligibilité des clients et les tarifs pour Asimov et Titan ne sont pas documentés dans la source. Les déploiements Atlas actuels de Positron offrent une expérience opérationnelle, mais ils ne valident pas de manière indépendante les futures performances d’Asimov.
Surveillez les tests signalés par Asimov fin 2026, le silicium fonctionnel et les tests indépendants sur différentes tailles de modèles, longueurs de contexte et charges de travail de décodage. Les mesures les plus utiles seront les jetons par dollar, les jetons par watt, la capacité de mémoire utilisable et le débit soutenu plutôt que les seules spécifications de pointe.
Regardez si les déploiements d'Atlas signalés s'étendent au-delà des clients actuels et si Positron offre une voie d'approvisionnement claire pour les entreprises. La source ne documente pas les conditions d'achat publiques, l'accès au cloud, le prix des services ou une date de sortie générale pour Asimov ou Titan.
Vérifiez également si les avantages de l’approvisionnement et du conditionnement du LPDDR5X se traduisent par une production fiable à grande échelle. La source présente la feuille de route de Positron et le soutien des investisseurs comme une preuve de confiance, mais ni l’un ni l’autre n’établit que le futur ASIC correspondra aux systèmes basés sur HBM en termes de performances ou d’économies réelles.