Wat is er gebeurd
PrismML heeft Bonsai 2 27B uitgebracht, een gecomprimeerd groottaalmodel dat is ontworpen om te draaien op personal computers en geavanceerde smartphones zonder cloudinfrastructuur. Het model reduceert Alibaba's Qwen3.8 27B tot 5,9 gigabyte met behulp van ternaire gewichtscompressie, waarbij 98% van de benchmarkprestaties van het origineel behouden blijft. De gewichten zijn beschikbaar onder de Apache 2.0-licentie en ondersteunen NVIDIA GPU's via CUDA en Apple-apparaten via MLX.
PrismML, een startup opgericht door Caltech-onderzoekers en geleid door Babak Hassibi, heeft donderdag Bonsai 2 27B uitgebracht. Het model is een gecomprimeerde versie van Alibaba's Qwen3.8 27B, teruggebracht tot 5,9 gigabyte door middel van ternaire gewichtscompressie, die 16-bits parameters omzet in drie waarden: positieve één, negatieve één of nul. Deze techniek elimineert overbodige parameters, waardoor het model 98% van de benchmarkprestaties van het origineel kan behouden terwijl het op lokale hardware past.
De release markeert een aanzienlijke verbetering ten opzichte van het originele Bonsai-model uit maart, dat 95% van de benchmarkprestaties behield. Volgens PrismML is het originele model meer dan 11 miljoen keer gedownload, waarbij nog eens kleinere modellen 2,6 miljoen keer zijn gedownload, wat wijst op een sterke adoptie door ontwikkelaars van apparaatgebaseerde AI. Het nieuwe model draait op NVIDIA GPU's via CUDA en op Apple-apparaten (Mac, iPhone, iPad) via MLX, waarbij gebruik wordt gemaakt van aangepaste low-bit kernels om een efficiënte lokale uitvoering te garanderen.
De modelgewichten zijn onmiddellijk beschikbaar onder de Apache 2.0-licentie, waardoor brede integratie en aanpassing mogelijk is. PrismML haalde een startronde van $ 22,25 miljoen op, ondersteund door Khosla Ventures, Cerberus Capital en Caltech, met Ion Stoica, medeoprichter van Databricks, als adviseur. De aanpak van het bedrijf is gericht op het benutten van de redundantie in grotere modellen om hoge prestatiepariteit te bereiken met een minimale bestandsgrootte, een strategie die volgens Hassibi effectiever zal worden naarmate de modelgroottes toenemen.
Waarom het ertoe doet
Deze release laat zien dat AI met redeneervermogen lokaal op consumentenhardware kan werken, privacyproblemen kan aanpakken en cloudlatentie en abonnementskosten kan elimineren. Door hoge prestatiepariteit te bereiken met een aanzienlijk kleinere bestandsgrootte, bevordert PrismML de verschuiving van cloudafhankelijke AI naar gedistribueerd, apparaatgebaseerd redeneren, waardoor geavanceerde AI-mogelijkheden toegankelijk worden zonder enorme datacenterinfrastructuur.
De mogelijkheid om AI met redeneervermogen lokaal op consumentenapparaten uit te voeren, pakt kritieke privacyproblemen aan door ervoor te zorgen dat gebruikersgegevens het apparaat nooit verlaten. Dit elimineert de noodzaak van cloudtransmissie, waardoor de latentie wordt verminderd en de lopende abonnementskosten die verband houden met cloudgebaseerde AI-services worden geëlimineerd. Voor ontwikkelaars en eindgebruikers betekent dit een fundamentele verschuiving naar gedistribueerd, apparaatgebaseerd redeneren dat zowel kosteneffectief als privé is.
Het hoge retentiepercentage van 98% benchmarkprestaties in een bestand van 5,9 GB toont aan dat compressietechnieken de intelligentie van grote modellen effectief kunnen behouden. Dit heeft praktische implicaties voor sectoren die AI op apparaten nodig hebben, zoals de gezondheidszorg, de financiële sector en persoonlijke assistenten, waar datasoevereiniteit en realtime respons van cruciaal belang zijn. Het open-source karakter van de release versnelt de acceptatie verder doordat de gemeenschap het model kan voortbouwen en optimaliseren voor specifieke hardwarebeperkingen.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
Ontwikkelaars moeten de beschikbaarheid van op maat gemaakte low-bit kernels voor verschillende hardware-architecturen in de gaten houden, evenals het doel van het bedrijf om de komende maanden modellen met honderden miljarden parameters te comprimeren. Bovendien rechtvaardigt de potentiële integratie met Apple-apparaten, aangegeven door de timing van de release, aandacht voor toekomstige AI-mogelijkheden aan de apparaatzijde.
PrismML heeft verklaard dat het zijn volgende doel is om binnen de komende maanden modellen met honderden miljarden parameters te comprimeren. Succes op dit gebied zou de schaalbaarheid van ternaire compressie voor frontier-class modellen verder valideren, waardoor mogelijk nog geavanceerdere AI-mogelijkheden beschikbaar zouden komen op lokale hardware.
De timing van de release heeft geleid tot speculaties over mogelijke integratie met Apple-apparaten. Terwijl CEO Babak Hassibi weigerde commentaar te geven op berichten over gesprekken met Apple, suggereert de steun voor het MLX-framework van Apple een strategische afstemming met het ecosysteem van Apple. Toekomstige aankondigingen over officiële partnerschappen of apparaatspecifieke optimalisaties kunnen een aanzienlijke impact hebben op de adoptie van lokale AI op iOS- en macOS-platforms.