Terug naar Nieuws
ProductAI Understanding-briefing

PrismML brengt Bonsai 2 uit, een gecomprimeerd 27B-model voor lokale apparaten

PrismML heeft Bonsai 2 uitgebracht, een gecomprimeerde versie van 5,9 GB van Alibaba's Qwen3.8 27B-model die lokaal op smartphones en pc's draait en 98% van de benchmarkprestaties van het origineel behoudt.

4 min readRead the linked source
Source-provided image accompanying PrismML releases Bonsai 2, a compressed 27B model for local devices
BronreferentieBron opgenomen
Uitgever
techjuice.pk
Bronlink
techjuice.pkhttps://www.techjuice.pk/prismml-bonsai-2-27b-llm-compression-smartphone-pc-ai-device/
Brontype
Gekoppelde bron: de status van de primaire bron is niet vastgesteld.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Groot taalmodel (LLM)
Een taalmodel dat is getraind op enorme tekstcorpora om tekst te genereren en te analyseren.
AI op het apparaat
AI-inferentie wordt lokaal uitgevoerd op gebruikershardware in plaats van in een externe cloudservice.
Benchmark
Een gestandaardiseerde test of dataset die wordt gebruikt om de prestaties van modellen te meten en te vergelijken.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

PrismML heeft Bonsai 2 27B uitgebracht, een gecomprimeerd groottaalmodel dat is ontworpen om te draaien op personal computers en geavanceerde smartphones zonder cloudinfrastructuur. Het model reduceert Alibaba's Qwen3.8 27B tot 5,9 gigabyte met behulp van ternaire gewichtscompressie, waarbij 98% van de benchmarkprestaties van het origineel behouden blijft. De gewichten zijn beschikbaar onder de Apache 2.0-licentie en ondersteunen NVIDIA GPU's via CUDA en Apple-apparaten via MLX.

PrismML, een startup opgericht door Caltech-onderzoekers en geleid door Babak Hassibi, heeft donderdag Bonsai 2 27B uitgebracht. Het model is een gecomprimeerde versie van Alibaba's Qwen3.8 27B, teruggebracht tot 5,9 gigabyte door middel van ternaire gewichtscompressie, die 16-bits parameters omzet in drie waarden: positieve één, negatieve één of nul. Deze techniek elimineert overbodige parameters, waardoor het model 98% van de benchmarkprestaties van het origineel kan behouden terwijl het op lokale hardware past.

De release markeert een aanzienlijke verbetering ten opzichte van het originele Bonsai-model uit maart, dat 95% van de benchmarkprestaties behield. Volgens PrismML is het originele model meer dan 11 miljoen keer gedownload, waarbij nog eens kleinere modellen 2,6 miljoen keer zijn gedownload, wat wijst op een sterke adoptie door ontwikkelaars van apparaatgebaseerde AI. Het nieuwe model draait op NVIDIA GPU's via CUDA en op Apple-apparaten (Mac, iPhone, iPad) via MLX, waarbij gebruik wordt gemaakt van aangepaste low-bit kernels om een ​​efficiënte lokale uitvoering te garanderen.

De modelgewichten zijn onmiddellijk beschikbaar onder de Apache 2.0-licentie, waardoor brede integratie en aanpassing mogelijk is. PrismML haalde een startronde van $ 22,25 miljoen op, ondersteund door Khosla Ventures, Cerberus Capital en Caltech, met Ion Stoica, medeoprichter van Databricks, als adviseur. De aanpak van het bedrijf is gericht op het benutten van de redundantie in grotere modellen om hoge prestatiepariteit te bereiken met een minimale bestandsgrootte, een strategie die volgens Hassibi effectiever zal worden naarmate de modelgroottes toenemen.

Brongegevens: techjuice.pk ↗

Waarom het ertoe doet

Deze release laat zien dat AI met redeneervermogen lokaal op consumentenhardware kan werken, privacyproblemen kan aanpakken en cloudlatentie en abonnementskosten kan elimineren. Door hoge prestatiepariteit te bereiken met een aanzienlijk kleinere bestandsgrootte, bevordert PrismML de verschuiving van cloudafhankelijke AI naar gedistribueerd, apparaatgebaseerd redeneren, waardoor geavanceerde AI-mogelijkheden toegankelijk worden zonder enorme datacenterinfrastructuur.

De mogelijkheid om AI met redeneervermogen lokaal op consumentenapparaten uit te voeren, pakt kritieke privacyproblemen aan door ervoor te zorgen dat gebruikersgegevens het apparaat nooit verlaten. Dit elimineert de noodzaak van cloudtransmissie, waardoor de latentie wordt verminderd en de lopende abonnementskosten die verband houden met cloudgebaseerde AI-services worden geëlimineerd. Voor ontwikkelaars en eindgebruikers betekent dit een fundamentele verschuiving naar gedistribueerd, apparaatgebaseerd redeneren dat zowel kosteneffectief als privé is.

Het hoge retentiepercentage van 98% benchmarkprestaties in een bestand van 5,9 GB toont aan dat compressietechnieken de intelligentie van grote modellen effectief kunnen behouden. Dit heeft praktische implicaties voor sectoren die AI op apparaten nodig hebben, zoals de gezondheidszorg, de financiële sector en persoonlijke assistenten, waar datasoevereiniteit en realtime respons van cruciaal belang zijn. Het open-source karakter van de release versnelt de acceptatie verder doordat de gemeenschap het model kan voortbouwen en optimaliseren voor specifieke hardwarebeperkingen.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

Ontwikkelaars moeten de beschikbaarheid van op maat gemaakte low-bit kernels voor verschillende hardware-architecturen in de gaten houden, evenals het doel van het bedrijf om de komende maanden modellen met honderden miljarden parameters te comprimeren. Bovendien rechtvaardigt de potentiële integratie met Apple-apparaten, aangegeven door de timing van de release, aandacht voor toekomstige AI-mogelijkheden aan de apparaatzijde.

PrismML heeft verklaard dat het zijn volgende doel is om binnen de komende maanden modellen met honderden miljarden parameters te comprimeren. Succes op dit gebied zou de schaalbaarheid van ternaire compressie voor frontier-class modellen verder valideren, waardoor mogelijk nog geavanceerdere AI-mogelijkheden beschikbaar zouden komen op lokale hardware.

De timing van de release heeft geleid tot speculaties over mogelijke integratie met Apple-apparaten. Terwijl CEO Babak Hassibi weigerde commentaar te geven op berichten over gesprekken met Apple, suggereert de steun voor het MLX-framework van Apple een strategische afstemming met het ecosysteem van Apple. Toekomstige aankondigingen over officiële partnerschappen of apparaatspecifieke optimalisaties kunnen een aanzienlijke impact hebben op de adoptie van lokale AI op iOS- en macOS-platforms.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-trainingAI-agentenTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?