Назад към Новини
ПродуктAI Understanding брифинг

PrismML пуска Bonsai 2, компресиран 27B модел за локални устройства

PrismML пусна Bonsai 2, 5,9 GB компресирана версия на модела Qwen3.8 27B на Alibaba, който работи локално на смартфони и персонални компютри, като същевременно запазва 98% от бенчмарк производителността на оригинала.

4 min readRead the linked source
Source-provided image accompanying PrismML releases Bonsai 2, a compressed 27B model for local devices
ИзточникИзточникът е записан
Издател
techjuice.pk
Изходна връзка
techjuice.pkhttps://www.techjuice.pk/prismml-bonsai-2-27b-llm-compression-smartphone-pc-ai-device/
Тип източник
Свързан източник — статусът на първичен източник не е установен.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
AI на устройството
AI извод, извършен локално на потребителски хардуер, а не в отдалечена облачна услуга.
Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

PrismML пусна Bonsai 2 27B, компресиран голям езиков модел, предназначен да работи на персонални компютри и смартфони от висок клас без облачна инфраструктура. Моделът намалява Qwen3.8 27B на Alibaba до 5,9 гигабайта, използвайки тройна компресия на теглото, запазвайки 98% от производителността на оригиналния бенчмарк. Теглата са налични под лиценза Apache 2.0 и поддържат GPU NVIDIA чрез CUDA и Apple устройства чрез MLX.

PrismML, стартираща компания, основана от изследователи от Caltech и ръководена от Бабак Хасиби, пусна Bonsai 2 27B в четвъртък. Моделът е компресирана версия на Qwen3.8 27B на Alibaba, намалена до 5,9 гигабайта чрез компресиране на троично тегло, което преобразува 16-битови параметри в три стойности: положителна единица, отрицателна единица или нула. Тази техника елиминира излишните параметри, позволявайки на модела да запази 98% от еталонната производителност на оригинала, докато се монтира на локален хардуер.

Изданието бележи значително подобрение спрямо оригиналния модел Bonsai от март, който запази 95% от бенчмарк производителността. Според PrismML, оригиналният модел е бил изтеглен над 11 милиона пъти, с допълнителни по-малки модели, натрупали 2,6 милиона изтегляния, което показва силно възприемане от разработчиците на базиран на устройство AI. Новият модел работи на NVIDIA графични процесори чрез CUDA и на Apple устройства (Mac, iPhone, iPad) чрез MLX, като използва персонализирани нискобитови ядра, за да осигури ефективно локално изпълнение.

Теглото на модела е достъпно веднага под лиценза Apache 2.0, което позволява широка интеграция и модификация. PrismML набра първоначален кръг от $22,25 милиона, подкрепен от Khosla Ventures, Cerberus Capital и Caltech, с Йон Стоика, съосновател на Databricks, служещ като съветник. Подходът на компанията се фокусира върху използването на излишъка в по-големите модели за постигане на паритет на висока производителност с минимален размер на файла, стратегия, която Hassibi предполага, че ще стане по-ефективна с увеличаването на размерите на модела.

Детайли за източника: techjuice.pk ↗

Защо има значение

Тази версия демонстрира, че способният да разсъждава AI може да работи локално на потребителски хардуер, като адресира проблемите, свързани с поверителността и елиминира забавянето на облака и разходите за абонамент. Чрез постигане на паритет на висока производителност със значително по-малък размер на файла, PrismML напредва в преминаването от зависим от облака AI към разпределено, базирано на устройство разсъждение, което прави усъвършенстваните възможности на AI достъпни без масивна инфраструктура на центъра за данни.

Възможността за стартиране на AI с възможност за разсъждение локално на потребителски устройства адресира критични проблеми с поверителността, като гарантира, че потребителските данни никога не напускат устройството. Това елиминира необходимостта от облачно предаване, намалявайки забавянето и премахвайки текущите разходи за абонамент, свързани с базирани на облак AI услуги. За разработчиците и крайните потребители това представлява фундаментална промяна към разпределено, базирано на устройство разсъждение, което е едновременно рентабилно и лично.

Високата степен на задържане от 98% бенчмарк производителност във файл от 5,9 GB демонстрира, че техниките за компресиране могат ефективно да запазят интелигентността на големите модели. Това има практически последици за индустриите, изискващи AI на устройството, като здравеопазване, финанси и лични асистенти, където суверенитетът на данните и отговорът в реално време са от първостепенно значение. Природата с отворен код на изданието допълнително ускорява приемането, като позволява на общността да надгражда и оптимизира модела за специфични хардуерни ограничения.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Разработчиците трябва да наблюдават наличието на персонализирани нискобитови ядра за различни хардуерни архитектури и заявената от компанията цел за компресиране на модели със стотици милиарди параметри през следващите месеци. Освен това, потенциалната интеграция с устройства Apple, намекната от времето на пускане, изисква внимание за бъдещите възможности на AI от страната на устройството.

PrismML заяви, че следващата му цел е да компресира модели със стотици милиарди параметри през следващите няколко месеца. Успехът в тази област допълнително ще утвърди скалируемостта на троичното компресиране за модели от граничен клас, което потенциално ще направи още по-усъвършенствани възможности на AI достъпни на местния хардуер.

Времето на пускане доведе до спекулации за потенциална интеграция с Apple устройства. Докато главният изпълнителен директор Бабак Хасиби отказа да коментира съобщенията за разговори със Apple, поддръжката за MLX рамката на Apple предполага стратегическо привеждане в съответствие с екосистемата на Apple. Бъдещи съобщения относно официални партньорства или специфични за устройството оптимизации могат значително да повлияят на приемането на локален AI на iOS и macOS платформи.

Свързани ръководства и викторини

Обяснени модели на AIAI обучениеAI агентиТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?