Какво стана
PrismML пусна Bonsai 2 27B, компресиран голям езиков модел, предназначен да работи на персонални компютри и смартфони от висок клас без облачна инфраструктура. Моделът намалява Qwen3.8 27B на Alibaba до 5,9 гигабайта, използвайки тройна компресия на теглото, запазвайки 98% от производителността на оригиналния бенчмарк. Теглата са налични под лиценза Apache 2.0 и поддържат GPU NVIDIA чрез CUDA и Apple устройства чрез MLX.
PrismML, стартираща компания, основана от изследователи от Caltech и ръководена от Бабак Хасиби, пусна Bonsai 2 27B в четвъртък. Моделът е компресирана версия на Qwen3.8 27B на Alibaba, намалена до 5,9 гигабайта чрез компресиране на троично тегло, което преобразува 16-битови параметри в три стойности: положителна единица, отрицателна единица или нула. Тази техника елиминира излишните параметри, позволявайки на модела да запази 98% от еталонната производителност на оригинала, докато се монтира на локален хардуер.
Изданието бележи значително подобрение спрямо оригиналния модел Bonsai от март, който запази 95% от бенчмарк производителността. Според PrismML, оригиналният модел е бил изтеглен над 11 милиона пъти, с допълнителни по-малки модели, натрупали 2,6 милиона изтегляния, което показва силно възприемане от разработчиците на базиран на устройство AI. Новият модел работи на NVIDIA графични процесори чрез CUDA и на Apple устройства (Mac, iPhone, iPad) чрез MLX, като използва персонализирани нискобитови ядра, за да осигури ефективно локално изпълнение.
Теглото на модела е достъпно веднага под лиценза Apache 2.0, което позволява широка интеграция и модификация. PrismML набра първоначален кръг от $22,25 милиона, подкрепен от Khosla Ventures, Cerberus Capital и Caltech, с Йон Стоика, съосновател на Databricks, служещ като съветник. Подходът на компанията се фокусира върху използването на излишъка в по-големите модели за постигане на паритет на висока производителност с минимален размер на файла, стратегия, която Hassibi предполага, че ще стане по-ефективна с увеличаването на размерите на модела.
Детайли за източника: techjuice.pk ↗
Защо има значение
Тази версия демонстрира, че способният да разсъждава AI може да работи локално на потребителски хардуер, като адресира проблемите, свързани с поверителността и елиминира забавянето на облака и разходите за абонамент. Чрез постигане на паритет на висока производителност със значително по-малък размер на файла, PrismML напредва в преминаването от зависим от облака AI към разпределено, базирано на устройство разсъждение, което прави усъвършенстваните възможности на AI достъпни без масивна инфраструктура на центъра за данни.
Възможността за стартиране на AI с възможност за разсъждение локално на потребителски устройства адресира критични проблеми с поверителността, като гарантира, че потребителските данни никога не напускат устройството. Това елиминира необходимостта от облачно предаване, намалявайки забавянето и премахвайки текущите разходи за абонамент, свързани с базирани на облак AI услуги. За разработчиците и крайните потребители това представлява фундаментална промяна към разпределено, базирано на устройство разсъждение, което е едновременно рентабилно и лично.
Високата степен на задържане от 98% бенчмарк производителност във файл от 5,9 GB демонстрира, че техниките за компресиране могат ефективно да запазят интелигентността на големите модели. Това има практически последици за индустриите, изискващи AI на устройството, като здравеопазване, финанси и лични асистенти, където суверенитетът на данните и отговорът в реално време са от първостепенно значение. Природата с отворен код на изданието допълнително ускорява приемането, като позволява на общността да надгражда и оптимизира модела за специфични хардуерни ограничения.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
Which component of an AI application is the machine-learning model itself?
Какво да гледате след това
Разработчиците трябва да наблюдават наличието на персонализирани нискобитови ядра за различни хардуерни архитектури и заявената от компанията цел за компресиране на модели със стотици милиарди параметри през следващите месеци. Освен това, потенциалната интеграция с устройства Apple, намекната от времето на пускане, изисква внимание за бъдещите възможности на AI от страната на устройството.
PrismML заяви, че следващата му цел е да компресира модели със стотици милиарди параметри през следващите няколко месеца. Успехът в тази област допълнително ще утвърди скалируемостта на троичното компресиране за модели от граничен клас, което потенциално ще направи още по-усъвършенствани възможности на AI достъпни на местния хардуер.
Времето на пускане доведе до спекулации за потенциална интеграция с Apple устройства. Докато главният изпълнителен директор Бабак Хасиби отказа да коментира съобщенията за разговори със Apple, поддръжката за MLX рамката на Apple предполага стратегическо привеждане в съответствие с екосистемата на Apple. Бъдещи съобщения относно официални партньорства или специфични за устройството оптимизации могат значително да повлияят на приемането на локален AI на iOS и macOS платформи.