Що сталося
Lec повідомляє, що 10 вересня Qualcomm представила нейронний процесор наступного покоління Hexagon для безперервних агентних навантажень ШІ на мобільних пристроях. Повідомлена конструкція додає прискорювач елементів для робочих навантажень трансформатора, збільшує спільну пам’ять на 50% і підтримує моделі суміші експертів із до 30 мільярдів параметрів, з приблизно 3 мільярдами активних для кожного згенерованого токена. Згідно з The Lec, NPU підтримує формати даних FP16, INT2, INT4, INT8 і FP8. Qualcomm стверджує, що продуктивність попереднього заповнення INT4 може бути на 50% швидшою, а відповіді можуть початися протягом 1,5 секунд, хоча The Lec не повідомляє про незалежне тестування цих цифр. NPU призначений для роботи з процесором Snapdragon Oryon і графічним процесором Adreno для багатоетапних робочих процесів і обробки графіки AI. У звіті йдеться, що Qualcomm надасть більше деталей на саміті Snapdragon у Сполучених Штатах з 22 по 24 вересня. Джерело не вказує конкретний смартфон, дату запуску, роздрібну доступність, ціну або підтверджені результати сторонніх тестів.
Lec повідомляє, що Qualcomm представила своє наступне покоління Hexagon NPU 10 вересня, позиціонуючи його як мобільне обладнання для систем штучного інтелекту, які інтерпретують контекст, міркують між програмами та виконують завдання для користувачів. Повідомлене обладнання додає елементний прискорювач поряд із існуючими скалярними, векторними та матричними розширеннями з метою покращення обчислень трансформаторної моделі при одночасному управлінні енергоспоживанням.
У звіті говориться, що ємність спільної пам’яті на 50% більша, ніж у попередньому дизайні. Заявлене обґрунтування Qualcomm полягає в тому, що збереження стану моделі, активацій і даних проміжного тензора ближче до процесора може зменшити передачу на зовнішню DRAM, потенційно покращуючи збереження контексту та перемикання завдань. Звіт не містить незалежного порівняння з попередньою реалізацією Hexagon.
Повідомляється, що новий Hexagon підтримує змішані експертні моделі з до 30 мільярдів параметрів, одночасно активуючи близько 3 мільярдів маршрутизованих параметрів на токен. Lec також повідомляє про керування й кешування флеш-пам’яті NAND, призначене для завантаження лише відповідних експертних компонентів у DRAM і збереження часто використовуваних компонентів у кеші.
Повідомляється, що NPU підтримує точні формати FP16, INT2, INT4, INT8 і FP8. Lec приписує Qualcomm твердження про швидше заповнення INT4 на 50% і початок відповіді протягом 1,5 секунд. Жодних незалежних тестів, наявності пристроїв, цін або конкретних споживчих товарів не надається.
Чому це важливо
Якщо проект Qualcomm досягне споживчих пристроїв, як описано, це може зробити більші та контекстно-орієнтовані системи штучного інтелекту більш практичними для локального запуску на телефонах. Зберігання більшої кількості даних моделі біля процесора може зменшити трафік пам’яті та затримку, тоді як архітектури з сумішшю експертів можуть надати доступ до спеціалізованих можливостей без активації кожного параметра для кожного завдання. Це важливо для конфіденційності, швидкості реагування та використання в автономному режимі, але практична користь залишається неперевіреною, доки не будуть доступні пристрої, моделі та незалежні тести.
Оголошення націлено на головне обмеження мобільного штучного інтелекту: запуск потужних моделей у жорстких обмеженнях пропускної здатності пам’яті, використання акумулятора та затримки. Більший пул спільної пам’яті та вибіркова активація компонентів суміші експертів можуть зменшити обсяг даних, що переміщуються під час локального висновку, якщо архітектура Qualcomm працює, як описано.
Локальна обробка може мати практичні переваги, оскільки деякі взаємодії можуть оброблятися на телефоні, не надсилаючи всі дані до віддаленої служби. Однак джерело не встановлює гарантії конфіденційності, офлайн-функціональність, покращення батареї або продуктивність реальних програм. Ці результати залежать від програмного забезпечення, стиснення моделі, температурних обмежень і реалізації телефону.
Повідомлена інтеграція з CPU та GPU свідчить про те, що Qualcomm розглядає агентський штучний інтелект як робоче навантаження платформи, а не ізольовану функцію прискорювача. Його важливість залежатиме від того, чи зможуть розробники отримати ефективний доступ до апаратного забезпечення та чи постачатимуть виробники телефонів моделі та програми, які його використовують.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Що дивитися далі
Наступним вагомим доказом стануть розкриття інформації про Snapdragon Summit від Qualcomm і можливі пристрої, які використовують NPU. Стежте за названими платформами чіпів, підтримуваними моделями, інструментами розробника, фактичними вимірюваннями на пристрої, постійним енергоспоживанням і чи застосовується заявлений час відгуку до повних агентських робочих процесів, а не до обмежених демонстрацій. Наявність, ціноутворення та регіональний розподіл у звіті не задокументовані.
Qualcomm каже, що додаткові подробиці будуть розкриті на саміті Snapdragon з 22 по 24 вересня. Ці відомості можуть уточнити конкретну платформу Snapdragon, графік розгортання, підтримувані операційні середовища та доступ розробників.
Незалежне тестування має підтвердити зареєстроване покращення продуктивності INT4, заяву про 1,5-секундну відповідь-запуск, енергоспоживання та стійку продуктивність під час багатокрокових агентських навантажень. Джерело не надає такого тестування.
Поки що невідомо, які смартфони використовуватимуть NPU, коли вони отримають клієнтів, скільки вони коштуватимуть і чи будуть усі зазначені можливості ввімкнені під час запуску.