Език AI РЪКОВОДСТВО

Паралелно декодиране на скелет на мисълта

Skeleton-of-Thought (SoT) е техника за подсказване и декодиране, която първо изисква езиков модел да очертае кратък скелет от точки за отговор, след което разширява всяка точка паралелно.

2 min readПоследна актуализация

Преглед

It matters because it can cut the wall-clock latency of long answers by roughly 2x without retraining the model.

Дълбоко гмуркане

Големите езикови модели обикновено генерират една лексема наведнъж, така че дългият отговор е бавен просто защото всяка дума чака тази преди нея. Skeleton-of-Thought, въведен от изследователи в Tsinghua и Microsoft през 2023 г., преструктурира работата. Първото обаждане изисква от модела кратък скелет: номериран списък от заглавия от 3 до 10 точки, всяко от които съдържа само няколко думи. След това втора група извиквания разширява всяка точка независимо и едновременно, тъй като точките не зависят една от друга. Разширенията се зашиват отново заедно в окончателния отговор. Тъй като етапът на бавно разширяване протича успоредно, общото забавяне пада рязко за въпроси, чиито отговори естествено се разлагат на независими части, като съвети за списък или сравняване на опции.

Техническа информация

SoT експлоатира, че изводът на декодера е обвързан със закъснение, а не винаги с изчисления: една заявка често оставя графичния процесор недостатъчно използван. Изпълнението на разширения на точки като пакет поддържа хардуера зает и припокрива генерирането на точка. При API моделите разширенията се издават като едновременни заявки; с местните модели, те споделят едно пакетно предаване напред. Етапът на скелета добавя фиксирани кратки разходи, така че нетното ускоряване расте с дължината на отговора и броя на независимите точки.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на паралелното декодиране на скелет на мисълта

Очаквайте идеите за SoT да се слеят в адаптивно маршрутизиране: системите ще открият кога дадена заявка се разлага чисто и ще преминат към паралелно разширяване, връщайки се към последователни разсъждения за тясно зависими задачи като математически доказателства. Варианти като SoT с динамични зависимости на графиката позволяват точки, които се препращат една към друга. Тъй като обслужващите рамки добавят естествена поддръжка на пакетни подзаявки и спекулативно декодиране, стратегиите за паралелно разлагане ще се превърнат в стандартен слой за намаляване на латентността, а не в ръчен трик за подкана.

Внедряване в реалния свят

Ускоряване на чатбот, който отговаря „дайте ми 8 съвета за намаляване на разходите в облака“, като разширите всичките осем съвета наведнъж.

Асистент за поддръжка на клиенти, генериращ структурирано ръководство за отстраняване на неизправности с много секции с по-ниско забавяне на реакцията.

Създаване на сравнителен отговор (плюсове и минуси на два продукта), където всеки куршум се попълва едновременно.

Backend обслужващи системи, групиращи независими секции с отговори за повишаване на използването на GPU по време на генериране на дълги форми.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Skeleton-of-Thought Parallel Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Parallel Token декодиране на MaskGIT

Frequently asked questions

What is Skeleton-of-Thought Parallel Decoding?

Skeleton-of-Thought (SoT) е техника за подсказване и декодиране, която първо изисква езиков модел да очертае кратък скелет от точки за отговор, след което разширява всяка точка паралелно. Има значение, защото може да намали латентността на стенния часовник на дългите отговори с приблизително 2 пъти, без да преквалифицира модела.

Какво произвежда първият етап на Skeleton-of-Thought?

SoT първо кара модела да излъчва кратък скелет от заглавия на точки, които след това се разширяват отделно.

Защо етапът на разширяване на точката може да работи паралелно?

Точките на скелета са проектирани да бъдат независими, така че разширяването им не изисква изчакване на братя и сестри.

Кое е основното пречка SoT цели при нормално LLM декодиране?

Стандартното декодиране е обвързано със закъснение, тъй като всеки токен чака предишния; Припокриванията на SoT работят за намаляване на времето на стенен часовник.

За кой тип въпроси SoT дава най-голямо ускорение?

Отговори, които се разлагат на много независими части, имат най-голяма полза, тъй като всяка част се разширява едновременно.

Какви режийни разходи добавя SoT в сравнение с едно последователно поколение?

Етапът на скелета добавя малка фиксирана латентност, която се компенсира от паралелно разширяване на дълги отговори.