Kembali ke Berita
InovasiAI Understanding taklimat

TOPAS mencadangkan penjadualan sedar aliran kerja untuk memendekkan kerja LLM berbilang ejen

Kertas arXiv baharu memperkenalkan TOPAS, penjadual yang mengurus bersama awalan LLM cache dan meminta pelaksanaan dalam aliran kerja ejen berbilang peringkat. Penulis melaporkan masa penyiapan kerja yang lebih rendah daripada garis dasar mereka yang diuji pada aliran kerja sintetik dan dua beban kerja pembangunan perisian MetaGPT.

6 min readRead the primary source
Primary-source image accompanying TOPAS proposes workflow-aware scheduling to shorten multi-agent LLM jobs
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.25523
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Gesaan Sistem
Arahan keutamaan tinggi yang menetapkan tingkah laku, dasar dan gaya tindak balas untuk model.
Uji diri andaKuiz Agen AI

Apa yang berlaku

Penyelidik mencadangkan TOPAS, Penjadual Sedar Awalan Berorientasikan Tugas untuk menyediakan aliran kerja model bahasa besar berbilang ejen. Ia menentukan kedua-dua awalan ejen yang kekal dalam cache nilai kunci dikongsi dan permintaan yang harus dijalankan, mengimbangi penggunaan semula cache terhadap kemajuan melalui aliran kerja keseluruhan.

Makalah ini memfokuskan pada masalah sistem tertentu dalam sajian LLM berbilang ejen: cache awalan. Apabila ejen berulang kali menggunakan gesaan sistem yang panjang atau awalan dikongsi yang lain, mengekalkan cache nilai kuncinya boleh mempercepatkan panggilan model kemudian. Tetapi cache yang sama menduduki memori GPU yang sebaliknya boleh digunakan untuk mengumpulkan permintaan serentak. Pengarang menggambarkan ini sebagai pertukaran antara lokaliti awalan segera dan kemajuan melalui aliran kerja berbilang peringkat. Dalam pembingkaian itu, kandungan cache adalah sebahagian daripada keadaan penjadualan dan bukannya butiran pelaksanaan yang berasingan.

TOPAS menangani pertukaran itu dengan membuat dua keputusan bersama-sama. Ia memilih awalan ejen yang mana untuk disimpan di bawah belanjawan cache nilai kunci yang dikongsi dan permintaan yang belum selesai untuk dijadualkan untuk pelaksanaan. Kaedah pemarkahannya menilai keadaan pasca keputusan yang mungkin dengan mengimbangi pengurangan yang dijangkakan dalam laluan perkhidmatan terpanjang setiap tugasan berbanding faedah jangka pendek menggunakan semula awalan hiliran. Pengiraan juga mengambil kira pergerakan awalan dan kos preemption. Penjadual termasuk mekanisme penuaan peringkat tugas yang bertujuan untuk menghalang beberapa tugas daripada menunggu selama-lamanya. Komponen ini menyambungkan residensi memori, pesanan permintaan dan kemajuan aliran kerja dalam satu dasar.

Penulis melaksanakan TOPAS dalam rangka kerja SGLang dan menilainya pada tiga beban kerja graf akiklik terarah sintetik dan dua aliran kerja pembangunan perisian MetaGPT. Makalah itu melaporkan bahawa, berbanding dengan garis dasar berprestasi terbaik untuk setiap beban kerja dan metrik, TOPAS mengurangkan masa penyiapan kerja min dan peratusan ke-99 sebanyak 39.8% dan 49.4% pada beban kerja sintetik. Pada beban kerja MetaGPT-SOP, ia melaporkan pengurangan 9.8% dalam purata masa penyiapan kerja. Pada MetaGPT-TL, ia melaporkan pengurangan sebanyak 22.0% dalam masa penyiapan min dan 26.6% pada persentil ke-99. Angka-angka ini adalah tuntutan yang dibuat oleh akhbar, bukan keputusan yang disahkan secara bebas dalam sumber yang dibekalkan. Oleh itu, penilaian menerangkan gelagat pelaksanaan yang dilaporkan merentas beban kerja ujian yang disenaraikan.

Cadangan ini terkenal kerana menggabungkan pemilihan cache dengan pemilihan pelaksanaan pada tahap aliran kerja. Gabungan itu ialah pembangunan sistem pusat yang diterangkan dalam kertas, manakala peratusan yang dilaporkan memberikan bukti yang ditawarkan untuk kesannya terhadap masa penyiapan.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Sistem berbilang ejen sering mengeluarkan panggilan model bergantung, jadi keputusan penjadualan yang membantu satu permintaan boleh menangguhkan peringkat kemudian. Kertas kerja melaporkan pengurangan ketara dalam min dan masa penyiapan kerja ekor pada beban kerja yang dinilai, mencadangkan bahawa infrastruktur penyajian—bukan sahaja kualiti model—boleh menjejaskan prestasi dan kos sistem ejen secara material.

Kepentingan praktikal terletak pada struktur aliran kerja ejen. Tugas berbilang ejen selalunya bukan satu permintaan model tetapi rangkaian atau graf panggilan, dengan panggilan kemudian menunggu untuk output yang lebih awal. Penjadual yang mengoptimumkan hanya permintaan seterusnya atau hanya penggunaan semula cache boleh meningkatkan metrik setempat sambil melambatkan laluan hiliran kritikal. TOPAS sebaliknya menganggap laluan baki aliran kerja sebagai sebahagian daripada keputusan penjadualan, yang merupakan percubaan langsung untuk menyelaraskan gelagat penyajian dengan penyempurnaan tugas keseluruhan pengguna. Ini menjadikan unit pengoptimuman tugas aliran kerja dan bukannya panggilan model terpencil.

Pengurangan yang dilaporkan berpotensi bermakna kerana masa penyiapan kerja mempengaruhi kelajuan ejen boleh bertindak balas dan bilangan aliran kerja serentak yang boleh disokong oleh sistem penyajian. Penambahbaikan dalam penggunaan cache dan penjadualan juga boleh mengurangkan tekanan untuk menambah perkakasan untuk beban kerja tertentu, walaupun sumber itu tidak mengukur penjimatan infrastruktur, penggunaan tenaga, kos operasi, kualiti tindak balas atau kepuasan pengguna. Oleh itu, kertas itu memberikan bukti tentang kependaman penjadualan dalam persediaan ujiannya, bukan kes lengkap untuk ekonomi penggunaan. Dimensi yang tidak diukur itu kekal berasingan daripada keputusan kependaman.

Kerja ini juga menyerlahkan batasan menilai prestasi ejen semata-mata pada peringkat panggilan model. Untuk sistem berbilang peringkat, model mungkin menghasilkan output yang sama manakala pengguna mengalami kelewatan yang berbeza kerana permintaan bersaing untuk slot memori dan pelaksanaan. Dengan membuat keadaan awalan dan kebergantungan aliran kerja menjadi jelas, makalah ini menawarkan perspektif sistem yang mungkin berguna kepada jurutera yang mereka bentuk infrastruktur perkhidmatan ejen. Namun, sumber itu tidak menetapkan bahawa TOPAS meningkatkan kebolehpercayaan, ketepatan, keadilan di kalangan pengguna atau keselamatan; sasaran yang dilaporkan ialah masa penyiapan kerja. Perbezaan itu penting kerana penyiapan yang lebih cepat tidak dengan sendirinya menunjukkan kualiti sistem yang lebih luas.

Secara umumnya, makalah ini menghubungkan tingkah laku infrastruktur kepada pemasaan tugas AI kompaun yang boleh dilihat oleh pengguna. Sambungan itu membantu menjelaskan mengapa penjadualan sedar aliran kerja boleh menjadi penting walaupun model asas dan output yang dijana kekal tidak berubah, sambil mengekalkan bukti sumber terhad kepada penilaian yang dilaporkan.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Hasilnya adalah daripada pracetak arXiv tunggal dan penilaian terhad: tiga graf asiklik terarah sintetik dan dua aliran kerja MetaGPT. Soalan terbuka yang penting termasuk prestasi pada trafik pengeluaran, susunan penyajian model yang berbeza, aliran kerja yang lebih besar atau lebih pelbagai dan kesan dasar overhed dan cache pelaksanaan di luar tetapan yang diuji.

Soalan pertama ialah sama ada keuntungan yang dilaporkan bertahan melebihi lima keluarga beban kerja kertas itu. Tiga beban kerja adalah sintetik, manakala dua lagi dikenal pasti sebagai aliran kerja pembangunan perisian MetaGPT. Sumber tidak memberikan saiz beban kerja, pengedaran trafik, konfigurasi model, butiran perkakasan, nama garis dasar atau varians merentas larian berulang dalam teks yang dibekalkan. Butiran tersebut penting untuk menilai sejauh mana peratusan digunakan. Tanpa mereka, perbandingan berangka sukar untuk dipindahkan terus ke persekitaran penyajian yang lain.

Penilaian ke atas jejak pengeluaran sebenar akan sangat bermaklumat. Sistem pengeluaran mungkin mempunyai corak ketibaan yang tidak teratur, pembatalan, panjang segera yang heterogen, berbilang model, perubahan residensi cache dan objektif peringkat perkhidmatan yang tidak diwakili oleh graf aliran kerja tetap. Ia juga berguna untuk mengetahui cara TOPAS berkelakuan apabila pergerakan awalan dan preemption mahal, apabila belanjawan cache sangat kecil, atau apabila aliran kerja mengandungi cawangan yang tidak dapat diramalkan. Ujian sedemikian akan menyiasat pertukaran yang sama di bawah keadaan yang lebih berbeza daripada yang diterangkan dalam penilaian yang dibekalkan.

Kertas itu ialah penyerahan arXiv bertarikh 26 Ogos 2026, dan sumber mengenal pasti ia sebagai kertas lapan muka surat. Rekod yang dibekalkan tidak mewujudkan semakan rakan sebaya, replikasi bebas, ketersediaan kod awam atau penggunaan oleh penyedia perkhidmatan. Kerja susulan harus menguji isu tersebut, membandingkan TOPAS dengan penjadual tambahan, melaporkan sumber dan pertukaran kualiti, dan memeriksa sama ada mekanisme penuaan memperkenalkan kelewatan yang berbeza merentas tugas. Sehingga itu, kesimpulan yang paling kuat disokong ialah pengarang melaporkan kaedah penjadualan yang menjanjikan dalam penilaian eksperimen yang terhad. Skop kesimpulan itu harus kekal terikat dengan keterangan dan huraian beban kerja yang tersedia di sini.

Oleh itu, bukti seterusnya yang paling berguna akan menggabungkan beban kerja yang lebih luas dengan butiran percubaan yang telus dan ukuran melebihi masa siap. Penambahan tersebut akan menjelaskan kedua-dua kebolehulangan dan had praktikal pendekatan penjadualan yang dilaporkan tanpa mengubah perkara yang dituntut oleh kertas semasa.

Panduan & kuiz berkaitan

Ejen AIModel AI DiterangkanTransformerUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?