Apa yang berlaku
Forbes melaporkan bahawa SemiAnalysis menerbitkan AgentX, penanda aras sumber terbuka yang memainkan semula sesi ejen pengekodan tanpa nama dan bukannya menggunakan gesaan tetap. Dalam konfigurasi yang diliputi, SemiAnalysis mendapati perkakasan Nvidia mempunyai kelebihan kecekapan kos sehingga lima kali ganda berbanding AMD pada titik operasi tertentu, dengan jurang yang lebih besar pada beberapa tindanan hidangan terbuka. Sumber yang dibekalkan tidak secara bebas mengesahkan penanda aras atau menghasilkan semula keputusannya.
Forbes melaporkan bahawa SemiAnalysis menerbitkan AgentX pada 24 Ogos sebagai tanda aras surih-ulang tayang untuk inferens gaya pengeluaran. Daripada menghantar gesaan seragam dan panjang output, AgentX memainkan semula struktur sesi pengekodan-ejen sebenar, termasuk sejarah panjang, berbilang giliran dan jeda semasa ejen menggunakan alatan. Forbes berkata SemiAnalysis membina korpus lebih daripada 8,000 sesi dan 610 bilion token daripada permintaan Claude Code dan Codex yang dipintas melibatkan kakitangannya sendiri. Subset versi awam 1.0 mengandungi 393 sesi Claude Code dan dikeluarkan di bawah Apache 2.0. Sumber itu tidak memberikan pengesahan bebas terhadap angka tersebut.
Forbes melaporkan bahawa kesan awam ditukar kepada blok cincang berantai berskop sesi sebanyak 64 token, mengekalkan perhubungan awalan sambil mengalih keluar gesaan dan kod asal. SemiAnalysis melaporkan panjang input median sebanyak 142,000 token, output median sebanyak 444 token dan jurang median 3.84 saat antara selekoh. Forbes juga berkata 175 daripada 393 sesi awam melahirkan sekurang-kurangnya satu subagen. Ciri-ciri tersebut bertujuan untuk menguji sama ada sistem penyajian mengekalkan dan menggunakan semula keadaan cache nilai kunci merentas selekoh, mengarahkan sesi kepada pekerja yang memegang keadaan tersebut dan mengelakkan pemprosesan semula konteks berulang yang tidak perlu.
Pada satu titik operasi yang dilaporkan, Forbes berkata SemiAnalysis mengukur perkakasan Nvidia sehingga lima kali lebih cekap kos daripada AMD apabila menjalankan GLM 5.3 melalui timbunan sajian SGLang sumber terbuka pada 150 token output sesaat bagi setiap pengguna. Artikel itu mengatakan perbandingan B200 dengan MI355X AMD menunjukkan kelebihan Nvidia kira-kira 57% pada 108 token sesaat setiap pengguna dan 247% pada 141 token sesaat setiap pengguna. Pada Qwen 3.5 melalui SGLang, Forbes melaporkan bahawa Nvidia berada lebih daripada 20 kali lebih awal pada 90 token sesaat bagi setiap pengguna. Ini adalah hasil konfigurasi khusus, bukan nisbah perkakasan universal.
Mengapa ia penting
Laporan itu mencadangkan bahawa prestasi inferens AI untuk ejen sangat bergantung pada perisian, penggunaan semula cache, penghalaan dan penyajian konteks panjang—bukan sahaja spesifikasi pemecut. Itu boleh menjejaskan pembelian infrastruktur, harga awan dan daya saing AMD dan Nvidia. Penemuan adalah terhad kepada perkakasan, model, versi perisian dan kesan beban kerja yang diuji.
Kepentingan praktikal ialah beban kerja ejen boleh menghabiskan lebih banyak masa memproses atau menggunakan semula konteks daripada menjana jawapan akhir. Forbes melaporkan input AgentX median sebanyak 142,000 token berbanding hanya 444 token keluaran, corak tidak seperti banyak penanda aras konvensional. Jika trafik yang serupa adalah perkara biasa dalam pengeluaran, keupayaan untuk menggunakan semula konteks cache dan laluan susulan giliran dengan cekap boleh mempengaruhi kos dan tindak balas ejen pengekodan, pembantu penyelidik dan sistem penggunaan alat lain. Sumber yang dibekalkan tidak menentukan sejauh mana kesan tersebut mewakili pasaran yang lebih luas.
Forbes mengaitkan kebanyakan kelebihan Nvidia yang dilaporkan kepada lapisan perisian. Artikel ini menerangkan pengurusan cache, penghalaan, penjadualan, kernel khusus dan tokenisasi tambahan sedar sempadan dalam tindanan TensorRT-LLM Nvidia. Forbes berkata tokenisasi tambahan sepadan dengan hasil tokenisasi penuh merentas 1,087 peralihan yang diuji dalam satu surih Qwen 3.5 sambil mengurangkan purata masa pemprosesan setiap giliran daripada 185.1 milisaat kepada 11.3 milisaat. Jika tepat, penambahbaikan sedemikian boleh menjadikan pemecut yang lebih lama atau setanding lebih berdaya saing dengan mengurangkan kerja berulang. Ini juga bermakna kedudukan penanda aras boleh berubah dengan cepat apabila menyiarkan perubahan perisian.
Laporan itu penting untuk persaingan kerana ia mencabar andaian bahawa pembekal pemecut kedua akan secara automatik mengecilkan kedudukan Nvidia melalui penetapan harga perkakasan sahaja. Forbes berkata enjin ATOM AMD mengalahkan sistem GB300 NVL72 yang menjalankan vLLM merentasi sebahagian daripada satu lengkung kependaman Kimi K3, dan MI355X AMD memadankan B200 pada DeepSeek V4 dengan SGLang sebelum pengoptimuman Nvidia kemudiannya dan pengoptimuman Inferact. Pembalikan itu menggambarkan kedua-dua potensi AMD dan kepentingan penggunaan perisian. Forbes juga melaporkan bahawa ATOM mempunyai penggunaan pengeluaran yang terhad dan bahagian belakang AMD tidak disenaraikan untuk beberapa laluan selari konteks vLLM, tetapi keadaan perisian tersebut boleh berubah.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang perlu ditonton seterusnya
Susulan utama ialah sama ada pengoptimuman ATOM AMD dan sokongan untuk penyajian konteks panjang diterima pakai secara lebih meluas dalam perisian arus perdana seperti vLLM dan SGLang. Pembeli juga harus memeriksa kadar hit awalan-cache pengeluaran, penggunaan memori hos, penghalaan sesi dan kependaman peringkat giliran. SemiAnalysis dijangka, menurut Forbes, untuk mengemas kini penanda aras dalam masa sebulan.
Tindakan susulan yang paling penting ialah sama ada jurang yang dilaporkan berterusan selepas kemas kini perisian. Forbes berkata SemiAnalysis menjadualkan kemas kini AgentX dalam masa sebulan, dan artikel itu menyatakan bahawa perubahan huluan pada 21 Ogos telah mengubah perbandingan DeepSeek V4. Versi akan datang harus menunjukkan sama ada keupayaan ATOM AMD mencapai tindanan penyajian yang biasa digunakan, sama ada vLLM dan SGLang menambah sokongan AMD yang lebih matang untuk keselarian dan pemuatan konteks panjang, dan sama ada pendahulu Nvidia kekal selepas pengoptimuman yang setanding digunakan pada kedua-dua belah pihak.
Pembeli infrastruktur harus meminta pembekal bukti khusus beban kerja dan bukannya bergantung pada angka token per saat agregat. Forbes mengesyorkan agar anda menyemak kadar hit awalan-cache yang berterusan pada serentak pengeluaran, jumlah memori hos yang digunakan untuk menyokong memori pemecut dan sama ada penghalaan sesi mengekalkan perbualan dengan pekerja yang memegang awalan cachenya. Artikel itu melaporkan bahawa SemiAnalysis menemui kadar hit memori lebar jalur tinggi sebanyak 91% pada satu konfigurasi B300 dan 73% pada konfigurasi B200 di bawah tahap konkurensi yang berbeza, dengan penggunaan semula memori hos tambahan. Pengukuran tersebut tidak cukup setanding secara langsung untuk mewujudkan peraturan umum, tetapi ia menunjukkan butiran operasi yang boleh menjejaskan kos dan kependaman.
Penanda aras juga meninggalkan beberapa bahan yang tidak diketahui. Forbes berkata AgentX menggantikan kandungan surih tanpa nama dengan token sintetik, yang boleh memesongkan penerimaan penyahkodan spekulatif, dan SemiAnalysis menggunakan panjang penerimaan yang diambil daripada SPEED-Bench dan bukannya mengukurnya secara langsung. Jejak datang daripada abah-abah pengekodan dengan konteks yang berat, manakala abah-abah yang lebih kurus menghasilkan pengedaran input yang berbeza. Reka bentuk gelung tertutup AgentX juga boleh menukar campuran beban kerja apabila sistem yang lebih pantas menyelesaikan lebih banyak permintaan. TPU Google tiada, dan kemudiannya perkakasan Rubin Nvidia dan MI455X AMD berada di luar perbandingan yang diterangkan. Respons vendor, replikasi bebas dan hasil pada beban kerja ejen bukan pengekodan tidak disediakan dalam sumber.