Kembali ke Berita
InovasiAI Understanding taklimat

Forbes melaporkan Nvidia mendahului AMD sehingga 5x pada penanda aras ejen AI baharu

Forbes melaporkan bahawa penanda aras AgentX SemiAnalysis mendapati perkakasan Nvidia jauh lebih cekap kos berbanding AMD pada beban kerja ejen pengekodan konteks panjang, berbilang pusingan, sambil memberi amaran bahawa keputusan berbeza mengikut model, susunan penyajian dan versi perisian.

5 min readRead the original reporting
Source-provided image accompanying Forbes reports Nvidia led AMD by up to 5x on new AI-agent benchmark
Pelaporan berkaitSumber direkodkan
Penerbit
forbes.com
Pautan sumber
forbes.comhttps://www.forbes.com/sites/janakirammsv/2026/08/24/nvidia-amd-ai-agent-benchmark/
Jenis sumber
Pelaporan oleh saluran berita — bukan dokumen pihak pertama.

Perkara yang tidak dapat kami sahkan secara bebas: Tuntutan ini dikaitkan dengan kedai yang dinamakan. Kami tidak mengesahkannya terhadap dokumen pihak pertama. (forbes.com)

KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Uji diri andaKuiz Agen AI

Apa yang berlaku

Forbes melaporkan bahawa SemiAnalysis menerbitkan AgentX, penanda aras sumber terbuka yang memainkan semula sesi ejen pengekodan tanpa nama dan bukannya menggunakan gesaan tetap. Dalam konfigurasi yang diliputi, SemiAnalysis mendapati perkakasan Nvidia mempunyai kelebihan kecekapan kos sehingga lima kali ganda berbanding AMD pada titik operasi tertentu, dengan jurang yang lebih besar pada beberapa tindanan hidangan terbuka. Sumber yang dibekalkan tidak secara bebas mengesahkan penanda aras atau menghasilkan semula keputusannya.

Forbes melaporkan bahawa SemiAnalysis menerbitkan AgentX pada 24 Ogos sebagai tanda aras surih-ulang tayang untuk inferens gaya pengeluaran. Daripada menghantar gesaan seragam dan panjang output, AgentX memainkan semula struktur sesi pengekodan-ejen sebenar, termasuk sejarah panjang, berbilang giliran dan jeda semasa ejen menggunakan alatan. Forbes berkata SemiAnalysis membina korpus lebih daripada 8,000 sesi dan 610 bilion token daripada permintaan Claude Code dan Codex yang dipintas melibatkan kakitangannya sendiri. Subset versi awam 1.0 mengandungi 393 sesi Claude Code dan dikeluarkan di bawah Apache 2.0. Sumber itu tidak memberikan pengesahan bebas terhadap angka tersebut.

Forbes melaporkan bahawa kesan awam ditukar kepada blok cincang berantai berskop sesi sebanyak 64 token, mengekalkan perhubungan awalan sambil mengalih keluar gesaan dan kod asal. SemiAnalysis melaporkan panjang input median sebanyak 142,000 token, output median sebanyak 444 token dan jurang median 3.84 saat antara selekoh. Forbes juga berkata 175 daripada 393 sesi awam melahirkan sekurang-kurangnya satu subagen. Ciri-ciri tersebut bertujuan untuk menguji sama ada sistem penyajian mengekalkan dan menggunakan semula keadaan cache nilai kunci merentas selekoh, mengarahkan sesi kepada pekerja yang memegang keadaan tersebut dan mengelakkan pemprosesan semula konteks berulang yang tidak perlu.

Pada satu titik operasi yang dilaporkan, Forbes berkata SemiAnalysis mengukur perkakasan Nvidia sehingga lima kali lebih cekap kos daripada AMD apabila menjalankan GLM 5.3 melalui timbunan sajian SGLang sumber terbuka pada 150 token output sesaat bagi setiap pengguna. Artikel itu mengatakan perbandingan B200 dengan MI355X AMD menunjukkan kelebihan Nvidia kira-kira 57% pada 108 token sesaat setiap pengguna dan 247% pada 141 token sesaat setiap pengguna. Pada Qwen 3.5 melalui SGLang, Forbes melaporkan bahawa Nvidia berada lebih daripada 20 kali lebih awal pada 90 token sesaat bagi setiap pengguna. Ini adalah hasil konfigurasi khusus, bukan nisbah perkakasan universal.

Butiran sumber: forbes.com ↗

Mengapa ia penting

Laporan itu mencadangkan bahawa prestasi inferens AI untuk ejen sangat bergantung pada perisian, penggunaan semula cache, penghalaan dan penyajian konteks panjang—bukan sahaja spesifikasi pemecut. Itu boleh menjejaskan pembelian infrastruktur, harga awan dan daya saing AMD dan Nvidia. Penemuan adalah terhad kepada perkakasan, model, versi perisian dan kesan beban kerja yang diuji.

Kepentingan praktikal ialah beban kerja ejen boleh menghabiskan lebih banyak masa memproses atau menggunakan semula konteks daripada menjana jawapan akhir. Forbes melaporkan input AgentX median sebanyak 142,000 token berbanding hanya 444 token keluaran, corak tidak seperti banyak penanda aras konvensional. Jika trafik yang serupa adalah perkara biasa dalam pengeluaran, keupayaan untuk menggunakan semula konteks cache dan laluan susulan giliran dengan cekap boleh mempengaruhi kos dan tindak balas ejen pengekodan, pembantu penyelidik dan sistem penggunaan alat lain. Sumber yang dibekalkan tidak menentukan sejauh mana kesan tersebut mewakili pasaran yang lebih luas.

Forbes mengaitkan kebanyakan kelebihan Nvidia yang dilaporkan kepada lapisan perisian. Artikel ini menerangkan pengurusan cache, penghalaan, penjadualan, kernel khusus dan tokenisasi tambahan sedar sempadan dalam tindanan TensorRT-LLM Nvidia. Forbes berkata tokenisasi tambahan sepadan dengan hasil tokenisasi penuh merentas 1,087 peralihan yang diuji dalam satu surih Qwen 3.5 sambil mengurangkan purata masa pemprosesan setiap giliran daripada 185.1 milisaat kepada 11.3 milisaat. Jika tepat, penambahbaikan sedemikian boleh menjadikan pemecut yang lebih lama atau setanding lebih berdaya saing dengan mengurangkan kerja berulang. Ini juga bermakna kedudukan penanda aras boleh berubah dengan cepat apabila menyiarkan perubahan perisian.

Laporan itu penting untuk persaingan kerana ia mencabar andaian bahawa pembekal pemecut kedua akan secara automatik mengecilkan kedudukan Nvidia melalui penetapan harga perkakasan sahaja. Forbes berkata enjin ATOM AMD mengalahkan sistem GB300 NVL72 yang menjalankan vLLM merentasi sebahagian daripada satu lengkung kependaman Kimi K3, dan MI355X AMD memadankan B200 pada DeepSeek V4 dengan SGLang sebelum pengoptimuman Nvidia kemudiannya dan pengoptimuman Inferact. Pembalikan itu menggambarkan kedua-dua potensi AMD dan kepentingan penggunaan perisian. Forbes juga melaporkan bahawa ATOM mempunyai penggunaan pengeluaran yang terhad dan bahagian belakang AMD tidak disenaraikan untuk beberapa laluan selari konteks vLLM, tetapi keadaan perisian tersebut boleh berubah.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Susulan utama ialah sama ada pengoptimuman ATOM AMD dan sokongan untuk penyajian konteks panjang diterima pakai secara lebih meluas dalam perisian arus perdana seperti vLLM dan SGLang. Pembeli juga harus memeriksa kadar hit awalan-cache pengeluaran, penggunaan memori hos, penghalaan sesi dan kependaman peringkat giliran. SemiAnalysis dijangka, menurut Forbes, untuk mengemas kini penanda aras dalam masa sebulan.

Tindakan susulan yang paling penting ialah sama ada jurang yang dilaporkan berterusan selepas kemas kini perisian. Forbes berkata SemiAnalysis menjadualkan kemas kini AgentX dalam masa sebulan, dan artikel itu menyatakan bahawa perubahan huluan pada 21 Ogos telah mengubah perbandingan DeepSeek V4. Versi akan datang harus menunjukkan sama ada keupayaan ATOM AMD mencapai tindanan penyajian yang biasa digunakan, sama ada vLLM dan SGLang menambah sokongan AMD yang lebih matang untuk keselarian dan pemuatan konteks panjang, dan sama ada pendahulu Nvidia kekal selepas pengoptimuman yang setanding digunakan pada kedua-dua belah pihak.

Pembeli infrastruktur harus meminta pembekal bukti khusus beban kerja dan bukannya bergantung pada angka token per saat agregat. Forbes mengesyorkan agar anda menyemak kadar hit awalan-cache yang berterusan pada serentak pengeluaran, jumlah memori hos yang digunakan untuk menyokong memori pemecut dan sama ada penghalaan sesi mengekalkan perbualan dengan pekerja yang memegang awalan cachenya. Artikel itu melaporkan bahawa SemiAnalysis menemui kadar hit memori lebar jalur tinggi sebanyak 91% pada satu konfigurasi B300 dan 73% pada konfigurasi B200 di bawah tahap konkurensi yang berbeza, dengan penggunaan semula memori hos tambahan. Pengukuran tersebut tidak cukup setanding secara langsung untuk mewujudkan peraturan umum, tetapi ia menunjukkan butiran operasi yang boleh menjejaskan kos dan kependaman.

Penanda aras juga meninggalkan beberapa bahan yang tidak diketahui. Forbes berkata AgentX menggantikan kandungan surih tanpa nama dengan token sintetik, yang boleh memesongkan penerimaan penyahkodan spekulatif, dan SemiAnalysis menggunakan panjang penerimaan yang diambil daripada SPEED-Bench dan bukannya mengukurnya secara langsung. Jejak datang daripada abah-abah pengekodan dengan konteks yang berat, manakala abah-abah yang lebih kurus menghasilkan pengedaran input yang berbeza. Reka bentuk gelung tertutup AgentX juga boleh menukar campuran beban kerja apabila sistem yang lebih pantas menyelesaikan lebih banyak permintaan. TPU Google tiada, dan kemudiannya perkakasan Rubin Nvidia dan MI455X AMD berada di luar perbandingan yang diterangkan. Respons vendor, replikasi bebas dan hasil pada beban kerja ejen bukan pengekodan tidak disediakan dalam sumber.

Panduan & kuiz berkaitan

Ejen AIModel AI DiterangkanTransformerUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?