Kembali ke Berita
ProdukAI Understanding pengarahan

OpenAI melaporkan chip Jalapeño khusus meningkatkan kecepatan dan efisiensi inferensi AI

OpenAI mengatakan chip inferensi khusus pertamanya memberikan kinerja per watt yang lebih tinggi dan latensi yang lebih rendah dibandingkan sistem perbandingan di tiga model bahasa besar, namun tetap dalam kualifikasi produksi menjelang penerapan yang direncanakan pada akhir tahun.

6 min readRead the primary source
Source-provided image accompanying OpenAI reports custom Jalapeño chip improves AI inference speed and efficiency
Dokumen sumber utamaSumber direkam
Penerbit
openai.com
Tautan sumber
openai.comhttps://openai.com/index/jalapeno-first-results/
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Kesimpulan
Fase runtime saat model terlatih menghasilkan prediksi atau keluaran.
Memori (Memori Agen)
Konteks tersimpan yang digunakan agen AI di seluruh langkah atau sesi untuk meningkatkan kontinuitas.
Tolok ukur
Tes atau kumpulan data standar yang digunakan untuk mengukur dan membandingkan kinerja model.
Uji diri Anda sendiriKuis Penjelasan Model AI

Apa yang terjadi

OpenAI menerbitkan hasil pengujian awal untuk Jalapeño, chip inferensi khusus pertamanya. Perusahaan mengatakan sistem tersebut menghasilkan 1,5 hingga 1,9 kali lebih banyak pekerjaan AI per watt pada throughput puncak dan latensi end-to-end 1,7 hingga 3,6 kali lebih rendah dibandingkan sistem perbandingan di GPT-OSS 120B, DeepSeek R1 670B, dan Kimi K2.5 1T.

OpenAI mengatakan Jalapeño adalah chip inferensi khusus pertamanya dan hasilnya didasarkan pada pengujian chip tersebut bersama dengan sistem yang dibangun di sekitarnya. Perusahaan mengevaluasi sistem pada InferenceX, tolok ukur publik dari SemiAnalysis yang mengukur seluruh proses dalam melayani permintaan AI. OpenAI mengatakan pihaknya membandingkan Jalapeño dengan sistem AI yang tersedia secara komersial pada titik operasi mulai dari penyajian throughput tinggi hingga penggunaan yang sangat interaktif dan latensi rendah.

Pada GPT-OSS 120B, DeepSeek R1, dan Kimi K2.5, OpenAI melaporkan kerja AI 1,5 hingga 1,9 kali lebih banyak per watt pada throughput puncak dan latensi end-to-end 1,7 hingga 3,6 kali lebih rendah dibandingkan sistem pembanding. Untuk beban kerja yang sangat interaktif, ia melaporkan kinerja 2,1 hingga 4,1 kali lebih tinggi. Dalam lampiran, perusahaan membandingkan Jalapeño dengan GB200 untuk GPT-OSS 120B dan dengan GB300 untuk DeepSeek R1 dan Kimi K2.5. OpenAI mengatakan Jalapeño mencapai batas Pareto di seluruh titik operasi yang diuji, yang berarti Jalapeño menemukan kombinasi throughput, latensi, dan efisiensi daya yang lebih baik dalam perbandingan tersebut.

Perusahaan melaporkan bahwa Jalapeño memiliki tingkat daya paket 700 watt, sementara daya berkelanjutan terukur tetap pada atau di bawah 550 watt pada beban kerja yang diuji. Perbandingan yang dipublikasikan menggunakan peringkat daya paket, termasuk 1.200 watt untuk GB200 dan 1.400 watt untuk GB300. Untuk GPT-OSS 120B, OpenAI melaporkan puncak token campuran per detik per kilowatt sekitar 1,9 kali lebih tinggi dan latensi end-to-end 1,7 kali lebih rendah dibandingkan sistem perbandingan. Untuk DeepSeek R1, ia melaporkan kinerja puncak per watt sekitar 1,7 kali lebih tinggi dan latensi 3,6 kali lebih rendah. Untuk Kimi K2.5, ia melaporkan kinerja puncak per watt sekitar 1,5 kali lebih tinggi dan latensi 3,4 kali lebih rendah.

OpenAI mengaitkan hasilnya dengan desain full-stack yang menggabungkan chip, memori, jaringan, perangkat lunak, dan sistem skala rak di sekitar beban kerja model bahasa. Perusahaan mengatakan arsitekturnya menjaga status model, termasuk cache KV yang digunakan selama pembuatan, secara lokal jika memungkinkan dan mengurangi penundaan komunikasi antara inti dan chip. Ini menggambarkan pra-pengisian sebagai lebih intensif komputasi dan dekode karena lebih dibatasi oleh bandwidth memori, dan mengatakan Jalapeño dirancang untuk menangani kedua fase tersebut. OpenAI juga mengatakan AI membantu memindahkan chip dari desain awal ke tapeout dalam sembilan bulan dan membantu mengoptimalkan sirkuit aritmatika, namun sumber tersebut tidak memberikan penjelasan independen mengenai garis waktu tersebut atau rincian lengkap pekerjaan desain mana yang diotomatisasi.

Detail sumber: openai.com ↗

Mengapa itu penting

Hasilnya menunjukkan bahwa kinerja inferensi mungkin semakin bergantung pada perancangan model, chip, memori, jaringan, dan perangkat lunak sebagai satu sistem. Jika peningkatan ini bertahan pada skala produksi, hal ini dapat mengurangi daya dan perangkat keras yang diperlukan untuk melayani respons AI dan membuat beban kerja agen interaktif menjadi lebih responsif.

Hal yang paling penting adalah potensi perubahan dalam cara mengoptimalkan infrastruktur AI. Akun OpenAI berpendapat bahwa akselerator tujuan umum dapat kehilangan kinerja ketika komputasi, akses memori, dan komunikasi diperlakukan sebagai masalah terpisah. Jalapeño malah menggabungkan elemen-elemen tersebut seputar waktu dan pola pergerakan data dalam inferensi model bahasa. Pendekatan tersebut penting karena memberikan respons melibatkan pemrosesan perintah dan pembuatan token secara berurutan, sementara sistem agen dapat mengulangi langkah-langkah tersebut berkali-kali dalam satu tugas.

Peningkatan latensi yang dilaporkan dapat berdampak praktis pada produk AI interaktif jika produk tersebut dapat bertahan dalam penerapan produksi. OpenAI mengatakan inferensi yang lebih cepat dapat mendukung agen yang lebih responsif dan memungkinkan untuk menjalankan beban kerja ultra-cepat dengan efisiensi yang sebelumnya dikaitkan dengan mode batch yang lebih cepat atau lebih banyak. Namun, sumbernya tidak menunjukkan efek tersebut pada produk pelanggan langsung. Laporan ini menyajikan hasil tolok ukur dan rencana penerapan infrastruktur, sehingga dampaknya terhadap masyarakat tetap prospektif.

Efisiensi daya juga mempunyai arti penting dalam operasional. OpenAI mengatakan bahwa menghasilkan pekerjaan yang lebih bermanfaat dengan daya dan perangkat keras yang sama dapat membantunya melayani permintaan dengan biaya lebih rendah dan meningkatkan leverage operasi. Klaim tersebut masuk akal sebagai tujuan bisnis, namun sumbernya tidak memberikan biaya per kueri, total biaya sistem, persyaratan pendinginan, belanja modal, asumsi pemanfaatan, atau bukti bahwa rasio tolok ukur yang dilaporkan secara langsung menghasilkan harga yang lebih rendah bagi pengguna.

Proses pengembangan yang dijelaskan oleh OpenAI sendiri patut diperhatikan. Perusahaan mengatakan model-modelnya membantu merancang dan mengembangkan Jalapeño, sementara model-model baru digunakan untuk mengoptimalkan dan memprogramnya. Menggunakan Codex dengan GPT-Astra, tim dilaporkan membawa tiga model bobot terbuka yang bukan bagian dari rencana produksi awal ke performa tinggi dalam waktu dua bulan. OpenAI juga mengatakan implementasi yang dihasilkan AI 1,5 hingga 1,8 kali lebih cepat dibandingkan implementasi yang ditulis manusia untuk perhatian GPT-OSS tertentu dan blok campuran pakar. Angka-angka tersebut hanya berlaku untuk blok tertentu, bukan model lengkap, dan tidak menetapkan bahwa AI dapat merancang atau mengoptimalkan keseluruhan chip produksi secara mandiri.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang harus ditonton selanjutnya

OpenAI berencana untuk mulai menerapkan Jalapeño dalam infrastruktur komputasinya pada akhir tahun 2026, namun mengatakan kualifikasi produksi, pematangan perangkat lunak, operasi skala, dan validasi model yang lebih luas masih berlangsung. Sumber tersebut tidak menetapkan verifikasi independen, biaya pengoperasian, volume produksi, atau bagaimana kinerja chip di seluruh beban kerja di luar yang diuji.

Tes pertama adalah apakah Jalapeño mencapai target penerapan yang direncanakan. OpenAI mengatakan pihaknya bermaksud untuk mulai menerapkan chip tersebut dalam infrastruktur komputasinya pada akhir tahun 2026, sementara kualifikasi produksi dan pekerjaan perangkat lunak terus berlanjut. Penerapan akan menetapkan bahwa sistem telah melampaui demonstrasi , namun sumbernya tidak menentukan skala awal, lokasi, beban kerja, atau apakah pengguna akan melihat perubahan tingkat produk.

Diperlukan lebih banyak bukti mengenai reproduktifitas dan metodologi perbandingan. OpenAI menggunakan tolok ukur publik, namun sumbernya tidak memberikan data tolok ukur lengkap, jumlah chip atau sistem yang diuji, versi perangkat lunak, tingkat pemanfaatan, daya pendinginan dan fasilitas, atau validasi independen atas hasil perbandingan. Karena rasio headline dinormalisasi menggunakan peringkat daya chip yang dipublikasikan, sedangkan daya berkelanjutan Jalapeño juga dilaporkan secara terpisah, pembaca harus membedakan efisiensi tingkat paket dari efisiensi total pusat data.

Cakupan model akan menjadi penting. OpenAI melaporkan hasil untuk GPT-OSS 120B, DeepSeek R1 670B dan Kimi K2.5 1T, dan mengatakan bahwa pengujian internal menunjukkan keunggulan yang lebih luas pada model OpenAI terdepan. Sumber tidak mengidentifikasi model internal tersebut atau mempublikasikan hasilnya. Ia juga mengatakan bahwa setiap rangkaian model tambahan memerlukan kernel baru dan pengoptimalan khusus model, yang berarti fleksibilitas chip mungkin bergantung pada kelanjutan kerja perangkat lunak, bukan pada perangkat keras saja.

OpenAI mengatakan Gen 2 sedang dalam pengembangan dan Gen 3 mulai terbentuk, sekaligus menekankan bahwa mereka akan terus menggunakan akselerator dari NVIDIA dan mitra lainnya untuk pelatihan dan inferensi. Oleh karena itu, ketidakpastian yang berarti bukan hanya apakah Jalapeño lebih cepat dalam pengujian yang dilaporkan, namun bagaimana Jalapeño cocok dengan strategi infrastruktur campuran, seberapa besar kapasitas yang akan diwakilinya, dan apakah generasi mendatang menjaga keseimbangan antara throughput, latensi, efisiensi dan dukungan untuk perubahan arsitektur model.

Panduan & kuis terkait

Model AI DijelaskanPelatihan AIAgen AIMasa Depan AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI
Apakah ini berguna?