Teras Tensor
Tensor Cores ialah unit perkakasan khusus dalam GPU NVIDIA moden yang melaksanakan operasi darab dan terkumpul matriks dengan sangat pantas.
Gambaran keseluruhan
They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.
Menyelam dalam
Diperkenalkan dengan seni bina Volta pada 2017, Tensor Cores ialah litar khusus yang mengira pendaraban matriks kecil ditambah penambahan (D = A x B + C) dalam satu operasi, dan bukannya melakukan setiap darab satu demi satu pada teras CUDA standard. Oleh kerana hampir setiap lapisan rangkaian saraf berkurangan kepada pendaraban matriks, ini sepadan dengan sebenarnya yang diperlukan AI matematik. Setiap generasi GPU mengembangkan perkara yang mereka kendalikan: Volta melakukan jubin 4x4 FP16, manakala seni bina Ampere, Hopper dan Blackwell kemudiannya menambah format ketepatan lebih rendah seperti TF32, BF16, INT8, FP8 dan FP4. Ketepatan yang lebih rendah bermakna lebih banyak nombor diproses setiap jam, meningkatkan daya pengeluaran secara mendadak untuk latihan dan inferens sambil memastikan ketepatan boleh diterima.
Wawasan Teknikal
Teras Tensor mendarab dua matriks kecil dan mengumpulkan hasilnya dalam satu langkah bercantum, mengeksploitasi fakta bahawa nilai input yang sama dapat digunakan semula merentas banyak elemen keluaran. Ia biasanya membaca input dalam ketepatan yang dikurangkan (FP16, BF16, atau FP8) tetapi mengumpulkan jumlah larian dalam ketepatan yang lebih tinggi (selalunya FP32) untuk mengehadkan ralat pembundaran. Pustaka perisian seperti cuBLAS dan cuDNN, dan rangka kerja seperti PyTorch, jubinkan matriks besar ke dalam blok kecil ini secara automatik supaya model mendapat kelajuan tanpa pengekodan manual.
Kesan Strategik
Kos dan bajet
Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.
Keputusan yang lebih jelas
Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.
Kawalan kualiti
Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.
Masa Depan Teras Tensor
Teras Tensor terus bergerak ke arah ketepatan yang lebih rendah: Hopper menambah FP8 dan Blackwell memperkenalkan 4-bit FP4 dengan penskalaan terurus perkakasan, secara kasar menggandakan daya pemprosesan setiap langkah untuk beban kerja berat inferens. Jangkakan sokongan yang lebih ketat untuk kesederhanaan (melangkau pemberat sifar), format penskalaan mikro yang melampirkan faktor skala pada blok nombor kecil dan penyepaduan yang lebih mendalam dengan sistem memori supaya teras kekal disuap. Apabila model berkembang, enjin matriks, bukan kelajuan jam mentah, kekal sebagai medan pertempuran utama untuk prestasi perkakasan AI.
Pelaksanaan Dunia Sebenar
Melatih model bahasa besar seperti pengubah gaya GPT, yang berbilion-bilion pendaraban matriks setiap langkah dijalankan pada Teras Tensor dalam BF16 atau FP8.
Menjalankan inferens masa nyata untuk chatbots dan penjana imej, menggunakan kuantiti INT8 atau FP8 untuk melayani lebih ramai pengguna bagi setiap GPU.
Mempercepatkan NVIDIA DLSS dalam permainan video, di mana rangkaian saraf meningkatkan bingkai resolusi rendah menggunakan Tensor Cores setiap bingkai.
Mempercepatkan pengkomputeran saintifik seperti lipatan protein (AlphaFold) dan model cuaca yang telah dirumus semula sebagai beban kerja saraf berat matriks.
Risiko & Pengawal
Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.
Kos infrastruktur dan penyelenggaraan sering dipandang remeh.
Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.
Hala Tuju Pelaksanaan
Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.
Penanda aras di bawah beban realistik dan keadaan data.
Pemantauan instrumen untuk ralat, drift dan kesan pengguna.
Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Cores quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Tensor Parallelism untuk Model Besar
Soalan lazim
What is Tensor Cores?
Tensor Cores ialah unit perkakasan khusus dalam GPU NVIDIA moden yang melaksanakan operasi darab dan terkumpul matriks dengan sangat pantas. Ini adalah sebab utama GPU tunggal boleh melatih dan menjalankan susunan rangkaian saraf yang besar dengan magnitud lebih cepat daripada yang dibenarkan oleh pengiraan tujuan umum.
Apakah operasi matematik teras yang Tensor Cores direka khusus untuk mempercepatkan?
Tensor Cores melakukan pendaraban matriks bercantum ditambah pengumpulan dalam satu langkah, iaitu operasi yang mendominasi lapisan rangkaian saraf.
Seni bina GPU NVIDIA manakah yang pertama kali memperkenalkan Teras Tensor?
Tensor Cores memulakan kerjaya dengan seni bina Volta pada 2017, bermula dengan operasi matriks FP16 4x4.
Mengapa Teras Tensor sering menggunakan ketepatan yang dikurangkan seperti FP16 atau FP8?
Menggunakan lebih sedikit bit setiap nombor bermakna lebih banyak nilai mengalir melalui perkakasan setiap kitaran, meningkatkan kelajuan dengan hanya kehilangan ketepatan yang kecil, biasanya boleh diterima.
Untuk mengekalkan ketepatan, apakah ketepatan yang biasa digunakan Tensor Cores untuk jumlah larian (pengumpulan)?
Input mungkin ketepatan rendah, tetapi penumpuk biasanya berjalan dalam ketepatan yang lebih tinggi seperti FP32 untuk mengehadkan pengumpulan ralat pembundaran.
Bagaimanakah rangka kerja AI setiap hari seperti PyTorch menggunakan Teras Tensor?
Perpustakaan asas memecahkan operasi matriks besar ke dalam jubin bersaiz Tensor-Core secara automatik, jadi rangka kerja mendapat kelajuan tanpa pengekodan manual.