Teknisk GUIDE

Tensor kärnor

Tensor Cores är specialiserade hårdvaruenheter inuti moderna NVIDIA GPU:er som utför matrix multiplicera-och-ackumulera operationer extremt snabbt.

2 min readSenast uppdaterad

Översikt

They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.

Djupdykning

Tensor Cores, som introducerades med Volta-arkitekturen 2017, är dedikerade kretsar som beräknar en liten matrismultiplikation plus en addition (D = A x B + C) i en enda operation, istället för att göra varje multiplikation en i taget på standard CUDA-kärnor. Eftersom praktiskt taget varje lager i ett neuralt nätverk reduceras till matrismultiplikationer, matchar detta den matematiska AI som faktiskt behöver. Varje GPU-generation utökade vad de hanterar: Volta gjorde 4x4 FP16-plattor, medan senare Ampere-, Hopper- och Blackwell-arkitekturer lade till format med lägre precision som TF32, BF16, INT8, FP8 och FP4. Lägre precision innebär fler siffror som bearbetas per klocka, vilket dramatiskt ökar genomströmningen för träning och slutledning samtidigt som noggrannheten hålls acceptabel.

Teknisk insikt

En Tensor Core multiplicerar två små matriser och ackumulerar resultatet i ett sammansmält steg, och utnyttjar det faktum att samma ingångsvärden återanvänds över många utdataelement. Den läser vanligtvis indata med reducerad precision (FP16, BF16 eller FP8) men ackumulerar löpsumman med högre precision (ofta FP32) för att begränsa avrundningsfel. Programvarubibliotek som cuBLAS och cuDNN, och ramverk som PyTorch, lägger ihop stora matriser i dessa små block automatiskt så att modellerna får snabbheten utan manuell kodning.

Strategisk inverkan

Cost and budget

Arkitekturbeslut driver prestanda och driftskostnader i flera år.

Clearer decisions

Teknisk utbildning hjälper team att välja rätt stack, inte bara den nyaste.

Quality control

Bättre tekniska val minskar tillförlitlighetsincidenter i produktionen.

Tensorkärnornas framtid

Tensorkärnor fortsätter att röra sig mot allt lägre precision: Hopper lade till FP8 och Blackwell introducerade 4-bitars FP4 med hårdvaruhanterad skalning, vilket ungefär fördubblar genomströmningen varje steg för slutledningstunga arbetsbelastningar. Förvänta dig snävare stöd för sparsitet (hoppa över nollvikter), mikroskalningsformat som kopplar skalfaktorer till små block av siffror och djupare integration med minnessystem så att kärnorna förblir matade. När modellerna växer förblir matrismotorn, inte rå klockhastighet, den centrala slagfältet för AI-hårdvaruprestanda.

Real-World Implementation

Träning av stora språkmodeller som transformatorer i GPT-stil, där miljarder matrismultiplikationer per steg körs på Tensor Cores i BF16 eller FP8.

Kör inferens i realtid för chatbots och bildgeneratorer, med INT8- eller FP8-kvantisering för att betjäna fler användare per GPU.

Accelererar NVIDIA DLSS i videospel, där ett neuralt nätverk skalar upp ramar med lägre upplösning med Tensor Cores varje bildruta.

Påskynda vetenskaplig beräkning som proteinveckning (AlphaFold) och vädermodeller som har omformulerats till matristunga neurala arbetsbelastningar.

Risker & skyddsräcken

Att optimera ett riktmärke kan dölja bredare systemsvagheter.

Infrastruktur- och underhållskostnader underskattas ofta.

Säkerhets- och observerbarhetsluckor kan växa i takt med att systemen blir mer komplexa.

Färdplan för genomförande

1

Definiera latens-, kvalitet- och kostnadsmål före implementering.

2

Benchmark under realistiska belastnings- och dataförhållanden.

3

Instrumentövervakning för fel, drift och användarpåverkan.

4

Förbered återställnings- och incidentsvarsvägar innan skalning.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Cores quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Tensorparallellism för stora modeller

Frequently asked questions

What is Tensor Cores?

Tensor Cores är specialiserade hårdvaruenheter inuti moderna NVIDIA GPU:er som utför matrix multiplicera-och-ackumulera operationer extremt snabbt. De är huvudorsaken till att en enda GPU kan träna och köra stora neurala nätverk i storleksordningar snabbare än generell beräkning skulle tillåta.

Vilken matematisk kärnoperation är Tensor Cores speciellt utformade för att accelerera?

Tensor Cores utför en fusionerad matrismultiplikation plus ackumulering i ett steg, vilket är exakt den operation som dominerar neurala nätverkslager.

Vilken NVIDIA GPU-arkitektur introducerade först Tensor Cores?

Tensor Cores debuterade med Volta-arkitekturen 2017 och började med FP16 4x4-matrisoperationer.

Varför använder Tensor Cores ofta reducerad precision som FP16 eller FP8?

Att använda färre bitar per nummer innebär att fler värden flödar genom hårdvaran varje cykel, vilket kraftigt ökar hastigheten med endast en liten, vanligtvis tolererbar, precisionsförlust.

För att bevara noggrannheten, vilken precision använder Tensor Cores vanligtvis för den löpande summan (ackumulering)?

Ingångarna kan ha låg precision, men ackumulatorn körs vanligtvis med högre precision som FP32 för att begränsa uppbyggnaden av avrundningsfel.

Hur använder vardagliga AI-ramverk som PyTorch sig av Tensor Cores?

Underliggande bibliotek delar automatiskt upp stora matrisoperationer i Tensor-kärnstora brickor, så ramverk får farten upp utan manuell kodning.