HƯỚNG DẪN KỸ THUẬT

Lõi Tensor

Lõi Tensor là các đơn vị phần cứng chuyên dụng bên trong GPU NVIDIA hiện đại, thực hiện các hoạt động nhân và tích lũy ma trận cực kỳ nhanh.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.

Lặn sâu

Được giới thiệu cùng với kiến ​​trúc Volta vào năm 2017, Tensor Core là các mạch chuyên dụng tính toán phép nhân ma trận nhỏ cộng với phép cộng (D = A x B + C) trong một thao tác duy nhất, thay vì thực hiện từng phép nhân một lần trên các lõi CUDA tiêu chuẩn. Bởi vì hầu như mọi lớp của mạng lưới thần kinh đều giảm xuống thành phép nhân ma trận, điều này phù hợp với toán học mà AI thực sự cần. Mỗi thế hệ GPU mở rộng những gì chúng xử lý: Volta tạo ra các ô 4x4 FP16, trong khi các kiến ​​trúc Ampere, Hopper và Blackwell sau này bổ sung các định dạng có độ chính xác thấp hơn như TF32, BF16, INT8, FP8 và FP4. Độ chính xác thấp hơn có nghĩa là nhiều số được xử lý hơn trên mỗi đồng hồ, tăng đáng kể thông lượng cho quá trình đào tạo và suy luận trong khi vẫn giữ được độ chính xác ở mức chấp nhận được.

Hiểu biết kỹ thuật

Lõi Tensor nhân hai ma trận nhỏ và tích lũy kết quả trong một bước hợp nhất, khai thác thực tế là các giá trị đầu vào giống nhau được sử dụng lại trên nhiều phần tử đầu ra. Nó thường đọc đầu vào với độ chính xác giảm (FP16, BF16 hoặc FP8) nhưng tích lũy tổng chạy ở độ chính xác cao hơn (thường là FP32) để hạn chế lỗi làm tròn. Các thư viện phần mềm như cuBLAS và cuDNN cũng như các khung như PyTorch, tự động xếp các ma trận lớn thành các khối nhỏ này để các mô hình tăng tốc mà không cần mã hóa thủ công.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của lõi Tensor

Lõi Tensor tiếp tục hướng tới độ chính xác ngày càng thấp hơn: Hopper đã thêm FP8 và Blackwell giới thiệu FP4 4 bit với khả năng mở rộng được quản lý bằng phần cứng, tăng gần gấp đôi thông lượng mỗi bước cho khối lượng công việc nặng về suy luận. Mong đợi sự hỗ trợ chặt chẽ hơn cho độ thưa (bỏ qua trọng số bằng 0), các định dạng vi mô gắn các hệ số tỷ lệ vào các khối số nhỏ và tích hợp sâu hơn với hệ thống bộ nhớ để các lõi luôn được cung cấp năng lượng. Khi các mô hình phát triển, công cụ ma trận, chứ không phải tốc độ xung nhịp thô, vẫn là chiến trường trung tâm cho hiệu suất phần cứng AI.

Triển khai trong thế giới thực

Đào tạo các mô hình ngôn ngữ lớn như máy biến áp kiểu GPT, trong đó hàng tỷ phép nhân ma trận mỗi bước chạy trên Lõi Tensor trong BF16 hoặc FP8.

Chạy suy luận thời gian thực cho chatbot và trình tạo hình ảnh, sử dụng lượng tử hóa INT8 hoặc FP8 để phục vụ nhiều người dùng hơn trên mỗi GPU.

Tăng tốc NVIDIA DLSS trong trò chơi điện tử, trong đó mạng thần kinh nâng cấp các khung hình có độ phân giải thấp hơn bằng cách sử dụng Tensor Cores cho mỗi khung hình.

Tăng tốc điện toán khoa học như mô hình gấp protein (AlphaFold) và mô hình thời tiết đã được định dạng lại dưới dạng khối lượng công việc thần kinh nặng về ma trận.

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Cores quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Tính song song của tenxơ cho các mô hình lớn

Câu hỏi thường gặp

What is Tensor Cores?

Lõi Tensor là các đơn vị phần cứng chuyên dụng bên trong GPU NVIDIA hiện đại, thực hiện các hoạt động nhân và tích lũy ma trận cực kỳ nhanh. Chúng là lý do chính khiến một GPU có thể huấn luyện và chạy các mạng lưới thần kinh lớn với tốc độ nhanh hơn tốc độ tính toán cho mục đích chung.

Hoạt động toán học cốt lõi nào được Tensor Cores thiết kế đặc biệt để tăng tốc?

Lõi Tensor thực hiện phép nhân ma trận hợp nhất cộng với tích lũy trong một bước, đây chính xác là hoạt động chi phối các lớp mạng thần kinh.

Kiến trúc GPU NVIDIA nào lần đầu tiên giới thiệu Tensor Cores?

Tensor Cores ra mắt với kiến ​​trúc Volta vào năm 2017, bắt đầu với các hoạt động ma trận FP16 4×4.

Tại sao Tensor Cores thường sử dụng độ chính xác thấp hơn như FP16 hoặc FP8?

Sử dụng ít bit hơn trên mỗi số có nghĩa là có nhiều giá trị hơn chảy qua phần cứng trong mỗi chu kỳ, tốc độ tăng lên đáng kể chỉ với độ chính xác bị mất ở mức độ nhỏ, thường có thể chấp nhận được.

Để duy trì độ chính xác, Tensor Core thường sử dụng độ chính xác nào cho tổng hiện hành (tích lũy)?

Đầu vào có thể có độ chính xác thấp nhưng bộ tích lũy thường chạy ở độ chính xác cao hơn như FP32 để hạn chế tích tụ các lỗi làm tròn.

Các khung AI hàng ngày như PyTorch tận dụng Tensor Cores như thế nào?

Các thư viện cơ bản tự động chia các hoạt động ma trận lớn thành các ô có kích thước Tensor-Core, do đó các khung có thể tăng tốc mà không cần mã hóa thủ công.