HƯỚNG DẪN cơ bản

Chức năng kích hoạt

Các hàm kích hoạt là các cổng phi tuyến nhỏ bên trong mỗi nơ-ron cho phép mạng lưới thần kinh học các mẫu cong, phức tạp thay vì chỉ các đường thẳng.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Without them, a deep network would collapse into a single linear equation.

Lặn sâu

Mỗi nơ-ron tính tổng có trọng số của các đầu vào của nó, nhưng riêng tổng đó là tuyến tính. Xếp chồng nhiều lớp tuyến tính và về mặt toán học, bạn vẫn chỉ có một hàm tuyến tính lớn, cho dù sâu đến đâu. Các hàm kích hoạt phá vỡ điều này bằng cách áp dụng một phép biến đổi phi tuyến cho đầu ra của mỗi nơ-ron, mang lại cho mạng khả năng xấp xỉ hầu hết mọi hàm. Phổ biến nhất là ReLU, đơn giản là xuất đầu vào nếu dương và bằng 0 nếu ngược lại; nó nhanh và tránh được một số vấn đề huấn luyện của các hàm cũ hơn. Các giá trị sigmoid và tanh biến thành các phạm vi giới hạn và đã phổ biến trong lịch sử nhưng có thể bị biến mất độ dốc trong các mạng sâu. Hàm softmax, được sử dụng ở đầu ra, chuyển đổi điểm thô thành phân bố xác suất cho các lớp.

Hiểu biết kỹ thuật

Sự hấp dẫn của ReLU một phần nằm ở độ dốc của nó: nó chính xác bằng 1 đối với đầu vào dương, do đó, nó không thu hẹp tín hiệu lỗi trong quá trình truyền ngược, giúp đào tạo các mạng sâu. Ngược lại, sigmoid và tanh phẳng ở các điểm cực trị của chúng, trong đó độ dốc của chúng tiến gần đến 0, gây ra vấn đề độ dốc biến mất khiến việc học tập trong các ngăn xếp sâu bị đình trệ. Nhược điểm của ReLU là vấn đề ReLU sắp chết, trong đó các tế bào thần kinh bị mắc kẹt ở đầu vào âm sẽ tạo ra kết quả bằng 0 mãi mãi; các biến thể như Leaky ReLU và GELU giải quyết vấn đề này bằng cách cho phép phản hồi khác 0 nhỏ hoặc mượt mà.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của chức năng kích hoạt

ReLU và người anh em họ hàng trơn tru của nó là GELU thống trị ngày nay, trong đó GELU được ưa chuộng trong các máy biến áp vì đường cong mượt mà của nó kết hợp tốt với động lực tập luyện của chúng. Nghiên cứu khám phá các kích hoạt đã học và kiểm soát như SwiGLU, hiện phổ biến trong các mô hình ngôn ngữ lớn, sử dụng phương pháp kích hoạt nhân để tăng cường khả năng diễn đạt. Xu hướng rộng rãi là hướng tới các chức năng kiểm soát, mượt mà giúp cải thiện dòng chuyển màu và chất lượng mô hình trên quy mô lớn. Trong khi các kích hoạt kỳ lạ xuất hiện thường xuyên trên giấy tờ thì các hàm đơn giản, hoạt động tốt có xu hướng giành chiến thắng trong thực tế vì chúng huấn luyện một cách đáng tin cậy trên các mô hình khổng lồ.

Triển khai trong thế giới thực

Sử dụng ReLU trong các lớp ẩn của mạng tích chập để nó có thể tìm hiểu các ranh giới quyết định cong để nhận dạng hình ảnh

Áp dụng softmax ở lớp cuối cùng để biến điểm thô của bộ phân loại thành xác suất của lớp có tổng bằng một

Chọn kích hoạt GELU bên trong mô hình ngôn ngữ biến áp để có luồng chuyển màu mượt mà hơn

Chuyển sang Leaky ReLU khi có quá nhiều nơ-ron trong mạng đã chết và ngừng phản hồi

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Tài liệu nơi Chức năng kích hoạt hữu ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Activation Functions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

What is Activation Functions?

Các hàm kích hoạt là các cổng phi tuyến nhỏ bên trong mỗi nơ-ron cho phép mạng lưới thần kinh học các mẫu cong, phức tạp thay vì chỉ các đường thẳng. Không có chúng, mạng sâu sẽ sụp đổ thành một phương trình tuyến tính duy nhất.

Điều gì sẽ xảy ra với một mạng sâu không có chức năng kích hoạt?

Việc xếp chồng các lớp tuyến tính không có tính phi tuyến sẽ thu gọn về mặt toán học thành một phép biến đổi tuyến tính, do đó mạng không thể học các mẫu phức tạp.

Hàm kích hoạt ReLU xuất ra kết quả gì cho đầu vào âm?

ReLU xuất đầu vào khi dương và bằng 0 khi âm, điều này giúp việc tính toán trở nên đơn giản và nhanh chóng.

Vấn đề độ dốc biến mất liên quan đến sigmoid và tanh là gì?

Sigmoid và tanh phẳng ở các điểm cực trị của chúng, do đó độ dốc của chúng co lại về 0, làm suy yếu tín hiệu lỗi trong các mạng sâu.

Hàm kích hoạt nào thường được sử dụng ở lớp đầu ra của bộ phân loại nhiều lớp?

Softmax chuyển đổi điểm thô thành phân bố xác suất trên các lớp có tổng thành một, lý tưởng cho đầu ra phân loại.

Vấn đề 'ReLU sắp chết' là gì?

Nếu một nơ-ron ReLU luôn nhận được đầu vào âm, nó sẽ xuất ra số 0 với độ dốc bằng 0 và ngừng cập nhật một cách hiệu quả, do đó 'chết'.