HƯỚNG DẪN cơ bản

Mạng thần kinh tích chập

Mạng thần kinh chuyển đổi (CNN) là kiến ​​trúc đặc biệt để hiểu hình ảnh.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

They learn visual patterns by sliding small filters across a picture, which is why they power everything from face unlock to medical scan analysis.

Lặn sâu

CNN xử lý hình ảnh bằng cách trượt các lưới trọng số nhỏ, được gọi là bộ lọc hoặc hạt nhân, trên các pixel. Mỗi bộ lọc quét một mẫu, chẳng hạn như một cạnh, một đốm màu hoặc một góc. Các lớp đầu phát hiện các tính năng đơn giản; các lớp sâu hơn kết hợp chúng thành mắt, bánh xe hoặc văn bản. Vì cùng một bộ lọc được sử dụng lại ở mọi vị trí (chia sẻ trọng lượng), CNN cần ít tham số hơn nhiều so với mạng được kết nối đầy đủ và có thể phát hiện ra một con mèo cho dù nó xuất hiện ở phía trên bên trái hay phía dưới bên phải. Các lớp gộp sẽ thu nhỏ hình ảnh giữa các bước, giúp mạng nhanh hơn và chịu được những thay đổi nhỏ hơn. Các thiết kế mang tính bước ngoặt như LeNet, AlexNet (2012) và ResNet đã thúc đẩy sự bùng nổ của deep learning, với chiến thắng ImageNet của AlexNet đã khơi dậy kỷ nguyên hiện đại của lĩnh vực này.

Hiểu biết kỹ thuật

Hoạt động cốt lõi là tích chập: một bộ lọc (giả sử trọng số 3x3) được phủ trên một mảng pixel, mỗi trọng số được nhân với pixel của nó và kết quả được tổng hợp thành một số đầu ra. Trượt bộ lọc sẽ tạo ra một bản đồ đặc trưng. Hai ý tưởng giúp việc này trở nên hiệu quả: chia sẻ trọng lượng (một bộ lọc được sử dụng lại ở mọi nơi) và kết nối cục bộ (mỗi nơ-ron chỉ nhìn thấy một vùng nhỏ). Tích chập xếp chồng, tính phi tuyến tính như ReLU và gộp cho phép mạng xây dựng một hệ thống phân cấp các tính năng hình ảnh ngày càng trừu tượng.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của mạng lưới thần kinh tích chập

CNN vẫn chiếm ưu thế trong thời gian thực và tầm nhìn hạn chế về tài nguyên, như camera điện thoại và nhận thức về xe tự lái, vì chúng nhanh và tiết kiệm dữ liệu. Vision Transformers hiện có thể cạnh tranh hoặc đánh bại chúng trên các tập dữ liệu lớn, vì vậy lĩnh vực này đang hội tụ các thiết kế kết hợp kết hợp hiệu quả của tích chập với khả năng lý luận tổng thể của sự chú ý. Kỳ vọng CNN sẽ tiếp tục tồn tại trong các thiết bị nhúng và biên, trong hình ảnh y tế nơi dữ liệu khan hiếm và là công cụ trích xuất tính năng hiệu quả cung cấp cho các hệ thống đa phương thức lớn hơn trong nhiều năm tới.

Triển khai trong thế giới thực

Phát hiện khối u, gãy xương, bệnh võng mạc đái tháo đường trên phim X-quang, CT scan, ảnh võng mạc

Hỗ trợ nhận dạng khuôn mặt để mở khóa điện thoại và gắn thẻ ảnh trong các ứng dụng như Google Photos

Đọc biển báo đường, vạch kẻ đường và người đi bộ trong hệ thống nhận biết xe tự lái

Tự động gắn cờ sản phẩm lỗi trên dây chuyền lắp ráp của nhà máy thông qua kiểm tra camera

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Tài liệu nơi Mạng thần kinh chuyển đổi hữu ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Convolutional Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mạng lưới thần kinh đồ thị

Câu hỏi thường gặp

What is Convolutional Neural Networks?

Mạng thần kinh chuyển đổi (CNN) là kiến trúc đặc biệt để hiểu hình ảnh. Họ tìm hiểu các mẫu hình ảnh bằng cách trượt các bộ lọc nhỏ trên một bức ảnh, đó là lý do tại sao họ hỗ trợ mọi thứ, từ mở khóa bằng khuôn mặt đến phân tích quét y tế.

Công việc chính của bộ lọc (kernel) trong CNN là gì?

Bộ lọc là một lưới nhỏ có trọng số trượt trên hình ảnh, kích hoạt khi tìm thấy mẫu mà nó đã học, chẳng hạn như cạnh hoặc họa tiết.

Tại sao CNN cần ít tham số hơn nhiều so với mạng được kết nối đầy đủ cho hình ảnh?

Chia sẻ trọng số có nghĩa là một bộ lọc nhỏ được áp dụng ở mọi nơi trong hình ảnh, do đó, mạng sẽ sử dụng lại các trọng số giống nhau thay vì học các trọng số riêng biệt cho từng vị trí pixel.

Lớp gộp thường làm gì?

Việc gộp chung (chẳng hạn như gộp tối đa) lấy mẫu bản đồ đối tượng địa lý, giảm tính toán và làm cho mạng ít nhạy cảm hơn với chính xác vị trí xuất hiện của đối tượng địa lý.

Trong một CNN sâu, các tính năng thường thay đổi như thế nào từ lớp đầu sang lớp sau?

Các lớp đầu phát hiện các tính năng cấp thấp như cạnh và màu sắc; các lớp sâu hơn kết hợp chúng thành các khái niệm cấp cao hơn như khuôn mặt hoặc các bộ phận của đối tượng.

Sự kiện nào được cho là đã khởi đầu cho sự bùng nổ về tầm nhìn của deep learning hiện đại?

Chiến thắng ấn tượng của ImageNet năm 2012 của AlexNet khi sử dụng CNN sâu trên GPU đã thuyết phục các nhà nghiên cứu rằng học sâu có thể vượt trội hơn các phương pháp cũ hơn, thúc đẩy sự phát triển nhanh chóng của lĩnh vực này.