HƯỚNG DẪN cơ bản

Tăng cường dữ liệu

Việc tăng cường dữ liệu sẽ mở rộng tập huấn luyện một cách giả tạo bằng cách tạo các bản sao sửa đổi của các mẫu hiện có — chẳng hạn như lật hoặc cắt xén hình ảnh.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because more varied data reduces overfitting and helps models generalize to inputs they have not seen.

Lặn sâu

Tăng cường dữ liệu tạo ra các ví dụ đào tạo mới bằng cách áp dụng các phép biến đổi bảo toàn nhãn cho dữ liệu bạn đã có. Đối với hình ảnh, điều đó có nghĩa là xoay, lật, cắt, thay đổi màu sắc, làm mờ và thêm nhiễu - những thay đổi làm thay đổi pixel nhưng không phải là câu trả lời chính xác (con mèo bị lật vẫn là con mèo). Đối với văn bản, các kỹ thuật bao gồm thay thế từ đồng nghĩa, dịch ngược (dịch sang ngôn ngữ khác và dịch ngược lại) và xóa hoặc hoán đổi từ ngẫu nhiên. Đối với âm thanh, bạn có thể thêm tiếng ồn xung quanh, thay đổi cao độ hoặc các đoạn kéo dài thời gian. Mục đích là dạy cho mô hình những bất biến quan trọng - rằng danh tính của một đối tượng không phụ thuộc vào vị trí, ánh sáng hoặc cụm từ của nó. Điều này làm cho các mô hình trở nên mạnh mẽ hơn và đặc biệt có giá trị khi dữ liệu được dán nhãn khan hiếm, vì mỗi ví dụ thực tế trở nên rất nhiều. Các quy trình hiện đại thường ngẫu nhiên tăng cường nhanh chóng trong mỗi giai đoạn đào tạo.

Hiểu biết kỹ thuật

Tính năng mở rộng hoạt động vì nó đưa trực tiếp kiến ​​thức có sẵn về bất biến vào quá trình đào tạo: bằng cách hiển thị cho mô hình nhiều phiên bản được chuyển đổi của một ví dụ, bạn khuyến khích mô hình tìm hiểu các tính năng bỏ qua các biến thể không liên quan. Điều quan trọng là các phép biến đổi phải bảo toàn nhãn - việc chuyển số '6' thành số '9' sẽ dạy điều sai. Các phương pháp nâng cao vượt xa các chỉnh sửa đơn giản: Mixup kết hợp hai hình ảnh và nhãn của chúng, các vùng mặt nạ bị cắt và các chính sách đã học như tìm kiếm AutoAugment để có các kết hợp chuyển đổi tốt nhất cho một tập dữ liệu nhất định.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của việc tăng cường dữ liệu

Biên giới là tăng cường sinh sản và học hỏi: sử dụng các mô hình phổ biến hoặc GAN để tổng hợp các ví dụ đào tạo thực tế, hoàn toàn mới thay vì chỉ chuyển đổi các ví dụ cũ. Tìm kiếm tăng cường tự động (AutoAugment, RandAugment) đang giảm việc điều chỉnh thủ công và tăng cường hiện là trọng tâm của quá trình học tập tự giám sát, trong đó các mô hình học bằng cách nhận ra rằng hai chế độ xem tăng cường của cùng một đầu vào phải khớp nhau. Mong đợi sự gia tăng để tiếp tục làm mờ ranh giới với việc tạo dữ liệu tổng hợp, đặc biệt đối với các lớp hiếm và các miền nhạy cảm về quyền riêng tư, nơi khó thu thập dữ liệu thực.

Triển khai trong thế giới thực

Trình phân loại hình ảnh sẽ xử lý các bức ảnh được xoay, cắt và trộn màu ngẫu nhiên để nhận dạng các vật thể bất kể góc độ hay ánh sáng.

Nhóm NLP sử dụng bản dịch ngược (tiếng Anh sang tiếng Đức và ngược lại) để diễn giải các câu và mở rộng tập dữ liệu phân tích tình cảm nhỏ.

Mẫu giọng nói thêm tiếng ồn nền của quán cà phê và thay đổi cao độ trên bản ghi để luôn chính xác trong điều kiện ồn ào của thế giới thực.

AI y tế áp dụng các biến dạng đàn hồi và lật cho một bộ quét MRI giới hạn để nhân lên các ví dụ được dán nhãn khan hiếm mà không có bệnh nhân mới.

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Tài liệu nơi Tăng cường dữ liệu hữu ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

What is Data Augmentation?

Việc tăng cường dữ liệu sẽ mở rộng tập huấn luyện một cách giả tạo bằng cách tạo các bản sao sửa đổi của các mẫu hiện có — chẳng hạn như lật hoặc cắt xén hình ảnh. Điều này quan trọng vì dữ liệu đa dạng hơn sẽ giảm việc khớp quá mức và giúp các mô hình khái quát hóa các đầu vào mà chúng chưa thấy.

Mục đích chính của việc tăng cường dữ liệu là gì?

Việc tăng cường tạo ra các bản sao được sửa đổi, đa dạng của dữ liệu hiện có để giảm tình trạng trang bị quá mức và giúp mô hình xử lý các dữ liệu đầu vào không nhìn thấy được.

Kỹ thuật nào sau đây là kỹ thuật tăng cường hình ảnh phổ biến?

Lật, cắt, xoay và thay đổi màu sắc là các tính năng tăng cường hình ảnh tiêu chuẩn giúp thay đổi pixel trong khi vẫn giữ được nhãn.

Dịch ngược làm gì trong việc tăng cường văn bản?

Dịch ngược chạy văn bản qua một ngôn ngữ khác và ngược lại, tạo ra một phiên bản được diễn đạt lại mà vẫn giữ nguyên ý nghĩa.

Tại sao các phần mở rộng phải là 'bảo toàn nhãn'?

Một phép biến đổi không được thay đổi câu trả lời đúng — chẳng hạn, việc lật số '6' thành số '9' sẽ gắn nhãn sai cho ví dụ.

Kỹ thuật Mixup làm gì?

Mixup tạo ra các mẫu mới bằng cách kết hợp tuyến tính các cặp đầu vào và nhãn của chúng, khuyến khích các ranh giới quyết định mượt mà hơn.