データ拡張
データ拡張では、画像の反転やトリミングなど、既存のサンプルの変更されたコピーを作成することで、トレーニング セットを人為的に拡張します。
概要
It matters because more varied data reduces overfitting and helps models generalize to inputs they have not seen.
ディープダイブ
データ拡張では、ラベルを保持した変換を既存のデータに適用することで、新しいトレーニング サンプルを生成します。画像の場合、これは回転、反転、クロップ、カラーシフト、ぼかし、ノイズの追加を意味します。これらの変更はピクセルを変更しますが、正解ではありません(反転した猫は猫のままです)。テキストの場合、同義語の置換、逆翻訳 (別の言語に翻訳してから戻す)、およびランダムな単語の削除または交換などの手法が使用されます。オーディオの場合は、バックグラウンド ノイズ、ピッチのシフト、またはタイム ストレッチ クリップを追加できます。目標は、重要な不変性、つまりオブジェクトのアイデンティティがその位置、照明、または表現に依存しないことをモデルに教えることです。これにより、モデルがより堅牢になり、各実際の例が実質的に多くなるため、ラベル付きデータが不足している場合に特に価値があります。最新のパイプラインでは、多くの場合、各トレーニング エポック中にその場で拡張をランダム化します。
技術的な洞察
拡張が機能するのは、不変性に関する事前知識をトレーニングに直接注入するためです。モデルに 1 つの例の多くの変換バージョンを示すことで、無関係な変動を無視する特徴を学習するように促します。重要なのは、変換ではラベルを保持する必要があることです。「6」を「9」に反転すると、間違ったことを教えることになります。高度な手法は単純な編集を超えています。Mixup は 2 つの画像とそのラベルをブレンドし、カットアウト マスク領域、および AutoAugment などの学習されたポリシーを使用して、特定のデータセットに最適な変換の組み合わせを検索します。
戦略的影響
より明確な判決
これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。
費用と予算
お金や時間を費やす前に、実装に関するより良い質問をすることができます。
チームとワークフロー
共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。
データ拡張の未来
最前線は生成的で学習された拡張です。拡散モデルまたは GAN を使用して、古いトレーニング サンプルを単に変換するのではなく、まったく新しい現実的なトレーニング サンプルを合成します。自動拡張検索 (AutoAugment、RandAugment) により手動チューニングが削減され、拡張は現在自己教師あり学習の中心となっており、モデルは同じ入力の 2 つの拡張ビューが一致する必要があることを認識して学習します。特に実際のデータの収集が難しいレアクラスやプライバシーに敏感なドメインでは、拡張によって合成データ生成との境界線が曖昧になり続けることが予想されます。
現実世界の実装
画像分類器は、角度や照明に関係なくオブジェクトを認識できるように、ランダムに回転、トリミング、色ジッターした写真をトレーニングします。
NLP チームは逆翻訳 (英語からドイツ語へ、そしてその逆) を使用して文章を言い換え、小規模な感情分析データセットを拡張しています。
音声モデルは背景のカフェのノイズを追加し、録音のピッチをシフトするため、騒がしい現実世界の状況でも正確さを保ちます。
医療 AI は弾性変形を適用し、限られた MRI スキャンのセットに反転して、新しい患者のいない希少なラベル付きサンプルを増やします。
リスクとガードレール
チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。
ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。
データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。
実装ロードマップ
必要な結果を平易な言葉で定義することから始めます。
テストする前に、成功指標と失敗条件を 1 つ選択します。
洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。
データ拡張が役立つ場合と、よりシンプルな方法の方が優れている場合を文書化します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Data Augmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
AIとデータ
よくある質問
What is Data Augmentation?
データ拡張では、画像の反転やトリミングなど、既存のサンプルの変更されたコピーを作成することで、トレーニング セットを人為的に拡張します。より多様なデータが過学習を減らし、モデルがこれまでに見たことのない入力に一般化するのに役立つため、これは重要です。
データ拡張の主な目的は何ですか?
拡張では、既存のデータのさまざまな変更されたコピーが作成され、過剰適合が軽減され、モデルが目に見えない入力を処理できるようになります。
一般的な画像拡張技術は次のうちどれですか?
反転、トリミング、回転、およびカラー シフトは、ラベルを維持しながらピクセルを変更する標準的な画像拡張です。
テキスト拡張において逆翻訳は何をしますか?
逆翻訳では、テキストを別の言語と逆に実行し、意味を保持した言い換え版を生成します。
なぜ拡張は「ラベルを保持」しなければならないのでしょうか?
変換によって正解が変更されるべきではありません。たとえば、「6」を「9」に反転すると、例に誤ったラベルが付けられてしまいます。
ミックスアップテクニックは何をするのですか?
Mixup は、入力とそのラベルのペアを線形的に組み合わせて新しいサンプルを作成し、よりスムーズな決定境界を促進します。