基本ガイド

畳み込みニューラル ネットワーク

畳み込みニューラル ネットワーク (CNN) は、画像を理解するための主力アーキテクチャです。

2分の読書最終更新日

概要

They learn visual patterns by sliding small filters across a picture, which is why they power everything from face unlock to medical scan analysis.

ディープダイブ

CNN は、フィルターまたはカーネルと呼ばれる重みの小さなグリッドをピクセル全体にスライドさせることによって画像を処理します。各フィルターは、エッジ、色のブロブ、コーナーなどの 1 つのパターンをスキャンします。初期の層は単純な特徴を検出します。より深いレイヤーでは、それらを結合して目、ホイール、またはテキストを作成します。すべての位置で同じフィルターが再利用される (重み共有) ため、CNN は完全に接続されたネットワークよりもはるかに少ないパラメーターを必要とし、左上に表示されるか右下に表示されるかに関係なく猫を見つけることができます。プーリング層はステップ間でイメージを縮小し、ネットワークを高速化し、小さなシフトに対する耐性を高めます。 LeNet、AlexNet (2012)、ResNet などの画期的な設計が深層学習ブームを牽引し、AlexNet の ImageNet の勝利がこの分野の現代の火付け役となりました。

技術的な洞察

中核となる演算は畳み込みです。フィルター (たとえば 3x3 の重み) がピクセルのパッチにオーバーレイされ、各重みにそのピクセルが乗算され、結果が合計されて 1 つの出力数値になります。フィルターをスライドすると、特徴マップが生成されます。これを効率的にするには、重み共有 (1 つのフィルターをどこでも再利用) とローカル接続 (各ニューロンが小さな領域のみを参照) という 2 つのアイデアを使用します。畳み込みの積み重ね、ReLU のような非線形性、およびプーリングにより、ネットワークはますます抽象化された視覚的特徴の階層を構築できます。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

畳み込みニューラル ネットワークの将来

CNN は高速でデータ効率が高いため、携帯電話のカメラや自動運転の認識など、リソースが限られたリアルタイムのビジョンにおいて依然として優位性を保っています。ビジョン トランスフォーマーは現在、大規模なデータセットで競合または勝利しているため、この分野は、畳み込みの効率とアテンションのグローバル推論を組み合わせたハイブリッド設計に収束しつつあります。 CNN は、組み込みデバイスやエッジ デバイス、データが不足している医療画像処理分野、さらには大規模なマルチモーダル システムに供給する効率的な特徴抽出器として、今後何年にもわたって存続すると予想されます。

現実世界の実装

X線、CTスキャン、網膜写真による腫瘍、骨折、糖尿病性網膜症の検出

Google 写真などのアプリでの電話のロック解除と写真のタグ付けのための顔認識の強化

自動運転車の認識システムで道路標識、車線区分線、歩行者を読み取る

カメラ検査により工場の組立ラインで欠陥製品に自動的にフラグを立てる

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

畳み込みニューラル ネットワークが役立つ場合と、より単純な方法の方が優れている場合を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Convolutional Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

グラフニューラルネットワーク

よくある質問

What is Convolutional Neural Networks?

畳み込みニューラル ネットワーク (CNN) は、画像を理解するための主力アーキテクチャです。写真上で小さなフィルターをスライドさせることで視覚的なパターンを学習するため、顔のロック解除から医療スキャン分析まであらゆるものを強化します。

CNN のフィルター (カーネル) の主な仕事は何ですか?

フィルターは、画像上をスライドするウェイトの小さなグリッドであり、エッジやテクスチャなど、学習したパターンを見つけるとアクティブになります。

CNN が画像用の完全に接続されたネットワークよりもはるかに少ないパラメーターを必要とするのはなぜですか?

重み共有とは、画像内のあらゆる場所に 1 つの小さなフィルターが適用されることを意味するため、ネットワークはピクセル位置ごとに個別の重みを学習するのではなく、同じ重みを再利用します。

プーリング層は通常何をしますか?

プーリング (最大プーリングなど) は特徴マップをダウンサンプリングして計算を削減し、特徴が現れる正確な場所に対するネットワークの感度を下げます。

ディープ CNN では、一般に初期の層から後の層まで特徴がどのように変化するのでしょうか?

初期の層は、エッジや色などの低レベルの特徴を検出します。より深いレイヤーでは、これらを顔やオブジェクトのパーツなどのより高いレベルの概念に結合します。

ビジョンにおける現代のディープラーニング ブームの火付け役となったと広く認められているイベントはどれですか?

AlexNet が GPU 上のディープ CNN を使用して 2012 年に ImageNet で劇的な勝利を収めたことで、研究者らはディープ ラーニングが古い手法を上回るパフォーマンスを発揮できると確信し、この分野の急速な成長を引き起こしました。