Görsel Yapay Zeka KILAVUZU

Eylem Tanıma

Eylem tanıma, bilgisayarlara, yalnızca tek bir karede görünenleri değil, insanların veya nesnelerin videoda ne *yaptıklarını* (koşma, el sallama, düşme, kapı açma) tanımlamayı öğretme görevidir.

2 min readSon güncelleme

Genel Bakış

It matters because understanding motion over time unlocks applications from sports analytics to elderly fall detection.

Derin Dalış

Eylem tanıma, piksellerin zaman içinde nasıl değiştiğine ilişkin akıl yürütme yoluyla statik görüntü sınıflandırmasının ötesine geçer. Tek bir kare bir kişiyi havada gösterebilir; yalnızca dizi onların atlayıp atlamadıklarını, düşmelerini veya dalmalarını ortaya koyuyor. İlk sistemler, optik akış ve yoğun yörüngeler gibi el yapımı hareket özellikleriydi. Modern yaklaşımlar derin ağları kullanır: iki akışlı mimariler görünümü (RGB çerçeveleri) ve hareketi (optik akış) ayrı ayrı işler; 3B evrişimli ağlar (C3D ve I3D gibi) filtreleri uzay *ve* zaman boyunca kaydırır; ve video dönüştürücüler (TimeSformer, VideoMAE) dikkati uzay-zamansal yamalara uygular. Standart kriterler arasında Kinetics (YouTube'dan 700 insan eylemi sınıfı), UCF101 ve modelleri yalnızca sahne bağlamından ziyade zamansal yönü anlamaya zorlayan Something-Something yer alıyor.

Teknik Bilgi

Temel zorluk zamansal boyutu modellemektir. 3B evrişim, normal bir 2B filtreyi birkaç kareyi kapsayan bir derinlik ekseniyle genişletir, böylece hareket modellerini doğrudan öğrenir. I3D hilesi, ImageNet üzerinde önceden eğitilmiş bir 2D görüntü ağındaki ağırlıkları zaman içinde kopyalayarak 3D'ye 'şişirir' ve güçlü bir başlangıç ​​noktası sağlar. Bunun yerine iki akışlı yöntemler, önceden hesaplanmış optik akışı ayrı bir dalda besleyerek hareketi açıkça kodlar ve ardından onu görünüm özellikleriyle birleştirir.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Aksiyon Tanımasının Geleceği

Alan, etiketlenmemiş görüntülerden öğrenen verimli video transformatörlerine ve kendi kendini denetleyen ön eğitime (maskeli video modelleme) doğru kayıyor ve pahalı ek açıklamalara olan bağımlılığı azaltıyor. Sistemlerin yalnızca eylemleri etiketlemekle kalmayıp aynı zamanda bunları doğal dilde tanımlayıp gerekçelendirebilmesi için çok modlu dil modelleriyle daha sıkı entegrasyon bekleyebilirsiniz. Giyilebilir cihazlar, robotikler ve akıllı kameralar için gerçek zamanlı cihaz içi tanıma, ince, neredeyse aynı hareketleri ayırt eden ince taneli tanımanın yanı sıra önemli bir sınırdır.

Gerçek Dünya Uygulaması

Yaşlı bakım evlerinde, bir sakinin yere yığılması durumunda personeli uyaran ve düşmeyi oturmaktan veya yatmaktan ayırt eden düşme algılama sistemleri

Antrenörlük ve yayının önemli anları için maç görüntülerindeki servisleri, müdahaleleri ve şutları otomatik olarak etiketleyen spor analitiği platformları

Kavga etmek, başıboş dolaşmak veya birisinin çitlere tırmanması gibi anormal davranışları işaretleyen gözetim ve güvenlik izlemesi

Tekrarları sayan ve zaman içindeki vücut hareketlerini tanıyarak egzersiz formunu kontrol eden, hareketle kontrol edilen arayüzler ve fitness uygulamaları

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Action Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Sık sorulan sorular

What is Action Recognition?

Eylem tanıma, bilgisayarlara, yalnızca tek bir karede görünenleri değil, insanların veya nesnelerin videoda ne *yaptıklarını* (koşma, el sallama, düşme, kapı açma) tanımlamayı öğretme görevidir. Bu önemlidir çünkü zaman içindeki hareketi anlamak, spor analitiğinden yaşlıların düşme tespitine kadar birçok uygulamanın kilidini açar.

Eylem tanımayı sıradan görüntü sınıflandırmasından temel olarak ayıran nedir?

Tek bir hareketsiz görüntü çoğu zaman birinin atladığını, düştüğünü veya daldığını ortaya çıkaramadığından, hareket tanıma bir dizi kare üzerindeki hareketi modeller.

Klasik bir iki akışlı eylem tanıma ağında, ikinci akış tipik olarak neyi işler?

İki akışlı mimariler görünüm için bir dal (RGB çerçeveleri) ve çerçeveler arasındaki hareketi açıkça kodlayan optik akış için ikinci bir dal kullanır.

3B evrişim, standart 2B evrişime kıyasla ne katar?

3B evrişim, filtreyi derinlik/zaman boyutuyla genişleterek, ardışık kareler boyunca hareket modellerini doğrudan öğrenmesine olanak tanır.

I3D modelinin kullandığı 'enflasyon' numarası nedir?

I3D, 2D görüntüler (ImageNet gibi) üzerinde önceden eğitilmiş ağırlıkları, bunları zamansal eksen boyunca kopyalayarak 3D'ye 'şişirir' ve güçlü bir başlatma sağlar.

Neden Bir Şey-Bir Şey veri kümesi eylem tanıma açısından dikkate değerdir?

Bir Şey-Bir Şey, eylemin zamansal düzene ve harekete bağlı olacağı şekilde tasarlanmıştır ve modellerin yalnızca arka plan veya nesne görünümünü kullanarak hile yapmasını engeller.