Alapok ÚTMUTATÓ

Hármas veszteség és metrikus tanulás

A hármas veszteség arra tanítja a neurális hálózatot, hogy hasonló elemeket közel egymáshoz, a különböző elemeket pedig egymástól távol helyezze el egy beágyazási térben.

2 perc olvasásUtoljára frissítve

Áttekintés

It is the foundation behind face recognition, image search, and recommendation systems that need to compare things rather than just classify them.

Mély merülés

A metrikus tanulás modellt képez beágyazások, vektorok létrehozására, ahol a távolság a hasonlóságot tükrözi. A hármas veszteség ezt három bemenet használatával teszi meg egyszerre: egy horgony, egy pozitív (ugyanaz az osztály, mint a horgony), és egy negatív (más osztály). Az objektív legalább egy fix különbséggel közelebb tolja a horgonyt a pozitívhoz, mint a negatívhoz. Formálisan a veszteség max(0, d(a,p) - d(a,n) + margó), ahol d általában euklideszi távolság. A Google 2015-ös FaceNetje népszerűsítette ezt a megközelítést, és közvetlenül megtanulta a 128 dimenziós arcbeágyazást. A betanítás után bármely két elemet összehasonlítja a távolság számítása alapján, nincs szükség átképzésre az új identitásokhoz. Ez a nyílt halmazú képesség az oka annak, hogy a metrikus tanulási képességek ellenőrzési és visszakeresési feladatok osztályozása nem könnyen kezelhető.

Technikai betekintés

Az árrés az, amitől a triplett veszteség működik. Enélkül a modell triviálisan összecsukhatná az összes beágyazást egyetlen pontra, így minden távolság nulla lenne, a sorrend pedig értelmetlenné válna. Az árrés puffert kényszerít: a negatívnak legalább egy árrésszel távolabbnak kell lennie a pozitívnál, mielőtt a veszteség eléri a nullát. A beágyazások általában L2-normalizáltak egy egységhipergömbre, így a távolságok korlátozottak és összehasonlíthatók maradnak. Az árrés (gyakran 0,2 körüli) megválasztása kiegyenlíti, hogy az osztályok milyen szorosan csoportosulnak a köztük lévő szétválás ellen.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

A hármasvesztés és a metrikus tanulás jövője

A tiszta triplett veszteséget egyre inkább felváltják a kötegszintű objektívek, mint például a többszörös hasonlóság, a proxy-horgony és a kontrasztos veszteségek (InfoNCE), amelyek lépésenként sok párt hasonlítanak össze, és gyorsabban konvergálnak. Az önfelügyelt módszerek, például a SimCLR azt mutatják, hogy a metrikus tanulás címkék nélkül is működhet, ha a kibővített nézeteket pozitívumként kezelik. Ahogy a vektoros adatbázisok és a visszakereséssel kiegészített generációs hullámzás, a tanult beágyazások támasztják alá a milliárdelemes méretű szemantikai keresést, így a távolság-hasonlóság alapgondolata egyre központibbá válik, még akkor is, amikor a specifikus hármas megfogalmazás elhalványul.

Valós megvalósítás

FaceNet-stílusú arcellenőrzés: a telefonok és az útlevélkapuk megerősítik a személyazonosságot azáltal, hogy ellenőrzik, hogy két arcbeágyazás a távolsági küszöbön belülre esik-e.

Vizuális termékkeresés: az e-kereskedelmi webhelyek lehetővé teszik a vásárlók számára, hogy fényképeket töltsenek fel, és a legközelebbi szomszéd beágyazása révén vizuálisan hasonló termékeket keressenek le.

Hangszóró ellenőrzése: a hangasszisztensek beágyaznak egy hangmintát, és összehasonlítják azt egy regisztrált profillal, hogy megbizonyosodjanak arról, hogy ki beszél.

Aláírás- és kézírás-ellenőrzés: a bankok hivatkozásokat ágyaznak be, aláírásokat kérdeznek le, valamint zászlóhamisításokat, ha a távolság meghaladja a betanult határt.

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, hol segít a hármas veszteség és a metrikus tanulás, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Triplet Loss and Metric Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Sziámi hálózatok és hármasok elvesztése

Gyakran ismételt kérdések

What is Triplet Loss and Metric Learning?

A hármas veszteség arra tanítja a neurális hálózatot, hogy hasonló elemeket közel egymáshoz, a különböző elemeket pedig egymástól távol helyezze el egy beágyazási térben. Ez az alapja az arcfelismerési, képkereső és ajánlási rendszereknek, amelyeknek össze kell hasonlítaniuk a dolgokat, nem pedig csak osztályozniuk.

Milyen három bemenet alkotja a hármast tripletveszteségben?

A triplett egy horgonyból, egy pozitívból, amely osztozik a horgony osztályán, és egy másik osztályból származó negatívból áll.

Miért tartalmaz a hármas veszteség egy margin kifejezést?

Maradék nélkül a modell mindent ugyanarra a pontra tudna leképezni, így minden távolságot nullává tesz, és triviálisan kielégíti a veszteséget. A margó valódi elválasztást kényszerít ki.

Melyik híres 2015-ös rendszer népszerűsítette a triplett elvesztését az arcfelismeréshez?

A Google FaceNetje triplet-vesztést használt a kompakt arcbeágyazás megtanulására, és mércét állított fel az arc-ellenőrzésben.

Mit ad a betanított metrikus tanulási modell az egyes bemenetekhez?

A modell a bemeneteket beágyazási vektorokra képezi le; majd összehasonlítja az elemeket a beágyazottságuk közötti távolság mérésével.

Miért alkalmas a metrikus tanulás olyan nyitott problémákra, mint például új arcok hozzáadása?

Mivel a felismerés a beágyazási távolságon alapul, új identitást egyszerűen a beágyazás tárolásával regisztrálhat, nincs szükség modell-újraképzésre.