Mi történt
A London Insider jelentése szerint a NetDocuments elindította a Legal Context Engineering -ot, megelőzve az ILTACON-t. A benchmark célja annak mérése, hogy a jogi mesterséges intelligencia rendszerek mekkora értéket nyernek a rendelkezésükre álló kontextusból, ahelyett, hogy egyedül az alapul szolgáló modellt értékelnék. A jelentés szerint a NetDocuments vezérigazgatója, Josh Baxter úgy jellemezte az iparágat, mint ami a korlátok nélküli kiadások és a stratégia nélküli csökkentés között ingadozik. A bevezetést és az összes jelentett módszertani részletet itt nem erősítették meg függetlenül.
A London Insider jelentése szerint a NetDocuments az ILTACON jogi-technológiai konferencia előtt elindította a Legal Context Engineering -ot. A jelentés a referenciaértéket olyan strukturált módszerként mutatja be, amellyel az ügyvédi irodák értékelhetik, hogy mesterséges intelligencia-rendszereik mit eredményeznek az elköltött pénzért. Azt mondja, hogy a benchmark három változón alapul, amelyek meghatározzák a legális AI-ügynök teljesítményét: a modellen, a modell köré épített kábelkötegen és a kontextuson, amelyhez a rendszer munka közben hozzáférhet. A forrás egy másodlagos jelentés, nem pedig egy belső bejelentés, és az indulást itt nem erősítették meg függetlenül.
A London Insider szerint a állandóan tartja a modellt és a bekötést, és változtatja a rendelkezésre álló kontextust. 300 azonos kérdést fut fel 10 valódi jogi ügyben, két különböző alkalommal. Az első futtatásban a rendszer szabványos keresést és visszakeresést használ. A másodikban a jogi kontextus grafikonja engedélyezve van. Az összehasonlítás célja, hogy elkülönítse a további kontextus hozzájárulását azáltal, hogy a többi fő változót változatlanul hagyja. A jelentés nem azonosítja az alkalmazott modellt, nem írja le a jogi kérdéseket, nem fedi fel a kérdéseket, nem határozza meg a pontozási kritériumokat, és egyik futam eredményeit sem jelenti.
A cikk a referenciaértéket a jogi mesterséges intelligencia közgazdaságtanával kapcsolatos bizonytalanságra adott válaszként fogalmazza meg. Azt állítja, hogy a cégek könnyebben tolerálják ezt a bizonytalanságot, miközben a mesterséges intelligenciát átalánydíjas ülésengedélyeken keresztül értékesítik, de a fogyasztási árak miatt minden egyes kérdés külön díjat számíthat fel. Ezt a jövőbeli árváltozást a forrás közeledő aggályként mutatja be, nem pedig megerősített iparági változásként. A jelentés nem közöl aktuális lekérdezésenkénti árakat, számlákra vonatkozó példákat, átvételi adatokat, vagy bizonyítékot arra vonatkozóan, hogy a NetDocuments ügyfelei már felhasználták a referenciaértéket a vásárlási döntéseik megváltoztatására.
A London Insider arról is beszámol, hogy Josh Baxter, a NetDocuments vezérigazgatója arra figyelmeztetett, hogy a szektor az ellenőrizetlen költekezés és a stratégia nélküli megszorítások között mozog. A cikk szerint a vállalat a benchmarkot úgy pozicionálja, hogy pénzügyi fegyelmet teremtsen a jogi mesterséges intelligencia elfogadása terén, és segítsen a cégeknek megérteni a helyes válasz megszerzésének költségeit. Ez a leírás tükrözi a vállalatnak az üzlet által közölt célját; nem független bizonyíték arra vonatkozóan, hogy a megbízhatóan méri a helyességet vagy a költségeket.
Forrás részletei: londoninsider.co.uk ↗
Miért számít
A az ügyvédi irodák gyakorlati problémáját oldja meg: az AI által generált válaszok költségének és hasznosságának megértése, mivel a vállalati árazás az átalánydíjas helyekről a fogyasztás alapú számlázás felé tolódik el. Tervezése segíthet elkülöníteni a modell hozzájárulását, a körülötte lévő szoftvert, valamint a rendszer számára elérhető jogi információkat. A jelentés azonban nem tartalmaz benchmark eredményeket, árakat, pontossági méréseket vagy a módszer független értékelését.
A bejelentett bevezetés központi jelentősége abban rejlik, hogy a jogi mesterséges intelligencia mérési és költségvetési problémaként kezeli, nem csak képességversenyként. A lenyűgöző válaszokat produkáló rendszert még mindig nehéz megindokolni a cég számára, ha a szervezet nem tudja a teljesítményt összekapcsolni a kontextus, a visszakeresés és a számítások mennyiségével. Egy , amely elkülöníti ezeket a hozzájárulásokat, világosabb alapot adhat a technológiai és pénzügyi csapatoknak a rendszerkonfigurációk összehasonlításához. A forrás azonban nem mutatja, hogy a referenciaérték a gyakorlatban elérte volna ezt a célt.
A bemutatott tervnek van egy hasznos kísérleti funkciója: két fő elemet rögzít, miközben megváltoztatja a rendszer számára elérhető kontextust. Ha azonos kérdéseket teszünk fel ugyanabban a jogi kérdésben, akkor az összehasonlítás értelmezhetőbbé válik, mint egy mesterséges intelligencia-eszköz általános bemutatása. Ha szigorúan hajtják végre és dokumentálják, egy ilyen teszt segíthet a cégeknek feltenni a kérdést, hogy a belső jogi információkhoz való jobb hozzáférés elegendő javulást eredményez-e ahhoz, hogy igazolja annak technikai és pénzügyi költségeit. Számszerű javulásról, hibaarányról vagy költségcsökkentésről nem számoltak be, így a haszon gyakorlati mérete ismeretlen marad.
A benchmarknak is vannak fontos korlátai. Mivel a jelentett összehasonlítás megváltoztatja a kontextust, miközben állandóan tartja a modellt és a kábelköteget, önmagában nem hasonlítja össze a versengő modelleket, visszakereső rendszereket vagy ügynökterveket. Előfordulhat, hogy tíz jogi ügy nem képviseli a dokumentumok, joghatóságok, gyakorlati területek vagy kockázati szintek körét, amelyekkel egy nagy cég találkozik. A forrás nem magyarázza meg, hogyan választották ki a kérdéseket, hogyan ítélték meg a válaszokat, hogy elvakították-e az értékelőket, vagy hogy ugyanazok az eredmények érvényesek-e a NetDocuments környezetén kívül is.
Az ügyfelek és a nyilvánosság számára nem egyszerűen az a lényeges kérdés, hogy egy legális AI-rendszer válaszonként olcsóbb-e. A jogi munka magában foglalhat bizalmas információkat, speciális jogokat és olyan következményeket, amelyeket egyetlen pont sem rögzít. A tájékoztathatja a beszerzést és a felügyeletet, de a jelentés nem ad bizonyítékot arra, hogy jogi pontosságot biztosít, védi a titoktartást vagy helyettesíti a szakmai felülvizsgálatot. Ezek az ismeretlenek számítanak, mielőtt a cégek bármilyen jelentett eredményt felhasználnának a szélesebb körű alkalmazás igazolására.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Mit nézzünk ezután
A következő kulcskérdések az, hogy a NetDocuments közzéteszi-e a eredményeket és a teljes módszertant, hogy külső cégek vagy kutatók képesek-e reprodukálni az összehasonlítást, és hogy a jogi kontextus grafikonja hogyan befolyásolja a válaszok minőségét és költségeit a gyakorlatban. Nézze meg a fogyasztási árakkal, a tesztelt modellekkel és visszakereső rendszerekkel, a jogi ügyekkel kapcsolatos konkrét információkat is, valamint azt, hogy a cégek hogyan kezelik a mesterséges intelligencia válaszainak emberi felülvizsgálatát.
Az első dolog, amit meg kell figyelni, hogy a NetDocuments tényleges megállapításokat tesz-e közzé, nem csak a teszttervet. A jelentés leírja a 300 kérdésből álló összehasonlítást, de nem ad pontszámokat, pontossági arányokat, hibakategóriákat, késleltetési méréseket vagy költségszámításokat. Az eredményeknek egyértelművé kell tenniük, hogy mekkora különbséget produkált a jogi kontextus grafikonja, milyen gyakran javultak vagy romlottak a válaszok, és hogy a változás elég nagy volt-e ahhoz, hogy pénzügyileg számítson.
A következő kérdés a reprodukálhatóság. A hasznos nyomon követési jelentéshez szükség lenne a tesztelt modellek és hevederek nevére vagy jellemzőire, a 10 jogi kérdés kiválasztásának szabályaira, az értékelési rubrikára, valamint a megválaszolatlan vagy részben helyes válaszok kezelésére. Az is számítana, hogy ügyvédi irodák, független kutatók vagy versengő beszállítók meg tudják-e ismételni az összehasonlítást. E részletek nélkül az olvasók nem tudják eldönteni, hogy a egy általános értékelési eszköz, vagy főként egy vállalat termékkonfigurációjának tesztje.
Az ár egy másik fontos ismeretlen lesz. A London Insider szerint a fogyasztási árazás jön, de nem ad idővonalat, szállítói kötelezettségvállalásokat vagy lekérdezésenkénti adatokat. Nézze meg a bizonyítékokat arra vonatkozóan, hogy a cégeknek miként számítanak fel díjat a visszakeresésért, a kontextusbővítésért, a modellhívásokért és az AI-munkafolyamat egyéb részeiért. A hiteles költségelemzésnek meg kell különböztetnie a válasz elkészítésének árát az ellenőrzés, a javítás és a mögöttes jogi információk karbantartásának költségeitől.
Végül nézze meg, hogyan használják a cégek a referenciamutatót az irányításban. A forrás szerint az ügyfelek sürgetik az ügyvédi irodákat, hogy demonstrálják a felelős technológiai költekezést, de nem közöl példát arra, hogy a cégek elfogadták volna a tesztet vagy megváltoztatták volna a politikát emiatt. A nyomon követési bizonyítékoknak ki kell terjedniük az emberi felülvizsgálatra, a titoktartási ellenőrzésekre, az ellenőrzési nyomvonalra, valamint arra, hogy a jobb kontextus következetesen javítja-e a válaszokat a különböző jogi feladatok során. Amíg ezekre a kérdésekre nem kap választ, a bevezetés egy potenciálisan hasznos értékelési javaslat, nem pedig annak bizonyítéka, hogy a jogi mesterséges intelligencia kiszámíthatóvá vagy gazdaságilag átláthatóvá vált.