Naponta frissítve2273 ellenőrzött történetek

AI hírek. A zaj nélkül.

Forrás-ellenőrzött mesterséges intelligencia lefedettség a termékbevezetésekről, a politikai változásokról, a biztonsági kutatásokról és az iparági lépésekről, egyszerű angol nyelven egy nonprofit oktatási csapattól.

Ellenőrzött beszerzés

Minden történet a rendelkezésre álló legerősebb bizonyítékokhoz kapcsolódik: eredeti forrásokhoz, ha rendelkezésre állnak, egyébként egyértelműen hozzárendelt jelentésekhez.

Sima angol

Mi történt, miért számít, és mit nézzünk – a szakzsargon nélkül.

Nincs töltőanyag

Ha a jel gyenge, akkor nem teszünk közzé semmit, csak feltöltjük a hírfolyamot.

9 történetek
  1. InnovációInnováció7 min olvasni

    A referenciaérték szerint a legjobb multimodális modellek 10% alatti pontszámot értek el a tollhangokból és a kézmozdulatokból származó szavak olvasásakor

    Egy új arXiv dokumentum egy olyan tesztet vezet be, amelyben a modelleknek írott szóra kell következtetniük a tollkarcolás hangjából és a kézmozgásos videóból anélkül, hogy tinta látható volna. A szerzők arról számolnak be, hogy az emberek 80% feletti rendezési pontossággal rendelkeznek, a vezető modellek pedig 10% alattiak – és hogy mindkét modell megadása gyakran rontotta az eredményeket.arxiv.org
  2. InnovációInnováció7 min olvasni

    A papír szerint az ügynök-tudatos gyorsítótár-kezelés akár 45%-kal csökkenti az első token késleltetést a többügynökes kiszolgálásban

    Egy új arXiv preprint leírja a CacheScoutot, a nyílt forráskódú vLLM-kiszolgálóra épülő réteget, amely az alapján dönti el, hogy mit tartson meg a modell kulcsérték-gyorsítótárában, az alapján, hogy valószínűleg melyik ügynök fut majd legközelebb. A szerzők kétszámjegyű késleltetésről és áteresztőképesség-növekedésről számolnak be; a munkaterhelések, a modellek és a hardverek nincsenek absztraktban megadva.arxiv.org
  3. InnovációInnováció7 min olvasni

    Egy OpenAI mesterséges intelligencia által generált bizonyíték ellenőrzése fordított állapotot talál, és javítást tesz közzé

    Két kutató szerint a OpenAI matematikai dokumentumának 6. fejezetében található lemmabizonyítás polaritáshibát tartalmaz: az átlagos siker tesztje, ahol a következő lépéshez nagy feltételes kudarc szükséges. Ellenpéldát és javított bizonyítást adnak, és arra figyelmeztetnek, hogy ez nem a fejezet főtételének igazolása.arxiv.org
  4. InnovációInnováció7 min olvasni

    A replikációs tanulmány szerint a FLOP-ok még mindig rosszul jósolják meg az AI futási idejét, és a javasolt javítás nem sikerül az újabb hardvereken

    Két kutató előnyomata egy korábbi tanulmányt reprodukál arról, hogy az egyenlő FLOP-számok miért nem jelentenek egyenlő végrehajtási időt. Megerősíti a mögöttes állítást, de beszámol arról, hogy az α-FLOPs korrekciós képlet általában alulbecsüli az újabb hardverek futási idejét, ami olyan ugrásokat és ingadozásokat mutat, amelyeket a képlet nem rögzít.arxiv.org
  5. VállalkozásVállalkozás6 min olvasni

    A benchmark papír négy módszert talált a vállalati adatok lekérdezésére az LLM-ekkel, az összes pontszám 26% alatti

    Az új arXiv preprint négy architektúrát állít szembe egymással a vállalati adatbázisok természetes nyelvű lekérdezéséhez egy szintetikus kétnyelvű benchmarkon. Egyik sem válaszolt helyesen az esetek több mint negyedére, és a legmagasabb pontszámot elért terv sem volt a legbiztonságosabb vagy a legolcsóbb.arxiv.org
  6. InnovációInnováció7 min olvasni

    A Paper a címkék nélküli mesterséges intelligencia biztonsági ügynökök osztályozását javasolja a konvergencia mérésével egy erősebb modellhez

    Egy új arXiv preprint azt állítja, hogy a biztonsági csapatok úgy tudják megítélni, hogy egy memóriával vagy visszakereséssel felszerelt AI-ügynök tanul-e, ha azt mérik, hogy mennyire zárja le a lemaradást egy erősebb "tanár" modellhez képest, nem pedig a gyakran ritka vagy elavult benchmarkok alapján. Egy hasonló teljesítményű modellből ítélve nem adott használható jelet.arxiv.org
  7. InnovációInnováció7 min olvasni

    Új benchmark tesztek, hogy az AI-asszisztensek emlékezzenek-e egy évre a telefonhasználat során

    Az arXiv-re közzétett, 17 szerzőből álló műszaki jelentés bemutatja a MobileMem-et, amely az eszközön található hosszú távú memória benchmark és keretrendszere, amely a mobil élmények éves gyűjteményéből épül fel. Az absztrakt leírja a tervezést, de nem közöl pontszámokat, és a mögöttes adatokkal kapcsolatos legfontosabb részleteket nem hozták nyilvánosságra.arxiv.org
  8. InnovációInnováció7 min olvasni

    A papír a szakértők keverékéből álló modell késői rétegeit találja, elviseli az erős szakértői maszkolást

    Egy preprint jelentése szerint az alacsony méretű szakértők letiltása egy 35 milliárd paraméterű Mixture of-Experts modell utolsó öt rétegében sokkal több használható kódfordítási kimenetet őriz meg, mintha ugyanazokat a vágásokat minden rétegre szétosztotta volna. Egy modellt és egy benchmarkot fed le, és az absztrakt nem tartalmaz leleplezett alapvonalat.arxiv.org

Minden héten egy hasznos eligazítás

Tartsa lépést az AI-val anélkül, hogy a hírfolyamban élne.

Szerezzen be a hét ellenőrzött AI-híreit, eredeti adatokat, hasznos eszközöket, tanulási lehetőségeket és friss mesterségesintelligencia-munkákat.

Send me
One email a week. Switch any time.

Érje el az AI-t tanuló embereket

AI-szakembert bérel, vagy hasznos AI-terméket dob piacra? Tedd olyan emberek elé, akik tanulni és cselekedni jöttek ide.

AI állás közzétételeKüldjön be egy AI-eszközt