Naponta frissítve1800 ellenőrzött történetek

AI hírek.A zaj nélkül.

Forrás-ellenőrzött mesterséges intelligencia lefedettség a termékbevezetésekről, a politikai változásokról, a biztonsági kutatásokról és az iparági lépésekről, egyszerű angol nyelven egy nonprofit oktatási csapattól.

Ellenőrzött beszerzés

Minden történet a rendelkezésre álló legerősebb bizonyítékokhoz kapcsolódik: eredeti forrásokhoz, ha rendelkezésre állnak, egyébként egyértelműen hozzárendelt jelentésekhez.

Sima angol

Mi történt, miért számít, és mit nézzünk – a szakzsargon nélkül.

Nincs töltőanyag

Ha a jel gyenge, akkor nem teszünk közzé semmit, csak feltöltjük a hírfolyamot.

Hírarchívum

AI hírarchívum — oldal 149

Forrás-ellenőrzött mesterséges intelligencia-történetek, a legfrissebbek azok számára, akiknek meg kell érteniük az AI-t anélkül, hogy felhajtást kergetnének.

Source-page capture accompanying Audit of an OpenAI AI-Generated Proof Finds a Reversed Condition, and Publishes a RepairLegjobb sztori
Innováció7 min olvasni
Innováció7 min olvasni

Egy OpenAI mesterséges intelligencia által generált bizonyíték ellenőrzése fordított állapotot talál, és javítást tesz közzé

Két kutató szerint a OpenAI matematikai dokumentumának 6. fejezetében található lemmabizonyítás polaritáshibát tartalmaz: az átlagos siker tesztje, ahol a következő lépéshez nagy feltételes kudarc szükséges. Ellenpéldát és javított bizonyítást adnak, és arra figyelmeztetnek, hogy ez nem a fejezet főtételének igazolása.

Olvassa el a történetet Ellenőrzött forrás: arxiv.org
9 történetek
  1. Innováció7 min olvasni

    A Paper a címkék nélküli mesterséges intelligencia biztonsági ügynökök osztályozását javasolja a konvergencia mérésével egy erősebb modellhez

    Egy új arXiv preprint azt állítja, hogy a biztonsági csapatok úgy tudják megítélni, hogy egy memóriával vagy visszakereséssel felszerelt AI-ügynök tanul-e, ha azt mérik, hogy mennyire zárja le a lemaradást egy erősebb "tanár" modellhez képest, nem pedig a gyakran ritka vagy elavult benchmarkok alapján. Egy hasonló teljesítményű modellből ítélve nem adott használható jelet.

    arxiv.org
  2. Innováció7 min olvasni

    Új benchmark tesztek, hogy az AI-asszisztensek emlékezzenek-e egy évre a telefonhasználat során

    Az arXiv-re közzétett, 17 szerzőből álló műszaki jelentés bemutatja a MobileMem-et, amely az eszközön található hosszú távú memória benchmark és keretrendszere, amely a mobil élmények éves gyűjteményéből épül fel. Az absztrakt leírja a tervezést, de nem közöl pontszámokat, és a mögöttes adatokkal kapcsolatos legfontosabb részleteket nem hozták nyilvánosságra.

    arxiv.org
  3. Innováció7 min olvasni

    A papír a szakértők keverékéből álló modell késői rétegeit találja, elviseli az erős szakértői maszkolást

    Egy preprint jelentése szerint az alacsony méretű szakértők letiltása egy 35 milliárd paraméterű Mixture of-Experts modell utolsó öt rétegében sokkal több használható kódfordítási kimenetet őriz meg, mintha ugyanazokat a vágásokat minden rétegre szétosztotta volna. Egy modellt és egy benchmarkot fed le, és az absztrakt nem tartalmaz leleplezett alapvonalat.

    arxiv.org
  4. Biztonság7 min olvasni

    A CoreBreak hibák lehetővé teszik, hogy az ügynöki eszközök a modell meghívása nélkül működjenek

    A Cloud Security Alliance kutatási feljegyzése leírja a CoreBreak-et, az Amazon Bedrock AgentCore, az Google Agent Development Kit és a Vercel AI SDK kábelköteg-csomagjainak hibáit, amelyek lehetővé tették az eszközök futtatását modellváltás nélkül, így a modellszintű védőkorlátokat nem kell ellenőrizni.

    labs.cloudsecurityalliance.org
  5. Ipar6 min olvasni

    A Cursor azt mondja, hogy a SpaceX felvásárlása hivatalosan lezárult

    A Cursor egy rövid bejegyzést tett közzé, amely szerint a SpaceX befejezte az AI kódolóeszköz beszerzését, és befejezte azt a folyamatot, amely állítása szerint áprilisban kezdődött a SpaceXAI modell-képzési partnerségével. A poszt hozzáférést ígér a világ legnagyobb GPU-flottájához, de nem fed fel feltételeket, határidőket vagy termékváltozásokat.

    cursor.com
  6. Innováció7 min olvasni

    Az új benchmark szerint az AI-ügynökök az esetek 28%-ában helytelenül blokkolják a jóváhagyott munkát

    Az előnyomtatás bemutatja a SteerBench-Work-ot, egy 106 forgatókönyvből álló tesztet abban a pillanatban, amikor egy AI-ügynök úgy dönt, hogy cselekszik, vagy szünetet tart az ellenőrzéshez. 30 modellállapotban a szerzők arról számoltak be, hogy a törölt munka helytelen megtartása nagyjából 28-szor gyakoribb volt, mint a nem biztonságos munka helytelen engedélyezése.

    arxiv.org

Minden héten egy hasznos eligazítás

Tartsa lépést az AI-val anélkül, hogy a hírfolyamban élne.

Szerezzen be a hét ellenőrzött AI-híreit, eredeti adatokat, hasznos eszközöket, tanulási lehetőségeket és friss mesterségesintelligencia-munkákat.

Send me
One email a week. Switch any time.

Érje el az AI-t tanuló embereket

AI-szakembert bérel, vagy hasznos AI-terméket dob piacra? Tedd olyan emberek elé, akik tanulni és cselekedni jöttek ide.

AI állás közzététele Küldjön be egy AI-eszközt