Naponta frissítve2528 ellenőrzött történetek
AI hírek. A zaj nélkül.
Forrás-ellenőrzött mesterséges intelligencia lefedettség a termékbevezetésekről, a politikai változásokról, a biztonsági kutatásokról és az iparági lépésekről, egyszerű angol nyelven egy nonprofit oktatási csapattól.
Ellenőrzött beszerzés
Minden történet a rendelkezésre álló legerősebb bizonyítékokhoz kapcsolódik: eredeti forrásokhoz, ha rendelkezésre állnak, egyébként egyértelműen hozzárendelt jelentésekhez.
Sima angol
Mi történt, miért számít, és mit nézzünk – a szakzsargon nélkül.
Nincs töltőanyag
Ha a jel gyenge, akkor nem teszünk közzé semmit, csak feltöltjük a hírfolyamot.
További történetek
9 történetekInnováció
Az AI-ügynöki képességek teljesítményének értékelése a NVIDIA SkillEvaluator segítségével
A NVIDIA SkillEvaluator háromszintű értékelési folyamaton keresztül méri az igazolt készségek hatását az AI-ügynök teljesítményére.
developer.nvidia.comInnováció
A Paper bemutatja az „árnyékértékeléseket”: az AI-ügynökök megtervezték, de kudarcot vallottak két kutatási kérdésben
Egy 24 szerzős előnyomat során a határ menti AI-ügynökök megpróbálták megválaszolni két, még nem publikált NeurIPS 2026 beadvány központi kutatási kérdését, majd a cikk saját szerzői minősítették az eredményeket. Az ügynökök hat napon keresztül segítség nélkül intézték a tervezést, de a kutatás során egyértelműen elutasították őket.arxiv.orgTermék
A Warp megnyitja a korai hozzáférést a "Factory"-okhoz, egy Config-as-Code rendszerhez a kódoló ügynökök flottáinak futtatásához
A Warp fogadja a korai hozzáférési kérelmeket a Warp Factories számára, amely a kódoló ügynökök flottáját kódként határozza meg – repók, modellek, engedélyek és emberi ellenőrzőpontok egyetlen YAML-fájlban, CLI, API, SDK és MCP által vezérelve. Automatizálási és költségadatai a gyártók állításai: nincs árképzés, általános elérhetőségi dátum vagy független tesztelés.warp.devInnováció
A referenciaérték szerint a legjobb multimodális modellek 10% alatti pontszámot értek el a tollhangokból és a kézmozdulatokból származó szavak olvasásakor
Egy új arXiv dokumentum egy olyan tesztet vezet be, amelyben a modelleknek írott szóra kell következtetniük a tollkarcolás hangjából és a kézmozgásos videóból anélkül, hogy tinta látható volna. A szerzők arról számolnak be, hogy az emberek 80% feletti rendezési pontossággal rendelkeznek, a vezető modellek pedig 10% alattiak – és hogy mindkét modell megadása gyakran rontotta az eredményeket.arxiv.orgInnováció
A papír szerint az ügynök-tudatos gyorsítótár-kezelés akár 45%-kal csökkenti az első token késleltetést a többügynökes kiszolgálásban
Egy új arXiv preprint leírja a CacheScoutot, a nyílt forráskódú vLLM-kiszolgálóra épülő réteget, amely az alapján dönti el, hogy mit tartson meg a modell kulcsérték-gyorsítótárában, az alapján, hogy valószínűleg melyik ügynök fut majd legközelebb. A szerzők kétszámjegyű késleltetésről és áteresztőképesség-növekedésről számolnak be; a munkaterhelések, a modellek és a hardverek nincsenek absztraktban megadva.arxiv.orgInnováció
Egy OpenAI mesterséges intelligencia által generált bizonyíték ellenőrzése fordított állapotot talál, és javítást tesz közzé
Két kutató szerint a OpenAI matematikai dokumentumának 6. fejezetében található lemmabizonyítás polaritáshibát tartalmaz: az átlagos siker tesztje, ahol a következő lépéshez nagy feltételes kudarc szükséges. Ellenpéldát és javított bizonyítást adnak, és arra figyelmeztetnek, hogy ez nem a fejezet főtételének igazolása.arxiv.orgInnováció
A replikációs tanulmány szerint a FLOP-ok még mindig rosszul jósolják meg az AI futási idejét, és a javasolt javítás nem sikerül az újabb hardvereken
Két kutató előnyomata egy korábbi tanulmányt reprodukál arról, hogy az egyenlő FLOP-számok miért nem jelentenek egyenlő végrehajtási időt. Megerősíti a mögöttes állítást, de beszámol arról, hogy az α-FLOPs korrekciós képlet általában alulbecsüli az újabb hardverek futási idejét, ami olyan ugrásokat és ingadozásokat mutat, amelyeket a képlet nem rögzít.arxiv.orgVállalkozás
A benchmark papír négy módszert talált a vállalati adatok lekérdezésére az LLM-ekkel, az összes pontszám 26% alatti
Az új arXiv preprint négy architektúrát állít szembe egymással a vállalati adatbázisok természetes nyelvű lekérdezéséhez egy szintetikus kétnyelvű benchmarkon. Egyik sem válaszolt helyesen az esetek több mint negyedére, és a legmagasabb pontszámot elért terv sem volt a legbiztonságosabb vagy a legolcsóbb.arxiv.orgInnováció
A Paper a címkék nélküli mesterséges intelligencia biztonsági ügynökök osztályozását javasolja a konvergencia mérésével egy erősebb modellhez
Egy új arXiv preprint azt állítja, hogy a biztonsági csapatok úgy tudják megítélni, hogy egy memóriával vagy visszakereséssel felszerelt AI-ügynök tanul-e, ha azt mérik, hogy mennyire zárja le a lemaradást egy erősebb "tanár" modellhez képest, nem pedig a gyakran ritka vagy elavult benchmarkok alapján. Egy hasonló teljesítményű modellből ítélve nem adott használható jelet.arxiv.org
Minden héten egy hasznos eligazítás
Tartsa lépést az AI-val anélkül, hogy a hírfolyamban élne.
Szerezzen be a hét ellenőrzött AI-híreit, eredeti adatokat, hasznos eszközöket, tanulási lehetőségeket és friss mesterségesintelligencia-munkákat.
Érje el az AI-t tanuló embereket
AI-szakembert bérel, vagy hasznos AI-terméket dob piacra? Tedd olyan emberek elé, akik tanulni és cselekedni jöttek ide.
AI állás közzétételeKüldjön be egy AI-eszközt