Aktualizováno denně2528 ověřené příběhy
AI novinky. Bez hluku.
Zdrojově ověřené AI pokrytí uvedení produktů na trh, změn politik, bezpečnostního výzkumu a kroků v odvětví, vysvětleno jednoduchou angličtinou vzdělávacím týmem neziskové organizace.
Ověřené zdroje
Každý článek odkazuje na nejsilnější dostupné důkazy: původní zdroje, pokud jsou k dispozici, jinak jasně připsané zprávy.
Obyčejná angličtina
Co se stalo, proč na tom záleží a na co se dívat – bez žargonu.
Žádná výplň
Když je signál slabý, nezveřejňujeme nic, místo abychom feed doplnili.
Další příběhy
9 příběhyInovace
Hodnocení výkonu dovedností AI agenta pomocí nástroje NVIDIA SkillEvaluator
NVIDIA SkillEvaluator měří dopad ověřených dovedností na výkon agentů AI prostřednictvím třístupňového procesu hodnocení.
developer.nvidia.comInovace
Kniha představuje „Hodnocení stínů“: Agenti AI provedli inženýrství, ale selhali ve dvou výzkumných otázkách
Předtisk 24 autorů přiměl agenty hraniční umělé inteligence, aby se pokusili o ústřední výzkumné otázky dvou nepublikovaných příspěvků NeurIPS 2026, a poté nechali vlastní autoři příspěvků ohodnotit výsledky. Agenti pracovali s inženýrstvím bez pomoci po dobu šesti dnů, ale byli jednoznačně odmítnuti ve výzkumu.arxiv.orgProdukt
Warp otevírá včasný přístup k „továrnám“, systému Config-as-Code pro provozování flotil kódovacích agentů
Warp přijímá požadavky na včasný přístup pro Warp Factories, které definují flotily kódovacích agentů jako kód – repozitáře, modely, oprávnění a lidské kontrolní body v jednom souboru YAML, řízeném pomocí CLI, API, SDK a MCP. Údaje o automatizaci a nákladech jsou tvrzením dodavatele: žádné ceny, obecné datum dostupnosti nebo nezávislé testování.warp.devInovace
Benchmark říká, že nejlepší multimodální modely dosahují méně než 10 % při čtení slov ze zvuků pera a pohybu rukou
Nový dokument arXiv zavádí test, ve kterém musí modely odvodit psané slovo ze zvuku poškrábání perem a videa pohybujícího se rukou bez viditelného inkoustu. Autoři uvádějí, že u lidí je přesnost uspořádaných písmen vyšší než 80 % a u vedoucích modelů nižší než 10 % – a že poskytnutí obou modalit modelům často zhoršilo výsledky.arxiv.orgInovace
Papír říká, že správa mezipaměti Agent-Aware snižuje zpoždění prvního tokenu až o 45 % při poskytování více agentů
Nový předtisk arXiv popisuje CacheScout, vrstvu postavenou na open-source serveru vLLM, která rozhoduje o tom, co se má ponechat v mezipaměti klíč–hodnota modelu na základě toho, který agent bude pravděpodobně spuštěn jako další. Autoři uvádějí dvouciferné zvýšení latence a propustnosti; pracovní zatížení, modely a hardware nejsou uvedeny v abstraktu.arxiv.orgInovace
Audit OpenAI AI-generovaného důkazu nalezne obrácený stav a zveřejní opravu
Dva výzkumníci tvrdí, že důkaz lemmatu v kapitole 6 matematického dokumentu OpenAI má chybu polarity: test z hlediska průměrného úspěchu, kde další krok vyžaduje velké podmíněné selhání. Uvádějí protipříklad a opravený důkaz a varují, že se nejedná o ověření hlavní věty kapitoly.arxiv.orgInovace
Replikační studie říká, že FLOPy stále špatně předpovídají běh AI a navrhovaná oprava selhává na novějším hardwaru
Předtisk dvou výzkumníků reprodukuje dřívější studii o tom, proč stejné počty FLOP neznamenají stejnou dobu provedení. Potvrzuje základní tvrzení, ale uvádí, že vzorec korekce α-FLOPs obecně podhodnocuje dobu běhu na novějším hardwaru, který ukazuje skoky a oscilace, které vzorec nezachytí.arxiv.orgPodnik
Referenční příručka nalezla čtyři způsoby, jak dotazovat podniková data pomocí LLM, všechny mají skóre pod 26 %
Nový předtisk arXiv staví proti sobě čtyři architektury pro dotazování podnikových databází v přirozeném jazyce na syntetickém dvojjazyčném benchmarku. Žádný neodpověděl správně na více než čtvrtinu případů a návrh, který dosáhl nejvyššího skóre, nebyl nejbezpečnější ani nejlevnější.arxiv.orgInovace
Dokument navrhuje klasifikaci bezpečnostních agentů AI bez štítků měřením konvergence k silnějšímu modelu
Nový předtisk arXiv tvrdí, že bezpečnostní týmy mohou posoudit, zda se agent umělé inteligence vybavený pamětí nebo vyhledáváním učí tím, že měří, jak dalece zaplňuje mezeru vůči silnějšímu „učitelskému“ modelu, spíše než podle označených benchmarků, které jsou často vzácné nebo zastaralé. Soudě podle podobně poháněného modelu nedal žádný použitelný signál.arxiv.org
Jeden užitečný brífink každý týden
Držte krok s AI, aniž byste žili jen ve feedu.
Získejte ověřené AI novinky týdne, originální data, užitečné nástroje, tipy na učení a nové AI pracovní příležitosti.
Oslovte lidi, kteří se učí AI
Najmout AI profesionála nebo spustit užitečný AI produkt? Dejte ho lidem, kteří sem přišli učit se a jednat.
Zveřejněte zakázku AIOdevzdat AI nástroj