Aktualizováno denně2303 ověřené příběhy
AI novinky. Bez hluku.
Zdrojově ověřené AI pokrytí uvedení produktů na trh, změn politik, bezpečnostního výzkumu a kroků v odvětví, vysvětleno jednoduchou angličtinou vzdělávacím týmem neziskové organizace.
Ověřené zdroje
Každý článek odkazuje na nejsilnější dostupné důkazy: původní zdroje, pokud jsou k dispozici, jinak jasně připsané zprávy.
Obyčejná angličtina
Co se stalo, proč na tom záleží a na co se dívat – bez žargonu.
Žádná výplň
Když je signál slabý, nezveřejňujeme nic, místo abychom feed doplnili.
Další příběhy
9 příběhyInovace
Dokument ArXiv navrhuje školení založené na milníku pro agenty LLM s dlouhým horizontem
MileGPO využívá zjišťování milníků a místní důkazy ke zlepšení přidělování kreditů při školení agentů jazykových modelů na dlouhých, vícestupňových úkolech. Autoři uvádějí nejnovější výsledky na ALFWorld a WebShop, ale tvrzení zůstávají omezena na experimenty v článku.arxiv.orgInovace
Předtisk testuje, zda agenti LLM vědí, kdy si pamatovat, ověřit nebo zeptat
Nový benchmark vyhodnocuje, zda agenti jazykového modelu správně rozhodují, kdy mají být informace odvozené z interakce uloženy, zkontrolovány, dočasně použity nebo objasněny s uživatelem.arxiv.orgInovace
Audit mezijazykové spravedlnosti ve vodoznaku jazykového modelu
Navrhuje se nový rámec hodnocení pro schémata vodoznaků ve velkých jazykových modelech se zaměřením na mezijazyčnou spravedlnost.arxiv.orgZásady
Stanford AI Index zjišťuje, že politika AI se rozšiřuje, protože suverenita a investice se liší
Index umělé inteligence Stanford HAI pro rok 2026 uvádí, že národní strategie umělé inteligence se šíří, zatímco pravidla pro lokalizaci dat, státem podporovaná výpočetní kapacita a veřejné investice zůstávají mezi regiony nerovnoměrné.hai.stanford.eduInovace
Společně AI benchmark: GLM-5.3 překonává GPT-5.6 Sol na první pokus, vyhrává při opakovaných pokusech za poloviční cenu
Analýza Together AI 904 zavedení DeepSWE uvádí, že GPT-5.6 Sol od OpenAI vede v přesnosti kódování na první pokus, zatímco GLM-5.3 s otevřenou váhou vede, jakmile jsou povoleny opakování, a to zhruba s polovičními náklady na pokus.together.aiInovace
Preprint navrhuje lokálně tokenizovaný model AI pro robustní vodoznaky v časové řadě
Předtisk arXiv navrhuje generativní model AI a metodu vodoznaku pro spolehlivější vícerozměrná data časových řad po úpravách. Autoři uvádějí testy napříč finančními, energetickými a neuroimagingovými benchmarky, ale abstrakt neposkytuje žádné číselné výsledky ani důkazy o nasazení.arxiv.orgInovace
Načítání kódu přirozeného jazyka pro 1C:Enterprise: Otevřený benchmark a účinný Bi-Encoder
Získávání kódu přirozeného jazyka je rychle se vyvíjející úkol v informatice. Ekosystém 1C:Enterprise však kombinuje ruskou syntaxi s terminologií vysoce specifickou pro doménu, pro kterou otevřené datové sady a specializované modely prakticky neexistovaly.arxiv.orgInovace
Načítání časových řad pro uzemnění multimodálních jazykových modelů ve zbývajícím užitečném životě
Velké jazykové modely (LLM) a agentní systémy umělé inteligence jsou stále častěji zkoumány pro úkoly údržby a prognostiky specifické pro doménu, což vyvolává otázku, zda mohou účinně podporovat prognostické a zdravotní řízení (PHM).arxiv.orgInovace
Nepálsko-anglický předtisk: pouze textový multimodální model shodný s umělou inteligencí na srovnávacím testu dezinformací mimo kontext
Nový předtisk arXiv představuje NepOOC, nepálsko-anglický benchmark s 1 090 páry pro odhalování zavádějících titulků připojených k autentickým obrázkům. V tomto souboru dat odpovídal pouze textový model mBERT nejlépe testovanému multimodálnímu systému, zatímco modely pouze s obrázky fungovaly téměř náhodně.arxiv.org
Jeden užitečný brífink každý týden
Držte krok s AI, aniž byste žili jen ve feedu.
Získejte ověřené AI novinky týdne, originální data, užitečné nástroje, tipy na učení a nové AI pracovní příležitosti.
Oslovte lidi, kteří se učí AI
Najmout AI profesionála nebo spustit užitečný AI produkt? Dejte ho lidem, kteří sem přišli učit se a jednat.
Zveřejněte zakázku AIOdevzdat AI nástroj