Actualizat zilnic2272 povești verificate
Știri AI. Fără zgomot.
Acoperirea AI verificată la sursă a lansărilor de produse, schimbărilor de politică, cercetării în materie de siguranță și mișcărilor din industrie, explicată în limba engleză simplă de o echipă de educație nonprofit.
Sursă verificată
Fiecare poveste se leagă de cele mai puternice dovezi disponibile: surse originale atunci când sunt disponibile, altfel raportate atribuite în mod clar.
Engleză simplă
Ce s-a întâmplat, de ce contează și ce să urmărești - fără jargon.
Fără umplutură
Când semnalul este subțire, nu publicăm nimic în loc să umplem feedul.
Mai multe povești
9 povestiriInovație
Hârtia spune că gestionarea cache-ului în funcție de agent reduce întârzierea primului jeton cu până la 45% în servirea cu mai mulți agenți
O nouă imprimare preliminară arXiv descrie CacheScout, un strat construit pe serverul open-source vLLM care decide ce să păstreze în memoria cache-cheie-valoare a unui model, în funcție de agentul care este probabil să ruleze următorul. Autorii raportează latență de două cifre și câștiguri de debit; sarcinile de lucru, modelele și hardware-ul nu sunt menționate în abstract.arxiv.orgInovație
Auditul unei dovezi generate de AI OpenAI găsește o stare inversată și publică o reparație
Doi cercetători spun că o demonstrație a lemei din capitolul 6 din documentul de matematică al lui OpenAI are o eroare de polaritate: un test în ceea ce privește succesul mediu în care următorul pas necesită un eșec condiționat mare. Ei oferă un contraexemplu și o demonstrație corectată și avertizează că aceasta nu este verificarea teoremei principale a capitolului.arxiv.orgInovație
Studiul de replicare spune că FLOP-urile încă prezic greșit timpul de rulare al AI, iar remedierea propusă eșuează pe hardware-ul mai nou
O preprint a doi cercetători reproduce un studiu anterior despre motivul pentru care un număr egal de FLOP nu înseamnă un timp egal de execuție. Acesta confirmă afirmația de bază, dar raportează că formula de corecție a α-FLOPs subestimează în general timpul de rulare pe hardware-ul mai nou, ceea ce arată salturi și oscilații pe care formula nu le captează.arxiv.orgÎntreprindere
Documentul de referință găsește patru modalități de a interoga datele întreprinderii cu LLM-urile au un scor sub 26%
O nouă tipărire arXiv pune patru arhitecturi pentru interogarea în limbaj natural a bazelor de date de întreprindere una față de cealaltă pe un benchmark bilingv sintetic. Niciunul nu a răspuns corect la mai mult de un sfert din cazuri, iar designul care a obținut cel mai mare punctaj nu a fost cel mai sigur sau cel mai ieftin.arxiv.orgInovație
Lucrarea propune clasificarea agenților de securitate AI fără etichete prin măsurarea convergenței către un model mai puternic
O nouă pretipărire arXiv susține că echipele de securitate pot judeca dacă un agent AI echipat cu memorie sau recuperare învață, măsurând cât de mult reduce decalajul față de un model de „profesor” mai puternic, mai degrabă decât pe criterii de referință etichetate care sunt adesea rare sau învechite. Judecând după un model cu putere similară nu a dat niciun semnal utilizabil.arxiv.orgInovație
Noi teste de referință dacă asistenții AI își pot aminti un an de utilizare a telefonului
Un raport tehnic de 17 autori, postat pe arXiv, prezintă MobileMem, un etalon și un cadru pentru memoria pe termen lung pe dispozitiv, construit dintr-o colecție de experiențe mobile la scară anuală. Rezumatul descrie designul, dar nu raportează scoruri, iar detaliile cheie despre datele de bază rămân nedezvăluite.arxiv.orgInovație
Hârtia raportează o organizație modulară asemănătoare creierului care emerge în cadrul modelelor lingvistice mari
O nouă versiune preliminară arXiv spune că modelele mari de limbaj dezvoltă o structură internă specializată funcțional, care se aliniază cu rețele distincte ale creierului uman, bazate pe analize de circuite în 46 de sarcini în patru domenii cognitive. Pagina de rezumate lasă detalii metodologice cheie nedeclarate.arxiv.orgInovație
Paper Finds Late Layers of a Mixture-of-Experts Model Tolerate Heavy Expert Masking
A preprint reports that disabling low-magnitude experts in the last five layers of a 35-billion-parameter Mixture-of-Experts model preserved far more usable code-translation outputs than spreading the same cuts across all layers. It covers one model and one benchmark, and the abstract reports no unmasked baseline.arxiv.orgSecuritate
CoreBreak Flaws Let Agent Tools Run Without the Model Ever Being Called
A Cloud Security Alliance research note describes CoreBreak, a pattern of flaws in Amazon Bedrock AgentCore, Google's Agent Development Kit, and Vercel's AI SDK harness packages that allowed tools to execute without a model turn — leaving model-level guardrails with nothing to inspect.labs.cloudsecurityalliance.org
Un briefing util în fiecare săptămână
Ține pasul cu AI fără a trăi în feed.
Obțineți știrile verificate de AI din săptămână, date originale, instrumente utile, alegeri de învățare și noi locuri de muncă AI.
Ajungeți la oamenii care învață AI
Angajați un profesionist AI sau lansați un produs AI util? Pune-o în fața oamenilor care au venit aici să învețe și să acționeze.
Postați un job AITrimiteți un instrument AI