Actualizat zilnic2528 povești verificate
Știri AI. Fără zgomot.
Acoperirea AI verificată la sursă a lansărilor de produse, schimbărilor de politică, cercetării în materie de siguranță și mișcărilor din industrie, explicată în limba engleză simplă de o echipă de educație nonprofit.
Sursă verificată
Fiecare poveste se leagă de cele mai puternice dovezi disponibile: surse originale atunci când sunt disponibile, altfel raportate atribuite în mod clar.
Engleză simplă
Ce s-a întâmplat, de ce contează și ce să urmărești - fără jargon.
Fără umplutură
Când semnalul este subțire, nu publicăm nimic în loc să umplem feedul.
Mai multe povești
9 povestiriInovație
Evaluarea performanței abilităților agentului AI cu NVIDIA SkillEvaluator
NVIDIA SkillEvaluator măsoară impactul competențelor verificate asupra performanței agenților AI printr-un proces de evaluare pe trei niveluri.
developer.nvidia.comInovație
Lucrarea prezintă „evaluări în umbră”: agenții AI au făcut ingineria, dar au eșuat două întrebări de cercetare
Un preprint de 24 de autori i-a cerut agenților AI de frontieră să încerce întrebările centrale de cercetare a două trimiteri nepublicate NeurIPS 2026, apoi i-a pus pe autorii lucrărilor să noteze rezultatele. Agenții s-au ocupat de inginerie fără ajutor timp de șase zile, dar au fost respinși fără ambiguitate din cercetare.arxiv.orgProdus
Warp deschide accesul timpuriu la „Factories”, un sistem de configurare ca cod pentru rularea flotelor de agenți de codare
Warp acceptă solicitări de acces anticipat pentru Warp Factories, care definește flotele de agenți de codare ca cod - repoziții, modele, permisiuni și puncte de control umane într-un fișier YAML, condus de CLI, API, SDK și MCP. Cifrele sale de automatizare și costuri sunt revendicări ale furnizorilor: fără preț, dată de disponibilitate generală sau testare independentă.warp.devInovație
Benchmark-ul spune că cele mai bune modele multimodale au un scor sub 10% la citirea cuvintelor din sunete ale stiloului și mișcarea mâinii
O nouă hârtie arXiv introduce un test în care modelele trebuie să deducă un cuvânt scris din sunetul cu zgârierea stiloului și din video cu mișcarea mâinii, fără cerneală vizibilă. Autorii raportează că oamenii au o acuratețe de peste 80% a scrisorilor comandate și modelele conducătoare sub 10% - și că oferirea modelelor ambelor modalități a înrăutățit adesea rezultatele.arxiv.orgInovație
Hârtia spune că gestionarea cache-ului în funcție de agent reduce întârzierea primului jeton cu până la 45% în servirea cu mai mulți agenți
O nouă imprimare preliminară arXiv descrie CacheScout, un strat construit pe serverul open-source vLLM care decide ce să păstreze în memoria cache-cheie-valoare a unui model, în funcție de agentul care este probabil să ruleze următorul. Autorii raportează latență de două cifre și câștiguri de debit; sarcinile de lucru, modelele și hardware-ul nu sunt menționate în abstract.arxiv.orgInovație
Auditul unei dovezi generate de AI OpenAI găsește o stare inversată și publică o reparație
Doi cercetători spun că o demonstrație a lemei din capitolul 6 din documentul de matematică al lui OpenAI are o eroare de polaritate: un test în ceea ce privește succesul mediu în care următorul pas necesită un eșec condiționat mare. Ei oferă un contraexemplu și o demonstrație corectată și avertizează că aceasta nu este verificarea teoremei principale a capitolului.arxiv.orgInovație
Studiul de replicare spune că FLOP-urile încă prezic greșit timpul de rulare al AI, iar remedierea propusă eșuează pe hardware-ul mai nou
O preprint a doi cercetători reproduce un studiu anterior despre motivul pentru care un număr egal de FLOP nu înseamnă un timp egal de execuție. Acesta confirmă afirmația de bază, dar raportează că formula de corecție a α-FLOPs subestimează în general timpul de rulare pe hardware-ul mai nou, ceea ce arată salturi și oscilații pe care formula nu le captează.arxiv.orgÎntreprindere
Documentul de referință găsește patru modalități de a interoga datele întreprinderii cu LLM-urile au un scor sub 26%
O nouă tipărire arXiv pune patru arhitecturi pentru interogarea în limbaj natural a bazelor de date de întreprindere una față de cealaltă pe un benchmark bilingv sintetic. Niciunul nu a răspuns corect la mai mult de un sfert din cazuri, iar designul care a obținut cel mai mare punctaj nu a fost cel mai sigur sau cel mai ieftin.arxiv.orgInovație
Lucrarea propune clasificarea agenților de securitate AI fără etichete prin măsurarea convergenței către un model mai puternic
O nouă pretipărire arXiv susține că echipele de securitate pot judeca dacă un agent AI echipat cu memorie sau recuperare învață, măsurând cât de mult reduce decalajul față de un model de „profesor” mai puternic, mai degrabă decât pe criterii de referință etichetate care sunt adesea rare sau învechite. Judecând după un model cu putere similară nu a dat niciun semnal utilizabil.arxiv.org
Un briefing util în fiecare săptămână
Ține pasul cu AI fără a trăi în feed.
Obțineți știrile verificate de AI din săptămână, date originale, instrumente utile, alegeri de învățare și noi locuri de muncă AI.
Ajungeți la oamenii care învață AI
Angajați un profesionist AI sau lansați un produs AI util? Pune-o în fața oamenilor care au venit aici să învețe și să acționeze.
Postați un job AITrimiteți un instrument AI