Aggiornato quotidianamente2528 storie verificate
Notizie sull'AI. Senza il rumore.
Copertura controllata dall'IA su lanci di prodotti, cambiamenti di politiche, ricerche sulla sicurezza e mosse del settore, spiegata in un linguaggio semplice da un team educativo non profit.
Fonti verificate
Ogni articolo è collegato alle prove più forti disponibili: fonti originali quando disponibili, altrimenti segnalazioni chiaramente attribuite.
Inglese semplice
Cosa è successo, perché è importante e cosa guardare, senza usare termini tecnici.
Nessun riempitivo
Quando il segnale è debole, non pubblichiamo nulla invece di riempire il feed.
Altre storie
9 storieInnovazione
Valutazione delle prestazioni delle competenze degli agenti IA con NVIDIA SkillEvaluator
NVIDIA SkillEvaluator misura l'impatto delle competenze verificate sulle prestazioni degli agenti IA attraverso un processo di valutazione a tre livelli.
developer.nvidia.comInnovazione
Il documento introduce le "valutazioni ombra": gli agenti dell'intelligenza artificiale hanno eseguito l'ingegneria ma non hanno superato due domande di ricerca
Una prestampa di 24 autori prevedeva che gli agenti di intelligenza artificiale di frontiera tentassero di rispondere alle domande di ricerca centrali di due proposte NeurIPS 2026 inedite, quindi gli stessi autori degli articoli valutavano i risultati. Gli agenti hanno gestito l'ingegneria senza aiuto per sei giorni, ma sono stati inequivocabilmente respinti dalla ricerca.arxiv.orgProdotto
Warp apre l'accesso anticipato a "Factories", un sistema Config-as-Code per l'esecuzione di flotte di agenti di codifica
Warp sta accettando richieste di accesso anticipato per Warp Factories, che definisce flotte di agenti di codifica come codice: repository, modelli, autorizzazioni e checkpoint umani in un unico file YAML, guidato da CLI, API, SDK e MCP. I dati relativi all'automazione e ai costi sono dichiarati dai fornitori: nessun prezzo, data di disponibilità generale o test indipendenti.warp.devInnovazione
Il benchmark afferma che i migliori modelli multimodali ottengono punteggi inferiori al 10% nella lettura delle parole dai suoni della penna e dal movimento della mano
Un nuovo documento di arXiv introduce un test in cui i modelli devono dedurre una parola scritta dall’audio di un graffio di penna e dal video del movimento della mano, senza inchiostro visibile. Gli autori riferiscono che negli esseri umani l’accuratezza delle lettere ordinate è superiore all’80% e che i modelli principali sono inferiori al 10% e che fornire ai modelli entrambe le modalità spesso ha peggiorato i risultati.arxiv.orgInnovazione
Un articolo afferma che la gestione della cache basata sugli agenti riduce il ritardo del primo token fino al 45% nel servizio multi-agente
Una nuova prestampa di arXiv descrive CacheScout, un livello costruito sul server vLLM open source che decide cosa conservare nella cache dei valori-chiave di un modello in base a quale agente verrà probabilmente eseguito successivamente. Gli autori riportano guadagni di latenza e throughput a due cifre; i carichi di lavoro, i modelli e l'hardware non sono indicati in astratto.arxiv.orgInnovazione
L'audit di una prova generata dall'intelligenza artificiale OpenAI rileva una condizione invertita e pubblica una riparazione
Due ricercatori affermano che una dimostrazione del lemma nel capitolo 6 del documento di matematica di OpenAI contiene un errore di polarità: un test in termini di successo medio in cui il passaggio successivo richiede un grande fallimento condizionale. Forniscono un controesempio e una dimostrazione corretta, avvertendo che questa non è una verifica del teorema principale del capitolo.arxiv.orgInnovazione
Uno studio sulla replica rivela che i FLOP continuano a prevedere erroneamente il runtime dell'intelligenza artificiale e la correzione proposta fallisce sull'hardware più recente
Una prestampa di due ricercatori riproduce uno studio precedente sul perché uguali conteggi FLOP non significano uguali tempi di esecuzione. Conferma l'affermazione di fondo ma segnala che la formula di correzione α-FLOP generalmente sottostima il tempo di esecuzione su hardware più recente, il che mostra salti e oscillazioni che la formula non cattura.arxiv.orgImpresa
Il documento di benchmark individua quattro modi per interrogare i dati aziendali con tutti i LLM che ottengono un punteggio inferiore al 26%
Una nuova prestampa di arXiv mette a confronto quattro architetture per l’interrogazione in linguaggio naturale dei database aziendali su un benchmark bilingue sintetico. Nessuno ha risposto correttamente a più di un quarto dei casi e il progetto che ha ottenuto il punteggio più alto non era il più sicuro o il più economico.arxiv.orgInnovazione
Il documento propone di classificare gli agenti di sicurezza AI senza etichette misurando la convergenza verso un modello più forte
Una nuova prestampa arXiv sostiene che i team di sicurezza possono giudicare se un agente AI dotato di memoria o recupero sta imparando misurando quanto riesce a colmare il divario rispetto a un modello di "insegnante" più forte, piuttosto che su benchmark etichettati che sono spesso scarsi o obsoleti. A giudicare da un modello con potenza simile, non forniva alcun segnale utilizzabile.arxiv.org
Un briefing utile ogni settimana
Tieni il passo con l'IA senza vivere nel feed.
Ricevi le notizie verificate sull'IA della settimana, dati originali, strumenti utili, scelte per l'apprendimento e nuovi lavori in IA.
Raggiungi le persone che stanno imparando l'intelligenza artificiale
Assumere un professionista dell'IA o lanciare un prodotto AI utile? Mettilo davanti a chi è venuto qui per imparare e agire.
Pubblica un lavoro AIInvia uno strumento AI