Aggiornato quotidianamente1982 storie verificate
Notizie sull'AI. Senza il rumore.
Copertura controllata dall'IA su lanci di prodotti, cambiamenti di politiche, ricerche sulla sicurezza e mosse del settore, spiegata in un linguaggio semplice da un team educativo non profit.
Fonti verificate
Ogni articolo è collegato alle prove più forti disponibili: fonti originali quando disponibili, altrimenti segnalazioni chiaramente attribuite.
Inglese semplice
Cosa è successo, perché è importante e cosa guardare, senza usare termini tecnici.
Nessun riempitivo
Quando il segnale è debole, non pubblichiamo nulla invece di riempire il feed.
Altre storie
9 storieInnovazione
Uno studio sulla replica rivela che i FLOP continuano a prevedere erroneamente il runtime dell'intelligenza artificiale e la correzione proposta fallisce sull'hardware più recente
Una prestampa di due ricercatori riproduce uno studio precedente sul perché uguali conteggi FLOP non significano uguali tempi di esecuzione. Conferma l'affermazione di fondo ma segnala che la formula di correzione α-FLOP generalmente sottostima il tempo di esecuzione su hardware più recente, il che mostra salti e oscillazioni che la formula non cattura.arxiv.orgImpresa
Il documento di benchmark individua quattro modi per interrogare i dati aziendali con tutti i LLM che ottengono un punteggio inferiore al 26%
Una nuova prestampa di arXiv mette a confronto quattro architetture per l’interrogazione in linguaggio naturale dei database aziendali su un benchmark bilingue sintetico. Nessuno ha risposto correttamente a più di un quarto dei casi e il progetto che ha ottenuto il punteggio più alto non era il più sicuro o il più economico.arxiv.orgInnovazione
Paper Proposes Grading AI Security Agents Without Labels by Measuring Convergence to a Stronger Model
A new arXiv preprint argues security teams can judge whether a memory- or retrieval-equipped AI agent is learning by measuring how far it closes the gap to a stronger "teacher" model, rather than on labeled benchmarks that are often scarce or stale. Judging by a similarly powered model gave no usable signal.arxiv.orgInnovazione
Nuovi test di riferimento per verificare se gli assistenti AI riescono a ricordare un anno di utilizzo del telefono
Un rapporto tecnico di 17 autori pubblicato su arXiv introduce MobileMem, un benchmark e un framework per la memoria a lungo termine sul dispositivo costruito a partire da una raccolta su scala annuale di esperienze mobili. L'abstract descrive il progetto ma non riporta alcun punteggio e i dettagli chiave sui dati sottostanti rimangono non divulgati.arxiv.orgInnovazione
L'articolo riporta un'organizzazione modulare simile al cervello che emerge all'interno di modelli linguistici di grandi dimensioni
Una nuova prestampa di arXiv afferma che i modelli linguistici di grandi dimensioni sviluppano una struttura interna funzionalmente specializzata che si allinea con distinte reti cerebrali umane, sulla base dell’analisi dei circuiti in 46 compiti in quattro domini cognitivi. La pagina dell'abstract lascia non dichiarati i dettagli metodologici chiave.arxiv.orgInnovazione
Paper Finds Late Layers of a Mixture-of-Experts Model Tolerate Heavy Expert Masking
A preprint reports that disabling low-magnitude experts in the last five layers of a 35-billion-parameter Mixture-of-Experts model preserved far more usable code-translation outputs than spreading the same cuts across all layers. It covers one model and one benchmark, and the abstract reports no unmasked baseline.arxiv.orgSicurezza
I difetti di CoreBreak consentono l'esecuzione degli strumenti dell'agente senza che il modello venga mai chiamato
Una nota di ricerca della Cloud Security Alliance descrive CoreBreak, un modello di difetti in Amazon Bedrock AgentCore, nell'Agent Development Kit di Google e nei pacchetti di cablaggio AI SDK di Vercel che consentivano l'esecuzione degli strumenti senza una svolta del modello, lasciando i guardrail a livello di modello senza nulla da ispezionare.labs.cloudsecurityalliance.orgPolitica
Anthropic Details How Claude's Text Watermark Will Work
Anthropic says future Claude models will embed a statistical watermark based on Google DeepMind's SynthID-Text, to comply with the EU AI Act. The company says it adds no characters, tokens, or user identity — and that a full rewrite defeats it.
anthropic.comIndustria
Cursor Says Its Acquisition by SpaceX Has Officially Closed
Cursor published a short post saying SpaceX has completed its acquisition of the AI coding tool, finishing a process it says began in April with a model-training partnership with SpaceXAI. The post promises access to what it calls the world's largest GPU fleet, but discloses no terms, timelines, or product changes.
cursor.com
Un briefing utile ogni settimana
Tieni il passo con l'IA senza vivere nel feed.
Ricevi le notizie verificate sull'IA della settimana, dati originali, strumenti utili, scelte per l'apprendimento e nuovi lavori in IA.
Raggiungi le persone che stanno imparando l'intelligenza artificiale
Assumere un professionista dell'IA o lanciare un prodotto AI utile? Mettilo davanti a chi è venuto qui per imparare e agire.
Pubblica un lavoro AIInvia uno strumento AI