Aggiornato quotidianamente1866 storie verificate
Notizie sull'AI. Senza il rumore.
Copertura controllata dall'IA su lanci di prodotti, cambiamenti di politiche, ricerche sulla sicurezza e mosse del settore, spiegata in un linguaggio semplice da un team educativo non profit.
Fonti verificate
Ogni articolo è collegato alle prove più forti disponibili: fonti originali quando disponibili, altrimenti segnalazioni chiaramente attribuite.
Inglese semplice
Cosa è successo, perché è importante e cosa guardare, senza usare termini tecnici.
Nessun riempitivo
Quando il segnale è debole, non pubblichiamo nulla invece di riempire il feed.
Altre storie
9 storieIndustria
Cursor Says Its Acquisition by SpaceX Has Officially Closed
Cursor published a short post saying SpaceX has completed its acquisition of the AI coding tool, finishing a process it says began in April with a model-training partnership with SpaceXAI. The post promises access to what it calls the world's largest GPU fleet, but discloses no terms, timelines, or product changes.
cursor.comInnovazione
New Benchmark Finds AI Agents Wrongly Block Approved Work 28% of the Time
A preprint introduces SteerBench-Work, a 106-scenario test of the moment an AI agent decides to act or pause for review. Across 30 model conditions, the authors report that wrongly holding cleared work was roughly 28 times more common than wrongly allowing unsafe work.arxiv.orgInnovazione
Paper Reports Frontier LLM Judges Flip Verdicts 25-71% Under Pushback
A new arXiv preprint stress-tests nine frontier models used as automated graders and reports that all of them change their verdicts under challenge — and that the changed verdicts usually move away from the correct answer, not toward it.arxiv.orgInnovazione
Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
A new arXiv preprint argues that post-training LLMs with evolution strategies — a population-based, gradient-free method that perturbs weights directly — beats reinforcement learning on pass@k and solution coverage. The abstract cites better math-benchmark results but names no models, benchmarks, or numbers.arxiv.orgSicurezza
Paper Says Self-Improving AI Agents Can Turn One Unsafe Success Into a Reusable Skill
A new arXiv preprint benchmarks a specific agent failure mode: when a self-improving agent writes an unsafe procedure into memory, it can be retrieved and executed in later sessions. Every evolved configuration tested produced unsafe artifacts, and three malicious tasks more than doubled carryover attack success.arxiv.orgSicurezza
Il documento SEAG propone l'aliasing delle entità sensibili prima che le query RAG raggiungano LLM esterni
Una prestampa pubblicata su arXiv descrive un framework che scambia nomi sensibili nelle query e documenti recuperati con alias prima di inviarli a un modello di terze parti. Gli autori riportano un'accuratezza superiore all'80% sulla metrica utente end-to-end e tassi di occultamento totale compresi tra il 74,91% e il 77,83% su tre piccoli modelli.arxiv.orgInnovazione
CABS+ Paper segnala una fusione di modelli più economica e rapida tra 27 set di dati
Una prestampa pubblicata su arXiv descrive CABS+, un metodo di fusione dei modelli che sostituisce la ricerca su griglia con una ricerca di coefficienti senza gradiente. Gli autori riportano miglioramenti prestazionali a due cifre su due linee di base, meno di un quarto della memoria della GPU di una linea di base e un aumento di velocità di circa 4 volte rispetto a un'altra.arxiv.orgInnovazione
Il documento propone "lezioni" recuperate per migliorare il ragionamento spaziale nei modelli visivo-linguaggio congelati
Una prestampa di arXiv descrive Spatial Memory Agent, che memorizza l'esperienza verificata come lezioni di testo recuperate al momento dell'inferenza, sostenendo guadagni su cinque benchmark spaziali e quattro modelli di linguaggio visivo senza modificare il peso del modello. È in fase di revisione; i suoi nomi astratti non menzionano parametri di riferimento, modelli base o margini.arxiv.orgInnovazione
Il documento PROVE-RT riporta il 44,7% di successi nella generazione di prove in tempo reale controllate dalla macchina
Una prestampa di arXiv presenta PROVE-RT, che utilizza il recupero e la richiesta graduale per fare in modo che modelli linguistici di grandi dimensioni scrivano script di prova PROSA/ROCQ per l'analisi della pianificazione in tempo reale. Gli autori riportano un tasso di successo del 44,7% su un set di valutazione curato, in cui il suggerimento diretto non riesce a produrre in modo affidabile meccanizzazioni valide.arxiv.org
Un briefing utile ogni settimana
Tieni il passo con l'IA senza vivere nel feed.
Ricevi le notizie verificate sull'IA della settimana, dati originali, strumenti utili, scelte per l'apprendimento e nuovi lavori in IA.
Raggiungi le persone che stanno imparando l'intelligenza artificiale
Assumere un professionista dell'IA o lanciare un prodotto AI utile? Mettilo davanti a chi è venuto qui per imparare e agire.
Pubblica un lavoro AIInvia uno strumento AI