Ενημερώνεται καθημερινά1866 επαληθευμένες ιστορίες
AI News. Χωρίς τον θόρυβο.
Η κάλυψη της τεχνητής νοημοσύνης ελεγμένης πηγής για την κυκλοφορία προϊόντων, τις αλλαγές πολιτικής, την έρευνα για την ασφάλεια και τις κινήσεις της βιομηχανίας, που εξηγείται σε απλά αγγλικά από μια μη κερδοσκοπική εκπαιδευτική ομάδα.
Επαληθευμένη προμήθεια
Κάθε ιστορία συνδέεται με τα ισχυρότερα διαθέσιμα στοιχεία: αρχικές πηγές όταν είναι διαθέσιμες, διαφορετικά αποδίδονται σαφώς αναφορές.
Απλά αγγλικά
Τι συνέβη, γιατί έχει σημασία και τι να παρακολουθήσετε — χωρίς την ορολογία.
Χωρίς πληρωτικό
Όταν το σήμα είναι λεπτό, δεν δημοσιεύουμε τίποτα αντί να συμπληρώνουμε τη ροή.
Περισσότερες ιστορίες
9 ιστορίεςβιομηχανία
Cursor Says Its Acquisition by SpaceX Has Officially Closed
Cursor published a short post saying SpaceX has completed its acquisition of the AI coding tool, finishing a process it says began in April with a model-training partnership with SpaceXAI. The post promises access to what it calls the world's largest GPU fleet, but discloses no terms, timelines, or product changes.
cursor.comΚαινοτομία
New Benchmark Finds AI Agents Wrongly Block Approved Work 28% of the Time
A preprint introduces SteerBench-Work, a 106-scenario test of the moment an AI agent decides to act or pause for review. Across 30 model conditions, the authors report that wrongly holding cleared work was roughly 28 times more common than wrongly allowing unsafe work.arxiv.orgΚαινοτομία
Paper Reports Frontier LLM Judges Flip Verdicts 25-71% Under Pushback
A new arXiv preprint stress-tests nine frontier models used as automated graders and reports that all of them change their verdicts under challenge — and that the changed verdicts usually move away from the correct answer, not toward it.arxiv.orgΚαινοτομία
Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
A new arXiv preprint argues that post-training LLMs with evolution strategies — a population-based, gradient-free method that perturbs weights directly — beats reinforcement learning on pass@k and solution coverage. The abstract cites better math-benchmark results but names no models, benchmarks, or numbers.arxiv.orgΑσφάλεια
Paper Says Self-Improving AI Agents Can Turn One Unsafe Success Into a Reusable Skill
A new arXiv preprint benchmarks a specific agent failure mode: when a self-improving agent writes an unsafe procedure into memory, it can be retrieved and executed in later sessions. Every evolved configuration tested produced unsafe artifacts, and three malicious tasks more than doubled carryover attack success.arxiv.orgΑσφάλεια
SEAG Paper Proposes Aliasing Sensitive Entities Before RAG Queries Reach External LLMs
A preprint posted to arXiv describes a framework that swaps sensitive names in queries and retrieved documents for aliases before sending them to a third-party model. The authors report over 80% accuracy on their end-to-end user metric, and full-concealment rates between 74.91% and 77.83% across three small models.arxiv.orgΚαινοτομία
Αναφορές χαρτιού CABS+ Φθηνότερη, ταχύτερη συγχώνευση μοντέλων σε 27 σύνολα δεδομένων
Μια προεκτύπωση που δημοσιεύτηκε στο arXiv περιγράφει το CABS+, μια μέθοδο συγχώνευσης μοντέλων που αντικαθιστά την αναζήτηση πλέγματος με μια αναζήτηση συντελεστών χωρίς κλίση. Οι συγγραφείς αναφέρουν διψήφια κέρδη απόδοσης σε δύο βασικές γραμμές, κάτω από το ένα τέταρτο της μνήμης GPU της μιας γραμμής βάσης και περίπου 4 φορές επιτάχυνση σε σχέση με μια άλλη.arxiv.orgΚαινοτομία
Το Paper προτείνει ανακτημένα "μαθήματα" για τη βελτίωση του χωρικού συλλογισμού σε μοντέλα παγωμένης όρασης-γλώσσας
Μια προεκτύπωση arXiv περιγράφει το Spatial Memory Agent, το οποίο αποθηκεύει την επαληθευμένη εμπειρία ως μαθήματα κειμένου που ανακτώνται σε χρόνο συμπερασμάτων, αξιώνοντας κέρδη σε πέντε χωρικά σημεία αναφοράς και τέσσερα μοντέλα γλώσσας όρασης χωρίς να αλλάζει το βάρος του μοντέλου. Είναι υπό εξέταση. η περίληψη του δεν ονομάζει σημεία αναφοράς, βασικά μοντέλα ή περιθώρια.arxiv.orgΚαινοτομία
Αναφορές χαρτιού PROVE-RT 44,7% Επιτυχία Δημιουργία αποδείξεων σε πραγματικό χρόνο που ελέγχονται από μηχανή
Μια προεκτύπωση arXiv παρουσιάζει το PROVE-RT, το οποίο χρησιμοποιεί ανάκτηση και σταδιακή προτροπή για να κάνει μεγάλα γλωσσικά μοντέλα να γράφουν σενάρια απόδειξης PROSA/ROCQ για ανάλυση προγραμματισμού σε πραγματικό χρόνο. Οι συγγραφείς αναφέρουν ποσοστό επιτυχίας 44,7% σε ένα επιμελημένο σύνολο αξιολόγησης, όπου η άμεση προτροπή αποτυγχάνει να παράγει αξιόπιστα έγκυρους μηχανισμούς.arxiv.org
Μία χρήσιμη ενημέρωση κάθε εβδομάδα
Συνεχίστε με την τεχνητή νοημοσύνη χωρίς να ζείτε στη ροή.
Λάβετε επαληθευμένες ειδήσεις τεχνητής νοημοσύνης της εβδομάδας, πρωτότυπα δεδομένα, χρήσιμα εργαλεία, επιλογές εκμάθησης και νέες θέσεις εργασίας AI.
Προσεγγίστε άτομα που μαθαίνουν AI
Να προσλάβετε έναν επαγγελματία τεχνητής νοημοσύνης ή να λανσάρετε ένα χρήσιμο προϊόν τεχνητής νοημοσύνης; Βάλτε το μπροστά σε ανθρώπους που ήρθαν εδώ για να μάθουν και να δράσουν.
Δημοσιεύστε μια εργασία AIΥποβάλετε ένα εργαλείο AI