Оновлюється щодня1866 перевірені історії
Новини AI. Без шуму.
Перевірений джерелом штучний інтелект висвітлює випуск продуктів, зміни в політиці, дослідження безпеки та зміни в галузі, пояснені простою англійською мовою некомерційною освітньою командою.
Перевірене джерело
Кожна історія пов’язана з найвагомішими наявними доказами: оригінальними джерелами, якщо вони доступні, в іншому випадку чітко зазначеними повідомленнями.
Звичайна англійська
Що сталося, чому це важливо та що дивитися — без жаргону.
Без наповнювача
Коли сигнал слабкий, ми нічого не публікуємо, а лише доповнюємо канал.
Більше історій
9 історіїПромисловість
Cursor Says Its Acquisition by SpaceX Has Officially Closed
Cursor published a short post saying SpaceX has completed its acquisition of the AI coding tool, finishing a process it says began in April with a model-training partnership with SpaceXAI. The post promises access to what it calls the world's largest GPU fleet, but discloses no terms, timelines, or product changes.
cursor.comІнновація
New Benchmark Finds AI Agents Wrongly Block Approved Work 28% of the Time
A preprint introduces SteerBench-Work, a 106-scenario test of the moment an AI agent decides to act or pause for review. Across 30 model conditions, the authors report that wrongly holding cleared work was roughly 28 times more common than wrongly allowing unsafe work.arxiv.orgІнновація
Paper Reports Frontier LLM Judges Flip Verdicts 25-71% Under Pushback
A new arXiv preprint stress-tests nine frontier models used as automated graders and reports that all of them change their verdicts under challenge — and that the changed verdicts usually move away from the correct answer, not toward it.arxiv.orgІнновація
Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
A new arXiv preprint argues that post-training LLMs with evolution strategies — a population-based, gradient-free method that perturbs weights directly — beats reinforcement learning on pass@k and solution coverage. The abstract cites better math-benchmark results but names no models, benchmarks, or numbers.arxiv.orgБезпека
Paper Says Self-Improving AI Agents Can Turn One Unsafe Success Into a Reusable Skill
A new arXiv preprint benchmarks a specific agent failure mode: when a self-improving agent writes an unsafe procedure into memory, it can be retrieved and executed in later sessions. Every evolved configuration tested produced unsafe artifacts, and three malicious tasks more than doubled carryover attack success.arxiv.orgБезпека
SEAG Paper Proposes Aliasing Sensitive Entities Before RAG Queries Reach External LLMs
A preprint posted to arXiv describes a framework that swaps sensitive names in queries and retrieved documents for aliases before sending them to a third-party model. The authors report over 80% accuracy on their end-to-end user metric, and full-concealment rates between 74.91% and 77.83% across three small models.arxiv.orgІнновація
Паперові звіти CABS+ дешевше, швидша модель, що об’єднує 27 наборів даних
Препринт, опублікований на arXiv, описує CABS+, метод об’єднання моделей, який замінює пошук по сітці на безградієнтний пошук за коефіцієнтами. Автори повідомляють про двозначне збільшення продуктивності в порівнянні з двома базовими рівнями, менше чверті GPU пам’яті одного базового рівня та приблизно 4-кратне прискорення порівняно з іншим.arxiv.orgІнновація
Стаття пропонує отримані «уроки» для покращення просторового мислення в моделях Frozen Vision-Language
Препринт arXiv описує Spatial Memory Agent, який зберігає перевірений досвід як текстові уроки, отримані під час висновку, заявляючи про переваги в п’яти просторових еталонних тестах і чотирьох моделях мови бачення без зміни ваги моделі. Перебуває на розгляді; його анотація не називає контрольні показники, базові моделі чи поля.arxiv.orgІнновація
PROVE-RT Paper звітує про 44,7% успішності створення перевірених машиною доказів у реальному часі
Препринт arXiv представляє PROVE-RT, який використовує пошук і поетапні підказки, щоб змусити великі мовні моделі писати перевірочні сценарії PROSA/ROCQ для аналізу планування в реальному часі. Автори повідомляють про 44,7% успіху підібраного набору оцінок, де прямі підказки не можуть надійно створити дійсну механізацію.arxiv.org
Один корисний брифінг щотижня
Будьте в курсі ШІ, не живучи в стрічці.
Отримуйте перевірені новини про штучний інтелект, оригінальні дані, корисні інструменти, підбірки для навчання та нові вакансії зі штучного інтелекту.
Охопіть людей, які вивчають ШІ
Найняти професіонала ШІ чи запустити корисний продукт ШІ? Покажіть це людям, які прийшли сюди вчитися та діяти.
Опублікувати роботу ШІНадішліть інструмент ШІ