Обновляется ежедневно1866 проверенные истории
Новости ИИ. Без шума.
Проверенные источники искусственного интеллекта освещают запуски продуктов, изменения в политике, исследования в области безопасности и отраслевые шаги, объясненные простым языком командой некоммерческого образования.
Проверенный источник
Каждая история связана с самыми убедительными имеющимися доказательствами: первоначальными источниками, если таковые имеются, или явно приписываемыми сообщениями.
Простой английский
Что произошло, почему это важно и что смотреть — без жаргона.
Без наполнителя
Когда сигнал слабый, мы ничего не публикуем, а лишь дополняем канал.
Больше историй
9 историиПромышленность
Cursor Says Its Acquisition by SpaceX Has Officially Closed
Cursor published a short post saying SpaceX has completed its acquisition of the AI coding tool, finishing a process it says began in April with a model-training partnership with SpaceXAI. The post promises access to what it calls the world's largest GPU fleet, but discloses no terms, timelines, or product changes.
cursor.comИнновации
New Benchmark Finds AI Agents Wrongly Block Approved Work 28% of the Time
A preprint introduces SteerBench-Work, a 106-scenario test of the moment an AI agent decides to act or pause for review. Across 30 model conditions, the authors report that wrongly holding cleared work was roughly 28 times more common than wrongly allowing unsafe work.arxiv.orgИнновации
Paper Reports Frontier LLM Judges Flip Verdicts 25-71% Under Pushback
A new arXiv preprint stress-tests nine frontier models used as automated graders and reports that all of them change their verdicts under challenge — and that the changed verdicts usually move away from the correct answer, not toward it.arxiv.orgИнновации
Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
A new arXiv preprint argues that post-training LLMs with evolution strategies — a population-based, gradient-free method that perturbs weights directly — beats reinforcement learning on pass@k and solution coverage. The abstract cites better math-benchmark results but names no models, benchmarks, or numbers.arxiv.orgБезопасность
Paper Says Self-Improving AI Agents Can Turn One Unsafe Success Into a Reusable Skill
A new arXiv preprint benchmarks a specific agent failure mode: when a self-improving agent writes an unsafe procedure into memory, it can be retrieved and executed in later sessions. Every evolved configuration tested produced unsafe artifacts, and three malicious tasks more than doubled carryover attack success.arxiv.orgБезопасность
SEAG Paper Proposes Aliasing Sensitive Entities Before RAG Queries Reach External LLMs
A preprint posted to arXiv describes a framework that swaps sensitive names in queries and retrieved documents for aliases before sending them to a third-party model. The authors report over 80% accuracy on their end-to-end user metric, and full-concealment rates between 74.91% and 77.83% across three small models.arxiv.orgИнновации
Бумажные отчеты CABS+ Дешевле и быстрее Объединение моделей из 27 наборов данных
Препринт, опубликованный на arXiv, описывает CABS+, метод слияния моделей, который заменяет поиск по сетке поиском коэффициентов без градиента. Авторы сообщают о двузначном приросте производительности по сравнению с двумя базовыми показателями, менее четверти памяти графического процессора одного базового уровня и примерно в 4 раза быстрее по сравнению с другим.arxiv.orgИнновации
В статье предлагаются извлеченные «уроки» для улучшения пространственного мышления в моделях на языке замороженного видения.
Препринт arXiv описывает агент пространственной памяти, который сохраняет подтвержденный опыт в виде текстовых уроков, полученных во время вывода, и заявляет о выигрыше по пяти пространственным критериям и четырем моделям языка видения без изменения весов моделей. Он находится на рассмотрении; его абстрактные названия не содержат эталонов, базовых моделей или пределов.arxiv.orgИнновации
В документе PROVE-RT сообщается о 44,7% успешных случаев создания машинно проверяемых доказательств в реальном времени.
Препринт arXiv представляет PROVE-RT, который использует поиск и поэтапные подсказки, чтобы заставить большие языковые модели писать сценарии доказательства PROSA/ROCQ для анализа планируемости в реальном времени. Авторы сообщают о 44,7% успеха в тщательно подобранном наборе оценок, где прямое подсказывание не позволяет надежно обеспечить действенную механизацию.arxiv.org
Один полезный брифинг каждую неделю
Идите в ногу с ИИ, не живя в ленте.
Получайте проверенные новости об искусственном интеллекте за неделю, оригинальные данные, полезные инструменты, обучающие материалы и свежие вакансии в области искусственного интеллекта.
Охватите людей, которые изучают ИИ
Нанимаете специалиста по искусственному интеллекту или запускаете полезный продукт в области искусственного интеллекта? Покажите это людям, которые пришли сюда учиться и действовать.
Опубликовать вакансию ИИОтправить инструмент искусственного интеллекта