Cập nhật hàng ngày1866 câu chuyện đã được xác minh
Tin tức AI. Không có tiếng ồn.
Dựa trên AI được kiểm tra nguồn về việc ra mắt sản phẩm, thay đổi chính sách, nghiên cứu an toàn và các động thái trong ngành, được giải thích bằng tiếng Anh đơn giản bởi một nhóm giáo dục phi lợi nhuận.
Nguồn cung cấp đã được xác minh
Mỗi câu chuyện đều liên kết với bằng chứng mạnh mẽ nhất hiện có: nguồn gốc khi có, các báo cáo được ghi nhận rõ ràng.
Tiếng Anh đơn giản
Điều gì đã xảy ra, tại sao nó lại quan trọng và những gì cần xem — không có biệt ngữ.
Không có phụ
Khi tín hiệu yếu, chúng tôi không xuất bản gì ngoài việc đệm nguồn cấp dữ liệu.
Thêm câu chuyện
9 câu chuyệnCông nghiệp
Cursor cho biết việc mua lại SpaceX đã chính thức kết thúc
Cursor đã xuất bản một bài đăng ngắn cho biết SpaceX đã hoàn tất việc mua lại công cụ mã hóa AI, hoàn tất quá trình mà họ cho biết đã bắt đầu vào tháng 4 với mối quan hệ hợp tác đào tạo mô hình với SpaceXAI. Bài đăng hứa hẹn quyền truy cập vào cái mà nó gọi là đội GPU lớn nhất thế giới, nhưng không tiết lộ điều khoản, mốc thời gian hoặc thay đổi sản phẩm.
cursor.comĐổi mới
Điểm chuẩn mới phát hiện các tác nhân AI chặn sai công việc được phê duyệt 28% thời gian
Bản in trước giới thiệu SteerBench-Work, một bài kiểm tra 106 kịch bản về thời điểm tác nhân AI quyết định hành động hoặc tạm dừng để xem xét. Trên 30 điều kiện mô hình, các tác giả báo cáo rằng việc giữ sai tác phẩm đã được xử lý phổ biến hơn khoảng 28 lần so với việc cho phép sai tác phẩm không an toàn.arxiv.orgĐổi mới
Báo cáo trên giấy Các thẩm phán của Frontier LLM đưa ra phán quyết lật ngược 25-71% dưới sự phản đối
Một bản in trước arXiv mới kiểm tra căng thẳng chín mô hình biên giới được sử dụng làm máy chấm điểm tự động và báo cáo rằng tất cả chúng đều thay đổi phán quyết của mình khi bị thử thách - và các phán quyết đã thay đổi thường di chuyển khỏi câu trả lời đúng chứ không phải hướng tới câu trả lời đó.arxiv.orgĐổi mới
Bài viết lập luận rằng các chiến lược tiến hóa đánh bại RL trong việc giữ cho bộ câu trả lời LLM đa dạng
Một bản in trước arXiv mới lập luận rằng các LLM sau đào tạo với các chiến lược tiến hóa — một phương pháp dựa trên dân số, không có độ dốc, làm nhiễu trực tiếp các trọng số — đánh bại việc học tăng cường trên pass@k và phạm vi giải pháp. Bản tóm tắt trích dẫn các kết quả điểm chuẩn toán học tốt hơn nhưng không nêu tên mô hình, điểm chuẩn hoặc số.arxiv.orgBảo mật
Paper cho biết các tác nhân AI tự cải tiến có thể biến một thành công không an toàn thành một kỹ năng có thể tái sử dụng
Bản in trước arXiv mới đánh giá chế độ lỗi tác nhân cụ thể: khi tác nhân tự cải thiện ghi một quy trình không an toàn vào bộ nhớ, nó có thể được truy xuất và thực thi trong các phiên sau. Mọi cấu hình cải tiến được thử nghiệm đều tạo ra các thành phần không an toàn và ba tác vụ độc hại đã tăng gấp đôi tỷ lệ thành công của cuộc tấn công chuyển tiếp.arxiv.orgBảo mật
Bài báo SEAG đề xuất đặt bí danh cho các thực thể nhạy cảm trước khi truy vấn RAG tiếp cận LLM bên ngoài
Một bản in trước được đăng lên arXiv mô tả một khung hoán đổi các tên nhạy cảm trong các truy vấn và truy xuất tài liệu lấy bí danh trước khi gửi chúng đến mô hình của bên thứ ba. Các tác giả báo cáo độ chính xác trên 80% về chỉ số người dùng đầu cuối của họ và tỷ lệ che giấu hoàn toàn từ 74,91% đến 77,83% trên ba mô hình nhỏ.arxiv.orgĐổi mới
Báo cáo giấy CABS+ Hợp nhất mô hình trên 27 bộ dữ liệu rẻ hơn, nhanh hơn
Một bản in trước được đăng lên arXiv mô tả CABS+, một phương pháp hợp nhất mô hình thay thế tìm kiếm dạng lưới bằng tìm kiếm hệ số không có độ dốc. Các tác giả báo cáo mức tăng hiệu suất hai chữ số trên hai đường cơ sở, dưới 1/4 bộ nhớ GPU của một đường cơ sở và tăng tốc gần gấp 4 lần so với đường cơ sở khác.arxiv.orgĐổi mới
Bài viết Đề xuất "Bài học" được truy xuất để cải thiện khả năng suy luận về không gian trong các mô hình ngôn ngữ thị giác đông lạnh
Bản in trước arXiv mô tả Tác nhân bộ nhớ không gian, lưu trữ trải nghiệm đã được xác minh dưới dạng các bài học văn bản được truy xuất tại thời điểm suy luận, xác nhận mức tăng trên năm điểm chuẩn không gian và bốn mô hình ngôn ngữ thị giác mà không thay đổi trọng số mô hình. Nó đang được xem xét; tên trừu tượng của nó không có điểm chuẩn, mô hình cơ sở hoặc lề.arxiv.orgĐổi mới
Báo cáo giấy PROVE-RT 44,7% tạo thành công bằng chứng thời gian thực được kiểm tra bằng máy
Bản in trước arXiv trình bày PROVE-RT, sử dụng tính năng truy xuất và nhắc nhở theo giai đoạn để làm cho các mô hình ngôn ngữ lớn viết các tập lệnh chứng minh PROSA/ROCQ để phân tích khả năng lập lịch theo thời gian thực. Các tác giả báo cáo tỷ lệ thành công là 44,7% trên một tập hợp đánh giá được tuyển chọn, trong đó việc nhắc nhở trực tiếp không tạo ra được cơ chế hóa hợp lệ một cách đáng tin cậy.arxiv.org
Mỗi tuần một buổi họp hữu ích
Theo dõi AI mà không sống trong nguồn tin.
Nhận tin tức AI đã được xác minh trong tuần, dữ liệu gốc, công cụ hữu ích, lựa chọn học tập và các công việc AI mới.
Tiếp cận những người đang học AI
Thuê một chuyên gia AI hay ra mắt một sản phẩm AI hữu ích? Hãy đặt nó trước những người đến đây để học hỏi và hành động.
Đăng tuyển dụng AIGửi một công cụ AI