Cập nhật hàng ngày1797 câu chuyện đã được xác minh

Tin tức AI.Không có tiếng ồn.

Dựa trên AI được kiểm tra nguồn về việc ra mắt sản phẩm, thay đổi chính sách, nghiên cứu an toàn và các động thái trong ngành, được giải thích bằng tiếng Anh đơn giản bởi một nhóm giáo dục phi lợi nhuận.

Nguồn cung cấp đã được xác minh

Mỗi câu chuyện đều liên kết với bằng chứng mạnh mẽ nhất hiện có: nguồn gốc khi có, các báo cáo được ghi nhận rõ ràng.

Tiếng Anh đơn giản

Điều gì đã xảy ra, tại sao nó lại quan trọng và những gì cần xem — không có biệt ngữ.

Không có phụ

Khi tín hiệu yếu, chúng tôi không xuất bản gì ngoài việc đệm nguồn cấp dữ liệu.

Lưu trữ tin tức

Kho lưu trữ tin tức AI — Trang 149

Các câu chuyện về AI đã được kiểm tra nguồn, mới nhất trước tiên, dành cho những người cần hiểu về AI mà không cần theo đuổi sự cường điệu.

Source-provided image accompanying Paper Proposes Grading AI Security Agents Without Labels by Measuring Convergence to a Stronger ModelCâu chuyện hàng đầu
Đổi mới7 min đọc
Đổi mới7 min đọc

Paper Proposes Grading AI Security Agents Without Labels by Measuring Convergence to a Stronger Model

A new arXiv preprint argues security teams can judge whether a memory- or retrieval-equipped AI agent is learning by measuring how far it closes the gap to a stronger "teacher" model, rather than on labeled benchmarks that are often scarce or stale. Judging by a similarly powered model gave no usable signal.

Đọc truyện Nguồn đã được xác minh: arxiv.org
9 câu chuyện
  1. Công nghiệp6 min đọc

    Cursor cho biết việc mua lại SpaceX đã chính thức kết thúc

    Cursor đã xuất bản một bài đăng ngắn cho biết SpaceX đã hoàn tất việc mua lại công cụ mã hóa AI, hoàn tất quá trình mà họ cho biết đã bắt đầu vào tháng 4 với mối quan hệ hợp tác đào tạo mô hình với SpaceXAI. Bài đăng hứa hẹn quyền truy cập vào cái mà nó gọi là đội GPU lớn nhất thế giới, nhưng không tiết lộ điều khoản, mốc thời gian hoặc thay đổi sản phẩm.

    cursor.com
  2. Đổi mới7 min đọc

    Điểm chuẩn mới phát hiện các tác nhân AI chặn sai công việc được phê duyệt 28% thời gian

    Bản in trước giới thiệu SteerBench-Work, một bài kiểm tra 106 kịch bản về thời điểm tác nhân AI quyết định hành động hoặc tạm dừng để xem xét. Trên 30 điều kiện mô hình, các tác giả báo cáo rằng việc giữ sai tác phẩm đã được xử lý phổ biến hơn khoảng 28 lần so với việc cho phép sai tác phẩm không an toàn.

    arxiv.org
  3. Đổi mới7 min đọc

    Báo cáo trên giấy Các thẩm phán của Frontier LLM đưa ra phán quyết lật ngược 25-71% dưới sự phản đối

    Một bản in trước arXiv mới kiểm tra căng thẳng chín mô hình biên giới được sử dụng làm máy chấm điểm tự động và báo cáo rằng tất cả chúng đều thay đổi phán quyết của mình khi bị thử thách - và các phán quyết đã thay đổi thường di chuyển khỏi câu trả lời đúng chứ không phải hướng tới câu trả lời đó.

    arxiv.org
  4. Đổi mới7 min đọc

    Bài viết lập luận rằng các chiến lược tiến hóa đánh bại RL trong việc giữ cho bộ câu trả lời LLM đa dạng

    Một bản in trước arXiv mới lập luận rằng các LLM sau đào tạo với các chiến lược tiến hóa — một phương pháp dựa trên dân số, không có độ dốc, làm nhiễu trực tiếp các trọng số — đánh bại việc học tăng cường trên pass@k và phạm vi giải pháp. Bản tóm tắt trích dẫn các kết quả điểm chuẩn toán học tốt hơn nhưng không nêu tên mô hình, điểm chuẩn hoặc số.

    arxiv.org
  5. Bảo mật7 min đọc

    Paper cho biết các tác nhân AI tự cải tiến có thể biến một thành công không an toàn thành một kỹ năng có thể tái sử dụng

    Bản in trước arXiv mới đánh giá chế độ lỗi tác nhân cụ thể: khi tác nhân tự cải thiện ghi một quy trình không an toàn vào bộ nhớ, nó có thể được truy xuất và thực thi trong các phiên sau. Mọi cấu hình cải tiến được thử nghiệm đều tạo ra các thành phần không an toàn và ba tác vụ độc hại đã tăng gấp đôi tỷ lệ thành công của cuộc tấn công chuyển tiếp.

    arxiv.org
  6. Bảo mật6 min đọc

    Bài báo SEAG đề xuất đặt bí danh cho các thực thể nhạy cảm trước khi truy vấn RAG tiếp cận LLM bên ngoài

    Một bản in trước được đăng lên arXiv mô tả một khung hoán đổi các tên nhạy cảm trong các truy vấn và truy xuất tài liệu lấy bí danh trước khi gửi chúng đến mô hình của bên thứ ba. Các tác giả báo cáo độ chính xác trên 80% về chỉ số người dùng đầu cuối của họ và tỷ lệ che giấu hoàn toàn từ 74,91% đến 77,83% trên ba mô hình nhỏ.

    arxiv.org

Mỗi tuần một buổi họp hữu ích

Theo dõi AI mà không sống trong nguồn tin.

Nhận tin tức AI đã được xác minh trong tuần, dữ liệu gốc, công cụ hữu ích, lựa chọn học tập và các công việc AI mới.

Send me
One email a week. Switch any time.

Tiếp cận những người đang học AI

Thuê một chuyên gia AI hay ra mắt một sản phẩm AI hữu ích? Hãy đặt nó trước những người đến đây để học hỏi và hành động.

Đăng tuyển dụng AI Gửi một công cụ AI