Cập nhật hàng ngày2528 câu chuyện đã được xác minh
Tin tức AI. Không có tiếng ồn.
Dựa trên AI được kiểm tra nguồn về việc ra mắt sản phẩm, thay đổi chính sách, nghiên cứu an toàn và các động thái trong ngành, được giải thích bằng tiếng Anh đơn giản bởi một nhóm giáo dục phi lợi nhuận.
Nguồn cung cấp đã được xác minh
Mỗi câu chuyện đều liên kết với bằng chứng mạnh mẽ nhất hiện có: nguồn gốc khi có, các báo cáo được ghi nhận rõ ràng.
Tiếng Anh đơn giản
Điều gì đã xảy ra, tại sao nó lại quan trọng và những gì cần xem — không có biệt ngữ.
Không có phụ
Khi tín hiệu yếu, chúng tôi không xuất bản gì ngoài việc đệm nguồn cấp dữ liệu.
Thêm câu chuyện
9 câu chuyệnĐổi mới
Đánh giá hiệu suất kỹ năng của tác nhân AI bằng NVIDIA SkillEvaluator
NVIDIA SkillEvaluator đo lường tác động của các kỹ năng đã được xác minh đến hiệu suất của tác nhân AI thông qua quy trình đánh giá ba cấp.
developer.nvidia.comĐổi mới
Bài viết giới thiệu "Đánh giá bóng": Các tác nhân AI đã thực hiện kỹ thuật nhưng không thành công hai câu hỏi nghiên cứu
Một bản in sẵn của 24 tác giả yêu cầu các đặc vụ AI biên giới thử trả lời các câu hỏi nghiên cứu trọng tâm của hai bài nộp NeurIPS 2026 chưa được xuất bản, sau đó nhờ chính tác giả của bài báo chấm điểm kết quả. Các đại lý đã xử lý kỹ thuật mà không cần trợ giúp trong sáu ngày nhưng đã bị từ chối rõ ràng trong nghiên cứu.arxiv.orgsản phẩm
Warp mở quyền truy cập sớm vào "Các nhà máy", một hệ thống cấu hình dưới dạng mã để chạy các nhóm tác nhân mã hóa
Warp đang nhận các yêu cầu truy cập sớm cho Warp Factory, nơi xác định nhóm tác nhân mã hóa là mã — kho, mô hình, quyền và điểm kiểm tra của con người trong một tệp YAML, được điều khiển bởi CLI, API, SDK và MCP. Số liệu tự động hóa và chi phí của nó là tuyên bố của nhà cung cấp: không có giá cả, ngày có sẵn chung hoặc thử nghiệm độc lập.warp.devĐổi mới
Điểm chuẩn cho biết những người mẫu đa phương thức hàng đầu đạt điểm dưới 10% khi đọc từ từ âm thanh bút và chuyển động tay
Một bài báo arXiv mới giới thiệu một bài kiểm tra trong đó các mô hình phải suy ra một từ được viết từ âm thanh vết xước của bút và video chuyển động của tay mà không nhìn thấy mực. Các tác giả báo cáo rằng con người có độ chính xác của chữ cái được đặt hàng trên 80% và các mô hình dẫn đầu dưới 10% - và việc đưa ra mô hình cả hai phương thức thường khiến kết quả trở nên tồi tệ hơn.arxiv.orgĐổi mới
Bài báo cho biết tính năng quản lý bộ nhớ đệm nhận biết tác nhân giúp giảm độ trễ mã thông báo đầu tiên lên tới 45% khi phân phối nhiều tác nhân
Bản in trước arXiv mới mô tả CacheScout, một lớp được xây dựng trên máy chủ vLLM nguồn mở quyết định những gì cần giữ trong bộ nhớ đệm khóa-giá trị của mô hình dựa trên tác nhân nào có khả năng chạy tiếp theo. Các tác giả báo cáo mức tăng thông lượng và độ trễ hai chữ số; khối lượng công việc, mô hình và phần cứng không được nêu trong bản tóm tắt.arxiv.orgĐổi mới
Kiểm tra bằng chứng do AI tạo ra OpenAI phát hiện tình trạng đảo ngược và xuất bản bản sửa chữa
Hai nhà nghiên cứu cho biết chứng minh bổ đề trong Chương 6 của tài liệu toán học của OpenAI có lỗi phân cực: một bài kiểm tra về mức độ thành công trung bình trong đó bước tiếp theo cần một lỗi có điều kiện lớn. Họ đưa ra một phản ví dụ và một chứng minh đã được sửa lại, đồng thời cảnh báo rằng đây không phải là sự xác minh định lý chính của chương.arxiv.orgĐổi mới
Nghiên cứu sao chép cho biết FLOP vẫn dự đoán sai thời gian chạy AI và bản sửa lỗi được đề xuất không thành công trên phần cứng mới hơn
Bản in trước của hai nhà nghiên cứu tái tạo lại một nghiên cứu trước đó về lý do tại sao số lượng FLOP bằng nhau không có nghĩa là thời gian thực hiện bằng nhau. Nó xác nhận tuyên bố cơ bản nhưng báo cáo rằng công thức hiệu chỉnh α-FLOP thường đánh giá thấp thời gian chạy trên phần cứng mới hơn, hiển thị các bước nhảy và dao động mà công thức không nắm bắt được.arxiv.orgDoanh nghiệp
Bài điểm chuẩn tìm ra bốn cách để truy vấn dữ liệu doanh nghiệp bằng LLM, tất cả đều có điểm dưới 26%
Bản in trước arXiv mới có bốn kiến trúc để truy vấn ngôn ngữ tự nhiên của cơ sở dữ liệu doanh nghiệp với nhau trên điểm chuẩn song ngữ tổng hợp. Không có câu trả lời nào đúng hơn khoảng một phần tư trường hợp và thiết kế đạt điểm cao nhất không phải là an toàn nhất hoặc rẻ nhất.arxiv.orgĐổi mới
Bài viết đề xuất phân loại các tác nhân bảo mật AI không có nhãn bằng cách đo lường sự hội tụ thành một mô hình mạnh hơn
Bản in trước arXiv mới lập luận rằng các nhóm bảo mật có thể đánh giá xem tác nhân AI được trang bị bộ nhớ hoặc truy xuất có đang học hay không bằng cách đo xem nó thu hẹp khoảng cách với mô hình "giáo viên" mạnh hơn bao xa, thay vì dựa trên các điểm chuẩn được dán nhãn thường khan hiếm hoặc cũ. Đánh giá bằng một mô hình có công suất tương tự không cho thấy tín hiệu nào có thể sử dụng được.arxiv.org
Mỗi tuần một buổi họp hữu ích
Theo dõi AI mà không sống trong nguồn tin.
Nhận tin tức AI đã được xác minh trong tuần, dữ liệu gốc, công cụ hữu ích, lựa chọn học tập và các công việc AI mới.
Tiếp cận những người đang học AI
Thuê một chuyên gia AI hay ra mắt một sản phẩm AI hữu ích? Hãy đặt nó trước những người đến đây để học hỏi và hành động.
Đăng tuyển dụng AIGửi một công cụ AI