검증된 출처
모든 기사는 가장 강력한 증거와 연결됩니다: 원가 자료가 있을 경우 그렇고, 그 외에는 명확히 출처가 명확히 기재된 보도입니다.
평범한 영어
무슨 일이 일어났는지, 왜 중요한지, 무엇을 보아야 하는지 등을 전문 용어 없이 설명합니다.
채우기 없는 이야기
신호가 얇을 때는 피드를 채우기보다는 아무것도 발행하지 않습니다.
더 많은 이야기
9 이야기들혁신
NVIDIA SkillEvaluator를 사용하여 AI 에이전트 스킬 성능 평가
NVIDIA SkillEvaluator는 3단계 평가 프로세스를 통해 검증된 기술이 AI 에이전트 성능에 미치는 영향을 측정합니다.
developer.nvidia.com혁신
논문에서는 "그림자 평가"를 소개합니다. AI 에이전트가 엔지니어링을 수행했지만 두 가지 연구 질문에 실패했습니다.
24명의 저자 사전 인쇄에서는 개척 AI 에이전트가 미출판 NeurIPS 2026 제출물 2개의 핵심 연구 질문을 시도한 다음 해당 논문의 저자가 결과를 평가하도록 했습니다. 요원들은 6일 동안 도움 없이 엔지니어링을 처리했지만 연구에서 명백히 거부당했습니다.arxiv.org제품
Warp, 코딩 에이전트 제품군 실행을 위한 코드형 구성 시스템인 "Factories"에 대한 조기 액세스 개시
Warp는 CLI, API, SDK 및 MCP로 구동되는 하나의 YAML 파일에 코딩 에이전트 집합을 코드(리포지토리, 모델, 권한 및 휴먼 체크포인트)로 정의하는 Warp Factory에 대한 조기 액세스 요청을 받고 있습니다. 자동화 및 비용 수치는 공급업체가 주장하는 것입니다. 가격, 일반 출시 날짜 또는 독립적 테스트가 없습니다.warp.dev혁신
벤치마크에 따르면 최고의 다중 모드 모델은 펜 소리와 손 동작에서 단어를 읽는 데 10% 미만의 점수를 받았습니다.
새로운 arXiv 논문에서는 모델이 잉크가 보이지 않는 상태에서 펜 스크래치 오디오 및 손 동작 비디오에서 작성된 단어를 추론해야 하는 테스트를 소개합니다. 저자는 인간의 순서 문자 정확도가 80% 이상이고 선도 모델의 정확도가 10% 미만이라고 보고했으며, 모델에 두 가지 양식을 모두 제공하면 결과가 더 나빠지는 경우가 많았습니다.arxiv.org혁신
논문에서는 에이전트 인식 캐시 관리가 다중 에이전트 서비스에서 첫 번째 토큰 지연을 최대 45% 단축한다고 밝혔습니다.
새로운 arXiv 사전 인쇄에서는 다음에 실행할 에이전트를 기반으로 모델의 키-값 캐시에 무엇을 유지할지 결정하는 오픈 소스 vLLM 서버에 구축된 계층인 CacheScout에 대해 설명합니다. 저자는 두 자리 수의 지연 시간과 처리량 증가를 보고했습니다. 워크로드, 모델 및 하드웨어는 요약에 명시되어 있지 않습니다.arxiv.org혁신
OpenAI AI 생성 증명 감사를 통해 반전된 조건을 찾아 수리 게시
두 연구자는 OpenAI 수학 문서 6장의 보조정리 증명에 극성 오류가 있다고 말합니다. 즉, 다음 단계에서 큰 조건부 실패가 필요한 평균 성공 측면의 테스트입니다. 그들은 반례와 수정된 증명을 제공하며 이것이 해당 장의 주요 정리를 검증하는 것이 아니라는 점에 주의합니다.arxiv.org혁신
복제 연구에 따르면 FLOP는 여전히 AI 런타임을 잘못 예측하고 있으며 제안된 수정 사항은 최신 하드웨어에서 실패합니다.
두 연구원의 사전 인쇄는 동일한 FLOP 개수가 동일한 실행 시간을 의미하지 않는 이유에 대한 이전 연구를 재현합니다. 이는 기본 주장을 확인하지만 α-FLOP 수정 공식이 일반적으로 최신 하드웨어의 런타임을 과소평가하여 공식이 포착하지 못하는 점프와 진동을 보여 준다고 보고합니다.arxiv.org기업
벤치마크 문서에서는 LLM의 모든 점수가 26% 미만인 엔터프라이즈 데이터를 쿼리하는 4가지 방법을 찾았습니다.
새로운 arXiv 사전 인쇄본에는 합성 이중 언어 벤치마크에서 기업 데이터베이스의 자연어 쿼리를 위한 4가지 아키텍처가 포함되어 있습니다. 사례 중 약 4분의 1 이상을 정확하게 답한 사람은 없었으며, 가장 높은 점수를 받은 디자인은 가장 안전하지도, 가장 저렴하지도 않았습니다.arxiv.org혁신
논문에서는 더 강력한 모델로의 융합을 측정하여 라벨 없이 AI 보안 에이전트 등급을 매길 것을 제안합니다.
새로운 arXiv 사전 인쇄에서는 보안 팀이 종종 부족하거나 오래된 벤치마크가 아닌 더 강력한 "교사" 모델과의 격차를 얼마나 줄이는지 측정하여 메모리 또는 검색 기능을 갖춘 AI 에이전트가 학습 중인지 여부를 판단할 수 있다고 주장합니다. 유사한 전력을 공급받는 모델로 판단하면 사용 가능한 신호가 나오지 않습니다.arxiv.org
매주 한 번씩 유용한 브리핑을 듣습니다
피드에 살지 않고도 AI를 따라가세요.
이번 주의 검증된 AI 뉴스, 원본 데이터, 유용한 도구, 학습 추천, 그리고 새로운 AI 일자리를 받아보세요.
AI를 배우는 사람들에게 다가가세요
AI 전문가를 고용하거나 유용한 AI 제품을 출시하는 것? 배우고 행동하기 위해 이곳에 온 사람들 앞에 그것을 보여주세요.
AI 공고를 올리세요AI 도구를 제출하세요