Avaliando o desempenho das habilidades do agente de IA com NVIDIA SkillEvaluator
NVIDIA SkillEvaluator mede o impacto das habilidades verificadas no desempenho do agente de IA por meio de um processo de avaliação de três níveis.
Atualizado diariamente1793 histórias verificadas
Cobertura de IA verificada na fonte sobre lançamentos de produtos, mudanças políticas, pesquisas de segurança e movimentos do setor, explicada em inglês simples por uma equipe de educação sem fins lucrativos.
Cada história está vinculada às evidências mais fortes disponíveis: fontes originais, quando disponíveis, reportagens claramente atribuídas.
What happened, why it matters, and what to watch — without the jargon.
Quando o sinal é fraco, não publicamos nada além de preencher o feed.
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
NVIDIA SkillEvaluator mede o impacto das habilidades verificadas no desempenho do agente de IA por meio de um processo de avaliação de três níveis.
Uma pré-impressão de 24 autores fez com que agentes de IA de fronteira tentassem responder às questões centrais de pesquisa de duas submissões não publicadas do NeurIPS 2026 e, em seguida, os próprios autores dos artigos avaliaram os resultados. Os agentes cuidaram da engenharia sem ajuda durante seis dias, mas foram inequivocamente rejeitados na pesquisa.
Warp está aceitando solicitações de acesso antecipado para Warp Factories, que define frotas de agentes de codificação como código – repositórios, modelos, permissões e pontos de verificação humanos em um arquivo YAML, conduzido por CLI, API, SDK e MCP. Seus números de automação e custos são afirmações do fornecedor: sem preço, data de disponibilidade geral ou testes independentes.
Um novo artigo arXiv introduz um teste no qual os modelos devem inferir uma palavra escrita a partir de áudio de rascunho da caneta e vídeo de movimento da mão, sem tinta visível. Os autores relatam que humanos acima de 80% de precisão de letras ordenadas e modelos líderes abaixo de 10% – e que dar aos modelos ambas as modalidades muitas vezes piora os resultados.
Uma nova pré-impressão do arXiv descreve o CacheScout, uma camada construída no servidor vLLM de código aberto que decide o que manter no cache de valor-chave de um modelo com base em qual agente provavelmente será executado em seguida. Os autores relatam ganhos de latência e rendimento de dois dígitos; as cargas de trabalho, modelos e hardware não são declarados de forma abstrata.
Dois pesquisadores dizem que uma prova do lema no Capítulo 6 do documento matemático de OpenAI tem um erro de polaridade: um teste em termos de sucesso médio onde a próxima etapa precisa de uma grande falha condicional. Eles fornecem um contra-exemplo e uma prova corrigida, e alertam que esta não é uma verificação do teorema principal do capítulo.
Uma pré-impressão de dois pesquisadores reproduz um estudo anterior sobre por que contagens iguais de FLOP não significam tempos de execução iguais. Ele confirma a afirmação subjacente, mas relata que a fórmula de correção de α-FLOPs geralmente subestima o tempo de execução em hardware mais recente, o que mostra saltos e oscilações que a fórmula não captura.
Uma nova pré-impressão do arXiv compara quatro arquiteturas para consulta em linguagem natural de bancos de dados corporativos em um benchmark bilíngue sintético. Nenhum respondeu corretamente a mais de um quarto dos casos, e o projeto com pontuação mais alta não foi o mais seguro nem o mais barato.
Uma nova pré-impressão do arXiv argumenta que as equipes de segurança podem julgar se um agente de IA equipado com memória ou recuperação está aprendendo medindo até que ponto ele fecha a lacuna para um modelo de “professor” mais forte, em vez de benchmarks rotulados que muitas vezes são escassos ou obsoletos. A julgar por um modelo com alimentação semelhante, não houve sinal utilizável.
Um relatório técnico de 17 autores postado no arXiv apresenta o MobileMem, um benchmark e estrutura para memória de longo prazo no dispositivo construída a partir de uma coleção de experiências móveis em escala anual. O resumo descreve o design, mas não relata pontuações, e os principais detalhes sobre os dados subjacentes permanecem não divulgados.
Uma nova pré-impressão do arXiv diz que grandes modelos de linguagem desenvolvem estruturas internas funcionalmente especializadas que se alinham com redes distintas do cérebro humano, com base em análises de circuitos em 46 tarefas em quatro domínios cognitivos. A página de resumo deixa detalhes metodológicos importantes não declarados.
Uma pré-impressão relata que desabilitar especialistas de baixa magnitude nas últimas cinco camadas de um modelo de mistura de especialistas de 35 bilhões de parâmetros preservou resultados de tradução de código muito mais utilizáveis do que espalhar os mesmos cortes em todas as camadas. Abrange um modelo e um benchmark, e o resumo não relata nenhuma linha de base desmascarada.
Um briefing útil por semana
Receba as notícias verificadas sobre IA da semana, dados originais, ferramentas úteis, opções de aprendizado e novos trabalhos de IA.
Contratar um profissional de IA ou lançar um produto útil de IA? Coloque isso na frente das pessoas que vieram aqui para aprender e agir.
Publique um trabalho de IA Envie uma ferramenta de IA