Atualizado diariamente2396 histórias verificadas
Notícias de IA. Sem o barulho.
Cobertura de IA verificada na fonte sobre lançamentos de produtos, mudanças políticas, pesquisas de segurança e movimentos do setor, explicada em inglês simples por uma equipe de educação sem fins lucrativos.
Fonte verificada
Cada história está vinculada às evidências mais fortes disponíveis: fontes originais, quando disponíveis, reportagens claramente atribuídas.
Inglês simples
O que aconteceu, por que é importante e o que assistir – sem jargão.
Sem preenchimento
Quando o sinal é fraco, não publicamos nada além de preencher o feed.
Mais histórias
9 históriasInovação
Avaliando o desempenho das habilidades do agente de IA com NVIDIA SkillEvaluator
NVIDIA SkillEvaluator mede o impacto das habilidades verificadas no desempenho do agente de IA por meio de um processo de avaliação de três níveis.
developer.nvidia.comInovação
Artigo apresenta "avaliações de sombra": agentes de IA fizeram a engenharia, mas falharam em duas questões de pesquisa
Uma pré-impressão de 24 autores fez com que agentes de IA de fronteira tentassem responder às questões centrais de pesquisa de duas submissões não publicadas do NeurIPS 2026 e, em seguida, os próprios autores dos artigos avaliaram os resultados. Os agentes cuidaram da engenharia sem ajuda durante seis dias, mas foram inequivocamente rejeitados na pesquisa.arxiv.orgProduto
Warp abre acesso antecipado a "Factory", um sistema de configuração como código para execução de frotas de agentes de codificação
Warp está aceitando solicitações de acesso antecipado para Warp Factories, que define frotas de agentes de codificação como código – repositórios, modelos, permissões e pontos de verificação humanos em um arquivo YAML, conduzido por CLI, API, SDK e MCP. Seus números de automação e custos são afirmações do fornecedor: sem preço, data de disponibilidade geral ou testes independentes.warp.devInovação
Benchmark afirma que os principais modelos multimodais pontuam menos de 10% na leitura de palavras de sons de caneta e movimentos de mão
Um novo artigo arXiv introduz um teste no qual os modelos devem inferir uma palavra escrita a partir de áudio de rascunho da caneta e vídeo de movimento da mão, sem tinta visível. Os autores relatam que humanos acima de 80% de precisão de letras ordenadas e modelos líderes abaixo de 10% – e que dar aos modelos ambas as modalidades muitas vezes piora os resultados.arxiv.orgInovação
Paper afirma que o gerenciamento de cache com reconhecimento de agente reduz o atraso do primeiro token em até 45% na veiculação multiagente
Uma nova pré-impressão do arXiv descreve o CacheScout, uma camada construída no servidor vLLM de código aberto que decide o que manter no cache de valor-chave de um modelo com base em qual agente provavelmente será executado em seguida. Os autores relatam ganhos de latência e rendimento de dois dígitos; as cargas de trabalho, modelos e hardware não são declarados de forma abstrata.arxiv.orgInovação
Auditoria de uma prova gerada por IA OpenAI encontra uma condição invertida e publica um reparo
Dois pesquisadores dizem que uma prova do lema no Capítulo 6 do documento matemático de OpenAI tem um erro de polaridade: um teste em termos de sucesso médio onde a próxima etapa precisa de uma grande falha condicional. Eles fornecem um contra-exemplo e uma prova corrigida, e alertam que esta não é uma verificação do teorema principal do capítulo.arxiv.orgInovação
Estudo de replicação afirma que FLOPs ainda prevêem mal o tempo de execução da IA e a correção proposta falha em hardware mais recente
Uma pré-impressão de dois pesquisadores reproduz um estudo anterior sobre por que contagens iguais de FLOP não significam tempos de execução iguais. Ele confirma a afirmação subjacente, mas relata que a fórmula de correção de α-FLOPs geralmente subestima o tempo de execução em hardware mais recente, o que mostra saltos e oscilações que a fórmula não captura.arxiv.orgEmpresa
Benchmark Paper encontra quatro maneiras de consultar dados corporativos com LLMs com pontuação abaixo de 26%
Uma nova pré-impressão do arXiv compara quatro arquiteturas para consulta em linguagem natural de bancos de dados corporativos em um benchmark bilíngue sintético. Nenhum respondeu corretamente a mais de um quarto dos casos, e o projeto com pontuação mais alta não foi o mais seguro nem o mais barato.arxiv.orgInovação
Artigo propõe classificação de agentes de segurança de IA sem rótulos, medindo a convergência para um modelo mais forte
Uma nova pré-impressão do arXiv argumenta que as equipes de segurança podem julgar se um agente de IA equipado com memória ou recuperação está aprendendo medindo até que ponto ele fecha a lacuna para um modelo de “professor” mais forte, em vez de benchmarks rotulados que muitas vezes são escassos ou obsoletos. A julgar por um modelo com alimentação semelhante, não houve sinal utilizável.arxiv.org
Um briefing útil por semana
Acompanhe a IA sem ficar no feed.
Receba as notícias verificadas sobre IA da semana, dados originais, ferramentas úteis, opções de aprendizado e novos trabalhos de IA.
Alcance pessoas que estão aprendendo IA
Contratar um profissional de IA ou lançar um produto útil de IA? Coloque isso na frente das pessoas que vieram aqui para aprender e agir.
Publique um trabalho de IAEnvie uma ferramenta de IA