Atualizado diariamente1866 histórias verificadas
Notícias de IA. Sem o barulho.
Cobertura de IA verificada na fonte sobre lançamentos de produtos, mudanças políticas, pesquisas de segurança e movimentos do setor, explicada em inglês simples por uma equipe de educação sem fins lucrativos.
Fonte verificada
Cada história está vinculada às evidências mais fortes disponíveis: fontes originais, quando disponíveis, reportagens claramente atribuídas.
Inglês simples
O que aconteceu, por que é importante e o que assistir – sem jargão.
Sem preenchimento
Quando o sinal é fraco, não publicamos nada além de preencher o feed.
Mais histórias
9 históriasIndústria
Cursor afirma que sua aquisição pela SpaceX foi oficialmente encerrada
Cursor publicou um breve post dizendo que a SpaceX concluiu a aquisição da ferramenta de codificação de IA, finalizando um processo que diz ter começado em abril com uma parceria de treinamento de modelos com a SpaceXAI. A postagem promete acesso ao que chama de maior frota de GPU do mundo, mas não divulga termos, prazos ou alterações de produtos.
cursor.comInovação
Novo benchmark descobre que agentes de IA bloqueiam erroneamente trabalhos aprovados 28% das vezes
Uma pré-impressão apresenta o SteerBench-Work, um teste de 106 cenários do momento em que um agente de IA decide agir ou fazer uma pausa para revisão. Em 30 condições modelo, os autores relatam que a retenção indevida de trabalho liberado era aproximadamente 28 vezes mais comum do que a permissão indevida de trabalho inseguro.arxiv.orgInovação
Paper Reports Juízes do Frontier LLM invertem veredictos 25-71% sob resistência
Uma nova pré-impressão do arXiv testa nove modelos de fronteira usados como avaliadores automatizados e relata que todos eles mudam seus veredictos sob contestação – e que os veredictos alterados geralmente se afastam da resposta correta, e não em direção a ela.arxiv.orgInovação
Artigo argumenta que estratégias de evolução superam RL ao manter conjuntos de respostas LLM diversificados
Uma nova pré-impressão do arXiv argumenta que LLMs pós-treinamento com estratégias de evolução – um método livre de gradiente baseado na população que perturba os pesos diretamente – supera o aprendizado por reforço em pass@k e cobertura de solução. O resumo cita melhores resultados de benchmarking matemático, mas não cita modelos, benchmarks ou números.arxiv.orgSegurança
Artigo afirma que agentes de IA que se aprimoram podem transformar um sucesso inseguro em uma habilidade reutilizável
Uma nova pré-impressão do arXiv avalia um modo de falha específico do agente: quando um agente de autoaperfeiçoamento grava um procedimento inseguro na memória, ele pode ser recuperado e executado em sessões posteriores. Cada configuração evoluída testada produziu artefatos inseguros e três tarefas maliciosas mais que dobraram o sucesso do ataque de transferência.arxiv.orgSegurança
Artigo SEAG propõe alias de entidades sensíveis antes que as consultas RAG cheguem a LLMs externos
Uma pré-impressão publicada no arXiv descreve uma estrutura que troca nomes confidenciais em consultas e documentos recuperados por aliases antes de enviá-los para um modelo de terceiros. Os autores relatam mais de 80% de precisão em sua métrica de usuário ponta a ponta e taxas de ocultação total entre 74,91% e 77,83% em três modelos pequenos.arxiv.orgInovação
Relatórios de papel CABS+ mesclam modelos mais baratos e rápidos em 27 conjuntos de dados
Uma pré-impressão postada no arXiv descreve CABS+, um método de fusão de modelos que substitui a pesquisa em grade por uma pesquisa de coeficiente sem gradiente. Os autores relatam ganhos de desempenho de dois dígitos em duas linhas de base, menos de um quarto da memória da GPU de uma linha de base e uma aceleração de aproximadamente 4x em relação a outra.arxiv.orgInovação
Artigo propõe "lições" recuperadas para melhorar o raciocínio espacial em modelos de linguagem de visão congelada
Uma pré-impressão do arXiv descreve o Spatial Memory Agent, que armazena experiência verificada como lições de texto recuperadas no momento da inferência, reivindicando ganhos em cinco benchmarks espaciais e quatro modelos de linguagem de visão sem alterar os pesos do modelo. Está em revisão; seus nomes abstratos não contêm benchmarks, modelos básicos ou margens.arxiv.orgInovação
Artigo PROVE-RT relata 44,7% de sucesso na geração de provas em tempo real verificadas por máquina
Uma pré-impressão do arXiv apresenta o PROVE-RT, que usa recuperação e prompts preparados para fazer grandes modelos de linguagem escreverem scripts de prova PROSA/ROCQ para análise de escalonamento em tempo real. Os autores relatam uma taxa de sucesso de 44,7% em um conjunto de avaliação com curadoria, onde a solicitação direta não consegue produzir mecanizações válidas de maneira confiável.arxiv.org
Um briefing útil por semana
Acompanhe a IA sem ficar no feed.
Receba as notícias verificadas sobre IA da semana, dados originais, ferramentas úteis, opções de aprendizado e novos trabalhos de IA.
Alcance pessoas que estão aprendendo IA
Contratar um profissional de IA ou lançar um produto útil de IA? Coloque isso na frente das pessoas que vieram aqui para aprender e agir.
Publique um trabalho de IAEnvie uma ferramenta de IA