Atualizado diariamente1982 histórias verificadas
Notícias de IA. Sem o barulho.
Cobertura de IA verificada na fonte sobre lançamentos de produtos, mudanças políticas, pesquisas de segurança e movimentos do setor, explicada em inglês simples por uma equipe de educação sem fins lucrativos.
Fonte verificada
Cada história está vinculada às evidências mais fortes disponíveis: fontes originais, quando disponíveis, reportagens claramente atribuídas.
Inglês simples
O que aconteceu, por que é importante e o que assistir – sem jargão.
Sem preenchimento
Quando o sinal é fraco, não publicamos nada além de preencher o feed.
Mais histórias
9 históriasInovação
Estudo de replicação afirma que FLOPs ainda prevêem mal o tempo de execução da IA e a correção proposta falha em hardware mais recente
Uma pré-impressão de dois pesquisadores reproduz um estudo anterior sobre por que contagens iguais de FLOP não significam tempos de execução iguais. Ele confirma a afirmação subjacente, mas relata que a fórmula de correção de α-FLOPs geralmente subestima o tempo de execução em hardware mais recente, o que mostra saltos e oscilações que a fórmula não captura.arxiv.orgEmpresa
Benchmark Paper encontra quatro maneiras de consultar dados corporativos com LLMs com pontuação abaixo de 26%
Uma nova pré-impressão do arXiv compara quatro arquiteturas para consulta em linguagem natural de bancos de dados corporativos em um benchmark bilíngue sintético. Nenhum respondeu corretamente a mais de um quarto dos casos, e o projeto com pontuação mais alta não foi o mais seguro nem o mais barato.arxiv.orgInovação
Artigo propõe classificação de agentes de segurança de IA sem rótulos, medindo a convergência para um modelo mais forte
Uma nova pré-impressão do arXiv argumenta que as equipes de segurança podem julgar se um agente de IA equipado com memória ou recuperação está aprendendo medindo até que ponto ele fecha a lacuna para um modelo de “professor” mais forte, em vez de benchmarks rotulados que muitas vezes são escassos ou obsoletos. A julgar por um modelo com alimentação semelhante, não houve sinal utilizável.arxiv.orgInovação
Novo benchmark testa se os assistentes de IA conseguem se lembrar de um ano de uso do telefone
Um relatório técnico de 17 autores postado no arXiv apresenta o MobileMem, um benchmark e estrutura para memória de longo prazo no dispositivo construída a partir de uma coleção de experiências móveis em escala anual. O resumo descreve o design, mas não relata pontuações, e os principais detalhes sobre os dados subjacentes permanecem não divulgados.arxiv.orgInovação
Artigo relata organização modular semelhante a um cérebro surgindo em grandes modelos de linguagem
Uma nova pré-impressão do arXiv diz que grandes modelos de linguagem desenvolvem estruturas internas funcionalmente especializadas que se alinham com redes distintas do cérebro humano, com base em análises de circuitos em 46 tarefas em quatro domínios cognitivos. A página de resumo deixa detalhes metodológicos importantes não declarados.arxiv.orgInovação
Artigo descobre que camadas tardias de um modelo de mistura de especialistas toleram máscaras pesadas de especialistas
Uma pré-impressão relata que desabilitar especialistas de baixa magnitude nas últimas cinco camadas de um modelo de mistura de especialistas de 35 bilhões de parâmetros preservou resultados de tradução de código muito mais utilizáveis do que espalhar os mesmos cortes em todas as camadas. Abrange um modelo e um benchmark, e o resumo não relata nenhuma linha de base desmascarada.arxiv.orgSegurança
Falhas do CoreBreak permitem que as ferramentas do agente sejam executadas sem que o modelo seja chamado
Uma nota de pesquisa da Cloud Security Alliance descreve CoreBreak, um padrão de falhas no Amazon Bedrock AgentCore, no kit de desenvolvimento de agente Google e nos pacotes de aproveitamento do AI SDK da Vercel que permitiam que as ferramentas fossem executadas sem uma mudança de modelo - deixando as proteções no nível do modelo sem nada para inspecionar.labs.cloudsecurityalliance.orgPolítica
Anthropic detalha como a marca d'água de texto de Claude funcionará
Anthropic afirma que os futuros modelos Claude incorporarão uma marca d'água estatística baseada no SynthID-Text de Google DeepMind, para cumprir a Lei de IA da UE. A empresa diz que não adiciona caracteres, tokens ou identidade de usuário – e que uma reescrita completa o derrota.
anthropic.comIndústria
Cursor afirma que sua aquisição pela SpaceX foi oficialmente encerrada
Cursor publicou um breve post dizendo que a SpaceX concluiu a aquisição da ferramenta de codificação de IA, finalizando um processo que diz ter começado em abril com uma parceria de treinamento de modelos com a SpaceXAI. A postagem promete acesso ao que chama de maior frota de GPU do mundo, mas não divulga termos, prazos ou alterações de produtos.
cursor.com
Um briefing útil por semana
Acompanhe a IA sem ficar no feed.
Receba as notícias verificadas sobre IA da semana, dados originais, ferramentas úteis, opções de aprendizado e novos trabalhos de IA.
Alcance pessoas que estão aprendendo IA
Contratar um profissional de IA ou lançar um produto útil de IA? Coloque isso na frente das pessoas que vieram aqui para aprender e agir.
Publique um trabalho de IAEnvie uma ferramenta de IA