Oppdateres daglig2286 bekreftede historier
AI Nyheter. Uten støyen.
Kildesjekket AI-dekning av produktlanseringer, endringer i retningslinjene, sikkerhetsundersøkelser og bransjebevegelser, forklart på vanlig engelsk av et nonprofit-utdanningsteam.
Verifisert kilde
Hver historie kobler til de sterkeste tilgjengelige bevisene: originale kilder når de er tilgjengelige, ellers tydelig tilskrevet rapportering.
Vanlig engelsk
Hva skjedde, hvorfor det er viktig og hva du bør se - uten sjargongen.
Ingen filler
Når signalet er tynt, publiserer vi ingenting i stedet for å polstre feeden.
Flere historier
9 historierInnovasjon
Kodeagenter mister pålitelighet når koden skrives om uten å endre betydningen, finner studien
Et arXiv forhåndstrykk rapporterer at kodeagenter kan utføre forskjellig på semantisk ekvivalente kodebaser, med effekter som varierer etter modell, agentrammeverk og benchmark.arxiv.orgInnovasjon
Enhanced Fuzzy Logic Model for Power Transformer Fault Diagnosis Using IEEE Key Gas Method Improvements
This study presents an enhanced model combining Fuzzy Logic with the IEEE Key Gas Method (FL-KGM) that introduces refined membership functions, optimized fuzzy rule sets, and a novel separation of CO and CO2 to eliminate diagnostic inconsistencies.arxiv.orgInnovasjon
New preprint reports gains from looped language models in multi-step tool calling
An arXiv study evaluates looped and conventional language models on three tool-calling benchmarks, reporting stronger results on workflows that require multiple dependent API calls and a potentially more efficient adaptive-computation approach.arxiv.orgInnovasjon
Adversarial Review tests structured disagreement for agentic code review
A new arXiv paper proposes a three-agent code-review protocol in which a reviewer evaluates an agent’s code and a critic audits that review before edits are made. The authors report improved benchmark results over tested baselines, while also identifying false consensus as a failure mode.arxiv.orgInnovasjon
ArXiv-studien rapporterer store romerske urdu-hattalergevinster fra LoRA-tilpasning
Et arXiv forhåndstrykk sammenligner nullskudd og parametereffektiv finjustering for hatefulle ytringer på romersk urdu. Forfatterne rapporterer at LoRA-tilpasning økte F1-ytelsen fra 0,56 til over 0,93 på et korpus som inneholder mer enn 72 000 kommenterte kommentarer.arxiv.orgSikkerhet
Preliminary FraudBench test finds banking agents vulnerable to adaptive fraud
An arXiv paper introduces FraudBench, a benchmark for testing whether tool-using banking agents can detect fraud that unfolds across conversations. In a preliminary single-trial evaluation, four agents scored 49% to 65% on attack security.arxiv.orgInnovasjon
Apple-forskere rapporterer skaleringslov for treningsmodeller med knappe data
En studie av mer enn 2000 treningsløp for språkmodeller sier at knappe måldata kan gjentas 15–20 ganger i blandinger, med den beste hastigheten som varierer etter skala og beregning.machinelearning.apple.comInnovasjon
Apple Researchers Propose Lexical Substitutions to Improve Multilingual Model Training
Apple researchers describe LINK, a pretraining intervention that replaces selected English words with word-level translations from a target language. The paper reports improvements across eight languages and five model sizes, including up to a twofold speedup in reaching equivalent downstream performance.machinelearning.apple.comPolitikk
Posisjonspapir krever sertifisering før AI-agenter tar markedsbeslutninger
Et posisjonspapir rapporterer stilltiende samarbeid fra DeepSeek-R1-agenter i et simulert Bertrand-prisingsmarked, selv etter menneskelige oppfordringer mot samordning. Den argumenterer for at sertifisering av observert atferd bør gå foran utplassering av resonneringsagenter i økonomiske markeder; bevisene og sikkerhetstiltakene forblir foreløpige.arxiv.org
En nyttig orientering hver uke
Hold deg oppdatert med AI uten å leve i feeden.
Få ukens bekreftede AI-nyheter, originale data, nyttige verktøy, læringsvalg og ferske AI-jobber.
Nå folk som lærer AI
Ansette en AI-profesjonell eller lansere et nyttig AI-produkt? Sett det foran folk som kom hit for å lære og handle.
Legg ut en AI-jobbSend inn et AI-verktøy