Dagelijks bijgewerkt2528 Geverifieerde verhalen
AI-nieuws. Zonder het lawaai.
Brongecontroleerde AI-verslaggeving van productlanceringen, beleidswijzigingen, veiligheidsonderzoek en industriële bewegingen, uitgelegd in eenvoudig Nederlands door een non-profit educatieteam.
Geverifieerde bronnen
Elk verhaal verwijst naar het sterkst beschikbare bewijs: originele bronnen indien beschikbaar, anders duidelijk toegeschreven verslaggeving.
Gewoon Engels
Wat er is gebeurd, waarom het ertoe doet en waar je naar moet kijken – zonder het jargon.
Geen opvulling
Wanneer het signaal dun is, publiceren we niets in plaats van de feed op te vullen.
Meer verhalen
9 VerhalenInnovatie
Vaardigheidsprestaties van AI-agenten evalueren met NVIDIA SkillEvaluator
NVIDIA SkillEvaluator meet de impact van geverifieerde vaardigheden op de prestaties van AI-agenten via een evaluatieproces op drie niveaus.
developer.nvidia.comInnovatie
Paper introduceert "Schaduwevaluaties": AI-agenten hebben de techniek uitgevoerd, maar hebben twee onderzoeksvragen niet gehaald
In een voordruk van 24 auteurs probeerden AI-agenten van de grens de centrale onderzoeksvragen van twee ongepubliceerde NeurIPS 2026-inzendingen, waarna de eigen auteurs van de artikelen de resultaten beoordeelden. De agenten voerden de engineering zes dagen lang zonder hulp uit, maar werden ondubbelzinnig afgewezen voor het onderzoek.arxiv.orgProduct
Warp opent vroege toegang tot 'Factories', een configuratie-als-code-systeem voor het runnen van vloten codeeragenten
Warp neemt verzoeken om vroegtijdige toegang aan voor Warp Factories, dat groepen codeeragenten definieert als code: opslagplaatsen, modellen, machtigingen en menselijke controlepunten in één YAML-bestand, aangestuurd door CLI, API, SDK en MCP. De automatiserings- en kostencijfers zijn claims van leveranciers: geen prijzen, algemene beschikbaarheidsdatum of onafhankelijke tests.warp.devInnovatie
Volgens de benchmark scoren de beste multimodale modellen minder dan 10% bij het lezen van woorden uit pengeluiden en handbewegingen
Een nieuw arXiv-paper introduceert een test waarbij modellen een geschreven woord moeten afleiden uit pen-krasaudio en handbewegingsvideo, zonder dat er inkt zichtbaar is. De auteurs melden dat mensen boven de 80% letternauwkeurigheid bestelden en leidende modellen onder de 10% – en dat het geven van modellen aan beide modaliteiten vaak de resultaten slechter maakte.arxiv.orgInnovatie
Paper zegt dat agent-bewust cachebeheer de vertraging bij het eerste token tot 45% vermindert bij het serveren door meerdere agenten
Een nieuwe arXiv-preprint beschrijft CacheScout, een laag gebouwd op de open-source vLLM-server die beslist wat er in de sleutelwaardecache van een model moet worden bewaard op basis van welke agent waarschijnlijk als volgende zal worden uitgevoerd. De auteurs rapporteren latentie- en doorvoerwinsten met dubbele cijfers; de werklasten, modellen en hardware worden niet in samenvatting vermeld.arxiv.orgInnovatie
Audit van een door AI gegenereerd bewijs van OpenAI vindt een omgekeerde toestand en publiceert een reparatie
Twee onderzoekers zeggen dat een lemmabewijs in hoofdstuk 6 van het wiskundedocument van OpenAI een polariteitsfout bevat: een test in termen van gemiddeld succes waarbij de volgende stap een grote voorwaardelijke mislukking vereist. Ze geven een tegenvoorbeeld en een gecorrigeerd bewijs, en waarschuwen ervoor dat dit geen verificatie is van de hoofdstelling van het hoofdstuk.arxiv.orgInnovatie
Uit replicatieonderzoek blijkt dat FLOP's de AI-runtime nog steeds verkeerd voorspellen en dat de voorgestelde oplossing mislukt op nieuwere hardware
Een preprint van twee onderzoekers reproduceert een eerder onderzoek naar waarom gelijke FLOP-tellingen niet dezelfde uitvoeringstijd betekenen. Het bevestigt de onderliggende claim, maar rapporteert dat de α-FLOPs-correctieformule over het algemeen de runtime op nieuwere hardware onderschat, wat sprongen en oscillaties laat zien die de formule niet opvangt.arxiv.orgOnderneming
Benchmarkpaper vindt vier manieren om bedrijfsgegevens te bevragen, waarbij LLM's allemaal onder de 26% scoren
Een nieuwe arXiv-voordruk plaatst vier architecturen voor het in natuurlijke taal bevragen van bedrijfsdatabases tegen elkaar op een synthetische tweetalige benchmark. Niemand antwoordde meer dan ongeveer een kwart van de gevallen correct, en het ontwerp dat het hoogst scoorde was niet het veiligste of het goedkoopste.arxiv.orgInnovatie
Paper stelt voor om AI-beveiligingsagenten zonder labels te beoordelen door de convergentie naar een sterker model te meten
Een nieuwe preprint van de arXiv stelt dat beveiligingsteams kunnen beoordelen of een AI-agent met geheugen of retrieval leert door te meten in hoeverre deze de kloof met een sterker ‘leraar’-model dichtt, in plaats van op gelabelde benchmarks die vaak schaars of verouderd zijn. Afgaande op een vergelijkbaar aangedreven model gaf dit geen bruikbaar signaal.arxiv.org
Elke week één nuttige briefing
Houd AI bij zonder in de feed te leven.
Ontvang het geverifieerde AI-nieuws van de week, originele data, nuttige tools, leertips en nieuwe AI-banen.
Bereik mensen die AI leren
Een AI-professional inhuren of een nuttig AI-product lanceren? Zet het voor mensen die hier zijn gekomen om te leren en te acteren.
Plaats een AI-taakDien een AI-tool in