Täglich aktualisiert2528 verifizierte Geschichten
KI-Nachrichten. Ohne den Lärm.
Quellengeprüfte KI-Berichterstattung über Produkteinführungen, Richtlinienänderungen, Sicherheitsforschung und Branchenbewegungen, erklärt in einfachem Englisch von einem gemeinnützigen Bildungsteam.
Verifizierte Beschaffung
Jede Geschichte ist mit den stärksten verfügbaren Beweisen verknüpft: Originalquellen, sofern verfügbar, ansonsten eindeutig zugeordnete Berichterstattung.
Einfaches Englisch
Was ist passiert, warum es wichtig ist und was man sich ansehen sollte – ohne Fachjargon.
Kein Füllstoff
Wenn das Signal dünn ist, veröffentlichen wir nichts, sondern füllen den Feed auf.
Weitere Geschichten
9 GeschichtenInnovation
Bewerten der KI-Agent-Skill-Leistung mit NVIDIA SkillEvaluator
NVIDIA SkillEvaluator misst die Auswirkung verifizierter Fähigkeiten auf die Leistung von KI-Agenten durch einen dreistufigen Bewertungsprozess.
developer.nvidia.comInnovation
Papier stellt „Schattenbewertungen“ vor: KI-Agenten führten die Technik durch, scheiterten aber an zwei Forschungsfragen
In einem Vorabdruck mit 24 Autoren versuchten sich Pionier-KI-Agenten mit den zentralen Forschungsfragen zweier unveröffentlichter NeurIPS 2026-Einreichungen und ließen die Ergebnisse dann von den eigenen Autoren der Arbeiten bewerten. Die Agenten erledigten das Engineering sechs Tage lang alleine, wurden aber bei der Untersuchung eindeutig abgelehnt.arxiv.orgProdukt
Warp eröffnet frühen Zugriff auf „Factories“, ein Config-as-Code-System zum Betrieb von Flotten von Codierungsagenten
Warp nimmt Early-Access-Anfragen für Warp Factories entgegen, das Flotten von Codierungsagenten als Code definiert – Repos, Modelle, Berechtigungen und menschliche Prüfpunkte in einer YAML-Datei, gesteuert durch CLI, API, SDK und MCP. Die Automatisierungs- und Kostenzahlen sind Angaben des Anbieters: keine Preise, kein allgemeines Verfügbarkeitsdatum oder unabhängige Tests.warp.devInnovation
Laut Benchmark erreichen die besten multimodalen Modelle weniger als 10 % beim Lesen von Wörtern anhand von Stiftgeräuschen und Handbewegungen
In einem neuen arXiv-Artikel wird ein Test vorgestellt, bei dem Modelle ein geschriebenes Wort aus Audioaufnahmen mit Stift und Handbewegungen ableiten müssen, ohne dass Tinte sichtbar ist. Die Autoren berichten von einer Genauigkeit der geordneten Buchstaben bei Menschen über 80 % und bei führenden Modellen unter 10 % – und dass die Verwendung beider Modalitäten bei Modellen oft zu schlechteren Ergebnissen führte.arxiv.orgInnovation
Laut Paper reduziert agentenbewusstes Cache-Management die Verzögerung beim ersten Token bei der Multi-Agent-Bereitstellung um bis zu 45 %
Ein neuer arXiv-Vorabdruck beschreibt CacheScout, eine auf dem Open-Source-vLLM-Server aufgebaute Schicht, die basierend darauf, welcher Agent wahrscheinlich als nächstes ausgeführt wird, entscheidet, was im Schlüsselwert-Cache eines Modells gespeichert werden soll. Die Autoren berichten von zweistelligen Latenz- und Durchsatzsteigerungen; Die Workloads, Modelle und Hardware werden in der Zusammenfassung nicht angegeben.arxiv.orgInnovation
Bei der Prüfung eines OpenAI KI-generierten Nachweises wird ein umgekehrter Zustand festgestellt und eine Reparatur veröffentlicht
Zwei Forscher sagen, dass ein Lemmabeweis in Kapitel 6 des Mathematikdokuments von OpenAI einen Polaritätsfehler aufweist: ein Test hinsichtlich des durchschnittlichen Erfolgs, bei dem der nächste Schritt einen großen bedingten Fehler erfordert. Sie geben ein Gegenbeispiel und einen korrigierten Beweis und weisen darauf hin, dass dies keine Bestätigung des Hauptsatzes des Kapitels ist.arxiv.orgInnovation
Replikationsstudie besagt, dass FLOPs die KI-Laufzeit immer noch falsch vorhersagen und die vorgeschlagene Lösung auf neuerer Hardware fehlschlägt
Ein Vorabdruck zweier Forscher reproduziert eine frühere Studie darüber, warum gleiche FLOP-Zahlen nicht gleiche Ausführungszeit bedeuten. Es bestätigt die zugrunde liegende Behauptung, berichtet jedoch, dass die α-FLOPs-Korrekturformel die Laufzeit auf neuerer Hardware im Allgemeinen unterschätzt, was Sprünge und Schwankungen zeigt, die die Formel nicht erfasst.arxiv.orgUnternehmen
Benchmark-Papier findet vier Möglichkeiten zur Abfrage von Unternehmensdaten mit LLM-Werten, die alle unter 26 % liegen
In einem neuen arXiv-Preprint werden vier Architekturen für die Abfrage von Unternehmensdatenbanken in natürlicher Sprache anhand eines synthetischen zweisprachigen Benchmarks miteinander verglichen. Keiner beantwortete mehr als ein Viertel der Fälle richtig, und das Design mit der höchsten Punktzahl war nicht das sicherste oder günstigste.arxiv.orgInnovation
Papier schlägt vor, KI-Sicherheitsagenten ohne Etiketten einzustufen, indem die Konvergenz zu einem stärkeren Modell gemessen wird
Ein neuer arXiv-Preprint argumentiert, dass Sicherheitsteams beurteilen können, ob ein mit Speicher oder Abruf ausgestatteter KI-Agent lernt, indem sie messen, inwieweit er die Lücke zu einem stärkeren „Lehrer“-Modell schließt, und nicht anhand gekennzeichneter Benchmarks, die oft rar oder veraltet sind. Ein ähnlich angetriebenes Modell lieferte kein brauchbares Signal.arxiv.org
Jede Woche ein nützliches Briefing
Bleiben Sie mit der KI auf dem Laufenden, ohne im Feed zu leben.
Erhalten Sie die verifizierten KI-Neuigkeiten der Woche, Originaldaten, nützliche Tools, Lerntipps und neue KI-Jobs.
Erreichen Sie Menschen, die KI lernen
Einen KI-Experten einstellen oder ein nützliches KI-Produkt auf den Markt bringen? Stellen Sie es den Leuten vor, die hierher gekommen sind, um zu lernen und zu handeln.
Veröffentlichen Sie einen KI-JobSenden Sie ein KI-Tool