อัพเดททุกวัน2528 เรื่องราวที่ได้รับการยืนยัน
ข่าวเอไอ ปราศจากเสียงรบกวน
การรายงานข่าว AI ที่ตรวจสอบแหล่งที่มาเกี่ยวกับการเปิดตัวผลิตภัณฑ์ การเปลี่ยนแปลงนโยบาย การวิจัยด้านความปลอดภัย และการเคลื่อนไหวในอุตสาหกรรม ซึ่งอธิบายเป็นภาษาอังกฤษง่าย ๆ โดยทีมการศึกษาขององค์กรไม่แสวงหากําไร
แหล่งที่มาที่ได้รับการยืนยัน
ทุกเรื่องราวเชื่อมโยงกับหลักฐานที่แข็งแกร่งที่สุดที่มีอยู่: แหล่งข่าวต้นฉบับเมื่อมี หรือรายงานที่ชัดเจนว่ามีแหล่งอ้างอิง
ภาษาอังกฤษธรรมดา
เกิดอะไรขึ้น เหตุใดจึงสำคัญ และจะดูอะไรดี โดยไม่มีศัพท์เฉพาะ
ไม่มีฟิลเลอร์
เมื่อสัญญาณเบาบาง เราจะไม่เผยแพร่สิ่งใดนอกจากการเติมฟีด
เรื่องราวเพิ่มเติม
9 เรื่องราวนวัตกรรม
การประเมินประสิทธิภาพทักษะตัวแทน AI ด้วย NVIDIA SkillEvaluator
NVIDIA SkillEvaluator วัดผลกระทบของทักษะที่ได้รับการตรวจสอบแล้วต่อประสิทธิภาพของเจ้าหน้าที่ AI ผ่านกระบวนการประเมินสามระดับ
developer.nvidia.comนวัตกรรม
Paper เปิดตัว "การประเมินเงา": เจ้าหน้าที่ AI ทำวิศวกรรมแต่ไม่สำเร็จสองคำถามวิจัย
การพิมพ์ล่วงหน้าของผู้เขียน 24 คนมีตัวแทน AI ระดับแนวหน้าพยายามถามคำถามการวิจัยกลางของการส่ง NeurIPS 2026 ที่ยังไม่ได้เผยแพร่สองรายการ จากนั้นให้ผู้เขียนของรายงานให้คะแนนผลลัพธ์ เจ้าหน้าที่จัดการด้านวิศวกรรมโดยไม่ได้รับความช่วยเหลือเป็นเวลากว่าหกวัน แต่กลับถูกปฏิเสธในการวิจัยอย่างไม่คลุมเครือarxiv.orgสินค้า
Warp เปิดให้เข้าถึง "Factories" ก่อนใคร ซึ่งเป็นระบบ Config-as-Code สำหรับการรันฟลีตของ Coding Agents
Warp กำลังรับคำร้องขอการเข้าถึงล่วงหน้าสำหรับ Warp Factories ซึ่งกำหนดฟลีตของตัวแทนการเข้ารหัสเป็นโค้ด — repos, โมเดล, สิทธิ์และจุดตรวจสอบของมนุษย์ในไฟล์ YAML ไฟล์เดียว ซึ่งขับเคลื่อนโดย CLI, API, SDK และ MCP ตัวเลขด้านระบบอัตโนมัติและต้นทุนเป็นการกล่าวอ้างของผู้ขาย: ไม่มีการกำหนดราคา วันที่วางจำหน่ายทั่วไป หรือการทดสอบอิสระwarp.devนวัตกรรม
เกณฑ์มาตรฐานกล่าวว่าโมเดลต่อเนื่องหลายรูปแบบได้คะแนนต่ำกว่า 10% ในการอ่านคำจากเสียงปากกาและการเคลื่อนไหวของมือ
กระดาษ arXiv ใหม่แนะนำการทดสอบซึ่งโมเดลจะต้องอนุมานคำที่เป็นลายลักษณ์อักษรจากเสียงจากการขีดปากกาและวิดีโอการเคลื่อนไหวของมือ โดยไม่สามารถมองเห็นหมึกได้ ผู้เขียนรายงานว่ามนุษย์มีความแม่นยำของตัวอักษรในการเรียงลำดับมากกว่า 80% และแบบจำลองชั้นนำต่ำกว่า 10% และการให้แบบจำลองทั้งสองรูปแบบมักจะทำให้ผลลัพธ์แย่ลงarxiv.orgนวัตกรรม
Paper กล่าวว่าการจัดการแคช Agent-Aware ลดความล่าช้าของโทเค็นแรกได้ถึง 45% ในการให้บริการหลายตัวแทน
การพิมพ์ล่วงหน้า arXiv ใหม่อธิบาย CacheScout ซึ่งเป็นเลเยอร์ที่สร้างขึ้นบนเซิร์ฟเวอร์ vLLM แบบโอเพ่นซอร์สที่จะตัดสินใจว่าจะเก็บอะไรไว้ในแคชคีย์-ค่าของโมเดล โดยขึ้นอยู่กับว่าเอเจนต์ใดมีแนวโน้มที่จะทำงานต่อไป ผู้เขียนรายงานเวลาแฝงและปริมาณงานที่เพิ่มขึ้นเป็นตัวเลขสองหลัก ปริมาณงาน โมเดล และฮาร์ดแวร์ไม่ได้ระบุไว้ในบทคัดย่อarxiv.orgนวัตกรรม
การตรวจสอบหลักฐานที่สร้างโดย AI ของ OpenAI ค้นหาสภาพที่กลับกัน และเผยแพร่การซ่อมแซม
นักวิจัยสองคนกล่าวว่าบทพิสูจน์บทแทรกในบทที่ 6 ของเอกสารทางคณิตศาสตร์ของ OpenAI มีข้อผิดพลาดด้านขั้ว นั่นคือการทดสอบในแง่ของความสำเร็จโดยเฉลี่ย โดยที่ขั้นตอนถัดไปจำเป็นต้องมีความล้มเหลวตามเงื่อนไขอย่างมาก พวกเขาให้ตัวอย่างแย้งและข้อพิสูจน์ที่ถูกต้อง และเตือนว่านี่ไม่ใช่การตรวจสอบทฤษฎีบทหลักของบทarxiv.orgนวัตกรรม
การศึกษาการจำลองแบบระบุว่า FLOP ยังคงคาดการณ์รันไทม์ AI ผิด และการแก้ไขที่เสนอล้มเหลวในฮาร์ดแวร์รุ่นใหม่
การพิมพ์ล่วงหน้าโดยนักวิจัยสองคนสร้างการศึกษาก่อนหน้านี้ว่าเหตุใดการนับ FLOP ที่เท่ากันไม่ได้หมายความว่าเวลาในการดำเนินการเท่ากัน เป็นการยืนยันการอ้างสิทธิ์ที่ซ่อนอยู่ แต่รายงานว่าสูตรการแก้ไข α-FLOPs โดยทั่วไปจะประเมินรันไทม์บนฮาร์ดแวร์รุ่นใหม่ต่ำเกินไป ซึ่งแสดงการกระโดดและการแกว่งที่สูตรไม่ได้บันทึกarxiv.orgองค์กร
บทความเปรียบเทียบค้นหาสี่วิธีในการสืบค้นข้อมูลองค์กรด้วย LLM คะแนนทั้งหมดต่ำกว่า 26%
การพิมพ์ล่วงหน้า arXiv ใหม่มีสถาปัตยกรรมสี่แบบสำหรับการสืบค้นฐานข้อมูลองค์กรในภาษาธรรมชาติโดยเปรียบเทียบกันบนเกณฑ์มาตรฐานสองภาษาสังเคราะห์ ไม่มีใครตอบถูกมากกว่าหนึ่งในสี่ของกรณีทั้งหมด และการออกแบบที่ได้คะแนนสูงสุดไม่ใช่วิธีที่ปลอดภัยที่สุดหรือถูกที่สุดarxiv.orgนวัตกรรม
Paper เสนอการจัดระดับเอเจนต์ความปลอดภัย AI โดยไม่มีป้ายกำกับโดยการวัดการลู่เข้าไปสู่โมเดลที่แข็งแกร่งยิ่งขึ้น
การพิมพ์ล่วงหน้าของ arXiv ใหม่ระบุว่าทีมรักษาความปลอดภัยสามารถตัดสินได้ว่าเอเจนต์ AI ที่ติดตั้งหน่วยความจำหรือการดึงข้อมูลกำลังเรียนรู้หรือไม่ โดยการวัดว่าระบบปิดช่องว่างกับโมเดล "ครู" ที่แข็งแกร่งได้ไกลแค่ไหน แทนที่จะใช้เกณฑ์มาตรฐานที่มีป้ายกำกับซึ่งมักจะหายากหรือเก่า การตัดสินโดยโมเดลที่ขับเคลื่อนคล้ายกันทำให้ไม่มีสัญญาณที่ใช้งานได้arxiv.org
การบรีฟที่มีประโยชน์หนึ่งครั้งต่อสัปดาห์
ตาม AI โดยไม่ต้องอยู่ในฟีด
รับข่าวสาร AI ที่ได้รับการยืนยันประจําสัปดาห์ ข้อมูลต้นฉบับ เครื่องมือที่เป็นประโยชน์ ตัวเลือกการเรียนรู้ และงาน AI ใหม่ ๆ
เข้าถึงผู้คนที่กำลังเรียนรู้ AI
การจ้างมืออาชีพด้าน AI หรือเปิดตัวผลิตภัณฑ์ AI ที่มีประโยชน์?นําเสนอให้คนที่มาที่นี่เพื่อเรียนรู้และลงมือทํา
ลงงาน AIส่งเครื่องมือ AI