已验证来源
每个故事都链接到最有力的可用证据:可用的原始来源,否则明确归因的报告。
简单的英语
发生了什么、为什么重要以及值得关注的内容——无需行话。
无填料
当信号很弱时,我们不会发布任何内容,而是填充提要。
更多故事
9 故事创新
学习地图 为葡萄牙语构建的 46 种语言模型
一项系统映射研究对 46 个葡萄牙语模型进行了分类,并比较了架构、培训资源、许可、代码、数据和权重。作者表示,该领域正在发展,但很难评估,因为信息分布在论文、技术报告、存储库和项目文档中。arxiv.org创新
可解释性研究将 Qwen3-4B 过度自信的答案与确定性偏见机制联系起来
arXiv 研究报告称,Qwen3-4B 在受控推理任务中更倾向于确定性而不是不确定性,并确定了可能导致不平衡的模型特征。作者表示,有针对性的干预措施减少了过度自信的错误,但摘要并未披露效果大小或测试细节。arxiv.org创新
义务差距:大语言模型和义务模态语言
情态助动词,如“must”、“should”和“have”,表示说话者权威和人际立场背景下的必要性和义务。arxiv.org安全
论文提出模糊拒绝信号以抵抗消除攻击
arXiv 预印本引入了一种权重编辑方法,旨在使安全拒绝更难提取和删除。该论文报告了两种开放模型的更强的消除后拒绝分数,并在通用性能方面进行了不同的权衡。arxiv.org创新
论文报告了一种在令牌级别检测幻觉的时间方法
arXiv 预印本描述了一种幻觉检测器,它结合了跨序列的文本统计、蕴含信号和语言模型惊喜,而不是独立判断标记。据该论文称,其 BiGRU 模型在 RAGTruth 上的 AUC 达到 0.840。arxiv.org创新
实体跟踪出现了 4.1 亿个参数,在自然叙事中超过了人类
理解语言需要跟踪整个话语中的实体——即知道事物在哪里以及它们如何变化,即使没有明确说明。arxiv.org创新
论文报告编译器引导搜索提高了精益定理证明效率
arXiv 预印本提出了一种针对上下文相关的精益 4 项目的自适应证明搜索方法。其作者报告称,与 pass@k 基线相比,pass@32 预算内的平均通过率提高了 12.8 个百分点,同时 LLM 调用数量减少了 21.9%。arxiv.org创新
基准将几何求解与图表构建分开
一个新的开源基准测试基础模型是否可以构建忠实的几何图,而不仅仅是解决根本问题。其作者报告称,评估模型的平均编译成功率为 36.14%,暴露了数学答案和可用视觉结构之间的差距。arxiv.org创新
您所需要的就是对齐:通用音频语言模型的免指导培训
一种训练多模态大语言模型(MLLM)的新方法消除了对广泛的特定任务监督的需要。arxiv.org