已验证来源
每个故事都链接到最有力的可用证据:可用的原始来源,否则明确归因的报告。
简单的英语
发生了什么、为什么重要以及值得关注的内容——无需行话。
无填料
当信号很弱时,我们不会发布任何内容,而是填充提要。
更多故事
9 故事创新
预印本描述了一种用于分析中草药配方的多智能体人工智能框架
新的 arXiv 预印本描述了 DeepTCM1.0,这是一个使用 11 种专门的人工智能代理和迭代审查来分析中药配方的可能机制的系统。它报告了评估设计,但没有数值结果、临床验证或改善患者护理的证据。arxiv.org安全
博士论文研究了语言和视觉语言模型中的后门攻击
arXiv 列名博士论文研究后门攻击如何影响语言模型和视觉语言模型,包括分析、检测和攻击设计的方法。arxiv.org创新
预印本报告对著名机构的法学硕士候选人评分更高
arXiv 预印本报告称,当与更高声望的机构和期刊相关联时,四种大型语言模型会对候选人资料进行更有利的评价。作者表示,机构和地理线索可以影响评估,而所提供的来源中并未具体说明测试的模型和专业领域。arxiv.org创新
研究发现推理上下文可以改变医疗分配场景中的法学硕士输出
arXiv 论文报告称,在评估相同的临床场景时,无论有或没有模型在上下文中的先前响应,四个测试语言模型中的三个都会以不同的方式改变资源分配概率。arxiv.org创新
预印本报告人工智能对非侵入性大脑记录中的自然句子进行解码
一个研究团队描述了 Brain2Qwerty v2,这是一种使用实时 MEG 记录来解码输入的自然句子的模型,报告显示 9 个受试者的平均单词错误率为 39%。arxiv.org创新
学习地图 为葡萄牙语构建的 46 种语言模型
一项系统映射研究对 46 个葡萄牙语模型进行了分类,并比较了架构、培训资源、许可、代码、数据和权重。作者表示,该领域正在发展,但很难评估,因为信息分布在论文、技术报告、存储库和项目文档中。arxiv.org创新
可解释性研究将 Qwen3-4B 过度自信的答案与确定性偏见机制联系起来
arXiv 研究报告称,Qwen3-4B 在受控推理任务中更倾向于确定性而不是不确定性,并确定了可能导致不平衡的模型特征。作者表示,有针对性的干预措施减少了过度自信的错误,但摘要并未披露效果大小或测试细节。arxiv.org创新
义务差距:大语言模型和义务模态语言
情态助动词,如“must”、“should”和“have”,表示说话者权威和人际立场背景下的必要性和义务。arxiv.org安全
论文提出模糊拒绝信号以抵抗消除攻击
arXiv 预印本引入了一种权重编辑方法,旨在使安全拒绝更难提取和删除。该论文报告了两种开放模型的更强的消除后拒绝分数,并在通用性能方面进行了不同的权衡。arxiv.org