- 论文公开站arXiv
打破同质化陷阱:通过SplitMoE扩展视频扩散模型
Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
受大语言模型启发的混合专家(MoE)是扩展视觉生成模型的有前景范式,但传统token级MoE在同类专家池中独立路由token并趋向均匀化,限制了性能。本文提出SplitMoE方法。
- 论文公开站arXiv
思考之前先思考:通过元推理扩展智能体推理
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
随着智能体处理更长更复杂的问题,控制执行本身成为一项任务。本文提出智能体元推理,在运行中做出选择部分工作、是否重新开始或何时停止等控制决策。
- 论文公开站arXiv
农田模式:并行维度注意力网络与数据集差异注意力用于作物分割
Cropland PAtteRNS: Parallel Dimensional Attention Networks and Attention to Dataset Disparity for Crop Segmentation in Satellite Imagery Time Series Data
卫星影像时间序列数据集和作物分割架构日益丰富,但在追求最新概念或最大数据集的过程中,两方面的重要事实被忽视。本文提出并行维度注意力网络及数据集差异注意力方法。
- 论文公开站arXiv
在 CP2K 中原生实现机器学习 Skala 交换关联泛函:统一单中心重建
Native implementation of the machine-learned Skala exchange-correlation functional in CP2K: Unified one-centre reconstruction for molecular and condensed-phase calculations
我们使用 CP2K 的高斯与平面波(GPW)及高斯与增强平面波(GAPW)方法,原生实现机器学习 Skala 交换关联(XC)泛函。对密度、密度梯度和动能密度进行联合单中心重建。
- 论文公开站arXiv
信还是不信:语音中的检索增强事实核查
To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech
摘要显示,研究者提出 VeriSpeak,一个用于研究大型音频语言模型(LALM)语音事实核查能力的探针基准,包含 3,879 条口语化声明,覆盖时间、地理与关系类事实,真假标签均衡。实验发现文本与语音之间存在稳定的模态差距:能可靠核查书面声明的模型在同样内容以语音呈现时常常失败;仅靠检索收益有限,因为模型常将检索证据与语音声明混淆,而检索结合显式推理可提升声明-证据比对效果,思维调优的 LALM 达到 86.1% 准确率。
意义:提示开发者:语音场景下事实核查不能简单复用文本能力,需重视跨模态差距与检索证据的显式推理比对。