- 论文公开站arXiv
WorldAuditBench:多模态智能体的交互式3D世界审计
WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
随着交互式3D世界被广泛用于研究智能行为,识别其中异常(如悬浮物体、可穿墙、与环境不一致的物体)的高效流程变得重要,本文提出相应基准。
- 论文公开站arXiv
面向多模态临床诊断的排序感知提示优化
Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis
多模态大模型正快速推进临床诊断,但其适配流程仍以准确率为目标。临床数据类别严重不平衡,恒定多数类预测器准确率可超90%却无临床价值。
- 论文公开站arXiv
交错强化学习让统一模型学会原生反思
Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
统一多模态模型既能看图又能生成图,原则上可自我修复生成结果:诊断错误、修改、观察再诊断;但修改是否有益只有渲染后才能知晓。
- 论文公开站arXiv
ARCH-B:建筑表征、理解与层级基准
ARCH-B: Architectural Representation, Comprehension and Hierarchy Benchmark
多模态模型越来越多地解读视觉环境,但其在照片、平面图、立面图、剖面图和渲染图中识别同一建筑的能力仍缺乏表征。我们推出 ARCH-B,一个包含 354 道四选一题的基准。
- 论文公开站arXiv
信还是不信:语音中的检索增强事实核查
To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech
摘要显示,研究者提出 VeriSpeak,一个用于研究大型音频语言模型(LALM)语音事实核查能力的探针基准,包含 3,879 条口语化声明,覆盖时间、地理与关系类事实,真假标签均衡。实验发现文本与语音之间存在稳定的模态差距:能可靠核查书面声明的模型在同样内容以语音呈现时常常失败;仅靠检索收益有限,因为模型常将检索证据与语音声明混淆,而检索结合显式推理可提升声明-证据比对效果,思维调优的 LALM 达到 86.1% 准确率。
意义:提示开发者:语音场景下事实核查不能简单复用文本能力,需重视跨模态差距与检索证据的显式推理比对。
- 论文公开站arXiv
我该加入哪里?语言引导目标预测的机器人群体加入
Where Should I Join? Robot Group Joining via Language-Guided Goal Prediction
摘要显示,社交导航通常假设目标已给定,而机器人加入群体需根据群体实时活动与队形预测加入位置。该工作提出语言引导的机器人群体加入任务:给定观测与目标群体的自然语言描述,机器人识别相关成员并预测符合社交规范的加入位姿。方法通过递归谱划分生成结构化候选子集,用语言条件图像-几何模型排序,再以人类队形先验生成多模态能量-朝向图。在对话、排队、观众场景中取得竞争性定位精度与亚秒级推理,加入位姿预测优于所有基线,并在真实机器人上验证。
意义:为社交导航引入语言引导的群体加入能力,对导盲机器人、自主代步车等需要理解人群语义与队形的应用有直接价值。
- 论文公开站arXiv
DexTacWAM:面向灵巧操作的视触觉世界-动作模型
DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation
摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。
意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。
- 论文公开站arXiv
MIGU:面向操作规划的不确定性下多模态指令接地
MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning
摘要显示,MIGU 是一个模块化框架,用于在语言与手势线索互补但不确定的情况下进行多模态指令接地。它通过眼-指几何传播视线方向与深度不确定性构建三维几何似然,并结合视觉语言模型提供的语义先验,以类贝叶斯方式融合为统一接地信念,进而支持直接规划或请求澄清。真实基准上 MIGU 优于所评估基线,消融实验支持显式多模态不确定性建模的收益。
意义:为机器人在不确定语言与手势输入下提供可量化的接地与澄清机制,对具身智能与多模态规划有参考价值。
- 论文公开站arXiv
ERCPMP-Gx:用于结直肠息肉形态、组织病理与基因组表征的内镜图像视频数据集
ERCPMP-Gx: Endoscopic Image and Video Dataset for Morphological, Histopathological, and Genomic Characterization of Colorectal Polyposis
摘要显示,该数据集面向遗传性息肉病综合征的AI识别与分类,包含160张图像及配套视频片段,多数采用Olympus EVIS X1的白光、窄带成像、放大窄带成像与近聚焦模式采集。约八成病例为经临床或基因确诊的遗传性息肉病综合征(FAP、PJS、JPS、GNS),其余两成为形态重叠的非遗传性息肉及类息肉病变,用于鉴别分类,并关联组织病理与胚系检测信息。
意义:为AI在内镜图像中区分遗传性与非遗传性息肉病提供多模态标注数据,有望推动结直肠癌早期筛查与个体化监测模型研发。
- 论文公开站arXiv
模态自回归的世界-动作模型
Modality-Autoregressive World-Action Models
摘要显示,该工作提出 ModAR,一种先在预测动作前自回归式去噪多种未来模态的世界-动作模型(WAM),使每次预测都能以先前生成的模态为条件。研究从零训练,系统考察训练数据混合、预测模态与 WAM 形式对性能的影响。结果显示,预测点轨迹、DINO 特征与深度图对 WAM 有益,而额外预测 RGB 并无一致收益;ModAR 的序列生成优于现有 WAM 形式,并在所有评估数据规模下取得最高平均成功率。
意义:为具身智能与世界模型提供新范式:用点轨迹、DINO 特征、深度等模态替代 RGB 预测,可能显著降低训练算力并提升策略成功率。
- 论文公开站arXiv
BioKERN:通过生物核正则化实现组织学-转录组学的邻域检索
BioKERN: Biological Kernel Regularization for Histology-to-Transcriptomics Neighborhood Retrieval
摘要介绍BioKERN,一种多模态空间表征学习框架,通过结合转录组相似性和空间邻近性构建训练时的生物核,提供分级邻域监督并正则化嵌入几何。在Mouse Brain Visium和Human Liver GSE240429数据集上,BioKERN在单尺度和多尺度设置下均优于BLEEP,且受控实验表明改进主要源于生物核正则化而非模型容量增加。
意义:为空间生物学多模态学习提供可解释的归纳偏置,帮助开发者构建保留生物结构的表征,提升检索性能。
- 论文公开站arXiv
LAION-BVD:千万小时级开放视频数据集,助力多模态预训练
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
LAION-BVD是LAION发布的大规模开放视频数据集,包含从CommonCrawl收集的13亿条平台视频URL,成功下载8000万段视频,总时长1000万小时。该数据集旨在支持视频、音频和图像多模态预训练,通过场景检测提取片段并合成字幕。基于此训练的模型在视频-文本和音频-文本基准上表现优异,且性能随规模提升。此外,提取的场景帧作为图像-文本数据源,展现出与网络图像不同的分布,模型在图像-文本检索上表现强劲。数据集已开源,显著扩大了…
意义:为多模态预训练提供千万小时级开放视频资源,填补大规模视频数据空白,推动视频、音频、图像联合学习研究。
- 论文公开站arXiv
老年人下肢骨折或髋关节置换术后功能恢复与社会隔离的多结局预测
Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement
摘要显示,该研究利用MAISON-LLF数据集,包含18名社区老年人的多模态传感器和临床评估数据,监测长达8周。提取46个日度特征,每两周评估5项临床结局。采用多输出回归算法联合预测临床评分,结果显示联合预测优于单独预测,其中NODE模型表现最佳(MSE=3.96,MAE=1.02)。SHAP分析强调了多模态传感器的重要性。
意义:对开发者而言,该研究展示了多模态传感器数据在多输出回归中的潜力,可启发健康监测AI模型设计,提升对老年康复过程的综合评估能力。
- 论文公开站arXiv
EG-ARSA:面向低资源场景的视觉道路安全审计开放专家模型
EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings
该研究提出专家接地蒸馏(EGD)框架,将机构道路安全专业知识迁移至紧凑视觉语言模型,用于可扩展的视觉道路安全审计。通过量化校准阶段,教师模型与权威实地审计达成显著一致(Cohen's kappa=0.74)。蒸馏后的80亿参数学生模型采用低秩适应。研究还发布了首个开放专家接地的孟加拉道路安全审计数据集BD-ARSA,含21,947条图像审计记录,以及首个专为此任务开发的视觉语言模型EG-ARSA。实验显示,接地微调显著提升了序数风险评估…
意义:为低资源环境提供可扩展的视觉道路安全审计方案,通过专家接地蒸馏提升模型可靠性,对AI在公共安全领域的落地具有示范意义。
- 论文公开站arXiv
Re³Cap:基于检索引导的强化学习图像描述优化方法
Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
Re³Cap提出一种检索引导的推理策略,用于增强图像描述生成,无需额外标注。该方法通过描述细化建议器和质量评估器,识别并修正描述中的幻觉与遗漏,从而生成更准确、详细的描述。实验表明,在COCO-LN500基准上,Re³Cap在关系推理任务上平均比GRPO提升8.64%,甚至优于监督微调方法。
意义:该方法利用多模态检索作为推理信号,提升强化学习在图像描述中的探索能力,为无需额外标注的模型优化提供了新思路。
- 论文公开站arXiv
G-CARL:面向患者导向的医学报告解读的基于清单对齐的奖励学习框架
G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation
摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。
意义:为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。